docs: add free vision/image model guide and quickstart pulls

Made-with: Cursor
This commit is contained in:
PTah
2026-04-21 17:41:37 +10:00
parent 77c23f83fd
commit dfd3eeace5
3 changed files with 131 additions and 0 deletions
+1
View File
@@ -85,6 +85,7 @@
| [bench-template.md](bench-template.md) | Шаблон benchmark своих задач |
| [cursor-like-stack.md](cursor-like-stack.md) | Локальный стек в духе IDE |
| [image-generation-local.md](image-generation-local.md) | Локальная генерация изображений |
| [free-graphical-models.md](free-graphical-models.md) | Бесплатные модели и стеки для image generation, OCR и vision |
| [linux-server-fixes.md](linux-server-fixes.md) | BOM в shell-скриптах, зеркала apt |
---
+125
View File
@@ -0,0 +1,125 @@
# Бесплатные модели для графики, OCR и vision-задач
Практический обзор бесплатных локальных моделей и стеков для:
- генерации изображений;
- OCR и извлечения текста с изображений;
- анализа изображений (VLM).
## 1) Важно: два разных класса задач
1. **Text-to-image / image-to-image** (генерация графики)
- Обычно через **Stable Diffusion / FLUX** в UI-проектах (`ComfyUI`, `AUTOMATIC1111`, `Forge`).
- Это не Ollama-first сценарий.
2. **Vision + OCR + описание изображений**
- Удобно через **Ollama** (модели типа `llava`, `minicpm-v`, `qwen2.5vl`).
- Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу".
## 2) Что можно скачать бесплатно через Ollama (vision/OCR)
```bash
ollama pull llava:7b
ollama pull minicpm-v
ollama pull qwen2.5vl
```
Быстрая проверка:
```bash
ollama run llava:7b
ollama run minicpm-v
ollama run qwen2.5vl
```
Примеры задач:
- распознать текст на скриншоте;
- описать диаграмму/интерфейс;
- извлечь структуру из изображения (поля формы, таблица, блоки).
## 3) Бесплатная локальная генерация изображений (рекомендуемый путь)
Для генерации картинок лучше использовать отдельный UI-стек:
- **ComfyUI** (гибкий workflow-граф, хороший для продвинутых пайплайнов),
- **AUTOMATIC1111** (классический web UI),
- **Stable Diffusion WebUI Forge** (быстрый и удобный форк для повседневки).
### Базовые бесплатные модели для старта
- **SDXL Base 1.0** — универсальный baseline;
- **FLUX.1-schnell** — быстрый современный вариант;
- **SD 1.5** — если видеопамяти мало.
Популярные community-чекпоинты:
- JuggernautXL
- DreamShaper
- RealVisXL
## 4) Минимальная установка ComfyUI (Ubuntu, NVIDIA)
> Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation.
```bash
sudo apt update
sudo apt install -y git python3 python3-venv
cd ~
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv .venv
source .venv/bin/activate
pip install --upgrade pip
pip install -r requirements.txt
python main.py --listen 0.0.0.0 --port 8188
```
После запуска откройте UI в браузере (локально обычно `http://127.0.0.1:8188`).
### Куда класть модели в ComfyUI
Обычно:
- checkpoint: `ComfyUI/models/checkpoints/`
- VAE: `ComfyUI/models/vae/`
- LoRA: `ComfyUI/models/loras/`
- ControlNet: `ComfyUI/models/controlnet/`
## 5) OCR-практика: что выбрать
Для простого OCR/понимания скриншотов:
- сначала попробуйте `minicpm-v` или `qwen2.5vl` через Ollama;
- если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент.
Пример с Tesseract (Ubuntu):
```bash
sudo apt update
sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng
tesseract image.png stdout -l rus+eng
```
Комбинация "OCR-движок + LLM" часто даёт лучший результат:
1. OCR извлекает сырой текст.
2. LLM нормализует, структурирует и суммирует.
## 6) Аппаратные ориентиры для графики
- **8 GB VRAM**: SD 1.5, облегчённые workflow.
- **12 GB VRAM**: SDXL в комфортном режиме.
- **16+ GB VRAM**: тяжёлые SDXL/FLUX workflow, ControlNet, батчи.
Для общего подбора железа смотрите: `hardware-budgets.md`.
## 7) Как связать это с OpenClaude
Типичный рабочий вариант:
1. OpenClaude решает текстовые и кодовые задачи.
2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки.
3. Vision/OCR модели в Ollama (`llava` / `minicpm-v` / `qwen2.5vl`) анализируют изображения и возвращают текст/описания.
Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.
+5
View File
@@ -119,8 +119,13 @@ docker info | grep "Docker Root Dir"
```bash
ollama pull qwen2.5-coder:7b
ollama pull nomic-embed-text
ollama pull llava:7b
ollama pull minicpm-v
ollama pull qwen2.5vl
```
`llava` / `minicpm-v` / `qwen2.5vl` полезны для анализа картинок и OCR-сценариев (vision), а не для генерации изображений "с нуля". Для image generation смотрите `docs/free-graphical-models.md`.
## 7) Поднять Qdrant
```bash