docs: add free vision/image model guide and quickstart pulls
Made-with: Cursor
This commit is contained in:
@@ -0,0 +1,125 @@
|
||||
# Бесплатные модели для графики, OCR и vision-задач
|
||||
|
||||
Практический обзор бесплатных локальных моделей и стеков для:
|
||||
|
||||
- генерации изображений;
|
||||
- OCR и извлечения текста с изображений;
|
||||
- анализа изображений (VLM).
|
||||
|
||||
## 1) Важно: два разных класса задач
|
||||
|
||||
1. **Text-to-image / image-to-image** (генерация графики)
|
||||
- Обычно через **Stable Diffusion / FLUX** в UI-проектах (`ComfyUI`, `AUTOMATIC1111`, `Forge`).
|
||||
- Это не Ollama-first сценарий.
|
||||
2. **Vision + OCR + описание изображений**
|
||||
- Удобно через **Ollama** (модели типа `llava`, `minicpm-v`, `qwen2.5vl`).
|
||||
- Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу".
|
||||
|
||||
## 2) Что можно скачать бесплатно через Ollama (vision/OCR)
|
||||
|
||||
```bash
|
||||
ollama pull llava:7b
|
||||
ollama pull minicpm-v
|
||||
ollama pull qwen2.5vl
|
||||
```
|
||||
|
||||
Быстрая проверка:
|
||||
|
||||
```bash
|
||||
ollama run llava:7b
|
||||
ollama run minicpm-v
|
||||
ollama run qwen2.5vl
|
||||
```
|
||||
|
||||
Примеры задач:
|
||||
|
||||
- распознать текст на скриншоте;
|
||||
- описать диаграмму/интерфейс;
|
||||
- извлечь структуру из изображения (поля формы, таблица, блоки).
|
||||
|
||||
## 3) Бесплатная локальная генерация изображений (рекомендуемый путь)
|
||||
|
||||
Для генерации картинок лучше использовать отдельный UI-стек:
|
||||
|
||||
- **ComfyUI** (гибкий workflow-граф, хороший для продвинутых пайплайнов),
|
||||
- **AUTOMATIC1111** (классический web UI),
|
||||
- **Stable Diffusion WebUI Forge** (быстрый и удобный форк для повседневки).
|
||||
|
||||
### Базовые бесплатные модели для старта
|
||||
|
||||
- **SDXL Base 1.0** — универсальный baseline;
|
||||
- **FLUX.1-schnell** — быстрый современный вариант;
|
||||
- **SD 1.5** — если видеопамяти мало.
|
||||
|
||||
Популярные community-чекпоинты:
|
||||
|
||||
- JuggernautXL
|
||||
- DreamShaper
|
||||
- RealVisXL
|
||||
|
||||
## 4) Минимальная установка ComfyUI (Ubuntu, NVIDIA)
|
||||
|
||||
> Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation.
|
||||
|
||||
```bash
|
||||
sudo apt update
|
||||
sudo apt install -y git python3 python3-venv
|
||||
|
||||
cd ~
|
||||
git clone https://github.com/comfyanonymous/ComfyUI.git
|
||||
cd ComfyUI
|
||||
python3 -m venv .venv
|
||||
source .venv/bin/activate
|
||||
pip install --upgrade pip
|
||||
pip install -r requirements.txt
|
||||
python main.py --listen 0.0.0.0 --port 8188
|
||||
```
|
||||
|
||||
После запуска откройте UI в браузере (локально обычно `http://127.0.0.1:8188`).
|
||||
|
||||
### Куда класть модели в ComfyUI
|
||||
|
||||
Обычно:
|
||||
|
||||
- checkpoint: `ComfyUI/models/checkpoints/`
|
||||
- VAE: `ComfyUI/models/vae/`
|
||||
- LoRA: `ComfyUI/models/loras/`
|
||||
- ControlNet: `ComfyUI/models/controlnet/`
|
||||
|
||||
## 5) OCR-практика: что выбрать
|
||||
|
||||
Для простого OCR/понимания скриншотов:
|
||||
|
||||
- сначала попробуйте `minicpm-v` или `qwen2.5vl` через Ollama;
|
||||
- если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент.
|
||||
|
||||
Пример с Tesseract (Ubuntu):
|
||||
|
||||
```bash
|
||||
sudo apt update
|
||||
sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng
|
||||
tesseract image.png stdout -l rus+eng
|
||||
```
|
||||
|
||||
Комбинация "OCR-движок + LLM" часто даёт лучший результат:
|
||||
|
||||
1. OCR извлекает сырой текст.
|
||||
2. LLM нормализует, структурирует и суммирует.
|
||||
|
||||
## 6) Аппаратные ориентиры для графики
|
||||
|
||||
- **8 GB VRAM**: SD 1.5, облегчённые workflow.
|
||||
- **12 GB VRAM**: SDXL в комфортном режиме.
|
||||
- **16+ GB VRAM**: тяжёлые SDXL/FLUX workflow, ControlNet, батчи.
|
||||
|
||||
Для общего подбора железа смотрите: `hardware-budgets.md`.
|
||||
|
||||
## 7) Как связать это с OpenClaude
|
||||
|
||||
Типичный рабочий вариант:
|
||||
|
||||
1. OpenClaude решает текстовые и кодовые задачи.
|
||||
2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки.
|
||||
3. Vision/OCR модели в Ollama (`llava` / `minicpm-v` / `qwen2.5vl`) анализируют изображения и возвращают текст/описания.
|
||||
|
||||
Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.
|
||||
Reference in New Issue
Block a user