dfd3eeace5
Made-with: Cursor
126 lines
5.0 KiB
Markdown
126 lines
5.0 KiB
Markdown
# Бесплатные модели для графики, OCR и vision-задач
|
||
|
||
Практический обзор бесплатных локальных моделей и стеков для:
|
||
|
||
- генерации изображений;
|
||
- OCR и извлечения текста с изображений;
|
||
- анализа изображений (VLM).
|
||
|
||
## 1) Важно: два разных класса задач
|
||
|
||
1. **Text-to-image / image-to-image** (генерация графики)
|
||
- Обычно через **Stable Diffusion / FLUX** в UI-проектах (`ComfyUI`, `AUTOMATIC1111`, `Forge`).
|
||
- Это не Ollama-first сценарий.
|
||
2. **Vision + OCR + описание изображений**
|
||
- Удобно через **Ollama** (модели типа `llava`, `minicpm-v`, `qwen2.5vl`).
|
||
- Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу".
|
||
|
||
## 2) Что можно скачать бесплатно через Ollama (vision/OCR)
|
||
|
||
```bash
|
||
ollama pull llava:7b
|
||
ollama pull minicpm-v
|
||
ollama pull qwen2.5vl
|
||
```
|
||
|
||
Быстрая проверка:
|
||
|
||
```bash
|
||
ollama run llava:7b
|
||
ollama run minicpm-v
|
||
ollama run qwen2.5vl
|
||
```
|
||
|
||
Примеры задач:
|
||
|
||
- распознать текст на скриншоте;
|
||
- описать диаграмму/интерфейс;
|
||
- извлечь структуру из изображения (поля формы, таблица, блоки).
|
||
|
||
## 3) Бесплатная локальная генерация изображений (рекомендуемый путь)
|
||
|
||
Для генерации картинок лучше использовать отдельный UI-стек:
|
||
|
||
- **ComfyUI** (гибкий workflow-граф, хороший для продвинутых пайплайнов),
|
||
- **AUTOMATIC1111** (классический web UI),
|
||
- **Stable Diffusion WebUI Forge** (быстрый и удобный форк для повседневки).
|
||
|
||
### Базовые бесплатные модели для старта
|
||
|
||
- **SDXL Base 1.0** — универсальный baseline;
|
||
- **FLUX.1-schnell** — быстрый современный вариант;
|
||
- **SD 1.5** — если видеопамяти мало.
|
||
|
||
Популярные community-чекпоинты:
|
||
|
||
- JuggernautXL
|
||
- DreamShaper
|
||
- RealVisXL
|
||
|
||
## 4) Минимальная установка ComfyUI (Ubuntu, NVIDIA)
|
||
|
||
> Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation.
|
||
|
||
```bash
|
||
sudo apt update
|
||
sudo apt install -y git python3 python3-venv
|
||
|
||
cd ~
|
||
git clone https://github.com/comfyanonymous/ComfyUI.git
|
||
cd ComfyUI
|
||
python3 -m venv .venv
|
||
source .venv/bin/activate
|
||
pip install --upgrade pip
|
||
pip install -r requirements.txt
|
||
python main.py --listen 0.0.0.0 --port 8188
|
||
```
|
||
|
||
После запуска откройте UI в браузере (локально обычно `http://127.0.0.1:8188`).
|
||
|
||
### Куда класть модели в ComfyUI
|
||
|
||
Обычно:
|
||
|
||
- checkpoint: `ComfyUI/models/checkpoints/`
|
||
- VAE: `ComfyUI/models/vae/`
|
||
- LoRA: `ComfyUI/models/loras/`
|
||
- ControlNet: `ComfyUI/models/controlnet/`
|
||
|
||
## 5) OCR-практика: что выбрать
|
||
|
||
Для простого OCR/понимания скриншотов:
|
||
|
||
- сначала попробуйте `minicpm-v` или `qwen2.5vl` через Ollama;
|
||
- если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент.
|
||
|
||
Пример с Tesseract (Ubuntu):
|
||
|
||
```bash
|
||
sudo apt update
|
||
sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng
|
||
tesseract image.png stdout -l rus+eng
|
||
```
|
||
|
||
Комбинация "OCR-движок + LLM" часто даёт лучший результат:
|
||
|
||
1. OCR извлекает сырой текст.
|
||
2. LLM нормализует, структурирует и суммирует.
|
||
|
||
## 6) Аппаратные ориентиры для графики
|
||
|
||
- **8 GB VRAM**: SD 1.5, облегчённые workflow.
|
||
- **12 GB VRAM**: SDXL в комфортном режиме.
|
||
- **16+ GB VRAM**: тяжёлые SDXL/FLUX workflow, ControlNet, батчи.
|
||
|
||
Для общего подбора железа смотрите: `hardware-budgets.md`.
|
||
|
||
## 7) Как связать это с OpenClaude
|
||
|
||
Типичный рабочий вариант:
|
||
|
||
1. OpenClaude решает текстовые и кодовые задачи.
|
||
2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки.
|
||
3. Vision/OCR модели в Ollama (`llava` / `minicpm-v` / `qwen2.5vl`) анализируют изображения и возвращают текст/описания.
|
||
|
||
Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.
|