dfd3eeace5
Made-with: Cursor
5.0 KiB
5.0 KiB
Бесплатные модели для графики, OCR и vision-задач
Практический обзор бесплатных локальных моделей и стеков для:
- генерации изображений;
- OCR и извлечения текста с изображений;
- анализа изображений (VLM).
1) Важно: два разных класса задач
- Text-to-image / image-to-image (генерация графики)
- Обычно через Stable Diffusion / FLUX в UI-проектах (
ComfyUI,AUTOMATIC1111,Forge). - Это не Ollama-first сценарий.
- Обычно через Stable Diffusion / FLUX в UI-проектах (
- Vision + OCR + описание изображений
- Удобно через Ollama (модели типа
llava,minicpm-v,qwen2.5vl). - Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу".
- Удобно через Ollama (модели типа
2) Что можно скачать бесплатно через Ollama (vision/OCR)
ollama pull llava:7b
ollama pull minicpm-v
ollama pull qwen2.5vl
Быстрая проверка:
ollama run llava:7b
ollama run minicpm-v
ollama run qwen2.5vl
Примеры задач:
- распознать текст на скриншоте;
- описать диаграмму/интерфейс;
- извлечь структуру из изображения (поля формы, таблица, блоки).
3) Бесплатная локальная генерация изображений (рекомендуемый путь)
Для генерации картинок лучше использовать отдельный UI-стек:
- ComfyUI (гибкий workflow-граф, хороший для продвинутых пайплайнов),
- AUTOMATIC1111 (классический web UI),
- Stable Diffusion WebUI Forge (быстрый и удобный форк для повседневки).
Базовые бесплатные модели для старта
- SDXL Base 1.0 — универсальный baseline;
- FLUX.1-schnell — быстрый современный вариант;
- SD 1.5 — если видеопамяти мало.
Популярные community-чекпоинты:
- JuggernautXL
- DreamShaper
- RealVisXL
4) Минимальная установка ComfyUI (Ubuntu, NVIDIA)
Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation.
sudo apt update
sudo apt install -y git python3 python3-venv
cd ~
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv .venv
source .venv/bin/activate
pip install --upgrade pip
pip install -r requirements.txt
python main.py --listen 0.0.0.0 --port 8188
После запуска откройте UI в браузере (локально обычно http://127.0.0.1:8188).
Куда класть модели в ComfyUI
Обычно:
- checkpoint:
ComfyUI/models/checkpoints/ - VAE:
ComfyUI/models/vae/ - LoRA:
ComfyUI/models/loras/ - ControlNet:
ComfyUI/models/controlnet/
5) OCR-практика: что выбрать
Для простого OCR/понимания скриншотов:
- сначала попробуйте
minicpm-vилиqwen2.5vlчерез Ollama; - если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент.
Пример с Tesseract (Ubuntu):
sudo apt update
sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng
tesseract image.png stdout -l rus+eng
Комбинация "OCR-движок + LLM" часто даёт лучший результат:
- OCR извлекает сырой текст.
- LLM нормализует, структурирует и суммирует.
6) Аппаратные ориентиры для графики
- 8 GB VRAM: SD 1.5, облегчённые workflow.
- 12 GB VRAM: SDXL в комфортном режиме.
- 16+ GB VRAM: тяжёлые SDXL/FLUX workflow, ControlNet, батчи.
Для общего подбора железа смотрите: hardware-budgets.md.
7) Как связать это с OpenClaude
Типичный рабочий вариант:
- OpenClaude решает текстовые и кодовые задачи.
- Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки.
- Vision/OCR модели в Ollama (
llava/minicpm-v/qwen2.5vl) анализируют изображения и возвращают текст/описания.
Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.