# Бесплатные модели для графики, OCR и vision-задач Практический обзор бесплатных локальных моделей и стеков для: - генерации изображений; - OCR и извлечения текста с изображений; - анализа изображений (VLM). ## 1) Важно: два разных класса задач 1. **Text-to-image / image-to-image** (генерация графики) - Обычно через **Stable Diffusion / FLUX** в UI-проектах (`ComfyUI`, `AUTOMATIC1111`, `Forge`). - Это не Ollama-first сценарий. 2. **Vision + OCR + описание изображений** - Удобно через **Ollama** (модели типа `llava`, `minicpm-v`, `qwen2.5vl`). - Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу". ## 2) Что можно скачать бесплатно через Ollama (vision/OCR) ```bash ollama pull llava:7b ollama pull minicpm-v ollama pull qwen2.5vl ``` Быстрая проверка: ```bash ollama run llava:7b ollama run minicpm-v ollama run qwen2.5vl ``` Примеры задач: - распознать текст на скриншоте; - описать диаграмму/интерфейс; - извлечь структуру из изображения (поля формы, таблица, блоки). ## 3) Бесплатная локальная генерация изображений (рекомендуемый путь) Для генерации картинок лучше использовать отдельный UI-стек: - **ComfyUI** (гибкий workflow-граф, хороший для продвинутых пайплайнов), - **AUTOMATIC1111** (классический web UI), - **Stable Diffusion WebUI Forge** (быстрый и удобный форк для повседневки). ### Базовые бесплатные модели для старта - **SDXL Base 1.0** — универсальный baseline; - **FLUX.1-schnell** — быстрый современный вариант; - **SD 1.5** — если видеопамяти мало. Популярные community-чекпоинты: - JuggernautXL - DreamShaper - RealVisXL ## 4) Минимальная установка ComfyUI (Ubuntu, NVIDIA) > Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation. ```bash sudo apt update sudo apt install -y git python3 python3-venv cd ~ git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI python3 -m venv .venv source .venv/bin/activate pip install --upgrade pip pip install -r requirements.txt python main.py --listen 0.0.0.0 --port 8188 ``` После запуска откройте UI в браузере (локально обычно `http://127.0.0.1:8188`). ### Куда класть модели в ComfyUI Обычно: - checkpoint: `ComfyUI/models/checkpoints/` - VAE: `ComfyUI/models/vae/` - LoRA: `ComfyUI/models/loras/` - ControlNet: `ComfyUI/models/controlnet/` ## 5) OCR-практика: что выбрать Для простого OCR/понимания скриншотов: - сначала попробуйте `minicpm-v` или `qwen2.5vl` через Ollama; - если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент. Пример с Tesseract (Ubuntu): ```bash sudo apt update sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng tesseract image.png stdout -l rus+eng ``` Комбинация "OCR-движок + LLM" часто даёт лучший результат: 1. OCR извлекает сырой текст. 2. LLM нормализует, структурирует и суммирует. ## 6) Аппаратные ориентиры для графики - **8 GB VRAM**: SD 1.5, облегчённые workflow. - **12 GB VRAM**: SDXL в комфортном режиме. - **16+ GB VRAM**: тяжёлые SDXL/FLUX workflow, ControlNet, батчи. Для общего подбора железа смотрите: `hardware-budgets.md`. ## 7) Как связать это с OpenClaude Типичный рабочий вариант: 1. OpenClaude решает текстовые и кодовые задачи. 2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки. 3. Vision/OCR модели в Ollama (`llava` / `minicpm-v` / `qwen2.5vl`) анализируют изображения и возвращают текст/описания. Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.