Files
openclaude-LLM-local/docs/free-graphical-models.md
T
2026-04-21 17:41:37 +10:00

5.0 KiB
Raw Blame History

Бесплатные модели для графики, OCR и vision-задач

Практический обзор бесплатных локальных моделей и стеков для:

  • генерации изображений;
  • OCR и извлечения текста с изображений;
  • анализа изображений (VLM).

1) Важно: два разных класса задач

  1. Text-to-image / image-to-image (генерация графики)
    • Обычно через Stable Diffusion / FLUX в UI-проектах (ComfyUI, AUTOMATIC1111, Forge).
    • Это не Ollama-first сценарий.
  2. Vision + OCR + описание изображений
    • Удобно через Ollama (модели типа llava, minicpm-v, qwen2.5vl).
    • Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу".

2) Что можно скачать бесплатно через Ollama (vision/OCR)

ollama pull llava:7b
ollama pull minicpm-v
ollama pull qwen2.5vl

Быстрая проверка:

ollama run llava:7b
ollama run minicpm-v
ollama run qwen2.5vl

Примеры задач:

  • распознать текст на скриншоте;
  • описать диаграмму/интерфейс;
  • извлечь структуру из изображения (поля формы, таблица, блоки).

3) Бесплатная локальная генерация изображений (рекомендуемый путь)

Для генерации картинок лучше использовать отдельный UI-стек:

  • ComfyUI (гибкий workflow-граф, хороший для продвинутых пайплайнов),
  • AUTOMATIC1111 (классический web UI),
  • Stable Diffusion WebUI Forge (быстрый и удобный форк для повседневки).

Базовые бесплатные модели для старта

  • SDXL Base 1.0 — универсальный baseline;
  • FLUX.1-schnell — быстрый современный вариант;
  • SD 1.5 — если видеопамяти мало.

Популярные community-чекпоинты:

  • JuggernautXL
  • DreamShaper
  • RealVisXL

4) Минимальная установка ComfyUI (Ubuntu, NVIDIA)

Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation.

sudo apt update
sudo apt install -y git python3 python3-venv

cd ~
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv .venv
source .venv/bin/activate
pip install --upgrade pip
pip install -r requirements.txt
python main.py --listen 0.0.0.0 --port 8188

После запуска откройте UI в браузере (локально обычно http://127.0.0.1:8188).

Куда класть модели в ComfyUI

Обычно:

  • checkpoint: ComfyUI/models/checkpoints/
  • VAE: ComfyUI/models/vae/
  • LoRA: ComfyUI/models/loras/
  • ControlNet: ComfyUI/models/controlnet/

5) OCR-практика: что выбрать

Для простого OCR/понимания скриншотов:

  • сначала попробуйте minicpm-v или qwen2.5vl через Ollama;
  • если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент.

Пример с Tesseract (Ubuntu):

sudo apt update
sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng
tesseract image.png stdout -l rus+eng

Комбинация "OCR-движок + LLM" часто даёт лучший результат:

  1. OCR извлекает сырой текст.
  2. LLM нормализует, структурирует и суммирует.

6) Аппаратные ориентиры для графики

  • 8 GB VRAM: SD 1.5, облегчённые workflow.
  • 12 GB VRAM: SDXL в комфортном режиме.
  • 16+ GB VRAM: тяжёлые SDXL/FLUX workflow, ControlNet, батчи.

Для общего подбора железа смотрите: hardware-budgets.md.

7) Как связать это с OpenClaude

Типичный рабочий вариант:

  1. OpenClaude решает текстовые и кодовые задачи.
  2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки.
  3. Vision/OCR модели в Ollama (llava / minicpm-v / qwen2.5vl) анализируют изображения и возвращают текст/описания.

Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.