Files
openclaude-LLM-local/docs/free-graphical-models.md
T
2026-04-21 17:41:37 +10:00

126 lines
5.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Бесплатные модели для графики, OCR и vision-задач
Практический обзор бесплатных локальных моделей и стеков для:
- генерации изображений;
- OCR и извлечения текста с изображений;
- анализа изображений (VLM).
## 1) Важно: два разных класса задач
1. **Text-to-image / image-to-image** (генерация графики)
- Обычно через **Stable Diffusion / FLUX** в UI-проектах (`ComfyUI`, `AUTOMATIC1111`, `Forge`).
- Это не Ollama-first сценарий.
2. **Vision + OCR + описание изображений**
- Удобно через **Ollama** (модели типа `llava`, `minicpm-v`, `qwen2.5vl`).
- Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу".
## 2) Что можно скачать бесплатно через Ollama (vision/OCR)
```bash
ollama pull llava:7b
ollama pull minicpm-v
ollama pull qwen2.5vl
```
Быстрая проверка:
```bash
ollama run llava:7b
ollama run minicpm-v
ollama run qwen2.5vl
```
Примеры задач:
- распознать текст на скриншоте;
- описать диаграмму/интерфейс;
- извлечь структуру из изображения (поля формы, таблица, блоки).
## 3) Бесплатная локальная генерация изображений (рекомендуемый путь)
Для генерации картинок лучше использовать отдельный UI-стек:
- **ComfyUI** (гибкий workflow-граф, хороший для продвинутых пайплайнов),
- **AUTOMATIC1111** (классический web UI),
- **Stable Diffusion WebUI Forge** (быстрый и удобный форк для повседневки).
### Базовые бесплатные модели для старта
- **SDXL Base 1.0** — универсальный baseline;
- **FLUX.1-schnell** — быстрый современный вариант;
- **SD 1.5** — если видеопамяти мало.
Популярные community-чекпоинты:
- JuggernautXL
- DreamShaper
- RealVisXL
## 4) Минимальная установка ComfyUI (Ubuntu, NVIDIA)
> Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation.
```bash
sudo apt update
sudo apt install -y git python3 python3-venv
cd ~
git clone https://github.com/comfyanonymous/ComfyUI.git
cd ComfyUI
python3 -m venv .venv
source .venv/bin/activate
pip install --upgrade pip
pip install -r requirements.txt
python main.py --listen 0.0.0.0 --port 8188
```
После запуска откройте UI в браузере (локально обычно `http://127.0.0.1:8188`).
### Куда класть модели в ComfyUI
Обычно:
- checkpoint: `ComfyUI/models/checkpoints/`
- VAE: `ComfyUI/models/vae/`
- LoRA: `ComfyUI/models/loras/`
- ControlNet: `ComfyUI/models/controlnet/`
## 5) OCR-практика: что выбрать
Для простого OCR/понимания скриншотов:
- сначала попробуйте `minicpm-v` или `qwen2.5vl` через Ollama;
- если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент.
Пример с Tesseract (Ubuntu):
```bash
sudo apt update
sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng
tesseract image.png stdout -l rus+eng
```
Комбинация "OCR-движок + LLM" часто даёт лучший результат:
1. OCR извлекает сырой текст.
2. LLM нормализует, структурирует и суммирует.
## 6) Аппаратные ориентиры для графики
- **8 GB VRAM**: SD 1.5, облегчённые workflow.
- **12 GB VRAM**: SDXL в комфортном режиме.
- **16+ GB VRAM**: тяжёлые SDXL/FLUX workflow, ControlNet, батчи.
Для общего подбора железа смотрите: `hardware-budgets.md`.
## 7) Как связать это с OpenClaude
Типичный рабочий вариант:
1. OpenClaude решает текстовые и кодовые задачи.
2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки.
3. Vision/OCR модели в Ollama (`llava` / `minicpm-v` / `qwen2.5vl`) анализируют изображения и возвращают текст/описания.
Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису.