diff --git a/docs/README.md b/docs/README.md index 5377fdf..4b8bcd0 100644 --- a/docs/README.md +++ b/docs/README.md @@ -85,6 +85,7 @@ | [bench-template.md](bench-template.md) | Шаблон benchmark своих задач | | [cursor-like-stack.md](cursor-like-stack.md) | Локальный стек в духе IDE | | [image-generation-local.md](image-generation-local.md) | Локальная генерация изображений | +| [free-graphical-models.md](free-graphical-models.md) | Бесплатные модели и стеки для image generation, OCR и vision | | [linux-server-fixes.md](linux-server-fixes.md) | BOM в shell-скриптах, зеркала apt | --- diff --git a/docs/free-graphical-models.md b/docs/free-graphical-models.md new file mode 100644 index 0000000..964552a --- /dev/null +++ b/docs/free-graphical-models.md @@ -0,0 +1,125 @@ +# Бесплатные модели для графики, OCR и vision-задач + +Практический обзор бесплатных локальных моделей и стеков для: + +- генерации изображений; +- OCR и извлечения текста с изображений; +- анализа изображений (VLM). + +## 1) Важно: два разных класса задач + +1. **Text-to-image / image-to-image** (генерация графики) + - Обычно через **Stable Diffusion / FLUX** в UI-проектах (`ComfyUI`, `AUTOMATIC1111`, `Forge`). + - Это не Ollama-first сценарий. +2. **Vision + OCR + описание изображений** + - Удобно через **Ollama** (модели типа `llava`, `minicpm-v`, `qwen2.5vl`). + - Хорошо подходит для "прочитай скриншот", "извлеки текст", "опиши таблицу". + +## 2) Что можно скачать бесплатно через Ollama (vision/OCR) + +```bash +ollama pull llava:7b +ollama pull minicpm-v +ollama pull qwen2.5vl +``` + +Быстрая проверка: + +```bash +ollama run llava:7b +ollama run minicpm-v +ollama run qwen2.5vl +``` + +Примеры задач: + +- распознать текст на скриншоте; +- описать диаграмму/интерфейс; +- извлечь структуру из изображения (поля формы, таблица, блоки). + +## 3) Бесплатная локальная генерация изображений (рекомендуемый путь) + +Для генерации картинок лучше использовать отдельный UI-стек: + +- **ComfyUI** (гибкий workflow-граф, хороший для продвинутых пайплайнов), +- **AUTOMATIC1111** (классический web UI), +- **Stable Diffusion WebUI Forge** (быстрый и удобный форк для повседневки). + +### Базовые бесплатные модели для старта + +- **SDXL Base 1.0** — универсальный baseline; +- **FLUX.1-schnell** — быстрый современный вариант; +- **SD 1.5** — если видеопамяти мало. + +Популярные community-чекпоинты: + +- JuggernautXL +- DreamShaper +- RealVisXL + +## 4) Минимальная установка ComfyUI (Ubuntu, NVIDIA) + +> Если уже есть рабочий Python и CUDA-драйверы, это самый прямой путь к local image generation. + +```bash +sudo apt update +sudo apt install -y git python3 python3-venv + +cd ~ +git clone https://github.com/comfyanonymous/ComfyUI.git +cd ComfyUI +python3 -m venv .venv +source .venv/bin/activate +pip install --upgrade pip +pip install -r requirements.txt +python main.py --listen 0.0.0.0 --port 8188 +``` + +После запуска откройте UI в браузере (локально обычно `http://127.0.0.1:8188`). + +### Куда класть модели в ComfyUI + +Обычно: + +- checkpoint: `ComfyUI/models/checkpoints/` +- VAE: `ComfyUI/models/vae/` +- LoRA: `ComfyUI/models/loras/` +- ControlNet: `ComfyUI/models/controlnet/` + +## 5) OCR-практика: что выбрать + +Для простого OCR/понимания скриншотов: + +- сначала попробуйте `minicpm-v` или `qwen2.5vl` через Ollama; +- если нужно строгое OCR-качество по документам, добавьте специализированный OCR-движок (например Tesseract/PaddleOCR) как отдельный инструмент. + +Пример с Tesseract (Ubuntu): + +```bash +sudo apt update +sudo apt install -y tesseract-ocr tesseract-ocr-rus tesseract-ocr-eng +tesseract image.png stdout -l rus+eng +``` + +Комбинация "OCR-движок + LLM" часто даёт лучший результат: + +1. OCR извлекает сырой текст. +2. LLM нормализует, структурирует и суммирует. + +## 6) Аппаратные ориентиры для графики + +- **8 GB VRAM**: SD 1.5, облегчённые workflow. +- **12 GB VRAM**: SDXL в комфортном режиме. +- **16+ GB VRAM**: тяжёлые SDXL/FLUX workflow, ControlNet, батчи. + +Для общего подбора железа смотрите: `hardware-budgets.md`. + +## 7) Как связать это с OpenClaude + +Типичный рабочий вариант: + +1. OpenClaude решает текстовые и кодовые задачи. +2. Отдельный локальный image stack (ComfyUI/Forge/A1111) генерирует картинки. +3. Vision/OCR модели в Ollama (`llava` / `minicpm-v` / `qwen2.5vl`) анализируют изображения и возвращают текст/описания. + +Если нужна интеграция в единый агентный пайплайн, добавьте MCP-инструмент-обёртку к вашему image/OCR сервису. diff --git a/docs/quickstart-30min.md b/docs/quickstart-30min.md index 2d8262c..7842233 100644 --- a/docs/quickstart-30min.md +++ b/docs/quickstart-30min.md @@ -119,8 +119,13 @@ docker info | grep "Docker Root Dir" ```bash ollama pull qwen2.5-coder:7b ollama pull nomic-embed-text +ollama pull llava:7b +ollama pull minicpm-v +ollama pull qwen2.5vl ``` +`llava` / `minicpm-v` / `qwen2.5vl` полезны для анализа картинок и OCR-сценариев (vision), а не для генерации изображений "с нуля". Для image generation смотрите `docs/free-graphical-models.md`. + ## 7) Поднять Qdrant ```bash