docs: split handbook into docs/ by topic, slim root README, add docs index
Made-with: Cursor
This commit is contained in:
@@ -0,0 +1,70 @@
|
||||
# Планирование железа под локальные LLM (3 бюджета)
|
||||
|
||||
Ориентиры для Linux-сервера и локального запуска LLM (Ollama / OpenAI-compatible). Подробнее про ожидания к качеству: [expectations.md](expectations.md), выбор рантайма: [runtime-choice.md](runtime-choice.md).
|
||||
|
||||
## Бюджет A: Минимальный (CPU-only)
|
||||
|
||||
**Для кого:** старт, RAG, базовые задачи, без требований к высокой скорости.
|
||||
|
||||
- CPU: 8–12 vCPU (современные ядра)
|
||||
- RAM: 32 GB (минимум 16 GB, но хуже)
|
||||
- Disk: NVMe 512 GB
|
||||
- GPU: нет
|
||||
|
||||
Ожидания:
|
||||
|
||||
- модели 3B–7B с умеренной скоростью
|
||||
- ориентир decode: примерно `1–6 ток/с` (зависит от модели и квантизации)
|
||||
|
||||
Рекомендованные модели:
|
||||
|
||||
- `qwen2.5:3b`
|
||||
- `qwen2.5-coder:7b` (если хватает RAM/терпения)
|
||||
|
||||
## Бюджет B: Комфортный (1× GPU среднего класса)
|
||||
|
||||
**Для кого:** ежедневная работа 1–3 пользователей, код + RAG в комфортном режиме.
|
||||
|
||||
- CPU: 8–16 vCPU
|
||||
- RAM: 32–64 GB
|
||||
- GPU: 1× NVIDIA 12–16 GB VRAM (например, RTX 3060 12GB / 4070 Ti Super 16GB)
|
||||
- Disk: NVMe 1 TB
|
||||
|
||||
Ожидания:
|
||||
|
||||
- стабильная работа 7B/8B, лучше latency и throughput
|
||||
- ориентир decode: примерно `10–35 ток/с`
|
||||
|
||||
Рекомендованные модели:
|
||||
|
||||
- `qwen2.5-coder:7b`
|
||||
- `llama3.1:8b`
|
||||
- `deepseek-r1:8b`
|
||||
|
||||
## Бюджет C: Производительный (1–2 GPU высокого класса)
|
||||
|
||||
**Для кого:** команда, многозадачность, более тяжёлые модели и высокая отзывчивость.
|
||||
|
||||
- CPU: 16+ vCPU
|
||||
- RAM: 64–128 GB
|
||||
- GPU:
|
||||
- вариант 1: 1× NVIDIA 24 GB VRAM (RTX 4090 / L40-class по бюджету)
|
||||
- вариант 2: 2× GPU по 16–24 GB для масштабирования
|
||||
- Disk: NVMe 2 TB
|
||||
|
||||
Ожидания:
|
||||
|
||||
- уверенная работа 14B+ (квантизованные), параллельные запросы
|
||||
- ориентир decode: `25–80+ ток/с` в зависимости от модели/батча
|
||||
|
||||
Рекомендованные модели:
|
||||
|
||||
- 14B-класс инструкт/кодовые варианты
|
||||
- mix моделей: одна «быстрая дешёвая», одна «качественная тяжёлая»
|
||||
|
||||
## Что критично кроме железа
|
||||
|
||||
- стабильная версия драйверов CUDA (если NVIDIA);
|
||||
- быстрый NVMe (модели занимают много места);
|
||||
- мониторинг температуры/памяти/IO;
|
||||
- резерв свободного диска под новые веса.
|
||||
Reference in New Issue
Block a user