c589a216be
Made-with: Cursor
2.9 KiB
2.9 KiB
Планирование железа под локальные LLM (3 бюджета)
Ориентиры для Linux-сервера и локального запуска LLM (Ollama / OpenAI-compatible). Подробнее про ожидания к качеству: expectations.md, выбор рантайма: runtime-choice.md.
Бюджет A: Минимальный (CPU-only)
Для кого: старт, RAG, базовые задачи, без требований к высокой скорости.
- CPU: 8–12 vCPU (современные ядра)
- RAM: 32 GB (минимум 16 GB, но хуже)
- Disk: NVMe 512 GB
- GPU: нет
Ожидания:
- модели 3B–7B с умеренной скоростью
- ориентир decode: примерно
1–6 ток/с(зависит от модели и квантизации)
Рекомендованные модели:
qwen2.5:3bqwen2.5-coder:7b(если хватает RAM/терпения)
Бюджет B: Комфортный (1× GPU среднего класса)
Для кого: ежедневная работа 1–3 пользователей, код + RAG в комфортном режиме.
- CPU: 8–16 vCPU
- RAM: 32–64 GB
- GPU: 1× NVIDIA 12–16 GB VRAM (например, RTX 3060 12GB / 4070 Ti Super 16GB)
- Disk: NVMe 1 TB
Ожидания:
- стабильная работа 7B/8B, лучше latency и throughput
- ориентир decode: примерно
10–35 ток/с
Рекомендованные модели:
qwen2.5-coder:7bllama3.1:8bdeepseek-r1:8b
Бюджет C: Производительный (1–2 GPU высокого класса)
Для кого: команда, многозадачность, более тяжёлые модели и высокая отзывчивость.
- CPU: 16+ vCPU
- RAM: 64–128 GB
- GPU:
- вариант 1: 1× NVIDIA 24 GB VRAM (RTX 4090 / L40-class по бюджету)
- вариант 2: 2× GPU по 16–24 GB для масштабирования
- Disk: NVMe 2 TB
Ожидания:
- уверенная работа 14B+ (квантизованные), параллельные запросы
- ориентир decode:
25–80+ ток/св зависимости от модели/батча
Рекомендованные модели:
- 14B-класс инструкт/кодовые варианты
- mix моделей: одна «быстрая дешёвая», одна «качественная тяжёлая»
Что критично кроме железа
- стабильная версия драйверов CUDA (если NVIDIA);
- быстрый NVMe (модели занимают много места);
- мониторинг температуры/памяти/IO;
- резерв свободного диска под новые веса.