# Планирование железа под локальные LLM (3 бюджета) Ориентиры для Linux-сервера и локального запуска LLM (Ollama / OpenAI-compatible). Подробнее про ожидания к качеству: [expectations.md](expectations.md), выбор рантайма: [runtime-choice.md](runtime-choice.md). ## Бюджет A: Минимальный (CPU-only) **Для кого:** старт, RAG, базовые задачи, без требований к высокой скорости. - CPU: 8–12 vCPU (современные ядра) - RAM: 32 GB (минимум 16 GB, но хуже) - Disk: NVMe 512 GB - GPU: нет Ожидания: - модели 3B–7B с умеренной скоростью - ориентир decode: примерно `1–6 ток/с` (зависит от модели и квантизации) Рекомендованные модели: - `qwen2.5:3b` - `qwen2.5-coder:7b` (если хватает RAM/терпения) ## Бюджет B: Комфортный (1× GPU среднего класса) **Для кого:** ежедневная работа 1–3 пользователей, код + RAG в комфортном режиме. - CPU: 8–16 vCPU - RAM: 32–64 GB - GPU: 1× NVIDIA 12–16 GB VRAM (например, RTX 3060 12GB / 4070 Ti Super 16GB) - Disk: NVMe 1 TB Ожидания: - стабильная работа 7B/8B, лучше latency и throughput - ориентир decode: примерно `10–35 ток/с` Рекомендованные модели: - `qwen2.5-coder:7b` - `llama3.1:8b` - `deepseek-r1:8b` ## Бюджет C: Производительный (1–2 GPU высокого класса) **Для кого:** команда, многозадачность, более тяжёлые модели и высокая отзывчивость. - CPU: 16+ vCPU - RAM: 64–128 GB - GPU: - вариант 1: 1× NVIDIA 24 GB VRAM (RTX 4090 / L40-class по бюджету) - вариант 2: 2× GPU по 16–24 GB для масштабирования - Disk: NVMe 2 TB Ожидания: - уверенная работа 14B+ (квантизованные), параллельные запросы - ориентир decode: `25–80+ ток/с` в зависимости от модели/батча Рекомендованные модели: - 14B-класс инструкт/кодовые варианты - mix моделей: одна «быстрая дешёвая», одна «качественная тяжёлая» ## Что критично кроме железа - стабильная версия драйверов CUDA (если NVIDIA); - быстрый NVMe (модели занимают много места); - мониторинг температуры/памяти/IO; - резерв свободного диска под новые веса.