Files
2026-04-21 15:37:43 +10:00

71 lines
2.9 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Планирование железа под локальные LLM (3 бюджета)
Ориентиры для Linux-сервера и локального запуска LLM (Ollama / OpenAI-compatible). Подробнее про ожидания к качеству: [expectations.md](expectations.md), выбор рантайма: [runtime-choice.md](runtime-choice.md).
## Бюджет A: Минимальный (CPU-only)
**Для кого:** старт, RAG, базовые задачи, без требований к высокой скорости.
- CPU: 812 vCPU (современные ядра)
- RAM: 32 GB (минимум 16 GB, но хуже)
- Disk: NVMe 512 GB
- GPU: нет
Ожидания:
- модели 3B–7B с умеренной скоростью
- ориентир decode: примерно `16 ток/с` (зависит от модели и квантизации)
Рекомендованные модели:
- `qwen2.5:3b`
- `qwen2.5-coder:7b` (если хватает RAM/терпения)
## Бюджет B: Комфортный (1× GPU среднего класса)
**Для кого:** ежедневная работа 1–3 пользователей, код + RAG в комфортном режиме.
- CPU: 816 vCPU
- RAM: 3264 GB
- GPU: 1× NVIDIA 1216 GB VRAM (например, RTX 3060 12GB / 4070 Ti Super 16GB)
- Disk: NVMe 1 TB
Ожидания:
- стабильная работа 7B/8B, лучше latency и throughput
- ориентир decode: примерно `1035 ток/с`
Рекомендованные модели:
- `qwen2.5-coder:7b`
- `llama3.1:8b`
- `deepseek-r1:8b`
## Бюджет C: Производительный (1–2 GPU высокого класса)
**Для кого:** команда, многозадачность, более тяжёлые модели и высокая отзывчивость.
- CPU: 16+ vCPU
- RAM: 64128 GB
- GPU:
- вариант 1: 1× NVIDIA 24 GB VRAM (RTX 4090 / L40-class по бюджету)
- вариант 2: 2× GPU по 16–24 GB для масштабирования
- Disk: NVMe 2 TB
Ожидания:
- уверенная работа 14B+ (квантизованные), параллельные запросы
- ориентир decode: `2580+ ток/с` в зависимости от модели/батча
Рекомендованные модели:
- 14B-класс инструкт/кодовые варианты
- mix моделей: одна «быстрая дешёвая», одна «качественная тяжёлая»
## Что критично кроме железа
- стабильная версия драйверов CUDA (если NVIDIA);
- быстрый NVMe (модели занимают много места);
- мониторинг температуры/памяти/IO;
- резерв свободного диска под новые веса.