Files
openclaude-LLM-local/docs/hardware-budgets.md
T
2026-04-21 15:37:43 +10:00

2.9 KiB
Raw Blame History

Планирование железа под локальные LLM (3 бюджета)

Ориентиры для Linux-сервера и локального запуска LLM (Ollama / OpenAI-compatible). Подробнее про ожидания к качеству: expectations.md, выбор рантайма: runtime-choice.md.

Бюджет A: Минимальный (CPU-only)

Для кого: старт, RAG, базовые задачи, без требований к высокой скорости.

  • CPU: 812 vCPU (современные ядра)
  • RAM: 32 GB (минимум 16 GB, но хуже)
  • Disk: NVMe 512 GB
  • GPU: нет

Ожидания:

  • модели 3B–7B с умеренной скоростью
  • ориентир decode: примерно 16 ток/с (зависит от модели и квантизации)

Рекомендованные модели:

  • qwen2.5:3b
  • qwen2.5-coder:7b (если хватает RAM/терпения)

Бюджет B: Комфортный (1× GPU среднего класса)

Для кого: ежедневная работа 1–3 пользователей, код + RAG в комфортном режиме.

  • CPU: 816 vCPU
  • RAM: 3264 GB
  • GPU: 1× NVIDIA 1216 GB VRAM (например, RTX 3060 12GB / 4070 Ti Super 16GB)
  • Disk: NVMe 1 TB

Ожидания:

  • стабильная работа 7B/8B, лучше latency и throughput
  • ориентир decode: примерно 1035 ток/с

Рекомендованные модели:

  • qwen2.5-coder:7b
  • llama3.1:8b
  • deepseek-r1:8b

Бюджет C: Производительный (1–2 GPU высокого класса)

Для кого: команда, многозадачность, более тяжёлые модели и высокая отзывчивость.

  • CPU: 16+ vCPU
  • RAM: 64128 GB
  • GPU:
    • вариант 1: 1× NVIDIA 24 GB VRAM (RTX 4090 / L40-class по бюджету)
    • вариант 2: 2× GPU по 16–24 GB для масштабирования
  • Disk: NVMe 2 TB

Ожидания:

  • уверенная работа 14B+ (квантизованные), параллельные запросы
  • ориентир decode: 2580+ ток/с в зависимости от модели/батча

Рекомендованные модели:

  • 14B-класс инструкт/кодовые варианты
  • mix моделей: одна «быстрая дешёвая», одна «качественная тяжёлая»

Что критично кроме железа

  • стабильная версия драйверов CUDA (если NVIDIA);
  • быстрый NVMe (модели занимают много места);
  • мониторинг температуры/памяти/IO;
  • резерв свободного диска под новые веса.