Files
openclaude-LLM-local/docs/runtime-choice.md
T
Andrey Lutsenko d67fdb0791 Add model and runtime guidance documentation set.
Made-with: Cursor
2026-04-20 23:13:00 +10:00

1.8 KiB
Raw Blame History

Runtime choice: Ollama vs vLLM vs llama.cpp

Как выбрать движок запуска моделей.

Ollama

Когда подходит лучше всего:

  • быстрый старт
  • локальная разработка
  • минимум настройки
  • поддержка многих моделей в одном интерфейсе

Плюсы:

  • простая установка
  • единый API-слой
  • удобные команды pull/list/run

Минусы:

  • меньше тонкой оптимизации, чем в специализированных production-схемах

vLLM

Когда подходит:

  • высокая нагрузка
  • production API
  • нужны throughput/батчинг и эффективная работа GPU

Плюсы:

  • высокая производительность под серверные сценарии
  • хорошие возможности масштабирования

Минусы:

  • выше порог настройки и эксплуатации

llama.cpp

Когда подходит:

  • CPU-only/edge сценарии
  • очень тонкий контроль квантизации и runtime-параметров
  • lightweight деплой

Плюсы:

  • гибкость и широкий набор форматов/опций
  • хороший вариант для слабых или нестандартных машин

Минусы:

  • больше ручной настройки по сравнению с Ollama

Практическая рекомендация

  • Стартуйте с Ollama.
  • Если уперлись в нагрузку/latency в проде - переходите на vLLM.
  • Если нужен максимальный контроль в CPU/edge - добавляйте llama.cpp.