# Runtime choice: Ollama vs vLLM vs llama.cpp Как выбрать движок запуска моделей. ## Ollama Когда подходит лучше всего: - быстрый старт - локальная разработка - минимум настройки - поддержка многих моделей в одном интерфейсе Плюсы: - простая установка - единый API-слой - удобные команды `pull/list/run` Минусы: - меньше тонкой оптимизации, чем в специализированных production-схемах ## vLLM Когда подходит: - высокая нагрузка - production API - нужны throughput/батчинг и эффективная работа GPU Плюсы: - высокая производительность под серверные сценарии - хорошие возможности масштабирования Минусы: - выше порог настройки и эксплуатации ## llama.cpp Когда подходит: - CPU-only/edge сценарии - очень тонкий контроль квантизации и runtime-параметров - lightweight деплой Плюсы: - гибкость и широкий набор форматов/опций - хороший вариант для слабых или нестандартных машин Минусы: - больше ручной настройки по сравнению с Ollama ## Практическая рекомендация - Стартуйте с **Ollama**. - Если уперлись в нагрузку/latency в проде - переходите на **vLLM**. - Если нужен максимальный контроль в CPU/edge - добавляйте **llama.cpp**.