Add model and runtime guidance documentation set.

Made-with: Cursor
This commit is contained in:
Andrey Lutsenko
2026-04-20 23:13:00 +10:00
parent bf1fd5e77d
commit d67fdb0791
6 changed files with 218 additions and 0 deletions
+62
View File
@@ -0,0 +1,62 @@
# Runtime choice: Ollama vs vLLM vs llama.cpp
Как выбрать движок запуска моделей.
## Ollama
Когда подходит лучше всего:
- быстрый старт
- локальная разработка
- минимум настройки
- поддержка многих моделей в одном интерфейсе
Плюсы:
- простая установка
- единый API-слой
- удобные команды `pull/list/run`
Минусы:
- меньше тонкой оптимизации, чем в специализированных production-схемах
## vLLM
Когда подходит:
- высокая нагрузка
- production API
- нужны throughput/батчинг и эффективная работа GPU
Плюсы:
- высокая производительность под серверные сценарии
- хорошие возможности масштабирования
Минусы:
- выше порог настройки и эксплуатации
## llama.cpp
Когда подходит:
- CPU-only/edge сценарии
- очень тонкий контроль квантизации и runtime-параметров
- lightweight деплой
Плюсы:
- гибкость и широкий набор форматов/опций
- хороший вариант для слабых или нестандартных машин
Минусы:
- больше ручной настройки по сравнению с Ollama
## Практическая рекомендация
- Стартуйте с **Ollama**.
- Если уперлись в нагрузку/latency в проде - переходите на **vLLM**.
- Если нужен максимальный контроль в CPU/edge - добавляйте **llama.cpp**.