Add model and runtime guidance documentation set.
Made-with: Cursor
This commit is contained in:
@@ -0,0 +1,62 @@
|
||||
# Runtime choice: Ollama vs vLLM vs llama.cpp
|
||||
|
||||
Как выбрать движок запуска моделей.
|
||||
|
||||
## Ollama
|
||||
|
||||
Когда подходит лучше всего:
|
||||
|
||||
- быстрый старт
|
||||
- локальная разработка
|
||||
- минимум настройки
|
||||
- поддержка многих моделей в одном интерфейсе
|
||||
|
||||
Плюсы:
|
||||
|
||||
- простая установка
|
||||
- единый API-слой
|
||||
- удобные команды `pull/list/run`
|
||||
|
||||
Минусы:
|
||||
|
||||
- меньше тонкой оптимизации, чем в специализированных production-схемах
|
||||
|
||||
## vLLM
|
||||
|
||||
Когда подходит:
|
||||
|
||||
- высокая нагрузка
|
||||
- production API
|
||||
- нужны throughput/батчинг и эффективная работа GPU
|
||||
|
||||
Плюсы:
|
||||
|
||||
- высокая производительность под серверные сценарии
|
||||
- хорошие возможности масштабирования
|
||||
|
||||
Минусы:
|
||||
|
||||
- выше порог настройки и эксплуатации
|
||||
|
||||
## llama.cpp
|
||||
|
||||
Когда подходит:
|
||||
|
||||
- CPU-only/edge сценарии
|
||||
- очень тонкий контроль квантизации и runtime-параметров
|
||||
- lightweight деплой
|
||||
|
||||
Плюсы:
|
||||
|
||||
- гибкость и широкий набор форматов/опций
|
||||
- хороший вариант для слабых или нестандартных машин
|
||||
|
||||
Минусы:
|
||||
|
||||
- больше ручной настройки по сравнению с Ollama
|
||||
|
||||
## Практическая рекомендация
|
||||
|
||||
- Стартуйте с **Ollama**.
|
||||
- Если уперлись в нагрузку/latency в проде - переходите на **vLLM**.
|
||||
- Если нужен максимальный контроль в CPU/edge - добавляйте **llama.cpp**.
|
||||
Reference in New Issue
Block a user