d67fdb0791
Made-with: Cursor
63 lines
1.8 KiB
Markdown
63 lines
1.8 KiB
Markdown
# Runtime choice: Ollama vs vLLM vs llama.cpp
|
||
|
||
Как выбрать движок запуска моделей.
|
||
|
||
## Ollama
|
||
|
||
Когда подходит лучше всего:
|
||
|
||
- быстрый старт
|
||
- локальная разработка
|
||
- минимум настройки
|
||
- поддержка многих моделей в одном интерфейсе
|
||
|
||
Плюсы:
|
||
|
||
- простая установка
|
||
- единый API-слой
|
||
- удобные команды `pull/list/run`
|
||
|
||
Минусы:
|
||
|
||
- меньше тонкой оптимизации, чем в специализированных production-схемах
|
||
|
||
## vLLM
|
||
|
||
Когда подходит:
|
||
|
||
- высокая нагрузка
|
||
- production API
|
||
- нужны throughput/батчинг и эффективная работа GPU
|
||
|
||
Плюсы:
|
||
|
||
- высокая производительность под серверные сценарии
|
||
- хорошие возможности масштабирования
|
||
|
||
Минусы:
|
||
|
||
- выше порог настройки и эксплуатации
|
||
|
||
## llama.cpp
|
||
|
||
Когда подходит:
|
||
|
||
- CPU-only/edge сценарии
|
||
- очень тонкий контроль квантизации и runtime-параметров
|
||
- lightweight деплой
|
||
|
||
Плюсы:
|
||
|
||
- гибкость и широкий набор форматов/опций
|
||
- хороший вариант для слабых или нестандартных машин
|
||
|
||
Минусы:
|
||
|
||
- больше ручной настройки по сравнению с Ollama
|
||
|
||
## Практическая рекомендация
|
||
|
||
- Стартуйте с **Ollama**.
|
||
- Если уперлись в нагрузку/latency в проде - переходите на **vLLM**.
|
||
- Если нужен максимальный контроль в CPU/edge - добавляйте **llama.cpp**.
|