Files
Andrey Lutsenko d67fdb0791 Add model and runtime guidance documentation set.
Made-with: Cursor
2026-04-20 23:13:00 +10:00

63 lines
1.8 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# Runtime choice: Ollama vs vLLM vs llama.cpp
Как выбрать движок запуска моделей.
## Ollama
Когда подходит лучше всего:
- быстрый старт
- локальная разработка
- минимум настройки
- поддержка многих моделей в одном интерфейсе
Плюсы:
- простая установка
- единый API-слой
- удобные команды `pull/list/run`
Минусы:
- меньше тонкой оптимизации, чем в специализированных production-схемах
## vLLM
Когда подходит:
- высокая нагрузка
- production API
- нужны throughput/батчинг и эффективная работа GPU
Плюсы:
- высокая производительность под серверные сценарии
- хорошие возможности масштабирования
Минусы:
- выше порог настройки и эксплуатации
## llama.cpp
Когда подходит:
- CPU-only/edge сценарии
- очень тонкий контроль квантизации и runtime-параметров
- lightweight деплой
Плюсы:
- гибкость и широкий набор форматов/опций
- хороший вариант для слабых или нестандартных машин
Минусы:
- больше ручной настройки по сравнению с Ollama
## Практическая рекомендация
- Стартуйте с **Ollama**.
- Если уперлись в нагрузку/latency в проде - переходите на **vLLM**.
- Если нужен максимальный контроль в CPU/edge - добавляйте **llama.cpp**.