# Benchmark template for local coding models Шаблон, чтобы сравнивать модели не "по ощущениям", а по одинаковым задачам. ## 1) Набор тест-кейсов Соберите 15-30 задач из реального проекта: - bugfix (small) - bugfix (cross-file) - рефакторинг модуля - добавление тестов - объяснение сложного участка - генерация migration/SQL ## 2) Метрики - **Latency to first token** - **Decode speed (tok/s)** - **Время до зелёных тестов** - **Число итераций правок** - **Процент задач "с первого прогона"** - **Субъективная читаемость кода (1-5)** ## 3) Таблица фиксации результатов | Модель | Runtime | tok/s | Time-to-green | Iterations | Pass rate | Notes | | --- | --- | --- | --- | --- | --- | --- | | qwen2.5-coder:7b | Ollama | | | | | | | qwen2.5-coder:14b | Ollama | | | | | | | deepseek-coder:* | Ollama/vLLM | | | | | | ## 4) Регламент сравнения 1. Использовать одинаковый prompt-шаблон. 2. Одинаковый контекст/набор файлов. 3. Одинаковый набор тест-команд. 4. Запускать минимум 2 повтора на каждую задачу. 5. Фиксировать дату, железо, версию модели. ## 5) Критерий "принять в прод-профиль" Новая модель переводится в default, если: - не хуже текущей по pass rate - не хуже по time-to-green на ключевых задачах - нет регрессий в критичных сценариях (миграции, тесты, multi-file edits)