d67fdb0791
Made-with: Cursor
1.9 KiB
1.9 KiB
Benchmark template for local coding models
Шаблон, чтобы сравнивать модели не "по ощущениям", а по одинаковым задачам.
1) Набор тест-кейсов
Соберите 15-30 задач из реального проекта:
- bugfix (small)
- bugfix (cross-file)
- рефакторинг модуля
- добавление тестов
- объяснение сложного участка
- генерация migration/SQL
2) Метрики
- Latency to first token
- Decode speed (tok/s)
- Время до зелёных тестов
- Число итераций правок
- Процент задач "с первого прогона"
- Субъективная читаемость кода (1-5)
3) Таблица фиксации результатов
| Модель | Runtime | tok/s | Time-to-green | Iterations | Pass rate | Notes |
|---|---|---|---|---|---|---|
| qwen2.5-coder:7b | Ollama | |||||
| qwen2.5-coder:14b | Ollama | |||||
| deepseek-coder:* | Ollama/vLLM |
4) Регламент сравнения
- Использовать одинаковый prompt-шаблон.
- Одинаковый контекст/набор файлов.
- Одинаковый набор тест-команд.
- Запускать минимум 2 повтора на каждую задачу.
- Фиксировать дату, железо, версию модели.
5) Критерий "принять в прод-профиль"
Новая модель переводится в default, если:
- не хуже текущей по pass rate
- не хуже по time-to-green на ключевых задачах
- нет регрессий в критичных сценариях (миграции, тесты, multi-file edits)