d67fdb0791
Made-with: Cursor
48 lines
1.9 KiB
Markdown
48 lines
1.9 KiB
Markdown
# Benchmark template for local coding models
|
|
|
|
Шаблон, чтобы сравнивать модели не "по ощущениям", а по одинаковым задачам.
|
|
|
|
## 1) Набор тест-кейсов
|
|
|
|
Соберите 15-30 задач из реального проекта:
|
|
|
|
- bugfix (small)
|
|
- bugfix (cross-file)
|
|
- рефакторинг модуля
|
|
- добавление тестов
|
|
- объяснение сложного участка
|
|
- генерация migration/SQL
|
|
|
|
## 2) Метрики
|
|
|
|
- **Latency to first token**
|
|
- **Decode speed (tok/s)**
|
|
- **Время до зелёных тестов**
|
|
- **Число итераций правок**
|
|
- **Процент задач "с первого прогона"**
|
|
- **Субъективная читаемость кода (1-5)**
|
|
|
|
## 3) Таблица фиксации результатов
|
|
|
|
| Модель | Runtime | tok/s | Time-to-green | Iterations | Pass rate | Notes |
|
|
| --- | --- | --- | --- | --- | --- | --- |
|
|
| qwen2.5-coder:7b | Ollama | | | | | |
|
|
| qwen2.5-coder:14b | Ollama | | | | | |
|
|
| deepseek-coder:* | Ollama/vLLM | | | | | |
|
|
|
|
## 4) Регламент сравнения
|
|
|
|
1. Использовать одинаковый prompt-шаблон.
|
|
2. Одинаковый контекст/набор файлов.
|
|
3. Одинаковый набор тест-команд.
|
|
4. Запускать минимум 2 повтора на каждую задачу.
|
|
5. Фиксировать дату, железо, версию модели.
|
|
|
|
## 5) Критерий "принять в прод-профиль"
|
|
|
|
Новая модель переводится в default, если:
|
|
|
|
- не хуже текущей по pass rate
|
|
- не хуже по time-to-green на ключевых задачах
|
|
- нет регрессий в критичных сценариях (миграции, тесты, multi-file edits)
|