Files
Andrey Lutsenko d67fdb0791 Add model and runtime guidance documentation set.
Made-with: Cursor
2026-04-20 23:13:00 +10:00

48 lines
1.9 KiB
Markdown

# Benchmark template for local coding models
Шаблон, чтобы сравнивать модели не "по ощущениям", а по одинаковым задачам.
## 1) Набор тест-кейсов
Соберите 15-30 задач из реального проекта:
- bugfix (small)
- bugfix (cross-file)
- рефакторинг модуля
- добавление тестов
- объяснение сложного участка
- генерация migration/SQL
## 2) Метрики
- **Latency to first token**
- **Decode speed (tok/s)**
- **Время до зелёных тестов**
- **Число итераций правок**
- **Процент задач "с первого прогона"**
- **Субъективная читаемость кода (1-5)**
## 3) Таблица фиксации результатов
| Модель | Runtime | tok/s | Time-to-green | Iterations | Pass rate | Notes |
| --- | --- | --- | --- | --- | --- | --- |
| qwen2.5-coder:7b | Ollama | | | | | |
| qwen2.5-coder:14b | Ollama | | | | | |
| deepseek-coder:* | Ollama/vLLM | | | | | |
## 4) Регламент сравнения
1. Использовать одинаковый prompt-шаблон.
2. Одинаковый контекст/набор файлов.
3. Одинаковый набор тест-команд.
4. Запускать минимум 2 повтора на каждую задачу.
5. Фиксировать дату, железо, версию модели.
## 5) Критерий "принять в прод-профиль"
Новая модель переводится в default, если:
- не хуже текущей по pass rate
- не хуже по time-to-green на ключевых задачах
- нет регрессий в критичных сценариях (миграции, тесты, multi-file edits)