Add model and runtime guidance documentation set.
Made-with: Cursor
This commit is contained in:
@@ -0,0 +1,47 @@
|
||||
# Benchmark template for local coding models
|
||||
|
||||
Шаблон, чтобы сравнивать модели не "по ощущениям", а по одинаковым задачам.
|
||||
|
||||
## 1) Набор тест-кейсов
|
||||
|
||||
Соберите 15-30 задач из реального проекта:
|
||||
|
||||
- bugfix (small)
|
||||
- bugfix (cross-file)
|
||||
- рефакторинг модуля
|
||||
- добавление тестов
|
||||
- объяснение сложного участка
|
||||
- генерация migration/SQL
|
||||
|
||||
## 2) Метрики
|
||||
|
||||
- **Latency to first token**
|
||||
- **Decode speed (tok/s)**
|
||||
- **Время до зелёных тестов**
|
||||
- **Число итераций правок**
|
||||
- **Процент задач "с первого прогона"**
|
||||
- **Субъективная читаемость кода (1-5)**
|
||||
|
||||
## 3) Таблица фиксации результатов
|
||||
|
||||
| Модель | Runtime | tok/s | Time-to-green | Iterations | Pass rate | Notes |
|
||||
| --- | --- | --- | --- | --- | --- | --- |
|
||||
| qwen2.5-coder:7b | Ollama | | | | | |
|
||||
| qwen2.5-coder:14b | Ollama | | | | | |
|
||||
| deepseek-coder:* | Ollama/vLLM | | | | | |
|
||||
|
||||
## 4) Регламент сравнения
|
||||
|
||||
1. Использовать одинаковый prompt-шаблон.
|
||||
2. Одинаковый контекст/набор файлов.
|
||||
3. Одинаковый набор тест-команд.
|
||||
4. Запускать минимум 2 повтора на каждую задачу.
|
||||
5. Фиксировать дату, железо, версию модели.
|
||||
|
||||
## 5) Критерий "принять в прод-профиль"
|
||||
|
||||
Новая модель переводится в default, если:
|
||||
|
||||
- не хуже текущей по pass rate
|
||||
- не хуже по time-to-green на ключевых задачах
|
||||
- нет регрессий в критичных сценариях (миграции, тесты, multi-file edits)
|
||||
Reference in New Issue
Block a user