Files
Andrey Lutsenko d67fdb0791 Add model and runtime guidance documentation set.
Made-with: Cursor
2026-04-20 23:13:00 +10:00

1.9 KiB

Benchmark template for local coding models

Шаблон, чтобы сравнивать модели не "по ощущениям", а по одинаковым задачам.

1) Набор тест-кейсов

Соберите 15-30 задач из реального проекта:

  • bugfix (small)
  • bugfix (cross-file)
  • рефакторинг модуля
  • добавление тестов
  • объяснение сложного участка
  • генерация migration/SQL

2) Метрики

  • Latency to first token
  • Decode speed (tok/s)
  • Время до зелёных тестов
  • Число итераций правок
  • Процент задач "с первого прогона"
  • Субъективная читаемость кода (1-5)

3) Таблица фиксации результатов

Модель Runtime tok/s Time-to-green Iterations Pass rate Notes
qwen2.5-coder:7b Ollama
qwen2.5-coder:14b Ollama
deepseek-coder:* Ollama/vLLM

4) Регламент сравнения

  1. Использовать одинаковый prompt-шаблон.
  2. Одинаковый контекст/набор файлов.
  3. Одинаковый набор тест-команд.
  4. Запускать минимум 2 повтора на каждую задачу.
  5. Фиксировать дату, железо, версию модели.

5) Критерий "принять в прод-профиль"

Новая модель переводится в default, если:

  • не хуже текущей по pass rate
  • не хуже по time-to-green на ключевых задачах
  • нет регрессий в критичных сценариях (миграции, тесты, multi-file edits)