Как мы выбираем модели для Грифона

Gryphon SDLC Benchmark проверяет модели на инженерных задачах по всему циклу разработки. График показывает качество относительно сочетания времени и расхода глифов. Таблица позволяет сравнить каждый показатель отдельно. Результаты используются для выбора моделей в режимах Грифона.

Оценка от

Качество и совокупные затраты

Выше — качественнее. Левее — меньше произведение времени и глифов. Наведите на точку или нажмите на неё, чтобы увидеть модель и показатели.

Методология
Качество · 0–100 · выше лучше
Качество и совокупные затратыГрафик всех моделей. По вертикали — качество. По горизонтали — медиана произведения времени задачи в минутах и расхода глифов; шкала логарифмическая. Все маркеры одинакового размера. Цвет и форма обозначают производителя.0204060801000,11101001 00010 000
Время × глифы · мин · глифы · меньше лучше

медиана · логарифмическая шкала

Производители

  • OpenAI
  • Anthropic
  • Google
  • xAI
  • Meta
  • DeepSeek
  • Alibaba
  • Moonshot AI
  • Z.ai
  • MiniMax

Качество — округлённый индекс по инженерным критериям. Подпись «Слабее всего» указывает направление с наименьшей итоговой оценкой у этой модели, с учётом обязательных проверок; при равенстве сравниваются оценки по инженерным критериям.

Для каждой задачи перемножаем время в минутах и записанный расход глифов, затем берём медиану. По горизонтали равные расстояния соответствуют одинаковым отношениям значений. Меньший результат может означать выигрыш по времени, по расходу или по обоим показателям; отдельные медианы приведены в таблице.

Время и глифы в таблице — отдельные медианы по тому же набору задач, включая неудачные решения. Последующая оценка судьями в них не входит. Значения округлены до десятых.

Все модели: качество, время и глифы

Нажмите на заголовок столбца, чтобы изменить сортировку.

Все модели: качество, время и глифы
Модель
GPT-6 AstraOpenAIСлабее всего: тестированиеКачество97Время4,5Глифы112,6
Grok 4.6xAIСлабее всего: разработкаКачество97Время6,7Глифы32,8
DeepSeek V4 Pro 0813DeepSeekСлабее всего: тестированиеКачество96Время9,5Глифы13,8
GPT-5.6 SolOpenAIСлабее всего: безопасностьКачество96Время2,6Глифы16,4
Muse Spark 1.3MetaСлабее всего: тестированиеКачество96Время2,8Глифы25,7
Claude Opus 5AnthropicСлабее всего: безопасностьКачество95Время8,5Глифы190,8
Claude Fable 5.1AnthropicСлабее всего: безопасностьКачество94Время6,7Глифы223
Gemini 3.8 FlashGoogleСлабее всего: разработкаКачество94Время4Глифы44,1
Claude Sonnet 5AnthropicСлабее всего: тестированиеКачество88Время9,1Глифы99
GPT-5.6 TerraOpenAIСлабее всего: тестированиеКачество88Время1,6Глифы16,7
GPT-5.6 LunaOpenAIСлабее всего: безопасностьКачество83Время2Глифы2,1
Qwen 3.8 Max 0902AlibabaСлабее всего: тестированиеКачество81Время16,2Глифы69,1
Kimi K3Moonshot AIСлабее всего: тестированиеКачество73Время18,2Глифы97
GLM 5.3Z.aiСлабее всего: безопасностьКачество60Время5,6Глифы1,5
MiniMax M3MiniMaxСлабее всего: сопровождениеКачество36Время9,8Глифы3,2
Gryphon SDLC Benchmark

Как устроен бенчмарк

Задача в контексте проекта

Модель работает через движок CodeGryphon: получает постановку задачи, код и документацию, использует доступные инструменты и сохраняет результат в рабочем окружении. Корпус состоит из контролируемых проектов, моделирующих инженерную работу. Это позволяет сравнивать модели на одинаковых постановках и исходном состоянии проекта.

Оценка готового результата

После выполнения мы проверяем изменения и артефакты. Программные проверки контролируют поведение, ограничения и обязательные условия. Отдельно модельные судьи оценивают корректность решения, безопасность инженерных решений, качество проверки и ясность объяснения. Перед этой оценкой скрываются название модели и время её работы.

Что означает качество на графике

Вертикальная ось показывает усреднённую оценку по инженерным критериям. Наибольший вес имеет корректность, далее — безопасность, проверка результата и ясность объяснения. Направления представлены с одинаковым весом. Подпись «Слабее всего» показывает направление с наименьшей итоговой оценкой с учётом обязательных проверок. При равенстве итоговых оценок сравниваем оценки по инженерным критериям. Это относительное сравнение направлений внутри результатов модели.

Как связаны время и глифы

Для каждой задачи перемножаем время выполнения в минутах и записанный расход глифов. Медиану этих произведений используем для горизонтальной оси графика. Это не произведение двух отдельных медиан. Логарифмическая шкала позволяет сопоставить значения с большим разбросом; равные расстояния означают одинаковые отношения. В таблице время и глифы показаны отдельно. Учитываем и неудачные решения, исключаем последующую оценку судьями.

Задачи по всему SDLC

Покрываем весь SDLC: от анализа и разработки до тестирования, безопасных изменений и эксплуатации. Ниже — примеры из корпуса и то, что проверяется в результате.

Анализ

Пример задачи

Разобраться в инциденте по исходным данным и трассировкам: восстановить цепочку причин, оценить потери и отделить подтверждённые выводы от гипотез.

Что проверяем
  • Выводы опираются на конкретные источники.
  • Расчёты согласуются с исходными данными.
  • Учтены альтернативные объяснения и скрытые риски.

Разработка

Пример задачи

Реализовать переводы в учётном сервисе: валидацию сумм, атомарные операции и безопасную обработку повторных и конкурентных запросов.

Что проверяем
  • Публичный контракт и инварианты баланса сохранены.
  • Сбой не оставляет частично применённых изменений.
  • Повторы и конфликты проверены регрессионными тестами.

Тестирование

Пример задачи

Написать регрессионные тесты для асинхронного кеша авторизации и исправить ошибки изоляции, отзыва доступа и обработки параллельных запросов.

Что проверяем
  • Тесты обнаруживают заданные классы ошибок.
  • Корректная эталонная реализация проходит проверки.
  • Проверены отмена, ошибки загрузки и устаревшие разрешения.

Безопасность

Пример задачи

Защитить скачивание подписанных архивов: связать разрешение с организацией и содержимым, закрыть опасные пути и ограничить распаковку.

Что проверяем
  • Подпись и границы доступа нельзя обойти.
  • Опасные пути и конфликты имён отклоняются.
  • Легитимные архивы продолжают скачиваться.

Сопровождение

Пример задачи

Обновить миграцию снимков состояния с сохранением совместимости: поддержать старые форматы, историю операций и повторное применение.

Что проверяем
  • Данные и метаданные сохраняются.
  • Повторная миграция не меняет результат.
  • Конфликты и ошибки не повреждают исходное состояние.

Эксплуатация и инциденты

Пример задачи

Подготовить исполняемый план восстановления обработки событий по материалам инцидента и эксплуатационному регламенту.

Что проверяем
  • Порядок действий безопасен при симуляции.
  • События не пропускаются, эффекты не дублируются.
  • Сохранены доказательства и условия восстановления.

От результатов бенчмарка — к режимам Грифона

Бенчмарк используется для выбора моделей для режимов Грифона. Мы смотрим на характер задачи, качество, обязательные требования и время выполнения. Режим задаёт нужный уровень возможностей; состав моделей может меняться по мере новых оценок.

Lite

Для простых, чётко заданных задач: коротких объяснений, переработки текста и небольших правок с очевидным решением.

Balance

Для повседневной инженерной работы: разработки, отладки, тестов и изменений в нескольких файлах.

Pro

Для задач с высокой неопределённостью и ценой ошибки: архитектуры, безопасности, сложных миграций и конкурентности.

Auto

Выбирает уровень по смыслу запроса и контексту: учитывает сложность рассуждения, масштаб, неопределённость и риск.