Gryphon SDLC Benchmark проверяет модели на инженерных задачах по всему циклу разработки. График показывает качество относительно сочетания времени и расхода глифов. Таблица позволяет сравнить каждый показатель отдельно. Результаты используются для выбора моделей в режимах Грифона.
Оценка от
Качество и совокупные затраты
Выше — качественнее. Левее — меньше произведение времени и глифов. Наведите на точку или нажмите на неё, чтобы увидеть модель и показатели.
Качество — округлённый индекс по инженерным критериям. Подпись «Слабее всего» указывает направление с наименьшей итоговой оценкой у этой модели, с учётом обязательных проверок; при равенстве сравниваются оценки по инженерным критериям.
Для каждой задачи перемножаем время в минутах и записанный расход глифов, затем берём медиану. По горизонтали равные расстояния соответствуют одинаковым отношениям значений. Меньший результат может означать выигрыш по времени, по расходу или по обоим показателям; отдельные медианы приведены в таблице.
Время и глифы в таблице — отдельные медианы по тому же набору задач, включая неудачные решения. Последующая оценка судьями в них не входит. Значения округлены до десятых.
Все модели: качество, время и глифы
Нажмите на заголовок столбца, чтобы изменить сортировку.
Все модели: качество, время и глифы
Модель
GPT-6 AstraOpenAIСлабее всего: тестирование
Качество97
Время4,5
Глифы112,6
Grok 4.6xAIСлабее всего: разработка
Качество97
Время6,7
Глифы32,8
DeepSeek V4 Pro 0813DeepSeekСлабее всего: тестирование
Качество96
Время9,5
Глифы13,8
GPT-5.6 SolOpenAIСлабее всего: безопасность
Качество96
Время2,6
Глифы16,4
Muse Spark 1.3MetaСлабее всего: тестирование
Качество96
Время2,8
Глифы25,7
Claude Opus 5AnthropicСлабее всего: безопасность
Качество95
Время8,5
Глифы190,8
Claude Fable 5.1AnthropicСлабее всего: безопасность
Качество94
Время6,7
Глифы223
Gemini 3.8 FlashGoogleСлабее всего: разработка
Качество94
Время4
Глифы44,1
Claude Sonnet 5AnthropicСлабее всего: тестирование
Качество88
Время9,1
Глифы99
GPT-5.6 TerraOpenAIСлабее всего: тестирование
Качество88
Время1,6
Глифы16,7
GPT-5.6 LunaOpenAIСлабее всего: безопасность
Качество83
Время2
Глифы2,1
Qwen 3.8 Max 0902AlibabaСлабее всего: тестирование
Качество81
Время16,2
Глифы69,1
Kimi K3Moonshot AIСлабее всего: тестирование
Качество73
Время18,2
Глифы97
GLM 5.3Z.aiСлабее всего: безопасность
Качество60
Время5,6
Глифы1,5
MiniMax M3MiniMaxСлабее всего: сопровождение
Качество36
Время9,8
Глифы3,2
Gryphon SDLC Benchmark
Как устроен бенчмарк
Задача в контексте проекта
Модель работает через движок CodeGryphon: получает постановку задачи, код и документацию, использует доступные инструменты и сохраняет результат в рабочем окружении. Корпус состоит из контролируемых проектов, моделирующих инженерную работу. Это позволяет сравнивать модели на одинаковых постановках и исходном состоянии проекта.
Оценка готового результата
После выполнения мы проверяем изменения и артефакты. Программные проверки контролируют поведение, ограничения и обязательные условия. Отдельно модельные судьи оценивают корректность решения, безопасность инженерных решений, качество проверки и ясность объяснения. Перед этой оценкой скрываются название модели и время её работы.
Что означает качество на графике
Вертикальная ось показывает усреднённую оценку по инженерным критериям. Наибольший вес имеет корректность, далее — безопасность, проверка результата и ясность объяснения. Направления представлены с одинаковым весом. Подпись «Слабее всего» показывает направление с наименьшей итоговой оценкой с учётом обязательных проверок. При равенстве итоговых оценок сравниваем оценки по инженерным критериям. Это относительное сравнение направлений внутри результатов модели.
Как связаны время и глифы
Для каждой задачи перемножаем время выполнения в минутах и записанный расход глифов. Медиану этих произведений используем для горизонтальной оси графика. Это не произведение двух отдельных медиан. Логарифмическая шкала позволяет сопоставить значения с большим разбросом; равные расстояния означают одинаковые отношения. В таблице время и глифы показаны отдельно. Учитываем и неудачные решения, исключаем последующую оценку судьями.
Задачи по всему SDLC
Покрываем весь SDLC: от анализа и разработки до тестирования, безопасных изменений и эксплуатации. Ниже — примеры из корпуса и то, что проверяется в результате.
Анализ
Пример задачи
Разобраться в инциденте по исходным данным и трассировкам: восстановить цепочку причин, оценить потери и отделить подтверждённые выводы от гипотез.
Что проверяем
Выводы опираются на конкретные источники.
Расчёты согласуются с исходными данными.
Учтены альтернативные объяснения и скрытые риски.
Разработка
Пример задачи
Реализовать переводы в учётном сервисе: валидацию сумм, атомарные операции и безопасную обработку повторных и конкурентных запросов.
Что проверяем
Публичный контракт и инварианты баланса сохранены.
Сбой не оставляет частично применённых изменений.
Повторы и конфликты проверены регрессионными тестами.
Тестирование
Пример задачи
Написать регрессионные тесты для асинхронного кеша авторизации и исправить ошибки изоляции, отзыва доступа и обработки параллельных запросов.
Что проверяем
Тесты обнаруживают заданные классы ошибок.
Корректная эталонная реализация проходит проверки.
Проверены отмена, ошибки загрузки и устаревшие разрешения.
Безопасность
Пример задачи
Защитить скачивание подписанных архивов: связать разрешение с организацией и содержимым, закрыть опасные пути и ограничить распаковку.
Что проверяем
Подпись и границы доступа нельзя обойти.
Опасные пути и конфликты имён отклоняются.
Легитимные архивы продолжают скачиваться.
Сопровождение
Пример задачи
Обновить миграцию снимков состояния с сохранением совместимости: поддержать старые форматы, историю операций и повторное применение.
Что проверяем
Данные и метаданные сохраняются.
Повторная миграция не меняет результат.
Конфликты и ошибки не повреждают исходное состояние.
Эксплуатация и инциденты
Пример задачи
Подготовить исполняемый план восстановления обработки событий по материалам инцидента и эксплуатационному регламенту.
Что проверяем
Порядок действий безопасен при симуляции.
События не пропускаются, эффекты не дублируются.
Сохранены доказательства и условия восстановления.
От результатов бенчмарка — к режимам Грифона
Бенчмарк используется для выбора моделей для режимов Грифона. Мы смотрим на характер задачи, качество, обязательные требования и время выполнения. Режим задаёт нужный уровень возможностей; состав моделей может меняться по мере новых оценок.
Lite
Для простых, чётко заданных задач: коротких объяснений, переработки текста и небольших правок с очевидным решением.
Balance
Для повседневной инженерной работы: разработки, отладки, тестов и изменений в нескольких файлах.
Pro
Для задач с высокой неопределённостью и ценой ошибки: архитектуры, безопасности, сложных миграций и конкурентности.
Auto
Выбирает уровень по смыслу запроса и контексту: учитывает сложность рассуждения, масштаб, неопределённость и риск.