يقيّم Gryphon SDLC Benchmark النماذج في مهام هندسية تغطي دورة حياة تطوير البرمجيات. يقارن المخطط الجودة بمزيج وقت التنفيذ واستهلاك الغليف، ويعرض الجدول كل مؤشر على حدة. نستخدم النتائج لاختيار نماذج أوضاع Gryphon.
تاريخ التقييم:
الجودة والاستهلاك المشترك للموارد
الأعلى يعني جودة أفضل. الاتجاه إلى اليسار يعني حاصل ضرب أقل للوقت والغليف. مرّر المؤشر فوق نقطة أو اضغط عليها لعرض النموذج ومؤشراته.
الجودة مؤشر مقرب وفق معايير هندسية. يشير «المجال الأقل تقييمًا» إلى المجال صاحب أدنى تقييم للعمل المنجز لدى النموذج، مع مراعاة الفحوص الإلزامية. عند التعادل نستخدم التقييم وفق المعايير الهندسية.
نضرب وقت التنفيذ بالدقائق في استهلاك الغليف المسجل لكل مهمة، ثم نحسب الوسيط. المسافات الأفقية المتساوية تمثل نسبًا متساوية. قد تعني القيمة الأقل تنفيذًا أسرع أو استهلاكًا أقل أو كليهما؛ يعرض الجدول الوسيطين منفصلين.
الوقت والغليف في الجدول وسيطان مستقلان لمجموعة المهام نفسها، بما فيها الحلول غير الناجحة، دون التقييم اللاحق. القيم مقربة إلى منزلة عشرية واحدة.
جميع النماذج: الجودة والوقت والغليف
اضغط على عنوان عمود لتغيير ترتيب النماذج.
جميع النماذج: الجودة والوقت والغليف
النموذج
GPT-6 AstraOpenAIالمجال الأقل تقييمًا: الاختبار
الجودة97
الوقت4.5
الغليف112.6
Grok 4.6xAIالمجال الأقل تقييمًا: التطوير
الجودة97
الوقت6.7
الغليف32.8
DeepSeek V4 Pro 0813DeepSeekالمجال الأقل تقييمًا: الاختبار
الجودة96
الوقت9.5
الغليف13.8
GPT-5.6 SolOpenAIالمجال الأقل تقييمًا: الأمان
الجودة96
الوقت2.6
الغليف16.4
Muse Spark 1.3Metaالمجال الأقل تقييمًا: الاختبار
الجودة96
الوقت2.8
الغليف25.7
Claude Opus 5Anthropicالمجال الأقل تقييمًا: الأمان
الجودة95
الوقت8.5
الغليف190.8
Claude Fable 5.1Anthropicالمجال الأقل تقييمًا: الأمان
الجودة94
الوقت6.7
الغليف223
Gemini 3.8 FlashGoogleالمجال الأقل تقييمًا: التطوير
الجودة94
الوقت4
الغليف44.1
Claude Sonnet 5Anthropicالمجال الأقل تقييمًا: الاختبار
الجودة88
الوقت9.1
الغليف99
GPT-5.6 TerraOpenAIالمجال الأقل تقييمًا: الاختبار
الجودة88
الوقت1.6
الغليف16.7
GPT-5.6 LunaOpenAIالمجال الأقل تقييمًا: الأمان
الجودة83
الوقت2
الغليف2.1
Qwen 3.8 Max 0902Alibabaالمجال الأقل تقييمًا: الاختبار
الجودة81
الوقت16.2
الغليف69.1
Kimi K3Moonshot AIالمجال الأقل تقييمًا: الاختبار
الجودة73
الوقت18.2
الغليف97
GLM 5.3Z.aiالمجال الأقل تقييمًا: الأمان
الجودة60
الوقت5.6
الغليف1.5
MiniMax M3MiniMaxالمجال الأقل تقييمًا: الصيانة
الجودة36
الوقت9.8
الغليف3.2
Gryphon SDLC Benchmark
كيف يعمل التقييم
مهمة ضمن سياق مشروع
يعمل كل نموذج عبر محرّك CodeGryphon: يتلقى وصف المهمة والشيفرة والتوثيق، ويستخدم الأدوات المتاحة ويحفظ النتيجة في بيئة العمل. تتكوّن مجموعة التقييم من مشاريع مضبوطة تحاكي العمل الهندسي، مما يتيح مقارنة النماذج على وصف المهمة نفسه والحالة الابتدائية نفسها للمشروع.
تقييم العمل المنجز
بعد التنفيذ نفحص التغييرات والمخرجات. تتحقق الفحوص البرمجية من السلوك والقيود والمتطلبات الإلزامية. ويقيّم حكّام من النماذج، بشكل مستقل، صحة الحل وسلامة القرارات الهندسية وجودة التحقق ووضوح الشرح. تُحجب هوية النموذج وزمن تنفيذه قبل هذا التقييم.
ماذا تعني الجودة في الرسم
يعرض المحور العمودي متوسط التقييم وفق معايير هندسية. لصحة الحل الوزن الأكبر، تليها السلامة والتحقق ووضوح الشرح. المجالات متساوية الوزن. يشير «المجال الأقل تقييمًا» إلى المجال صاحب أدنى تقييم للعمل المنجز مع مراعاة الفحوص الإلزامية. عند التعادل نقارن التقييمات وفق المعايير الهندسية. هذه مقارنة نسبية بين المجالات ضمن نتائج النموذج نفسه.
الجمع بين الوقت واستهلاك الغليف
لكل مهمة نضرب وقت التنفيذ بالدقائق في استهلاك الغليف المسجل، ثم نستخدم وسيط هذه الحواصل لتحديد الموقع الأفقي. هذا ليس حاصل ضرب وسيطين منفصلين. يتيح المقياس اللوغاريتمي مقارنة نطاق واسع من القيم؛ المسافات المتساوية تمثل نسبًا متساوية. يعرض الجدول الوقت والغليف منفصلين. تشمل الحسابات الحلول غير الناجحة وتستبعد التقييم اللاحق.
مهام تغطي دورة حياة تطوير البرمجيات
نغطي دورة حياة تطوير البرمجيات كاملة، من التحليل والتطوير إلى الاختبار والتغييرات الآمنة والتشغيل. توضّح هذه الأمثلة من مجموعة التقييم المطلوب في كل مجال وكيف نتحقق من النتيجة.
التحليل
مثال على المهمة
تحليل حادثة بالاستناد إلى الأدلة ومسارات التتبع: إعادة بناء سلسلة الأسباب وتقدير الخسائر وفصل الاستنتاجات المدعومة عن الفرضيات.
ما نتحقق منه
تستند الاستنتاجات إلى مصادر محددة.
تتوافق الحسابات مع البيانات الأصلية.
تؤخذ التفسيرات البديلة والمخاطر الكامنة في الحسبان.
التطوير
مثال على المهمة
تنفيذ التحويلات في خدمة دفتر حسابات، بما يشمل التحقق من المبالغ والعمليات الذرية والمعالجة الآمنة للطلبات المتكررة والمتزامنة.
ما نتحقق منه
الحفاظ على العقد العام وثوابت الأرصدة.
لا يترك الإخفاق تغييرات جزئية.
تغطية إعادة التنفيذ والتعارضات باختبارات انحدار.
الاختبار
مثال على المهمة
كتابة اختبارات انحدار لذاكرة تخزين مؤقت غير متزامنة للتفويض، وإصلاح العزل وسحب الصلاحيات ومعالجة الطلبات المتزامنة.
ما نتحقق منه
تكشف الاختبارات فئات الأخطاء المحددة.
يجتاز التنفيذ المرجعي الصحيح الاختبارات.
التحقق من الإلغاء وأخطاء التحميل والصلاحيات القديمة.
تحديث ترحيل لقطات الحالة مع الحفاظ على التوافق مع التنسيقات القديمة وسجل العمليات وإعادة تطبيقها.
ما نتحقق منه
الحفاظ على البيانات والبيانات الوصفية.
إعادة الترحيل لا تغيّر النتيجة.
لا تفسد التعارضات والإخفاقات الحالة الأصلية.
التشغيل والحوادث
مثال على المهمة
إعداد خطة قابلة للتنفيذ لاستعادة معالجة الأحداث، اعتمادًا على أدلة الحادثة ودليل التشغيل.
ما نتحقق منه
سلامة ترتيب الإجراءات أثناء المحاكاة.
عدم تخطي الأحداث أو تكرار آثارها.
الحفاظ على الأدلة وشروط الاستعادة.
من نتائج التقييم إلى أوضاع غريفون
نستخدم هذا التقييم لاختيار النماذج لأوضاع غريفون. نراعي طبيعة العمل والجودة والمتطلبات الإلزامية وزمن التنفيذ. يحدد كل وضع مستوى القدرات المطلوب، وقد يتغير اختيار النماذج مع توفر تقييمات جديدة.
Lite
للمهام البسيطة والواضحة: الشروح القصيرة وإعادة صياغة النصوص والتعديلات الصغيرة ذات الحل المباشر.
Balance
للعمل الهندسي اليومي: التطوير وتصحيح الأخطاء والاختبارات والتغييرات عبر ملفات متعددة.
Pro
للمهام عالية الغموض أو ذات عواقب كبيرة عند الخطأ: المعمارية والأمان والترحيلات المعقدة والتزامن.
Auto
يختار مستوى القدرات من معنى الطلب وسياقه، مع مراعاة عمق الاستدلال والنطاق وعدم اليقين والمخاطر.