كيف نختار النماذج لغريفون

يقيّم Gryphon SDLC Benchmark النماذج في مهام هندسية تغطي دورة حياة تطوير البرمجيات. يقارن المخطط الجودة بمزيج وقت التنفيذ واستهلاك الغليف، ويعرض الجدول كل مؤشر على حدة. نستخدم النتائج لاختيار نماذج أوضاع Gryphon.

تاريخ التقييم:

الجودة والاستهلاك المشترك للموارد

الأعلى يعني جودة أفضل. الاتجاه إلى اليسار يعني حاصل ضرب أقل للوقت والغليف. مرّر المؤشر فوق نقطة أو اضغط عليها لعرض النموذج ومؤشراته.

المنهجية
الجودة · 0–100 · الأعلى أفضل
الجودة والاستهلاك المشترك للمواردجميع النماذج في مخطط واحد. المحور العمودي يعرض الجودة. الأفقي يعرض وسيط حاصل ضرب وقت المهمة بالدقائق في استهلاك الغليف، بمقياس لوغاريتمي. جميع العلامات متساوية الحجم، ويحدد اللون والشكل الشركة المطورة.0204060801000.11101001,00010,000
الوقت × الغليف · دقيقة · غليف · الأقل أفضل

الوسيط · مقياس لوغاريتمي

الشركات المطورة

  • OpenAI
  • Anthropic
  • Google
  • xAI
  • Meta
  • DeepSeek
  • Alibaba
  • Moonshot AI
  • Z.ai
  • MiniMax

الجودة مؤشر مقرب وفق معايير هندسية. يشير «المجال الأقل تقييمًا» إلى المجال صاحب أدنى تقييم للعمل المنجز لدى النموذج، مع مراعاة الفحوص الإلزامية. عند التعادل نستخدم التقييم وفق المعايير الهندسية.

نضرب وقت التنفيذ بالدقائق في استهلاك الغليف المسجل لكل مهمة، ثم نحسب الوسيط. المسافات الأفقية المتساوية تمثل نسبًا متساوية. قد تعني القيمة الأقل تنفيذًا أسرع أو استهلاكًا أقل أو كليهما؛ يعرض الجدول الوسيطين منفصلين.

الوقت والغليف في الجدول وسيطان مستقلان لمجموعة المهام نفسها، بما فيها الحلول غير الناجحة، دون التقييم اللاحق. القيم مقربة إلى منزلة عشرية واحدة.

جميع النماذج: الجودة والوقت والغليف

اضغط على عنوان عمود لتغيير ترتيب النماذج.

جميع النماذج: الجودة والوقت والغليف
النموذج
GPT-6 AstraOpenAIالمجال الأقل تقييمًا: الاختبارالجودة97الوقت4.5الغليف112.6
Grok 4.6xAIالمجال الأقل تقييمًا: التطويرالجودة97الوقت6.7الغليف32.8
DeepSeek V4 Pro 0813DeepSeekالمجال الأقل تقييمًا: الاختبارالجودة96الوقت9.5الغليف13.8
GPT-5.6 SolOpenAIالمجال الأقل تقييمًا: الأمانالجودة96الوقت2.6الغليف16.4
Muse Spark 1.3Metaالمجال الأقل تقييمًا: الاختبارالجودة96الوقت2.8الغليف25.7
Claude Opus 5Anthropicالمجال الأقل تقييمًا: الأمانالجودة95الوقت8.5الغليف190.8
Claude Fable 5.1Anthropicالمجال الأقل تقييمًا: الأمانالجودة94الوقت6.7الغليف223
Gemini 3.8 FlashGoogleالمجال الأقل تقييمًا: التطويرالجودة94الوقت4الغليف44.1
Claude Sonnet 5Anthropicالمجال الأقل تقييمًا: الاختبارالجودة88الوقت9.1الغليف99
GPT-5.6 TerraOpenAIالمجال الأقل تقييمًا: الاختبارالجودة88الوقت1.6الغليف16.7
GPT-5.6 LunaOpenAIالمجال الأقل تقييمًا: الأمانالجودة83الوقت2الغليف2.1
Qwen 3.8 Max 0902Alibabaالمجال الأقل تقييمًا: الاختبارالجودة81الوقت16.2الغليف69.1
Kimi K3Moonshot AIالمجال الأقل تقييمًا: الاختبارالجودة73الوقت18.2الغليف97
GLM 5.3Z.aiالمجال الأقل تقييمًا: الأمانالجودة60الوقت5.6الغليف1.5
MiniMax M3MiniMaxالمجال الأقل تقييمًا: الصيانةالجودة36الوقت9.8الغليف3.2
Gryphon SDLC Benchmark

كيف يعمل التقييم

مهمة ضمن سياق مشروع

يعمل كل نموذج عبر محرّك CodeGryphon: يتلقى وصف المهمة والشيفرة والتوثيق، ويستخدم الأدوات المتاحة ويحفظ النتيجة في بيئة العمل. تتكوّن مجموعة التقييم من مشاريع مضبوطة تحاكي العمل الهندسي، مما يتيح مقارنة النماذج على وصف المهمة نفسه والحالة الابتدائية نفسها للمشروع.

تقييم العمل المنجز

بعد التنفيذ نفحص التغييرات والمخرجات. تتحقق الفحوص البرمجية من السلوك والقيود والمتطلبات الإلزامية. ويقيّم حكّام من النماذج، بشكل مستقل، صحة الحل وسلامة القرارات الهندسية وجودة التحقق ووضوح الشرح. تُحجب هوية النموذج وزمن تنفيذه قبل هذا التقييم.

ماذا تعني الجودة في الرسم

يعرض المحور العمودي متوسط التقييم وفق معايير هندسية. لصحة الحل الوزن الأكبر، تليها السلامة والتحقق ووضوح الشرح. المجالات متساوية الوزن. يشير «المجال الأقل تقييمًا» إلى المجال صاحب أدنى تقييم للعمل المنجز مع مراعاة الفحوص الإلزامية. عند التعادل نقارن التقييمات وفق المعايير الهندسية. هذه مقارنة نسبية بين المجالات ضمن نتائج النموذج نفسه.

الجمع بين الوقت واستهلاك الغليف

لكل مهمة نضرب وقت التنفيذ بالدقائق في استهلاك الغليف المسجل، ثم نستخدم وسيط هذه الحواصل لتحديد الموقع الأفقي. هذا ليس حاصل ضرب وسيطين منفصلين. يتيح المقياس اللوغاريتمي مقارنة نطاق واسع من القيم؛ المسافات المتساوية تمثل نسبًا متساوية. يعرض الجدول الوقت والغليف منفصلين. تشمل الحسابات الحلول غير الناجحة وتستبعد التقييم اللاحق.

مهام تغطي دورة حياة تطوير البرمجيات

نغطي دورة حياة تطوير البرمجيات كاملة، من التحليل والتطوير إلى الاختبار والتغييرات الآمنة والتشغيل. توضّح هذه الأمثلة من مجموعة التقييم المطلوب في كل مجال وكيف نتحقق من النتيجة.

التحليل

مثال على المهمة

تحليل حادثة بالاستناد إلى الأدلة ومسارات التتبع: إعادة بناء سلسلة الأسباب وتقدير الخسائر وفصل الاستنتاجات المدعومة عن الفرضيات.

ما نتحقق منه
  • تستند الاستنتاجات إلى مصادر محددة.
  • تتوافق الحسابات مع البيانات الأصلية.
  • تؤخذ التفسيرات البديلة والمخاطر الكامنة في الحسبان.

التطوير

مثال على المهمة

تنفيذ التحويلات في خدمة دفتر حسابات، بما يشمل التحقق من المبالغ والعمليات الذرية والمعالجة الآمنة للطلبات المتكررة والمتزامنة.

ما نتحقق منه
  • الحفاظ على العقد العام وثوابت الأرصدة.
  • لا يترك الإخفاق تغييرات جزئية.
  • تغطية إعادة التنفيذ والتعارضات باختبارات انحدار.

الاختبار

مثال على المهمة

كتابة اختبارات انحدار لذاكرة تخزين مؤقت غير متزامنة للتفويض، وإصلاح العزل وسحب الصلاحيات ومعالجة الطلبات المتزامنة.

ما نتحقق منه
  • تكشف الاختبارات فئات الأخطاء المحددة.
  • يجتاز التنفيذ المرجعي الصحيح الاختبارات.
  • التحقق من الإلغاء وأخطاء التحميل والصلاحيات القديمة.

الأمان

مثال على المهمة

تأمين تنزيل الأرشيفات الموقّعة: ربط الإذن بالمؤسسة والمحتوى ورفض المسارات الخطرة وفرض حدود لفك الضغط.

ما نتحقق منه
  • لا يمكن تجاوز التوقيع أو حدود الوصول.
  • رفض المسارات الخطرة وتعارضات الأسماء.
  • استمرار عمل التنزيلات المشروعة.

الصيانة

مثال على المهمة

تحديث ترحيل لقطات الحالة مع الحفاظ على التوافق مع التنسيقات القديمة وسجل العمليات وإعادة تطبيقها.

ما نتحقق منه
  • الحفاظ على البيانات والبيانات الوصفية.
  • إعادة الترحيل لا تغيّر النتيجة.
  • لا تفسد التعارضات والإخفاقات الحالة الأصلية.

التشغيل والحوادث

مثال على المهمة

إعداد خطة قابلة للتنفيذ لاستعادة معالجة الأحداث، اعتمادًا على أدلة الحادثة ودليل التشغيل.

ما نتحقق منه
  • سلامة ترتيب الإجراءات أثناء المحاكاة.
  • عدم تخطي الأحداث أو تكرار آثارها.
  • الحفاظ على الأدلة وشروط الاستعادة.

من نتائج التقييم إلى أوضاع غريفون

نستخدم هذا التقييم لاختيار النماذج لأوضاع غريفون. نراعي طبيعة العمل والجودة والمتطلبات الإلزامية وزمن التنفيذ. يحدد كل وضع مستوى القدرات المطلوب، وقد يتغير اختيار النماذج مع توفر تقييمات جديدة.

Lite

للمهام البسيطة والواضحة: الشروح القصيرة وإعادة صياغة النصوص والتعديلات الصغيرة ذات الحل المباشر.

Balance

للعمل الهندسي اليومي: التطوير وتصحيح الأخطاء والاختبارات والتغييرات عبر ملفات متعددة.

Pro

للمهام عالية الغموض أو ذات عواقب كبيرة عند الخطأ: المعمارية والأمان والترحيلات المعقدة والتزامن.

Auto

يختار مستوى القدرات من معنى الطلب وسياقه، مع مراعاة عمق الاستدلال والنطاق وعدم اليقين والمخاطر.