في عالم يتطور فيه الذكاء الاصطناعي بوتيرة غير مسبوقة، يصبح قياس قدرات النماذج وتقييم أدائها بدقة أمرًا حيويًا. يسعى مؤشر ذكاء التحليل الاصطناعي (AI Index) باستمرار لمواكبة هذه الحدود سريعة التغير، ولهذا السبب نقدم التحديث المؤقت v4.2. هذا الإصدار لا يقربنا من إطلاق الإصدار الخامس المرتقب فحسب، بل يرفع أيضًا معايير التقييم بمهام أكثر تعقيدًا وواقعية، ومجموعات اختبار مصممة خصيصًا لمنع التلاعب بالنتائج.
التحديثات الرئيسية في مؤشر الذكاء الاصطناعي v4.2
تأتي النسخة v4.2 من مؤشر الذكاء الاصطناعي بمجموعة من التغييرات المهمة التي تعزز قدرته على تقييم النماذج في سياقات أكثر عملية. لقد تم تصميم هذه التعديلات لتسريع العمل نحو الإصدار الخامس مع ضمان بقاء المؤشر فعالاً وملائمًا.
- إضافة حقيبة AA (AA-Briefcase): وهو تقييمنا الخاص للعمل المعرفي عبر مجموعة اختبار فريدة.
- إضافة DP.pdf: لتقييم استدلال المستندات ذات السياق الطويل، يغطي 4592 صفحة من ملفات PDF.
- إزالة GPQA Diamond: تم تشبعه حاليًا كتقييم استدلالي علمي استثنائي.
- زيادة الوزن على مجموعات الاختبار المعلقة: لتعزيز المتانة ومنع التلاعب بالنتائج.
- ترقيات البنية التحتية للتقييم: لزيادة الدقة والاستقرار في قياس الأداء.
تهدف هذه التحديثات إلى جعل المؤشر أقرب إلى حالات الاستخدام الواقعية، بمهام أكثر تحديًا وواقعية. لقد قضينا أشهرًا في تخطيط وبناء عناصر المؤشر v5، حيث مرت 8 أشهر منذ إطلاق v4 في يناير. ومع التطور السريع لمجال الذكاء الاصطناعي في الأسابيع الماضية، أصبح تقديم هذا التحديث المؤقت أمرًا ضروريًا للحفاظ على ملاءمة مؤشرنا وفائدته للمستخدمين.
تفاصيل التغييرات في مؤشر الذكاء الاصطناعي v4.2
إضافة حقيبة AA (AA-Briefcase): قياس العمل المعرفي الواقعي
تُعد حقيبة AA تقييمًا داخليًا رائدًا يختبر نماذج الذكاء الاصطناعي في مهام العمل المعرفي الواقعية ضمن مشاريع معقدة صممها خبراء الصناعة. تُقيَّم النماذج في مشاريع عمل معرفية تمتد لعدة أسابيع، وتحتوي كل منها على مهام متعددة مرتبطة بآلاف من ملفات المصدر المدخلة. تجمع حقيبة AA بين قواعد التقييم والتسجيل الثنائي لتقييم نجاح المهمة القابل للتحقق، وجودة التحليل، وجودة العرض التقديمي، مما يوفر نظرة شاملة لقدرة الوكيل الكلية في العمل المعرفي.
إضافة DP.pdf: استدلال احترافي للمستندات طويلة السياق
صممت Surge AI اختبار DP.pdf لتقييم الاستدلال الاحترافي للمستندات في دورة واحدة عبر 100 ملف PDF وعشرة مجالات مختلفة. يجب أن تجمع النماذج الأدلة الموزعة على 4592 صفحة، بما في ذلك النصوص والجداول والرسوم البيانية والهوامش والاستثناءات. تُصنف الإجابات مقابل 1275 معيارًا دقيقًا من تأليف الخبراء؛ ويُنسب معدل النجاح الكلي للمهمة فقط عند استيفاء كل معيار.
زيادة الترجيح لقياس الاستخدام الواقعي ومنع التلاعب
أصبح الآن 40% من وزن المؤشر خاصًا ومحجوزًا لمجموعات اختبار معلقة (held-out test sets) – وهو ضعف الرقم مقارنةً بالإصدار 4.1. تشمل البيانات المحفوظة AA-Briefcase و AA-Omniscience و حلول CritPt. يقلل هذا من قدرة المختبرات على التلاعب بالتقييمات، وستزداد النسبة المئوية الموقوفة بشكل أكبر في المؤشر v5.
تحسين البنية التحتية للتقييم
شهدت بنية التقييم التحتية لدينا تحسينات كبيرة. في AA-LCR v1.1، أضفنا نظام تسجيل سريعًا وصححنا الأخطاء والغموض في مفاتيح الإجابات، مما عزز دقة التسجيل. بالنسبة لـ GDDval-AA v2 وحقيبة AA-Briefcase، قمنا بتحسين عيناتنا وإعادة تثبيت مقياس Elo، مما جعل التقييمات أكثر استقرارًا مع إضافة نماذج جديدة. أما بالنسبة لـ SciCode، فقد قمنا بتحسين قوة صناديق الحماية الخاصة بالتقييم لضمان عدم اعتبار التعليمات البرمجية البطيئة والصحيحة على أنها فاشلة.
النتائج الرئيسية من مؤشر الذكاء الاصطناعي v4.2
- Anthropic و OpenAI يتصدران المؤشر: يتصدر Claude Fable 5.1 من Anthropic المؤشر، يليه GPT-6 Astra من OpenAI، والذي يُظهر زيادة بمقدار 4 نقاط عن GPT-5.6 Sol. يأتي Meta في المركز الثالث، يليه SpaceXAI، و Moonshot/Kimi، و Z.AI، و Google.
- حدود باريتو لتكلفة المهمة المشتركة: تحتل Anthropic و OpenAI و Meta و Z.AI حدود التكلفة المحدثة لكل مهمة.
- هيمنة GPT-6 Astra على حدود رمز الإخراج: يُعد GPT-6 Astra أكثر كفاءة من حيث الرمز المميز (token) تقريبًا من جميع الطرز الأخرى القريبة من حدود الذكاء، مع وجود Claude Fable 5.1 و Grok 4.5 و Gemini 3.5 Flash-Lite على طرفي المنحنى (باستثناء الطرز الأقل من 25 في المؤشر).
- الأداء في AA-Briefcase: يقود Claude Fable 5.1 و Opus 5 من Anthropic هذا التقييم، يليهما GPT-6 Astra و Muse Spark 1.3. يُظهر GPT-6 Astra مكاسب كبيرة أعلى من GPT-5.6 Sol بحوالي 85 نقطة Elo.
- الأداء في DP.pdf: يتصدر OpenAI هذا التقييم بـ GPT-6 Astra (33.2%) و GPT-5.6 Sol (28.2%)، يليه Claude Fable 5.1 بنسبة 26.2%.
إن هذه النتائج تبرز التطور المستمر في قدرات نماذج الذكاء الاصطناعي، وتسلط الضوء على المختبرات الرائدة في هذا المجال. ومع استمرار عمل فريقنا على الإصدار الخامس من المؤشر، نتوقع المزيد من التحديثات والإصدارات الإضافية في المستقبل القريب. تابعونا!
للاطلاع على المزيد من التفاصيل حول مؤشر ذكاء التحليل الاصطناعي v4.2، يرجى زيارة الرابط: https://artificialanalysis.ai/methodology/intelligence-benchmarking