في خطوة نوعية تعزز مكانة الذكاء الاصطناعي في مجالات تطوير البرمجيات، أعلنت شركة Cognition عن إنجاز لافت لنموذجها SWE-2. فقد حقق هذا النموذج المتطور نسبة 92.8% على معيار Terminal-Bench 2.1، مسجلاً بذلك رقماً قياسياً يعكس قفزة هائلة في قدرات نماذج تعلم الآلة المخصصة للمطورين. يأتي هذا الأداء المبهر ليؤكد التزام Cognition بدفع حدود الابتكار وتقديم حلول تتسم بالكفاءة والفعالية.
تقنية SWE-2: قفزة عملاقة في عالم الذكاء الاصطناعي للمطورين
يعتمد نموذج SWE-2 على بنية ضخمة تتضمن إجمالي 2.8 تريليون معلمة، مع 104 مليار معلمة نشطة لكل رمز مميز (MoE)، مما يجعله أحد أكثر النماذج كفاءة في استغلال الموارد. تم بناء SWE-2 على أساس Kimi K3، مع تدريب لاحق من Cognition، ويمثل المرة الأولى التي تقوم فيها Cognition بتوسيع نطاق التعلم المعزز (RL) إلى نظام يتجاوز تريليونات المعلمات. كان الأساس قوياً بالفعل في التعلم المعزز لتشفير الوكلاء، وقد أضافت جهود Cognition من 5 إلى 6 نقاط إضافية في معظم المعايير، مما يعزز قدراته بشكل كبير.
- كومة الخدمات المتقدمة: يعتمد النموذج على استدلال خبراء المزيج (MoE) باستخدام نوى NVFP4 وFP8، مع تدريب يراعي عملية التكميم. يحمل FP8 حسابات K وQ وV والنتائج في طبقات MLA. بالإضافة إلى ذلك، يوفر نموذج المسودة المعاد تدريبه باستخدام SpecForge أطوال قبول أطول بنسبة 15%، بينما يساهم تأخير التعبئة المسبقة في زيادة الرموز المميزة لكل وحدة معالجة رسومات والرموز المميزة لكل طلب بنسبة تتراوح بين 10% إلى 20%.
- مستويات الجهد والكفاءة: يظهر SWE-2 كفاءة ملحوظة مقارنة بسابقه SWE-1.7. فمتوسط عدد الخطوات لكل تشغيل هو 53 (متوسط)، 80 (مرتفع)، 98 (أقصى)، مقابل 127 لـ SWE-1.7. يحقق SWE-2 أداءً أعلى في FrontierCode مع دورات أقل بنسبة 58% وتكلفة متوسطة أقل بنسبة 81%، مما يمثل تعديله الحقيقي الأول عند متوسط الخطوة 18 (مقارنة بـ 48 لـ SWE-1.7).
SWE-2 في مواجهة عمالقة الذكاء الاصطناعي: أرقام الأداء والمعايير
وفقًا لتقارير Cognition الذاتية، تبرز أرقام الأداء لـ SWE-2 بشكل واضح: 50.0 على FrontierCode 1.1 Main، و73.0 على DeepSWE 1.1، و92.8 على Terminal-Bench 2.1، و27.3 على Terminal-Bench 4.0. ويضع هذا الأداء SWE-2 في منافسة قوية مع النماذج الرائدة الأخرى.
على صعيد FrontierCode، يأتي SWE-2 بفارق نقطة واحدة فقط خلف Claude Fable 5.1 (50.9) و3.3 نقطة خلف GPT-6 Astra (53.3)، ولكنه يتفوق عليهما بشكل كبير من حيث التكلفة، حيث يعد أرخص بنسبة 64% من Fable 5.1 وربع تكلفة Astra. ويُعد رقم 92.8 على Terminal-Bench 2.1 هو الأعلى في الجدول المنشور. ومع ذلك، تبقى هناك نقطة تحتاج إلى تطوير وهي Terminal-Bench 4.0، حيث يتأخر SWE-2 بنتيجة 27.3 عن Fable 5.1 (55.8) وGPT-6 Astra (57.9) بفارق كبير، مما يشير إلى أن العمل الوكيل طويل الأمد لا يزال يمثل فجوة بين SWE-2 والنماذج المتطورة.
التوفر والوصول إلى SWE-2: سياسة Cognition
تتبع Cognition سياسة خاصة فيما يتعلق بتوزيع SWE-2؛ إذ لم تنشر الأوزان الخاصة بالنموذج، مما يعني عدم توفره للتحميل أو التشغيل المحلي. يتوفر النموذج حالياً ضمن Devin Desktop وCLI، ومن المقرر طرحه قريباً على Devin Web وFusion. تجدر الإشارة إلى أن Cognition لا تقدم واجهة برمجة تطبيقات (API) لكل رمز مميز لـ SWE-2، وبالتالي فإن مقارنات التكلفة لكل مهمة (مثل كونه أرخص بنسبة 64% من Fable 5.1 عند تكافؤ FrontierCode) تمثل تسعير الخدمات، وليس بطاقة أسعار تعتمد على الدولار لكل مليون رمز. جميع الأرقام المذكورة هي أرقام أعلنتها Cognition، وتنتظر التحقق المستقل.
لمحة عن SWE-2: البيانات الأساسية
- المعلمات: 2800.0 مليار
- الترخيص: ملكية خاصة
- المطور: Cognition
- الأصل: الولايات المتحدة الأمريكية
- تاريخ الإطلاق المستهدف: سبتمبر 2026
يمثل نموذج SWE-2 من Cognition إنجازًا تقنياً مهماً يمهد الطريق لجيل جديد من أدوات تطوير الذكاء الاصطناعي الأكثر كفاءة وفعالية من حيث التكلفة. وبينما لا تزال هناك مجالات للتطوير، خاصة في مهام الوكيل طويلة الأمد، فإن الإنجازات التي حققها النموذج على معايير مثل Terminal-Bench 2.1 وكفاءته الاقتصادية تجعله لاعباً رئيسياً يستحق المتابعة في المشهد التكنولوجي المتطور.