من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

تُعد مراجعة التعليمات البرمجية، خاصة تلك التي تتجاوز التغييرات السطحية، من أصعب المهام وأكثرها تعقيدًا في دورة حياة تطوير البرمجيات. فالتغيير الذي يبدو صحيحًا بمعزل عن غيره قد يتسبب في تعطيل أجزاء أخرى من النظام، مما يجعل الكشف عن الأخطاء الخفية تحديًا كبيرًا.

في هذا السياق، تأتي النتائج الأولية لـ OpenAI’s GPT-6 Astra لتثير اهتمامًا بالغًا. في تقييمنا، تمكنت Astra من اكتشاف ما يقرب من 4% إضافية من الأخطاء المصنفة القابلة للتنفيذ مقارنة بـ GPT-5.6 Sol، و22% إضافية مقارنة بـ Opus 5.

تتجلى القفزة الأكبر في المراجعات الأكثر صعوبة عبر الملفات المتعددة، حيث حققت Astra مكاسب بنسبة 20% على Sol و 33% على Opus 5. يمثل تطبيق هذه الإمكانات على مستوى العميل أيضًا حماية لبيانات العملاء وتقييمًا دقيقًا لتسعير واجهة برمجة التطبيقات (API) العامة للنموذج.

ما أضافته Astra لمراجعة الكود

يعتمد مقياسنا الأساسي هنا على تغطية الأخطاء القابلة للتنفيذ، والذي يشير إلى عدد الأخطاء المصنفة التي يتمكن النموذج من التقاطها وتقديمها بنتائج يمكن للمطورين اتخاذ إجراءات بشأنها.

قد تبدو المكاسب الإجمالية مقارنة بـ GPT-5.6 Sol متواضعة في هذا المقياس الأولي للتقييم، إذ يشمل هذا التقييم مراجعات أبسط حيث قد يكون هناك مجال أقل لنموذج أقوى ليُظهر تميزه. ومع ذلك، تظهر ميزة Astra الأكبر بوضوح في المجموعة الفرعية الأكثر صعوبة من المراجعات المتضمنة لملفات متقاطعة، وهي نتيجة أولية وواعدة.

تعد المقارنة في السيناريوهات الأكثر تعقيدًا بين الملفات المتعددة أكثر إقناعًا. تنمو الميزة النسبية لـ Astra لتصل إلى 20% على Sol و 33% على Opus 5. وهذا يؤكد على قيمة ربط نية التغيير بالعواقب الموزعة عبر قاعدة التعليمات البرمجية.

تصف هذه النتائج جانبًا واحدًا فقط من أداء المراجعة. فهي لا تقدم تصنيفًا شاملاً لجودة المراجعة الكلية، ولا تتنبأ بمعدل عيوب الفريق، ولا تعد بنفس المكاسب في كل طلب سحب.

وضع السياق في العمل

توفر نافذة السياق الكبيرة مساحة واسعة للمعلومات. ولكن لكي يكون الاستدلال مفيدًا، يتطلب الأمر من النموذج تحديد الأجزاء المهمة، وربطها، والتوصل إلى نتيجة مدعومة بالأدلة.

تفسيرنا هو أن التقدم الأكثر إثارة للاهتمام الذي حققته Astra يكمن في قدرتها على ربط المعلومات الصحيحة. تشير مكاسبها الأكبر في المراجعات الأكثر صعوبة للملفات إلى تقدم في التعامل مع المهام التي تتطلب توزيع المعلومات ذات الصلة. لا يعزل هذا التفسير سبب هذا التقدم أو يثبت أن مجرد توفير سياق أكبر يؤدي وحده إلى تحسين أداء النموذج.

تضع OpenAI نموذج Astra في موقع يمكّنه من أداء عمل متعدد الخطوات عبر التعليمات البرمجية والمتصفحات والبرامج الاحترافية.

بالنسبة للفرق التي تعتمد على النماذج الذكية، يبرز سؤال مهم: ما هي المهام التي تستدعي هذا المنطق الإضافي لتبرير تكلفته؟ المهمة الصعبة ذات الأدلة المتناثرة هي مرشح أقوى للتحقيق من المهمة الروتينية التي يتعامل معها نموذج أقل تكلفة بشكل موثوق. هذا لا يعني تحويل كل جلسة إلى Astra لزيادة جهد التفكير إلى الحد الأقصى.

التفكير الأقوى يأتي بسعر أعلى

تبلغ أسعار واجهة برمجة التطبيقات القياسية لـ Astra 10 دولارات لكل مليون رمز إدخال و50 دولارًا لكل مليون رمز إخراج، وفقًا للأسعار المنشورة. يتمتع نموذج Fable 5.1 بنفس معدلات الإدخال والإخراج الأساسية، على الرغم من اختلاف أسعار التخزين المؤقت.

لوضع هذه الأسعار في سياقها، يمكننا تخيل مهمة توضيحية تستخدم 100,000 رمز إدخال غير مخزن مؤقتًا و10,000 رمز إخراج قابل للفوترة، بما في ذلك الرموز المميزة للاستدلال. إن الحفاظ على ثبات استخدام الرمز المميز يسهل مقارنة الأسعار المنشورة، مع الأخذ في الاعتبار أن التكاليف الفعلية للمهام تختلف باختلاف الاستخدام.

في هذا الاستخدام الثابت، تبلغ تكاليف Astra 2.5 مرة مقارنة بـ Sol، وحوالي 4.7 مرة مقارنة بـ Terra، وحوالي 47 مرة مقارنة بـ Luna. هذه فروق أسعار كبيرة وذات مغزى. لكن هذه الأرقام لا تتنبأ بالفرق في التكلفة لكل مهمة مكتملة؛ فالنموذج الذي يحتاج إلى عدد أقل من الرموز المميزة أو عدد أقل من المحاولات يمكن أن يقلل الفجوة في التكلفة الإجمالية.

أفادت OpenAI عن انخفاض في تكاليف المهام المقدرة لـ Astra في بعض تقييماتها الخاصة، على الرغم من ارتفاع أسعار الرموز المميزة. وهذا يؤكد أن التكلفة الإجمالية لكل نتيجة ناجحة تستحق القياس على عملك الخاص، بدلاً من افتراض أن سعر الرمز المميز أو درجة القدرة وحدها تحدد القرار.

ما قد ينتقل إلى ما هو أبعد من مراجعة التعليمات البرمجية

يكمن المفهوم القابل للتحويل في قدرة Astra على التفكير في العلاقات المعقدة بين مصادر منفصلة للمعلومات. تشير النتائج التي توصلنا إليها إلى عدة استخدامات محتملة تستحق التقييم، علمًا بأننا لم نقم بقياس أداء Astra في هذه المهام بعد:

  • توليف البحث: التوفيق بين التقارير المتعارضة، وربط الادعاءات بأدلتها، وتحديد الثغرات التي قد تغفلها ملخصات الوثائق الفردية.
  • التحقيق التشغيلي: تجميع تفسير متماسك من السجلات وملاحظات الحوادث وكتيبات التشغيل، مع فصل الملاحظات عن الفرضيات.
  • المتطلبات وتحليل السياسات: تتبع التغيير المقترح عبر المواصفات والسياسات الداخلية وخطط التنفيذ لتحديد التناقضات لمراجعة الخبراء.
  • عمل المستندات وجداول البيانات: التحقق مما إذا كانت الافتراضات والصيغ والاستنتاجات السردية متفقة عبر التقرير والمواد الداعمة له.

تتشارك هذه التطبيقات في بنية مشتركة تتمثل في وجود أدلة متناثرة مع وجود تبعيات بين أجزائها. لبدء التقييم، ابدأ بالعمل المحدد الذي يمكن التحقق من إجابته. أسهل طريقة لاختبار ما إذا كان Astra مناسبًا لسير العمل أو المنتجات الخاصة بك هي تشغيله جنبًا إلى جنب مع النموذج الحالي الخاص بك على نفس المهام، ثم مقارنة جودة الإجابة ووقت التحقق والتكلفة الإجمالية.

بناء وموازنة Nightshift

استخدمنا أيضًا Astra في بناء لعبة كاملة: Nightshift، وهي لعبة تقمص أدوار تم تطويرها باستخدام Godot و GDScript. كانت أصعب المشكلات التي واجهناها هي تحقيق التوازن بين التفاعلات المعقدة بين الأنظمة، ثم إعادة ضبط هذا التوازن مع تطور اللعبة.

هذا يعني التفكير في سبع فئات من الشخصيات، وشجرة مهارات سلبية مكونة من 988 عقدة (مستوحاة من شجرة العقدة السلبية الأسطورية في Path of Exile)، ومهارات نشطة، ورونية، وترقيات قابلة للتوصيل، وتطورات للمهارات، وعمل تعاوني. عبر 40 منطقة في 10 أعمال، تقدم الحملة مجموعات أعداء متزايدة التعقيد. يمكن لتغيير فئة واحدة أن يغير الترقيات المفيدة، وكيفية تطور المهارة، وما يمكن للفريق التعامل معه.

لقد أجرينا تغييرات جوهرية على الأنظمة الأساسية أثناء التطوير وطلبنا من Astra التعامل مع العواقب وإعادة توازنها. يُعد التوازن في لعبة كهذه التحدي الإبداعي الأكثر صعوبة لتحقيق أسلوب لعب مقنع. كيف يمكنك إجراء تغييرات شاملة أو تقديم أنظمة وآليات لعب جديدة تمامًا مع الحفاظ على تماسك التقدم والقتال والصعوبة؟

أردنا أيضًا أن يكتشف اللاعبون تصميمات قوية للمراحل النهائية من خلال مجموعات ذكية من الفئات والإحصائيات والعناصر والعناصر السلبية والمهارات النشطة. كان التحدي يتمثل في صياغة تقدم حيث كان الوصول إلى منتصف اللعبة غير مؤكد، ولكن الإبداع والتجريب يمكن أن يؤتيا ثمارهما بطرق مذهلة. كانت مكافأة العثور على هذه المجموعات هي بناء يمكن أن يذيب أسراب العدو بشكل مرضٍ.

كانت هذه العملية تعني العودة إلى اللعبة بين الأعمال الأخرى، وتقديم ملاحظات إلى Astra، ومنحها الاستقلالية الكاملة لاستخدام حكمها في تحسين هذا التوازن. قامت Astra أيضًا ببناء دعم أصلي لوحدات تحكم PS5 وXbox، وبنيات macOS الأصلية، والويب، وLinux، واللعب التعاوني. كانت اللعبة التعاونية مثيرة للاهتمام بشكل خاص، لأن Astra كانت قادرة على بنائها للعب على نفس الحساب والشبكة المحلية (LAN)، الأمر الذي، نظرًا لرغبتنا في توزيعها على زملاء العمل الذين يستخدمون نظام التشغيل macOS، تطلب إنشاء مشروع Xcode جديد وحساب App Store Connect وإنشاء شهادات واستحقاقات متعددة والتوثيق.

تعاملت Astra مع كل شيء بشكل مستقل، ولم تتوقف إلا من حين لآخر لتطلب السلطة والأذونات التي لم تكن تمتلكها بالفعل. كمكافأة ممتعة، تم تصميم اللعبة أيضًا ليكون العملاء أنفسهم لاعبين، وهو أمر سريالي نوعًا ما أن تكون قادرًا على لعب جلسات تعاونية مباشرة مع Astra كزميل في الفريق. وجد الكثير منا صعوبة في التوقف عنها، وأصبح تفسير “أنا أعمل على تقييمات النموذج” عذرًا مفيدًا لفتح مباراة عندما كان المدير متوقفًا.

أعطتنا اللعبة إعدادًا إبداعيًا لاستكشاف نفس الإمكانات التي برزت في مراجعة التعليمات البرمجية. كان على Astra أن تفكر في كيفية تأثير كل تغيير على بقية النظام.

ما نريد أن نراه بعد ذلك

التقدم المثير التالي سيجعل هذا العمق في التفكير موثوقًا بدرجة كافية لاستخدامه في كثير من الأحيان. وهذا يعني تحقيق مكاسب متسقة من العمل الصعب، واستنتاجات يمكن للأشخاص التحقق منها بسهولة، وخفض التكلفة الإجمالية لتحقيق نتيجة ناجحة.

ويتطلب ذلك اختيارًا أفضل للسياق ذي الصلة، وأدلة داعمة أكثر وضوحًا، وتقليل الخطوات غير الضرورية. ويعني ذلك أيضًا مسارات النشر التي تحافظ على الخصوصية، مما يجعل الإمكانيات المتقدمة قابلة للاستخدام بموجب التزامات حقيقية للعملاء.

تقدم لنا Astra إشارة مشجعة بشأن التفكير المنطقي المتبادل. وتكمن الفرصة العملية في تحويل تلك القدرة إلى عمل أكثر فائدة وأسهل للثقة. وكما هو الحال مع جلب أي نموذج جديد عبر الإنترنت على CodeRabbit، فإن التقييم هو جزء واحد من هذا القرار.

حماية بيانات العملاء

لا تقوم CodeRabbit ولا موفرو النماذج لدينا بتدريب نماذج الذكاء الاصطناعي على التعليمات البرمجية الخاصة بعملاء CodeRabbit أو المعلومات الشخصية التي تم جمعها أثناء مراجعات التعليمات البرمجية الخاصة. يُرجى قراءة سياسة الخصوصية الخاصة بنا لمزيد من التفاصيل.

لدى OpenAI وAnthropic سياسات مختلفة للاحتفاظ بالبيانات:

  • OpenAI: يدعم GPT-6 Astra عدم الاحتفاظ بالبيانات (ZDR) لعملاء واجهة برمجة التطبيقات (API) المؤهلين. تصف عناصر التحكم في بيانات واجهة برمجة التطبيقات الخاصة بـ OpenAI أهلية ZDR والإمكانيات المدعومة في إعلان Astra وضوابط بيانات OpenAI.
  • Anthropic: يتطلب Fable الاحتفاظ بالبيانات لمدة 30 يومًا افتراضيًا لمراقبة السلامة، ولكن يمكن للعملاء المؤهلين استخدام Fable 5 و5.1 مع ZDR عند تقديم ضمانات Enterprise Frontier. بالنسبة للمنتجات التي تخدم أنشطة تجارية أخرى، يتطلب هذا الخيار شروطًا متفق عليها مع Anthropic. تم تصميم EFS للاحتفاظ ببيانات النشاط المحتجزة في البنية التحتية التي يتحكم فيها العميل. يمكن الاطلاع على سياسة الاحتفاظ بالنموذج المغطى، وضمانات حدود المؤسسة، وتفاصيل الأهلية.

يجب أن يفي أي نموذج نستخدمه لمراجعات العملاء بمتطلبات حماية البيانات الصارمة لدينا.

مراجعة حصرية: مجموعة BLACKPINK x Razer – ألعاب بلمسة وردية متألقة
مؤشر ذكاء التحليل الاصطناعي v4.2: الارتقاء بتقييمات الذكاء الاصطناعي نحو الواقعية

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل