أصبح مراجعة الكود بالذكاء الاصطناعي جزءًا أساسيًا من تدفقات العمل الحديثة. لكن قياس جودة هذه المراجعات لا يزال صعبًا بسبب تنوع الأنظمة وتفاوت نتائجها. لهذا السبب أطلق فريق ReviewBench معيارًا مفتوحًا يهدف إلى توفير طريقة موثوقة لمقارنة الأدوات المختلفة.
ما هو ReviewBench؟
ReviewBench هو مجموعة اختبار غير متصلة بالإنترنت تم بناؤها على أساس 219 طلب سحب عام من 187 مستودعًا على GitHub، تغطي 19 لغة برمجة. تم اختيار هذه الطلبات لتقليد توزيع حجم وتنوع طلبات السحب الحقيقية على المنصة، مع إيلاء اهتمام خاص للطلبات المتوسطة إلى الكبيرة التي تتطلب مراجعة دقيقة.
كيف يُقيم المعيار الأنظمة؟
يُنشئ المعيار مجموعة ذهبية متعددة المصادر تشمل ملاحظات مراجع بشرية، نماذج لغة كبيرة متقدمة، وأدوات تحليل ثابتة. تُدمج النتائج المتشابهة ثم تُتحقق من صحتها وفق rubric موحد باستخدام Claude Sonnet 5 كحكم. النتيجة هي مجموعة حقائق موثوقة يمكن للأنظمة مقارنتها.
- دقة مُستندة إلى المجموعة الذهبية (Grounded precision)
- استدعاء مُستند إلى المجموعة الذهبية (Grounded recall)
- دقة مُعززة تشمل القضايا الجديدة (Augmented precision)
- استدعاء مُعزز يضيف القضايا غير المتوقعة (Augmented recall)
توفر هذه المقاييس رؤية شاملة: الدقة الأرضية تقيس مدى توافق النظام مع القضايا المعروفة، بينما تسمح الدقة والاستدعاء المعززين بتكريم اكتشافات جديدة لا توجد في المجموعة الذهبية. يمكن للمطورين تعديل وزن الاستدعاء عبر معامل β لتفضيل تغطية أوسع أو تقليل الضجيج حسب احتياجاتهم.
برأينا، سيساعد ReviewBench الفرق التقنية على اختيار أداة مراجعة كود تتماشى مع أولوياتها—سواء كان التركيز على القضايا الأمنية الحرجة أو تحسين القابلية للصيانة. كما يتيح للفرق التي تطور مراجعات مخصصة اختبار نماذجها محليًا قبل نشرها في الإنتاج، مما يقلل من المخاطر ويعزز الثقة.
المصدر: github.blog