من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

TLDR ؛

  • تقدم Google إطارًا جديدًا للتقييم يركز على الأداء الحقيقي لمنظمة العفو الدولية.
  • تعتبر المعايير التقليدية غير كافية للتطبيقات العملية.
  • يؤكد النموذج البيئات الديناميكية وتفاعلات المستخدم.
  • يضع هذا البحث سابقة لنشر الذكاء الاصطناعي في القطاعات الحرجة مثل الرعاية الصحية وخدمة العملاء.

تتخذ Google خطوة مهمة للأمام في الطريقة التي يتم بها تقييم الذكاء الاصطناعي من خلال اقتراح إطار عمل جديد مصمم لاختبار نماذج لغة كبيرة في الظروف الواقعية.

إعادة التفكير في تقييم الذكاء الاصطناعي وراء المختبر

النظام الجديد ، مفصل في أ”https://arxiv.org/abs/2506.13023v1″> ورقة البحث بقيادة إيثان م. رود وفريقه ، يعالج فجوة طويلة الأمد في تطوير الذكاء الاصطناعي. في حين يتم تقييم معظم النماذج الحالية باستخدام المعايير الاصطناعية الثابتة ، فإن هذا الإطار يدفع إلى نهج أكثر واقعية ، مع التركيز على سيناريوهات الاستخدام الفعلي حيث يمكن أن يختلف الأداء بشكل كبير.

وفقًا للباحثين ، غالبًا ما تعطي المقاييس الحالية إحساسًا مضللاً بموثوقية نموذج الذكاء الاصطناعي. قد يؤدي chatbot أداءً رائعًا أثناء عمليات محاكاة المختبر ، ولكنه ينهار عند التفاعل مع المستخدمين في بيئة سريعة الخطى لا يمكن التنبؤ بها مثل خط دعم العملاء. يهدف إطار Google الجديد إلى سد هذه الفجوة من خلال تقديم مجموعات بيانات تمثيلية ، ومقاييس الأداء الأوسع ، ومنهجيات الاختبار المدركة للسياق.

الأداء تحت الضغط مسائل

واحدة من النتائج المركزية هي أن العديد من تقنيات التقييم المستخدمة حاليًا تفشل في حساب تباين الاستخدام الحقيقي. غالبًا ما تتجاهل المعايير التقليدية كيفية استجابة النماذج لمراوغات اللغة الطبيعية ، أو الصياغة الغامضة ، أو التحولات السريعة في السياق ، وكلها شائعة في التطبيقات العملية. يصر الإطار الذي اقترحه Google على تضمين هذه المتغيرات التي لا يمكن التنبؤ بها أثناء الاختبار لتحسين عكس الظروف الفعلية التي قد تواجهها LLM بعد النشر.

يمكن أن يكون هذا التحول تحويليًا بشكل خاص في قطاعات مثل الرعاية الصحية ، حيث يمكن أن تكون الدقة والتفاهم السياقي مسألة حياة وموت. كما أن لها آثار على الصناعات الإبداعية ، حيث يجب أن تفسر النماذج التوليدية المطالبات المفتوحة ولا تزال تفي بتوقعات المستخدم. يجادل الباحثون أنه من خلال محاذاة طرق الاختبار مع الإعدادات التي يتم فيها استخدام الذكاء الاصطناعي بالفعل ، ستصبح النتائج أكثر اتساقًا وجديرة بالثقة.

دفعة أوسع نحو منظمة العفو الدولية القوية

يأتي هذا الإطار بعد أسابيع فقط من تطور كبير آخر من جناح أبحاث الذكاء الاصطناعي من Google. في وقت سابق من هذا الشهر الشركة”https://www.techinasia.com/news/google-develops-ai-model-for-complex-pattern-learning”> تم تقديمه المنطق المنطقي Automata ، نموذج مبتكر يجمع بين الشبكات العصبية والدوائر المنطقية. كان هذا النموذج مصممًا لمحاكاة التعلم المعقد للأنماط ، وكان قادرًا على محاكاة قواعد لعبة الحياة في كونواي مع الاستمرار في الاستقرار حتى في ظل الظروف الصاخبة. تسلط كلتا المبادرتين الضوء على جهد Google الأوسع لتحسين ذكاء أنظمة الذكاء الاصطناعي فحسب ، بل مرونتها وموثوقيتها في الظروف المتقلبة.

مجتمعة ، تعكس هذه المشاريع التزامًا عميقًا بالأداء الحقيقي والاستقرار في الذكاء الاصطناعي. عندما تصبح النماذج أكثر تضمينًا في الأدوات والخدمات اليومية ، أصبح التأكد من أنها يمكن أن تعمل بشكل موثوق خارج البيئات الخاضعة للرقابة أولوية قصوى.

التركيز في العالم الحقيقي ، تأثير العالم الحقيقي

على الرغم من وعدها ، فإن الإطار الجديد لا يخلو من قيود. أحد التحديات المستمرة هو الحفاظ على مجموعات البيانات ذات الصلة مع تطور اللغة وتوقعات المستخدم والسلوكيات الرقمية. يعترف الفريق بأن الإطار سيتطلب تحديثات مستمرة للحفاظ على فعاليته.

ومع ذلك ، فإن هذا آخر دفعة من قبل”https://coincentral.com/google-reportedly-cuts-ties-with-scale-ai-amid-metas-growing-influence/”> جوجل يضع سابقة قوية لتقييم الذكاء الاصطناعي الأكثر مسؤولية وذات مغزى. مع استمرار النضج المجال ، يتحول التركيز من التميز النظري إلى الأداء العملي ، وهو تحول يمكن أن يعيد تعريف كيفية تطوير الجيل القادم من الذكاء الاصطناعي واختباره وموثوق به.

اقرأ المزيد

طراز Google Gemini من Flash-Lite 2.5 من Google قد خرج الآن
يأخذ الفهود بينيت كون سميث كأس

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل