من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

OpenAI”https://openai.com/index/how-confessions-can-keep-language-models-honest/” بيانات-i13n=”cpos:1;pos:1″ rel=”nofollow noopener” الهدف=”_blank” بيانات-ylk=”slk:announced;cpos:1;pos:1;elm:context_link;itc:0;sec:content-canvas”> أعلن واليوم تعمل على إطار عمل من شأنه تدريب نماذج الذكاء الاصطناعي على الاعتراف عندما تنخرط في سلوك غير مرغوب فيه، وهو نهج يسميه الفريق اعترافًا. نظرًا لأن النماذج اللغوية الكبيرة غالبًا ما يتم تدريبها على إنتاج الاستجابة التي تبدو مرغوبة، فقد يصبح من المرجح بشكل متزايد تقديم التملق أو الهلوسة بثقة تامة. يحاول نموذج التدريب الجديد تشجيع الاستجابة الثانوية من النموذج حول ما فعله للوصول إلى الإجابة الرئيسية التي يقدمها. يتم الحكم على الاعترافات فقط على أساس الصدق، على عكس العوامل المتعددة التي تستخدم للحكم على الإجابات الرئيسية، مثل المساعدة والدقة والامتثال. الكتابة الفنية متاحة”https://cdn.openai.com/pdf/6216f8bc-187b-4bbb-8932-ba7c40c5553d/confessions_paper.pdf” بيانات-i13n=”cpos:2;pos:1″ rel=”nofollow noopener” الهدف=”_blank” بيانات-ylk=”slk:here;cpos:2;pos:1;elm:context_link;itc:0;sec:content-canvas”>هنا.

قال الباحثون إن هدفهم هو تشجيع النموذج على أن يكون صريحًا بشأن ما فعله، بما في ذلك الإجراءات التي قد تسبب مشكلات مثل اختراق الاختبار أو وضع أكياس الرمل أو عصيان التعليمات. “If the model honestly admits to hacking a test, sandbagging, or violating instructions, that admission increases its reward rather than decreasing it,” قالت الشركة. سواء كنت من محبي الكاثوليكية، أو من محبي الذكاء الاصطناعي الأكثر شفافية، فإن نظامًا مثل الاعترافات يمكن أن يكون إضافة مفيدة لتدريب LLM.

اقرأ المزيد

الجميع في سياتل يكرهون الذكاء الاصطناعي
يقود الذكاء الاصطناعي الآن اكتشاف المنتجات لملايين الأمريكيين

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل