Gemini 3 هو أحدث طراز للذكاء الاصطناعي من Google
VCG عبر Getty Images
حققت أحدث برامج الدردشة الآلية من Google، Gemini 3، قفزات كبيرة في مجموعة من المعايير المصممة لقياس تقدم الذكاء الاصطناعي، وفقًا للشركة. قد تكون هذه الإنجازات كافية لتهدئة المخاوف من حدوث”http://www.newscientist.com/article/2499738-the-ai-bubble-is-heading-towards-a-burst-but-it-wont-be-the-end-of-ai/”> فقاعة الذكاء الاصطناعي وهي تنفجر في الوقت الحالي، ولكن من غير الواضح مدى جودة ترجمة هذه النتائج إلى قدرات العالم الحقيقي.
ما هو أكثر من ذلك،”http://www.newscientist.com/article/2479545-ai-hallucinations-are-getting-worse-and-theyre-here-to-stay/”> استمرار عدم الدقة في الحقائق والهلوسة التي أصبحت سمة مميزة لجميع نماذج اللغات الكبيرة لا تظهر أي علامات على تسويتها، الأمر الذي قد يمثل مشكلة لأي استخدامات تكون فيها الموثوقية أمرًا حيويًا.
في مشاركة مدونة عند الإعلان عن النموذج الجديد، كتب رؤساء جوجل، ساندر بيتشاي، وديميس هاسابيس، وكوراي كافوكوغلو، أن Gemini 3 لديه “استدلال على مستوى الدكتوراه”، وهي عبارة استخدمها منافس OpenAI أيضًا عندما أعلن عن نموذجه الجديد.”http://www.newscientist.com/article/2492232-gpt-5s-modest-gains-suggest-ai-progress-is-slowing-down/”> نموذج جي بي تي-5. وكدليل على ذلك، فقد أدرجوا درجات في العديد من الاختبارات المصممة لاختبار المعرفة “على مستوى الدراسات العليا”، مثل الاختبار الأخير للإنسانية، وهو عبارة عن مجموعة من 2500 سؤال على مستوى البحث من الرياضيات والعلوم والعلوم الإنسانية. حصل Gemini 3 على 37.5% في هذا الاختبار، متفوقًا على صاحب الرقم القياسي السابق، وهو نسخة من GPT-5 من OpenAI، والتي سجلت 26.5%.
ويقول إن مثل هذه القفزات يمكن أن تشير إلى أن النموذج أصبح أكثر قدرة في بعض النواحي”https://www.oii.ox.ac.uk/people/profiles/luc-rocher/”> لوك روشيه في جامعة أكسفورد، ولكن علينا أن نكون حذرين بشأن كيفية تفسير هذه النتائج. “إذا ارتفعت نسبة النموذج من 80 في المائة إلى 90 في المائة على أساس معياري، فماذا يعني ذلك؟ هل يعني أن النموذج كان بمستوى دكتوراه بنسبة 80 في المائة، والآن أصبح مستوى دكتوراه بنسبة 90 في المائة؟ أعتقد أنه من الصعب جدًا فهمه”. “لا يوجد رقم يمكننا تحديد ما إذا كان نموذج الذكاء الاصطناعي لديه منطق، لأن هذه فكرة ذاتية للغاية.”
تحتوي الاختبارات المعيارية على العديد من القيود، مثل طلب إجابة واحدة أو إجابات متعددة الاختيارات والتي لا تحتاج النماذج إلى إظهار عملها. “من السهل جدًا استخدام أسئلة الاختيار من متعدد للتقييم [the models]يقول روشيه، “لكن إذا ذهبت إلى طبيب، فلن يقيمك الطبيب باختيار متعدد. إذا سألت محاميًا، فلن يقدم لك المحامي نصيحة قانونية بإجابات متعددة الاختيارات. هناك أيضًا خطر يتمثل في أن الإجابات على مثل هذه الاختبارات قد تم دمجها في بيانات التدريب الخاصة بنماذج الذكاء الاصطناعي التي تم اختبارها، مما سمح لها بالغش فعليًا.
يقول روشيه إن الاختبار الحقيقي لنموذج جيميني 3 ونماذج الذكاء الاصطناعي الأكثر تقدما – وما إذا كان أدائها سيكون كافيا لتبرير تريليونات الدولارات التي تنفقها شركات مثل جوجل وأوبن إيه آي على مراكز بيانات الذكاء الاصطناعي – سيكون في كيفية استخدام الناس للنموذج ومدى موثوقيته في العثور عليه.
وتقول جوجل إن القدرات المحسنة للنموذج ستجعله أفضل في إنتاج البرامج وتنظيم البريد الإلكتروني وتحليل المستندات. وتقول الشركة أيضًا إنها ستعمل على تحسين بحث Google من خلال استكمال النتائج الناتجة عن الذكاء الاصطناعي بالرسومات وعمليات المحاكاة.
من المحتمل أن التحسينات الحقيقية ستكون للأشخاص الذين يستخدمون أدوات الذكاء الاصطناعي لكتابة التعليمات البرمجية بشكل مستقل، وهي عملية تسمى التشفير الوكيل، كما يقول”https://www.oii.ox.ac.uk/people/profiles/adam-mahdi/”> آدم مهدي في جامعة أكسفورد. “أعتقد أننا وصلنا إلى الحد الأعلى لما يمكن أن يفعله برنامج الدردشة الآلي النموذجي، والفوائد الحقيقية لـ Gemini 3 Pro [the standard version of Gemini 3] من المحتمل أن يكون ذلك في مسارات عمل أكثر تعقيدًا، ومن المحتمل أن تكون فعالة، بدلاً من الدردشة اليومية.
وقد شملت ردود الفعل الأولية عبر الإنترنت”https://www.oneusefulthing.org/p/three-years-from-gpt-3-to-gemini”> مدح الناس قدرات البرمجة والتفكير المنطقي لدى Gemini، ولكن كما هو الحال مع جميع إصدارات النماذج الجديدة، كانت هناك أيضًا منشورات تسلط الضوء على الفشل في القيام بمهام تبدو بسيطة، مثل”https://x.com/peterwildeford/status/1990830603239842080″> تتبع مرسومة باليد أسهم تشير إلى أشخاص مختلفين، أو بسيطة”https://x.com/a_karvonen/status/1990839995675128259″> الاستدلال البصري الاختبارات.
تعترف جوجل، في المواصفات الفنية لـGemini 3، بأن النموذج سيستمر في الهلوسة وإنتاج معلومات غير دقيقة في بعض الأحيان، بمعدل يمكن مقارنته تقريبًا بنماذج الذكاء الاصطناعي الرائدة الأخرى. ويقول إن عدم وجود تحسن في هذا المجال يشكل مصدر قلق كبير”https://www.citystgeorges.ac.uk/about/people/academics/artur-davila-garcez”> أرتور دافيلا جارسيز في سيتي سانت جورج، جامعة لندن. ويقول: “المشكلة هي أن جميع شركات الذكاء الاصطناعي تحاول الحد من الهلوسة منذ أكثر من عامين، لكنك تحتاج فقط إلى هلوسة واحدة سيئة للغاية لتدمير الثقة في النظام إلى الأبد”.
المواضيع: