من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

في خطوة مهمة تعزز من قدرات الذكاء الاصطناعي الوكيل، أعلنت جوجل عن دمج ميزة استخدام الكمبيوتر مباشرةً في نموذجها السريع Gemini 3.5 Flash. هذه الإمكانية، التي تم إطلاقها في I/O 2026 كأسرع نموذج للذكاء الاصطناعي الوكيل، كانت تتطلب سابقًا نموذجًا مستقلاً ومنفصلاً. أما الآن، فقد أصبحت أداة أصلية متاحة عبر Gemini API ومنصة Gemini Enterprise Agent (المعروفة سابقًا باسم Vertex AI)، مما يمثل نقلة نوعية في كيفية تفاعل وكلاء الذكاء الاصطناعي مع الواجهات الرقمية.

جيميني 3.5 فلاش: قدرات رؤية الشاشة والتحكم بها

تتيح ميزة استخدام الكمبيوتر لوكلاء الذكاء الاصطناعي رؤية شاشات المستخدم، والنقر، والكتابة، والتمرير عبر المتصفحات والأجهزة المحمولة وأجهزة سطح المكتب. وهذا يعني أن المطورين لم يعودوا بحاجة إلى استدعاء نموذج مخصص لهذه الوظيفة. بدلاً من ذلك، يمكنهم تفعيلها كإحدى الأدوات المتعددة ضمن Flash، إلى جانب تنفيذ التعليمات البرمجية والبحث واستدعاء الوظائف. وصف مدير المنتج ماتيو كويروس هذا التكامل بأنه يمنح Flash القدرة على الرؤية والتفكير واتخاذ الإجراءات على الشاشات، وهو تطور يدمج سير عمل النموذجين السابقين في نموذج واحد أكثر كفاءة.

كانت جوجل قد أطلقت نموذج استخدام الكمبيوتر المستقل في أكتوبر 2025، والذي كان مصممًا خصيصًا لسير عمل الوكيل القائم على المتصفح، وحقق دقة تقارب 70% وفقًا لمعيار Online-Mind2Web. يأتي هذا الدمج الجديد ليعزز من سرعة وفعالية تطوير تطبيقات الذكاء الاصطناعي الوكيل.

تعزيز أتمتة المؤسسات بالذكاء الاصطناعي الوكيل

تتجاوز رؤية جوجل لهذه الأداة مجرد برامج الدردشة الآلية، لتصل إلى أتمتة شاملة للمؤسسات. تتيح الأداة إجراء اختبار مستمر للبرامج، حيث يتنقل وكلاء الذكاء الاصطناعي في التطبيقات ويتحققون من وظائفها دون الحاجة إلى تدخل بشري في كل شاشة. كما يمكن للعاملين في مجالات المعرفة استخدام هؤلاء الوكلاء لإكمال المهام المعقدة التي تتطلب خطوات متعددة في المتصفح، مثل ملء النماذج، أو استخراج البيانات من لوحات المعلومات، أو التنقل بين الأدوات الداخلية للشركة، مما يوفر وقتًا وجهدًا كبيرين.

الأمان والثقة: ركيزة أساسية لوكلاء الذكاء الاصطناعي

تضع جوجل الأمان على رأس أولوياتها، خاصةً مع وكلاء الذكاء الاصطناعي الذين يتفاعلون مباشرةً مع الأنظمة. لذا، طبقت الشركة تدريبًا عدائيًا مستهدفًا خصيصًا لمواجهة هجمات الحقن الفوري (prompt injection)، وهو تهديد حقيقي حيث يمكن لتعليمات ضارة مضمنة في صفحات الويب أو المستندات أن تخدع وكلاء الذكاء الاصطناعي لتنفيذ أعمال غير مقصودة. وقد أثبت الباحثون مرارًا إمكانية التلاعب بوكلاء الذكاء الاصطناعي من خلال المحتوى الذي يواجهونه.

تقدم جوجل ضمانتين اختياريتين للمؤسسات لتعزيز الأمان:

  • التأكيد الصريح من المستخدم: يتطلب هذا الإجراء موافقة المستخدم قبل أن ينفذ الوكيل أي عمل حساس أو لا رجعة فيه، مثل إرسال نموذج، أو إجراء عملية شراء، أو حذف البيانات.
  • الإيقاف التلقائي للوكيل: يوقف الوكيل تلقائيًا إذا اكتشف محاولة حقن سريعة غير مباشرة، مما يمنع التنفيذ ويقلل من مخاطر اتخاذ إجراء مخترق.

تجدر الإشارة إلى أن هاتين الضمانتين اختياريتان وليستا افتراضيتين. توصي جوجل باتباع نهج الدفاع المتعمق (defense in depth)، حيث يقوم المطورون بتطبيق طبقات متعددة من الحماية بدلاً من الاعتماد على آلية واحدة. وتقر وثائق الشركة صراحةً بأنه لا توجد حماية فردية كافية بحد ذاتها، وهو إطار يتناقض مع لغة التسويق الأكثر ثقة حول قدرات الذكاء الاصطناعي الأخرى.

المشهد التنافسي وتحديات التنفيذ

لقد تغير المشهد التنافسي بشكل كبير منذ أن كانت شركة أنثروبيك رائدة في هذه الفئة. يعمل نموذج Claude Computer Use من أنثروبيك عبر أنظمة التشغيل المختلفة ويمكنه التفاعل مع أنظمة الملفات، وليس فقط المتصفحات، مما يجعله أكثر تنوعًا لسير عمل سطح المكتب. كما أضافت جوجل نفسها ميزات التصفح الوكيل إلى Chrome Enterprise في وقت سابق من هذا العام. ومع دخول OpenAI لهذا المجال أيضًا، تتنافس الشركات الثلاث الآن على محاور مختلفة. ويتمثل السؤال الأهم للمشترين من المؤسسات في تحديد النموذج الذي يمكنه تنفيذ المهام بأمان ضمن بيئة منظمة وملتزمة بالضوابط.

على الرغم من هذه التطورات، لم تنشر جوجل بعد نتائج معيارية محدثة لاستخدام استخدام الكمبيوتر كأداة فلاش مدمجة مقارنة بالنموذج المستقل السابق. ولم تكشف الشركة عن عدد الشركات التي تستخدم هذه الإمكانية أو تقدم دراسات حالة محددة لعملائها. كما أن الادعاءات المتعلقة بالتدريب العدائي المستهدف للحقن الفوري لم تُدعم بأبحاث منشورة أو نتائج فرق الاختراق (Red Team).

تستخدم منصة Gemini Enterprise Agent، حيث تتوفر الأداة، تسعير الدفع حسب الاستخدام. ويُعد Flash أحد النماذج الأقل تكلفة في تشكيلة جوجل، مما قد يجعل استخدام الكمبيوتر أكثر سهولة في الأتمتة واسعة النطاق. لكن ما إذا كانت ميزة التكلفة هذه ستستمر أم لا، يعتمد على عدد الإجراءات التي يتطلبها سير عمل الوكيل النموذجي وعدد المرات التي يتم فيها إيقاف التنفيذ بسبب حواجز السلامة لطلب التأكيد.

لا يزال مفهوم استخدام الكمبيوتر في الذكاء الاصطناعي في مراحله المبكرة. يمكن للنماذج التنقل في الواجهات المألوفة ولكنها تواجه صعوبات في التعامل مع النوافذ المنبثقة غير المتوقعة، واختبارات CAPTCHA، والمحتوى الذي يتم تحميله ديناميكيًا، والتخطيطات التي لم يسبق لها رؤيتها. يشير قرار جوجل بجعلها أداة مدمجة بدلاً من نموذج مستقل إلى الثقة في أن القدرة ناضجة بدرجة كافية للتوافر العام، لكن وجود حواجز الحماية الآمنة الاختيارية يشير إلى وعي متساوٍ بأنها ليست ناضجة بعد بما يكفي للتشغيل بدون إشراف كامل.

احصل على خصم يصل إلى 36% مع أفضل عروض Prime Day Kindle (2026): Paperwhite، Colorsoft، Kids
خبراء الذكاء الاصطناعي في الصين قلقون: دعوة ملحة للتعاون العالمي

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل