تريد رؤى أكثر ذكاء في صندوق الوارد الخاص بك؟ اشترك في النشرات الإخبارية الأسبوعية لدينا للحصول على ما يهم فقط للمؤسسات AI والبيانات وقادة الأمن. اشترك الآن
باحثو جوجل طورت أ إطار عمل جديد لوكلاء أبحاث الذكاء الاصطناعى يتفوق على أنظمة قيادة من منافسيها Openai ، الحيرة ، وغيرها على المعايير الرئيسية.
الوكيل الجديد ، يسمى”https://www.arxiv.org/abs/2507.16075″ الهدف=”_blank” rel=”noreferrer noopener”> اختبار انتشار الوقت العميق (TTD-DR) ، مستوحى من الطريقة التي يكتب بها البشر من خلال المرور بعملية الصياغة والبحث عن المعلومات وإجراء مراجعات تكرارية.
يستخدم النظام آليات الانتشار والخوارزميات التطورية لإنتاج بحث أكثر شمولاً ودقيقة حول الموضوعات المعقدة.
للمؤسسات ، هذا الإطار هل يمكن تشغيل جيل جديد من مساعدي الأبحاث المخصصة للمهام ذات القيمة العالية هذا المعيار”https://venturebeat.com/ai/why-enterprise-rag-systems-fail-google-study-introduces-sufficient-context-solution/”> استرجاع الجيل المعزز (خرقة) النظم تكافح معها ، مثل توليد تحليل تنافسي أو تقرير دخول السوق.
يتساقط تحجيم الذكاء الاصطناعى حدوده
تتم إعادة تشكيل قبعات الطاقة ، وارتفاع تكاليف الرمز المميز ، والتأخيرات الاستدلال. انضم إلى صالوننا الحصري لاكتشاف كيف هي الفرق الكبرى:
- تحويل الطاقة إلى ميزة استراتيجية
- تعليم الاستدلال الفعال لتحقيق مكاسب الإنتاجية الحقيقية
- فتح العائد على الاستثمار التنافسي مع أنظمة الذكاء الاصطناعى المستدامة
تأمين مكانك للبقاء في المقدمة:”https://bit.ly/4mwGngO”> https://bit.ly/4mwgngo
وفقًا لمؤلفي الورقة ، كانت حالات استخدام الأعمال في العالم الحقيقي هي الهدف الأساسي للنظام.
حدود وكلاء البحوث العميقة الحالية
تم تصميم عوامل البحث العميق (DR) لمعالجة الاستعلامات المعقدة التي تتجاوز البحث البسيط. يستخدمون نماذج لغة كبيرة (LLMS) للتخطيط ، واستخدام أدوات مثل البحث على الويب لجمع المعلومات ، ثم توليف النتائج في تقرير مفصل بمساعدة من”https://venturebeat.com/ai/how-test-time-scaling-unlocks-hidden-reasoning-abilities-in-small-language-models-and-allows-them-to-outperform-llms/”> تقنيات التحجيم وقت الاختبار مثل سلسلة الأفكار (COT) ، وأفضل أخذ العينات من N ، والبحث عن شجرة Monte-Carlo.
ومع ذلك ، فإن العديد من هذه الأنظمة لها قيود تصميم أساسية. يطبق معظم وكلاء DR المتاحين للجمهور خوارزميات وأدوات اختبار وقت الاختبار بدون هيكل يعكس السلوك المعرفي البشري. غالبًا ما تتبع عوامل المصادر المفتوحة عملية خطي أو موازية صلبة للتخطيط والبحث وتوليد المحتوى ، مما يجعل من الصعب على المراحل المختلفة للبحث التفاعل مع بعضها البعض وتصحيحها.
يمكن أن يتسبب ذلك في فقدان الوكيل السياق العالمي للبحث ويفتقد الاتصالات الحرجة بين أجزاء مختلفة من المعلومات.
كما يلاحظ مؤلفو الورقة ، “يشير هذا إلى وجود قيود أساسية في عمل وكيل DR الحالي ويسلط الضوء على الحاجة إلى إطار أكثر تماسكًا ومصممًا لهذا الغرض لوكلاء DR الذي يقلد أو يتجاوز قدرات البحث البشري.”
نهج جديد مستوحى من الكتابة البشرية والانتشار
على عكس العملية الخطية لمعظم وكلاء الذكاء الاصطناعي ، يعمل الباحثون البشرون بشكل تكرار. عادة ما يبدأون بـ خطة عالية المستوى ، وإنشاء مسودة أولية ، ثم الانخراط في دورات مراجعة متعددة. خلال هذه المراجعات ، يبحثون عن معلومات جديدة لتعزيز حججهم وملء الثغرات.
لاحظ باحثو Google أن هذا يمكن محاكاة العملية البشرية مع آلية أ”https://venturebeat.com/ai/beyond-gpt-architecture-why-googles-diffusion-approach-could-reshape-llm-deployment/”> نموذج الانتشار معززة مع مكون استرجاع. (غالبًا ما يتم استخدام نماذج الانتشار في توليد الصور. تبدأ بصورة صاخبة وتحسينها تدريجياً حتى تصبح صورة مفصلة.)
كما يوضح الباحثون ، “في هذا القياس ، يقوم نموذج الانتشار المدرب في البداية بإنشاء مسودة صاخبة ، وتوحيد وحدة تقليلها ، بمساعدة أدوات الاسترجاع ، هذه المسودة إلى مخرجات عالية الجودة (أو ذات دقة أعلى).”
تم بناء TTD-DR على هذا المخطط. يعامل الإطار إنشاء تقرير بحثي كعملية انتشار ، حيث يتم تحسين مسودة “صاخبة” أولية “صاخبة” تدريجياً إلى تقرير نهائي مصقول.
يتم تحقيق ذلك من خلال آليتين أساسيتين. الأول ، الذي يطلق عليه الباحثون “تقليل الاسترجاع” ، يبدأ بمشروع أولي ويحسنه بشكل متكرر. في كل خطوة ، يستخدم الوكيل المسودة الحالية لصياغة استعلامات بحث جديدة ، واسترداد المعلومات الخارجية ، ودمجها “
تضمن الآلية الثانية ، “التطور الذاتي” ، أن كل مكون من الوكيل (المخطط ، ومولد الأسئلة ، وممتلئ الإجابة) يعمل بشكل مستقل على تحسين أدائه. في تعليقات على VentureBeat ، أوضح Rujun Han ، عالم الأبحاث في Google والمؤلف المشارك للورقة ، أن هذا التطور على مستوى المكون أمر بالغ الأهمية لأنه يجعل “التقرير أكثر فاعلية”. هذا يشبه عملية تطورية حيث يتحسن كل جزء من النظام بشكل تدريجي في مهمته المحددة ، مما يوفر سياقًا عالي الجودة لعملية المراجعة الرئيسية.
“التفاعل المعقد والمزيج التآزري من هاتين الخوارزميات أمر حاسم لتحقيق نتائج بحث عالية الجودة” ، يقول المؤلفون. تؤدي هذه العملية التكرارية بشكل مباشر إلى التقارير التي ليست أكثر دقة فحسب ، ولكنها أيضًا أكثر تماسكًا منطقيًا. كما يلاحظ Han ، نظرًا لأن النموذج تم تقييمه على المساعدة ، والذي يتضمن الطلاقة والتماسك ، فإن مكاسب الأداء هي مقياس مباشر لقدرته على إنتاج مستندات أعمال جيدة التنظيم.
حسب الورقة ، رفيق البحث الناتج “قادر على توليد تقارير مفيدة وشاملة لأسئلة البحث المعقدة عبر مجالات الصناعة المتنوعة ، بما في ذلك التمويل والطبية الحيوية والترفيه والتكنولوجيا “، وضعها في نفس الفئة مثل منتجات البحث العميق من Openai ، Perplexity ، و Grok.
TTD-DR في العمل
لبناء واختبار إطارهم ، استخدم الباحثون Google’s”https://venturebeat.com/ai/googles-new-agent-development-kit-lets-enterprises-rapidly-prototype-and-deploy-ai-agents-without-recoding/”> مجموعة تطوير الوكيل (ADK) ، منصة قابلة للتوسيع لتنظيم مهام سير العمل المعقدة ، مع”https://venturebeat.com/ai/meet-the-new-king-of-ai-coding-googles-gemini-2-5-pro-i-o-edition-dethrones-claude-3-7-sonnet/”> Gemini 2.5 Pro باعتباره LLM Core (على الرغم من أنه يمكنك تبديله للنماذج الأخرى).
قاموا بتقييم TTD-DR ضد أنظمة تجارية ومفتوحة المصدر الرائدة ، بما في ذلك”https://venturebeat.com/ai/out-analyzing-analysts-openai-deep-research-pairs-reasoning-llms-with-agentic-rag-to-automate-work-and-replace-jobs/”> Openai Deep Research، بحث عميق في الحيرة ، Grok DeepSearch ، والمصدر المفتوح”https://github.com/assafelovic/gpt-researcher”> GPT-Researcher.
ركز التقييم على مجالين رئيسيين. لتوليد تقارير شاملة طويلة الشكل ، استخدموا”https://github.com/Su-Sea/ydc-deep-research-evals”> معيار DeepConsult، مجموعة من المطالبات ذات الصلة بالأعمال والاستشارات ، إلى جانب مجموعة بيانات البحث الطويلة الخاصة بهم. للإجابة على أسئلة متعددة القبور التي تتطلب بحثًا واسعًا وتفكيرًا ، اختبروا الوكيل حول تحدي معايير أكاديمية وواقعية مثل”https://agi.safe.ai/”> امتحان الإنسانية الأخير (HLE) و”https://venturebeat.com/ai/beyond-arc-agi-gaia-and-the-search-for-a-real-intelligence-benchmark/”> غايا.
أظهرت النتائج TTD-DR تتفوق باستمرار على منافسيها. في المقارنات جنبًا إلى جنب مع الأبحاث العميقة Openai على توليد التقارير الطويلة ، حققت TTD-DR معدلات فوز بنسبة 69.1 ٪ و 74.5 ٪ على مجموعتين مختلفتين. كما تجاوز نظام Openai على ثلاثة معايير منفصلة تتطلب التفكير متعدد القوانين للعثور على إجابات موجزة ، مع مكاسب الأداء بنسبة 4.8 ٪ و 7.7 ٪ و 1.7 ٪.
مستقبل انتشار وقت الاختبار
بينما يركز البحث الحالي على التقارير المستندة إلى النص باستخدام Web Search ، تم تصميم Framework ليكون قابلاً للتكيف بدرجة كبيرة. أكد هان أن الفريق يخطط لتوسيع العمل لدمج المزيد من الأدوات لمهام المؤسسات المعقدة.
أ يمكن استخدام عملية “انتشار وقت الاختبار” مماثلة لإنشاء رمز برامج معقدو إنشاء نموذج مالي مفصل، أو تصميم حملة تسويقية متعددة المراحل، حيث “مسودة” أولية للمشروع صقل بشكل تكرار بمعلومات جديدة والتعليقات من مختلف الأدوات المتخصصة.
وقال هان: “كل هذه الأدوات يمكن دمجها بشكل طبيعي في إطارنا” ، مما يشير إلى أن هذا النهج المتمحور حول المسودة يمكن أن يصبح بنية أساسية لمجموعة واسعة من العوامل المعقدة من الذكاء الاصطناعي.
الرؤى اليومية حول حالات استخدام الأعمال مع VB يوميا
إذا كنت ترغب في إقناع رئيسك في العمل ، فقد غطيت VB Daily. نمنحك السبق الصحفي الداخلي على ما تفعله الشركات مع الذكاء الاصطناعي التوليدي ، من التحولات التنظيمية إلى عمليات النشر العملية ، حتى تتمكن من مشاركة رؤى لأقصى عائد على الاستثمار.
اقرأ لدينا”http://venturebeat.com/terms-of-service/”> سياسة الخصوصية
شكرا على الاشتراك. تحقق أكثر”http://venturebeat.com/newsletters/”> النشرات الإخبارية VB هنا.
حدث خطأ.