من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

في Quesma، نغوص عميقًا في عالم اقتصاديات وكلاء الذكاء الاصطناعي، مستكشفين التكاليف الحقيقية لتشغيلهم وكيفية التعامل معها. في رحلتنا البحثية، أقوم بتشغيل إعداد خاص للبحث العميق، يتكون من مجموعة من الوكلاء الذين يعملون على بناء قاعدة معرفية موثوقة. لكن، النسخة الأولية من هذا الإعداد استهلكت الحد الأقصى لخطة Claude Max 5x في غضون 30 دقيقة فقط. هذا المقال يروي كيف تمكنا من معالجة مشكلتي التكلفة والثقة، باستخدام الاشتراكات المدفوعة بالفعل، وكيف يمكنك تطبيق نفس المنهجية.

كان هدفي الرئيسي هو فهم شامل لما يعرف بالاقتصاد الرمزي. أردت معرفة أنظمة المراقبة المتاحة، وكيف تدير الفرق إنفاقها على الذكاء الاصطناعي، وما هي أدوات وممارسات التحسين التي أثبتت فعاليتها، سواء في الأبحاث الأكاديمية أو في التطبيقات العملية.

بدأت بالطريقة المعتادة، باستخدام أداة البحث العميق. وجهت إليها سؤالًا مفتوحًا وتركتها تعمل. بعد حوالي 30 دقيقة، وصلت إلى الحد الأقصى واضطررت للانتظار عدة ساعات حتى يتم إعادة تعيينه. لم أحصل على أي نتائج ملموسة. أطلقت العملية 111 وكيلًا ووضعت 123 مطالبة في قائمة الانتظار للتحقق منها، ولكن تم التحقق من 25 مطالبة فقط قبل الوصول إلى الحد الأقصى، ولم يتم تشغيل التوليف النهائي أبدًا.

لقد كانت صدمة شخصية بالنسبة لي. من المثير للسخرية أنني اضطررت لتحسين استهلاك الرموز المميزة بينما كنت لا أزال أتعلم كيفية القيام بذلك. كان تعلمًا بالممارسة.

الاستفادة القصوى من كل اشتراك أدفع مقابله

إذا كان Claude Fable 5 يصل إلى حده الأقصى بعد 30 دقيقة، وأداة البحث العميق تستهلك الكثير من الرموز دون نتائج، فماذا يمكنني أن أفعل لجعل البحث أكثر فعالية؟ بدأت بالتفكير في الأدوات التي أمتلكها وأدفع ثمنها بالفعل. Claude وCodex وAntigravity: ثلاثة اشتراكات، ونظريًا ثلاثة أضعاف الرموز المميزة دون دفع أي شيء إضافي. ماذا لو استخدمت كل هذه الأدوات معًا، مع ذاكرة مشتركة؟

بما أنني كنت أستخدم بالفعل كلود ميم، فقد قمت بتوسيع هذا المكون الإضافي ليدعم Codex وAntigravity محليًا، مما يسمح لجميع الأدوات الثلاثة باستخدام الذاكرة المشتركة خلال الجلسات. أي شيء تتعلمه أداة واحدة، يمكن للآخرين الاستفادة منه.

نماذج أرخص كوكلاء فرعيين

كان إعدادي الافتراضي هو Claude Code، لذا استخدمته كأداة رئيسية. أثناء البحث اليدوي، اكتشفت نمط تنسيق النموذج، وهو ما كنت أحتاجه بالضبط. لسنا بحاجة بالضرورة إلى Fable لكل مهمة؛ نماذج مثل Claude Opus 4.8 وClaude Sonnet 5 وGPT-5.5 وGemini 3.1 Pro تعتبر ممتازة للعديد من المهام.

قمت بفحص بعض المعايير وتحليلات التكلفة، مثل منصة Tbench للعمل النهائي والوكيل، وSWE-Bench Pro لهندسة البرمجيات الشاملة، والتحليل الاصطناعي للحصول على نظرة عامة على الأداء والأسعار. لم أعتبر أيًا منها الحقيقة المطلقة؛ فالمعايير تقيس أمورها الخاصة وتتغير الأرقام شهريًا. كنت بحاجة فقط إلى نقطة بداية فضفاضة لمعرفة من يتقن ماذا، وكان استخدام عدة نماذج مختلفة جزءًا من التجربة منذ البداية؛ كنت أتوقع تعديل التقسيم بعد التشغيل الفعلي على أي حال:

  • للبحث: كلود سونيت 5 – قوي وفقًا لمعايير الوكيل ورخيص بما يكفي للتشغيل بكميات كبيرة.
  • للتحقق: كلود أوبوس 4.8 – أدق وكيل كلود؛ يحتاج التحقق إلى دقة أكبر من البحث.
  • للتحكيم والتخطيط: كلود فابل 5 – الأكثر تكلفة، يقوم فقط بالتخطيط والتحلل وحل النزاعات.
  • للمهام الصغيرة: كلود هايكو 4.5 – رخيص وسريع في الاستخراج والتنسيق، ضعيف جدًا بالنسبة للعمل متعدد الخطوات.
  • لتشغيل الأدوات: Codex (GPT-5.5) – قوي جدًا فيما يتعلق بالمعايير النهائية؛ يقوم باستنساخ الأدوات وتثبيتها وتشغيلها وفحصها.
  • للرأي الثاني: Antigravity (Gemini 3.1 Pro) – عائلة نماذج مختلفة، لذا لا تشارك نفس النقاط العمياء.

لم يكن هذا التقسيم هو نسختي الأولى؛ لقد قمت بتعديله عدة مرات عندما أظهرت العمليات المباشرة نقاط ضعف، وكانت القواعد الاحتياطية تنبع من تلك الإخفاقات.

أفضل ما في هذا هو أنني قمت بإعداد Codex وAntigravity لاستخدامهما كوكلاء فرعيين لكلود، بتنسيق من Fable، مستفيدًا من طبيعتهما التي لا تتطلب واجهة مستخدم. لماذا هذا رائع؟ لأن الرموز المميزة مأخوذة من اشتراكات Codex وAntigravity، لذلك لم أدفع مبلغًا إضافيًا، ولكن كان لدي على الفور المزيد من القدرات الذكية لاستخدامها. يتم ذلك عبر نص Bash صغير يمكن لوكلاء Claude استدعاؤه كأي أمر آخر، مما يمكنهم من استدعاء واجهات سطر الأوامر الخاصة بمزودين آخرين كوكلاء فرعيين بلا رأس، والوصول إلى Codex وAntigravity بمرونة.

يراقب المنسق أيضًا إخراج رسائل حدود الاستخدام ونفاد الاعتمادات ويعيد رمز خروج خاصًا. هذه هي الطريقة التي يعمل بها الرجوع التلقائي إلى نماذج كلود: يرى المنسق الإشارة ويقوم بالعمل مع وكيل كلود بدلاً من ذلك.

شيء آخر مهم حقًا هو تثبيت النموذج لكل دور، لأن الوكلاء الفرعيين يرثون نموذج الوالدين افتراضيًا، وهذا بالضبط كيف استهلكت حد Fable الخاص بي في 30 دقيقة.

باستخدام هذه التقنية، تمكنت من إجراء البحث بشكل مستمر لفترة أطول بعشر مرات تقريبًا مقارنة بالبداية باستخدام Fable فقط. يقاس هذا ببساطة بالمدة التي يمكنني خلالها إبقاء الوكلاء يعملون قبل أن يصل أي من الاشتراكات الثلاثة إلى الحد الأقصى. في السابق كان الأمر يستغرق 30 دقيقة من البحث، أما الآن فقد أصبح يستغرق عدة ساعات، دون دفع فلس واحد إضافي. وعندما يصل Codex أو Antigravity إلى حده الأقصى، يعود الإطار ببساطة إلى نماذج كلود، وبالتالي لا يتوقف البحث.

الحد من الهلوسة

كانت التكلفة هي المشكلة الأولى فقط، أما المشكلة الثانية فكانت الثقة. قبل إطار البحث الخاص بي، عندما كانت Fable تقوم بكل شيء، كنت أحصل أحيانًا على نتائج تبدو قوية ولكنها لم تكن صحيحة. على سبيل المثال، ترخيص خاطئ في المستودع، أو رقم توفير بدون مصدر، أو رقم لم يكن موجودًا في الصفحة المذكورة. وللحد من الهلوسة، قمت بتطبيق قواعد واضحة في إطار البحث تنص على أن كل نتيجة يجب أن تمر عبر تدقيق قبل مشاركتها. بعض هذه القواعد هي:

  • الوكيل الذي يجد مطالبة لا يتحقق منها أبدًا؛ بل يقوم نموذج أو وكيل مختلف بالتحقق من الروابط وعروض الأسعار والأرقام.
  • لا شيء يصل إلى قاعدة المعرفة بدون عنوان URL واقتباس من المصدر الأساسي.
  • لا تذكر أبدًا رقمًا لا تحتويه الصفحة المصدر.

لم يتم تصميم هذه القائمة مسبقًا. لقد تطورت أثناء البحث، لأنه في كل مرة يكتشف فيها التحقق فئة جديدة من الأخطاء، تعود القاعدة لتعديل المطالبات. ومثل هذا الإطار لا يكون فعالًا حقًا إلا إذا واصلت ضبطه، لذا يجب مراجعة النتائج، ووضع علامة على النتائج غير المفيدة، ثم تعديل القواعد.

أداة البحث العميق تأتي أخيرًا

مع معالجة مشكلتي التكلفة والثقة، كانت القطعة الأخيرة هي أداة البحث العميق التي بدأت هذه القصة بأكملها. لا يزال هذا المشروع في طور الإعداد، ولكنه كخطوة أخيرة، وليس الأولى. في نهاية كل يوم، أقوم بمراجعة النتائج التي نجت بالفعل من التحقق. لذا، فبدلاً من البحث بشكل أعمى، يمر الوكيل عبر النتائج الموجودة، ويعمقها، ويزيل الفوضى، ويحاول سد الثغرات التي فاتت الإطار. كما أنها تستخدم عددًا أقل من الرموز المميزة بهذه الطريقة، لأنها تعمل من خلال قائمة ثابتة من المطالبات بدلاً من استكشاف الإنترنت. استخدمت الجولة الأخيرة 61 عميلًا واستغرقت 22 دقيقة. قارن ذلك باليوم الأول، عندما استهلك 111 عميلًا الحد بالكامل في حوالي 30 دقيقة ولم يقدموا التقرير أبدًا. نفس الأداة، مجرد مهمة أصغر بكثير، ضمن مسار شامل للبحث والتحقق والحكم وتشغيل الأدوات.

النتيجة: قاعدة معرفية يمكنني الوثوق بها

كل ما نجا من التحقق يقع في موسوعة LLM التي أحتفظ بها في Obsidian، مستوحاة من نمط موسوعة LLM الخاص بكارباثي: الملاحظات الذرية المرتبطة، الوكلاء الذين يقومون بعمليات المسح، وأنا أضع القواعد. بعد مرور أسبوع واحد، أصبحت تحتوي على مئات الملاحظات التي تم التحقق من صحتها حول التسعير والأدوات والمعايير والممارسات.

الشيكات الآلية ليست كافية بحد ذاتها. ذات مرة، تم رفض مشروع Headroom، وهو مشروع يضم 56 ألف نجمة وواحد من أكبر المشاريع في فئته، بهدوء من قاعدة الفرز الخاصة بي. لقد فعل الوكلاء كل شيء بشكل صحيح، وأكد التحقق أن المشروع شرعي، وأشار فحص المطالبة بشكل صحيح إلى أن أرقام التوفير الرئيسية الخاصة به لم تكن خاضعة لرقابة الجودة. لكن قاعدتي تنص على أن الادعاءات غير المتحققة تعني عدم الدخول، لذا فإن المشروع الذي تستخدمه نصف الصناعة كان غير مرئي في قاعدة معارفي. لقد لاحظت ذلك بعد يومين فقط، عندما سألت كيف فاتنا هذا؟ كان الإصلاح عبارة عن قاعدة جديدة: رفض المطالبة، وليس المشروع. يمكن للوكلاء إجراء البحث والتحقق، ولكن لن يخبرك أي وكيل أبدًا أن قاعدتك هي الخطأ.

إذا كنت ترغب في بناء قاعدة معرفية عالية الجودة، فإن التحقق البشري ومكملات البحث ضروريان. يمكن لأبحاث الذكاء الاصطناعي وحدها أن تكون رديئة الجودة حقًا. الأبحاث التي تُجرى على البشر فقط بطيئة جدًا. أفضل طريقة هي الطريقة الهجينة: حيث يقوم العملاء بالأعمال البحثية الثقيلة، لكنهم يعملون وفقًا لخط أنابيب تم تصميمه وتحسينه باستمرار بواسطة الإنسان. كما يقوم الإنسان بالتحقق من النتائج وسد الثغرات.

بعض النتائج من قاعدة المعرفة

تبين أن موضوع الاقتصاد الرمزي أكبر بكثير مما كنت أتوقع. فيما يلي عينة صغيرة مما هو موجود بالفعل في الداخل، والنتائج التي فاجأتني أكثر من غيرها:

  • يمكن أن يكون إعدادك ذا أهمية بقدر أهمية نموذجك. على منصة Tbench، يظهر النموذج نفسه تباينًا يقارب 66 ضعفًا في استهلاك الرموز المميزة عبر أدوات مختلفة، وتسجل الإعدادات الأقل تعقيدًا في الواقع درجات أعلى، وليس أقل. دراسة أخرى قيست تفاوتًا بحوالي 54 نقطة مئوية على نفس النموذج، مع تغيير الإعداد فقط. لقد رأينا نسخة صغيرة من هذا بأنفسنا عندما تحققنا من التكلفة الحقيقية لقول مرحبًا لعميل الذكاء الاصطناعي.
  • ضغط السياق يمكن أن يضاعف فاتورتك بدلاً من توفيرها. يبدو الضغط كعملية توفير، لذلك من السهل افتراض أنه جيد دائمًا، ولكنه ليس مجانيًا: يجب على النموذج تلخيص سجل محادثاتك، وهذا الاستدعاء للتخليص يستهلك الرموز المميزة أيضًا. يمكنه أيضًا إخراج الملفات التي لا يزال الوكيل بحاجة إليها، لذلك يقوم الوكيل بإعادة قراءتها، ويمتلئ السياق مرة أخرى، ويتم تشغيل الضغط مرة أخرى. انحدار واحد موثق يوضح مدى سوء هذه الحلقة: بعد أن قام الإعداد بإعادة ضبط حد الضغط الخاص به، انتقل من 4 إلى 12-26 ضغطًا في كل جلسة، وارتفع استخدام الرمز المميز في مهام متطابقة من 89 مليونًا إلى 160-185 مليونًا.
  • تغيير أداة واحدة في منتصف الجلسة يعيد فوترة كل شيء بصمت. تكلف قراءة ذاكرة التخزين المؤقت حوالي 0.1x من سعر الإدخال الأساسي، ولكن يتم إبطال ذاكرة التخزين المؤقت كتسلسل هرمي (الأدوات ثم النظام ثم الرسائل). قم بإضافة أو إعادة ترتيب مخطط أداة واحدة في منتصف الجلسة، وسيتم إعادة فوترة البادئة المخزنة مؤقتًا بالكامل بالسعر الكامل. لن تحصل على أي خطأ، فقط فاتورة أكبر.
  • عداد الرمز المميز الخاص بك ليس فاتورتك. في حالة موثقة، تم حساب 3.60 دولار أمريكي شهريًا كفاتورة بقيمة 25-40 دولار أمريكي شهريًا، وفجوة 7-11 ضعفًا تأتي من تراكم السياق، وإعادة محاولة التضخيم، والنفقات العامة لإطار العمل، ومكالمات التقييم التي لم يتم التقاطها أبدًا بتقدير رمزي بسيط.

يصنف إطار عملنا معظم هذه الأمور على أنها ذات ثقة متوسطة، وعادةً ما تكون مصدرًا واحدًا أو مصدرين قويين، ونبقي ذلك مرئيًا بدلاً من التظاهر بأنه قد تم تسويته.

قبل أن تستهلك حدك التالي

إذا كنت تستهلك حدودك في البحث العميق اليوم، فحاول عكس الترتيب: النماذج الرخيصة تقوم بالبحث، والنماذج الدقيقة تتحقق، ويأتي البحث العميق أخيرًا. تحقق أيضًا من مقدار المعلومات التي تدفع مقابلها بالفعل. تمنحك بعض الاشتراكات ذات الدور الواضح لكل نموذج أكثر من نموذج حدودي واحد يُستخدم بشكل أعمى.

وإذا كنت تقوم بإنشاء خط أنابيب بحثي خاص بك، أو كانت فاتورة الذكاء الاصطناعي الخاصة بك تنمو بشكل أسرع من استخدامك، فنحن نود حقًا أن نسمع كيف تتعامل معها. تواصل معنا عبر X أو لينكد إن وشارك إعداداتك. ترقبوا منشورات وإصدارات مستقبلية حول هذا الموضوع.

هل لا تزال أجهزة تلفزيون OLED الخيار الأفضل في عام 2026؟
تحديث هائل: Minecraft Java Edition ينتقل إلى SDL3 لتحسين الأداء وتجربة المستخدم

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل