من فضلك تسجيل الدخول أو تسجيل لتفعل ذلك.

قبل عام واحد، أعلنا عن يوم استقلال المحتوى الأول، وقمنا بتمكين مالكي مواقع الويب من استعادة السيطرة على محتواهم. لقد تدهور الاتفاق الذي استمر 30 عامًا بين برامج الزحف ومالكي المواقع – نحن نزحف إليك، وستحصل على إحالات – مع ظهور الذكاء الاصطناعي الذي أخذ كل شيء ولم يرسل شيئًا، مما مثل تهديدًا وجوديًا لأصحاب المواقع. ولهذا، أطلقنا خيارًا بنقرة واحدة لحظر روبوتات الذكاء الاصطناعي، إلى جانب سوق للدفع مقابل الزحف.

لقد تغير الكثير في عام واحد. في يوليو الماضي، تركزت المحادثات حول روبوتات الذكاء الاصطناعي على منع تدريب الذكاء الاصطناعي دون تعويض، مشيرةً إلى صفقة ربح وخسارة حيث يُستخدم المحتوى لتدريب النماذج دون إرجاع أي قيمة لمالك الموقع. لكن ظهرت رغبة في المزيد من الدقة والتفاصيل، فلا يزال أصحاب المحتوى يرغبون في حماية محتواهم، ويجب تعويضهم عن المحتوى الأصلي الذي يعملون جاهدين على إنشائه وتنظيمه ومشاركته. ندرك أيضًا أن تأمين المحتوى ليس حلاً واحدًا يناسب الجميع؛ يريد مالكو مواقع الويب خيارات أكثر من مجرد اللجوء إلى حظر جميع عمليات الأتمتة في كل مرة.

إذا كنت تدير موقعًا صغيرًا، فالمشكلة ليست فقط أن يتمكن شخص ما من تدريب النماذج على محتواك، بل يعني أنه لا يمكن لأحد العثور عليك في المقام الأول. لذا يتعين عليك أن تعقد صفقة: إما أن تظهر في البحث وتدع الذكاء الاصطناعي يتدرب عليك، أو تخاطر بفقدان قابلية الاكتشاف. وهذا يفيد بشكل غير عادل مقدمي البحث الحاليين إذا كانوا يستخدمون نفس الروبوتات لكل من البحث والتدريب؛ وهذه الميزة غير العادلة تحفز اللاعبين الجدد على المراوغة أثناء محاولتهم سد الفجوة التنافسية.

الذكاء الاصطناعي يمكن أن يكون أي شيء اليوم

اليوم، يمكن أن يتواجد الذكاء الاصطناعي في أي شيء. لقد تغير بحث جوجل من التصنيف بواسطة الذكاء الاصطناعي إلى كونه محرك إجابات كاملة يجيب على سؤالك مباشرة على صفحة النتائج. وجوجل ليست فريدة من نوعها في هذا الموقف؛ فهذا هو الاتجاه الذي يتحرك فيه مفهوم البحث ككل.

يمكننا أن نناقش الحد الأقصى لما يمكن وصفه بـ الذكاء الاصطناعي اليوم، فقط لنجد أن المعيار سيتغير غدًا. لذا، بدلًا من تعريف الروبوت في المقام الأول على أنه ذكاء اصطناعي أم لا، فإن نهجنا المحدث للتصنيف سيطرح أسئلة أعمق حول سلوك الروبوت أو الوكيل: ماذا يفعلون على موقعي؟ ماذا يخزنون؟ وكيف سيعيدون مشاركة المحتوى الخاص بي؟

تصنيف عملي لروبوتات الذكاء الاصطناعي

للإجابة على هذه الأسئلة، نحتاج إلى رؤية أكثر دقة – تصنيف عملي يتماشى مع حالات استخدام الذكاء الاصطناعي التي يهتم بها عملاؤنا. لذلك نحن نفتح المناقشة بما يتجاوز تدريب الذكاء الاصطناعي وحده ونركز على ثلاث حالات استخدام للذكاء الاصطناعي نريد أن يتمكن جميع العملاء من إدارتها:

  • البحث: أي سلوك يقوم بجمع المحتوى الخاص بك أو فهرسته، حتى يتمكن من الإجابة على الأسئلة المتعلقة به لاحقًا. المفتاح هو أن البحث يقوم بشكل استباقي ببناء قاعدة بيانات لموقعك للرد لاحقًا على الاستفسارات. يجب أن يتوقع مالكو الموقع الحصول على حركة إحالة أو تعويض عادل آخر نتيجة لذلك.
  • العامل: السلوك الآلي الذي يتصرف، عادةً في الوقت الفعلي، نيابةً عن شخص ما لإنجاز شيء ما في الوقت الحالي. يتضمن ذلك روبوتات جلب الدردشة (مثل ChatGPT-User) ووكلاء استخدام المتصفح (مثل Gemini أو Claude الذي يقود Chrome). المفتاح هو أنه يزور تطبيق الويب الخاص بك لإكمال المهمة، وغالبًا ما يكون هناك إنسان ينتظر على الطرف الآخر.
  • التدريب: يأخذ الزاحف المحتوى الخاص بك لتدريب نموذج أو تحسينه. المفتاح هو أن يتم استيعاب بياناتك بشكل دائم في البنية الأساسية للذكاء الاصطناعي لتحسين قدراته.

تندرج العديد من برامج الزحف الشائعة على الويب ضمن أحد التصنيفات المذكورة أعلاه؛ ويقع البعض في تصنيفات متعددة. نقوم بتصنيف الكثير من السلوكيات الأخرى بخلاف السلوكيات الثلاثة المذكورة أعلاه – بما في ذلك التحقق من الإعلانات، وجلب الخلاصات، ومعاملات الوكلاء. ولكننا نعتقد أنه يجب أن يكون من السهل على جميع مالكي مواقع الويب إدارة الوصول إلى حالات الاستخدام الثلاث التي تركز على الذكاء الاصطناعي. نحن نعتقد أنه يجب على مشغلي الروبوتات فصل برامج الزحف الخاصة بهم لأن ذلك يخلق المزيد من الشفافية لأصحاب مواقع الويب: مما يسمح لهم بفهم سبب زيارة زاحف معين لهم بشكل أفضل، بالإضافة إلى إدارة الوصول الذي يوسّعونه إلى هذا الزاحف بشكل أفضل. إذا كانت الشركة تدير الأتمتة التي تبني فهارس البحث، وتعمل كعامل، وتجمع البيانات لتدريب نماذجها، فإننا نشجع تلك الشركة بشدة على فصل الأتمتة إلى ثلاثة برامج زحف منفصلة.

نريد نظام تصنيف قابل للتطوير ويمثل عالم حركة المرور الآلية أثناء تطوره. إن تتبع أغراض الروبوت ليس بالأمر الجديد، ولكن تصنيفنا الجديد يتضمن بعض التحديثات التي تمثل بشكل أفضل حالة حركة مرور الروبوتات اليوم. والأهم من ذلك أننا نريد أن ندرك أن الروبوتات التي لها أغراض متعددة يجب أن يتم تتبعها بجميع الأغراض، وليس واحدًا منها فقط.

خيارات جديدة لإدارة حركة مرور الذكاء الاصطناعي

نريد توفير المزيد من الخيارات لإدارة أنواع مختلفة من حركة مرور الذكاء الاصطناعي لجميع أصحاب المواقع على شبكة Cloudflare.

يتضمن الإعداد المسبق المُدار لـ حظر روبوتات الذكاء الاصطناعي الذي أعلنا عنه في الماضي روبوتات ذات غرض واحد تقوم بالزحف إلى البيانات للتدريب النموذجي.

ولكن ليس كل استخدامات الذكاء الاصطناعي متماثلة، ونريد أن يحصل عملاؤنا على عناصر التحكم التي يحتاجون إليها. لذلك، نحن نطلق القدرة على إدارة حركة مرور الذكاء الاصطناعي بناءً على حالات الاستخدام الرئيسية الثلاث: البحث والوكيل والتدريب. باستخدام هذه الخيارات الجديدة، يمكن لعملائنا ضبط كيفية إدارة حركة مرور الروبوتات التي تعمل بالذكاء الاصطناعي بشكل أكثر دقة – بما في ذلك العملاء في الطبقة المجانية لدينا.

تحديد الإعدادات الافتراضية الجديدة

وفي 15 سبتمبر 2026، سنقوم بتعيين إعدادات افتراضية جديدة لكل من هذه التصنيفات الثلاثة. بالنسبة لجميع النطاقات الجديدة المنضمة إلى Cloudflare، فإن فئات التدريب و العامل سيتم حظرها بشكل افتراضي على الصفحات التي تعرض الإعلانات، بينما البحث سيظل مسموحًا به افتراضيًا.

الإعلان عبارة عن إشارة إلى أن مالك موقع الويب يقصد أن يصل الشخص إلى هناك ويشاهده – وهو شيء يمكن تحقيق الدخل منه ويغذي العمل. لذلك، في تلك الصفحات، نتعامل مع الاهتمام البشري باعتباره الهدف النهائي، ونبعد الروبوتات التي قد تمنع هذا الاهتمام (على سبيل المثال، روبوتات التدريب والوكلاء). ومن ناحية أخرى، يعد البحث هو السلوك الذي يعيد الزائرين بشكل طبيعي، ونعتقد أنه من مصلحة معظم مالكي المواقع السماح بذلك.

هناك تغيير آخر سيتم تطبيقه في 15 سبتمبر وهو أن برامج الزحف متعددة الأغراض (خاصة تلك التي تجمع بين البحث والتدريب) سيتم السماح بها/حظرها وفقًا لجميع سلوكياتها، تماشيًا مع دعوتنا إلى الشفافية لأصحاب مواقع الويب. نظرًا لأنه سيتم فرض الإعدادات الافتراضية من خلال القواعد المعمول بها الأكثر تقييدًا، فسيتم حظر برامج الزحف متعددة الأغراض مثل Googlebot وApplebot وBingBot من قبل العملاء الذين اختاروا حظر التدريب (إما من خلال الخيارات الجديدة لإدارة حركة مرور الذكاء الاصطناعي، أو من خلال خدمة Block AI bots القديمة).

بالطبع، يعد اختيار العميل أمرًا بالغ الأهمية: إذا أراد مالك موقع الويب إلغاء الاشتراك في هذه التكوينات الافتراضية الجديدة، فيمكنه ذلك بسهولة في إعدادات الأمان الخاصة بهم في أي وقت قبل 15 سبتمبر، وهو ما سيؤكد رغبتهم في عدم تطبيق تغييرات على برامج الزحف التدريبية التي تقوم أيضًا بالزحف لأغراض البحث. سنستمر أيضًا في إخطار العملاء بالتغيير القادم على الإعدادات الافتراضية مع اقترابنا من 15 سبتمبر للتأكد من أن العملاء الذين يرغبون في اختيار إعدادات مختلفة عن الإعدادات الافتراضية لديهم الفرصة للقيام بذلك.

BotBase: مستوى جديد من الرؤية لعملاء المؤسسات

يسعدنا أيضًا إطلاق تحديث رئيسي للرؤية كميزة جديدة لإدارة برامج Enterprise Bot. مع نمو دليل Cloudflare للروبوتات المتعقبة، زادت أيضًا الرغبة في إدارة هذه الروبوتات في مجموعات معقولة وفهم المزيد من التفاصيل حول روبوت معين.

نقدم BotBase، وهي قاعدة بياناتنا الجديدة التي تتعقب جميع الروبوتات المعروفة، بما في ذلك الروبوتات والوكلاء الذين تم التحقق منهم. توفر قاعدة البيانات هذه عرضًا شاملاً وقابلًا للبحث لدليل الروبوتات الخاص بنا بالكامل، مباشرة على لوحة تحكم Cloudflare. نحن نتعامل الرؤية أولًا، ولكن، في وقت لاحق من هذا العام، سنقوم بتوسيع BotBase لتوفير مركز تحكم مباشر للمحتوى الآلي المعروف على موقع الويب الخاص بك.

باستخدام هذا العرض الجديد، يمكن لعملاء Enterprise Bot Management رؤية الكتالوج الكامل لجميع الروبوتات/الوكلاء الذين تم التحقق منهم ومكان تصنيفهم في هذا التصنيف المحدث – وهو عرض لم نعرضه ديناميكيًا على لوحة معلومات Cloudflare من قبل. يمكن أيضًا للعملاء الذين يريدون استهداف روبوت معين بدقة تصفية كل حركة المرور من هذا الروبوت بسهولة، بالإضافة إلى نسخ معرف الكشف لاستخدامه في قواعد الأمان. كل هذا أصبح الآن مباشرًا ضمن صفحة مخصصة، يمكن الوصول إليها من خلال بطاقة تكوين إدارة الروبوتات.

أثناء قيامنا ببناء BotBase، أردنا أن نأخذ في الاعتبار جميع أجزاء المعلومات التي من شأنها أن تسمح لنا ببناء رؤى قوية وقابلة للتطوير من روبوت إلى آخر. واحدة من هذه القطع هي حجر الزاوية لتصنيفنا المحدث، وهو بناءً على ما قد يفعله الروبوت على موقعك – سلوكه. نقوم بفصل هذه التصنيفات كما هو موضح أدناه، ويتم تصنيف كل روبوت بواحد أو أكثر من هذه السلوكيات.

  • البحث: الزحف لفحص موقعك لمساعدته على الظهور في نتائج محرك البحث.
  • العامل: الوكلاء الموجهون من قبل المستخدم يزورون الصفحة نيابة عن الإنسان.
  • التدريب: الزحف لتدريب النماذج أو تحسينها.
  • الصفقة: إجراءات الخروج نيابة عن المستخدمين.
  • جمع البيانات: يتضمن تجريف الأسعار، وجمع المعلومات الاستخبارية التنافسية، وتحليلات الطرف الثالث.
  • اختبار الأمان: يشمل فحص الثغرات الأمنية واختبار الاختراق.
  • تحسين محركات البحث: زحف تحسين محركات البحث (SEO)، وتدقيق الموقع، والتحقق من إمكانية الوصول.
  • التحقق من الإعلانات: التحقق من موضع الإعلان، واكتشاف الاحتيال في الإعلانات.
  • الاجتماعية / معاينة الرابط: معاينات الارتباط للمنصات الاجتماعية وتطبيقات المراسلة.
  • جلب الخلاصات: يتضمن قارئات RSS ومجمعات البودكاست وروبوتات موجز الأخبار.
  • المراقبة والعمليات: يتضمن مراقبة وقت التشغيل وخطافات الويب والفحوصات الصحية.

تشير التصنيفات البحث، العامل، والتدريب إلى الخيارات الجديدة القابلة للتكوين المتوفرة لجميع العملاء.

كيف يستخدم الزاحف المحتوى الخاص بي؟

هناك معلومة أخرى سمعناها وهي مهمة لعملائنا وهي استخدام محتوى الروبوت – ما قد يحتفظ به الروبوت ويعيد مشاركته بعد أن يقوم بالزحف إلى المحتوى الخاص بك. ولمعالجة هذه المشكلة، نقوم ببناء قدرات لعملاء إدارة الروبوتات للاختيار والحظر بناءً على استخدام المحتوى. يمكن ضبط هذا الإعداد على أحد المستويات الثلاثة، من الأقل إلى الأكثر سماحًا:

  • immediate – تفاعل، لكن لا تخزن ولا تعيد استخدام أي شيء.
  • reference (افتراضي) – الفهرس والمقتطفات والروابط الخلفية.
  • full – تلخيص وإعادة إنتاج.

يمكن دمج هذه القيم مع تصنيفات الروبوتات للتعبير عن قواعد دقيقة، مثل السماح لجميع الروبوتات المستخدمة للبحث و تحسين محركات البحث و التحقق من الإعلانات، ولكن فقط حتى مستوى استخدام المرجع (reference). يتيح ذلك لأصحاب مواقع الويب اتخاذ القرارات في مجموعات معقولة بدلًا من إدارة قواعد الروبوت الفردية.

لمزيد من الدعم، بدءًا من اليوم، نقوم باختبار إشارة جديدة، use، التي تمتد إشارات المحتوى وتعيش في ملف robots.txt الخاص بك. يؤدي هذا إلى توسيع الحقول الثلاثة للإصدار الأول من إشارات المحتوى بحقل اختياري رابع يعبر عن نفس التفضيل المذكور أعلاه: use=immediate، use=reference، أو use=full.

كما هو الحال مع جميع العناصر الأخرى المدرجة في ملف robots.txt، تشير قيم استخدام المحتوى إلى مالك موقع الويب التفضيل، بدلًا من إصدار الكتل مباشرةً. نعمل الآن على إضافة دعم لهذا الامتداد: جميع العملاء الذين قاموا بالفعل بتمكين ملف robots.txt المُدار — الذي يُسبق التفضيل لملف robots.txt الذي يعتبر الزحف للبحث أمرًا مقبولًا، ولكن الزحف للتدريب ليس كذلك — سيكون لديهم الآن التفضيل الإضافي وهو use=reference تمت إضافتها إلى ملف robots.txt الخاص بهم.

مثال على محتويات ملف robots.txt المُدار بواسطة Cloudflare مع قيم إشارات المحتوى الأصلية:

# Cloudflare Managed content with original Content Signals

User-agent: *

Content-Signal: search=yes,ai-train=no

Allow: /

مثال على محتويات ملف robots.txt المُدار بواسطة Cloudflare مع المعلمة المضافة:

# Cloudflare Managed content with the new content-use signal

User-agent: *

Content-Signal: search=yes,ai-train=no,use=reference

Allow: /

لقد بدأنا أيضًا في تتبع استخدامات المحتوى لكل روبوت في BotBase، وعندما نكتشف أن أحد الروبوتات يسيء استخدام هذه الإشارات، فإنه سيفقد حالة التحقق، مما يؤدي إلى عدم السماح به بعد الآن. اليوم، لا يمكن أن تتمتع الروبوتات التي تتكاثر بالكامل بحالة التحقق.

ماذا يعني أن يتم التحقق من الروبوت؟

تحديد مفهوم التحقق يتم تحديثه ليعكس التغييرات القادمة على السماح والحظر الأساسيين بشكل افتراضي. سابقًا، جميع الروبوتات التي تم التحقق منها كانت مسموحًا بها افتراضيًا، وهو ما انعكس في أساسيات وضع قتال الروبوتات وعروضنا لعملاء Enterprise Bot Management.

بدءًا من اليوم، نقوم بتعديل هذا لإضافة فارق بسيط: لا تزال الروبوتات التي لم يتم التحقق منها محظورة افتراضيًا، لكننا لم نعد نعتبر تم التحقق منها مسموحًا بها افتراضيًا. الآن، يجعل التصنيف تم التحقق منها الروبوت مسموحًا بفئته ذات الصلة، مما يعني الفئة المسموح بها (على سبيل المثال، السماح بالبحث) سيحدد ما هو مسموح له بالوصول إلى موقع الويب.

لتحقيق التوازن في هذا التغيير، نحن نفتح عملية التحول إلى روبوت تم التحقق منه، ونجعله أكثر شفافية أيضًا. لـ التحقق من روبوت، يحتاج مشغل الروبوت إلى إظهار شيئين: أن تمثل نفسك بأمانة، و لا تسيء استخدام الوصول الذي يكسبه الصدق. ولتسهيل الأمر على مشغلي الروبوتات، نقوم حاليًا ببناء أدوات إدارة لمشغلي الروبوتات لضمان تمثيلهم بدقة بشكل أفضل من خلال نظام تصنيف Cloudflare (سيتم الإعلان عنه في المستقبل القريب).

تجربة الثقة المتعدية

قطعة أخرى: الروبوت (أو الوكيل) الموجود عند باب منزلك لا يتم تشغيله بشكل متزايد من قبل الشركة التي قامت بإنشائه. تقوم منصة مثل Cloudflare Developer Platform بتشغيل العمليات الآلية لآلاف المشغلين المختلفين في وقت واحد، بدءًا من المؤسسات إلى المطور الذي لم تسمع عنه من قبل. قد تثق في Stripe، لكنك لا تثق بالضرورة في كل من قام بتوصيل أدوات Stripe في مشروع عطلة نهاية الأسبوع.

نحن نطلق على حالة (مالك الموقع ← الشركة المالكة للبوت ← المستخدم النهائي) مسألة الثقة المتعدية، ونحن نقترح استخدام الرأس المعاد توجيهه الحالي كما هو محدد في RFC 7239 الذي يتوافق مع الطلب ويسمح لـ مكونات الوكيل بالكشف عن المعلومات المفقودة في عملية الوكيل.

هذا مشابه لما يفعله X-Forwarded-For لعناوين IP، أو X-Forwarded-Host للحفاظ على رأس المضيف الأصلي. لذلك عندما يقول صاحب الموقع: اسمح لهذا المشغل، فسيظل هذا التفضيل قائمًا، سواء أتى المشغل إليك مباشرة أو من خلال ثلاث طبقات من الوسطاء الموثوق بهم. مزيد من التفاصيل يمكن العثور عليها في وثائقنا، مع مثال مختصر لإظهار التنسيق أدناه.

Forwarded: for=openai

عند إضافة الامتداد مع استخدام المحتوى الذي تمت مناقشته أعلاه، ستبدو إضافة الرأس كما هو موضح أدناه، مع تحديد كيفية استخدام المشغل للمحتوى الذي يصل إليه:

Forwarded: for=openai;use=reference

وهذا أيضًا ينسجم مع نموذج الحوافز الذي نريد تعزيزه. يعد فقدان حالة الثقة عبر أكثر من 20% من نطاقات الويب التي تقف خلف Cloudflare بمثابة رادع قوي. تصبح الثقة شيئًا يمكنك حمله معك، وشيئًا يمكن أن تخسره.

ومع ذلك، بينما تمتزج حركة الروبوتات مع حركة المرور البشرية، فمن الممكن أن نظام الثقة المتعدية هذا لا يتجاوز المستخدمين الذين يمكنهم تحمل تكلفة التعرف عليهم. تساعد الإجراءات التي نقترحها اليوم على نقل الثقة، لكنها لن تناسب شبكة الويب بأكملها إلى الأبد. تحتاج مصادر صغيرة لحركة المرور إلى الخصوصية، ويجب أن تكون الشركات التي ترغب في الحفاظ على التزامات الخصوصية الخاصة بها قادرة على استكشاف العناصر الأساسية العادلة لمستقبل الإنترنت الوكيل، مثل تحديد المعدل الخاص.

حدد شروطك اليوم

هذه تغييرات صغيرة تتحرك في نفس الاتجاه: يتمتع مالكو المواقع بمزيد من التحكم في من يستخدم المحتوى الخاص بهم وكيف. ونعتقد أن الإعدادات الافتراضية الجديدة التي ناقشناها اليوم وسننفذها قريبًا هي تلك التي تشجع الشفافية وتعكس بشكل أكبر الاتجاه الذي يتجه إليه العالم.

بالطبع، ستستمر المد والجزر في الويب في التحول تحتنا، وسنواصل التكيف معها. لكن الاتجاه لن يتغير، لأنه هو الاتجاه الذي بدأت به Cloudflare: نظام بيئي للويب مبني على الثقة. حيث يمكن للأشخاص الذين يصنعون الأشياء أن يقرروا كيفية استخدامها – والمكان الذي يكسبك فيه الصدق بشأن ما تفعله مزيدًا من الوصول، وليس أقل.

أصبحت هذه الخيارات الجديدة لإدارة حركة مرور الذكاء الاصطناعي متاحة الآن، ويمكن تهيئتها من قبل جميع العملاء الحاليين في إعدادات منطقتهم. ألا تستخدم Cloudflare بعد؟ ابدأ مجانًا لتعيين عناصر التحكم في حركة المرور التي تريدها اليوم.

عيد استقلال محتوى سعيد.

الذكاء الاصطناعي ومستقبل الوظائف: فصل الواقع عن الضجيج
تيك توك وحماية الأطفال: اتهامات الاتحاد الأوروبي بقصور المنصة

Reactions

0
0
0
0
0
0
بالفعل كان رد فعل لهذا المنصب.

ردود الفعل