
أي زواحف الذكاء الاصطناعي تلتزم robots.txt فعلاً
اقرأ وثائق البائعين الأربعة أنفسهم فلن يكون الجواب نعم أو لا واحدة لكل شركة. فثلاثة يستثنون الجلب الذي يبدأه مستخدم من robots.txt وواحد لا، وحظر روبوت التدريب لدى شركة يترك روبوت بحثها يعمل.
يجيب كل دليل عن زواحف الذكاء الاصطناعي عن هذا السؤال بنعم أو لا واحدة لكل شركة. واقرأ وثائق البائعين الأربعة أنفسهم يظهر نمط أدق: ثلاثة منهم يستثنون الجلب الذي يبدأه مستخدم من robots.txt، وواحد لا يستثنيه. وذلك التمييز هو الجواب كله، وهو غير مذكور في أي موضع من الصفحة الأولى للنتائج.
والمنطق وراء الاستثناء متسق عند الثلاثة. فالجلب الذي يحدث لأن شخصاً كتب سؤالاً يُعامَل كزيارة ذلك الشخص للصفحة، لا كزحف يفهرسها، وrobots.txt يحكم الزواحف. وسواء وجدت ذلك مقنعاً أم لا فتلك مسألة منفصلة عن كونه صحيحاً، وهو صحيح.
الوكلاء، وما يذكره كل بائع
| الوكيل | ماذا يفعل | يلتزم robots.txt |
|---|---|---|
GPTBot | OpenAI، بيانات التدريب | نعم |
OAI-SearchBot | OpenAI، يظهر المواقع في بحث ChatGPT | نعم |
OAI-AdsBot | OpenAI، يفحص الصفحات المقدمة كإعلانات | نعم |
ChatGPT-User | OpenAI، يزور صفحة حين يسأل مستخدم | لا. OpenAI: القواعد "قد لا تنطبق" |
ClaudeBot | Anthropic، بيانات التدريب | نعم |
Claude-SearchBot | Anthropic، جودة نتائج البحث | نعم |
Claude-User | Anthropic، يزور صفحة حين يسأل مستخدم | نعم، بخلاف نظرائه |
PerplexityBot | Perplexity، فهرس البحث | نعم |
Perplexity-User | Perplexity، يزور صفحة حين يسأل مستخدم | لا. "يتجاهل عموماً قواعد robots.txt" |
Google-Extended | Google، الانسحاب من تدريب Gemini والإسناد | نعم |
Google-Agent وGoogle-GeminiNotebook وGoogleMessages | Google، يجلب صفحة لمستخدم | لا. Google: إنها "تتجاهل عموماً قواعد robots.txt" |
حظر وكيل واحد لا يحظر الآخرين
والخطأ الثاني في معظم ملفات robots.txt هو معاملة الشركة كزاحف واحد. فكل بائع يشغّل وكيلاً للتدريب وآخر للبحث وثالثاً للجلب الذي يبدأه مستخدم، وهي قابلة للمخاطبة منفصلة. فمنع ClaudeBot يحظر التدريب ويترك Claude-SearchBot وClaude-User دون مساس. ومنع GPTBot لا يفعل شيئاً لـ OAI-SearchBot.
وذلك الفصل مفيد لا مزعج، لأنه يتيح لك التمييز الذي يريده أغلب أصحاب المواقع فعلاً: ابقَ خارج مجموعة التدريب، وابقَ داخل الإجابات. اسمح لوكلاء البحث، وقرر بشأن وكلاء التدريب بشروطك، وافهم أن الوكلاء الذين يبدأهم المستخدم ليسوا قراراً تملكه على ثلاث من المنصات الأربع.
وملف هذا الموقع نفسه يسمح لأربعة عشر وكيلاً ويمنع /api/ فقط. وقد كشفت كتابة هذه المقالة ثغرة فيه: فـ OAI-AdsBot غير مدرج، لأنه لم يكن موجوداً حين كُتب الملف. وتلك هي تكلفة الصيانة العادية لملف كهذا، وسبب إعادة قراءة صفحات البائعين لا دليل.
ما لا يستطيع robots.txt فعله هنا
- لا يستطيع إيقاف جلب يبدأه مستخدم عند OpenAI أو Perplexity أو Google. ولا تستطيع ذلك إلا ضوابط من جانب الخادم، وحظر هؤلاء يعني أن من يسأل عن نشاطك يحصل على إجابة بُنيت دون صفحتك.
- ولا يتحكم في ظهورك في ميزات Google الذكية. فذلك تحكمه توجيهات المعاينة والفهرسة العادية:
nosnippetوdata-nosnippetوmax-snippetوnoindex. ولا يوجد انسحاب خاص بالذكاء الاصطناعي. - وليس موضعاً يفيد فيه
llms.txt. فـ Google تذكر أنها تتجاهل ملفات نصوص الذكاء الاصطناعي في البحث، بما في ذلك ميزاتها التوليدية، وأنها لا تضر ولا تنفع. فاحتفظ بواحد لخدمات أخرى إن شئت؛ ولا تعدّه أداة تأثير.
وحين يصح الملف ينتقل السؤال إلى ما يتلقاه أولئك الوكلاء فعلاً حين يصلون، وهي مشكلة مختلفة وقابلة للقياس: انظر ما الذي يتلقاه زاحف الذكاء الاصطناعي فعلاً من موقعك. أما الصورة الأوسع لكيفية صنع الاستشهادات فتقع في كيف تقرر محركات البحث الذكية ما تستشهد به وكيف يختار ChatGPT الأنشطة التي يوصي بها.

