كيفية حظر زواحف الذكاء الاصطناعي في ووردبريس (بصراحة)
لإيقاف زحف GPTBot على موقع ووردبريس، أضف هذه الأسطر إلى ملف robots.txt الخاص بك:
نُشر
لإيقاف زحف GPTBot على موقع ووردبريس، أضف هذه الأسطر إلى ملف robots.txt الخاص بك:
User-agent: GPTBot
Disallow: /
هذا هو الحل الكامل بالنسبة للزواحف المهذّبة. لكن كن صادقًا مع نفسك بشأن ما فعلته للتو: ملف robots.txt هو طلب، وليس سياجًا. زاحف GPTBot التابع لـ OpenAI يجلب الملف ويلتزم به. أما الزاحف الذي لا يحترم المعيار فيجلب نفس الملف ويتجاهل كل سطر فيه. ضع هذا الفرق نصب عينيك قبل أن تقضي بعد الظهيرة كاملة في ضبط هذا الأمر.
إذا أردت تغطية أهم زواحف الذكاء الاصطناعي في خطوة واحدة، فإن رموز user-agent الشائعة هي:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Bytespider
Disallow: /
GPTBot هو زاحف التدريب التابع لـ OpenAI، وCCBot هو Common Crawl (الذي تتدرب عليه نماذج كثيرة لاحقًا)، وClaudeBot تابع لـ Anthropic، وGoogle-Extended هو رمز جوجل الخاص بتدريب الذكاء الاصطناعي، وBytespider تابع لشركة ByteDance. لاحظ أن اثنين من هذه الزواحف يخالفان بالفعل نموذج الطلب المهذّب: فقد جرى توثيق Bytespider وPerplexityBot علنًا وهما يزحفان على مواقع منعتهما صراحةً. إدراجهما لا يزال مفيدًا ضد الروبوتات الأمينة؛ لكنه لا يجدي شيئًا ضد تلك التي تكذب أصلًا بشأن هويتها.
كيف يقدّم ووردبريس ملف robots.txt فعليًا
هنا بالتحديد تكون تعديلات معظم الناس بلا أثر يُذكر. إذا لم يكن هناك ملف robots.txt فعلي في جذر موقعك، فإن ووردبريس يولّد واحدًا في الحال. يُعالج الطلب عبر الدالة do_robots() في ملف wp-includes/functions.php، ويمرّ الناتج عبر مرشّح robots_txt. أما خيار “منع محركات البحث من فهرسة هذا الموقع” ضمن الإعدادات ← القراءة فيبدّل قيمة blog_public، وهو ما يجعل ذلك الملف الافتراضي يُخرج Disallow: /.
لذا يمكنك إلحاق قواعد زواحف الذكاء الاصطناعي برمجيًا:
add_filter( 'robots_txt', function ( $output, $public ) {
$output .= "User-agent: GPTBot\nDisallow: /\n";
return $output;
}, 10, 2 );
وإليك المطبّ الذي يلتهم الساعات: في اللحظة التي يوجد فيها ملف robots.txt ثابت في جذر موقعك، يقدّم Apache أو nginx ذلك الملف مباشرةً ولا يعمل ووردبريس إطلاقًا. مرشّح robots_txt، ومحرّر robots في Yoast/Rank Math، وإعداد القراءة — كلها تُتجاوَز. إذا كنت قد عدّلت robots.txt عبر إضافة ولم يتغير الملف الحيّ أبدًا، فهذا هو السبب في الغالب الأعمّ. تحقق من https://yoursite.com/robots.txt في نافذة تصفّح خاصة وقارنه بما تظن أنك ضبطته. إذا كان هناك ملف حقيقي على القرص، فعدّل ذلك الملف؛ المرشّح لا صلة له بالأمر.
إصلاح المشكلة، بالترتيب
أولًا، اكتب قواعد نظيفة. اضبط بناء الجملة وقائمة الزواحف بشكل صحيح حتى لا تحظر Googlebot عن طريق الخطأ. مولّد robots.txt الخاص بنا يبني لك كتلة حظر زواحف الذكاء الاصطناعي ويعرض الملف الدقيق لنسخه، وهو ما يتجنّب الالتباس بين الملف الافتراضي والفعلي لأنك تنتهي بملف واحد مرجعي.
ثانيًا، تأكد أنه فعّال. اجلب الرابط مباشرةً. لا تثق بلوحة المعاينة في الإضافة.
ثالثًا، إذا أردت فرضًا فعليًا بدلًا من طلب مهذّب، انتقل إلى طبقة أعلى في المكدّس. ملف robots.txt يعيش في طبقة التطبيق ويعتمد على حسن نية الروبوت. ولرفض الاتصال فعليًا، احظر حسب user agent عند مستوى الخادم. في ملف .htaccess:
<IfModule mod_rewrite.c>
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (GPTBot|CCBot|ClaudeBot|Bytespider) [NC]
RewriteRule .* - [F,L]
</IfModule>
هذا يُرجع الرمز 403 لأي شيء يرسل تلك الـ user agents. مولّد htaccess الخاص بنا يمكنه تجميع هذه القاعدة. لكن افهم حدودها: الـ user agents يسهل انتحالها، لذا فهذا لا يوقف سوى الروبوتات الأمينة بما يكفي للتعريف عن نفسها — وهي نفس الروبوتات التي تلتزم أصلًا بـ robots.txt. الخيار المتين حقًا هو شبكة توصيل محتوى (CDN) أو جدار حماية تطبيقات ويب (WAF) يحظر حسب هوية زاحف مُتحقَّق منها أو نطاق عناوين IP. وقاعدة Cloudflare المُدارة بنقرة واحدة “Block AI Scrapers and Crawlers” هي أقل النسخ جهدًا من هذا، وتعمل عند الحافة، قبل أن يصل الطلب إلى ووردبريس أصلًا.
ما لا ينبغي فعله
لا تحظر Google-Extended ظنًّا أنه يبقيك خارج AI Overviews. هذا هو المفهوم الخاطئ الجدير بالتصحيح. Google-Extended رمز منتج، وليس زاحفًا. إنه يتحكم فقط فيما إذا كان محتواك يُستخدم في تدريب وإسناد نماذج Gemini. ووفقًا لوثائق جوجل نفسها، ليس له أي تأثير على كيفية زحف صفحاتك أو فهرستها أو ترتيبها في بحث جوجل. كما أن AI Overviews تُبنى من فهرس البحث العادي الذي يزحف عليه Googlebot — لا من Google-Extended. حظر Google-Extended لن يزيلك من AI Overviews، ولن يكلّفك مركزًا واحدًا في البحث. الطريقة الوحيدة للبقاء خارج AI Overviews هي حظر Googlebot أو وضع noindex على الصفحة، وهو ما يحذفك أيضًا من البحث بالكامل. وهذه مقايضة نادرًا ما تريدها.
لا تعامل robots.txt كأداة أمان. فهو عام واستشاري. إدراج /wp-admin/ أو مسار خاص فيه ما هو إلا نشر خريطة تدلّ على مواضع البحث. احمِ نقاط النهاية الحقيقية بالمصادقة، لا بسطر disallow.
لا تعتمد على وسوم noai / noimageai الوصفية. فقد جرى اقتراحها، لا اعتمادها كمعيار، ولا يحترمها سوى حفنة من المنصّات. إنها ليست دفاعًا عامًا.
لا تفترض أن إضافة “حظر الذكاء الاصطناعي” فعلت أكثر من كتابة robots.txt. معظمها يكتب نفس الأسطر التي يمكنك كتابتها يدويًا ويرث نفس القيود. اقرأ ما غيّرته الإضافة فعليًا قبل أن تثق بها.
ما زلت عالقًا؟
إذا لم تظهر تعديلاتك، فالجواب في الغالب الأعمّ هو وجود ملف robots.txt فعلي شارد في جذر الموقع يتجاوز الملف الافتراضي لووردبريس — اجلب الرابط مباشرةً وتحقق. وإذا اختفت الروبوتات الملتزمة لكن الزواحف تواصل مهاجمتك، فقد بلغت سقف ما يستطيع robots.txt فعله، والخطوة التالية هي قاعدة WAF أو CDN تحظر حسب هوية مُتحقَّق منها بدلًا من الطلب بلطف.
FAQ
أسئلة
كيف أمنع ChatGPT من الزحف على موقع WordPress؟
أضف السطر «User-agent: GPTBot» متبوعًا بـ «Disallow: /» إلى ملف robots.txt. فـ GPTBot هو زاحف التدريب التابع لـ OpenAI، وهو يجلب ذلك الملف ويلتزم به. لكن تذكّر أن robots.txt طلب لا سياج — فالزاحف الذي لا يحترم المعيار يجلب الملف نفسه ويتجاهل كل سطر فيه.
لماذا لا تظهر تعديلاتي على robots.txt في WordPress؟
في الغالب لأن ملف robots.txt فعليًا موجود في جذر الموقع. فما إن يوجد ذلك الملف حتى يقدّمه Apache أو nginx مباشرة ولا يعمل WordPress أصلًا، فيُتجاوز مرشّح robots_txt، ومحرّر Yoast أو Rank Math، وخيار الإعدادات ← القراءة، جميعها. عدّل الملف الحقيقي على القرص بدلًا من ذلك.
هل يضرّ حظر Google-Extended ترتيبي في جوجل؟
لا. فـ Google-Extended رمز منتج لا زاحف، وبحسب توثيق جوجل نفسها لا أثر له على كيفية زحف صفحاتك أو فهرستها أو ترتيبها في بحث جوجل. هو يتحكم فقط في استخدام محتواك لتدريب نماذج Gemini وإسنادها، وحظره لن يخرجك من AI Overviews.
هل تلتزم زواحف الذكاء الاصطناعي بـ robots.txt فعلًا؟
بعضها يلتزم وبعضها لا. فـ GPTBot يجلب robots.txt ويتبعه، أما Bytespider و PerplexityBot فقد جرى توثيقهما علنًا وهما يزحفان على مواقع منعتهما. إدراج كل رموز user-agent يبقى مفيدًا ضد الروبوتات الأمينة، ولا يجدي شيئًا ضد تلك التي تكذب أصلًا بشأن هويتها.
كيف أحظر روبوتات الذكاء الاصطناعي على مستوى الخادم بدل robots.txt؟
احظرها حسب user agent في ملف .htaccess بقاعدة mod_rewrite تعيد 403 لـ GPTBot و CCBot و ClaudeBot و Bytespider. وانتحال user agent سهل للغاية، فهذا لا يوقف إلا الروبوتات الأمينة بما يكفي لتعرّف عن نفسها. أما شبكة توزيع محتوى أو جدار حماية تطبيقات يحظر حسب هوية زاحف موثّقة أو نطاق IP فهو الخيار المتين.