WordPress-də AI Kraulerləri Necə Bloklamalı (Dürüstcə)
GPTBot-un WordPress saytınızı taramasının qarşısını almaq üçün robots.txt faylınıza bu sətirləri əlavə edin:
Nəşr olundu
GPTBot-un WordPress saytınızı taramasının qarşısını almaq üçün robots.txt faylınıza bu sətirləri əlavə edin:
User-agent: GPTBot
Disallow: /
Qaydalara əməl edən kraulerlər üçün bütün həll budur. Amma nə etdiyinizə dair özünüzlə dürüst olun: robots.txt bir hasar deyil, sadəcə bir xahişdir. OpenAI-nin GPTBot-u faylı yükləyir və ona tabe olur. Standarta hörmət etməyən bir skreyper isə eyni faylı yükləyir və içindəki hər sətri saymır. Bu qaydaya kökləmək üçün bir günorta sərf etməzdən əvvəl bu fərqi gözünüz önündə saxlayın.
Əsas AI kraulerləri bir dəfəyə əhatə etmək istəyirsinizsə, ən çox rast gəlinən user-agent tokenləri bunlardır:
User-agent: GPTBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Bytespider
Disallow: /
GPTBot OpenAI-nin təlim krauleri, CCBot Common Crawl-dur (bir çox model dolayı yolla onun üzərində təlim keçir), ClaudeBot Anthropic-in, Google-Extended Google-un AI təlimi tokeni, Bytespider isə ByteDance-in kraulerdir. Diqqət edin ki, bunlardan ikisi artıq nəzakətli-xahiş modelini pozur: Bytespider və PerplexityBot-un hər ikisinin özlərinə qadağa qoyulmuş saytları taradığı açıq şəkildə sənədləşdirilib. Onları siyahıya salmaq dürüst botlara qarşı hələ də kömək edir; kim olduqları barədə artıq yalan danışanlara isə heç bir təsiri yoxdur.
WordPress robots.txt-ni əslində necə təqdim edir
Əksər insanların dəyişiklikləri məhz burada səssizcə heç bir nəticə vermir. Veb kök qovluğunuzda fiziki robots.txt faylı yoxdursa, WordPress onu anında generasiya edir. Sorğu wp-includes/functions.php içindəki do_robots() tərəfindən idarə olunur və çıxış robots_txt filtrindən keçir. Parametrlər → Oxu bölməsindəki “Axtarış sistemlərini bu saytı indeksləməkdən çəkindir” qutucuğu blog_public seçimini dəyişdirir və məhz bu, həmin virtual faylın Disallow: / yaymasına səbəb olur.
Beləliklə, AI-krauler qaydalarını proqramla əlavə edə bilərsiniz:
add_filter( 'robots_txt', function ( $output, $public ) {
$output .= "User-agent: GPTBot\nDisallow: /\n";
return $output;
}, 10, 2 );
Saatlarınızı yeyən tələ budur: veb kök qovluğunuzda statik robots.txt faylı yaranan andan Apache və ya nginx həmin faylı birbaşa təqdim edir və WordPress heç vaxt işə düşmür. robots_txt filtri, Yoast/Rank Math robots redaktoru, Oxu parametri — hamısı yan keçilir. robots.txt-ni bir plaginlə redaktə etdinizsə, amma canlı fayl heç dəyişmədisə, demək olar ki, həmişə səbəb budur. https://yoursite.com/robots.txt ünvanını gizli pəncərədə yoxlayın və qoyduğunuzu düşündüyünüz şeylə müqayisə edin. Diskdə real fayl varsa, həmin faylı redaktə edin; filtrin heç bir əhəmiyyəti yoxdur.
Düzəlişi ardıcıllıqla etmək
Birincisi, təmiz qaydalar yazın. Sintaksisi və krauler siyahısını düzgün tərtib edin ki, təsadüfən Googlebot-u bloklamayasınız. Bizim robots.txt generatorumuz AI-krauler blokunu sizin üçün qurur və yapışdırılacaq dəqiq faylı göstərir; bu da virtual-fiziki qarışıqlığını aradan qaldırır, çünki sonda tək bir etibarlı fayl əldə edirsiniz.
İkincisi, canlı olduğunu təsdiqləyin. URL-i birbaşa yükləyin. Plaginin ön izləmə panelinə güvənməyin.
Üçüncüsü, nəzakətli xahiş deyil, məcburiyyət lazımdırsa, yığının yuxarısına qalxın. robots.txt tətbiq qatında yerləşir və botun xoş niyyətindən asılıdır. Bağlantını əslində rədd etmək üçün serverdə user-agent-ə görə bloklayın. .htaccess-də:
<IfModule mod_rewrite.c>
RewriteEngine On
RewriteCond %{HTTP_USER_AGENT} (GPTBot|CCBot|ClaudeBot|Bytespider) [NC]
RewriteRule .* - [F,L]
</IfModule>
Bu, həmin user-agent-ləri göndərən hər şeyə 403 qaytarır. Bizim .htaccess generatorumuz bu qaydanı yığa bilər. Ancaq məhdudiyyətini anlayın: user-agent-lər asanlıqla saxtalaşdırıla bilir, ona görə də bu yalnız özünü tanıtmaq qədər dürüst olan botları dayandırır — bunlar isə artıq robots.txt-ə tabe olan həmin botlardır. Həqiqətən möhkəm variant təsdiqlənmiş krauler kimliyinə və ya IP diapazonuna görə bloklayan CDN və ya WAF-dır. Cloudflare-in bir kliklik “Block AI Scrapers and Crawlers” idarə olunan qaydası bunun ən az səy tələb edən versiyasıdır və sorğu ümumiyyətlə WordPress-ə çatmazdan əvvəl kənarda (edge-də) işləyir.
Nə etməməli
Google-Extended-i AI Overviews-dan kənarda qalmağınızı təmin edir deyə bloklamayın. Düzəldilməyə dəyər yanlış təsəvvür budur. Google-Extended bir krauler deyil, məhsul tokenidir. O yalnız məzmununuzun Gemini modellərini təlim keçmək və əsaslandırmaq üçün istifadə olunub-olunmamasını idarə edir. Google-un öz sənədlərinə görə, onun səhifələrinizin necə taranmasına, indekslənməsinə və ya Google Axtarışında sıralanmasına heç bir təsiri yoxdur. AI Overviews isə Googlebot-un taradığı adi Axtarış indeksindən qurulur — Google-Extended-dən deyil. Google-Extended-i bloklamaq sizi AI Overviews-dan çıxarmayacaq və Axtarışda bir mövqe belə itirməyinizə səbəb olmayacaq. AI Overviews-dan kənarda qalmağın yeganə yolu Googlebot-u bloklamaq və ya səhifəni noindex etməkdir ki, bu da sizi Axtarışdan tamamilə silir. Bu, demək olar ki, heç vaxt istəyəcəyiniz bir güzəşt deyil.
robots.txt-ni təhlükəsizlik nəzarəti kimi qəbul etməyin. O ictimaidir və məsləhət xarakteri daşıyır. İçində /wp-admin/ və ya hər hansı gizli yolu sadalamaq sadəcə haraya baxmaq lazım olduğunun xəritəsini dərc edir. Real endpoint-ləri disallow sətri ilə deyil, autentifikasiya ilə qoruyun.
noai / noimageai meta teqlərinə güvənməyin. Onlar təklif edilib, amma standartlaşdırılmayıb və yalnız bir neçə platforma onlara hörmət edir. Onlar ümumi müdafiə vasitəsi deyil.
“AI-ni blokla” plagininin robots.txt yazmaqdan artıq bir şey etdiyini düşünməyin. Onların əksəriyyəti əl ilə yaza biləcəyiniz eyni sətirləri yazır və eyni məhdudiyyəti miras alır. Ona güvənməzdən əvvəl plaginin əslində nəyi dəyişdiyini oxuyun.
Hələ də ilişib qalmısınız?
Dəyişiklikləriniz görünmürsə, cavab demək olar ki, həmişə veb kök qovluğunda WordPress-in virtualını üstələyən azmış fiziki robots.txt faylıdır — URL-i birbaşa yükləyin və yoxlayın. Qaydalara əməl edən botlar yox olub, amma skreyperlər sizə hücum etməkdə davam edirsə, robots.txt-nin edə biləcəyinin tavanına çatmısınız və növbəti addım nəzakətlə xahiş etmək yerinə təsdiqlənmiş kimliyə görə bloklayan WAF və ya CDN qaydasıdır.
FAQ
Suallar
ChatGPT-in WordPress saytımı taramasını necə dayandıra bilərəm?
robots.txt faylınıza “User-agent: GPTBot” sətrini, ardınca isə “Disallow: /” sətrini əlavə edin. GPTBot OpenAI-ın təlim tarayıcısıdır, həmin faylı yükləyir və ona tabe olur. Yadda saxlayın ki, robots.txt bir hasar deyil, sadəcə xahişdir — standarta hörmət etməyən skreyper eyni faylı yükləyir və içindəki hər sətri saymır.
robots.txt dəyişikliklərim WordPress-də niyə görünmür?
Demək olar ki, həmişə səbəb veb kökündə fiziki robots.txt faylının mövcud olmasıdır. Həmin fayl var olan andan Apache və ya nginx onu birbaşa verir, WordPress ümumiyyətlə işə düşmür, ona görə də robots_txt filtri, Yoast və ya Rank Math redaktoru, həmçinin Parametrlər bölməsindəki Oxu seçimi tamamilə yan keçilir. Bunun əvəzinə diskdəki əsl faylı redaktə edin.
Google-Extended-i bloklamaq Google-dakı mövqelərimə zərər verirmi?
Xeyr. Google-Extended tarayıcı deyil, məhsul tokenidir və Google-un öz sənədlərinə görə səhifələrinizin Google Axtarışında taranmasına, indekslənməsinə və sıralanmasına heç bir təsiri yoxdur. O yalnız məzmununuzun Gemini modellərinin öyrədilməsində istifadə olunub-olunmamasına nəzarət edir və onu bloklamaq sizi AI Overviews nəticələrindən çıxarmayacaq.
Süni intellekt tarayıcıları həqiqətənmi robots.txt qaydalarına əməl edir?
Bəziləri edir, bəziləri yox. GPTBot robots.txt faylını yükləyir və ona tabe olur, lakin Bytespider və PerplexityBot-un hər ikisinin özlərinə qadağa qoyulmuş saytları taradığı açıq şəkildə sənədləşdirilib. Bütün user-agent tokenlərini sadalamaq vicdanlı botlara qarşı yenə də faydalıdır, artıq kim olduğu barədə yalan danışanlara qarşı isə heç nə vermir.
Süni intellekt botlarını robots.txt əvəzinə server səviyyəsində necə bloklaya bilərəm?
GPTBot, CCBot, ClaudeBot və Bytespider üçün 403 qaytaran mod_rewrite qaydası ilə .htaccess faylında user agent üzrə bloklayın. User agent dəyərini saxtalaşdırmaq çox asandır, ona görə bu yalnız özünü dürüst təqdim edən botları saxlayır. Tarayıcı kimliyini və ya IP diapazonunu doğrulayaraq bloklayan CDN yaxud WAF daha etibarlı seçimdir.