Loni se blokování AI botů zdálo jako jasný krok. Cloudflare to zjednodušil na jedno kliknutí. Kliklo na to hodně lidí.
Za pár týdnů začne tohle kliknutí blokovat Googlebota.
Žádné varování. Žádná preference v textovém souboru. Cloudflare zablokuje požadavek ještě předtím, než si crawler stihne přečíst váš robots.txt.
Co se vlastně mění
Cloudflare teď třídí boty podle chování. Search, Agent, Training.
Za pár týdnů se změní dvě věci. Ta, o které se píše všude, je nové výchozí nastavení. Novým doménám Cloudflare zablokuje Training a Agent na stránkách s reklamou. Jen novým doménám. Pokud už váš web na Cloudflare běží, tahle změna se vás nedotkne.
Ta druhá je důvod, proč tohle čtete.
Crawlery se posuzují podle všeho, co dělají, ne podle jedné věci. Platí to nejpřísnější pravidlo.
Googlebot prochází web pro Search. Prochází ho i pro Training. Totéž platí pro Applebot a BingBot.
Takže pokud máte zablokovaný Training, máte zablokovaného i Googlebota. Cloudflare v oznámení jmenuje všechny tři boty.
Vztahuje se to i na starý přepínač „Block AI bots“. Nových nastavení jste se nemuseli ani dotknout. Počítá se i to staré tlačítko.
Zapnuli jste ho loni. Za pár týdnů přijdete o Googlebota.
Nejdřív klesne procházení. Pak indexace. Pak pozice. Search Console se zaplní chybami, které ukazují na váš server. Ne na dashboard, který jste od loňského léta neotevřeli.
Proč to dělají
Skoro každý projekt, který vedu, běží za Cloudflare. Pořád je to nejlepší infrastrukturní platforma, jakou znám. Jedno špatné výchozí nastavení na tom nic nezmění.
A jejich argument obstojí.
Tentýž crawler sbírá obsah pro vyhledávání i pro trénování zároveň. Takže nemůžete říct trénování ne, aniž byste přišli o vyhledávání. To nikdy nebyla férová volba.
Cloudflare se rozhodl, že se trénování už nebude schovávat za vyhledávání. Když Google nerozdělí crawler, Cloudflare ho bere jako obojí.
Sám se v tom ale nemůžu rozhodnout.
Oddělené crawlery jsou správný princip. Když si berete můj obsah na tři účely, měl bych mít možnost jednomu říct ano a druhému ne.
Ani argument Googlu není hloupý. Stránku už jednou stáhli. Stáhnout ji znovu pro jiný účel znamená víc požadavků a větší zátěž pro můj server, a to kvůli obsahu, který už mají.
Projít stránku jednou a využít ji víckrát je k vašemu webu šetrnější. Kdo viděl, jak mu AI crawlery buší do serveru, ví, proč na tom záleží.
Obě strany mají kus pravdy. Rozdělením crawleru získáte kontrolu, ale zaplatíte za ni přenesenými daty. Nikdo zatím nepřišel s variantou, která by vyřešila obojí.
Jedno je jisté. Cloudflare si vybral stranu. Tlak míří na Google. Odnesete to i vy.
Co udělat do 15. září
Otevřete si nastavení zabezpečení v Cloudflare. Zkontrolujte, jestli nemáte zablokovaný Training, ať už přes nová nastavení AI provozu, nebo přes starý přepínač.
Pokud ano a chcete, aby Googlebot dál procházel váš web, nastavte si výjimku. Cloudflare na to má samostatné nastavení: víceúčelové crawlery pak nechá být. Zapnout si ji můžete jen do toho data.
A pak ta větší otázka. Co vám blokování trénování vlastně přinese?
Pokud je vaším produktem obsah, blokování trénování je reálné byznysové rozhodnutí. Tu výjimku stejně potřebujete. Blokovat trénování je jedna věc. Přijít o Google je druhá. Ještě do září se dá udělat to první bez toho druhého.
Takhle bych to nastavil já. Nastavte si výjimku z pravidla pro víceúčelové crawlery, aby Googlebot dál procházel váš web. A trénovací crawlery blokujte radši podle jména. Robots.txt na ty, které ho respektují, a pravidlo na edge na ty, které ne.
Jednoúčelové boty zablokujete podle jména. Víceúčelové necháte být. Google vám zůstane a trénování zůstane venku.
Přiznejte si ale upřímně, jestli se to vůbec týká vás. Pro většinu webů to reálné rozhodnutí není. SaaS, distributor, e-shop. Za čtení vašeho obsahu by stejně nikdo nezaplatil. Blokování trénování vás jen vyřadí z dalšího modelu.
Řádek, který nedělá nic
Pokud máte zapnutý managed robots.txt, Cloudflare vám do souboru zapsal blok, který jste nenapsali vy. Text, který zní jako právní dokument, a pod ním řádek typu Content-Signal: search=yes,ai-train=no.
Vypadá to, že to máte pod kontrolou. Jenže nemáte.
Muellera se na to nedávno ptali na Redditu. Pokud ví, nepoužívá to žádný crawler. Ani žádný LLM. Nemá to vůbec žádný účinek. Jen vám to nafukuje soubor.
Cloudflare to ostatně ani nepopírá. Jeho vlastní dokumentace označuje content signals za preferenci, „místo přímého blokování“.
Pokud trénování povolujete, ty řádky můžete nechat být. Ničemu neublíží. Jen nic nedělají.
Pokud ho blokujete, nespoléhejte se na ně. Blokujte crawlery radši podle jména.
Chci, aby to fungovalo
Ta myšlenka není špatná. Právě proto je to frustrující.
Robots.txt vznikl proto, aby řekl, kam crawler smí. Nikdy nevznikl proto, aby řekl, co se s vaším obsahem stane potom. Ta mezera je reálná a každý měsíc se zvětšuje.
Řešení není na papíře složité. Cloudflare, Google, Microsoft a OpenAI v jedné místnosti a shoda na jedné sadě pravidel. Napsali by je lidé, kteří crawlery vyvíjejí. A dodržovala by se proto, že si je napsali sami.
Přesně tak kdysi vznikl robots.txt. Nikdo ho nevymáhal. Ti, na kterých záleželo, se prostě dohodli, že ho budou používat.
Takovou schůzku si moc nedokážu představit. Motivace táhnou opačným směrem. Google nemá důvod vám pomáhat říct trénování ne. Cloudflare nemá důvod čekat na Google.
Takže sázím na to, že to skončí v zákoně. Ne v syntaxi, kterou si vymyslela jedna firma. V reálném pravidle, za kterým stojí regulátor a které crawlery dodržují, protože musí. U autorských práv se Evropa pohnula jako první. Tohle půjde nejspíš stejnou cestou.
Cloudflare nemá špatný nápad, jen přišel moc brzy.
Někdo to ale musí napsat pro lidi. Zatím je to řádek s hodnotami oddělenými čárkou v souboru, který většina majitelů webů nikdy neotevřela. Pod odstavcem právního textu.
Zeptal jsem se pár kamarádů, kteří mají vlastní weby, co jim ten řádek ai-train=no na webu dělá. Nevěděl nikdo. Jeden ani netušil, že ho v robots.txt vůbec má.
Standard, který vám musí přeložit specialista na technické SEO, není hotový.
Postavte si ta dvě nastavení vedle sebe. To, které zní jako oficiální prohlášení, nedělá nic. To, které zní jako drobný technický detail, vám dokáže z webu vyhnat Googlebota.
Jedno z nich dostalo vlastní oznámení, právní rámec a generátor. To druhé dostalo odstavec.
Běžte si zkontrolovat nastavení.
Původní verze tohoto článku je anglická. Do češtiny je přeložená automaticky.

Martin Štěpánek
Konzultant enterprise technického SEO
Jsem konzultant enterprise technického SEO a vývojář. Přes deset let jsem web stavěl, než jsem ho začal opravovat, a produkční kód píšu dodnes. Čtu odpovědi, které váš web skutečně vrací, řeknu vám, které nálezy stojí za sprint, a opravu vašim vývojářům předám sám.
Newsletter o technickém SEO, který vývojáři i SEO specialisté opravdu dočtou
Jeden konkrétní problém rozebraný do konce a jasný názor, co s ním — porovnané s primární dokumentací i s tím, co vidím v auditech. A k tomu tři zprávy z posledních dvou týdnů, vybrané a vysvětlené.



Přihlásit se k odběru
Nové vydání každé dva týdny. Odhlásíte se jedním kliknutím.
Newsletter je pouze v angličtině