Cloudflare uruchomił 15 września nowe ustawienie Disallow AI Training, które pozwala właścicielom stron odmówić wykorzystania treści do trenowania modeli AI bez odcinania Googlebota, Applebota i Bingbota od indeksowania. To odpowiedź na problem, który firma sama nagłośniła w lipcu: crawlery mieszanego przeznaczenia pobierają stronę raz i używają jej zarówno do wyszukiwarki, jak i do treningu, więc blokada jednego celu oznaczała dotąd blokadę obu. W oficjalnym komunikacie Cloudflare pisze, że nowa opcja działa dzięki statusowi Accountable, który otrzymały Google, Apple i Microsoft oraz operatorzy z rozdzielonymi botami: Amazon, Anthropic, Meta i OpenAI.
Kontekst: dlaczego blokada treningu groziła wypadnięciem z Google
Zmiana zamyka historię, która zaczęła się 1 lipca 2026 roku. Cloudflare ogłosił wówczas, że od 15 września ruch botów AI będzie zarządzany w trzech kategoriach: Search (budowanie indeksu wyszukiwarki), Training (trenowanie i dostrajanie modeli) oraz Agent (pobieranie stron w czasie rzeczywistym na polecenie użytkownika). Dla nowych domen z reklamami kategorie Training i Agent miały być domyślnie blokowane, a Search pozostawało otwarte.
Problem pojawił się w szczegółach. Googlebot nie ma osobnego bota treningowego, który pobierałby strony niezależnie. Ten sam crawler dostarcza dane do indeksu wyszukiwarki i, o ile witryna nie zgłosi sprzeciwu tokenem Google-Extended, do trenowania modeli Gemini. Cloudflare zapowiedział, że crawlery obsługujące więcej niż jeden cel będą traktowane według najbardziej restrykcyjnej z reguł. W praktyce oznaczało to, że strona blokująca kategorię Training zablokowałaby na tych samych adresach także Googlebota, czyli straciłaby indeksowanie. Jak podawał wtedy serwis Search Engine Journal, skala ryzyka dotyczyła każdej witryny na Cloudflare, która włączyła blokadę botów AI jednym kliknięciem, nie zastanawiając się nad architekturą crawlerów Google.
Cloudflare sam przyznał w komunikacie, że właściciele stron stali przed wyborem opisanym krótko: odmówisz jednego, odmawiasz drugiego. Ustawienie Disallow AI Training ma ten węzeł rozwiązać.
Jak działa Disallow AI Training
Nowa opcja nie blokuje żądań HTTP od Googlebota, Applebota ani Bingbota. Zamiast tego publikuje preferencję braku treningu w pliku robots.txt witryny, korzystając z tokenów, które każdy z operatorów już honoruje. Cloudflare zapisuje je automatycznie przez mechanizm Bot Preference Sync, następcę wycofywanego Managed robots.txt. Boty treningowe innych firm, które nie mają statusu Accountable, są przy tym blokowane na poziomie sieci.
Dla każdego z trzech wielkich operatorów mechanizm wygląda nieco inaczej:
| Operator | Jak Cloudflare przekazuje sprzeciw wobec treningu | Kontrola nad podsumowaniami AI | Wpływ na ranking według operatora |
|---|---|---|---|
| Reguła Disallow dla tokena Google-Extended w robots.txt | Osobny przełącznik w Search Console wyłączający udział w wynikach generatywnych; raporty z metrykami wyszukiwania i podsumowań AI | Google deklaruje, że sprzeciw wobec treningu nie wpływa na ranking w wyszukiwarce | |
| Apple | Reguła Disallow dla tokena Applebot-Extended | Dyrektywa nosnippet w HTML strony; możliwość oznaczania treści za paywallem | Apple potwierdza brak wpływu na pozycje; narzędzie wglądu na poziomie URL zapowiedziane na przyszły rok |
| Microsoft (Bing) | Na razie tylko metatag NOARCHIVE; obsługa w robots.txt celowana na początek 2027 | Szczegółowe ustawienia w Bing Webmaster Tools | Microsoft zapewnia, że NOARCHIVE nie obniża rankingu |
Istotne zastrzeżenie dotyczy Binga. Dopóki Microsoft nie wdroży obsługi preferencji treningowej w robots.txt, samo włączenie Disallow AI Training w panelu Cloudflare nie przekaże sygnału do Bingbota. Właściciel strony, któremu zależy na pełnym pokryciu, musi dodać NOARCHIVE ręcznie. Cloudflare pisze o tym wprost, zaznaczając, że do początku 2027 roku Bing pozostaje wyjątkiem.
Cztery ustawienia zamiast jednego przełącznika
Po zmianie każda z kategorii ruchu (Search, Training, Agent) może mieć jedną z czterech wartości:
- Allow: wszystkie crawlery w danej kategorii przechodzą, o ile inna reguła ich nie zatrzymuje.
- Disallow AI Training: witryna publikuje w robots.txt sprzeciw wobec treningu; crawlery mieszane ze statusem Accountable pozostają dopuszczone dla celów wyszukiwania, pozostałe boty treningowe są blokowane.
- Block on pages with ads: crawlery są blokowane tylko na stronach, na których serwowane są reklamy.
- Block: pełna blokada, łącznie z Googlebotem, Applebotem i Bingbotem, czyli z utratą indeksowania.
Różnica między drugą a czwartą opcją jest kluczowa. Jeszcze w połowie roku wybór blokady treningu sprowadzał się do wariantu Block. Teraz ten sam cel biznesowy da się osiągnąć bez ryzyka dla widoczności w Google, przynajmniej u operatorów, którzy zgodzili się grać według reguł Cloudflare.
Status Accountable: cztery warunki dla operatorów crawlerów
Najciekawszym elementem ogłoszenia jest sama etykieta Accountable. Cloudflare stworzył ją po rozmowach z operatorami crawlerów, które trwały od lipca, i przyznaje ją firmom spełniającym cztery warunki:
- istnieje mechanizm sprzeciwu wobec treningu AI przez robots.txt lub inny otwarty standard;
- istnieje mechanizm sprzeciwu wobec wykorzystania treści w podsumowaniach AI (dziś na poziomie operatora, docelowo jednym ustawieniem w Cloudflare na początku przyszłego roku);
- operator zapewnia wgląd na poziomie adresu URL w to, które strony były użyte do treningu, razem z metrykami z wyszukiwarki;
- operator zapewnia, że sprzeciw wobec treningu nie odbije się na tradycyjnych wynikach wyszukiwania.
Google, Apple i Microsoft dostały status jako operatorzy crawlerów mieszanych. Amazon, Anthropic, Meta i OpenAI znalazły się na liście z innego powodu: utrzymują osobne boty dla wyszukiwania i treningu, więc Cloudflare może zablokować ich crawler treningowy bez dotykania wyszukiwarki. To istotne uściślenie wobec danych, o których pisaliśmy przy okazji analizy różnic między crawlerem treningowym a botem pobierającym stronę na żywo: rozdzielenie user-agentów to warunek, którego mieszane crawlery Google i Apple po prostu nie spełniają, i dlatego potrzebowały osobnej ścieżki opartej na tokenach Extended.
Cloudflare nie ukrywa, że etykieta uznaje nie tylko możliwości dostępne dziś, ale też konkretne zobowiązania. Google ma w najbliższych tygodniach uruchomić narzędzia przejrzystości na poziomie URL dla Google-Extended. Apple pokazało Cloudflare wersję roboczą podobnego rozwiązania z terminem na przyszły rok. Microsoft buduje obsługę robots.txt. Innymi słowy, część warunków jest spełniona na kredyt.
Co dzieje się z dotychczasowymi ustawieniami klientów
Dla administratorów najważniejsza jest migracja. Dwa dotychczasowe mechanizmy, Block AI Bots oraz Managed robots.txt, zostają wycofane. Klienci, którzy mieli włączone Block AI Bots, dostają automatycznie nową konfigurację:
| Kategoria | Ustawienie po migracji z Block AI Bots |
|---|---|
| Search | Allow |
| Training | Disallow AI Training |
| Agent | Block on pages with ads |
Nowym domenom Cloudflare rekomenduje dwa zestawy. Witryny bez reklam: Preference Sync włączony, Search, Training i Agent na Allow. Witryny monetyzowane reklamami: Preference Sync włączony, Search na Allow, Training na Disallow AI Training, Agent na Block on pages with ads. Właściciele stron, którzy dotąd wybierali wariant blokowania na stronach z reklamami, również trafiają do nowego ustawienia treningowego.
W komunikacie pojawiły się też liczby pokazujące skalę zjawiska. Mniej niż 1 procent witryn na Cloudflare blokuje boty wyszukiwarek, natomiast 17 procent włączyło mechanizmy blokujące trening. Ta asymetria tłumaczy, dlaczego firma musiała szukać rozwiązania: rosnąca grupa klientów chciała odmówić treningu, a dotychczasowa konstrukcja zmuszała ją do decyzji, która mogła kosztować ruch z Google.
Co to znaczy dla SEO i AIO
Dla zespołów SEO najważniejsza informacja jest prosta: włączenie Disallow AI Training na Cloudflare nie odcina strony od indeksu Google, Apple ani Bing. Wcześniej ta pewność nie istniała, a wiele witryn trzymało się z daleka od jakichkolwiek blokad z obawy o widoczność. Pisaliśmy o tym dylemacie w tekście o tym, czy blokada botów AI szkodzi widoczności w Google. Nowe ustawienie usuwa najgroźniejszy scenariusz, ale nie wszystkie.
Google-Extended nie wyłącza AI Overviews
To rozróżnienie warto powtarzać, bo w dyskusjach o blokowaniu botów AI wciąż się gubi. Reguła Disallow dla Google-Extended dotyczy wyłącznie użycia treści do trenowania modeli Gemini. Nie ma wpływu na to, czy strona zostanie pokazana lub zacytowana w AI Overviews albo w AI Mode. Za to odpowiada osobny przełącznik w Search Console oraz dyrektywy na poziomie strony, takie jak nosnippet czy max-snippet. Podobnie u Apple: Applebot-Extended chroni przed treningiem, a wyłączenie treści z odpowiedzi generowanych przez Siri wymaga nosnippet. U Microsoftu NOARCHIVE robi obie rzeczy jednocześnie, blokując zarówno trening, jak i linkowanie w Copilocie.
W praktyce oznacza to, że administrator, który chce odmówić treningu, ale zachować cytowania w podsumowaniach AI (bo z nich płynie ruch), może to zrobić bez kompromisów. Cloudflare podaje, że ponad 50 procent konsumentów czyta podsumowania AI w wynikach wyszukiwania, a ruch z wyszukiwarek AI konwertuje 3–5 razy lepiej niż ruch z klasycznych wyników. To argument za tym, żeby nie mylić obu decyzji.
Kto pozostaje zablokowany
Disallow AI Training blokuje na poziomie sieci wszystkie boty treningowe bez statusu Accountable. Dotyczy to mniejszych laboratoriów, agregatorów danych i crawlerów, które nie deklarują celu ani nie rozdzielają user-agentów. Dla witryn, które od miesięcy obserwują w logach dziesiątki nieznanych botów, to realna zmiana. Nasz przewodnik po kontroli crawlerów AI w 2026 roku opisywał, jak żmudne było ręczne utrzymywanie listy blokad w robots.txt i regułach WAF; teraz część tej pracy przejmuje jedno ustawienie.
Ograniczenia, o których trzeba pamiętać
- Preferencja w robots.txt to deklaracja, nie blokada techniczna. Wobec operatorów Accountable Cloudflare polega na ich zobowiązaniu, że token Extended zostanie uszanowany.
- Bing do początku 2027 roku wymaga ręcznego metatagu NOARCHIVE.
- Narzędzia przejrzystości na poziomie URL, czyli sposób na weryfikację, czy Google naprawdę nie użyło strony do treningu, dopiero się pojawią.
- Kategoria Agent (boty pobierające strony na żywo dla ChatGPT, Perplexity czy Gemini) rządzi się osobną regułą. Zablokowanie jej na stronach z reklamami oznacza, że asystenci AI nie zobaczą tych stron w czasie rzeczywistym, co może obniżyć liczbę cytowań.
Reakcje branży
Pierwsze komentarze koncentrują się na dwóch wątkach. Po pierwsze, Cloudflare de facto ustanowił prywatny standard zgodności dla operatorów crawlerów. Cztery warunki statusu Accountable to lista wymagań, której nie wypracowała ani grupa robocza IETF, ani żaden regulator, a którą trzy największe wyszukiwarki zdecydowały się spełnić, bo alternatywą było odcięcie od sporej części sieci. Według doniesień serwisu Search Engine Journal, Apple, Google i Microsoft zgodziły się honorować preferencje w ramach tego układu jeszcze przed uruchomieniem ustawienia.
Po drugie, specjaliści od SEO technicznego zwracają uwagę, że lipcowa zapowiedź wywołała falę nieporozumień. Część publikacji ostrzegała wprost, że Cloudflare od 15 września będzie blokować Googlebota, jeśli witryna zablokuje trening. Ogłoszenie z 15 września zmienia ten obraz: domyślne ustawienie po migracji zostawia Search na Allow, a zamiast blokady treningu wchodzi deklaracja w robots.txt. Administratorzy, którzy w panice wyłączyli w lecie wszelkie reguły dla botów AI, mogą teraz do nich wrócić.
Pojawiają się też głosy sceptyczne. Krytycy wskazują, że status Accountable premiuje największych graczy, którzy mają zasoby, żeby budować narzędzia przejrzystości i negocjować z Cloudflare, natomiast mniejsze wyszukiwarki i projekty badawcze trafiają do jednego worka z anonimowymi scraperami. Cloudflare odpowiada, że lista nie jest zamknięta i każdy operator spełniający cztery warunki może o status wystąpić.
Co dalej
Kalendarz zapowiedzi jest gęsty. Google ma w ciągu kilku tygodni udostępnić raporty pokazujące, które adresy URL zostały użyte do treningu. Apple pracuje nad analogicznym narzędziem z terminem na przyszły rok. Microsoft celuje w obsługę preferencji treningowej w robots.txt na początku 2027 roku, co pozwoli Cloudflare wycofać wyjątek dla Binga. Sam Cloudflare zapowiada, że na początku przyszłego roku doda możliwość sterowania udziałem treści w podsumowaniach AI z jednego miejsca, bez chodzenia po panelach Search Console, Bing Webmaster Tools i metatagach Apple.
Dla właścicieli stron w Polsce, których znaczna część korzysta z Cloudflare przynajmniej jako DNS i CDN, praktyczna lista zadań na najbliższe dni wygląda tak:
- Sprawdzić w panelu Cloudflare, w jakim stanie są kategorie Search, Training i Agent po migracji, zwłaszcza jeśli wcześniej działało Block AI Bots.
- Zweryfikować, czy Bot Preference Sync faktycznie wpisał reguły Disallow dla Google-Extended i Applebot-Extended do publicznego robots.txt.
- Jeśli witryna zarabia na reklamach i chce odmówić treningu także Bingowi, dodać metatag NOARCHIVE ręcznie.
- Świadomie zdecydować o kategorii Agent: blokada na stronach z reklamami obniży widoczność w asystentach AI działających na żywo.
- Osobno przemyśleć AI Overviews i AI Mode, bo Disallow AI Training niczego w tej sprawie nie zmienia.
Cloudflare zamknął jeden z najbardziej kłopotliwych sporów tego roku między wydawcami a wyszukiwarkami, ale zrobił to na własnych warunkach. Wyszukiwarki dostały jasny sygnał, że dostęp do treści za darmo nie jest już domyślny, a wydawcy dostali pierwszy przełącznik, który nie karze ich za odmowę. Czy operatorzy dotrzymają zobowiązań, zwłaszcza w części o przejrzystości, będzie widać w ciągu kilku tygodni.
FAQ
Czy włączenie Disallow AI Training w Cloudflare wyrzuci moją stronę z Google?
Nie. Ustawienie publikuje w robots.txt regułę Disallow dla tokena Google-Extended, a Googlebot dalej pobiera strony do indeksu wyszukiwarki. Google potwierdza, że sprzeciw wobec treningu nie wpływa na ranking. Utratę indeksowania powoduje dopiero wariant Block.
Czy Disallow AI Training blokuje AI Overviews i AI Mode?
Nie. Google-Extended dotyczy tylko treningu modeli. Udział strony w AI Overviews i AI Mode kontroluje osobny przełącznik w Search Console oraz dyrektywy na poziomie strony, takie jak nosnippet i max-snippet.
Co z Bingiem?
Microsoft nie obsługuje jeszcze preferencji treningowej w robots.txt; obsługa jest celowana na początek 2027 roku. Do tego czasu sprzeciw wobec treningu w Bingu wymaga ręcznego metatagu NOARCHIVE, który blokuje jednocześnie trening i linkowanie w Copilocie.
Co się stało z ustawieniem Block AI Bots?
Zostało wycofane. Klienci, którzy je mieli włączone, zostali 15 września automatycznie zmigrowani do konfiguracji: Search na Allow, Training na Disallow AI Training, Agent na Block on pages with ads. Managed robots.txt zastępuje Bot Preference Sync.
Które firmy mają status Accountable?
Google, Apple i Microsoft jako operatorzy crawlerów mieszanych oraz Amazon, Anthropic, Meta i OpenAI, które utrzymują osobne boty dla wyszukiwania i treningu. Status wymaga mechanizmu sprzeciwu wobec treningu, sprzeciwu wobec podsumowań AI, wglądu na poziomie URL i gwarancji braku wpływu na ranking.
