Ta lista powstała z powtarzalnego problemu: strona jest gotowa, zespół chce publikować, a nikt nie potrafi powiedzieć, czy asystent AI w ogóle będzie w stanie ją przeczytać, zrozumieć i zacytować. Przechodzimy przez te 25 punktów przed każdą publikacją. Żaden z nich nie zajmuje więcej niż kilka minut, a każdy usuwa konkretny powód, dla którego treść potem nie pojawia się w odpowiedziach.
Jak korzystać z tej checklisty
Checklista jest podzielona na siedem bloków i ułożona w kolejności, w jakiej faktycznie się ją przechodzi: najpierw dostęp, potem struktura, potem warstwa semantyczna, na końcu pomiar. Kolejność ma znaczenie, bo naprawianie danych strukturalnych na stronie, do której bot nie ma dostępu, jest stratą czasu.
Traktuj punkty jako bramki, nie jako sugestie. Jeśli któryś nie przechodzi, publikacja czeka. W praktyce najwięcej blokad pojawia się w bloku pierwszym i szóstym, czyli tam, gdzie decyduje konfiguracja serwera, a nie praca redakcji. Jeżeli szukasz gotowych poleceń do samego audytu tekstu, zebraliśmy je w zestawie promptów do audytu treści pod AIO.
Dostęp botów i polityka robots
Ten blok rozstrzyga, czy jakakolwiek dalsza praca ma sens. Asystenci AI korzystają z osobnych user agentów i osobnych reguł, więc zgoda dla Googlebota niczego tutaj nie załatwia.
- robots.txt nie blokuje agentów AI, których chcesz wpuścić. Sprawdź osobno GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot i Google-Extended. Każdy z nich czyta własną regułę, a domyślna sekcja
User-agent: *bywa nadpisana wyżej w pliku. - Strona zwraca 200 dla żądania bez cookies i bez JavaScriptu. Najprostszy test to
curlz pustą sesją. Jeśli zamiast treści dostajesz przekierowanie na zgodę cookie, bot dostanie to samo. - Firewall i ochrona przed botami nie odrzucają nieznanych user agentów. Reguły typu „blokuj wszystko poza przeglądarkami” wycinają większość klientów AI. Sprawdź logi po stronie serwera, nie panel wtyczki.
- Nagłówek
X-Robots-Tagnie zawieranoindexaninoai. To ustawienie żyje w konfiguracji serwera i nie widać go w kodzie strony. - Adres kanoniczny wskazuje sam na siebie i nie przekierowuje. Łańcuch przekierowań na kanonicznym URL to najczęstsza cicha przyczyna pominięcia strony.
Struktura treści i nagłówki
Modele językowe pracują na fragmentach, nie na całych stronach. Wygrywa treść, z której da się wyciąć samodzielny, sensowny kawałek bez reszty kontekstu.
- Jeden
h1, zgodny z tytułem i z obietnicą strony. Dwa konkurencyjne nagłówki pierwszego poziomu rozmywają temat fragmentu. - Każde
h2to pytanie albo konkretne stwierdzenie. Nagłówki w rodzaju „Podsumowanie” czy „Nasze podejście” nie niosą informacji, którą da się dopasować do zapytania. - Pierwszy akapit pod nagłówkiem odpowiada na jego temat. Bez rozbiegu, bez zapowiedzi, że za chwilę coś wyjaśnimy.
- Definicje i liczby stoją w osobnych, krótkich akapitach. Zdanie zamknięte w akapicie na trzy linijki cytuje się łatwiej niż to samo zdanie schowane w bloku na dwanaście linijek.
- Tabele i listy mają nagłówki opisowe. Kolumna „Wartość” nic nie mówi, kolumna „Koszt miesięczny w zł” mówi wszystko.
- Treść nie duplikuje innej podstrony w serwisie. Dwie strony na to samo pytanie dzielą sygnały i zwykle żadna nie wygrywa.
Dane strukturalne i encje
Schema.org nie gwarantuje cytowania, ale porządkuje to, co model musi inaczej wywnioskować z tekstu. Warto sprawdzić poprawność w walidatorze Schema.org, zanim strona pójdzie na produkcję.
- Strona emituje poprawny typ główny. Artykuł to
Article, poradnik krok po kroku toHowTo, oferta usługi toService. Pusty lub nieokreślony węzeł jest gorszy niż jego brak. - Blok JSON-LD parsuje się bez błędów. Sprawdzaj surowe źródło, bo część narzędzi podglądowych usuwa skrypty i pokazuje fałszywy brak schematu.
- Encje mają identyfikatory zewnętrzne. Pole
sameAsz linkiem do Wikipedii, LinkedIna albo rejestru firm łączy twoją nazwę z bytem, który model już zna. - Dane organizacji zgadzają się z resztą sieci. Rozjazd w nazwie, adresie albo NIP potrafi utrwalić się w odpowiedziach na miesiące, co opisaliśmy przy okazji problemu z nieaktualnymi danymi o firmie w ChatGPT.
- FAQ w schemacie odpowiada FAQ widocznemu na stronie. Rozbieżność jest traktowana jak próba manipulacji.
Fakty, liczby i źródła
Fragment bez daty i bez źródła jest ryzykowny do zacytowania, więc bywa pomijany na rzecz słabszej merytorycznie, ale lepiej udokumentowanej konkurencji.
- Każda liczba ma datę i podmiot pomiaru. „Wzrost o 34%” nic nie znaczy; „wzrost o 34% rok do roku w okresie styczeń 2026 wobec stycznia 2025” znaczy wszystko.
- Twierdzenia zewnętrzne mają link do źródła pierwotnego. Nie do artykułu, który cytuje badanie, tylko do badania.
- Data publikacji i aktualizacji jest widoczna w treści, nie tylko w metadanych. Modele czytają tekst częściej niż nagłówki HTTP.
- Nie ma zdań, których nie da się zweryfikować. „Lider rynku” bez podania metodologii to koszt, nie korzyść.
Autorstwo i sygnały wiarygodności
- Wpis ma przypisanego realnego autora ze stroną profilu. Autor o identyfikatorze zerowym albo konto „admin” psuje schemat i odbiera stronie warstwę autorstwa.
- Profil autora zawiera kompetencje związane z tematem. Dwa zdania wystarczą, o ile mówią, dlaczego ta osoba ma prawo to twierdzić.
- Strona kontaktu i strona „o nas” istnieją, są indeksowalne i zawierają prawdziwe dane. Treść demonstracyjna zostawiona po wdrożeniu to jeden z najtańszych do naprawienia, a najbardziej kosztownych błędów.
Wydajność i renderowanie
Część klientów AI pobiera dokument bez wykonywania JavaScriptu i bez czekania na dociągane fragmenty. To, czego nie ma w pierwszej odpowiedzi serwera, dla nich nie istnieje.
- Pełna treść jest w HTML zwróconym przez serwer. Wyłącz JavaScript w przeglądarce albo obejrzyj surowe źródło. Jeśli widzisz pusty kontener zamiast tekstu, żaden dalszy punkt nie ma znaczenia.
- Czas do pierwszego bajtu mieści się poniżej 800 ms, a obrazy mają atrybuty
alt,widthiheight. Wolna odpowiedź obniża częstotliwość pobrań, a pustealtodbiera kontekst warstwie graficznej, w tym miniaturom cytowanym w odpowiedziach.
Pomiar i monitoring po publikacji
Checklista kończy się w momencie publikacji, ale bez pomiaru nie dowiesz się, który punkt naprawdę coś zmienił. Minimum to trzy rzeczy uruchomione tego samego dnia.
Po pierwsze, wydzielony raport ruchu z asystentów. Sesje z ChatGPT, Perplexity i Gemini wpadają domyślnie do worka „referral” albo „direct” i giną; sposób ich rozdzielenia opisaliśmy w tekście o tym, jak wyodrębnić ruch z ChatGPT w GA4. Po drugie, logi serwera z filtrem na user agenty AI, bo to jedyne miejsce, w którym widać, czy bot faktycznie pobrał stronę i z jakim kodem odpowiedzi. Po trzecie, kontrolne zapytania do samych asystentów, zadawane co dwa tygodnie z tej samej listy fraz i zapisywane razem z datą.
Warto też ustawić realistyczne oczekiwania co do typu strony. Analiza rozkładu cytowań pokazuje, że strony produktowe zbierają 24% cytowań AI, podczas gdy fora i wideo dużo mniej, więc ta sama checklista da inny zwrot na karcie produktu, a inny na wpisie blogowym. Pierwsze sensowne odczyty pojawiają się zwykle po 3–6 tygodniach, bo tyle trwa ponowne pobranie i przetworzenie treści.
FAQ
Czy muszę przejść wszystkie 25 punktów przed każdą publikacją?
Punkty od 1 do 5 tak, przy każdej publikacji, bo dotyczą dostępu i wystarczy jedna zmiana w konfiguracji serwera, żeby zablokować cały serwis. Pozostałe bloki wystarczy weryfikować przy nowym typie strony albo po zmianie szablonu, a przy rutynowych wpisach ograniczyć się do struktury nagłówków i danych źródłowych.
Ile czasu zajmuje przejście całej listy?
Przy pierwszym wdrożeniu na nowym serwisie liczymy około dwóch godzin, głównie przez blok dostępu botów i weryfikację renderowania. Przy kolejnych publikacjach na tym samym szablonie schodzi to do 15–20 minut, bo połowa punktów jest już rozstrzygnięta na poziomie motywu.
Czy dane strukturalne gwarantują cytowanie w AI?
Nie. Schema.org obniża koszt zrozumienia strony i porządkuje encje, ale nie zastępuje treści, która realnie odpowiada na pytanie. Poprawny Article na pustym tekście nie zbierze cytowań, natomiast dobry tekst bez schematu zbierze ich mniej, niż mógłby.
Co zrobić, gdy strona przechodzi całą checklistę, a mimo to nie pojawia się w odpowiedziach?
Sprawdź w logach serwera, czy bot w ogóle pobrał adres. W większości takich przypadków problem leży po stronie wykrywania, nie jakości: strona nie ma linków wewnętrznych, nie jest w sitemapie albo jej sekcja jest pobierana raz na kilka tygodni. Dopiero gdy widać udane pobranie, ma sens praca nad samą treścią.
Czy blokowanie botów AI ma sens biznesowy?
Ma, ale w wąskich przypadkach: przy treści płatnej, danych licencjonowanych albo materiałach, których nie chcesz oddać do trenowania modeli. Pamiętaj o rozdziale agentów trenujących od tych obsługujących wyszukiwanie w czasie rzeczywistym. Zablokowanie tych drugich usuwa cię z odpowiedzi, ale nie chroni przed niczym, co już zostało pobrane wcześniej.
