Google Research opublikowało framework, który radykalnie obniża koszt jednej z najdroższych operacji w wyszukiwaniu opartym na AI: rozbijania jednego zapytania na wiązkę podzapytań. R4T-Diffusion, opisany w pracy „Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion”, wykonuje query fan-out od 12 do 20 razy szybciej niż podejście autoregresyjne, przy modelu liczącym zaledwie 53,9 mln parametrów. Jak podaje serwis Search Engine Journal, Google nagłośnił badanie na własnym blogu badawczym 15 września 2026, choć sam preprint trafił do arXiv już 6 marca 2026.
Dla branży SEO to nie kolejna ciekawostka z laboratorium. Query fan-out jest mechanizmem, który decyduje o tym, jakie podzapytania AI Mode i AI Overviews w ogóle zadają, a więc pośrednio o tym, które strony mają szansę zostać zacytowane. Jeśli ta operacja tanieje o rząd wielkości, zmienia się nie jedna funkcja, lecz ekonomia całego generatywnego wyszukiwania.
Kontekst: query fan-out jest drogi, a właśnie na nim stoi AI Mode
Klasyczna wyszukiwarka dopasowuje jeden ciąg znaków do jednego rankingu. Wyszukiwanie generatywne działa inaczej: model bierze szerokie, często rozmyte zapytanie użytkownika („co założyć na wesele w plenerze we wrześniu”) i rozkłada je na zbiór węższych, uzupełniających się podzapytań. Każde z nich trafia do indeksu osobno, a wyniki są scalane w jedną odpowiedź. To właśnie query fan-out, opisywany przez Google w dokumentacji AI Mode jako podstawa „szerszego pokrycia tematu”.
Problem, który autorzy pracy nazywają wprost, jest natury ekonomicznej. Aby fan-out był dobry, trzeba optymalizować właściwości całego zbioru wyników: różnorodność, pokrycie, komplementarność, spójność. Takie cele nazywa się nierozkładalnymi, bo nie da się ich policzyć dla pojedynczej pary zapytanie plus dokument. Standardowe zbiory treningowe typu (zapytanie, treść) premiują wyłącznie trafienie numer jeden, więc nie uczą modelu niczego o tym, jak skomponować dobry zestaw.
Uczenie przez wzmacnianie (RL) radzi sobie z celami zbiorowymi, ponieważ nagroda może opisywać cały koszyk wyników. Kłopot polega na tym, że wypuszczenie dostrojonego przez RL modelu językowego do produkcji jest, cytując autorów, zaporowo drogie na etapie wnioskowania. Model generuje podzapytania token po tokenie, autoregresyjnie, a przy dużej liczbie wariantów opóźnienie rośnie do poziomu nieakceptowalnego w wyszukiwarce obsługującej miliardy zapytań dziennie.
Kluczowe fakty
| Element | Szczegóły |
|---|---|
| Nazwa | R4T (Retrieve-for-Train), wdrożeniowo określane jako R4T-Diffusion |
| Praca źródłowa | „Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion”, arXiv 2603.06397 |
| Data preprintu | 6 marca 2026 |
| Komunikacja Google | wpis na blogu badawczym, 15 września 2026 |
| Autorzy | Pengcheng Jiang, Judith Yue Li, Moonkyung Ryu, R. Lily Hu, Kun Su, Zhong Yi Wan, Liam Hebert, Hao Peng, Jiawei Han, Dima Kuzmin, Craig Boutilier |
| Rozmiar modelu produkcyjnego | 53,9 mln parametrów (model dyfuzyjny) |
| Przyspieszenie | 12–20x wobec fan-outu autoregresyjnego |
| Opóźnienie w skali | od poniżej sekundy do kilku sekund, wobec blisko 50 sekund dla wariantu autoregresyjnego |
| Benchmarki | duże zbiory z domen moda i muzyka, oparte na kuratorowanych zestawach produktów |
Jak działa R4T: trzy kroki zamiast jednego drogiego modelu
Pomysł autorów jest elegancki i sprowadza się do przeniesienia kosztu z czasu odpowiedzi do czasu treningu. RL zostaje użyty tylko raz, w roli, którą praca nazywa transducerem celu. Potem znika z produkcji.
Krok pierwszy: model językowy uczony nagrodą zbiorową
Najpierw trenowany jest duży model językowy generujący fan-out, ale nagradzany nie za pojedyncze trafienie, lecz za jakość całego zbioru podzapytań. Nagroda jest złożona i opiera się na trzech konkurujących filarach. Ugruntowanie (groundedness) pilnuje, aby wygenerowane podzapytania faktycznie odpowiadały czemuś, co istnieje w bazie i da się pobrać. Różnorodność jest mierzona metryką Vendi Score, która wymusza semantyczną szerokość zamiast pięciu parafraz tego samego pytania. Dopasowanie (alignment) blokuje dryf znaczeniowy, czyli sytuację, w której model odpływa od pierwotnej intencji użytkownika.
Ten układ trzech sił jest w praktyce najciekawszą częścią pracy. Różnorodność i dopasowanie ciągną w przeciwne strony: im szerzej rozstawisz podzapytania, tym łatwiej zgubisz intencję. Vendi Score służy tu jako miara efektywnej liczby różnych elementów w zbiorze, a nie prostego dystansu między wektorami, więc karze parafrazy skuteczniej niż klasyczne metryki podobieństwa.
Krok drugi: synteza danych treningowych zgodnych z celem
Dostrojony model służy następnie jako generator danych. Z jego najlepszych wyjść powstają pary treningowe, które są, jak piszą autorzy, zgodne z celem (objective-consistent). Innymi słowy: zamiast szukać w archiwach zbiorów danych, które nigdy nie były projektowane pod cele zbiorowe, Google produkuje własne, syntetyczne przykłady zawierające już wpisaną wiedzę o różnorodności i pokryciu.
Krok trzeci: lekki retriever dyfuzyjny
Na tych danych trenowany jest mały model dyfuzyjny, który modeluje warunkowy rozkład wyjść o wartościach zbiorowych. Dyfuzja w przestrzeni embeddingów ma jedną kluczową zaletę wobec generowania tokenów: cały zbiór podzapytań powstaje w jednym przejściu, równolegle, a nie sekwencyjnie. Stąd bierze się przyspieszenie 12–20x i spadek opóźnienia z blisko 50 sekund do wartości sekundowych.
Technika przenoszenia wiedzy z dużego modelu do małego nazywa się destylacją i ma w Google długą historię, sięgającą prac Jeffa Deana z 2015 roku. Nowością nie jest więc sama destylacja, lecz to, co się destyluje: nie zdolność przewidywania następnego tokenu, ale zachowanie zoptymalizowane pod właściwości zbioru.
Co to znaczy dla SEO i AIO
Pierwszy i najważniejszy wniosek: jeśli fan-out tanieje o rząd wielkości, można go uruchamiać częściej i szerzej. Do tej pory ograniczeniem nie była pomysłowość Google, lecz budżet obliczeniowy. Tania dyfuzja oznacza więcej podzapytań na jedno zapytanie użytkownika, a więc więcej równoległych ścieżek, którymi Twoja strona może wejść do odpowiedzi.
Drugi wniosek dotyczy tego, jakie treści zyskują. Nagroda za różnorodność premiuje zbiory, w których podzapytania nie są parafrazami. Model, który celowo unika powtarzania tego samego pytania innymi słowami, będzie sięgał po ujęcia poboczne, warunki brzegowe, porównania i przypadki użycia. To dokładnie te fragmenty, które w typowym polskim artykule SEO są odpuszczane na rzecz trzeciego akapitu o definicji. Jeśli Twój tekst pokrywa wyłącznie rdzeń tematu, obsłuży jedno podzapytanie z dwudziestu.
Trzeci wniosek jest niewygodny. Ugruntowanie w pracy zdefiniowano jako odpowiedniość wobec elementów istniejących w stałej bazie danych. W eksperymentach bazą były kuratorowane zestawy produktów z domen moda i muzyka, a nie otwarty web. Nie ma w pracy żadnej deklaracji, że R4T obsługuje dziś ruch w Google Search. To badanie infrastruktury wyszukiwania i rekomendacji, opublikowane w marcu, nagłośnione przez firmę we wrześniu.
Warto tu zachować higienę wnioskowania, o której pisaliśmy przy okazji autoregresyjnego rankingu ARR z DeepMind: publikacja pracy badawczej nie jest komunikatem o wdrożeniu, a korelacja z wahaniami w SERP-ach niczego nie dowodzi. Mechanika, którą opisuje praca, jest natomiast realną wskazówką, w którą stronę idzie warstwa pobierania danych pod odpowiedzi generatywne. Kto rozumie, jak działa RAG i pobieranie semantyczne, ten czyta tę pracę jako opis własnego środowiska pracy, a nie jako egzotykę.
Cztery rzeczy, które możesz zrobić w tym tygodniu
- Zmapuj wachlarz podzapytań, nie słowo kluczowe. Weź swoje trzy najważniejsze tematy i wypisz po piętnaście węższych pytań, na które rozpadłyby się w AI Mode. Sprawdź, ile z nich Twoja strona faktycznie obsługuje osobnym akapitem lub sekcją.
- Zbuduj komplementarność, nie powtórzenia. Jeśli trzy Twoje artykuły odpowiadają na to samo podzapytanie innymi słowami, model premiujący różnorodność wybierze jeden z nich, a dwa pozostałe będą kosztem. Lepiej mieć jeden mocny tekst plus dwa ujmujące temat z innej strony.
- Utrzymaj ugruntowanie na poziomie danych. Konkretne liczby, daty, ceny, parametry i nazwy własne są tym, co retriever może dopasować do istniejących elementów bazy. Ogólniki nie są ugruntowane w niczym.
- Strukturyzuj tak, aby fragment dał się pobrać osobno. Nagłówek, który zadaje pytanie, i akapit, który na nie odpowiada bez odsyłania do kontekstu wyżej, to podstawowa jednostka w świecie fan-outu.
Dlaczego to dotyczy też mniejszych, polskich witryn
Istnieje wygodna narracja, według której generatywne wyszukiwanie to gra wyłącznie dla wydawców z setkami tysięcy podstron. Mechanika fan-outu ją podważa. Jeśli jedno zapytanie użytkownika rozpada się na dwadzieścia węższych, to konkurencja rozgrywa się nie o jeden ranking, lecz o dwadzieścia mikrorankingów, z których każdy jest cieńszy i mniej obstawiony. Wąska witryna, która naprawdę wyczerpuje jeden wycinek tematu, ma w takim układzie przewagę nad ogólnym portalem, który każdy wycinek obsługuje jednym zdaniem. To ten sam mechanizm, który sprawia, że mała strona branżowa bywa cytowana w odpowiedzi AI obok serwisu z dwudziestoletnią historią.
Drugi element to język. Podzapytania są generowane w języku intencji, a polskie zapytania długiego ogona mają znacznie mniejszą konkurencję niż ich angielskie odpowiedniki. Tania generacja wachlarza podzapytań oznacza, że nisze, których dotąd nie opłacało się obsługiwać, zaczynają się w systemie pojawiać.
Reakcje branży
Search Engine Journal, który pierwszy zwrócił uwagę na wpis Google, podkreślił produkcyjną gotowość rozwiązania i zestawił je ze spekulacjami o niedawnym wzroście liczby linków wyświetlanych w AI Mode. Serwis zaznaczył jednak, że powiązanie obu faktów jest hipotezą opartą na zbieżności czasowej, nie na oświadczeniu firmy.
MarkTechPost skupił się na inżynierii i opisał R4T jako retriever dyfuzyjny kompilowany przez RL, kładąc nacisk na to, że praktyczną wartością jest możliwość optymalizowania właściwości wyższego rzędu (różnorodność, pokrycie, komplementarność) przy niskim opóźnieniu wnioskowania. W tej lekturze najważniejsze zastosowania to systemy rekomendacyjne, wyszukiwanie kreatywne i eksploracyjny dostęp do informacji, a więc niekoniecznie klasyczna wyszukiwarka tekstowa.
W środowisku analityków AI search pojawił się też wątek trzeci, znany z wcześniejszych dyskusji o fan-oucie: parafrastyczne zapadanie się zbioru, czyli sytuacja, w której model generuje dwudziestkę podzapytań brzmiących inaczej, a znaczących to samo. Praca Google adresuje ten problem bezpośrednio, bo Vendi Score jest w niej właśnie kagańcem na parafrazy. To sygnał, że zespoły pracujące nad fan-outem traktują pokrycie tematu jako mierzalny cel, a nie efekt uboczny.
Sami autorzy nie ukrywają ryzyka. W sekcji o wdrożeniu wskazują na wzmacnianie uprzedzeń w kontekstach wrażliwych: model nagradzany za różnorodność zbioru może tę różnorodność realizować w sposób, którego nikt nie zamawiał, jeśli dane treningowe niosą skrzywienie. Dla wyszukiwarki działającej w wielu językach i kulturach to nie jest przypis, lecz warunek dopuszczenia do produkcji.
Co dalej
Najbliższe tygodnie przyniosą prawdopodobnie pierwsze próby zewnętrznej weryfikacji, czyli analizy logów serwerowych i raportów Search Console pod kątem tego, czy liczba różnych zapytań, na które wyświetla się dana strona, rośnie. To jedyny sensowny sygnał obserwowalny z naszej strony szyby: nie „czy Google wdrożył R4T”, lecz „czy mój materiał zaczyna łapać szerszy wachlarz zapytań przy tej samej pozycji”. Pamiętajmy przy tym, że raportowanie pozycji dla bloków AI jest spłaszczane, więc pozycja średnia jest tu wskaźnikiem gorszym niż liczba unikalnych zapytań z wyświetleniami.
Druga rzecz do obserwowania to tempo, w jakim mechanika opisana w pracy przenika do narzędzi. Jeśli fan-out staje się tani, to tanieje również w produktach zewnętrznych, a to oznacza nową generację analiz widoczności, które pokazują nie jedno zapytanie, lecz cały wachlarz podzapytań i Twój udział w każdym z nich. Debata o tym, że AEO i GEO to nadal SEO, dostaje w tym kontekście bardzo konkretne, techniczne uzasadnienie: optymalizujesz pod pobieranie, a pobieranie jest zbiorowe.
Trzeci scenariusz, najmniej medialny i najbardziej prawdopodobny, jest taki, że R4T trafi najpierw tam, gdzie baza jest domknięta i kuratorowana: do rekomendacji zakupowych, muzycznych i wideo. Dokładnie takie zbiory posłużyły w benchmarkach. Otwarty web jest znacznie trudniejszym środowiskiem dla wymogu ugruntowania, a Google nigdzie nie twierdzi, że ten krok już zrobił.
Czego ta praca nie mówi
Uporządkujmy, bo wokół każdej publikacji Google narasta warstwa nadinterpretacji.
- Nie mówi, że to działa w Google Search. Brak jakiejkolwiek deklaracji wdrożenia w wyszukiwarce ogólnej.
- Nie mówi, że zmienia się ranking. R4T dotyczy warstwy pobierania i komponowania zbioru, nie kryteriów oceny jakości strony.
- Nie mówi, ile podzapytań generuje produkcyjny fan-out. Liczby z benchmarków nie są liczbami z produkcji.
- Nie mówi nic o wpływie na ruch. Jakiekolwiek wykresy łączące tę pracę ze zmianami w liczbie kliknięć są korelacją, i to na danych, których nikt z zewnątrz nie kontroluje.
To rozróżnienie nie jest pedantyczne. Decyzje budżetowe podjęte na podstawie pracy badawczej wziętej za komunikat produktowy kosztują realne pieniądze, a w tym roku w polskiej branży widzieliśmy już kilka takich przypadków.
FAQ
Czy R4T-Diffusion działa już w Google Search?
Nie ma na to potwierdzenia. Google opisał framework w pracy naukowej z 6 marca 2026 i nagłośnił go na blogu badawczym 15 września 2026, ale nie ogłosił wdrożenia w wyszukiwarce. Eksperymenty przeprowadzono na kuratorowanych zbiorach z domen moda i muzyka, nie na otwartym webie.
Co dokładnie oznacza przyspieszenie 12–20x?
Tyle razy szybszy jest fan-out dyfuzyjny wobec autoregresyjnego, czyli generującego podzapytania token po tokenie. W praktyce, według publikacji, opóźnienie spada z blisko 50 sekund do przedziału od poniżej sekundy do kilku sekund, przy modelu o 53,9 mln parametrów.
Czy powinienem zmienić strategię treści z powodu tej pracy?
Nie z powodu samej pracy, ale kierunek, który ona potwierdza, jest jasny od kilku kwartałów: wygrywa pokrycie wachlarza podzapytań, nie powtarzanie rdzenia tematu. Jeśli Twoje artykuły odpowiadają na jedno pytanie w pięciu wariantach, jesteś po niewłaściwej stronie metryki różnorodności.
Czym jest Vendi Score i dlaczego pojawia się w tej pracy?
To metryka różnorodności zbioru, interpretowana jako efektywna liczba naprawdę różnych elementów. W R4T służy jako składnik nagrody, który wymusza semantyczną szerokość podzapytań i karze generowanie parafraz tego samego pytania.
Jak zmierzyć u siebie, czy wachlarz zapytań się poszerza?
W Search Console porównuj liczbę unikalnych zapytań z wyświetleniami dla danego URL w kolejnych okresach, a nie średnią pozycję. Dla bloków AI raportowanie pozycji jest spłaszczane, więc liczba różnych zapytań i kliknięcia są znacznie wiarygodniejszym sygnałem niż pozycja.
