Dlaczego robots.txt dla botów AI to decyzja strategiczna, a nie techniczna?
Reguły robots.txt dla botów AI decydują dziś o trzech osobnych rzeczach naraz: czy Twoja treść trafia do treningu modeli, czy pojawia się w wyszukiwarkach AI i czy silnik generatywny — system odpowiadający użytkownikowi wygenerowaną odpowiedzią zamiast listą linków (ChatGPT, Perplexity, Google AI Overviews, Copilot) — może pobrać Twoją stronę na żądanie użytkownika. Jedna źle dobrana linijka potrafi wyzerować widoczność marki w całym silniku, dlatego to decyzja biznesowa, a nie kosmetyka techniczna.
Skala zjawiska jest mierzalna. Według danych Cloudflare (2025) około 80% crawlingu botów AI w ciągu 12 miesięcy do lipca 2025 służyło treningowi modeli, a tylko 18% wyszukiwaniu; udział treningu rósł z 72% (lipiec 2024) do 79% (lipiec 2025). Dwa najaktywniejsze crawlery to GPTBot i ClaudeBot: w lipcu 2025 odpowiadały kolejno za 28,1% i 23,3% ruchu botów AI w sieci Cloudflare (Cloudflare, 2025).
Punktem startowym całej fali blokad była publiczna dokumentacja GPTBota z 7 sierpnia 2023 (Glide, 2023). Od tego czasu każdy duży dostawca AI opublikował własny katalog botów — i to właśnie te oficjalne katalogi, a nie kopiowane z forów listy user-agentów, powinny być podstawą Twojego pliku. Kontekst strategiczny tej zmiany opisujemy w tekście GEO vs SEO — co się zmienia oraz w naszym przewodniku po GEO (Generative Engine Optimization), czyli metodzie tworzenia i optymalizacji treści tak, aby były cytowane w odpowiedziach generowanych przez AI.
Jakie boty wysyła OpenAI i co robi każdy z nich?
OpenAI rozdziela kontrolę w robots.txt na trzy niezależne tokeny — GPTBot, OAI-SearchBot i ChatGPT-User — więc możesz zablokować trening modeli, pozostając w pełni widocznym w wyszukiwarce ChatGPT (OpenAI, dokumentacja crawlerów, 2025). To najważniejsza pojedyncza informacja w tym temacie, bo większość szkód bierze się z traktowania botów OpenAI jako jednego „bota ChatGPT”.
- GPTBot crawluje treści do treningu przyszłych modeli. Blokada wyklucza stronę z materiału treningowego, ale nie z wyszukiwania.
- OAI-SearchBot buduje indeks wyszukiwania ChatGPT search. Dokumentacja mówi wprost: „Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers” (OpenAI, 2025) — blokada usuwa stronę z odpowiedzi wyszukiwarki ChatGPT.
- ChatGPT-User pobiera konkretną stronę, gdy poprosi o to użytkownik w rozmowie. Po rewizji dokumentacji z grudnia 2025 OpenAI zastrzega: „Because these actions are initiated by a user, robots.txt rules may not apply” (OpenAI, 2025). Skuteczna blokada wymaga warstwy serwerowej, np. filtrowania po opublikowanych zakresach IP.
- OAI-AdsBot — czwarty, najnowszy bot (w dokumentacji publicznie od 21 kwietnia 2026) — waliduje bezpieczeństwo stron docelowych reklam w ChatGPT i odwiedza wyłącznie strony zgłoszone jako reklamy (OpenAI, 2026).
OpenAI publikuje zakresy IP każdego bota w osobnych plikach JSON (m.in. openai.com/gptbot.json i chatgpt-user.json), co pozwala weryfikować autentyczność wizyt po adresie, a nie tylko po nagłówku user-agent (OpenAI, 2025).

Jak działają ClaudeBot i pozostałe boty Anthropic?
Anthropic stosuje identyczny trójpodział jak OpenAI: ClaudeBot zbiera treści pod trening modeli, Claude-SearchBot indeksuje strony pod jakość wyników wyszukiwania Claude, a Claude-User pobiera stronę, gdy pyta o nią użytkownik — i według deklaracji wszystkie trzy respektują robots.txt, łącznie z dyrektywą Crawl-delay (Anthropic, dokumentacja wsparcia, stan na lipiec 2026).
Konsekwencje blokad są rozdzielne: blokada ClaudeBot oznacza, że „future materials should be excluded from our AI model training datasets”, natomiast blokada Claude-User odcina pobieranie treści na żądanie użytkownika i — jak pisze sam Anthropic — „may reduce your site’s visibility”. Blokada nie usuwa danych zebranych wcześniej (Anthropic, stan na lipiec 2026). Zakresy IP botów Anthropic są publikowane pod claude.com/crawling/bots.json.
Uwaga na tokeny historyczne: „anthropic-ai” i „claude-web” nie występują w aktualnej oficjalnej dokumentacji Anthropic — bieżące agenty to wyłącznie ClaudeBot, Claude-User i Claude-SearchBot — a mimo to wciąż blokuje je odpowiednio 72% i 66% topowych serwisów newsowych (Search Engine Land, 2026, za danymi BuzzStream). Takie martwe reguły nie szkodzą, ale dają fałszywe poczucie kontroli i zaśmiecają plik.
Czym różni się PerplexityBot od Perplexity-User?
PerplexityBot indeksuje strony, by „surface and link websites in search results on Perplexity”, i według deklaracji „is not used to crawl content for AI foundation models” — nie służy więc treningowi modeli, tylko widoczności w wynikach (Perplexity, dokumentacja crawlerów, stan na lipiec 2026). Drugi agent, Perplexity-User, pobiera stronę w odpowiedzi na pytanie użytkownika i — według tej samej dokumentacji — „generally ignores robots.txt rules”. Zakresy IP obu botów Perplexity publikuje w plikach perplexitybot.json i perplexity-user.json.
Deklaracje trzeba jednak zestawić z pomiarami. Cloudflare udokumentował 4 sierpnia 2025, że Perplexity używał niezadeklarowanych stealth-crawlerów: podszywały się pod przeglądarkę Chrome na macOS i rotowały adresy IP oraz numery ASN spoza oficjalnie opublikowanych zakresów, omijając blokady robots.txt i reguły WAF; Perplexity zaprzeczył tym ustaleniom (Cloudflare, 2025). Wniosek praktyczny: reguły robots.txt dla Perplexity traktuj jako deklarację intencji, a twardą kontrolę dostępu realizuj na serwerze.
Co naprawdę kontroluje Google-Extended?
Google-Extended nie jest crawlerem — to token kontrolny w robots.txt bez własnego user-agenta („Google-Extended doesn’t have a separate HTTP request user agent string”); strony fizycznie pobierają istniejące agenty Google, a token decyduje tylko o tym, do czego wolno użyć treści (Google Search Central, 2026). Blokada wyklucza treść z treningu modeli Gemini (Gemini Apps, Vertex AI) oraz z groundingu — czyli podawania treści z indeksu Search modelowi w momencie zapytania — ogłoszono go 28 września 2023 (Google, 2026).
Najczęstsze nieporozumienie: blokada Google-Extended nie wpływa na obecność w Google Search ani na ranking („does not impact a site’s inclusion in Google Search nor is it used as a ranking signal”, Google Search Central, 2026) i nie usuwa strony z AI Overviews ani AI Mode — te funkcje działają w ramach zwykłej wyszukiwarki Google i jej indeksu (Google Search Central, 2025). Jedyna kontrola nad AI Overviews to blokada Googlebota, tag noindex albo dyrektywy nosnippet / data-nosnippet / max-snippet — każda z nich uderza jednak także w klasyczne wyniki wyszukiwania.
Co tracisz, blokując poszczególne boty AI?
Każdy bot ma inną funkcję, więc każda blokada ma inną cenę — poniższa tabela zestawia katalog botów z oficjalnych dokumentacji (stan na lipiec 2026) z konsekwencją blokady w robots.txt.
| Bot (token) | Właściciel | Funkcja | Konsekwencja blokady |
|---|---|---|---|
| GPTBot | OpenAI | crawling treści do treningu modeli | treść poza treningiem przyszłych modeli; w praktyce koreluje też ze spadkiem cytowań w ChatGPT |
| OAI-SearchBot | OpenAI | indeks wyszukiwania ChatGPT search | strona znika z odpowiedzi ChatGPT search |
| ChatGPT-User | OpenAI | pobranie strony na żądanie użytkownika | brak fetchu na życzenie; reguły „may not apply” — pewna blokada tylko po IP/WAF |
| OAI-AdsBot | OpenAI | walidacja stron docelowych reklam w ChatGPT | dotyczy wyłącznie stron zgłoszonych jako reklamy |
| ClaudeBot | Anthropic | zbieranie treści pod trening modeli | przyszłe materiały wykluczone z zestawów treningowych; dane zebrane wcześniej zostają |
| Claude-SearchBot | Anthropic | indeksowanie pod wyniki wyszukiwania Claude | gorsza/żadna obecność w wynikach wyszukiwania Claude |
| Claude-User | Anthropic | dostęp do strony, gdy pyta użytkownik | brak pobrania treści na żądanie; wg Anthropic „may reduce your site’s visibility” |
| PerplexityBot | Perplexity | indeks wyników Perplexity (nie trening) | strona znika z wyników i linków w Perplexity |
| Perplexity-User | Perplexity | fetch na pytanie użytkownika | deklaratywnie „generally ignores robots.txt” — blokada wymaga warstwy serwerowej |
| Google-Extended | token kontrolny: trening Gemini + grounding | treść poza treningiem Gemini i groundingiem; zero wpływu na Search, ranking i AI Overviews |
Źródła funkcji i konsekwencji: dokumentacje OpenAI, Anthropic, Perplexity i Google (dostęp: lipiec 2026).
Jakie reguły robots.txt wpisać dla swojej strategii?
Właściwe reguły zależą od jednej decyzji: czy ważniejsza jest dla Ciebie widoczność w odpowiedziach AI, czy kontrola nad użyciem treści w treningu — poniżej trzy gotowe warianty. Cena złej decyzji jest policzalna: według badania cloro.dev (2026) na 1 058 prominentnych domenach mediana „citation propensity” (liczby cytowań ChatGPT na jedną obecność w organiku Google) wynosi 0,003 u domen blokujących GPTBot wobec 0,417 u nieblokujących, a u blokujących OAI-SearchBot spada do zera (wobec 0,394).
robots.txt dla botów AI to nie plik techniczny, tylko cennik widoczności: każda linijka „Disallow” ma policzalny koszt w cytowaniach — zanim ją dopiszesz, sprawdź w oficjalnym katalogu botów, co dokładnie wyłączasz.
Strategia 1: maksymalna widoczność w AI (domyślna rekomendacja dla firm, które chcą być cytowane). Boty crawlują domyślnie, więc wystarczy nie blokować — jawny zapis „Allow” dokumentuje decyzję i chroni przed przypadkowym odziedziczeniem reguły „Disallow” z sekcji ogólnej:
User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Google-Extended
Allow: /
Strategia 2: widoczność bez treningu. Blokujesz boty treningowe, zostawiając indeksy wyszukiwarek AI — to możliwe, bo kontrolki są rozdzielone (OpenAI, 2025):
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /
Strategia 3: pełna blokada botów AI. Dopisujesz „Disallow: /” dla wszystkich tokenów z tabeli powyżej — i akceptujesz, że sam plik nie wystarczy. RFC 9309, formalny standard IETF dla robots.txt od września 2022, stwierdza wprost, że reguły „are not a form of access authorization” (IETF RFC 9309, 2022). Twarda blokada wymaga warstwy serwerowej: WAF i weryfikacji wizyt po opublikowanych zakresach IP. Rynek zresztą już idzie w tę stronę — od 1 lipca 2025 Cloudflare domyślnie blokuje crawlery AI dla nowo rejestrowanych domen (Cloudflare, 2025).
Jeśli nie wiesz, która strategia pasuje do Twojego modelu biznesowego, zacznij od pomiaru: audyt widoczności w AI pokaże, które silniki już cytują Twoją stronę i co realnie stracisz na każdej blokadzie. Techniczne przygotowanie strony (renderowanie, sitemapy, dostępność treści dla botów) opisujemy krok po kroku w przewodniku jak przygotować stronę na silniki generatywne.
Jakie błędy najczęściej psują konfigurację robots.txt pod boty AI?
Najdroższe błędy wynikają z traktowania botów jednego dostawcy jako jednego bota oraz z kopiowania cudzych plików bez weryfikacji w dokumentacji. Pięć powtarzalnych problemów:
- Blokowanie OAI-SearchBot „przy okazji” GPTBota. To dwie różne funkcje: blokada GPTBota wyłącza trening, blokada OAI-SearchBot usuwa stronę z odpowiedzi ChatGPT search (OpenAI, 2025). W badaniu cloro.dev (2026) GPTBota blokowało 13,9% domen, a OAI-SearchBota tylko 3,4% — większość rynku rozumie już tę różnicę.
- Kopiowanie przestarzałych list user-agentów. Tokeny „anthropic-ai” i „claude-web” nie istnieją w bieżącej dokumentacji Anthropic, a wciąż blokuje je 72% i 66% topowych serwisów newsowych (Search Engine Land, 2026).
- Traktowanie Google-Extended jako wyłącznika AI Overviews. Blokada nie usuwa strony z AI Overviews ani z AI Mode — steruje wyłącznie treningiem Gemini i groundingiem (Google Search Central, 2025).
- Wiara, że robots.txt to blokada techniczna. ChatGPT-User „may not apply” (OpenAI, 2025), Perplexity-User „generally ignores robots.txt” (Perplexity, stan na lipiec 2026), a udokumentowany przez Cloudflare (2025) stealth-crawling pokazuje, że deklaracje bywają łamane. Egzekwowanie = WAF i weryfikacja IP.
- Zastępowanie robots.txt plikiem llms.txt. llms.txt — proponowany standard mapy treści dla systemów AI — nie ma potwierdzonej adopcji: według Ahrefs (2026) 97% z około 38 tys. domen z poprawnym plikiem llms.txt nie otrzymało w maju 2026 ani jednego żądania o ten plik, a żaden duży dostawca (OpenAI, Anthropic, Google) go nie wspiera. Kontrolę dostępu robi robots.txt i serwer, nie llms.txt.
FAQ: robots.txt i boty AI
Czy blokada GPTBota usunie moją stronę z ChatGPT?
Nie bezpośrednio — GPTBot odpowiada za trening modeli, a za wyszukiwarkę ChatGPT odpowiada OAI-SearchBot (OpenAI, 2025). W praktyce blokada GPTBota koreluje jednak z niemal zerową cytowalnością: mediana cytowań ChatGPT na obecność w organiku Google to 0,003 u blokujących wobec 0,417 u nieblokujących (cloro.dev, 2026).
Czy blokada Google-Extended obniży moje pozycje w Google?
Nie. Google deklaruje, że Google-Extended „does not impact a site’s inclusion in Google Search nor is it used as a ranking signal” (Google Search Central, 2026). Token steruje wyłącznie użyciem treści do treningu modeli Gemini i do groundingu; nie dotyczy ani rankingu, ani AI Overviews.
Czy boty AI zawsze respektują robots.txt?
Nie. RFC 9309 definiuje robots.txt jako konwencję dobrowolną — reguły „are not a form of access authorization” (IETF, 2022). Boty fetchujące na żądanie użytkownika (ChatGPT-User, Perplexity-User) mogą reguły pomijać zgodnie z własną dokumentacją, a Cloudflare udokumentował w 2025 stealth-crawling Perplexity omijający blokady (Cloudflare, 2025).
Czy llms.txt zastępuje robots.txt?
Nie. To dwa różne pliki o różnych rolach: robots.txt kontroluje dostęp botów, llms.txt to propozycja mapy treści dla systemów AI — bez potwierdzonej adopcji. Według Ahrefs (2026) 97% domen z poprawnym llms.txt nie dostało w maju 2026 żadnego żądania o ten plik; OpenAI, Anthropic i Google go nie wspierają.