← Wróć do bloga
Poradniki 13 August 2026 · 10 min czytania 13 aug 2026 · 10 min

robots.txt dla botów AI: GPTBot, OAI-SearchBot, PerplexityBot i inne

Dawid Walczyk
Dawid Walczyk
Co-Founder
Plik robots.txt jako brama kontrolująca dostęp botów AI do strony — część crawlerów przepuszczona, część zablokowana
Odpowiedź w skrócie
OpenAI, Anthropic, Perplexity i Google rozdzielają kontrolę w robots.txt na osobne tokeny: inne boty odpowiadają za trening modeli (GPTBot, ClaudeBot, Google-Extended), inne za wyszukiwarki AI (OAI-SearchBot, PerplexityBot), a boty fetch na żądanie użytkownika mogą reguły ignorować. Koszt złej blokady jest policzalny: mediana cytowań ChatGPT u domen blokujących GPTBot to 0,003 wobec 0,417 u nieblokujących (cloro.dev, 2026).

Dlaczego robots.txt dla botów AI to decyzja strategiczna, a nie techniczna?

Reguły robots.txt dla botów AI decydują dziś o trzech osobnych rzeczach naraz: czy Twoja treść trafia do treningu modeli, czy pojawia się w wyszukiwarkach AI i czy silnik generatywny — system odpowiadający użytkownikowi wygenerowaną odpowiedzią zamiast listą linków (ChatGPT, Perplexity, Google AI Overviews, Copilot) — może pobrać Twoją stronę na żądanie użytkownika. Jedna źle dobrana linijka potrafi wyzerować widoczność marki w całym silniku, dlatego to decyzja biznesowa, a nie kosmetyka techniczna.

Skala zjawiska jest mierzalna. Według danych Cloudflare (2025) około 80% crawlingu botów AI w ciągu 12 miesięcy do lipca 2025 służyło treningowi modeli, a tylko 18% wyszukiwaniu; udział treningu rósł z 72% (lipiec 2024) do 79% (lipiec 2025). Dwa najaktywniejsze crawlery to GPTBot i ClaudeBot: w lipcu 2025 odpowiadały kolejno za 28,1% i 23,3% ruchu botów AI w sieci Cloudflare (Cloudflare, 2025).

Punktem startowym całej fali blokad była publiczna dokumentacja GPTBota z 7 sierpnia 2023 (Glide, 2023). Od tego czasu każdy duży dostawca AI opublikował własny katalog botów — i to właśnie te oficjalne katalogi, a nie kopiowane z forów listy user-agentów, powinny być podstawą Twojego pliku. Kontekst strategiczny tej zmiany opisujemy w tekście GEO vs SEO — co się zmienia oraz w naszym przewodniku po GEO (Generative Engine Optimization), czyli metodzie tworzenia i optymalizacji treści tak, aby były cytowane w odpowiedziach generowanych przez AI.

Jakie boty wysyła OpenAI i co robi każdy z nich?

OpenAI rozdziela kontrolę w robots.txt na trzy niezależne tokeny — GPTBot, OAI-SearchBot i ChatGPT-User — więc możesz zablokować trening modeli, pozostając w pełni widocznym w wyszukiwarce ChatGPT (OpenAI, dokumentacja crawlerów, 2025). To najważniejsza pojedyncza informacja w tym temacie, bo większość szkód bierze się z traktowania botów OpenAI jako jednego „bota ChatGPT”.

  • GPTBot crawluje treści do treningu przyszłych modeli. Blokada wyklucza stronę z materiału treningowego, ale nie z wyszukiwania.
  • OAI-SearchBot buduje indeks wyszukiwania ChatGPT search. Dokumentacja mówi wprost: „Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers” (OpenAI, 2025) — blokada usuwa stronę z odpowiedzi wyszukiwarki ChatGPT.
  • ChatGPT-User pobiera konkretną stronę, gdy poprosi o to użytkownik w rozmowie. Po rewizji dokumentacji z grudnia 2025 OpenAI zastrzega: „Because these actions are initiated by a user, robots.txt rules may not apply” (OpenAI, 2025). Skuteczna blokada wymaga warstwy serwerowej, np. filtrowania po opublikowanych zakresach IP.
  • OAI-AdsBot — czwarty, najnowszy bot (w dokumentacji publicznie od 21 kwietnia 2026) — waliduje bezpieczeństwo stron docelowych reklam w ChatGPT i odwiedza wyłącznie strony zgłoszone jako reklamy (OpenAI, 2026).

OpenAI publikuje zakresy IP każdego bota w osobnych plikach JSON (m.in. openai.com/gptbot.json i chatgpt-user.json), co pozwala weryfikować autentyczność wizyt po adresie, a nie tylko po nagłówku user-agent (OpenAI, 2025).

Diagram: robots.txt dla botów AI rozdziela trzy boty OpenAI — GPTBot (trening modeli AI), OAI-SearchBot (indeks wyszukiwarki ChatGPT) i ChatGPT-User (pobranie strony na żądanie użytkownika) — z konsekwencjami blokady każdego z nich

Jak działają ClaudeBot i pozostałe boty Anthropic?

Anthropic stosuje identyczny trójpodział jak OpenAI: ClaudeBot zbiera treści pod trening modeli, Claude-SearchBot indeksuje strony pod jakość wyników wyszukiwania Claude, a Claude-User pobiera stronę, gdy pyta o nią użytkownik — i według deklaracji wszystkie trzy respektują robots.txt, łącznie z dyrektywą Crawl-delay (Anthropic, dokumentacja wsparcia, stan na lipiec 2026).

Konsekwencje blokad są rozdzielne: blokada ClaudeBot oznacza, że „future materials should be excluded from our AI model training datasets”, natomiast blokada Claude-User odcina pobieranie treści na żądanie użytkownika i — jak pisze sam Anthropic — „may reduce your site’s visibility”. Blokada nie usuwa danych zebranych wcześniej (Anthropic, stan na lipiec 2026). Zakresy IP botów Anthropic są publikowane pod claude.com/crawling/bots.json.

Uwaga na tokeny historyczne: „anthropic-ai” i „claude-web” nie występują w aktualnej oficjalnej dokumentacji Anthropic — bieżące agenty to wyłącznie ClaudeBot, Claude-User i Claude-SearchBot — a mimo to wciąż blokuje je odpowiednio 72% i 66% topowych serwisów newsowych (Search Engine Land, 2026, za danymi BuzzStream). Takie martwe reguły nie szkodzą, ale dają fałszywe poczucie kontroli i zaśmiecają plik.

Czym różni się PerplexityBot od Perplexity-User?

PerplexityBot indeksuje strony, by „surface and link websites in search results on Perplexity”, i według deklaracji „is not used to crawl content for AI foundation models” — nie służy więc treningowi modeli, tylko widoczności w wynikach (Perplexity, dokumentacja crawlerów, stan na lipiec 2026). Drugi agent, Perplexity-User, pobiera stronę w odpowiedzi na pytanie użytkownika i — według tej samej dokumentacji — „generally ignores robots.txt rules”. Zakresy IP obu botów Perplexity publikuje w plikach perplexitybot.json i perplexity-user.json.

Deklaracje trzeba jednak zestawić z pomiarami. Cloudflare udokumentował 4 sierpnia 2025, że Perplexity używał niezadeklarowanych stealth-crawlerów: podszywały się pod przeglądarkę Chrome na macOS i rotowały adresy IP oraz numery ASN spoza oficjalnie opublikowanych zakresów, omijając blokady robots.txt i reguły WAF; Perplexity zaprzeczył tym ustaleniom (Cloudflare, 2025). Wniosek praktyczny: reguły robots.txt dla Perplexity traktuj jako deklarację intencji, a twardą kontrolę dostępu realizuj na serwerze.

Co naprawdę kontroluje Google-Extended?

Google-Extended nie jest crawlerem — to token kontrolny w robots.txt bez własnego user-agenta („Google-Extended doesn’t have a separate HTTP request user agent string”); strony fizycznie pobierają istniejące agenty Google, a token decyduje tylko o tym, do czego wolno użyć treści (Google Search Central, 2026). Blokada wyklucza treść z treningu modeli Gemini (Gemini Apps, Vertex AI) oraz z groundingu — czyli podawania treści z indeksu Search modelowi w momencie zapytania — ogłoszono go 28 września 2023 (Google, 2026).

Najczęstsze nieporozumienie: blokada Google-Extended nie wpływa na obecność w Google Search ani na ranking („does not impact a site’s inclusion in Google Search nor is it used as a ranking signal”, Google Search Central, 2026) i nie usuwa strony z AI Overviews ani AI Mode — te funkcje działają w ramach zwykłej wyszukiwarki Google i jej indeksu (Google Search Central, 2025). Jedyna kontrola nad AI Overviews to blokada Googlebota, tag noindex albo dyrektywy nosnippet / data-nosnippet / max-snippet — każda z nich uderza jednak także w klasyczne wyniki wyszukiwania.

Co tracisz, blokując poszczególne boty AI?

Każdy bot ma inną funkcję, więc każda blokada ma inną cenę — poniższa tabela zestawia katalog botów z oficjalnych dokumentacji (stan na lipiec 2026) z konsekwencją blokady w robots.txt.

Bot (token) Właściciel Funkcja Konsekwencja blokady
GPTBot OpenAI crawling treści do treningu modeli treść poza treningiem przyszłych modeli; w praktyce koreluje też ze spadkiem cytowań w ChatGPT
OAI-SearchBot OpenAI indeks wyszukiwania ChatGPT search strona znika z odpowiedzi ChatGPT search
ChatGPT-User OpenAI pobranie strony na żądanie użytkownika brak fetchu na życzenie; reguły „may not apply” — pewna blokada tylko po IP/WAF
OAI-AdsBot OpenAI walidacja stron docelowych reklam w ChatGPT dotyczy wyłącznie stron zgłoszonych jako reklamy
ClaudeBot Anthropic zbieranie treści pod trening modeli przyszłe materiały wykluczone z zestawów treningowych; dane zebrane wcześniej zostają
Claude-SearchBot Anthropic indeksowanie pod wyniki wyszukiwania Claude gorsza/żadna obecność w wynikach wyszukiwania Claude
Claude-User Anthropic dostęp do strony, gdy pyta użytkownik brak pobrania treści na żądanie; wg Anthropic „may reduce your site’s visibility”
PerplexityBot Perplexity indeks wyników Perplexity (nie trening) strona znika z wyników i linków w Perplexity
Perplexity-User Perplexity fetch na pytanie użytkownika deklaratywnie „generally ignores robots.txt” — blokada wymaga warstwy serwerowej
Google-Extended Google token kontrolny: trening Gemini + grounding treść poza treningiem Gemini i groundingiem; zero wpływu na Search, ranking i AI Overviews

Źródła funkcji i konsekwencji: dokumentacje OpenAI, Anthropic, Perplexity i Google (dostęp: lipiec 2026).

Jakie reguły robots.txt wpisać dla swojej strategii?

Właściwe reguły zależą od jednej decyzji: czy ważniejsza jest dla Ciebie widoczność w odpowiedziach AI, czy kontrola nad użyciem treści w treningu — poniżej trzy gotowe warianty. Cena złej decyzji jest policzalna: według badania cloro.dev (2026) na 1 058 prominentnych domenach mediana „citation propensity” (liczby cytowań ChatGPT na jedną obecność w organiku Google) wynosi 0,003 u domen blokujących GPTBot wobec 0,417 u nieblokujących, a u blokujących OAI-SearchBot spada do zera (wobec 0,394).

robots.txt dla botów AI to nie plik techniczny, tylko cennik widoczności: każda linijka „Disallow” ma policzalny koszt w cytowaniach — zanim ją dopiszesz, sprawdź w oficjalnym katalogu botów, co dokładnie wyłączasz.

Strategia 1: maksymalna widoczność w AI (domyślna rekomendacja dla firm, które chcą być cytowane). Boty crawlują domyślnie, więc wystarczy nie blokować — jawny zapis „Allow” dokumentuje decyzję i chroni przed przypadkowym odziedziczeniem reguły „Disallow” z sekcji ogólnej:

User-agent: GPTBot
User-agent: OAI-SearchBot
User-agent: ClaudeBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
User-agent: Google-Extended
Allow: /

Strategia 2: widoczność bez treningu. Blokujesz boty treningowe, zostawiając indeksy wyszukiwarek AI — to możliwe, bo kontrolki są rozdzielone (OpenAI, 2025):

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
User-agent: Claude-SearchBot
User-agent: PerplexityBot
Allow: /

Strategia 3: pełna blokada botów AI. Dopisujesz „Disallow: /” dla wszystkich tokenów z tabeli powyżej — i akceptujesz, że sam plik nie wystarczy. RFC 9309, formalny standard IETF dla robots.txt od września 2022, stwierdza wprost, że reguły „are not a form of access authorization” (IETF RFC 9309, 2022). Twarda blokada wymaga warstwy serwerowej: WAF i weryfikacji wizyt po opublikowanych zakresach IP. Rynek zresztą już idzie w tę stronę — od 1 lipca 2025 Cloudflare domyślnie blokuje crawlery AI dla nowo rejestrowanych domen (Cloudflare, 2025).

Jeśli nie wiesz, która strategia pasuje do Twojego modelu biznesowego, zacznij od pomiaru: audyt widoczności w AI pokaże, które silniki już cytują Twoją stronę i co realnie stracisz na każdej blokadzie. Techniczne przygotowanie strony (renderowanie, sitemapy, dostępność treści dla botów) opisujemy krok po kroku w przewodniku jak przygotować stronę na silniki generatywne.

Jakie błędy najczęściej psują konfigurację robots.txt pod boty AI?

Najdroższe błędy wynikają z traktowania botów jednego dostawcy jako jednego bota oraz z kopiowania cudzych plików bez weryfikacji w dokumentacji. Pięć powtarzalnych problemów:

  1. Blokowanie OAI-SearchBot „przy okazji” GPTBota. To dwie różne funkcje: blokada GPTBota wyłącza trening, blokada OAI-SearchBot usuwa stronę z odpowiedzi ChatGPT search (OpenAI, 2025). W badaniu cloro.dev (2026) GPTBota blokowało 13,9% domen, a OAI-SearchBota tylko 3,4% — większość rynku rozumie już tę różnicę.
  2. Kopiowanie przestarzałych list user-agentów. Tokeny „anthropic-ai” i „claude-web” nie istnieją w bieżącej dokumentacji Anthropic, a wciąż blokuje je 72% i 66% topowych serwisów newsowych (Search Engine Land, 2026).
  3. Traktowanie Google-Extended jako wyłącznika AI Overviews. Blokada nie usuwa strony z AI Overviews ani z AI Mode — steruje wyłącznie treningiem Gemini i groundingiem (Google Search Central, 2025).
  4. Wiara, że robots.txt to blokada techniczna. ChatGPT-User „may not apply” (OpenAI, 2025), Perplexity-User „generally ignores robots.txt” (Perplexity, stan na lipiec 2026), a udokumentowany przez Cloudflare (2025) stealth-crawling pokazuje, że deklaracje bywają łamane. Egzekwowanie = WAF i weryfikacja IP.
  5. Zastępowanie robots.txt plikiem llms.txt. llms.txt — proponowany standard mapy treści dla systemów AI — nie ma potwierdzonej adopcji: według Ahrefs (2026) 97% z około 38 tys. domen z poprawnym plikiem llms.txt nie otrzymało w maju 2026 ani jednego żądania o ten plik, a żaden duży dostawca (OpenAI, Anthropic, Google) go nie wspiera. Kontrolę dostępu robi robots.txt i serwer, nie llms.txt.

FAQ: robots.txt i boty AI

Czy blokada GPTBota usunie moją stronę z ChatGPT?

Nie bezpośrednio — GPTBot odpowiada za trening modeli, a za wyszukiwarkę ChatGPT odpowiada OAI-SearchBot (OpenAI, 2025). W praktyce blokada GPTBota koreluje jednak z niemal zerową cytowalnością: mediana cytowań ChatGPT na obecność w organiku Google to 0,003 u blokujących wobec 0,417 u nieblokujących (cloro.dev, 2026).

Czy blokada Google-Extended obniży moje pozycje w Google?

Nie. Google deklaruje, że Google-Extended „does not impact a site’s inclusion in Google Search nor is it used as a ranking signal” (Google Search Central, 2026). Token steruje wyłącznie użyciem treści do treningu modeli Gemini i do groundingu; nie dotyczy ani rankingu, ani AI Overviews.

Czy boty AI zawsze respektują robots.txt?

Nie. RFC 9309 definiuje robots.txt jako konwencję dobrowolną — reguły „are not a form of access authorization” (IETF, 2022). Boty fetchujące na żądanie użytkownika (ChatGPT-User, Perplexity-User) mogą reguły pomijać zgodnie z własną dokumentacją, a Cloudflare udokumentował w 2025 stealth-crawling Perplexity omijający blokady (Cloudflare, 2025).

Czy llms.txt zastępuje robots.txt?

Nie. To dwa różne pliki o różnych rolach: robots.txt kontroluje dostęp botów, llms.txt to propozycja mapy treści dla systemów AI — bez potwierdzonej adopcji. Według Ahrefs (2026) 97% domen z poprawnym llms.txt nie dostało w maju 2026 żadnego żądania o ten plik; OpenAI, Anthropic i Google go nie wspierają.

Czytaj dalej

Wszystkie wpisy →
Ilustracja hero artykułu o pisaniu treści pod cytowania AI: pierwsze zdanie dokumentu podświetlone na żółto, wyciągane przez znak cytatu do okna odpowiedzi AI — metafora zasady BLUF i zdań cytowalnych.

Jak pisać treści, które AI może zacytować: BLUF i zdania cytowalne

Minimalistyczna ilustracja pliku llms.txt: dokument Markdown połączony liniami z węzłami systemów AI, z których większość połączeń pozostaje nieużywana.

llms.txt: jak wdrożyć plik i czego się (nie) spodziewać

Abstrakcyjna ilustracja pokazująca, jak dane strukturalne schema.org przekazują kontekst strony do silnika AI, podczas gdy magiczny skrót do widoczności w AI kończy się przerwaną linią

Schema i dane strukturalne: co naprawdę dają widoczności w AI

Sprawdź, czy AI zna Twoją markę

Umów darmową konsultację