← Wróć do bloga
GEO 16 July 2026 · 8 min czytania 16 jul 2026 · 8 min

Jak ChatGPT wybiera źródła, które cytuje? Mechanika cytowań AI

Dawid Walczyk
Dawid Walczyk
Co-Founder
Abstrakcyjna ilustracja pokazująca, jak model językowy wybiera źródła do cytowania: z pola dokumentów tylko wybrane strony trafiają do sieci neuronowej, która generuje odpowiedź z cytowaniami
Odpowiedź w skrócie
Cytowania AI powstają w warstwie groundingu — na bazie indeksów wyszukiwania (własny indeks OAI-SearchBot, Bing, dostawcy zewnętrzni), nie wiedzy z treningu. Najsilniejsze korelaty cytowań leżą poza stroną marki: 84% cytowań AI pochodzi z earned media (Muck Rack, 2026), a wzorce doboru źródeł potrafią odwrócić się w tygodnie — udział Reddita w odpowiedziach ChatGPT spadł z ok. 60% do ok. 10%.

Pytanie „jak ChatGPT wybiera źródła” często zakłada, że model przegląda internet i ocenia strony jak redaktor. Tak nie jest. Cytowania AI powstają w kilkuetapowym procesie technicznym: crawler buduje indeks, warstwa wyszukiwania dobiera dokumenty-kandydatów, a model językowy składa z nich odpowiedź i podpina linki. Ten tekst rozkłada tę mechanikę na części na podstawie oficjalnej dokumentacji platform i badań z lat 2024–2026; kontekst strategiczny znajdziesz w przewodniku po GEO (Generative Engine Optimization) — metodzie tworzenia i optymalizacji treści tak, aby były cytowane i wykorzystywane w odpowiedziach generowanych przez AI.

Skąd model językowy bierze źródła: z treningu czy z wyszukiwania?

Cytowania w odpowiedziach AI pochodzą z warstwy wyszukiwania (groundingu), a nie z treningu modelu — to dwa rozdzielne mechanizmy o różnych regułach. Model językowy (LLM) — duży model językowy, czyli silnik ChatGPT, Gemini czy Claude’a — koduje podczas treningu wzorce i fakty w swoich parametrach, ale nie przechowuje przypisów: odpowiadając wyłącznie „z pamięci”, nie potrafi wiarygodnie wskazać, skąd wie to, co wie. Grounding działa odwrotnie: to opieranie odpowiedzi na bieżących wynikach wyszukiwania i indeksie, zamiast wyłącznie na wiedzy z treningu. Dopiero w tym trybie silnik generatywny — system odpowiadający użytkownikowi wygenerowaną odpowiedzią zamiast listą linków, jak ChatGPT, Perplexity, Google AI Overviews czy Copilot — pobiera fragmenty konkretnych stron i podpina do nich linki. Taki link to cytowanie (w odpowiedzi AI): wskazanie strony jako źródła w formie przypisu.

OpenAI rozdziela te dwa światy już na poziomie crawlerów: utrzymuje osobne boty o odrębnych rolach i niezależnych kontrolkach w robots.txt — trzy z nich decydują o widoczności treści (OpenAI, 2025):

Bot Rola Skutek blokady w robots.txt
GPTBot crawling treści pod trening modeli wykluczenie z treningu; bez wpływu na ChatGPT search
OAI-SearchBot budowa indeksu pod ChatGPT search strona nie pojawi się w odpowiedziach ChatGPT search (może pozostać jako link nawigacyjny)
ChatGPT-User pobranie strony na żądanie użytkownika blokada może nie działać — „Because these actions are initiated by a user, robots.txt rules may not apply”

Praktyczna konsekwencja tego podziału: można zablokować trening (GPTBot) i pozostać w pełni widocznym w ChatGPT search (OAI-SearchBot) — kontrolki działają niezależnie (OpenAI, 2025). Analogiczny rozdział stosuje Google: Google-Extended to token kontrolny w robots.txt, nie osobny crawler; jego blokada wyłącza użycie treści do treningu i groundingu Gemini, ale nie wpływa na obecność w Google Search, ranking ani na AI Overviews — generowane przez AI podsumowania nad wynikami wyszukiwania zasila zwykły indeks Search budowany przez Googlebota (Google, 2026).

Jak ChatGPT wybiera źródła w trybie wyszukiwania?

ChatGPT dobiera źródła z więcej niż jednego indeksu: OpenAI deklaruje udostępnianie zdeasocjowanych zapytań wyszukiwarce Bing oraz zewnętrznym dostawcom wyszukiwania (third-party search providers), a równolegle buduje własny indeks crawlowany przez OAI-SearchBot; dla planów Enterprise/Edu Bing jest jedynym wskazanym dostawcą zewnętrznym (OpenAI, 2026). Popularna teza „ChatGPT to po prostu Bing” jest więc nieaktualna, choć Bing pozostaje istotnym kanałem (stan na lipiec 2026). W Microsoft 365 Copilot zależność jest natomiast udokumentowana wprost: Copilot generuje z promptu zapytanie i wysyła je do usługi wyszukiwania Bing, więc indeksacja w Bing jest warunkiem widoczności strony w webowych odpowiedziach Copilota (Microsoft Learn, 2026).

Zanim treść w ogóle trafi do któregokolwiek indeksu, musi być technicznie czytelna dla botów. Analiza ruchu botów przeprowadzona przez Vercel i MERJ (próba obejmująca m.in. 569 mln żądań GPTBot i 370 mln żądań botów Anthropic miesięcznie) wykazała, że żaden z głównych crawlerów AI nie renderuje JavaScriptu: GPTBot pobiera pliki JS w 11,5% żądań, ale ich nie wykonuje, więc treść renderowana wyłącznie po stronie klienta jest dla tych botów niewidoczna; wyjątkiem są ekosystem Google i AppleBot (Vercel i MERJ, 2024).

Sama selekcja źródeł nie odwzorowuje przy tym rankingu Google. W analizie 15 000 zapytań long-tail tylko 12% linków cytowanych przez ChatGPT, Gemini i Copilota rankowało w top-10 Google dla danego zapytania, a około 80% cytowań nie rankowało w Google nigdzie; najbliżej wyników Google był Perplexity (28,6% cytowań z top-10) (Ahrefs, 2025). Nawet AI Overviews oddalają się od klasycznego rankingu: udział cytowań AIO pochodzących z top-10 Google spadł z 76,1% w lipcu 2025 do 37,9% w marcu 2026, przy czym część tego spadku wynika ze zmiany metodologii — edycja 2025 liczyła tylko trzy widoczne cytowania (Ahrefs, 2026). Czym logika doboru źródeł w silnikach generatywnych różni się od klasycznego rankingu, opisujemy szerzej w tekście GEO vs SEO — co się zmienia.

Diagram pokazujący, skąd biorą się cytowania AI: pipeline groundingu crawler → indeks → wyszukiwanie → odpowiedź z cytowaniami, obok odseparowany trening modelu bez przypisów

Jakie cechy treści korelują z cytowaniami AI?

Najsilniejsze znane korelaty cytowań leżą poza własną domeną marki — w tym, co piszą o niej niezależne źródła trzecie. Dane z lat 2024–2026 układają się w czytelną hierarchię:

  • Earned media dominuje. 84% wszystkich cytowań AI pochodzi ze źródeł trzecich, nie z własnych treści marek; samo dziennikarstwo to 27% cytowanych źródeł, a treści płatne i advertoriale — zaledwie 0,3% (Muck Rack, 2026; ponad 25 mln linków z odpowiedzi ChatGPT, Claude’a i Gemini, 17 branż; zakres 82–89% w trzech edycjach badania od lipca 2025).
  • Wzmianki biją backlinki. W badaniu 75 000 marek wzmianki o marce na YouTube były najsilniejszym pojedynczym korelatem widoczności marki w odpowiedziach AI (Spearman ~0,737), przed brandowymi wzmiankami webowymi (0,656–0,709); backlinki korelowały słabo (~0,218), a Domain Rating umiarkowanie (0,266–0,326) (Ahrefs, 2025). To korelacje, nie dowód przyczynowości, a próba obejmowała wyłącznie marki o DR>40.
  • Świeżość pomaga umiarkowanie. ChatGPT, Perplexity, Gemini i Copilot cytują treści średnio o 25,7% świeższe niż organiczne wyniki Google (1064 vs 1432 dni od publikacji), ale średni wiek cytowanej treści to nadal około 2,9 roku, a w AI Overviews efekt nie występuje (Ahrefs, 2025). Relewancja wygrywa ze świeżością.
  • Początek treści pracuje najciężej. 44,2% zweryfikowanych cytowań ChatGPT wskazywało fragmenty z pierwszych 30% treści strony, a tylko 24,7% z ostatniej jednej trzeciej (Kevin Indig, 2026; 18 012 cytowań z 1,2 mln odpowiedzi). To korelacyjny, ale mocny argument za pisaniem answer-first.
  • Dowody na taktyki on-page są mieszane. Recenzowany eksperyment GEO wykazał do 40% wzrostu widoczności treści na metryce Position-Adjusted Word Count po dodaniu cytatów, statystyk i przywołań źródeł (Aggarwal i in., KDD 2024), ale niezależna replikacja na metryce rankingu cytowań tego nie potwierdziła: tylko 3 z 54 przypadków dały istotny statystycznie pozytywny efekt, a metoda „dodaj statystyki” pogarszała ranking cytowań w 19 z 24 ustawień (Puerto i in., NeurIPS 2025).

O cytowaniu w odpowiedzi AI silniej decyduje to, co o marce piszą niezależne źródła, niż to, co marka publikuje u siebie: earned media odpowiada za 84% cytowań AI (Muck Rack, 2026), a wzmianki o marce na YouTube korelują z widocznością w AI wielokrotnie silniej niż backlinki (Ahrefs, 2025).

Dlaczego cytowania AI są niestabilne w czasie?

Wzorce doboru źródeł potrafią odwrócić się w kilka tygodni bez żadnej zmiany po stronie wydawców. Udział Reddita w odpowiedziach ChatGPT spadł z około 60% odpowiedzi na początku sierpnia 2025 do około 10% w połowie września 2025, a Wikipedii — z około 55% do poniżej 20%; zmiana ograniczyła się do ChatGPT, bo AI Mode i Perplexity były w tym okresie stabilne (Semrush, 2025; 230 000 promptów, 3 platformy, 13 tygodni). Skoro tak duże przesunięcie dotknęło jednego silnika i nie dotknęło pozostałych, dobór źródeł jest w istotnej mierze decyzją produktową i konfiguracją retrievalu po stronie platformy — nie stałym „algorytmem”, który można raz rozpracować i odhaczyć.

Dla marek wynikają z tego dwie rzeczy: jednorazowy pomiar widoczności to migawka, która dezaktualizuje się w tygodnie, a wyniki trzeba śledzić osobno per silnik. Jeśli chcesz wiedzieć, czy ChatGPT, Gemini i Copilot cytują Twoją markę dziś — a nie pół roku temu — zacznij od audytu widoczności w AI: cyklicznego pomiaru, gdzie i jak marka pojawia się w odpowiedziach silników generatywnych, na stałym zestawie promptów.

Czym są ghost citations i dlaczego psują pomiar widoczności?

Ghost citation to cytowanie URL-a strony bez wymienienia marki w treści odpowiedzi — i dotyczy większości cytowań AI: 61,7% cytowań nie łączy się z żadną wzmianką marki, czyli wystąpieniem nazwy marki w treści odpowiedzi (Semrush i Kevin Indig, 2026). Silniki mają przy tym odwrotne profile: Gemini wymienia marki w 83,7% wystąpień, a cytuje tylko w 21,4%; ChatGPT odwrotnie — cytuje w 87%, a wymienia w 20,7%. Najwięcej wzmianek generowały treści porównawcze: 43,3%, czyli 2,4 razy więcej niż treści informacyjne. Próba badania jest umiarkowana (115 promptów, 3 981 wystąpień domen, 14 krajów, 4 platformy), więc liczby traktuj jako rząd wielkości, nie precyzyjny benchmark.

Konsekwencja dla pomiaru: cytowanie i wzmianka marki to dwa osobne wskaźniki i trzeba je liczyć rozdzielnie. Strona może być cytowana bez wymienienia marki (ruch bez budowy rozpoznawalności) albo wymieniana bez cytowania (rozpoznawalność bez ruchu) — narzędzie, które zlicza tylko jedno z dwojga, pokaże fałszywy obraz widoczności w AI.

FAQ: jak ChatGPT wybiera źródła — najczęstsze pytania

Poniżej trzy pytania, które najczęściej padają przy okazji mechaniki cytowań AI.

Czy blokada GPTBot w robots.txt usunie stronę z ChatGPT search?

Nie. GPTBot odpowiada wyłącznie za crawling pod trening modeli; widoczność w ChatGPT search zależy od OAI-SearchBot i to jego blokada sprawia, że strona nie pojawi się w odpowiedziach ChatGPT search (OpenAI, 2025). Uwaga na trzeci bot: przy ChatGPT-User, pobierającym stronę na żądanie użytkownika, „robots.txt rules may not apply” (OpenAI, 2025).

Czy wysoka pozycja w Google gwarantuje cytowanie w odpowiedziach AI?

Nie gwarantuje, ale w AI Overviews silnie koreluje: strona z pozycji 1. pojawia się w AIO w 43% przypadków, z pozycji 20. — w 7%, a 94% AIO zawiera co najmniej jedno cytowanie z top-20 (seoClarity, 2025). W chatbotach zależność jest słaba: tylko 12% linków cytowanych przez ChatGPT, Gemini i Copilota rankowało w top-10 Google dla zapytania (Ahrefs, 2025).

Czy plik llms.txt zwiększa szanse na cytowanie?

Nie ma na to dowodów. llms.txt — proponowany standard pliku z mapą najważniejszych treści strony dla systemów AI — nie jest używany przez żadnego dużego dostawcę LLM (OpenAI, Anthropic, Google): 97% z około 38 000 domen z poprawnym plikiem nie otrzymało w maju 2026 ani jednego żądania o ten plik, a Google oficjalnie go ignoruje (Ahrefs, 2026).

Czytaj dalej

Wszystkie wpisy →
GEO vs SEO — od listy niebieskich linków do jednej odpowiedzi AI

GEO vs SEO: co się zmienia, gdy wyszukiwarką staje się model językowy

Sprawdź, czy AI zna Twoją markę

Umów darmową konsultację