← Wróć do bloga
Badania 31 August 2026 · 9 min czytania 31 aug 2026 · 9 min

Jak ChatGPT wybiera źródła, które cytuje — i co z tego wynika dla marek

Michał Rochwerger
Michał Rochwerger
Co-Founder
Ilustracja wektorowa flat marki Vistrix: centralny węzeł ChatGPT rozsyła zapytania do siatki stron, z których tylko kilka zostaje wybranych i podświetlonych — obraz mechaniki, jak ChatGPT wybiera źródła, które cytuje.
Odpowiedź w skrócie
ChatGPT nie wybiera źródeł jak Google: korzysta z indeksu Bing i własnego OAI-SearchBot, pobiera więcej stron niż cytuje i faworyzuje dopasowanie semantyczne. Podobieństwo cosinusowe tytułu do zapytania to 0,602 dla stron cytowanych wobec 0,484 dla niecytowanych (Ahrefs, kwiecień 2026). Pozycja w top-10 Google jest słabym predyktorem cytowania.

ChatGPT nie wybiera źródeł tak jak Google wybiera wyniki. Wyszukiwanie w ChatGPT (funkcja groundingu, czyli opierania odpowiedzi na bieżącym indeksie zamiast wyłącznie na wiedzy z treningu) korzysta z indeksu Bing oraz własnego indeksu OpenAI, pobiera znacznie więcej stron niż cytuje i faworyzuje treści świeższe i lepiej dopasowane semantycznie niż typowy wynik organiczny. W badaniu 1,4 mln promptów podobieństwo cosinusowe tytułu do zapytania wynosiło 0,602 dla stron cytowanych wobec 0,484 dla niecytowanych (Ahrefs, kwiecień 2026). Ten artykuł tłumaczy mechanikę doboru źródeł i to, co marka może z nią realnie zrobić. Stan na .

Na czym opiera się wyszukiwanie źródeł w ChatGPT?

Wyszukiwanie w ChatGPT opiera się na kilku indeksach jednocześnie, a nie wyłącznie na Bingu. OpenAI korzysta z indeksu Bing, ale utrzymuje też własny indeks budowany przez bota OAI-SearchBot, a w danych widać również poszlaki sięgania do Google — teza „ChatGPT = wyłącznie Bing” jest już nieaktualna. Dla porównania w Microsoft Copilot grounding przez Bing pozostaje warunkiem koniecznym, więc bez indeksacji w Bing strona tam nie istnieje (ChatGPT Search, OpenAI Help Center, lipiec 2026).

OpenAI używa trzech rozdzielnych botów z niezależnymi kontrolkami, co ma praktyczne znaczenie dla widoczności: GPTBot pobiera treści do treningu, OAI-SearchBot buduje indeks wyszukiwania ChatGPT, a ChatGPT-User pobiera stronę na żądanie użytkownika. Można zablokować trening i nadal zostać w wynikach wyszukiwania — ale blokada OAI-SearchBot oznacza, że strona „will not be shown in ChatGPT search answers, though can still appear as navigational links” (OpenAI, dokumentacja botów, grudzień 2025). Warto też wiedzieć, że dla bota ChatGPT-User OpenAI w rewizji dokumentacji z grudnia 2025 usunęło deklarację zgodności z robots.txt: „Because these actions are initiated by a user, robots.txt rules may not apply” (OpenAI, dokumentacja botów, lipiec 2026).

Jest jeszcze twardy warunek techniczny doboru: crawlery AI, w tym GPTBot, pobierają pliki JavaScript, ale ich nie wykonują. W ponad 500 mln fetchy GPTBot nie znaleziono ani jednego dowodu wykonania JS, a wniosek badania brzmi wprost: „None of the major AI crawlers currently render JavaScript” (Vercel i MERJ, grudzień 2024). Treść renderowana wyłącznie po stronie klienta jest dla nich niewidoczna — kluczowe fakty muszą być w HTML zwróconym przez serwer. To pierwszy próg, którego żadna optymalizacja cytowalności nie obejdzie.

Czy ChatGPT cytuje te same strony, co Google?

Nie — ChatGPT cytuje w większości strony, które nie rankują w top-10 Google. Dla zapytań long-tail tylko 8,0% linków cytowanych w tekście odpowiedzi znajdowało się w top-10 Google, a dla sekcji „references” udział spadał do 6,1%; około 80% cytowanych adresów nie rankowało w Google nigdzie (Ahrefs, sierpień 2025). Innymi słowy, pozycja organiczna jest słabym predyktorem tego, co ChatGPT wskaże jako źródło.

Ta zależność dodatkowo słabnie w czasie i widać ją nawet tam, gdzie grounding jest ściśle związany z wyszukiwarką. W AI Overviews (generowane przez AI podsumowania nad wynikami wyszukiwania Google) udział cytowań pochodzących z top-10 Google spadł z 76,1% w lipcu 2025 do 37,9% w marcu 2026 (Ahrefs, marzec 2026). Wniosek dla marki: klasyczne pozycjonowanie na czołowe miejsca w SERP przestaje wystarczać jako bilet do cytowań w silnikach generatywnych — systemach, które odpowiadają wygenerowanym tekstem zamiast listą linków.

Diagram przepływu w stylu Vistrix pokazujący, jak ChatGPT wybiera źródła: zapytanie użytkownika, rozbicie na podzapytania (fan-out), pobranie stron z indeksów i finalnie cytowane źródła, z podpisami o dopasowaniu semantycznym, świeżości treści i wzmiankach marki.

Jaką rolę gra świeżość treści?

Świeżość działa na korzyść cytowania, ale umiarkowanie — nie jest to przełącznik. ChatGPT cytuje treści istotnie młodsze niż typowy wynik organiczny: średni wiek cytowanych adresów wynosił około 958 dni wobec około 1416 dni dla baselinu SERP na tej platformie, a w skali wszystkich badanych silników treści cytowane przez AI były średnio o 25,7% świeższe (1064 vs 1432 dni) niż wyniki organiczne (Ahrefs, lipiec 2025).

Praktyczny wniosek jest ostrożny: aktualizujemy treści przede wszystkim dla poprawności merytorycznej, a przewagę świeżości traktujemy jako czynnik wspierający, nie jako trik. Naszym zdaniem widoczna data publikacji i realna, merytoryczna aktualizacja co kwartał to rozsądne minimum higieny — ale relewancja tematyczna nadal bije samą datę. Więcej o tym, jak układać treści pod te silniki, opisujemy w przewodniku po Generative Engine Optimization.

Co najbardziej decyduje o cytowaniu konkretnej strony?

Najsilniejszym pojedynczym czynnikiem jest dopasowanie semantyczne strony do wewnętrznych zapytań modelu, a nie autorytet domeny. ChatGPT rozbija pytanie użytkownika na wiele wewnętrznych zapytań (tzw. fan-out) i szuka stron, których tytuł i URL są im najbliższe. W analizie 1,4 mln promptów podobieństwo cosinusowe tytułu do zapytania wynosiło 0,602 dla stron cytowanych wobec 0,484 dla niecytowanych, a strony z czytelnym, opisowym slugiem były cytowane w 89,78% przypadków wobec 81,11% dla stron bez takiego sluga (Ahrefs, kwiecień 2026).

Do tego dochodzi selekcja na etapie pobierania i miejsce cytowanego fragmentu na stronie. ChatGPT pobiera znacznie więcej stron, niż ostatecznie cytuje — do cytowań trafia mniej więcej połowa pobranych adresów, a w skrajnym przypadku Reddita około 98% pobranych wyników znika między pobraniem a cytowaniem (Search Engine Journal, kwiecień 2026). Cytowana treść pochodzi też nieproporcjonalnie z początku strony: 44,2% cytowań wywodziło się z pierwszych 30% treści, a częściej cytowano fragmenty o definitywnych sformułowaniach, strukturze pytanie–odpowiedź i wysokim nasyceniu encjami (średnio 20,6%) (Kevin Indig, marzec 2026).

Znaczenie ma również sam format treści względem intencji zapytania — celu, z jakim użytkownik zadaje pytanie. Format dopasowany do intencji jest najsilniejszym predyktorem cytowania, a najczęściej cytowanym formatem są listy: odpowiadały za 21,9% wszystkich cytowań, przed artykułami (16,7%) i stronami produktowymi (13,7%); dla zapytań komercyjnych aż 40,86% cytowań przypadało na listy (Wix Studio AI Search Lab, marzec 2026). Poniższa tabela zbiera czynniki, na które marka ma realny wpływ.

Czynnik doboru Co pokazują dane Źródło
Dopasowanie semantyczne tytułu/URL Cosine similarity 0,602 (cytowane) vs 0,484 (niecytowane) Ahrefs, IV 2026
Czytelny, opisowy slug Cytowalność 89,78% (ze slugiem) vs 81,11% (bez) Ahrefs, IV 2026
Umiejscowienie treści na stronie 44,2% cytowań z pierwszych 30% treści Kevin Indig, III 2026
Format dopasowany do intencji Listy = 21,9% wszystkich cytowań (najwięcej) Wix Studio, III 2026
Świeżość Cytowane URL-e średnio 958 dni vs 1416 dni baseline Ahrefs, VII 2025

Czy autorytet domeny i wzmianki marki mają znaczenie?

Tak, ale inaczej, niż podpowiada klasyczne SEO — liczą się wzmianki marki i earned media bardziej niż backlinki. W analizie 75 000 marek liczba niezależnych wzmianek o marce korelowała z widocznością w AI około trzy razy silniej niż backlinki: wzmianki w sieci na poziomie 0,656–0,709 i wzmianki na YouTube jako najsilniejszy pojedynczy korelat (~0,737), wobec 0,218 dla backlinków i 0,266–0,326 dla Domain Rating (Ahrefs, grudzień 2025). To korelacja, nie dowód przyczynowości — ale kierunek jest spójny między badaniami.

Spójny jest też z tym, skąd silniki generatywne biorą źródła. Cytują przede wszystkim media pozyskane (earned media), a nie treści własne marki: około 84% cytowań AI pochodziło z earned media (82–89% w trzech kolejnych edycjach badania), podczas gdy treści płatne odpowiadały za 0,3% (Muck Rack, maj 2026). Cytowanie i wzmianka marki to jednak dwa różne zjawiska. W badaniu 3 981 cytowań aż 61,7% stanowiły ghost citations — cytowania URL-a bez wymienienia marki w treści odpowiedzi; ChatGPT cytował źródło w 87% przypadków, ale wymieniał markę tylko w 20,7% (Semrush i Kevin Indig, czerwiec 2026). Dla marki oznacza to, że sama cytowalna strona nie wystarczy — nazwa marki musi być na tyle obecna w korpusie, by model wymienił ją w tekście, który czyta człowiek.

Co realnie działa, a co jest mitem?

Realnie działa dopasowanie treści do zapytania i obecność marki w korpusie; kilka popularnych „dźwigni” nie ma potwierdzonego efektu przyczynowego. Najczęstszy mit to dane strukturalne (schema.org) jako sposób na cytowania. W kontrolowanym eksperymencie dodanie JSON-LD nie zwiększyło przyczynowo cytowań ChatGPT (+2,2%, nieistotne statystycznie), a w AI Overviews efekt był ujemny (-4,6%); strony cytowane są około trzy razy częściej wyposażone w JSON-LD, ale to współwystępowanie, nie dźwignia (Ahrefs, maj 2026). Dane strukturalne robimy jako higienę techniczną, nie jako obietnicę cytowań.

Ostrożności wymagają też same taktyki GEO. W recenzowanym eksperymencie dodawanie statystyk, cytatów i źródeł podnosiło widoczność do około 40% na metryce benchmarkowej (GEO, KDD 2024), ale niezależna replikacja tego nie potwierdziła: w C-SEO Bench (NeurIPS 2025) istotnie dodatnie było tylko 3 z 54 przypadków (~5,6%), a taktyka „Statistics” okazała się szkodliwa w 19 z 24 (Aggarwal i in., KDD 2024). Dlatego statystyki i cytaty stosujemy dla jakości i weryfikowalności treści, a nie jako gwarancję „+40%”.

Trzeci fakt do zaakceptowania: wzorce doboru źródeł są niestabilne. Udział Reddita w odpowiedziach ChatGPT spadł z około 60% do około 10% w ciągu dwóch tygodni po zmianie z września 2025, a Wikipedii z około 55% do około 20% (Semrush, listopad 2025). Oznacza to, że doboru źródeł nie da się „ustawić raz” — wymaga on pomiaru co miesiąc. Poniżej lista działań, które w świetle danych mają sens dla marki.

  1. Przepuść boty i serwuj HTML z serwera. Odblokuj OAI-SearchBot i bingbot w robots.txt oraz upewnij się, że kluczowe fakty są w HTML, bo crawlery AI nie wykonują JavaScriptu (Vercel i MERJ, grudzień 2024).
  2. Pisz tytuły i slugi pod realne zapytania. Semantyczne dopasowanie tytułu i czytelny slug to najsilniejsze korelaty cytowania (Ahrefs, kwiecień 2026).
  3. Dawaj odpowiedź na górze strony i w strukturze pytanie–odpowiedź. 44,2% cytowań pochodzi z pierwszych 30% treści (Kevin Indig, marzec 2026).
  4. Dobierz format do intencji. Dla zapytań, gdzie pasuje lista, listy są najczęściej cytowanym formatem — 21,9% cytowań (Wix Studio, marzec 2026).
  5. Buduj wzmianki marki w earned media i na YouTube. Wzmianki korelują z widocznością w AI ~3x silniej niż backlinki (Ahrefs, grudzień 2025).
  6. Mierz cytowania i wzmianki co miesiąc, per silnik. Wzorce są niestabilne — Reddit spadł z ~60% do ~10% w dwa tygodnie (Semrush, listopad 2025).

Jeśli chcesz punkt wyjścia — realny obraz tego, gdzie i jak Twoja marka pojawia się dziś w odpowiedziach ChatGPT, Perplexity i Copilota — to właśnie mierzy audyt widoczności w AI Vistrix Labs. A o tym, dlaczego to nie jest po prostu odświeżone SEO, piszemy w tekście GEO vs SEO: co się realnie zmienia.

ChatGPT nie nagradza najwyższej pozycji w Google — nagradza najlepsze semantyczne dopasowanie odpowiedzi do pytania, podane wcześnie na stronie i poparte obecnością marki w korpusie. Cytowalna strona i rozpoznawalna nazwa to dwa różne zwycięstwa, które trzeba wypracować osobno.

FAQ

Czy ChatGPT korzysta wyłącznie z indeksu Bing?

Nie. Wyszukiwanie w ChatGPT korzysta z indeksu Bing, ale też z własnego indeksu OpenAI budowanego przez bota OAI-SearchBot, a w danych widać poszlaki sięgania do Google (ChatGPT Search, OpenAI Help Center, lipiec 2026). Warunek „wyłącznie Bing” dotyczy dziś Microsoft Copilot, gdzie grounding przez Bing pozostaje konieczny. Blokada OAI-SearchBot w robots.txt usuwa stronę z odpowiedzi wyszukiwania ChatGPT (OpenAI, dokumentacja botów, grudzień 2025).

Co najbardziej zwiększa szansę, że ChatGPT zacytuje moją stronę?

Najsilniejszy pojedynczy czynnik to dopasowanie semantyczne tytułu i URL-a do zapytania: podobieństwo cosinusowe 0,602 dla stron cytowanych wobec 0,484 dla niecytowanych (Ahrefs, kwiecień 2026). Pomaga też podanie odpowiedzi na górze strony — 44,2% cytowań pochodzi z pierwszych 30% treści (Kevin Indig, marzec 2026) — oraz format dopasowany do intencji, przy czym listy to najczęściej cytowany format (21,9%) (Wix Studio, marzec 2026).

Czy dodanie danych strukturalnych zwiększa cytowania w ChatGPT?

Nie ma na to dowodu przyczynowego. W kontrolowanym eksperymencie dodanie JSON-LD zmieniło cytowania ChatGPT o +2,2% (nieistotne statystycznie), a w AI Overviews o -4,6%; strony cytowane są około trzy razy częściej wyposażone w JSON-LD, ale to współwystępowanie, nie dźwignia (Ahrefs, maj 2026). Dane strukturalne warto wdrażać jako higienę techniczną, ale nie jako sposób na wymuszenie cytowań.

Czytaj dalej

Wszystkie wpisy →
Abstrakcyjna ilustracja research promptów: jedno długie zapytanie rozgałęzia się na wiele równoległych podzapytań, które sięgają do źródeł i zbiegają się w jedną odpowiedź z cytowaniami.

Prompty jak zapytania: jak badać intencje klientów w erze AI

Flat wektorowa ilustracja marki Vistrix: pojedyncza odpowiedź AI zasilana licznymi liniami od niezależnych źródeł earned media, obrazująca, że około 84% cytowań w AI pochodzi z mediów trzecich.

Earned media a cytowania AI: co pokazują dane

Płaska wektorowa ilustracja ghost citations w barwach Vistrix: strona internetowa połączona jasnym linkiem z odpowiedzią AI, w której odznaka marki jest wyblakła i niemal niewidoczna, obrazując cytowanie bez wymienienia marki.

Ghost citations: dlaczego 6 na 10 cytowań AI nie wymienia marki

Sprawdź, czy AI zna Twoją markę

Umów darmową konsultację