„GEO może zwiększyć widoczność w odpowiedziach silników generatywnych nawet o 40%” — ta deklaracja z abstraktu jednej pracy naukowej stała się najczęściej powtarzanym argumentem sprzedażowym w branży optymalizacji pod AI. Problem w tym, że niezależna replikacja tego wyniku nie potwierdziła. Poniżej uczciwe omówienie obu badań: co dokładnie zmierzono, jakimi metrykami, gdzie wyniki się rozjeżdżają i co z tej rozbieżności wynika w praktyce — stan na lipiec 2026.
Co dokładnie zbadał paper GEO z Princeton (Aggarwal i in., KDD 2024)?
Praca „GEO: Generative Engine Optimization” (Aggarwal, Murahari i in.) to pierwsze recenzowane badanie sprawdzające, czy zmiany w treści strony zwiększają jej udział w odpowiedziach generowanych przez AI — i to z jej abstraktu pochodzi deklaracja „GEO can boost visibility by up to 40% in generative engine responses”. Preprint ukazał się na arXiv 16 listopada 2023 r., wersja v3 z 28 czerwca 2024 r. została przyjęta na konferencję KDD 2024 (Aggarwal i in., 2024). Branżowa nazwa „paper z Princeton” bierze się z afiliacji pierwszych autorów — w zespole badawczym były też inne ośrodki.
To właśnie ta praca spopularyzowała pojęcie GEO (Generative Engine Optimization) — metody tworzenia i optymalizacji treści tak, aby były cytowane i wykorzystywane w odpowiedziach generowanych przez AI. Pełne wprowadzenie do tematu znajdziesz w naszym przewodniku po GEO (Generative Engine Optimization); tutaj skupiamy się wyłącznie na warstwie dowodowej.
Autorzy zbudowali do badania benchmark GEO-bench: 10 000 zapytań w podziale 8K/1K/1K (train/val/test), zebranych z 9 zbiorów źródłowych — m.in. MS MARCO, Natural Questions, ELI5 i Perplexity.ai Discover — i obejmujących 25 domen tematycznych; ok. 80% zapytań ma intencję informacyjną, po ok. 10% transakcyjną i nawigacyjną (Aggarwal i in., 2024).
Dwa zastrzeżenia metodologiczne są kluczowe dla interpretacji wyników:
- Silnik był symulowany, nie produkcyjny. Dla każdego zapytania pobierano top-5 wyników Google, a odpowiedzi generował model gpt-3.5-turbo (5 odpowiedzi na zapytanie, temperature=0.7). Główne eksperymenty nie działy się więc w AI Overviews ani w ChatGPT z wyszukiwaniem, tylko w silniku generatywnym — systemie odpowiadającym użytkownikowi wygenerowaną odpowiedzią zamiast listą linków — zbudowanym na potrzeby badania (Aggarwal i in., 2024).
- „Widoczność” to metryki własne papieru. Position-Adjusted Word Count (PAWC) mierzy udział słów odpowiedzi przypisanych do danego źródła, ważony pozycją cytatu; Subjective Impression to ocena subiektywna wykonywana przez model językowy (LLM). Żadna z tych metryk nie jest tożsama z częstością cytowania strony w produkcyjnych silnikach generatywnych (Aggarwal i in., 2024).
Które taktyki GEO wypadły najlepiej i o ile?
Najlepiej wypadły trzy taktyki „dowodowe”: dodawanie cytatów (Quotation Addition, 27,8 pkt PAWC), dodawanie statystyk (Statistics Addition, 25,9) i dodawanie przypisów źródłowych (Cite Sources, 24,9) — wobec 19,5 pkt dla treści bazowej (Aggarwal i in., 2024, Tabela 1). Pełne wyniki na zbiorze testowym GEO-bench:
| Taktyka | PAWC | Subjective Impression | Zmiana PAWC vs baseline |
|---|---|---|---|
| Baseline (treść bez zmian) | 19,5 | 19,3 | — |
| Quotation Addition (cytaty) | 27,8 | 24,7 | ok. +43% |
| Statistics Addition (statystyki) | 25,9 | 23,7 | ok. +33% |
| Fluency Optimization (płynność) | 25,1 | 21,9 | ok. +29% |
| Cite Sources (przypisy źródłowe) | 24,9 | 21,9 | ok. +28% |
| Technical Terms (terminologia) | 23,1 | 21,4 | ok. +18% |
| Easy-to-Understand (prostota) | 22,2 | 20,5 | ok. +14% |
| Authoritative (ton autorytatywny) | 21,8 | 22,9 | ok. +12% |
| Unique Words (unikalne słowa) | 20,7 | 20,4 | ok. +6% |
| Keyword stuffing (upychanie fraz) | 17,8 | — | ok. −9% |
Źródło: Aggarwal i in., 2024, Tabela 1 (zbiór testowy); zmiany procentowe wyliczone z wartości PAWC.
Dwa wyniki poboczne są co najmniej równie ważne jak sam ranking taktyk:
Keyword stuffing pogarsza widoczność w silniku generatywnym. Upychanie fraz kluczowych dało 17,8 pkt PAWC wobec 19,5 dla baseline’u (ok. −9%) na GEO-bench oraz 21,9 wobec 24,1 (również ok. −9%) w teście na produkcyjnym Perplexity.ai (Aggarwal i in., 2024, Tabele 1 i 5). Nawyk „optymalizacji przez powtarzanie frazy” w odpowiedziach AI działa przeciwko stronie.
GEO najbardziej pomaga stronom nisko rankującym — kosztem lidera. Metoda Cite Sources dała +115,1% widoczności stronom z 5. pozycji źródłowej, przy jednoczesnym −30,3% dla stron z pozycji 1. Wewnątrz jednej odpowiedzi to gra o sumie zerowej: zysk niżej rankujących odbywa się kosztem najlepiej rankującego źródła (Aggarwal i in., 2024, Tabela 2).
Autorzy sprawdzili też wybrane taktyki na produkcyjnym Perplexity.ai: Quotation Addition uzyskało 29,1 wobec 24,1 pkt PAWC dla baseline’u (ok. +21%), a Statistics Addition 33,9 wobec 24,7 pkt Subjective Impression (ok. +37%). To jednak wciąż eksperyment samych autorów na wersji silnika z przełomu 2023/24 — nie niezależna replikacja (Aggarwal i in., 2024, Tabela 5).

Czego nie potwierdziła replikacja C-SEO Bench (NeurIPS 2025)?
C-SEO Bench — niezależny benchmark przyjęty na NeurIPS 2025 Datasets & Benchmarks — nie potwierdził skuteczności żadnej z ośmiu metod papieru GEO: na 54 badane przypadki (metoda × domena × model) tylko 3 dały istotny statystycznie pozytywny efekt i wszystkie trzy dotyczyły metod nowych, spoza oryginalnej pracy (Puerto i in., 2025).
Skala badania była duża: ponad 1,9 tys. zapytań i ok. 16,3 tys. dokumentów w 6 domenach (Retail, Video Games, Books, Web, News, Debate), na 4 modelach (gpt-4o-mini, claude-3-5-haiku, o3, o4-mini), z 10 testowanymi metodami — 8 z papieru GEO plus 2 nowe: LLM Guidance i Content Improvement (Puerto i in., 2025).
Kluczowe ustalenia replikacji:
- 3 z 54 przypadków z istotnym pozytywnym efektem — i to niewielkim. LLM Guidance poprawiło pozycję cytowania o 0,36 pozycji w domenie Retail i o 0,24 w Video Games, a Content Improvement o 0,18 w Retail. Wszystkie zyski wyniosły mniej niż pół pozycji w rankingu cytowań; metody z papieru GEO nie zanotowały ani jednego istotnie pozytywnego wyniku (Puerto i in., 2025).
- Statistics Addition — jedna z gwiazd papieru GEO — częściej szkodziła, niż pomagała. Metoda pogarszała ranking cytowań w 19 z 24 badanych ustawień. Osobny wynik dotyczy modelu: na Claude 3.5 Haiku w zadaniach rekomendacji produktów aż 26 z 30 przypadków (wszystkie 10 metod × 3 domeny) miało istotnie negatywny efekt (Puerto i in., 2025).
- Silniejsza od wszystkich taktyk okazała się pozycja dokumentu. Autorzy piszą, że klasyczne SEO poprawiające pozycję dokumentu w kontekście modelu jest „significantly more effective”, a umieszczenie dokumentu jako pierwszego daje „far greater citation ranking gains than any C-SEO method” (Puerto i in., 2025).
Wniosek autorów replikacji brzmi jednoznacznie: „most current C-SEO methods are not only largely ineffective but also frequently have a negative impact on document ranking” — większość obecnych metod optymalizacji pod odpowiedzi AI jest w dużej mierze nieskuteczna, a często wręcz pogarsza ranking dokumentu (Puerto i in., 2025).
Skąd rozbieżność? Częściowo z metryk. Paper GEO mierzył udział słów w odpowiedzi (PAWC), a C-SEO Bench — poprawę pozycji cytowania: skuteczna metoda ma sprawić, że model zacytuje zmodyfikowany dokument wcześniej, niż cytował oryginalny (Puerto i in., 2025). To dwa różne pytania badawcze — „ile mojej treści trafia do odpowiedzi” kontra „czy jestem cytowany wyżej” — i ta różnica częściowo tłumaczy rozjazd wyników. Nie unieważnia żadnego z badań; unieważnia traktowanie „+40%” jako uniwersalnej obietnicy.
Praktyczny problem: skoro efekty taktyk GEO zależą od domeny, modelu i metryki, to bez pomiaru nie wiesz, czy w Twojej branży którakolwiek z nich działa. Dlatego rozsądniej zacząć od danych, nie od taktyk — audyt widoczności w AI pokazuje, gdzie i jak Twoja marka pojawia się w odpowiedziach silników generatywnych, zanim wydasz cokolwiek na optymalizację.
Co z tych badań wynika praktycznie?
Praktyczny wniosek z zestawienia obu prac: teza „dodawaj statystyki, cytaty i źródła, a widoczność w AI wzrośnie o 30–40%” nie jest zreplikowanym faktem — liczba pochodzi z jednego badania, na specyficznej metryce i symulowanym silniku, a niezależna replikacja na metryce rankingu cytowań tych efektów nie potwierdziła (Aggarwal i in., 2024 vs Puerto i in., 2025).
Gdy oferta obiecuje „+40% widoczności w AI”, cytuje jedno niezreplikowane badanie przeprowadzone na symulowanym silniku i metryce udziału słów. Uczciwa wersja brzmi: efekty taktyk GEO są silnie zależne od domeny, modelu i metryki — trzeba je zmierzyć na własnym zestawie zapytań, a nie zakładać z cudzego benchmarku.
Co między oboma badaniami pozostaje zgodne i nadaje się do działania:
- Keyword stuffing nie działa w silnikach generatywnych. W papierze GEO upychanie fraz obniżało widoczność o ok. 9% zarówno w benchmarku, jak i na Perplexity.ai (Aggarwal i in., 2024), a C-SEO Bench potwierdza, że mechaniczne triki treściowe częściej szkodzą, niż pomagają (Puerto i in., 2025).
- Efekty są zależne od domeny i modelu. Te same metody dawały różne wyniki w różnych domenach i na różnych modelach w obu badaniach — wyników z cudzej branży nie wolno przenosić na swoją bez pomiaru.
- Pozycja źródła wciąż rządzi. Skoro dokument podany modelowi jako pierwszy zyskuje więcej niż jakakolwiek taktyka treściowa (Puerto i in., 2025), klasyczne SEO pozostaje fundamentem widoczności w AI. Jak te dwie warstwy się łączą, opisujemy w tekście GEO vs SEO: co się zmienia.
- To gra o sumie zerowej. Zyski niżej rankujących stron odbywają się kosztem lidera (+115,1% dla pozycji 5. przy −30,3% dla pozycji 1. w papierze GEO), a autorzy C-SEO Bench wskazują, że przy rosnącej adopcji zyski maleją ze względu na „congested and zero-sum nature” tych metod (Aggarwal i in., 2024; Puerto i in., 2025).
Badania nad GEO idą dalej i coraz częściej podważają uniwersalne taktyki. Preprint GEO-16 (obserwacyjny, nierecenzowany) przeanalizował 1702 cytowania z 3 silników generatywnych dla 1100 URL-i i wskazał, że z cytowalnością najsilniej korelują metadane i świeżość, semantyczny HTML oraz dane strukturalne — to jednak korelacje na anglojęzycznych stronach B2B SaaS, nie dowód przyczynowy (GEO-16, 2025). Z kolei E-GEO na testbedzie ponad 7000 zapytań e-commerce pokazało, że iteracyjna optymalizacja treści promptem przewyższa stałe heurystyki z papieru GEO, i skrytykowało jego metrykę „impression” jako nieprzekładającą się wprost na wartość komercyjną (E-GEO, 2025). Kierunek jest czytelny: od uniwersalnych recept ku pomiarowi i optymalizacji per przypadek.
FAQ: badanie GEO i jego replikacja
Czy badanie GEO potwierdza wzrost widoczności w AI o 40%?
Nie jako zreplikowany fakt. „Do 40%” to deklaracja abstraktu papieru GEO (KDD 2024), uzyskana na symulowanym silniku i metryce udziału słów (Aggarwal i in., 2024). Niezależny C-SEO Bench (NeurIPS 2025) na metryce pozycji cytowania nie potwierdził pozytywnego efektu żadnej z metod tej pracy (Puerto i in., 2025).
Czym różnią się metryki papieru GEO i C-SEO Bench?
Paper GEO mierzy Position-Adjusted Word Count — udział słów odpowiedzi przypisanych do źródła, ważony pozycją cytatu — oraz ocenę subiektywną przez LLM (Aggarwal i in., 2024). C-SEO Bench mierzy poprawę pozycji cytowania dokumentu w odpowiedzi (Puerto i in., 2025). Ta różnica metryk częściowo tłumaczy rozbieżność wyników obu prac.
Czy dodawanie statystyk do treści ma jeszcze sens?
Jako obietnica wzrostu widoczności — nie: w C-SEO Bench metoda Statistics Addition pogarszała ranking cytowań w 19 z 24 ustawień (Puerto i in., 2025). Jako element jakości i wiarygodności treści — tak, ale traktuj to jako higienę redakcyjną z mieszanymi dowodami na wzrost widoczności, nie jako gwarantowaną dźwignię.
Czy keyword stuffing działa w silnikach generatywnych?
Nie — i to jeden z niewielu wyników zgodnych między badaniami. W papierze GEO upychanie fraz obniżało widoczność o ok. 9% zarówno na benchmarku GEO-bench (17,8 vs 19,5 pkt PAWC), jak i na produkcyjnym Perplexity.ai (21,9 vs 24,1) (Aggarwal i in., 2024).