← Wróć do bloga
Badania 20 July 2026 · 9 min czytania 20 jul 2026 · 9 min

Badanie GEO z Princeton kontra replikacja: co naprawdę wiemy

Michał Rochwerger
Michał Rochwerger
Co-Founder
Abstrakcyjna ilustracja papera GEO z Princeton i jego replikacji: żółta strzałka wzrostu nad stosem publikacji naukowych oraz rozpadająca się koralowa strzałka badana lupą
Odpowiedź w skrócie
Paper GEO (Aggarwal i in., KDD 2024) wykazał na benchmarku 10 000 zapytań wzrost widoczności treści do 40% — ale na autorskiej metryce udziału słów i symulowanym silniku. Niezależna replikacja C-SEO Bench (NeurIPS 2025) potwierdziła istotny pozytywny efekt tylko w 3 z 54 kombinacji i w żadnej dla metod z oryginalnego badania. Zgodny pozostał jeden wniosek: keyword stuffing szkodzi.

„GEO może zwiększyć widoczność w odpowiedziach silników generatywnych nawet o 40%” — ta deklaracja z abstraktu jednej pracy naukowej stała się najczęściej powtarzanym argumentem sprzedażowym w branży optymalizacji pod AI. Problem w tym, że niezależna replikacja tego wyniku nie potwierdziła. Poniżej uczciwe omówienie obu badań: co dokładnie zmierzono, jakimi metrykami, gdzie wyniki się rozjeżdżają i co z tej rozbieżności wynika w praktyce — stan na lipiec 2026.

Co dokładnie zbadał paper GEO z Princeton (Aggarwal i in., KDD 2024)?

Praca „GEO: Generative Engine Optimization” (Aggarwal, Murahari i in.) to pierwsze recenzowane badanie sprawdzające, czy zmiany w treści strony zwiększają jej udział w odpowiedziach generowanych przez AI — i to z jej abstraktu pochodzi deklaracja „GEO can boost visibility by up to 40% in generative engine responses”. Preprint ukazał się na arXiv 16 listopada 2023 r., wersja v3 z 28 czerwca 2024 r. została przyjęta na konferencję KDD 2024 (Aggarwal i in., 2024). Branżowa nazwa „paper z Princeton” bierze się z afiliacji pierwszych autorów — w zespole badawczym były też inne ośrodki.

To właśnie ta praca spopularyzowała pojęcie GEO (Generative Engine Optimization) — metody tworzenia i optymalizacji treści tak, aby były cytowane i wykorzystywane w odpowiedziach generowanych przez AI. Pełne wprowadzenie do tematu znajdziesz w naszym przewodniku po GEO (Generative Engine Optimization); tutaj skupiamy się wyłącznie na warstwie dowodowej.

Autorzy zbudowali do badania benchmark GEO-bench: 10 000 zapytań w podziale 8K/1K/1K (train/val/test), zebranych z 9 zbiorów źródłowych — m.in. MS MARCO, Natural Questions, ELI5 i Perplexity.ai Discover — i obejmujących 25 domen tematycznych; ok. 80% zapytań ma intencję informacyjną, po ok. 10% transakcyjną i nawigacyjną (Aggarwal i in., 2024).

Dwa zastrzeżenia metodologiczne są kluczowe dla interpretacji wyników:

  • Silnik był symulowany, nie produkcyjny. Dla każdego zapytania pobierano top-5 wyników Google, a odpowiedzi generował model gpt-3.5-turbo (5 odpowiedzi na zapytanie, temperature=0.7). Główne eksperymenty nie działy się więc w AI Overviews ani w ChatGPT z wyszukiwaniem, tylko w silniku generatywnym — systemie odpowiadającym użytkownikowi wygenerowaną odpowiedzią zamiast listą linków — zbudowanym na potrzeby badania (Aggarwal i in., 2024).
  • „Widoczność” to metryki własne papieru. Position-Adjusted Word Count (PAWC) mierzy udział słów odpowiedzi przypisanych do danego źródła, ważony pozycją cytatu; Subjective Impression to ocena subiektywna wykonywana przez model językowy (LLM). Żadna z tych metryk nie jest tożsama z częstością cytowania strony w produkcyjnych silnikach generatywnych (Aggarwal i in., 2024).

Które taktyki GEO wypadły najlepiej i o ile?

Najlepiej wypadły trzy taktyki „dowodowe”: dodawanie cytatów (Quotation Addition, 27,8 pkt PAWC), dodawanie statystyk (Statistics Addition, 25,9) i dodawanie przypisów źródłowych (Cite Sources, 24,9) — wobec 19,5 pkt dla treści bazowej (Aggarwal i in., 2024, Tabela 1). Pełne wyniki na zbiorze testowym GEO-bench:

Taktyka PAWC Subjective Impression Zmiana PAWC vs baseline
Baseline (treść bez zmian) 19,5 19,3
Quotation Addition (cytaty) 27,8 24,7 ok. +43%
Statistics Addition (statystyki) 25,9 23,7 ok. +33%
Fluency Optimization (płynność) 25,1 21,9 ok. +29%
Cite Sources (przypisy źródłowe) 24,9 21,9 ok. +28%
Technical Terms (terminologia) 23,1 21,4 ok. +18%
Easy-to-Understand (prostota) 22,2 20,5 ok. +14%
Authoritative (ton autorytatywny) 21,8 22,9 ok. +12%
Unique Words (unikalne słowa) 20,7 20,4 ok. +6%
Keyword stuffing (upychanie fraz) 17,8 ok. −9%

Źródło: Aggarwal i in., 2024, Tabela 1 (zbiór testowy); zmiany procentowe wyliczone z wartości PAWC.

Dwa wyniki poboczne są co najmniej równie ważne jak sam ranking taktyk:

Keyword stuffing pogarsza widoczność w silniku generatywnym. Upychanie fraz kluczowych dało 17,8 pkt PAWC wobec 19,5 dla baseline’u (ok. −9%) na GEO-bench oraz 21,9 wobec 24,1 (również ok. −9%) w teście na produkcyjnym Perplexity.ai (Aggarwal i in., 2024, Tabele 1 i 5). Nawyk „optymalizacji przez powtarzanie frazy” w odpowiedziach AI działa przeciwko stronie.

GEO najbardziej pomaga stronom nisko rankującym — kosztem lidera. Metoda Cite Sources dała +115,1% widoczności stronom z 5. pozycji źródłowej, przy jednoczesnym −30,3% dla stron z pozycji 1. Wewnątrz jednej odpowiedzi to gra o sumie zerowej: zysk niżej rankujących odbywa się kosztem najlepiej rankującego źródła (Aggarwal i in., 2024, Tabela 2).

Autorzy sprawdzili też wybrane taktyki na produkcyjnym Perplexity.ai: Quotation Addition uzyskało 29,1 wobec 24,1 pkt PAWC dla baseline’u (ok. +21%), a Statistics Addition 33,9 wobec 24,7 pkt Subjective Impression (ok. +37%). To jednak wciąż eksperyment samych autorów na wersji silnika z przełomu 2023/24 — nie niezależna replikacja (Aggarwal i in., 2024, Tabela 5).

Diagram porównujący paper GEO z Princeton (silnik symulowany, metryka udziału słów, +40% widoczności) z replikacją C-SEO Bench (4 modele produkcyjne, metryka pozycji cytowania, 3 z 54 efektów pozytywnych) — inna metryka daje inny wynik

Czego nie potwierdziła replikacja C-SEO Bench (NeurIPS 2025)?

C-SEO Bench — niezależny benchmark przyjęty na NeurIPS 2025 Datasets & Benchmarks — nie potwierdził skuteczności żadnej z ośmiu metod papieru GEO: na 54 badane przypadki (metoda × domena × model) tylko 3 dały istotny statystycznie pozytywny efekt i wszystkie trzy dotyczyły metod nowych, spoza oryginalnej pracy (Puerto i in., 2025).

Skala badania była duża: ponad 1,9 tys. zapytań i ok. 16,3 tys. dokumentów w 6 domenach (Retail, Video Games, Books, Web, News, Debate), na 4 modelach (gpt-4o-mini, claude-3-5-haiku, o3, o4-mini), z 10 testowanymi metodami — 8 z papieru GEO plus 2 nowe: LLM Guidance i Content Improvement (Puerto i in., 2025).

Kluczowe ustalenia replikacji:

  • 3 z 54 przypadków z istotnym pozytywnym efektem — i to niewielkim. LLM Guidance poprawiło pozycję cytowania o 0,36 pozycji w domenie Retail i o 0,24 w Video Games, a Content Improvement o 0,18 w Retail. Wszystkie zyski wyniosły mniej niż pół pozycji w rankingu cytowań; metody z papieru GEO nie zanotowały ani jednego istotnie pozytywnego wyniku (Puerto i in., 2025).
  • Statistics Addition — jedna z gwiazd papieru GEO — częściej szkodziła, niż pomagała. Metoda pogarszała ranking cytowań w 19 z 24 badanych ustawień. Osobny wynik dotyczy modelu: na Claude 3.5 Haiku w zadaniach rekomendacji produktów aż 26 z 30 przypadków (wszystkie 10 metod × 3 domeny) miało istotnie negatywny efekt (Puerto i in., 2025).
  • Silniejsza od wszystkich taktyk okazała się pozycja dokumentu. Autorzy piszą, że klasyczne SEO poprawiające pozycję dokumentu w kontekście modelu jest „significantly more effective”, a umieszczenie dokumentu jako pierwszego daje „far greater citation ranking gains than any C-SEO method” (Puerto i in., 2025).

Wniosek autorów replikacji brzmi jednoznacznie: „most current C-SEO methods are not only largely ineffective but also frequently have a negative impact on document ranking” — większość obecnych metod optymalizacji pod odpowiedzi AI jest w dużej mierze nieskuteczna, a często wręcz pogarsza ranking dokumentu (Puerto i in., 2025).

Skąd rozbieżność? Częściowo z metryk. Paper GEO mierzył udział słów w odpowiedzi (PAWC), a C-SEO Bench — poprawę pozycji cytowania: skuteczna metoda ma sprawić, że model zacytuje zmodyfikowany dokument wcześniej, niż cytował oryginalny (Puerto i in., 2025). To dwa różne pytania badawcze — „ile mojej treści trafia do odpowiedzi” kontra „czy jestem cytowany wyżej” — i ta różnica częściowo tłumaczy rozjazd wyników. Nie unieważnia żadnego z badań; unieważnia traktowanie „+40%” jako uniwersalnej obietnicy.

Praktyczny problem: skoro efekty taktyk GEO zależą od domeny, modelu i metryki, to bez pomiaru nie wiesz, czy w Twojej branży którakolwiek z nich działa. Dlatego rozsądniej zacząć od danych, nie od taktyk — audyt widoczności w AI pokazuje, gdzie i jak Twoja marka pojawia się w odpowiedziach silników generatywnych, zanim wydasz cokolwiek na optymalizację.

Co z tych badań wynika praktycznie?

Praktyczny wniosek z zestawienia obu prac: teza „dodawaj statystyki, cytaty i źródła, a widoczność w AI wzrośnie o 30–40%” nie jest zreplikowanym faktem — liczba pochodzi z jednego badania, na specyficznej metryce i symulowanym silniku, a niezależna replikacja na metryce rankingu cytowań tych efektów nie potwierdziła (Aggarwal i in., 2024 vs Puerto i in., 2025).

Gdy oferta obiecuje „+40% widoczności w AI”, cytuje jedno niezreplikowane badanie przeprowadzone na symulowanym silniku i metryce udziału słów. Uczciwa wersja brzmi: efekty taktyk GEO są silnie zależne od domeny, modelu i metryki — trzeba je zmierzyć na własnym zestawie zapytań, a nie zakładać z cudzego benchmarku.

Co między oboma badaniami pozostaje zgodne i nadaje się do działania:

  1. Keyword stuffing nie działa w silnikach generatywnych. W papierze GEO upychanie fraz obniżało widoczność o ok. 9% zarówno w benchmarku, jak i na Perplexity.ai (Aggarwal i in., 2024), a C-SEO Bench potwierdza, że mechaniczne triki treściowe częściej szkodzą, niż pomagają (Puerto i in., 2025).
  2. Efekty są zależne od domeny i modelu. Te same metody dawały różne wyniki w różnych domenach i na różnych modelach w obu badaniach — wyników z cudzej branży nie wolno przenosić na swoją bez pomiaru.
  3. Pozycja źródła wciąż rządzi. Skoro dokument podany modelowi jako pierwszy zyskuje więcej niż jakakolwiek taktyka treściowa (Puerto i in., 2025), klasyczne SEO pozostaje fundamentem widoczności w AI. Jak te dwie warstwy się łączą, opisujemy w tekście GEO vs SEO: co się zmienia.
  4. To gra o sumie zerowej. Zyski niżej rankujących stron odbywają się kosztem lidera (+115,1% dla pozycji 5. przy −30,3% dla pozycji 1. w papierze GEO), a autorzy C-SEO Bench wskazują, że przy rosnącej adopcji zyski maleją ze względu na „congested and zero-sum nature” tych metod (Aggarwal i in., 2024; Puerto i in., 2025).

Badania nad GEO idą dalej i coraz częściej podważają uniwersalne taktyki. Preprint GEO-16 (obserwacyjny, nierecenzowany) przeanalizował 1702 cytowania z 3 silników generatywnych dla 1100 URL-i i wskazał, że z cytowalnością najsilniej korelują metadane i świeżość, semantyczny HTML oraz dane strukturalne — to jednak korelacje na anglojęzycznych stronach B2B SaaS, nie dowód przyczynowy (GEO-16, 2025). Z kolei E-GEO na testbedzie ponad 7000 zapytań e-commerce pokazało, że iteracyjna optymalizacja treści promptem przewyższa stałe heurystyki z papieru GEO, i skrytykowało jego metrykę „impression” jako nieprzekładającą się wprost na wartość komercyjną (E-GEO, 2025). Kierunek jest czytelny: od uniwersalnych recept ku pomiarowi i optymalizacji per przypadek.

FAQ: badanie GEO i jego replikacja

Czy badanie GEO potwierdza wzrost widoczności w AI o 40%?

Nie jako zreplikowany fakt. „Do 40%” to deklaracja abstraktu papieru GEO (KDD 2024), uzyskana na symulowanym silniku i metryce udziału słów (Aggarwal i in., 2024). Niezależny C-SEO Bench (NeurIPS 2025) na metryce pozycji cytowania nie potwierdził pozytywnego efektu żadnej z metod tej pracy (Puerto i in., 2025).

Czym różnią się metryki papieru GEO i C-SEO Bench?

Paper GEO mierzy Position-Adjusted Word Count — udział słów odpowiedzi przypisanych do źródła, ważony pozycją cytatu — oraz ocenę subiektywną przez LLM (Aggarwal i in., 2024). C-SEO Bench mierzy poprawę pozycji cytowania dokumentu w odpowiedzi (Puerto i in., 2025). Ta różnica metryk częściowo tłumaczy rozbieżność wyników obu prac.

Czy dodawanie statystyk do treści ma jeszcze sens?

Jako obietnica wzrostu widoczności — nie: w C-SEO Bench metoda Statistics Addition pogarszała ranking cytowań w 19 z 24 ustawień (Puerto i in., 2025). Jako element jakości i wiarygodności treści — tak, ale traktuj to jako higienę redakcyjną z mieszanymi dowodami na wzrost widoczności, nie jako gwarantowaną dźwignię.

Czy keyword stuffing działa w silnikach generatywnych?

Nie — i to jeden z niewielu wyników zgodnych między badaniami. W papierze GEO upychanie fraz obniżało widoczność o ok. 9% zarówno na benchmarku GEO-bench (17,8 vs 19,5 pkt PAWC), jak i na produkcyjnym Perplexity.ai (21,9 vs 24,1) (Aggarwal i in., 2024).

Czytaj dalej

Wszystkie wpisy →
Ilustracja koncepcyjna: panel odpowiedzi AI z podświetlonymi cytowaniami źródeł, do których prowadzą trzy warstwy badań o widoczności w odpowiedziach AI.

Co mówią badania o widoczności w odpowiedziach AI (przegląd)

Sprawdź, czy AI zna Twoją markę

Umów darmową konsultację