Zależność od indeksu wyszukiwarki

Generatywne silniki AI pobierają treści do odpowiedzi z indeksów wyszukiwarek lub własnych baz dokumentów. Strona musi być zaindeksowana i dostępna dla robotów AI, zanim model będzie mógł ją zacytować.

Po angielsku: Search Index Dependence.

Najważniejsze

  • Generatywny silnik AI cytuje wyłącznie treści, które wcześniej trafiły do jego indeksu lub bazy dokumentów. Blokowanie robotów AI wyklucza stronę z odpowiedzi modelu.
  • Według pomiaru własnego RankinGEO tylko 2,9% polskich MŚP (N=244) blokuje roboty AI w robots.txt, a większość stron pozostaje dostępna dla indeksowania przez silniki generatywne.
  • Każdy generatywny silnik czerpie z innego zbioru źródeł: według Ahrefs (badanie 75 000 marek) top-50 domen pokrywa się tylko w 7 na 50 między silnikami, czyli około 86% źródeł jest unikalnych dla danego silnika.

Jak to działa

Potoki RAG dzielą zaindeksowane strony na fragmenty, zamieniają je na wektory i pobierają semantycznie pasujące do zapytania. Strona nieobecna w indeksie nie istnieje dla modelu na etapie retrieval. Każdy silnik utrzymuje własny indeks, więc obecność w indeksie Google nie gwarantuje obecności w indeksie Perplexity ani ChatGPT Search. Przykładowo firma, która zezwala na crawlowanie przez GPTBot, a blokuje PerplexityBot, może pojawiać się w odpowiedziach ChatGPT i pozostawać niewidoczna w Perplexity.

Powiązane pojęcia

Przeczytaj więcej

Czy AI poleca Państwa firmę?

Bezpłatny Zwiad pokaże to czarno na białym: co odpowiada Państwa serwer robotom AI i kogo silnik wymienia na jedno pytanie z Państwa kategorii. Pierwszy krok kosztuje 0 zł.