Zależność od indeksu wyszukiwarki
Generatywne silniki AI pobierają treści do odpowiedzi z indeksów wyszukiwarek lub własnych baz dokumentów. Strona musi być zaindeksowana i dostępna dla robotów AI, zanim model będzie mógł ją zacytować.
Po angielsku: Search Index Dependence.
Najważniejsze
- Generatywny silnik AI cytuje wyłącznie treści, które wcześniej trafiły do jego indeksu lub bazy dokumentów. Blokowanie robotów AI wyklucza stronę z odpowiedzi modelu.
- Według pomiaru własnego RankinGEO tylko 2,9% polskich MŚP (N=244) blokuje roboty AI w robots.txt, a większość stron pozostaje dostępna dla indeksowania przez silniki generatywne.
- Każdy generatywny silnik czerpie z innego zbioru źródeł: według Ahrefs (badanie 75 000 marek) top-50 domen pokrywa się tylko w 7 na 50 między silnikami, czyli około 86% źródeł jest unikalnych dla danego silnika.
Jak to działa
Potoki RAG dzielą zaindeksowane strony na fragmenty, zamieniają je na wektory i pobierają semantycznie pasujące do zapytania. Strona nieobecna w indeksie nie istnieje dla modelu na etapie retrieval. Każdy silnik utrzymuje własny indeks, więc obecność w indeksie Google nie gwarantuje obecności w indeksie Perplexity ani ChatGPT Search. Przykładowo firma, która zezwala na crawlowanie przez GPTBot, a blokuje PerplexityBot, może pojawiać się w odpowiedziach ChatGPT i pozostawać niewidoczna w Perplexity.
Powiązane pojęcia
- Roboty AI Roboty AI to zautomatyzowane programy indeksujące, które producenci modeli językowych (OpenAI, Google, Anthropic, Perplexity) wysyłają po treści stron internetowych, by budować lub aktualizować korpusy danych służące do trenowania modeli i zasilania potoków RAG odpowiedzialnych za generowanie odpowiedzi.
- Pobieranie źródeł (retrieval) Pobieranie źródeł to etap w potoku RAG, w którym silnik generatywny wyszukuje fragmenty tekstu semantycznie zbliżone do zapytania użytkownika, a następnie przekazuje je modelowi językowemu jako kontekst do sformułowania odpowiedzi.
- Plik robots.txt i roboty AI Plik robots.txt dla robotów AI to konfiguracja pliku robots.txt, w której właściciel witryny określa, które roboty generatywnych silników wyszukiwania mają prawo indeksować treść strony.