Roboty AI
Roboty AI to zautomatyzowane programy indeksujące, które producenci modeli językowych (OpenAI, Google, Anthropic, Perplexity) wysyłają po treści stron internetowych, by budować lub aktualizować korpusy danych służące do trenowania modeli i zasilania potoków RAG odpowiedzialnych za generowanie odpowiedzi.
Po angielsku: AI Crawler.
Najważniejsze
- Roboty AI indeksują strony osobno od robotów wyszukiwarek. Każdy silnik generatywny buduje własny zbiór źródeł: wg Ahrefs (badanie 75 000 marek) top-50 domen pokrywa się tylko w 7 na 50 między silnikami, a około 86% źródeł jest unikalnych dla danego silnika.
- Właściciel strony może zablokować dostęp robotom AI przez robots.txt, jednak wg pomiaru własnego RankinGEO (N=244 polskich MŚP) tylko 2,9% firm stosuje taką blokadę.
- Strona nieindeksowana przez robota AI danego silnika nie może pojawić się w jego odpowiedziach. Dostępność dla robotów jest warunkiem wstępnym widoczności generatywnej.
Jak to działa
Roboty AI pobierają surowy HTML lub tekst strony, który trafia do potoku RAG: treść jest dzielona na fragmenty na granicach akapitów i nagłówków, każdy fragment jest zamieniany na osobny wektor, a następnie pobierany przez podobieństwo semantyczne w momencie generowania odpowiedzi. Strona zablokowana w robots.txt lub niedostępna technicznie wypada z tego procesu całkowicie. Przykładowo GPTBot (OpenAI) i ClaudeBot (Anthropic) to osobne programy z osobnymi harmonogramami wizyt, więc ta sama strona może być świeża w jednym silniku i nieaktualna w drugim.
Powiązane pojęcia
- Plik robots.txt i roboty AI Plik robots.txt dla robotów AI to konfiguracja pliku robots.txt, w której właściciel witryny określa, które roboty generatywnych silników wyszukiwania mają prawo indeksować treść strony.
- Plik llms.txt Plik llms.txt to plik tekstowy umieszczany w katalogu głównym domeny, który dostarcza modelom językowym skondensowany, ustrukturyzowany opis zawartości witryny, kluczowych encji i preferowanych źródeł.
- RAG (generowanie wspomagane pobieraniem) Generowanie wspomagane pobieraniem (RAG) to architektura, w której model językowy przed wygenerowaniem odpowiedzi pobiera z zewnętrznego indeksu fragmenty dokumentów semantycznie zbliżone do zapytania, a następnie włącza je do kontekstu generowania, co pozwala odpowiedzi opierać się na aktualnych, konkretnych źródłach.
Przeczytaj więcej
- Co to jest robots.txt i co widzą w nim roboty AI? Robots.txt decyduje, czy roboty AI mogą czytać stronę firmy. Wyjaśniamy, czym różnią się GPTBot i OAI-SearchBot oraz jak sprawdzić nieświadome blokady.
- Czy blokować GPTBot? Spokojna analiza za i przeciw Blokada GPTBot chroni treści przed treningiem, ale może wycinać firmę z odpowiedzi AI. Analizujemy, dla kogo blokada ma sens, a dla kogo jest stratą.
- Dlaczego ChatGPT nie poleca mojej firmy? Trzy progi, na których firma wypada z odpowiedzi AI: dostęp robotów, treść do zacytowania, obecność w źródłach. Mechanizm, typowe polskie awarie i nasz własny wynik 0 na 12.