Plik robots.txt i roboty AI
Plik robots.txt dla robotów AI to konfiguracja pliku robots.txt, w której właściciel witryny określa, które roboty generatywnych silników wyszukiwania mają prawo indeksować treść strony. Ustawienie to decyduje, czy dana domena trafia do zbioru źródeł używanych przez modele językowe.
Najważniejsze
- Tylko 2,9% polskich MŚP blokuje roboty AI w pliku robots.txt; zdecydowana większość witryn pozostaje dostępna dla robotów generatywnych silników (pomiar własny RankinGEO, N=244).
- Blokada robota AI w robots.txt wyklucza domenę z puli źródeł, z których silnik może cytować treść. Dotyczy to każdej domeny, bez względu na jakość jej treści.
- Każdy generatywny silnik wyszukiwania używa własnego robota z odrębnym user-agent, dlatego reguły robots.txt wymagają osobnych wpisów dla każdego robota, którego właściciel chce kontrolować.
Jak to działa
Potoki RAG pobierają treść przez własne roboty, zanim trafi ona do indeksu wektorowego. Jeśli reguła Disallow w robots.txt obejmuje danego user-agenta, robot pomija stronę i nie tworzy jej embeddingu. Domena staje się wtedy niewidoczna dla modelu przy generowaniu odpowiedzi. Przykład: zablokowanie GPTBot wyklucza domenę z zasobów dostępnych ChatGPT Search. Roboty Perplexity i Google-Extended działają na osobnych user-agentach i wymagają odrębnych wpisów. Decyzja o blokowaniu lub zezwoleniu powinna być świadoma, bo jej skutki obowiązują do momentu zmiany konfiguracji.
Powiązane pojęcia
- Plik llms.txt Plik llms.txt to plik tekstowy umieszczany w katalogu głównym domeny, który dostarcza modelom językowym skondensowany, ustrukturyzowany opis zawartości witryny, kluczowych encji i preferowanych źródeł.
- Roboty AI Roboty AI to zautomatyzowane programy indeksujące, które producenci modeli językowych (OpenAI, Google, Anthropic, Perplexity) wysyłają po treści stron internetowych, by budować lub aktualizować korpusy danych służące do trenowania modeli i zasilania potoków RAG odpowiedzialnych za generowanie odpowiedzi.
- Pobieranie źródeł (retrieval) Pobieranie źródeł to etap w potoku RAG, w którym silnik generatywny wyszukuje fragmenty tekstu semantycznie zbliżone do zapytania użytkownika, a następnie przekazuje je modelowi językowemu jako kontekst do sformułowania odpowiedzi.
Przeczytaj więcej
- Co to jest robots.txt i co widzą w nim roboty AI? Robots.txt decyduje, czy roboty AI mogą czytać stronę firmy. Wyjaśniamy, czym różnią się GPTBot i OAI-SearchBot oraz jak sprawdzić nieświadome blokady.
- Czy blokować GPTBot? Spokojna analiza za i przeciw Blokada GPTBot chroni treści przed treningiem, ale może wycinać firmę z odpowiedzi AI. Analizujemy, dla kogo blokada ma sens, a dla kogo jest stratą.