Plik robots.txt i roboty AI

Plik robots.txt dla robotów AI to konfiguracja pliku robots.txt, w której właściciel witryny określa, które roboty generatywnych silników wyszukiwania mają prawo indeksować treść strony. Ustawienie to decyduje, czy dana domena trafia do zbioru źródeł używanych przez modele językowe.

Najważniejsze

  • Tylko 2,9% polskich MŚP blokuje roboty AI w pliku robots.txt; zdecydowana większość witryn pozostaje dostępna dla robotów generatywnych silników (pomiar własny RankinGEO, N=244).
  • Blokada robota AI w robots.txt wyklucza domenę z puli źródeł, z których silnik może cytować treść. Dotyczy to każdej domeny, bez względu na jakość jej treści.
  • Każdy generatywny silnik wyszukiwania używa własnego robota z odrębnym user-agent, dlatego reguły robots.txt wymagają osobnych wpisów dla każdego robota, którego właściciel chce kontrolować.

Jak to działa

Potoki RAG pobierają treść przez własne roboty, zanim trafi ona do indeksu wektorowego. Jeśli reguła Disallow w robots.txt obejmuje danego user-agenta, robot pomija stronę i nie tworzy jej embeddingu. Domena staje się wtedy niewidoczna dla modelu przy generowaniu odpowiedzi. Przykład: zablokowanie GPTBot wyklucza domenę z zasobów dostępnych ChatGPT Search. Roboty Perplexity i Google-Extended działają na osobnych user-agentach i wymagają odrębnych wpisów. Decyzja o blokowaniu lub zezwoleniu powinna być świadoma, bo jej skutki obowiązują do momentu zmiany konfiguracji.

Powiązane pojęcia

Przeczytaj więcej

Czy AI poleca Państwa firmę?

Bezpłatny Zwiad pokaże to czarno na białym: co odpowiada Państwa serwer robotom AI i kogo silnik wymienia na jedno pytanie z Państwa kategorii. Pierwszy krok kosztuje 0 zł.