Co to jest robots.txt i co widzą w nim roboty AI?
Robots.txt decyduje, czy roboty AI mogą czytać stronę firmy. Wyjaśniamy, czym różnią się GPTBot i OAI-SearchBot oraz jak sprawdzić nieświadome blokady.
Plik robots.txt to najprostsza forma komunikacji między właścicielem strony a robotami sieciowymi. Można go porównać do tablicy informacyjnej przy wejściu do budynku: wisi na widoku, każdy może ją przeczytać, ale nikt nie ma obowiązku jej słuchać. Dla Państwa firmy decyduje on o tym, czy roboty AI w ogóle dowiedzą się, co znajduje się na stronie, a przez to, czy mogą ją kiedykolwiek polecić klientowi zadającemu pytanie w ChatGPT, Gemini czy Google AI Overviews.
Co to jest robots.txt i jak działa?
Robots.txt to zwykły plik tekstowy umieszczony w głównym katalogu domeny, pod adresem domena.pl/robots.txt. Zawiera on reguły wskazujące, które części strony roboty powinny omijać, a które mogą odwiedzać. Nie jest to zabezpieczenie techniczne. Plik nie blokuje dostępu do danych, lecz jedynie przekazuje prośbę. Uprzejme roboty, takie jak te prowadzone przez OpenAI, Google czy Anthropic, zwykle tę prośbę respektują. Dzięki temu, że plik jest publiczny, Państwo mogą go w każdej chwili sprawdzić, podobnie jak każdy inny robot.
Które roboty AI odwiedzają Państwa stronę?
Najważniejsze roboty AI, które warto znać, to:
- GPTBot: robot OpenAI, zbierający treści do zbiorów treningowych. To on decyduje o tym, czy model „widział” Państwa stronę podczas nauki.
- OAI-SearchBot: robot OpenAI odpowiedzialny za wyszukiwanie na żywo w odpowiedziach ChatGPT. To on pobiera treść, gdy użytkownik zadaje aktualne pytanie.
- ClaudeBot: robot Anthropic, działający w podobnym modelu.
- PerplexityBot: robot wyszukiwarki Perplexity, pobierający treści do odpowiedzi na bieżąco.
- Google-Extended: deklaracja Google dla treści wykorzystywanych w produktach AI.
- Bingbot: klasyczny robot Microsoftu, od którego zależy zarówno indeks w Bing, jak i obecność w odpowiedziach generatywnych opartych na wyszukiwarce.
Kluczowe rozróżnienie dotyczy celu: GPTBot zbiera dane do treningu modeli, podczas gdy OAI-SearchBot i PerplexityBot działają w modelu wyszukiwania na żywo. Blokada tego drugiego wyklucza Państwa firmę z aktualnych odpowiedzi, nawet jeśli trening już miał miejsce.
Dlaczego sama treść pliku rzadko mówi całą prawdę
Mogłoby się wydawać, że wystarczy zajrzeć do własnego pliku robots.txt, by mieć pewność. W praktyce to rzadko wystarcza i tu kryje się pułapka. Blokada widoczna w robots.txt to tylko jeden z kilku sposobów, na jakie strona odcina się od robotów AI; równie często odcina je zapora, CDN albo reguła hostingu, której w samym pliku w ogóle nie widać. Co więcej, poszczególne boty (GPTBot, OAI-SearchBot, PerplexityBot, ClaudeBot, Bingbot) bywają traktowane różnie, a skutki blokady każdego z nich są inne. Rzetelna ocena wymaga sprawdzenia reakcji każdego z tych robotów osobno i zestawienia jej z tym, co widzi zwykła przeglądarka. Inaczej łatwo o fałszywe poczucie bezpieczeństwa. Właśnie taką pełną diagnozę dostępu, dla wszystkich kluczowych botów AI naraz, z dowodem reakcji przed i po, wykonujemy w ramach bezpłatnego audytu, a wykryte blokady usuwamy w pakiecie naprawczym (zwykle 2-3 dni robocze).
Pułapki nieświadomej blokady
Wiele firm nie blokuje robotów celowo. Blokada często powstaje przez:
- Wtyczki SEO: popularne rozszerzenia do WordPressa oferują opcję „blokuj boty AI” jako jedno kliknięcie.
- Firewall lub CDN: reguły zabezpieczające ruch mogą odrzucać niektóre user-agenty.
- Ustawienia hostingodawcy: niektóre panele administracyjne oferują przycisk „blokuj wszystkie boty AI” bez wyjaśnienia konsekwencji.
Według danych Hostingera ze stycznia 2026 roku OAI-SearchBot, czyli robot wyszukiwania ChatGPT, dociera do około 55% sieci. Prawie co druga strona jest więc dla aktualnych odpowiedzi AI niedostępna, najczęściej bez wiedzy właściciela. Dla firmy usługowej skutek jest bardzo konkretny: gdy klient pyta AI o usługę, model nie ma jak pobrać Państwa treści, więc poleca konkurencję, której strona jest dostępna. Rozpoznanie, który dokładnie bot jest blokowany i dlaczego, oraz bezpieczne przywrócenie dostępu to część audytu i pakietu naprawczego, wykonujemy je za Państwa, z dowodem reakcji robotów przed i po.
Dlaczego rozróżnienie botów jest kluczowe
Najczęstszy błąd polega na traktowaniu wszystkich robotów jako jednej grupy. Blokada GPTBot chroni przed wykorzystaniem treści do treningu, ale nie wyklucza firmy z odpowiedzi wyszukiwanych na żywo. Blokada OAI-SearchBot natomiast wycina Państwa firmę z wyników wyszukiwania w ChatGPT, nawet jeśli sama treść jest wartościowa. Z perspektywy firmy usługowej, która zależy na poleceniach w odpowiedziach generatywnych, to właśnie ten drugi bot jest zwykle istotniejszy dla bieżącej widoczności.