Czy blokować GPTBota?

Nie, jeśli zależy ci na cytowaniach. Blokada w robots.txt nie chroni treści przed uczeniem modelu w sposób, na który większość firm liczy, za to skutecznie wyklucza stronę z odpowiedzi udzielanych użytkownikom. Blokuj świadomie i wybiórczo, a nie domyślnie, bo brak decyzji zwykle kończy się brakiem wzmianek.

GPTBot i OAI-SearchBot to nie to samo

Jeden pobiera treść na potrzeby trenowania, drugi na potrzeby odpowiedzi udzielanej właśnie teraz. To rozróżnienie decyduje o tym, co właściwie blokujesz. Zablokowanie bota odpowiedzialnego za wyszukiwanie w czasie rzeczywistym wycina markę z odpowiedzi, które powstają dla użytkowników tu i teraz. Podobnie jest u innych dostawców: osobne nazwy odpowiadają za trenowanie i za pobranie strony pod konkretne pytanie.

Jak wygląda jawna zgoda w robots.txt

Wymień boty z nazwy i daj im Allow, zamiast liczyć na zachowanie domyślne. Brak reguły zwykle znaczy zgodę, ale zostawia miejsce na interpretację i utrudnia audyt. Plik tej witryny wymienia GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended i Bingbot, każdemu daje Allow, a na końcu wskazuje sitemapę. Możesz go podejrzeć pod adresem /robots.txt.

Jak sprawdzić, co naprawdę widzi bot

Pobierz stronę jego nagłówkiem User-Agent i porównaj z tym, co widzi przeglądarka. Różne odpowiedzi znaczą, że serwer traktuje boty inaczej. Pusta albo bardzo krótka odpowiedź znaczy, że treść powstaje dopiero w przeglądarce, a bot dostaje sam szkielet. Konkretne polecenia znajdziesz w checkliście.

Ostatnia aktualizacja:

Nasz pomiar na 55 spółkach z WIG20 i mWIG40: boty AI blokuje 3 (5%), ale 18 (33%) nie ma w surowym HTML nagłówka H1 z tekstem. Świadoma blokada jest rzadka; wielokrotnie częstsza jest strona, której bot nie ma jak przeczytać.

Powiązane pytania

Wróć na stronę główną Visibility by Xfaang