Recomindo

Roboty AI: GPTBot, OAI-SearchBot i PerplexityBot wyjaśnione

Autor: [FILL IN: author name], [FILL IN: author role]4 min czytania

Firmy AI uruchamiają osobne roboty do wyszukiwania AI, do próśb użytkowników i do trenowania modeli, a w robots.txt możesz każdy traktować inaczej. Wpuść roboty wyszukujące, jeśli chcesz, by asystenci Cię cytowali; blokowanie robotów trenujących to uprawniony wybór.

Roboty AI to roboty internetowe prowadzone przez firmy AI; każdy podaje własną nazwę (user agent), dzięki czemu właściciele stron mogą w robots.txt wpuścić go lub zablokować osobno.
  • Roboty wyszukujące (OAI-SearchBot, PerplexityBot, Claude-SearchBot) decydują, czy asystenci mogą Cię cytować.
  • Roboty trenujące (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) decydują, czy Twoje treści mogą służyć do trenowania modeli.
  • Roboty uruchamiane przez użytkownika (ChatGPT-User, Perplexity-User, Claude-User) odwiedzają stronę, bo poprosił o to człowiek, i mogą nie stosować się do robots.txt.
  • Zablokowanie wszystkiego jedną regułą blokuje też roboty, które przynoszą Ci rekomendacje.

Jakie roboty AI istnieją i do czego służy każdy z nich?

RobotOperatorPrzeznaczenie (według dokumentacji)robots.txt
OAI-SearchBotOpenAIPrezentuje witryny w funkcjach wyszukiwania ChatGPTKontroluje go; zmiany mogą zająć około 24 godzin
GPTBotOpenAIPobiera treści, które mogą być używane do trenowaniaKontroluje go
ChatGPT-UserOpenAIOdwiedza stronę, gdy użytkownik zadaje pytanie ChatGPT lub własnemu GPTMoże nie obowiązywać, bo inicjuje go użytkownik
PerplexityBotPerplexityPrezentuje i linkuje witryny w wyszukiwaniu Perplexity; nie służy do trenowania podstawowych modeliPrzestrzega go
Perplexity-UserPerplexityObsługuje prośby użytkowników w PerplexityZazwyczaj go ignoruje, bo poprosił użytkownik
ClaudeBotAnthropicZbiera treści, które mogą przyczynić się do trenowania modeliPrzestrzega go
Claude-SearchBotAnthropicPoprawia jakość wyników wyszukiwaniaPrzestrzega go
Claude-UserAnthropicObsługuje prośby inicjowane przez użytkownikówAnthropic podaje, że jej roboty przestrzegają dyrektyw robots.txt
Google-ExtendedGoogleToken kontrolujący wykorzystanie do trenowania i groundingu Gemini; bez osobnego user agentaToken w robots.txt; bez wpływu na wyszukiwarkę
Applebot-ExtendedAppleKontroluje, czy dane pobrane przez Applebot służą do trenowania modeli Apple; sam nie pobiera stronToken w robots.txt
CCBotCommon CrawlBuduje zbiór danych Common CrawlPrzestrzega go

Źródła: OpenAI, Perplexity, Anthropic, Google, Apple i Common Crawl. Nazwy i zachowanie się zmieniają, więc przed poleganiem na szczególe sprawdź stronę dostawcy.

Czy wpuszczać roboty AI, czy je blokować?

To zależy od tego, czego chcesz:

  • Chcesz, by asystenci Cię polecali: wpuść roboty wyszukujące (OAI-SearchBot, PerplexityBot, Claude-SearchBot) i dopilnuj, by Googlebot mógł indeksować Twoje strony, bo według Google AI Overviews i AI Mode wymagają strony zaindeksowanej i kwalifikującej się do wyświetlenia ze snippetem (Google).
  • Nie chcesz, by Twoje treści służyły do trenowania: zablokuj GPTBot, ClaudeBot, Google-Extended, Applebot-Extended i CCBot. OpenAI podaje, że zablokowanie GPTBot „oznacza, że treści witryny nie powinny być używane do trenowania”, a Apple, że strony blokujące Applebot-Extended nadal mogą pojawiać się w jej wynikach wyszukiwania.
  • Jedno i drugie: wpuść roboty wyszukujące i zablokuj trenujące. Obie grupy są niezależne.

Jak wygląda rozsądny robots.txt?

Ten przykład wpuszcza roboty wyszukujące, blokuje trenujące i chroni prywatne ścieżki. Dostosuj ścieżki do swojej strony:

User-agent: *
Disallow: /admin/

User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /

Pamiętaj, że robot z własną grupą stosuje się tylko do tej grupy, więc reguły prywatnych ścieżek, które nadal chcesz zachować (np. Disallow: /admin/), skopiuj do grup, które dają dostęp.

Dlaczego reguła w robots.txt nie zawsze powstrzymuje wizytę?

Roboty uruchamiane przez użytkownika działają w jego imieniu. OpenAI podaje, że reguły robots.txt „mogą nie obowiązywać” ChatGPT-User, a Perplexity, że Perplexity-User zazwyczaj je ignoruje. Jeśli musisz całkowicie wykluczyć takie wizyty, użyj zapory sieciowej lub uwierzytelniania, a nie robots.txt. Anthropic zaznacza też, że blokowanie po adresie IP może nie powstrzymać pobierania niezawodnie, i publikuje listę adresów IP do weryfikacji swoich robotów.

Jak sprawdzić, co Twoja strona dziś dopuszcza?

  1. Uruchom sprawdzanie robotów AI dla swojej domeny. Pokaże werdykt dla każdego robota i dokładną linię robots.txt, która o nim decyduje.
  2. Jeśli robot wyszukujący jest zablokowany, skopiuj poprawiony robots.txt, który wygeneruje narzędzie i który zachowuje blokadę Twoich prywatnych ścieżek.
  3. Wgraj plik do katalogu głównego strony i sprawdź ponownie po mniej więcej dobie; OpenAI podaje, że OAI-SearchBot może potrzebować około 24 godzin, by się dostosować.
  4. Dodaj llms.txt, aby roboty, które mogą czytać Twoją stronę, szybko znalazły kluczowe podstrony.
  5. Uruchom audyt gotowości na AI, by sprawdzić resztę podstaw technicznych, a potem bezpłatny test widoczności w AI, by zobaczyć, czy asystenci wymieniają Cię na Twoim rynku.

Najczęstsze pytania

Czym różni się GPTBot od OAI-SearchBot?

OAI-SearchBot prezentuje witryny w funkcjach wyszukiwania ChatGPT, więc jego zablokowanie wyklucza Cię z tych wyników. GPTBot pobiera treści, które mogą być używane do trenowania modeli OpenAI; jego zablokowanie nie usuwa Cię z wyszukiwania ChatGPT.

Czy zablokowanie Google-Extended zaszkodzi mojej pozycji w Google?

Nie. Google podaje, że Google-Extended nie wpływa na obecność witryny w Google Search i nie jest sygnałem rankingowym. Kontroluje wyłącznie wykorzystanie pobranych treści do trenowania przyszłych modeli Gemini i do groundingu.

Czy mała firma powinna blokować roboty trenujące AI?

To Twoja decyzja. Zablokowanie robotów trenujących utrzymuje Twoje treści poza przyszłym trenowaniem modeli i nie powstrzymuje robotów wyszukujących, dzięki którym asystenci mogą Cię cytować, o ile wpuszczasz je osobno.

Dlaczego moja zapora blokuje roboty AI, mimo że robots.txt je wpuszcza?

robots.txt tylko określa Twoją politykę. Zapory, sieci CDN i narzędzia ochrony przed botami mogą blokować roboty niezależnie od niego. Jeśli narzędzie pokazuje dozwolony dostęp, a asystenci nadal nie mogą przeczytać Twojej strony, sprawdź ustawienia ochrony przed botami.

Czy ChatGPT poleca Twoją firmę?

Uruchom bezpłatny test widoczności w AI: 10 prawdziwych pytań kupujących, ChatGPT i Perplexity, Twój wynik na tle 3 konkurentów. Bez rejestracji.

Wszystkie poradniki →