Roboty AI: GPTBot, OAI-SearchBot i PerplexityBot wyjaśnione
Firmy AI uruchamiają osobne roboty do wyszukiwania AI, do próśb użytkowników i do trenowania modeli, a w robots.txt możesz każdy traktować inaczej. Wpuść roboty wyszukujące, jeśli chcesz, by asystenci Cię cytowali; blokowanie robotów trenujących to uprawniony wybór.
Roboty AI to roboty internetowe prowadzone przez firmy AI; każdy podaje własną nazwę (user agent), dzięki czemu właściciele stron mogą w robots.txt wpuścić go lub zablokować osobno.
- Roboty wyszukujące (OAI-SearchBot, PerplexityBot, Claude-SearchBot) decydują, czy asystenci mogą Cię cytować.
- Roboty trenujące (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) decydują, czy Twoje treści mogą służyć do trenowania modeli.
- Roboty uruchamiane przez użytkownika (ChatGPT-User, Perplexity-User, Claude-User) odwiedzają stronę, bo poprosił o to człowiek, i mogą nie stosować się do robots.txt.
- Zablokowanie wszystkiego jedną regułą blokuje też roboty, które przynoszą Ci rekomendacje.
Jakie roboty AI istnieją i do czego służy każdy z nich?
| Robot | Operator | Przeznaczenie (według dokumentacji) | robots.txt |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Prezentuje witryny w funkcjach wyszukiwania ChatGPT | Kontroluje go; zmiany mogą zająć około 24 godzin |
| GPTBot | OpenAI | Pobiera treści, które mogą być używane do trenowania | Kontroluje go |
| ChatGPT-User | OpenAI | Odwiedza stronę, gdy użytkownik zadaje pytanie ChatGPT lub własnemu GPT | Może nie obowiązywać, bo inicjuje go użytkownik |
| PerplexityBot | Perplexity | Prezentuje i linkuje witryny w wyszukiwaniu Perplexity; nie służy do trenowania podstawowych modeli | Przestrzega go |
| Perplexity-User | Perplexity | Obsługuje prośby użytkowników w Perplexity | Zazwyczaj go ignoruje, bo poprosił użytkownik |
| ClaudeBot | Anthropic | Zbiera treści, które mogą przyczynić się do trenowania modeli | Przestrzega go |
| Claude-SearchBot | Anthropic | Poprawia jakość wyników wyszukiwania | Przestrzega go |
| Claude-User | Anthropic | Obsługuje prośby inicjowane przez użytkowników | Anthropic podaje, że jej roboty przestrzegają dyrektyw robots.txt |
| Google-Extended | Token kontrolujący wykorzystanie do trenowania i groundingu Gemini; bez osobnego user agenta | Token w robots.txt; bez wpływu na wyszukiwarkę | |
| Applebot-Extended | Apple | Kontroluje, czy dane pobrane przez Applebot służą do trenowania modeli Apple; sam nie pobiera stron | Token w robots.txt |
| CCBot | Common Crawl | Buduje zbiór danych Common Crawl | Przestrzega go |
Źródła: OpenAI, Perplexity, Anthropic, Google, Apple i Common Crawl. Nazwy i zachowanie się zmieniają, więc przed poleganiem na szczególe sprawdź stronę dostawcy.
Czy wpuszczać roboty AI, czy je blokować?
To zależy od tego, czego chcesz:
- Chcesz, by asystenci Cię polecali: wpuść roboty wyszukujące (OAI-SearchBot, PerplexityBot, Claude-SearchBot) i dopilnuj, by Googlebot mógł indeksować Twoje strony, bo według Google AI Overviews i AI Mode wymagają strony zaindeksowanej i kwalifikującej się do wyświetlenia ze snippetem (Google).
- Nie chcesz, by Twoje treści służyły do trenowania: zablokuj GPTBot, ClaudeBot, Google-Extended, Applebot-Extended i CCBot. OpenAI podaje, że zablokowanie GPTBot „oznacza, że treści witryny nie powinny być używane do trenowania”, a Apple, że strony blokujące Applebot-Extended nadal mogą pojawiać się w jej wynikach wyszukiwania.
- Jedno i drugie: wpuść roboty wyszukujące i zablokuj trenujące. Obie grupy są niezależne.
Jak wygląda rozsądny robots.txt?
Ten przykład wpuszcza roboty wyszukujące, blokuje trenujące i chroni prywatne ścieżki. Dostosuj ścieżki do swojej strony:
User-agent: *
Disallow: /admin/
User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /Pamiętaj, że robot z własną grupą stosuje się tylko do tej grupy, więc reguły prywatnych ścieżek, które nadal chcesz zachować (np. Disallow: /admin/), skopiuj do grup, które dają dostęp.
Dlaczego reguła w robots.txt nie zawsze powstrzymuje wizytę?
Roboty uruchamiane przez użytkownika działają w jego imieniu. OpenAI podaje, że reguły robots.txt „mogą nie obowiązywać” ChatGPT-User, a Perplexity, że Perplexity-User zazwyczaj je ignoruje. Jeśli musisz całkowicie wykluczyć takie wizyty, użyj zapory sieciowej lub uwierzytelniania, a nie robots.txt. Anthropic zaznacza też, że blokowanie po adresie IP może nie powstrzymać pobierania niezawodnie, i publikuje listę adresów IP do weryfikacji swoich robotów.
Jak sprawdzić, co Twoja strona dziś dopuszcza?
- Uruchom sprawdzanie robotów AI dla swojej domeny. Pokaże werdykt dla każdego robota i dokładną linię robots.txt, która o nim decyduje.
- Jeśli robot wyszukujący jest zablokowany, skopiuj poprawiony robots.txt, który wygeneruje narzędzie i który zachowuje blokadę Twoich prywatnych ścieżek.
- Wgraj plik do katalogu głównego strony i sprawdź ponownie po mniej więcej dobie; OpenAI podaje, że OAI-SearchBot może potrzebować około 24 godzin, by się dostosować.
- Dodaj llms.txt, aby roboty, które mogą czytać Twoją stronę, szybko znalazły kluczowe podstrony.
- Uruchom audyt gotowości na AI, by sprawdzić resztę podstaw technicznych, a potem bezpłatny test widoczności w AI, by zobaczyć, czy asystenci wymieniają Cię na Twoim rynku.
Najczęstsze pytania
Czym różni się GPTBot od OAI-SearchBot?
OAI-SearchBot prezentuje witryny w funkcjach wyszukiwania ChatGPT, więc jego zablokowanie wyklucza Cię z tych wyników. GPTBot pobiera treści, które mogą być używane do trenowania modeli OpenAI; jego zablokowanie nie usuwa Cię z wyszukiwania ChatGPT.
Czy zablokowanie Google-Extended zaszkodzi mojej pozycji w Google?
Nie. Google podaje, że Google-Extended nie wpływa na obecność witryny w Google Search i nie jest sygnałem rankingowym. Kontroluje wyłącznie wykorzystanie pobranych treści do trenowania przyszłych modeli Gemini i do groundingu.
Czy mała firma powinna blokować roboty trenujące AI?
To Twoja decyzja. Zablokowanie robotów trenujących utrzymuje Twoje treści poza przyszłym trenowaniem modeli i nie powstrzymuje robotów wyszukujących, dzięki którym asystenci mogą Cię cytować, o ile wpuszczasz je osobno.
Dlaczego moja zapora blokuje roboty AI, mimo że robots.txt je wpuszcza?
robots.txt tylko określa Twoją politykę. Zapory, sieci CDN i narzędzia ochrony przed botami mogą blokować roboty niezależnie od niego. Jeśli narzędzie pokazuje dozwolony dostęp, a asystenci nadal nie mogą przeczytać Twojej strony, sprawdź ustawienia ochrony przed botami.
Czy ChatGPT poleca Twoją firmę?
Uruchom bezpłatny test widoczności w AI: 10 prawdziwych pytań kupujących, ChatGPT i Perplexity, Twój wynik na tle 3 konkurentów. Bez rejestracji.
Czytaj dalej
- Jak sprawić, by ChatGPT polecał Twoją firmę: lista kontrolnaPraktyczna lista kontrolna dla małych firm, by stać się widocznym w odpowiedziach ChatGPT, Perplexity i Gemini: dostęp, jasność, dowody i cotygodniowy pomiar.
- Jak asystenci AI wybierają firmy, które polecająJak ChatGPT, Perplexity, Gemini i Claude znajdują firmy do polecenia: co silniki dokumentują, co zachowują dla siebie i na co możesz mieć wpływ.
- llms.txt: czym jest i jak go napisać dla swojej stronyllms.txt to proponowany plik w formacie markdown, który mówi asystentom AI, czym jest Twoja strona. Co mówi specyfikacja, przykład i przewodnik w sześciu krokach.
- Czym jest GEO? Generative Engine Optimization po ludzkuGEO (Generative Engine Optimization) to sposób, by ChatGPT, Perplexity i Gemini wymieniały Twoją firmę. Prosty przewodnik i sześć kroków na początek.