Recomindo

AI crawlery: GPTBot, OAI-SearchBot, PerplexityBot

Autor: [FILL IN: author name], [FILL IN: author role]4 min čtení

AI firmy provozují oddělené crawlery pro AI vyhledávání, pro požadavky uživatelů a pro trénování modelů a v robots.txt můžete každý z nich řešit zvlášť. Chcete-li, aby vás asistenti citovali, povolte vyhledávací crawlery; zablokovat trénovací crawlery je legitimní volba.

AI crawlery jsou weboví roboti provozovaní AI firmami; každý se hlásí vlastním jménem (user agent), takže ho majitel webu může v robots.txt povolit nebo zablokovat samostatně.
  • Vyhledávací crawlery (OAI-SearchBot, PerplexityBot, Claude-SearchBot) rozhodují o tom, zda vás mohou asistenti citovat.
  • Trénovací crawlery (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) rozhodují o tom, zda se váš obsah smí použít k trénování modelů.
  • Nástroje spouštěné uživatelem (ChatGPT-User, Perplexity-User, Claude-User) navštíví stránku, protože o to člověk požádal, a nemusejí se řídit robots.txt.
  • Zablokování všeho jedním pravidlem zablokuje i crawlery, které vám přinášejí doporučení.

Jaké AI crawlery existují a k čemu který slouží?

CrawlerProvozovatelÚčel (podle dokumentace)robots.txt
OAI-SearchBotOpenAIZobrazuje weby ve vyhledávacích funkcích ChatGPTŘídí ho; změny mohou trvat asi 24 hodin
GPTBotOpenAIProchází obsah, který se může použít k trénováníŘídí ho
ChatGPT-UserOpenAINavštíví stránku, když se uživatel zeptá ChatGPT nebo vlastního GPTNemusí platit, protože ho spouští uživatel
PerplexityBotPerplexityZobrazuje a odkazuje weby ve vyhledávání Perplexity; nepoužívá se k trénování základních modelůRespektuje ho
Perplexity-UserPerplexityObsluhuje požadavky uživatelů v PerplexityObvykle ho ignoruje, protože o stránku požádal uživatel
ClaudeBotAnthropicSbírá obsah, který může přispět k trénování modelůRespektuje ho
Claude-SearchBotAnthropicZlepšuje kvalitu výsledků vyhledáváníRespektuje ho
Claude-UserAnthropicObsluhuje požadavky vyvolané uživatelemAnthropic uvádí, že jeho boti dodržují direktivy robots.txt
Google-ExtendedGoogleToken řídící použití pro trénování Gemini a grounding; nemá samostatný user agentToken v robots.txt; na Vyhledávání nemá vliv
Applebot-ExtendedAppleUrčuje, zda se data nasbíraná Applebotem použijí k trénování modelů Apple; sám neprochází webToken v robots.txt
CCBotCommon CrawlVytváří datovou sadu Common CrawlRespektuje ho

Zdroje: OpenAI, Perplexity, Anthropic, Google, Apple a Common Crawl. Názvy i chování se mění, proto si před spoléháním na nějaký detail ověřte stránku výrobce.

Máte AI crawlery povolit, nebo zablokovat?

Záleží na tom, čeho chcete dosáhnout:

  • Chcete, aby vás asistenti doporučovali: povolte vyhledávací crawlery (OAI-SearchBot, PerplexityBot, Claude-SearchBot) a zajistěte, aby Googlebot mohl vaše stránky indexovat, protože Google uvádí, že AI Overviews a AI Mode vyžadují stránku, která je indexovaná a způsobilá k zobrazení s úryvkem (Google).
  • Nechcete, aby se váš obsah používal k trénování: zakažte GPTBot, ClaudeBot, Google-Extended, Applebot-Extended a CCBot. OpenAI uvádí, že zákaz GPTBotu „indikuje, že obsah webu by se neměl používat k trénování“, a Apple říká, že stránky, které zakazují Applebot-Extended, se mohou dál objevovat v jeho výsledcích vyhledávání.
  • Obojí: povolte vyhledávací crawlery a zablokujte trénovací. Obě skupiny jsou nezávislé.

Jak vypadá rozumný robots.txt?

Tento příklad pouští dovnitř vyhledávací crawlery, blokuje trénovací crawlery a soukromé cesty nechává soukromé. Cesty upravte podle svého webu:

User-agent: *
Disallow: /admin/

User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /

Pamatujte, že crawler, který má vlastní skupinu, se řídí pouze touto skupinou, takže pravidla pro soukromé cesty, která chcete zachovat (například Disallow: /admin/), zkopírujte i do skupin, které přístup povolují.

Proč pravidlo v robots.txt návštěvu vždy nezastaví?

Nástroje spouštěné uživatelem jednají za člověka. OpenAI uvádí, že pravidla robots.txt „nemusejí platit“ pro ChatGPT-User, a Perplexity říká, že Perplexity-User je obvykle ignoruje. Pokud musíte takové návštěvy úplně vyloučit, použijte firewall nebo autentizaci, ne robots.txt. Anthropic také upozorňuje, že blokování podle IP adresy nemusí procházení spolehlivě zabránit, a zveřejňuje seznam IP adres pro ověření svých botů.

Jak zjistíte, co váš web dnes povoluje?

  1. Spusťte kontrolu AI crawlerů se svou doménou. Ukáže verdikt pro každý crawler i přesný řádek v robots.txt, který o něm rozhoduje.
  2. Pokud je některý vyhledávací crawler blokovaný, zkopírujte opravený robots.txt, který nástroj vygeneruje a který ponechává soukromé cesty zakázané.
  3. Nahrajte soubor do kořene webu a po zhruba jednom dni zkontrolujte znovu; OpenAI uvádí, že OAI-SearchBot se může přizpůsobit až za 24 hodin.
  4. Přidejte llms.txt, aby crawlery, které váš web umějí číst, rychle našly klíčové stránky.
  5. Spusťte audit připravenosti na AI pro zbytek technických základů a poté bezplatnou kontrolu viditelnosti v AI, abyste zjistili, zda vás asistenti pro váš trh jmenují.

Často kladené otázky

Jaký je rozdíl mezi GPTBot a OAI-SearchBot?

OAI-SearchBot zobrazuje weby ve vyhledávacích funkcích ChatGPT, takže jeho zablokování vás z těchto výsledků vyřadí. GPTBot prochází obsah, který se může použít k trénování modelů OpenAI; jeho zablokování vás z vyhledávání ChatGPT neodstraní.

Uškodí zablokování Google-Extended mému umístění v Googlu?

Ne. Google uvádí, že Google-Extended nemá vliv na zařazení webu do Vyhledávání Google a není signálem pořadí. Řídí pouze použití procházeného obsahu k trénování budoucích modelů Gemini a pro grounding.

Má malá firma blokovat trénovací AI crawlery?

Je to na vás. Zablokováním trénovacích crawlerů zůstane váš obsah mimo budoucí trénování modelů a nezastaví to vyhledávací crawlery, díky nimž vás asistenti mohou citovat, pokud je povolíte zvlášť.

Proč můj firewall blokuje AI crawlery, i když je robots.txt povoluje?

robots.txt pouze určuje vaši politiku. Firewally, CDN a nástroje na ochranu před boty mohou crawlery blokovat bez ohledu na něj. Pokud kontrola ukazuje, že přístup je povolen, ale asistenti váš web stále nemohou číst, zkontrolujte nastavení ochrany před boty.

Doporučuje ChatGPT Vaši firmu?

Spusťte bezplatnou kontrolu viditelnosti v AI: 10 skutečných otázek kupujících, ChatGPT a Perplexity, Vaše skóre proti 3 konkurentům. Bez registrace.

Všichni průvodci →