Recomindo

KI-Crawler erklärt: GPTBot, OAI-SearchBot, PerplexityBot

Von [FILL IN: author name], [FILL IN: author role]5 Min. Lesezeit

KI-Unternehmen betreiben getrennte Crawler für die KI-Suche, für Nutzeranfragen und für das Modelltraining, und Sie können jeden davon in der robots.txt anders behandeln. Lassen Sie die Such-Crawler zu, wenn Assistenten Sie zitieren sollen; das Blockieren der Training-Crawler ist eine legitime Entscheidung.

KI-Crawler sind Web-Roboter von KI-Unternehmen; jeder nennt einen eigenen Namen (User-Agent), damit Website-Betreiber ihn in der robots.txt einzeln zulassen oder blockieren können.
  • Such-Crawler (OAI-SearchBot, PerplexityBot, Claude-SearchBot) entscheiden, ob Assistenten Sie zitieren können.
  • Training-Crawler (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) entscheiden, ob Ihre Inhalte zum Training von Modellen verwendet werden dürfen.
  • Nutzerausgelöste Abrufer (ChatGPT-User, Perplexity-User, Claude-User) besuchen eine Seite, weil eine Person darum gebeten hat, und folgen der robots.txt möglicherweise nicht.
  • Wer alles mit einer Regel blockiert, sperrt auch die Crawler aus, die Ihnen Empfehlungen bringen.

Welche KI-Crawler gibt es, und wofür ist jeder gedacht?

CrawlerBetreiberZweck (laut Dokumentation)robots.txt
OAI-SearchBotOpenAIZeigt Websites in den Suchfunktionen von ChatGPT anSteuert ihn; Änderungen können etwa 24 Stunden dauern
GPTBotOpenAICrawlt Inhalte, die für das Training verwendet werden könnenSteuert ihn
ChatGPT-UserOpenAIRuft eine Seite auf, wenn ein Nutzer ChatGPT oder einen Custom GPT fragtGilt möglicherweise nicht, weil ein Nutzer ihn auslöst
PerplexityBotPerplexityZeigt Websites in der Perplexity-Suche an und verlinkt sie; nicht für das Training von BasismodellenBeachtet sie
Perplexity-UserPerplexityUnterstützt Nutzeranfragen innerhalb von PerplexityIgnoriert sie in der Regel, weil ein Nutzer gefragt hat
ClaudeBotAnthropicSammelt Inhalte, die zum Modelltraining beitragen könntenBeachtet sie
Claude-SearchBotAnthropicVerbessert die Qualität der SuchergebnisseBeachtet sie
Claude-UserAnthropicUnterstützt nutzerausgelöste AnfragenAnthropic sagt, seine Bots befolgen robots.txt-Anweisungen
Google-ExtendedGoogleToken, das die Nutzung für Gemini-Training und Grounding steuert; kein eigener User-AgentEin robots.txt-Token; keine Auswirkung auf die Suche
Applebot-ExtendedAppleSteuert, ob von Applebot gecrawlte Daten Apple-Modelle trainieren; er crawlt nichtEin robots.txt-Token
CCBotCommon CrawlErstellt den Common-Crawl-DatensatzBeachtet sie

Quellen: OpenAI, Perplexity, Anthropic, Google, Apple und Common Crawl. Namen und Verhalten ändern sich, prüfen Sie daher die Seite des Anbieters, bevor Sie sich auf ein Detail verlassen.

Sollten Sie KI-Crawler zulassen oder blockieren?

Das hängt davon ab, was Sie wollen:

  • Sie möchten, dass Assistenten Sie empfehlen: Lassen Sie die Such-Crawler (OAI-SearchBot, PerplexityBot, Claude-SearchBot) zu und stellen Sie sicher, dass Googlebot Ihre Seiten indexieren kann, denn laut Google brauchen AI Overviews und AI Mode eine Seite, die indexiert und für die Anzeige mit einem Snippet geeignet ist (Google).
  • Sie möchten nicht, dass Ihre Inhalte für das Training verwendet werden: Sperren Sie GPTBot, ClaudeBot, Google-Extended, Applebot-Extended und CCBot. OpenAI sagt, das Sperren von GPTBot „zeigt an, dass die Inhalte einer Website nicht für das Training verwendet werden sollen“, und Apple sagt, dass Seiten, die Applebot-Extended sperren, weiterhin in seinen Suchergebnissen erscheinen können.
  • Beides: Lassen Sie die Such-Crawler zu und blockieren Sie die Training-Crawler. Die beiden Gruppen sind unabhängig voneinander.

Wie sieht eine sinnvolle robots.txt aus?

Dieses Beispiel lässt die Such-Crawler herein, blockiert die Training-Crawler und hält private Pfade privat. Passen Sie die Pfade an Ihre Website an:

User-agent: *
Disallow: /admin/

User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /

Beachten Sie, dass ein Crawler mit eigener Gruppe nur dieser Gruppe folgt. Kopieren Sie deshalb alle Regeln für private Pfade, die Sie weiterhin wollen (etwa Disallow: /admin/), in die Gruppen, die den Zugriff erlauben.

Warum stoppt eine robots.txt-Regel nicht immer einen Besuch?

Nutzerausgelöste Abrufer handeln für eine Person. OpenAI sagt, robots.txt-Regeln „könnten“ für ChatGPT-User „nicht gelten“, und Perplexity sagt, Perplexity-User ignoriere sie in der Regel. Wenn Sie solche Besuche komplett fernhalten müssen, nutzen Sie eine Firewall oder eine Authentifizierung, nicht die robots.txt. Anthropic weist außerdem darauf hin, dass das Blockieren per IP-Adresse das Crawlen möglicherweise nicht zuverlässig verhindert, und veröffentlicht eine IP-Liste, um seine Bots zu überprüfen.

Wie prüfen Sie, was Ihre Website heute erlaubt?

  1. Starten Sie den KI-Crawler-Checker mit Ihrer Domain. Er zeigt das Urteil für jeden Crawler und die genaue robots.txt-Zeile, die entscheidet.
  2. Ist ein Such-Crawler blockiert, kopieren Sie die korrigierte robots.txt, die er erzeugt und die Ihre privaten Pfade weiterhin sperrt.
  3. Laden Sie die Datei in das Stammverzeichnis Ihrer Website hoch und prüfen Sie nach etwa einem Tag erneut; OpenAI sagt, OAI-SearchBot könne etwa 24 Stunden brauchen, um sich anzupassen.
  4. Ergänzen Sie eine llms.txt, damit Crawler, die Ihre Website lesen können, Ihre wichtigsten Seiten schnell finden.
  5. Starten Sie das KI-Readiness-Audit für den Rest der technischen Grundlagen und danach den kostenlosen KI-Sichtbarkeits-Check, um zu sehen, ob Assistenten Sie für Ihren Markt nennen.

Häufig gestellte Fragen

Was ist der Unterschied zwischen GPTBot und OAI-SearchBot?

OAI-SearchBot zeigt Websites in den Suchfunktionen von ChatGPT an. Wer ihn blockiert, bleibt aus diesen Ergebnissen draußen. GPTBot crawlt Inhalte, die zum Training der OpenAI-Modelle verwendet werden können; sein Blockieren entfernt Sie nicht aus der ChatGPT-Suche.

Schadet das Blockieren von Google-Extended meinem Google-Ranking?

Nein. Google erklärt, dass Google-Extended die Aufnahme einer Website in die Google-Suche nicht beeinflusst und kein Ranking-Signal ist. Es steuert nur die Nutzung gecrawlter Inhalte für das Training künftiger Gemini-Modelle und für Grounding.

Sollte ein kleines Unternehmen KI-Training-Crawler blockieren?

Das entscheiden Sie. Das Blockieren von Training-Crawlern hält Ihre Inhalte aus dem künftigen Modelltraining heraus. Es stoppt nicht die Such-Crawler, mit denen Assistenten Sie zitieren können, solange Sie diese separat zulassen.

Warum blockiert meine Firewall KI-Crawler, obwohl die robots.txt sie erlaubt?

Die robots.txt legt nur Ihre Richtlinie fest. Firewalls, CDNs und Bot-Schutz-Tools können Crawler unabhängig davon blockieren. Zeigt der Checker erlaubten Zugriff, aber Assistenten können Ihre Website trotzdem nicht lesen, prüfen Sie die Einstellungen Ihres Bot-Schutzes.

Empfiehlt ChatGPT Ihr Unternehmen?

Starten Sie den kostenlosen KI-Sichtbarkeits-Check: 10 echte Käuferfragen, ChatGPT und Perplexity, Ihr Score gegenüber 3 Wettbewerbern. Ohne Anmeldung.

Alle Leitfäden →