Crawlere AI explicate: GPTBot, OAI-SearchBot, PerplexityBot
Companiile de AI folosesc crawlere separate pentru căutarea AI, pentru cererile utilizatorilor și pentru antrenarea modelelor, iar în robots.txt le puteți trata pe fiecare diferit. Permiteți crawlerele de căutare dacă doriți ca asistenții să vă citeze; blocarea celor de antrenare este o alegere legitimă.
Crawlerele AI sunt roboți web operați de companiile de AI; fiecare își declară propriul nume (user agent), astfel încât proprietarii de site-uri să îl poată permite sau bloca individual în robots.txt.
- Crawlerele de căutare (OAI-SearchBot, PerplexityBot, Claude-SearchBot) decid dacă asistenții vă pot cita.
- Crawlerele de antrenare (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) decid dacă conținutul dumneavoastră poate fi folosit la antrenarea modelelor.
- Instrumentele de acces declanșate de utilizator (ChatGPT-User, Perplexity-User, Claude-User) vizitează o pagină pentru că o persoană a cerut-o și pot să nu respecte robots.txt.
- Blocarea tuturor printr-o singură regulă blochează și crawlerele care vă aduc recomandări.
Ce crawlere AI există și la ce folosește fiecare?
| Crawler | Operator | Scop (conform documentației) | robots.txt |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Afișează site-uri în funcțiile de căutare din ChatGPT | Îl controlează; modificările pot dura aproximativ 24 de ore |
| GPTBot | OpenAI | Parcurge conținut care poate fi folosit la antrenare | Îl controlează |
| ChatGPT-User | OpenAI | Vizitează o pagină când un utilizator întreabă ChatGPT sau un GPT personalizat | Poate să nu se aplice, deoarece vizita este inițiată de un utilizator |
| PerplexityBot | Perplexity | Afișează și leagă site-uri în căutarea Perplexity; nu este folosit la antrenarea modelelor de bază | Îl respectă |
| Perplexity-User | Perplexity | Susține cererile utilizatorilor în Perplexity | Îl ignoră în general, deoarece a cerut un utilizator |
| ClaudeBot | Anthropic | Colectează conținut care ar putea contribui la antrenarea modelelor | Îl respectă |
| Claude-SearchBot | Anthropic | Îmbunătățește calitatea rezultatelor căutării | Îl respectă |
| Claude-User | Anthropic | Susține cererile inițiate de utilizatori | Anthropic afirmă că roboții săi respectă directivele robots.txt |
| Google-Extended | Token care controlează utilizarea pentru antrenarea și fundamentarea Gemini; nu are user agent separat | Un token robots.txt; nu influențează Căutarea | |
| Applebot-Extended | Apple | Controlează dacă datele colectate de Applebot antrenează modelele Apple; nu parcurge site-uri | Un token robots.txt |
| CCBot | Common Crawl | Construiește setul de date Common Crawl | Îl respectă |
Surse: OpenAI, Perplexity, Anthropic, Google, Apple și Common Crawl. Numele și comportamentul se schimbă, așa că verificați pagina furnizorului înainte de a vă baza pe un detaliu.
Ar trebui să permiteți sau să blocați crawlerele AI?
Depinde de ce doriți:
- Doriți ca asistenții să vă recomande: permiteți crawlerele de căutare (OAI-SearchBot, PerplexityBot, Claude-SearchBot) și asigurați-vă că Googlebot poate indexa paginile dumneavoastră, deoarece Google spune că AI Overviews și AI Mode necesită o pagină indexată și eligibilă pentru afișare cu fragment (Google).
- Nu doriți ca conținutul dumneavoastră să fie folosit la antrenare: interziceți GPTBot, ClaudeBot, Google-Extended, Applebot-Extended și CCBot. OpenAI afirmă că interzicerea GPTBot „indică faptul că conținutul unui site nu trebuie folosit la antrenare”, iar Apple spune că paginile care interzic Applebot-Extended pot apărea în continuare în rezultatele sale de căutare.
- Ambele: permiteți crawlerele de căutare și blocați-le pe cele de antrenare. Cele două grupuri sunt independente.
Cum arată un robots.txt rezonabil?
Acest exemplu lasă crawlerele de căutare să intre, blochează crawlerele de antrenare și păstrează căile private în afara accesului. Adaptați căile la site-ul dumneavoastră:
User-agent: *
Disallow: /admin/
User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /Rețineți că un crawler care are propriul grup urmează doar acel grup, așa că copiați regulile pentru căile private pe care le mai doriți (precum Disallow: /admin/) în grupurile care permit accesul.
De ce o regulă robots.txt nu oprește întotdeauna o vizită?
Instrumentele declanșate de utilizator acționează în numele unei persoane. OpenAI spune că regulile robots.txt „pot să nu se aplice” pentru ChatGPT-User, iar Perplexity spune că Perplexity-User le ignoră în general. Dacă trebuie să țineți complet departe astfel de vizite, folosiți un firewall sau autentificare, nu robots.txt. Anthropic mai menționează că blocarea după adresa IP poate să nu împiedice în mod fiabil parcurgerea site-ului și publică o listă de adrese IP pentru verificarea roboților săi.
Cum verificați ce permite site-ul dumneavoastră astăzi?
- Rulați verificatorul de crawlere AI cu domeniul dumneavoastră. Acesta arată verdictul pentru fiecare crawler și linia exactă din robots.txt care îl determină.
- Dacă un crawler de căutare este blocat, copiați fișierul robots.txt corectat pe care îl generează, care păstrează căile private interzise.
- Încărcați fișierul în rădăcina site-ului și verificați din nou după aproximativ o zi; OpenAI spune că OAI-SearchBot poate avea nevoie de aproximativ 24 de ore pentru a se adapta.
- Adăugați un llms.txt, astfel încât crawlerele care pot citi site-ul să găsească rapid paginile dumneavoastră principale.
- Rulați auditul de pregătire pentru AI pentru restul bazelor tehnice, apoi Verificarea gratuită a vizibilității în AI pentru a vedea dacă asistenții vă menționează pe piața dumneavoastră.
Întrebări frecvente
Care este diferența dintre GPTBot și OAI-SearchBot?
OAI-SearchBot afișează site-uri în funcțiile de căutare din ChatGPT, deci blocarea lui vă scoate din acele rezultate. GPTBot parcurge conținut care poate fi folosit la antrenarea modelelor OpenAI; blocarea lui nu vă elimină din căutarea ChatGPT.
Blocarea Google-Extended îmi va afecta pozițiile în Google?
Nu. Google afirmă că Google-Extended nu influențează includerea unui site în Căutarea Google și nu este un semnal de clasare. Controlează doar folosirea conținutului parcurs pentru antrenarea viitoarelor modele Gemini și pentru fundamentare.
Ar trebui o afacere mică să blocheze crawlerele de antrenare AI?
Este decizia dumneavoastră. Blocarea crawlerelor de antrenare păstrează conținutul în afara antrenării viitoarelor modele și nu oprește crawlerele de căutare care permit asistenților să vă citeze, atât timp cât le permiteți separat pe acestea.
De ce firewallul meu blochează crawlerele AI deși robots.txt le permite?
robots.txt doar enunță politica dumneavoastră. Firewallurile, CDN-urile și instrumentele de protecție împotriva roboților pot bloca crawlerele indiferent de el. Dacă verificatorul arată accesul ca permis, dar asistenții tot nu vă pot citi site-ul, verificați setările de protecție împotriva roboților.
Vă recomandă ChatGPT afacerea?
Rulați verificarea gratuită a vizibilității în AI: 10 întrebări reale ale cumpărătorilor, ChatGPT și Perplexity, scorul dumneavoastră față de 3 concurenți. Fără înregistrare.
Citiți în continuare
- Cum să fiți recomandat de ChatGPT: listă de verificareListă practică pentru afaceri mici care vor vizibilitate în răspunsurile ChatGPT, Perplexity și Gemini: acces, claritate, dovezi și măsurare săptămânală.
- Cum aleg asistenții AI ce afaceri să recomandeCum găsesc ChatGPT, Perplexity, Gemini și Claude afaceri de recomandat: ce documentează motoarele, ce țin secret și ce puteți influența dumneavoastră.
- llms.txt: ce este și cum îl scrieți pentru site-ul dumneavoastrăllms.txt este un fișier markdown propus, care spune asistenților AI despre ce este site-ul dumneavoastră. Ce spune specificația, un exemplu și un ghid în șase pași.
- Ce este GEO? Optimizarea pentru motoare generative explicatăGEO (optimizare pentru motoare generative) este modul în care determinați ChatGPT, Perplexity și Gemini să vă menționeze afacerea. Ghid simplu și start în șase pași.