ШІ-роботи: GPTBot, OAI-SearchBot, PerplexityBot — що це
Компанії ШІ мають окремих роботів для ШІ-пошуку, для запитів користувачів і для навчання моделей, і в robots.txt з кожним можна поводитися по-різному. Дозвольте пошукових роботів, якщо хочете, щоб асистенти вас цитували; блокування роботів для навчання — цілком законний вибір.
ШІ-роботи — це веброботи, якими керують компанії ШІ; кожен вказує власну назву (user agent), тож власники сайтів можуть дозволити чи заблокувати його окремо в robots.txt.
- Пошукові роботи (OAI-SearchBot, PerplexityBot, Claude-SearchBot) визначають, чи можуть асистенти вас цитувати.
- Роботи для навчання (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) визначають, чи можна використовувати ваш контент для навчання моделей.
- Роботи, що діють на запит користувача (ChatGPT-User, Perplexity-User, Claude-User), відвідують сторінку, бо про це попросила людина, і можуть не дотримуватися robots.txt.
- Блокування всього одним правилом блокує й роботів, які приносять вам рекомендації.
Які ШІ-роботи існують і для чого кожен?
| Робот | Оператор | Призначення (за документацією) | robots.txt |
|---|---|---|---|
| OAI-SearchBot | OpenAI | Показує сайти в пошукових функціях ChatGPT | Керує ним; зміни можуть тривати близько 24 годин |
| GPTBot | OpenAI | Обходить контент, який може використовуватися для навчання | Керує ним |
| ChatGPT-User | OpenAI | Відвідує сторінку, коли користувач ставить запитання ChatGPT або власному GPT | Може не застосовуватися, бо ініціює його користувач |
| PerplexityBot | Perplexity | Показує сайти в пошуку Perplexity і дає на них посилання; не використовується для навчання фундаментальних моделей | Дотримується його |
| Perplexity-User | Perplexity | Підтримує запити користувачів усередині Perplexity | Зазвичай ігнорує його, бо просила людина |
| ClaudeBot | Anthropic | Збирає контент, який може сприяти навчанню моделей | Дотримується його |
| Claude-SearchBot | Anthropic | Покращує якість результатів пошуку | Дотримується його |
| Claude-User | Anthropic | Підтримує запити, ініційовані користувачами | Anthropic пише, що її боти дотримуються директив robots.txt |
| Google-Extended | Токен, що керує використанням для навчання Gemini і для grounding; окремого user agent немає | Токен robots.txt; на Пошук не впливає | |
| Applebot-Extended | Apple | Керує тим, чи навчаються моделі Apple на даних, зібраних Applebot; сам не обходить сайти | Токен robots.txt |
| CCBot | Common Crawl | Збирає набір даних Common Crawl | Дотримується його |
Джерела: OpenAI, Perplexity, Anthropic, Google, Apple і Common Crawl. Назви та поведінка змінюються, тож перед тим, як покладатися на якусь деталь, перевірте сторінку вендора.
Чи дозволяти, чи блокувати ШІ-роботів?
Усе залежить від того, чого ви хочете:
- Ви хочете, щоб асистенти вас рекомендували: дозвольте пошукових роботів (OAI-SearchBot, PerplexityBot, Claude-SearchBot) і переконайтеся, що Googlebot може індексувати ваші сторінки, бо Google пише, що AI Overviews і AI Mode потребують сторінки, яка проіндексована і має право показуватися зі сніпетом (Google).
- Ви не хочете, щоб ваш контент використовували для навчання: забороніть GPTBot, ClaudeBot, Google-Extended, Applebot-Extended і CCBot. OpenAI пише, що заборона GPTBot «означає, що контент сайту не слід використовувати для навчання», а Apple пише, що сторінки, які забороняють Applebot-Extended, усе одно можуть з'являтися в її результатах пошуку.
- Те й інше: дозвольте пошукових роботів і заблокуйте тих, що навчаються. Ці дві групи незалежні.
Як виглядає розумний robots.txt?
Цей приклад пускає пошукових роботів, блокує роботів для навчання і залишає приватні шляхи приватними. Підлаштуйте шляхи під свій сайт:
User-agent: *
Disallow: /admin/
User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /
User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /Зверніть увагу: робот зі своєю групою дотримується лише цієї групи, тож скопіюйте до груп, що дозволяють доступ, будь-які правила для приватних шляхів, які ви хочете зберегти (наприклад, Disallow: /admin/).
Чому правило robots.txt не завжди зупиняє візит?
Роботи, що діють на запит користувача, діють від імені людини. OpenAI пише, що правила robots.txt «можуть не застосовуватися» до ChatGPT-User, а Perplexity пише, що Perplexity-User зазвичай їх ігнорує. Якщо такі візити потрібно повністю не пускати, використовуйте файрвол або автентифікацію, а не robots.txt. Anthropic також зазначає, що блокування за IP-адресою може ненадійно зупиняти обхід, і публікує список IP для перевірки своїх ботів.
Як перевірити, що ваш сайт дозволяє сьогодні?
- Запустіть Перевірку ШІ-роботів зі своїм доменом. Вона показує вердикт для кожного робота і точний рядок robots.txt, що його визначає.
- Якщо пошукового робота заблоковано, скопіюйте виправлений robots.txt, який вона генерує і який зберігає ваші приватні шляхи забороненими.
- Завантажте файл у корінь сайту й перевірте знову приблизно за добу; OpenAI пише, що OAI-SearchBot може підлаштовуватися близько 24 годин.
- Додайте llms.txt, щоб роботи, які можуть читати ваш сайт, швидко знаходили ключові сторінки.
- Запустіть Аудит готовності до ШІ для решти технічних основ, а потім безкоштовну перевірку видимості в ШІ, щоб побачити, чи називають вас асистенти на вашому ринку.
Поширені запитання
Чим відрізняються GPTBot і OAI-SearchBot?
OAI-SearchBot показує сайти в пошукових функціях ChatGPT, тож його блокування прибирає вас із цих результатів. GPTBot обходить контент, який може використовуватися для навчання моделей OpenAI; його блокування не прибирає вас із пошуку ChatGPT.
Чи зашкодить блокування Google-Extended моїм позиціям у Google?
Ні. Google пише, що Google-Extended не впливає на включення сайту в Google Пошук і не є сигналом ранжування. Він лише керує використанням зібраного контенту для навчання майбутніх моделей Gemini та для grounding.
Чи варто малому бізнесу блокувати ШІ-роботів для навчання?
Це ваше рішення. Блокування роботів для навчання тримає ваш контент поза майбутнім навчанням моделей і не зупиняє пошукових роботів, завдяки яким асистенти вас цитують, якщо ви дозволяєте їх окремо.
Чому мій файрвол блокує ШІ-роботів, хоча robots.txt їх дозволяє?
robots.txt лише викладає вашу політику. Файрволи, CDN і засоби захисту від ботів можуть блокувати роботів незалежно від нього. Якщо перевірка показує, що доступ дозволено, а асистенти все одно не можуть прочитати ваш сайт, перевірте налаштування захисту від ботів.
Чи радить ChatGPT ваш бізнес?
Запустіть безкоштовну перевірку видимості в ШІ: 10 реальних запитань покупців, ChatGPT і Perplexity, ваш бал порівняно з 3 конкурентами. Без реєстрації.
Читайте далі
- Як зробити, щоб ChatGPT рекомендував ваш бізнес: чеклістПрактичний чекліст для малого бізнесу, щоб потрапити у відповіді ChatGPT, Perplexity і Gemini: доступ, ясність, підтвердження і щотижневе вимірювання.
- Як ШІ-асистенти обирають, які бізнеси рекомендуватиЯк ChatGPT, Perplexity, Gemini і Claude знаходять бізнеси для рекомендацій: що системи документують, що тримають у таємниці та на що ви можете вплинути.
- llms.txt: що це і як створити його для свого сайтуllms.txt — це запропонований простий markdown-файл, що пояснює ШІ-асистентам, про що ваш сайт. Що каже специфікація, готовий приклад і шість кроків.
- Що таке GEO? Оптимізація для відповідей ШІ простими словамиGEO (Generative Engine Optimization) — це робота над тим, щоб ChatGPT, Perplexity і Gemini називали ваш бізнес. Пояснення простими словами та старт за шість кроків.