Recomindo

ШІ-роботи: GPTBot, OAI-SearchBot, PerplexityBot — що це

Автор: [FILL IN: author name], [FILL IN: author role]4 хв читання

Компанії ШІ мають окремих роботів для ШІ-пошуку, для запитів користувачів і для навчання моделей, і в robots.txt з кожним можна поводитися по-різному. Дозвольте пошукових роботів, якщо хочете, щоб асистенти вас цитували; блокування роботів для навчання — цілком законний вибір.

ШІ-роботи — це веброботи, якими керують компанії ШІ; кожен вказує власну назву (user agent), тож власники сайтів можуть дозволити чи заблокувати його окремо в robots.txt.
  • Пошукові роботи (OAI-SearchBot, PerplexityBot, Claude-SearchBot) визначають, чи можуть асистенти вас цитувати.
  • Роботи для навчання (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot) визначають, чи можна використовувати ваш контент для навчання моделей.
  • Роботи, що діють на запит користувача (ChatGPT-User, Perplexity-User, Claude-User), відвідують сторінку, бо про це попросила людина, і можуть не дотримуватися robots.txt.
  • Блокування всього одним правилом блокує й роботів, які приносять вам рекомендації.

Які ШІ-роботи існують і для чого кожен?

РоботОператорПризначення (за документацією)robots.txt
OAI-SearchBotOpenAIПоказує сайти в пошукових функціях ChatGPTКерує ним; зміни можуть тривати близько 24 годин
GPTBotOpenAIОбходить контент, який може використовуватися для навчанняКерує ним
ChatGPT-UserOpenAIВідвідує сторінку, коли користувач ставить запитання ChatGPT або власному GPTМоже не застосовуватися, бо ініціює його користувач
PerplexityBotPerplexityПоказує сайти в пошуку Perplexity і дає на них посилання; не використовується для навчання фундаментальних моделейДотримується його
Perplexity-UserPerplexityПідтримує запити користувачів усередині PerplexityЗазвичай ігнорує його, бо просила людина
ClaudeBotAnthropicЗбирає контент, який може сприяти навчанню моделейДотримується його
Claude-SearchBotAnthropicПокращує якість результатів пошукуДотримується його
Claude-UserAnthropicПідтримує запити, ініційовані користувачамиAnthropic пише, що її боти дотримуються директив robots.txt
Google-ExtendedGoogleТокен, що керує використанням для навчання Gemini і для grounding; окремого user agent немаєТокен robots.txt; на Пошук не впливає
Applebot-ExtendedAppleКерує тим, чи навчаються моделі Apple на даних, зібраних Applebot; сам не обходить сайтиТокен robots.txt
CCBotCommon CrawlЗбирає набір даних Common CrawlДотримується його

Джерела: OpenAI, Perplexity, Anthropic, Google, Apple і Common Crawl. Назви та поведінка змінюються, тож перед тим, як покладатися на якусь деталь, перевірте сторінку вендора.

Чи дозволяти, чи блокувати ШІ-роботів?

Усе залежить від того, чого ви хочете:

  • Ви хочете, щоб асистенти вас рекомендували: дозвольте пошукових роботів (OAI-SearchBot, PerplexityBot, Claude-SearchBot) і переконайтеся, що Googlebot може індексувати ваші сторінки, бо Google пише, що AI Overviews і AI Mode потребують сторінки, яка проіндексована і має право показуватися зі сніпетом (Google).
  • Ви не хочете, щоб ваш контент використовували для навчання: забороніть GPTBot, ClaudeBot, Google-Extended, Applebot-Extended і CCBot. OpenAI пише, що заборона GPTBot «означає, що контент сайту не слід використовувати для навчання», а Apple пише, що сторінки, які забороняють Applebot-Extended, усе одно можуть з'являтися в її результатах пошуку.
  • Те й інше: дозвольте пошукових роботів і заблокуйте тих, що навчаються. Ці дві групи незалежні.

Як виглядає розумний robots.txt?

Цей приклад пускає пошукових роботів, блокує роботів для навчання і залишає приватні шляхи приватними. Підлаштуйте шляхи під свій сайт:

User-agent: *
Disallow: /admin/

User-agent: OAI-SearchBot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
Allow: /

User-agent: GPTBot
User-agent: ClaudeBot
User-agent: Google-Extended
User-agent: Applebot-Extended
User-agent: CCBot
Disallow: /

Зверніть увагу: робот зі своєю групою дотримується лише цієї групи, тож скопіюйте до груп, що дозволяють доступ, будь-які правила для приватних шляхів, які ви хочете зберегти (наприклад, Disallow: /admin/).

Чому правило robots.txt не завжди зупиняє візит?

Роботи, що діють на запит користувача, діють від імені людини. OpenAI пише, що правила robots.txt «можуть не застосовуватися» до ChatGPT-User, а Perplexity пише, що Perplexity-User зазвичай їх ігнорує. Якщо такі візити потрібно повністю не пускати, використовуйте файрвол або автентифікацію, а не robots.txt. Anthropic також зазначає, що блокування за IP-адресою може ненадійно зупиняти обхід, і публікує список IP для перевірки своїх ботів.

Як перевірити, що ваш сайт дозволяє сьогодні?

  1. Запустіть Перевірку ШІ-роботів зі своїм доменом. Вона показує вердикт для кожного робота і точний рядок robots.txt, що його визначає.
  2. Якщо пошукового робота заблоковано, скопіюйте виправлений robots.txt, який вона генерує і який зберігає ваші приватні шляхи забороненими.
  3. Завантажте файл у корінь сайту й перевірте знову приблизно за добу; OpenAI пише, що OAI-SearchBot може підлаштовуватися близько 24 годин.
  4. Додайте llms.txt, щоб роботи, які можуть читати ваш сайт, швидко знаходили ключові сторінки.
  5. Запустіть Аудит готовності до ШІ для решти технічних основ, а потім безкоштовну перевірку видимості в ШІ, щоб побачити, чи називають вас асистенти на вашому ринку.

Поширені запитання

Чим відрізняються GPTBot і OAI-SearchBot?

OAI-SearchBot показує сайти в пошукових функціях ChatGPT, тож його блокування прибирає вас із цих результатів. GPTBot обходить контент, який може використовуватися для навчання моделей OpenAI; його блокування не прибирає вас із пошуку ChatGPT.

Чи зашкодить блокування Google-Extended моїм позиціям у Google?

Ні. Google пише, що Google-Extended не впливає на включення сайту в Google Пошук і не є сигналом ранжування. Він лише керує використанням зібраного контенту для навчання майбутніх моделей Gemini та для grounding.

Чи варто малому бізнесу блокувати ШІ-роботів для навчання?

Це ваше рішення. Блокування роботів для навчання тримає ваш контент поза майбутнім навчанням моделей і не зупиняє пошукових роботів, завдяки яким асистенти вас цитують, якщо ви дозволяєте їх окремо.

Чому мій файрвол блокує ШІ-роботів, хоча robots.txt їх дозволяє?

robots.txt лише викладає вашу політику. Файрволи, CDN і засоби захисту від ботів можуть блокувати роботів незалежно від нього. Якщо перевірка показує, що доступ дозволено, а асистенти все одно не можуть прочитати ваш сайт, перевірте налаштування захисту від ботів.

Чи радить ChatGPT ваш бізнес?

Запустіть безкоштовну перевірку видимості в ШІ: 10 реальних запитань покупців, ChatGPT і Perplexity, ваш бал порівняно з 3 конкурентами. Без реєстрації.

Усі посібники →