31 августа 2026

Зачем нужен robots.txt

Как robots.txt управляет доступом поисковых и обучающих ботов и почему для каждого агента нужны отдельные правила.

Сначала определите, какого бота настраиваете

Одна AI-компания может использовать несколько автоматических агентов для разных задач. Разрешение для одного агента не распространяется на остальных.

OpenAI разделяет их так:

  • OAI-SearchBot — добавляет сайты в поисковые результаты ChatGPT
  • GPTBot — собирает материалы, которые могут использоваться для обучения моделей
  • ChatGPT-User — открывает страницу по действию пользователя; правила robots.txt для таких запросов могут не применяться

Разрешение для GPTBot не открывает доступ для OAI-SearchBot. Владелец сайта должен задать правило для каждого нужного агента.

Perplexity тоже использует отдельных агентов для разных задач. PerplexityBot ищет страницы для результатов поиска. Perplexity-User открывает страницы по запросу человека.

Google использует Googlebot для поиска и его AI-функций. Google-Extended управляет использованием уже собранного контента для некоторых систем Gemini. По документации Google, настройка Google-Extended не влияет на попадание сайта в обычный поиск.

Как правило закрывает страницу

Запись ниже запрещает OAI-SearchBot обходить весь сайт:

User-agent: OAI-SearchBot
Disallow: /

Владелец сайта может закрыть отдельный раздел вместо всего сайта. Следующее правило запрещает OAI-SearchBot обходить страницы в каталоге /blog/:

User-agent: OAI-SearchBot
Disallow: /blog/

Правило для каталога /blog/ оставляет главную страницу доступной, но запрещает OAI-SearchBot обходить статьи.

Чтобы разрешить обход сайта, владелец может оставить Disallow пустым или добавить явный Allow:

User-agent: OAI-SearchBot
Allow: /

Проверьте также группу User-agent: *. Общее правило может затронуть агентов, для которых нет отдельной секции.

Почему разрешения в файле недостаточно

Файл robots.txt описывает правила обхода, но не управляет всеми системами защиты сайта.

WAF, CDN или защита от ботов могут вернуть ошибку 403, CAPTCHA или JavaScript-проверку. Поисковый агент получит страницу ошибки, хотя robots.txt разрешает обход.

После изменения файла проверьте:

  1. открывается ли сам robots.txt без авторизации
  2. получает ли агент нужную страницу
  3. возвращает ли сервер код 200
  4. нет ли блокировки по IP или User-Agent
  5. появился ли запрос в логах сервера

OpenAI и Perplexity публикуют диапазоны IP своих агентов. Сверяйте адрес и User-Agent вместе: строку User-Agent можно подделать.

Какие разделы обычно закрывают

Не каждый URL нужен поисковому или обучающему боту. Можно закрывать служебные страницы, результаты внутреннего поиска, черновики и параметры, которые создают дубли.

Проверка должна исключить случайную блокировку материалов, которые должны стать источниками:

  • страницы услуг
  • цены и условия
  • справочные статьи
  • сравнения
  • кейсы
  • ответы на частые вопросы

Проверяйте итоговое правило на конкретном URL. Одного просмотра файла robots.txt недостаточно.

Что robots.txt не решает

Разрешённая страница не получает цитату автоматически. Поисковый бот должен найти страницу по ссылке и получить полный текст. Затем AI-сервис решает, подходит ли эта страница для ответа пользователя.

robots.txt отвечает только за один этап: право автоматического агента зайти по адресу.

Если поисковый бот получает страницу, а AI-сервис не цитирует сайт, проверьте исходный HTML, внутренние ссылки и содержание страницы. Затем сравните материал с источниками, которые AI-сервис уже показывает в ответах.

Источники

Можно замерить видимость бренда в ChatGPT, Gemini и Perplexity.