Игорь Градов
Игорь Градов
5 мин
text

ChatGPT игнорирует robots.txt на половине сайтов: Cloudflare начнёт блокировать ботов на сетевом уровне

ChatGPT собирает данные с сайтов, которые прямо запретили к нему доступ, и делает это чаще любого другого ИИ-бота, а Cloudflare с 15 сентября 2026 года начнёт блокировать таких сборщиков на сетевом уровне.

ChatGPT игнорирует robots.txt на половине сайтов: Cloudflare начнёт блокировать ботов на сетевом уровне
Почему это важно

Файл robots.txt (текстовый файл, в котором владелец сайта указывает, каким ботам можно заходить, а каким нет) перестал быть надёжной защитой: OpenAI считает, что запрет не распространяется на запросы, инициированные живым пользователем ChatGPT.

Отчёт TollBit State of the Bots за первое полугодие 2026 года впервые показал масштаб проблемы в цифрах. Бот ChatGPT-User обошёл запреты на большем числе сайтов, чем любой другой ИИ-агент (программа, которая сама ходит по сайтам и забирает содержимое). Данные касаются европейских сайтов, но затрагивают всех, кто публикует контент в открытом вебе.

Что Когда Кто выпустил отчёт Цена
Отчёт о поведении ИИ-ботов на сайтах Первое полугодие 2026 TollBit Бесплатно (публичный отчёт)

Какие боты нарушают запреты и насколько?

  • Около 15% ИИ-ботов на европейских сайтах заходили на страницы, которые владельцы явно пометили как запрещённые, по данным TollBit.
  • ChatGPT-User, Bytespider и Youbot заходили на запрещённые страницы почти на половине европейских сайтов, где эти боты были прямо перечислены в robots.txt. ChatGPT-User среди них лидирует по охвату.
  • Новые боты почти не блокируются. Claude-User (бот Anthropic) заблокирован только на 9% европейских сайтов, Perplexity-User на 13%. В Северной Америке цифры выше: 26% для каждого.
  • ChatGPT-User остаётся исключением: его блокируют заметно чаще остальных, но он всё равно проходит.

Почему OpenAI считает, что robots.txt на неё не распространяется?

В документации OpenAI сказано: ChatGPT-User заходит на страницу, когда живой пользователь ChatGPT задаёт вопрос. Поскольку действие инициировано человеком, правила robots.txt, по мнению компании, могут не применяться.

Perplexity придерживается той же логики для своего бота Perplexity-User. Anthropic заняла противоположную позицию и заявила, что все три её бота соблюдают robots.txt, о чём TollBit сообщал ещё в феврале 2026 года.

TollBit при этом считает любой заход на запрещённую страницу нарушением, независимо от того, что заявляет оператор бота.

Ловушка для владельцев сайтов: блокировка без выгоды

Здесь важен нюанс, который легко упустить. Бот, отвечающий за попадание сайта в поисковую выдачу ChatGPT, называется OAI-SearchBot, а не ChatGPT-User. Это два разных агента.

Если владелец сайта заблокировал оба бота, он потерял видимость в поиске ChatGPT, но при этом не получил реальной защиты от сбора данных: ChatGPT-User всё равно может зайти, сославшись на запрос пользователя. Файл robots.txt показывает, что вы попросили. Серверные логи или записи CDN (сети доставки контента, через которую проходит трафик сайта) показывают, что реально произошло.

Cloudflare переносит защиту на уровень сети

Cloudflare готовит обновление: с 15 сентября 2026 года новые домены, подключённые к сервису, будут по умолчанию блокировать ботов категорий Training (обучающие данные) и Agent (агентный доступ) на страницах с рекламой. Поисковые боты (Search) при этом останутся разрешёнными.

Решение переносится на сетевой уровень: соблюдение правил перестаёт зависеть от доброй воли самого бота. Для тех ботов, которые Cloudflare распознаёт, файл robots.txt становится не просьбой, а командой, исполняемой инфраструктурой.

Как проверить, заходят ли боты на ваш сайт?

  1. Откройте серверные логи или панель CDN (Cloudflare, если пользуетесь) и найдите запросы от агентов ChatGPT-User, Bytespider, Youbot, Perplexity-User.
  2. Сверьте адреса, на которые они заходили, со списком запрещённых страниц в вашем файле robots.txt.
  3. Если вы на Cloudflare, проверьте раздел управления ботами: после 15 сентября 2026 года для новых доменов блокировка обучающих и агентных ботов включится автоматически, но для существующих доменов может потребоваться ручная настройка.

Как это выглядит в России?

В РФ ситуация проще и сложнее одновременно. YandexGPT и GigaChat работают преимущественно с данными, к которым у «Яндекса» и «Сбера» есть доступ через собственные экосистемы. Открытых отчётов о том, как именно их боты обрабатывают robots.txt сторонних сайтов, на момент публикации нет. Но если вы ведёте сайт, доступный из-за рубежа, ваш контент уже сейчас может собираться ChatGPT-User без вашего ведома, независимо от того, что написано в robots.txt.

Мнение редакции dzen.guru

OpenAI фактически превратила robots.txt из работающего механизма в декларацию о намерениях. Аргумент «это не бот ходит, это пользователь попросил» юридически не проверен ни в одном суде, но технически уже работает в промышленном масштабе.

Для авторов Дзена и владельцев сайтов это конкретный сигнал: если вы публикуете экспертный контент на своём сайте, одного robots.txt недостаточно. Проверьте логи, посмотрите, кто реально заходит. Если вы на Cloudflare, дождитесь сентябрьского обновления или настройте блокировку вручную уже сейчас.

Оговорка: данные TollBit касаются европейских сайтов. Для рунета аналогичного публичного исследования пока нет, поэтому масштаб нарушений в зоне .ru остаётся неизвестным.

Частые вопросы

Файл robots.txt больше не работает?

Он работает как просьба, но не как замок. Боты, которые решили его соблюдать (например, боты Anthropic), действительно не заходят на запрещённые страницы. Но ChatGPT-User и ряд других ботов трактуют запрос пользователя как основание обойти запрет. Реальную блокировку даёт только сетевой уровень: CDN, файрвол или сервис вроде Cloudflare.

Если я заблокирую ChatGPT-User, мой сайт исчезнет из поиска ChatGPT?

Нет. За индексацию в поиске ChatGPT отвечает другой бот, OAI-SearchBot. Блокировка ChatGPT-User не влияет на поисковую видимость. Но если вы заблокируете оба бота, вы потеряете видимость и не получите гарантированной защиты от сбора данных.

Что делать автору Дзена, у которого нет своего сайта?

Если весь ваш контент опубликован только на Дзене, robots.txt вашего личного сайта вас не касается: правила доступа к страницам Дзена устанавливает «Яндекс». Но если вы ведёте параллельный блог или лендинг, проверьте логи и настройте защиту там.

Главный открытый вопрос: выживет ли лазейка «пользователь попросил, значит, это не краулинг». Сейчас все крупные ИИ-ассистенты забирают страницы именно так, и Cloudflare первым переводит ответ из области этикета в область инфраструктуры.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

SEO для B2B теряет смысл без AI-обзоров: как попасть в 3% видимых брендов
text

SEO для B2B теряет смысл без AI-обзоров: как попасть в 3% видимых брендов

Статья, которую вы просите, не является новостью о конкретном событии, а представляет собой how-to гайд по SEO для B2B. Я напишу её по заданному плану,…

6 мин
Машинный трафик ИИ уже в 5 раз больше человеческого: под краулерами прячутся сканеры паролей
text

Машинный трафик ИИ уже в 5 раз больше человеческого: под краулерами прячутся сканеры паролей

Машинный трафик уже в пять раз обогнал человеческий на серверах Cloudflare, и финансовый директор компании заявил аналитикам, что через пять лет машины будут…

5 мин
ИИ-поиск обнажил технический долг сайтов: Google прощал, а новые системы нет
text

ИИ-поиск обнажил технический долг сайтов: Google прощал, а новые системы нет

Google has long been able to compensate for messy site architecture, but AI retrieval systems work differently, pulling specific passages rather than ranking…

5 мин