Cloudflare синхронизирует robots.txt с реальной блокировкой ботов: ручная правка больше не нужна
Cloudflare 21 августа анонсировала Bot Preference Sync, инструмент, который автоматически генерирует файл robots.txt на основе настроек блокировки ботов в панели управления, устраняя разрыв между тем, что сайт декларирует, и тем, что он реально блокирует.

Файл robots.txt и реальные правила блокировки на сервере живут в разных местах, и рассинхрон между ними даёт ИИ-краулерам (программам, которые обходят сайты и собирают данные для обучения моделей) аргумент игнорировать ваши ограничения. Cloudflare впервые связала эти два слоя в один автоматический механизм.
Автор оригинального разбора, Саймон Уиллисон, обнаружил проблему на собственном сайте: его robots.txt месяцами приглашал краулер Bytespider (бот TikTok), хотя автор давно хотел его заблокировать, и заметил это, только когда писал статью о расхождениях между файлом и реальной защитой. На следующий день Cloudflare анонсировала продукт, который решает именно эту задачу. По состоянию на 13 сентября инструмент ещё не появился в документации Cloudflare и не активировался на сайтах, то есть речь идёт о продукте в статусе анонса.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Bot Preference Sync, автогенерация robots.txt из настроек панели | Анонс 21 августа, на 13 сентября не активирован | Cloudflare | Бесплатно, доступно начиная с бесплатного тарифа |
Как работает синхронизация robots.txt?
-
Автогенерация файла. Bot Preference Sync берёт настройки бот-политик из панели Cloudflare и записывает их в начало вашего robots.txt между маркерами
# BEGIN Cloudflare Bot Preference Syncи# END Cloudflare Bot Preference Sync. Ваш существующий контент сохраняется ниже. -
Три категории вместо отдельных ботов. Политики задаются по трём категориям: Search (поисковые), Agent (ИИ-агенты, программы, действующие от лица пользователя), Training (обучение моделей). Для каждой доступны варианты: заблокировать на всех страницах, заблокировать только на страницах с рекламой или разрешить.
-
Нельзя исключить конкретного бота. Какой краулер попадает в какую категорию, решает Cloudflare по своему внутреннему списку. Если вам нужна точечная настройка, единственный выход, отключить синхронизацию и вести robots.txt вручную.
-
Включён по умолчанию для новых клиентов. Cloudflare прямо заявила: для новых пользователей Bot Preference Sync будет активен без дополнительных действий.
Где теряется гибкость?
Автор исходного разбора показал конкретный сценарий: он разрешает краулерам OpenAI (GPTBot), Anthropic и Perplexity, но блокирует Bytespider и Meta. Все пять компаний обучают модели, однако решение принимается не по категории, а по логике «что я получаю взамен». Первые три показывают его контент пользователям ИИ-ассистентов, остальные только забирают данные.
В Bot Preference Sync такой сценарий не выражается. Если поставить Training в «запретить», файл заблокирует и OpenAI. Если поставить «разрешить», ничего не отделит Meta от остальных, хотя реальная защита на сервере возвращает им ошибку 403. Настройки по категориям не покрывают политику «бот за ботом».
Четыре условия Cloudflare для краулеров
Cloudflare опубликовала список требований к ИИ-краулерам. Бот, который одновременно ищет и обучает модели, должен соответствовать всем четырём условиям, иначе Cloudflare считает его «непрозрачным» и блокирует на всех сайтах, выбравших запрет обучения:
- Бот обязан уважать пометку «не обучать» в robots.txt.
- Владельцу сайта должна быть доступна возможность отказаться от ИИ-выжимок (например, AI Overviews в Google).
- Бот должен показывать, какие именно страницы использовались для обучения, и давать статистику по поисковым результатам.
- Компания должна публично доказать, что запрет обучения не ухудшает позиции сайта в обычной поисковой выдаче.
Ни одна компания не названа по имени в этих условиях. Автор разбора отмечает, что условия два и четыре описывают Google, причём четвёртое Google уже выполняет (документация от 14 июля 2026 года подтверждает, что Google-Extended не влияет на ранжирование), а второе пока нет: механизма отказа от AI-выжимок Google не предложил.
Как попробовать?
- Убедитесь, что ваш сайт работает через Cloudflare (подойдёт даже бесплатный тариф).
- Зайдите в раздел Security Settings, затем Configure AI bot policies.
- Выберите нужные режимы для категорий Search, Agent и Training.
- Проверьте, появился ли сгенерированный блок в вашем robots.txt между маркерами Cloudflare. На момент публикации (13 сентября) инструмент ещё не активирован, поэтому блок может не появиться.
Есть ли аналог для сайтов на российском хостинге?
Прямого аналога Bot Preference Sync в российских сервисах пока нет. Яндекс.Вебмастер позволяет управлять индексацией поисковым ботом Яндекса, но не генерирует robots.txt автоматически из единого интерфейса и не привязывает файл к реальной блокировке на уровне сервера. Если ваш сайт не за Cloudflare, robots.txt по-прежнему нужно редактировать вручную и следить, чтобы он совпадал с настройками .htaccess или nginx.
Что это значит для вас, по ролям?
Автору на Дзене. Дзен сам управляет robots.txt платформы, автор не может его менять. Но если у вас есть личный сайт или блог на WordPress за Cloudflare, Bot Preference Sync избавит от ручной правки файла. Главное: проверьте, не блокирует ли категория Training тех краулеров, которых вы хотите пускать.
Маркетологу. Разрыв между robots.txt и реальной блокировкой, это не теоретическая проблема. Cloudflare прямо заявляет, что некоторые краулеры используют такое расхождение как повод игнорировать запреты. Автоматическая синхронизация закрывает эту дыру, но убирает точечное управление.
Предпринимателю в РФ. Если ваш сайт за Cloudflare, инструмент будет доступен бесплатно. Если нет, следите за тем, появятся ли аналоги у российских CDN и хостингов. Пока единственный надёжный способ, ручная проверка robots.txt раз в месяц.
Bot Preference Sync решает реальную боль: я сам ловил ситуации, когда robots.txt на сайте жил отдельной жизнью от настроек сервера. Автоматизация этого процесса давно назрела.
Но подход «три категории, и точка» слишком грубый для любого, кто принимает решения по каждому боту отдельно. Автор оригинального разбора показал это на своём примере, и у меня похожая логика: OpenAI пускаю, Meta нет, а в Cloudflare этот сценарий не укладывается.
Второй момент: включение по умолчанию для новых клиентов означает, что Cloudflare фактически решает за владельца сайта, что писать в robots.txt. Для тех, кто не следит за настройками, это скорее плюс. Для тех, кто хочет контроль, повод зайти в панель и убедиться, что политика совпадает с вашими намерениями.
Что сделать сегодня: откройте robots.txt своего сайта прямо сейчас и сравните его с тем, что реально блокируется на сервере. Если есть расхождения, исправьте вручную, не дожидаясь автоматизации.
Частые вопросы
Мой сайт не на Cloudflare. Могу ли я использовать Bot Preference Sync?
Нет. Инструмент работает только для сайтов, которые используют Cloudflare как CDN (сеть доставки контента, промежуточный сервер между вашим сайтом и посетителями). Если ваш сайт на другом хостинге без Cloudflare, robots.txt нужно вести вручную.
Удалит ли Bot Preference Sync мои текущие правила в robots.txt?
Нет. Сгенерированные правила вставляются в начало файла между специальными маркерами. Всё, что вы написали сами, сохраняется ниже. Но если ваши ручные правила противоречат сгенерированным, приоритет получат те, что стоят выше в файле, то есть правила Cloudflare.
Когда инструмент реально заработает?
На 13 сентября Bot Preference Sync не появился в документации Cloudflare, не зафиксирован в журнале изменений и не активирован на сайтах. Точную дату запуска Cloudflare не назвала.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Reddit AI поиск отсекает личный опыт: формальные комментарии попадают в ответы на 49% чаще
Reddit запустил AI поиск по популярным комментариям, и исследователи из Университета Иллинойса в Урбана-Шампейн проверили, какие комментарии он на самом деле…

Google назвал canonical теги SEO ненадёжными: Мюллер советует заменить их на 301 и noindex
Google удалила страницы из-за серверных ошибок, а не из-за canonical тегов, и Джон Мюллер из Google объяснил на Reddit, почему кросс-доменные canonical теги…
Google краулер Mediapartners теперь управляет не только AdSense: кому пора менять robots.txt
Google 12 июня 2025 года обновил документацию по краулеру (боту-сборщику, который автоматически обходит страницы сайтов) Mediapartners-Google, расширив его…
Комментарии