Игорь Градов
Игорь Градов
6 мин
text

Robots.txt не блокирует AI ботов: почему нужен серверный замок вместо таблички

Лид:

Robots.txt не блокирует AI ботов: почему нужен серверный замок вместо таблички

Владельцы сайтов всё чаще блокируют AI ботов через robots.txt, но этот файл работает как табличка «вход запрещён» у открытых ворот: боты подчиняются ему добровольно, и реальную защиту контента даёт только блокировка на уровне сервера.

Почему это важно

Robots.txt не останавливает ботов технически, он лишь просит их не заходить, и ни одна внешняя служба это не контролирует. Для тех, кто зарабатывает контентом, разница между «просьбой» и «замком» определяет, утечёт ли материал в обучающие данные ИИ-моделей.

Тема защиты сайтов от ИИ-краулеров (программ, которые автоматически обходят страницы и собирают текст) перешла из разряда технических тонкостей в повседневную задачу. Источник Search Engine Journal разобрал два принципиально разных подхода и их ограничения. Ниже факты, которые нужны, чтобы принять решение для своего сайта.

Что Когда Кто описал Цена
Сравнение двух способов блокировки AI ботов: robots.txt и серверный стек (CDN/WAF) Июнь 2025 Search Engine Journal Бесплатно (robots.txt); CDN/WAF зависит от провайдера

Два способа и принципиальная разница между ними

  • Robots.txt добавляет правило-запрет для конкретного бота. Например, строка User-agent: GPTBot и Disallow: / просит краулер OpenAI не заходить ни на одну страницу. Крупные компании официально заявляют, что их боты уважают этот файл: GPTBot и OAI-SearchBot (OpenAI), ClaudeBot и Claude-SearchBot (Anthropic), Google-Extended (Google), PerplexityBot (Perplexity).

  • Серверный стек перехватывает запрос бота до того, как тот получит контент. Это делается на уровне самого сервера, CDN (сеть доставки контента, промежуточный слой между посетителем и сервером) или WAF (файрвол веб-приложений, фильтр, который анализирует поведение запроса, а не только его заголовок).

Разница проста: robots.txt это «честное слово» компании-разработчика бота, серверный блок это замок, который не зависит от поведения бота.

Что даёт и чего не даёт robots.txt?

  • Главное преимущество: доступность. SEO-специалист или автор может отредактировать файл сам или попросить разработчика, правка занимает минуты.
  • Можно точечно закрыть отдельные разделы сайта. Например, запретить GPTBot доступ только к папке /products/, оставив остальные страницы открытыми.
  • Можно настроить правила для каждого бота отдельно.

Но есть три серьёзных ограничения:

  • Добровольность. Соблюдение robots.txt никем централизованно не проверяется. Бот технически может проигнорировать запрет, и сайт об этом даже не узнает.
  • Ручное обновление. Когда появляется новый AI-бот с новым именем, кто-то должен вручную добавить его в файл. Автоматически список не пополняется.
  • Риск ошибки. Если в CMS (система управления сайтом) случайно поставить правило User-agent: * / Disallow: /, закроется доступ для всех ботов, включая поисковые. Это может убить индексацию сайта за считанные дни.

Серверный блок: надёжнее, но сложнее

На уровне сервера, CDN или WAF блокировка работает иначе. Запрос бота перехватывается и отклоняется до того, как контент будет передан. Источник сравнивает это с замком на воротах вместо таблички.

Конкретный пример: Cloudflare предлагает готовые настройки блокировки с разделением ботов на категории: поисковый краулер, ИИ-агент (программа, действующая автономно) или бот для сбора обучающих данных. Настройка возможна и поштучно, для каждого бота отдельно.

WAF идёт ещё дальше. Он анализирует поведение запроса и способен обнаружить ботов, которые маскируются под обычных пользователей, подменяя свой идентификатор. Для сайтов, которые видят массовый приход AI-краулеров, логи WAF дают доказательную базу, в том числе для юридических разбирательств с владельцами ботов.

Минус серверного подхода: настройка требует разработчика или системного администратора. Изменения проходят через очередь задач, а не правятся за минуту в текстовом файле.

Что делать прямо сейчас, по ролям

  • Автор на Дзене или владелец блога. Если ваш сайт на собственном домене, проверьте файл robots.txt. Добавьте правила для GPTBot, ClaudeBot, PerplexityBot. Это не гарантия, но базовый сигнал «не трогайте». Если контент на платформе (Дзен, VC, Хабр), блокировку AI ботов через robots.txt контролирует сама платформа, повлиять можно только через обращение в поддержку.

  • Маркетолог или SEO-специалист. Уточните у хостинга или в настройках CDN, есть ли встроенные инструменты блокировки AI-краулеров. Cloudflare, один из популярных вариантов, но и российские CDN-провайдеры начинают добавлять похожие фильтры.

  • Предприниматель в РФ и СНГ. Если сайт приносит деньги контентом (статьи, каталоги, базы знаний), одного robots.txt мало. Поставьте задачу разработчику: настроить блокировку на уровне WAF или CDN. Это защитит и от «послушных» ботов, и от тех, кто маскируется.

Как попробовать

  1. Откройте файл robots.txt вашего сайта (обычно доступен по адресу вашсайт.ru/robots.txt) и добавьте правила Disallow: / для ботов GPTBot, ClaudeBot, PerplexityBot, Google-Extended.
  2. Проверьте, использует ли ваш хостинг или CDN готовые инструменты блокировки AI-ботов. У Cloudflare это раздел «Bot Management» в панели управления.
  3. Если на сайте есть WAF (Cloudflare WAF, AWS WAF или аналог), настройте правила фильтрации по user-agent и поведению запросов. Для этого, скорее всего, понадобится разработчик.

Сравнение с ситуацией для российских сайтов

В России популярны CDN и хостинги, которые не всегда предлагают встроенную фильтрацию AI-ботов «из коробки». Cloudflare доступен, но часть функций ограничена для российских аккаунтов. Российские CDN-провайдеры (например, DDoS-Guard, Selectel CDN) поддерживают базовую фильтрацию по user-agent, но готовых пресетов именно для AI-краулеров пока, по моим наблюдениям, не предлагают. Поэтому для российского сайта оптимальный путь: robots.txt как первый уровень плюс ручная настройка серверных правил или WAF.

Мнение редакции dzen.guru

Блокировка AI ботов через robots.txt это необходимый минимум, но не защита. Я бы сравнил это с замком на почтовом ящике: честного почтальона остановит, а того, кто решил вскрыть, нет. Если ваш контент кормит бизнес, не останавливайтесь на robots.txt. Настройте хотя бы CDN-фильтрацию. И обязательно проверяйте логи сервера: если видите подозрительные запросы от неизвестных user-agent, это повод разобраться. Сегодняшний шаг: откройте robots.txt вашего сайта и убедитесь, что там есть хотя бы правила для GPTBot и ClaudeBot. Займёт пять минут, а пользу принесёт сразу.

Частые вопросы

Достаточно ли одного robots.txt, чтобы защитить контент от ИИ?

Нет. Robots.txt это набор просьб, а не технический барьер. Крупные компании (OpenAI, Anthropic, Google) заявляют, что их боты уважают эти правила, но никто не контролирует исполнение централизованно. Боты, которые маскируются под обычных посетителей, файл проигнорируют. Для надёжной защиты нужна блокировка на уровне сервера, CDN или WAF.

Что произойдёт, если случайно заблокировать всех ботов?

Если в robots.txt появится правило User-agent: * с Disallow: /, поисковые роботы Google и Яндекса тоже перестанут индексировать сайт. Страницы начнут исчезать из поисковой выдачи. Поэтому правила нужно прописывать для каждого AI-бота отдельно, по имени, и не использовать универсальный запрет без крайней необходимости.

Нужно ли обновлять список ботов вручную?

Да. Robots.txt не обновляется автоматически при появлении нового AI-краулера. Каждый раз, когда компания выпускает нового бота с новым именем, владелец сайта должен добавить соответствующее правило вручную. Это ещё один аргумент в пользу серверной блокировки: WAF может фильтровать ботов по поведению, а не только по имени.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

text

Google Gemini 3.8 Flash вошла в AI Mode в день релиза: три смены модели за шесть недель

Google Gemini 3.8 Flash появилась в меню AI Mode в тот же день, когда Google выпустила саму модель, и это впервые, когда поиск получает новую версию…

5 мин
ИИ и конкуренция: почему нейросеть описывает чужой бизнес вместо вашего
text

ИИ и конкуренция: почему нейросеть описывает чужой бизнес вместо вашего

Когда нейросеть не знает вашу компанию, она не молчит и не предупреждает, а уверенно подставляет данные конкурента, средние показатели по отрасли или…

6 мин
Спрос на AI контент фильтрацию вырос на 87%: доводка черновика стоит как работа с нуля
text

Спрос на AI контент фильтрацию вырос на 87%: доводка черновика стоит как работа с нуля

Спрос на «починку» за ИИ вырос на 87% за год: фрилансеры берут за переделку столько же, сколько за работу с нуля, а заказчики к этому не готовы. Почему это…

5 мин