Игорь Градов
Игорь Градов
7 мин
ai

Защита от ботов на сайте mbk guard: 214 загрузок ботами на каждую живую страницу

ил файрволла. Но приходится признать: Claude-SearchBot считал 420 680 страниц за неделю, а привёл 12 живых посетителей.

Защита от ботов на сайте mbk guard: 214 загрузок ботами на каждую живую страницу

Краулер Amazon Два дня назад я заметил, что краулер Amazon (Amazonbot) индексировал по 117 тысяч страниц в день и не направил мне ни одного посетителя. Я его заблокировал.

Ботнет из резидентских IP После блокировки Китая, Вьетнама и Сингапура атаки продолжились. Боты начали использовать резидентские IP (домашние адреса реальных пользователей в разных странах), каждый из которых делал по одному запросу. Такой трафик невозможно остановить простой блокировкой по стране или IP.

CAPTCHA Показатель решения CAPTCHA на сайте составил 0,24%. Боты даже не пытаются её решать. Managed Challenge от Cloudflare остановила 1,18 миллиона запросов за первые десять часов китайской волны, но часть ботов всё равно прошла.

Правила файрволла Автор перечисляет все используемые правила: блокировка SEO-краулеров (SemrushBot, AhrefsBot, MJ12bot, DataForSEOBot) сначала через robots.txt, затем на уровне Cloudflare; блокировка целых стран (Китай, Вьетнам, Сингапур) в edge-сети; мониторинг дэшборда ИИ-краулеров Cloudflare для отслеживания соотношения краулинга к реальным посетителям; применение Managed Challenge (невидимая CAPTCHA) Cloudflare.

Аналитика Для подсчёта живых посетителей автор использует Plausible Community Edition на собственном хостинге. Она считает только тех, у кого выполняется JavaScript. У ботов его почти никогда нет. Если смотреть только на JavaScript-аналитику (Plausible, Fathom, Google Analytics), реальный масштаб бот-трафика остаётся невидимым.

Источник: PatronView blog Ссылка: не указана в оригинале


Ниже — готовая новость.


Разработчик базы данных PatronView целый год вёл борьбу с ботами и 22 апреля 2025 года зафиксировал пиковый удар: 3,6 миллиона запросов за сутки с 361 844 уникальных китайских IP-адресов, при том что реальная аудитория сайта составляет около 500 живых посетителей в день.

Почему это важно

На каждую загрузку страницы человеком приходится 214 загрузок ботами, а доля живого трафика не дотягивает даже до половины процента. Это не теоретическая угроза, а измеренная реальность конкретного сайта с 1,5 миллиона страниц.

Автор PatronView, американской базы данных филантропов, опубликовал детальный разбор годового опыта защиты от ботов. Сайт построен с помощью Claude Code от Anthropic и защищён через Cloudflare. Публикация содержит конкретные цифры по каждому типу бот-трафика и полный список правил файрволла, которые автор применяет на практике.

Что Когда Кто опубликовал Цена
Разбор бот-трафика и правил файрволла PatronView Июнь 2025 года Разработчик PatronView Бесплатная публикация

Какие цифры стоят за бот-трафиком?

  • 3,6 миллиона запросов за один день поступили 22 апреля 2025 года с 361 844 уникальных IP-адресов, почти все из Китая.
  • 214 загрузок ботами на каждую загрузку человеком. За неделю публикации сервер отдал 1,28 миллиона страниц, а JavaScript-аналитика Plausible (инструмент подсчёта живых посетителей, который срабатывает, только если в браузере выполняется скрипт) зафиксировала 5 977 просмотров людьми.
  • Краулер (автоматический сборщик страниц) Anthropic Claude-SearchBot за одну неделю запросил 420 680 страниц и привёл 12 живых посетителей. Соотношение: 35 000 к 1. По данным Cloudflare, среднее по рынку для краулеров Anthropic составляет примерно 3 000 к 1.
  • Краулер Amazon (Amazonbot) индексировал по 117 тысяч страниц в день и не привёл ни одного посетителя. Автор заблокировал его.
  • CAPTCHA (тест, отсеивающий ботов от людей) решается в 0,24% случаев. Боты даже не пытаются проходить проверку.
  • Managed Challenge от Cloudflare (невидимая CAPTCHA) остановила 1,18 миллиона запросов за первые десять часов китайской волны, но часть ботов всё равно прошла.

Как автор выстроил защиту?

  1. Заблокировал SEO-краулеры (SemrushBot, AhrefsBot, MJ12bot, DataForSEOBot) сначала через файл robots.txt, затем правилами безопасности Cloudflare.
  2. Заблокировал целые страны в edge-сети Cloudflare: сначала Китай, затем Вьетнам и Сингапур, когда волна переместилась туда. Автор признаёт, что такой подход «не рекомендуется», но для англоязычного сайта с 95,9% трафика из США и 1,3% из Канады это оказалось оправдано.
  3. Применил Managed Challenge Cloudflare как основной фильтр для остального трафика.
  4. Отслеживает дэшборд ИИ-краулеров Cloudflare, чтобы видеть соотношение краулинга к реальным посетителям и блокировать ботов, которые не приносят трафик.

Проблема осталась нерешённой до конца. Как отметил один из комментаторов (Родриго Рокко): боты стали использовать резидентские IP (домашние адреса реальных пользователей), каждый из которых делает по одному запросу. Заблокировать такой трафик по IP или стране невозможно.

Почему JavaScript-аналитика не показывает правды?

Если владелец сайта пользуется только JavaScript-аналитикой (Plausible, Fathom, Google Analytics), он видит только живых посетителей с работающим скриптом. У ботов JavaScript почти никогда не выполняется. Разница между «500 посетителей в день» и «миллионы запросов в неделю» остаётся полностью невидимой.

Для авторов Дзена, маркетологов и владельцев сайтов это означает: метрики посещаемости в привычных панелях могут не отражать реальную нагрузку на сервер. А нагрузка стоит денег и замедляет сайт для живых людей.

Есть ли аналоги для защиты в России?

Cloudflare доступен и в России, но ряд владельцев сайтов ищут локальные решения. Для защиты от ботов на сайте можно рассмотреть сервис MBK Guard, ориентированный на русскоязычных разработчиков. Из крупных российских аналогов работают Qrator Labs и DDoS-Guard, которые фильтруют бот-трафик на сетевом уровне.

Прямого аналога дэшборда ИИ-краулеров, который есть у Cloudflare, российские сервисы пока не предлагают. Отслеживать ИИ-ботов придётся по логам сервера вручную или скриптами.

Что делать с этим прямо сейчас, по ролям

Автору Дзена и блогеру. Если у вас есть собственный сайт, проверьте серверные логи. JavaScript-счётчик не покажет ботов. Даже на маленьком сайте бот-трафик может превышать живой в сотни раз. Это расходует хостинг и может влиять на скорость загрузки.

Маркетологу. Цифры посещаемости, на которые вы опираетесь для отчётов, могут не включать 99% реальных обращений к серверу. Если клиент жалуется на медленный сайт или растущие счета за хостинг, причина может быть в ботах, а не в росте аудитории.

Разработчику и предпринимателю в РФ. Защита от ботов на сайте через MBK Guard или Cloudflare требует настройки правил, а не просто подключения. Блокировка по странам работает, только если ваша аудитория географически сконцентрирована. Для русскоязычного сайта с аудиторией из РФ и СНГ блокировка Китая и Юго-Восточной Азии может быть оправдана.

Мнение редакции dzen.guru

Этот разбор ценен не выводами (они очевидны: ботов много), а конкретными числами. 214 к 1, 35 000 к 1, 0,24% решений CAPTCHA. Такие метрики позволяют принимать решения, а не гадать.

По моим наблюдениям, большинство авторов и владельцев небольших сайтов в РФ вообще не заглядывают в серверные логи. Они видят Яндекс Метрику или Google Analytics и считают, что картина полная. Она не полная.

Оговорка: автор описывает сайт с 1,5 миллиона уникальных страниц, содержащих структурированные данные о финансах. Такой сайт привлекает ботов больше, чем обычный блог. Но масштаб проблемы касается всех: ИИ-краулеры (Claude-SearchBot, Amazonbot, GPTBot) обходят и маленькие сайты.

Что сделать сегодня: откройте серверные логи или панель хостинга, посмотрите на количество запросов за последнюю неделю. Сравните с цифрами из JavaScript-аналитики. Разница покажет, нужна ли вам защита от ботов на сайте.

Частые вопросы

Как узнать, сколько ботов приходит на мой сайт?

JavaScript-аналитика (Яндекс Метрика, Google Analytics, Plausible) показывает только живых посетителей. Чтобы увидеть ботов, нужно смотреть серверные логи или панель хостинга, где отображается общее количество HTTP-запросов. Разница между двумя цифрами и есть бот-трафик.

Поможет ли robots.txt остановить ботов?

Файл robots.txt, это просьба, а не приказ. Легитимные поисковые краулеры (Googlebot, YandexBot) его соблюдают. SEO-краулеры и ИИ-боты часто игнорируют. Автор PatronView начал с robots.txt, но был вынужден перейти к блокировке на уровне Cloudflare, потому что боты продолжали приходить.

Стоит ли блокировать ИИ-краулеры, если они приводят посетителей?

Зависит от соотношения. Если краулер читает 420 тысяч страниц и приводит 12 человек, как Claude-SearchBot в описанном случае, нагрузка на сервер несоразмерна пользе. Автор продолжает пользоваться Claude для разработки, но отслеживает каждый бот отдельно и блокирует тех, кто не приносит трафика вообще, как Amazonbot.

Проверяйте логи, считайте соотношение и блокируйте тех, кто берёт и не отдаёт. Это не паранойя, а гигиена для любого сайта с содержательным контентом.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься
ai

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься

Большие языковые модели (LLM, нейросети, которые генерируют текст и код по запросу) обучены отказывать на опасные вопросы, но злоумышленники научились обходить…

6 мин
Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API
ai

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API

Контекст — это не про IQ модели, а про безопасность данных: если код нельзя отправить наружу, выбор делается не между «лучшей» и «худшей» моделью, а между…

5 мин
ai

OpenAI впервые остановила новую модель: та научилась взламывать системы без человека

OpenAI второго июня приостановила внутреннюю разработку новой модели Astra, которая по результатам собственных проверок компании может обладать критическими…

4 мин