Игорь Градов
Игорь Градов
6 мин
text

Common Crawl выпустил гайд по видимости для ИИ: 64% языковых моделей учатся на его данных

Common Crawl, некоммерческая организация, которая ежемесячно скачивает более двух миллиардов веб-страниц и бесплатно отдаёт архив всем желающим, в июне опубликовала 18-страничное руководство по аудиту видимости сайта в своём датасете, а независимый разработчик автоматизировал все ручные проверки в бесплатном онлайн-инструменте.

Common Crawl выпустил гайд по видимости для ИИ: 64% языковых моделей учатся на его данных
Почему это важно

По данным аудита Mozilla, 64% языковых моделей (LLM, большие языковые модели, основа ChatGPT и аналогов), выпущенных с 2019 по 2023 год, обучались на данных Common Crawl. Если ваш сайт заблокирован для краулера CCBot, ваш контент не попадает в обучающие данные большинства нейросетей, и вы теряете шанс, что ИИ «знает» ваш бренд.

Зачем это нужно и при чём тут ваш сайт

Common Crawl ежемесячно индексирует веб и складывает результат в открытый архив. Этот архив питает ключевые обучающие наборы: C4, RefinedWeb, RedPajama, Dolma, FineWeb и другие. Лаборатории вроде OpenAI берут не сырой архив, а его фильтрованные производные, но отправная точка одна: краулер CCBot пришёл на страницу, прочитал её и сохранил.

Июльский краул 2026 года содержит 2,14 миллиарда страниц. При этом, например, сайт BBC заблокировал CCBot в файле robots.txt (файл-инструкция для поисковых роботов, указывающая, какие страницы можно читать), и в архиве его фактически нет. По данным BuzzStream, 75% крупнейших издателей США и Великобритании намеренно блокируют краулеры для обучения ИИ.

Проблема в том, что блокировка часто возникает не по решению владельца. С 1 июля 2025 года Cloudflare по умолчанию блокирует ИИ-краулеры на каждом новом домене. Управляемый robots.txt Cloudflare затронул 3,8 миллиона доменов, которые никогда не писали собственный robots.txt. Плагины рекламных сетей добавляют блоклисты. По данным HTTP Archive, которые опубликовал Крис Грин в LinkedIn, около 492 000 сайтов упоминают CCBot в robots.txt, и примерно 95% этих упоминаний существуют для блокировки.

Сколько из этих полумиллиона владельцев действительно хотели заблокировать CCBot? Вопрос открытый. Именно поэтому проверка нужна каждому, кто хочет, чтобы нейросети знали о его контенте.

Что понадобится

  • Доступ к бесплатному инструменту Common Crawl Visibility Checker (без регистрации, работает в браузере)
  • Домен вашего сайта или конкретный URL страницы для проверки
  • Доступ к панели управления хостингом или Cloudflare (если потребуется исправить robots.txt)
  • 10-15 минут на диагностику и исправление

Пошаговая инструкция

  1. Откройте Common Crawl Visibility Checker и введите ваш домен. Инструмент работает с одним доменом за раз и берёт данные напрямую из архивов Common Crawl.

  2. Изучите панель «Captures Per Crawl» (захваты по краулам). Она покажет, сколько ваших страниц попало в каждый из последних двенадцати ежемесячных краулов. Для крупных доменов инструмент даёт оценку (estimate), читая структуру индекса, а не считая каждую запись. Например, для wikipedia.org отображается примерно 3,7 миллиона страниц с пометкой «estimate».

  3. Проверьте панель «Robots.txt History» (история robots.txt). Инструмент хранит копии robots.txt, которые Common Crawl считывал перед каждым краулом, и сравнивает правила для ИИ-краулеров месяц за месяцем. Если CCBot заблокирован, вы увидите дату начала блокировки.

  4. Определите, чья это блокировка. Если блок совпадает с известным шаблоном, инструмент сообщит об этом. У управляемого robots.txt от Cloudflare есть характерный лицензионный комментарий, у Squarespace свой уникальный почерк. Если восемь и более токенов ИИ-краулеров заблокированы одним махом, скорее всего это плагин или скопированный список.

  5. Посмотрите результат живой проверки (Live Probe). Инструмент запрашивает вашу главную страницу от имени CCBot/2.0, обычного браузера и контрольного бота. Это ловит блокировки, которых нет в robots.txt: файрвол, который отклоняет запрос по user-agent на уровне сети.

  6. Изучите панель Sitemap Coverage (покрытие карты сайта). Инструмент скачивает вашу карту сайта и сравнивает с захваченными URL. Вы получаете рабочий список: какие страницы попали в архив, а какие нет. Недостающие страницы скачиваются как CSV.

  7. Если обнаружена блокировка, исправьте её. Инструмент выдаёт карточки с конкретными действиями:

  8. Блокировка шаблоном Cloudflare: указан путь в панели управления и предупреждение
  9. Блокировка вручную: готовый двухстрочный фрагмент robots.txt с кнопкой копирования
  10. Блокировка на уровне файрвола: название вендора и ссылки на опубликованные IP-диапазоны CCBot

  11. Запомните дату следующего краула. Инструмент показывает её под карточками исправлений. Исправление, сделанное сегодня, отразится в данных следующего месяца.

  12. Для проверки отдельной страницы вставьте полный URL вместо домена и получите историю этой страницы за год.

Как это выглядит на практике

Автор инструмента проверил собственный сайт и обнаружил рост с 2 захваченных страниц в августовском краулу прошлого года до 55 в июльском. Панель покрытия карты сайта показала: 42 из 97 страниц попали в июльский краул, оставшиеся 55 скачались как CSV для дальнейшей работы. При проверке домена bbc.com инструмент показал: CCBot заблокирован, 13 из 14 отслеживаемых токенов ИИ-краулеров заблокированы правилом «Disallow /». Один из крупнейших новостных сайтов планеты для обучающего конвейера фактически не существует.

Частые ошибки

Не проверять, кто именно заблокировал CCBot. Многие владельцы сайтов уверены, что не трогали robots.txt. Но Cloudflare с 1 июля 2025 года блокирует ИИ-краулеры по умолчанию на новых доменах, а рекламные плагины добавляют блоклисты без уведомления. Результат один: ваш контент исчезает из архива Common Crawl не по вашему решению.

Путать GPTBot и CCBot. GPTBot собирает страницы только для OpenAI. Визит CCBot компаундируется: одна страница попадает ко всем, кто когда-либо будет обучаться на открытом вебе. Разблокировать только GPTBot и забыть про CCBot значит отдать контент одной компании и закрыть его для десятков других моделей.

Исправить robots.txt и ждать мгновенного результата. Common Crawl работает ежемесячными циклами. Исправление сегодня отразится только в следующем краулe. Инструмент показывает дату следующего обхода, ориентируйтесь на неё.

Что делать с этим прямо сейчас, по ролям

Автору Дзена и блогеру. Проверьте домен вашего основного сайта или портфолио. Если вы ведёте блог на собственном хостинге и хотите, чтобы ИИ-ассистенты ссылались на ваш контент, убедитесь, что CCBot не заблокирован. Для контента на платформах (Дзен, Medium) robots.txt контролирует платформа, но это повод задуматься о собственном домене.

Маркетологу и SEO-специалисту. Добавьте проверку видимости в Common Crawl к стандартному техническому аудиту. Если бренд клиента невидим для обучающих наборов, он невидим и для ответов нейросетей. Это параллельный канал «обнаружимости», который пока почти никто не отслеживает.

Владельцу бизнеса в РФ и СНГ. Инструмент работает с любым доменом, включая .ru и .рф. Из российских решений, связанных с ИИ-видимостью, пока нет прямых аналогов этого чекера. Проверка бесплатна и занимает минуты, при этом ответ на вопрос «знают ли нейросети о моём сайте» может оказаться неожиданным.

Мнение редакции dzen.guru

Я считаю, что видимость в Common Crawl через пару лет станет такой же базовой метрикой, как индексация в поиске. Пока об этом думают единицы, и именно сейчас у небольших сайтов есть окно: проверить, разблокировать, попасть в следующий краул. Честная оговорка: попадание в архив Common Crawl не гарантирует, что конкретная модель «запомнит» именно вашу страницу. Между сырым краулом и финальной моделью стоят фильтры качества, дедупликация и отбор. Но если вас нет в архиве, шансов нет вообще. Начните с проверки, это буквально одно поле ввода и десять минут.

Хотите, чтобы ИИ работал на ваш контент?

Проверьте видимость сайта и настройте стратегию контента с инструментами dzen.guru

Попробовать бесплатно
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

56% покупателей уже ищут через ИИ: как поведение покупателей онлайн меняет стратегию продвижения
text

56% покупателей уже ищут через ИИ: как поведение покупателей онлайн меняет стратегию продвижения

Завоевать доверие покупателей онлайн не значит просто «быть везде»: исследование Reflect Digital показало, что 56% людей уже используют ИИ-поиск, но 57%…

6 мин
SEO для AI поиска оказалось старым SEO: три эксперта пришли к одному выводу
text

SEO для AI поиска оказалось старым SEO: три эксперта пришли к одному выводу

Компания Google годами продвигала одни и те же принципы качественного поиска, и теперь, когда ИИ-поиск с функциями вроде AI Overviews стал реальностью,…

5 мин
Издатели борются с Google за ссылки, но сами используют кликбейт и удержание ссылок
text

Издатели борются с Google за ссылки, но сами используют кликбейт и удержание ссылок

Ежедневно десятки изданий требуют от Google и ИИ-платформ ссылки на свои материалы, но при этом сами отказывают в кликабельных ссылках тем, чьи данные,…

4 мин