Игорь Градов
Игорь Градов
7 мин
ai

AI краулеры игнорируют ваш robots.txt: как открыть сайт для GPTBot и ClaudeBot в 2026

Владельцы сайтов в РФ теряют присутствие в ответах ChatGPT, Perplexity и Claude из-за устаревшего файла robots.txt, хотя в Google и Яндексе всё выглядит нормально, и в июле 2026 года список AI краулеров вырос настолько, что старые настройки пора переписывать.

AI краулеры игнорируют ваш robots.txt: как открыть сайт для GPTBot и ClaudeBot в 2026
Почему это важно

Robots.txt для поисковых ботов и robots.txt для AI краулеров по факту два разных набора правил: сайт может быть в топе Google, но полностью невидим для GPTBot, ClaudeBot и PerplexityBot, и ни Search Console, ни Яндекс.Вебмастер об этом не предупредят.

Типичная история из практики выглядит так. Сайт стоит в топ-3 Google, ссылки в порядке, индексация зелёная. Но в robots.txt для всех user-agent, кроме Googlebot и YandexBot, стоит запрет Disallow: /. Результат: GPTBot, ClaudeBot и PerplexityBot получают код 403 на первом же запросе. Полгода сайт невидим для трёх из четырёх крупных ИИ-поисковиков (систем, которые формируют ответ вместо привычной поисковой выдачи), и никто об этом не знает. Этот случай описан в источнике как типовой, и ниже разберём, как его не повторить.

Что понадобится

  • Доступ к файлу robots.txt на сервере (или к панели хостинга, где его можно редактировать)
  • Доступ к логам сервера (access.log) или панель хостинга с просмотром логов
  • Терминал с командами grep и curl (подойдёт любой Linux/macOS; на Windows можно через WSL)
  • Яндекс.Вебмастер для проверки видимости YandexBot и YandexAI
  • 30 минут на первую проверку и правку, потом 10 минут раз в квартал

Пошаговая инструкция

  1. Откройте текущий robots.txt вашего сайта. Просто зайдите на https://ваш-сайт.ru/robots.txt в браузере. Посмотрите, есть ли строки с Disallow: / для User-agent: * или для конкретных ботов. Если стоит общий запрет для всех, кроме Googlebot и YandexBot, AI краулеры уже заблокированы.

  2. Проверьте логи сервера за последние две недели. Выполните команду, которая покажет, какие AI краулеры приходили и какой ответ получали:

grep -E "GPTBot|ClaudeBot|PerplexityBot|OAI-SearchBot" access.log | awk '{print $9}' | sort | uniq -c

Код 403 или редирект на страницу логина означают, что бот заблокирован.

  1. Проверьте, что реально отдаёт сервер конкретному боту. Подставьте нужный user-agent (имя, под которым бот представляется серверу) в запрос через curl:
curl -A "GPTBot" -I https://example.com/page
curl -A "PerplexityBot" https://example.com/page | head -50

Если в ответе пустой div с классом root без текста, ваш контент рендерится (отрисовывается) клиентским JavaScript, и бот видит пустую страницу, даже если robots.txt открыт.

  1. Добавьте в robots.txt разрешения для актуальных AI краулеров. Вот рабочий список на конец июля 2026 года:
User-agent: GPTBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: anthropic-ai
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: Applebot-Extended
Allow: /

User-agent: CCBot
Allow: /

User-agent: GigaChat
Allow: /

User-agent: YandexAI
Allow: /

Закрывайте точечно только то, что не должно попадать в обучающие данные (обучающие данные, training data, это массив текстов, на котором модель учится): личный кабинет, черновики, служебные разделы.

  1. Проверьте, не переименован ли бот. В 2026 году Google сменила user-agent NotebookLM на Google-GeminiNotebook. Об этом писал Search Engine Land. Если у вас в robots.txt или конфиге файервола (WAF, защитного экрана между сервером и интернетом) прописано старое имя NotebookLM, правило адресовано боту, которого под этим именем больше нет. Продублируйте строку на Google-GeminiNotebook до конца лета 2026 года.

  2. Проверьте настройки CDN и WAF. Некоторые CDN (сети доставки контента, ускоряющие загрузку сайта) по умолчанию включают защиту от парсеров по эвристике на user-agent, и туда попадают легитимные AI краулеры вместе со спамом. Это правило живёт на уровне CDN, а не в robots.txt, поэтому при обычном SEO-аудите его никто не проверяет. Зайдите в панель CDN и убедитесь, что GPTBot, PerplexityBot, ClaudeBot не в чёрном списке.

  3. Убедитесь, что контент доступен без JavaScript. AI краулеры реального времени (OAI-SearchBot, PerplexityBot, ChatGPT-User) не исполняют JavaScript как браузер. Они забирают HTML (код страницы, который сервер отдаёт первым), и если контент подгружается скриптом после загрузки страницы, модель видит пустой каркас. То же касается бесконечной прокрутки: карточки, которые появляются только при скролле и не лежат в исходном HTML или на постраничных URL, бот не увидит дальше первого экрана. Решение: серверный рендеринг (SSR) или хотя бы предварительная отрисовка (prerendering) для ботов.

  4. Повторяйте проверку раз в квартал. Новые user-agent выходят без громких анонсов. Актуальные правила по каждому боту публикуют сами компании: OpenAI, Anthropic, Google.

Два типа AI краулеров: зачем это различать?

Путаница между типами ботов приводит к тому, что владельцы сайтов открывают доступ одним и забывают про других.

  • Краулеры для обучения моделей: GPTBot (OpenAI), ClaudeBot (Anthropic), CCBot (Common Crawl, открытый набор данных, на котором обучается часть открытых моделей). Собирают массив текста на будущее, заходят реже, результат не виден сразу.

  • Краулеры реального времени: OAI-SearchBot, PerplexityBot, ChatGPT-User. Заходят на страницу в тот момент, когда пользователь задаёт вопрос модели, забирают контент и отдают его для формирования ответа здесь и сейчас. Нет доступа у такого бота, и модель либо не найдёт вашу страницу, либо процитирует конкурента с открытым доступом.

  • Google-Extended стоит особняком: это отдельная директива для использования контента в Gemini и AI Overviews. Не путайте с обычным Googlebot: разрешение для Googlebot не распространяется на Google-Extended автоматически.

Что делать с этим прямо сейчас, по ролям

Автору Дзена и контент-мейкеру. Если у вас есть свой сайт, с которого вы хотите получать упоминания в ответах ChatGPT или Perplexity, проверьте robots.txt по списку выше. Контент, который лежит только на Дзене, зависит от настроек платформы, но если вы дублируете статьи на свой домен, доступ для AI краулеров полностью в ваших руках.

Маркетологу и SEO-специалисту. Добавьте проверку AI краулеров в стандартный чеклист аудита. Индексация в Google и Яндексе больше не означает видимость для ИИ-поисковиков. Отдельный пункт: проверка CDN и WAF, которые могут блокировать ботов независимо от robots.txt.

Предпринимателю в РФ и СНГ. Для Яндекса и Алисы AI актуальны YandexBot и YandexAI, проверяйте через Яндекс.Вебмастер. Для GigaChat от Сбера есть отдельный user-agent GigaChat. Остальные боты из списка (GPTBot, ClaudeBot, PerplexityBot) тоже заходят на российские сайты, если доступ не закрыт.

Как это выглядит на практике

Исходный robots.txt содержал:

User-agent: *
Disallow: /

User-agent: Googlebot
Allow: /

User-agent: YandexBot
Allow: /

Сайт был в топ-3 Google, но GPTBot, ClaudeBot и PerplexityBot получали 403. После добавления разрешений для десяти AI краулеров из списка выше и проверки, что CDN не режет ботов дополнительно, сайт стал доступен для ИИ-поисковиков. Команда curl -A "GPTBot" -I https://example.com/ начала возвращать код 200 вместо 403.

Частые ошибки

Старый шаблон robots.txt из прошлого проекта. Скопировали файл двухлетней давности, где прописаны боты 2024 года. OAI-SearchBot и Google-Extended вышли позже и в список исключений не попали.

CDN блокирует ботов за вас. Защита от парсеров на уровне CDN работает по эвристике и ловит легитимных AI краулеров вместе со спамом. В robots.txt всё открыто, а бот получает 403 от CDN.

«Раз индексируется, значит, всё в порядке». Индексация в Яндексе и Google ничего не говорит о доступности для AI краулеров. Это разные боты с разными user-agent и разной механикой.

Забыли про JS-рендеринг. Robots.txt открыт, CDN пропускает, но контент загружается клиентским JavaScript. Бот реального времени видит пустую страницу.

Устаревшее имя бота. Google переименовала NotebookLM в Google-GeminiNotebook. Строка с прежним именем осталась в файле, но адресована несуществующему боту.

Совет редакции dzen.guru

Я проверил robots.txt на нескольких десятках сайтов клиентов, и примерно у половины AI краулеры были заблокированы случайно. Чаще всего проблема не в злом умысле, а в том, что файл robots.txt написали один раз при запуске и больше не трогали. Мой совет: поставьте напоминание на каждый квартал, заходите на страницы документации OpenAI, Anthropic и Google по краулерам и сверяйте список user-agent. Новые боты появляются тихо. Честная оговорка: само по себе открытие доступа для AI краулеров не гарантирует, что модель процитирует именно вашу страницу. Но закрытый доступ гарантирует, что она точно этого не сделает.

Проверьте свой контент глазами ИИ

В dzen.guru мы помогаем авторам и владельцам сайтов адаптировать контент-стратегию под новые правила видимости

Узнать больше

Файл robots.txt перестал быть техническим артефактом, который трогают раз в жизни. В 2026 году это точка, где решается, увидит ли вас половина новой аудитории, та, что задаёт вопросы не поисковику, а модели.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Новости искусственного интеллекта и нейросетей: 5 бесплатных инструментов, готовых к работе
ai

Новости искусственного интеллекта и нейросетей: 5 бесплатных инструментов, готовых к работе

Каждую неделю выходят десятки новостей про нейросети, но разбирать их все бессмысленно: большинство не дают ничего, что можно применить прямо сейчас, и эта…

6 мин
У справочников закончились данные для обучения ИИ: как атрибутивный разбор находит дубли точнее строк
ai

У справочников закончились данные для обучения ИИ: как атрибутивный разбор находит дубли точнее строк

Справочники в компаниях неизбежно превращаются в свалку: один отдел пишет «кабель ВВГ 3×2.5», другой «ВВГнг 3×2,5», третий «провод 3 жилы», и закупки начинают…

6 мин
Промпт инженерия для Claude 5: Anthropic удалила 80% инструкций и не потеряла качество
ai

Промпт инженерия для Claude 5: Anthropic удалила 80% инструкций и не потеряла качество

Anthropic на собственном опыте показала, что для Claude 5 лучше работает короткий системный промпт: компания удалила более 80% инструкций из Claude Code и не…

7 мин