68% файлов llms.txt бесполезны: Common Crawl проверил полмиллиона сайтов
Владельцы сайтов массово создают файл llms.txt, рассчитывая управлять доступом нейросетей к своему контенту, но по данным Common Crawl, большинство этих файлов работают не так, как авторы ожидают, а часть путает их с robots.txt.

Common Crawl проанализировал более 500 000 файлов llms.txt и обнаружил, что 68% сгенерированы шаблонами автоматически, 22% вообще не содержат ссылок, а попытки блокировать краулеры через llms.txt технически бессмысленны: файл ничего не запрещает и ничего не разрешает.
Исследование провёл старший инженер-исследователь Common Crawl Малте Остендорф. Его команда собрала файлы llms.txt с огромной выборки сайтов, доступных их краулеру CCBot, и разобрала содержимое каждого. Результат показал разрыв между тем, чем файл является по спецификации, и тем, как его используют на практике.
Что такое llms.txt и чем он отличается от robots.txt?
Файл llms.txt по замыслу создателей формата это не инструмент блокировки. Это предложение: вы размещаете на сайте структурированный список страниц, которые считаете полезными для ИИ-систем. Краулер (робот-сборщик данных для нейросетей) может прочитать этот список и учесть его при обработке вашего сайта.
Ключевое слово здесь «может». Как пишет Common Crawl, файл llms.txt «ничего не разрешает и ничего не блокирует, и ни один краулер не обязан его читать». Для реальных ограничений доступа существует robots.txt, и именно его учитывает CCBot.
Путаница между двумя файлами массовая. Common Crawl обнаружил 136 578 файлов robots.txt, размещённых по адресу /llms.txt. Это примерно 10% от 1 287 207 ответов, которые вернули статус HTTP 200 (то есть файл найден и отдаётся).
Что понадобится
- Доступ к файловой системе вашего сайта (FTP, панель хостинга или CMS)
- Текстовый редактор (подойдёт встроенный в хостинг-панель)
- 15 минут на создание файла и проверку robots.txt
- Понимание структуры сайта: какие страницы вы хотите «показать» нейросетям
Пошаговая инструкция
-
Проверьте, нет ли у вас llms.txt уже. Если сайт на Wix, велика вероятность, что файл создан автоматически. По данным Common Crawl, Wix генерирует 41% всех обнаруженных llms.txt. Откройте в браузере
вашсайт.ru/llms.txtи посмотрите, что там. -
Проверьте robots.txt отдельно. Откройте
вашсайт.ru/robots.txt. Убедитесь, что правила для краулеров прописаны именно там, а не в llms.txt. Если вы хотите ограничить доступ конкретного бота (например, CCBot или GPTBot), инструкция должна быть в robots.txt:
User-agent: CCBot
Disallow: /
User-agent: GPTBot
Disallow: /
- Создайте llms.txt по спецификации, если хотите помочь нейросетям найти ваш лучший контент. Минимальная структура по стандарту: заголовок H1 и, по желанию, краткое описание сайта в блок-цитате, затем секции со ссылками. Каждая ссылка может сопровождаться коротким пояснением:
# Название вашего сайта
> Краткое описание: о чём сайт и для кого
## Основные разделы
- [Главная страница](https://вашсайт.ru/): описание содержимого
- [Блог](https://вашсайт.ru/blog/): статьи по теме X
- [Услуги](https://вашсайт.ru/services/): описание услуг
-
Не пытайтесь вписывать в llms.txt команды для нейросетей. Common Crawl нашёл 3 793 файла с «мягкими указаниями» вроде «сосредоточься на этих страницах» и 10 файлов с попытками внедрения промпта (prompt injection, когда в текст вставляют инструкцию, которая пытается перехватить управление нейросетью). Из десяти подозрительных случаев подтвердились только четыре, и все были демонстрацией уязвимости, а не реальной атакой.
-
Загрузите файл в корень сайта по адресу
/llms.txt. Если хотите предоставить расширенную версию со всеми страницами, создайте также/llms-full.txt. -
Сверьте llms.txt и robots.txt между собой. Common Crawl приводит конкретный пример: на одном сайте llms.txt утверждает, что CCBot заблокирован «с июня 2026 года», а robots.txt при этом разрешает доступ через правило с подстановочным знаком. Файл llms.txt описывает политику, но не является ею, и рассинхронизация делает оба файла бесполезными.
Две трети файлов создают плагины, а не люди
По данным Common Crawl, 68% файлов llms.txt сгенерированы плагином или шаблоном CMS. Только 49% файлов имеют полную структуру, которую проверяло исследование: заголовок H1, описание в блок-цитате и секции со ссылками. При этом 32% добавляют краткое пояснение к каждой ссылке, а 22,56% не содержат ссылок вообще.
Отдельно выделяется плагин All in One SEO: по данным Common Crawl, в 73 000 файлов он никогда не добавляет описание сайта, зато вставляет в среднем 138 ссылок. Исследование прямо называет такой подход «использованием llms.txt как карты сайта». Файлы, которые генерирует GoDaddy для припаркованных доменов, проходят все структурные проверки, но по сути являются рекламой хостинга.
Всё это означает, что формат llms.txt на практике определяется не авторами сайтов, а разработчиками плагинов и платформ.
Common Crawl проверил 32 файла, которые пытались запретить доступ их краулеру CCBot через llms.txt. Команда смогла оценить 31 сайт из 32. Результат: ни один из этих сайтов не блокировал CCBot в robots.txt. Пять сайтов явно разрешали доступ, 11 ограничивали отдельные разделы, но открывали остальные, а 15 не имели никаких ограничений. Один сайт вернул ошибку 429 (слишком много запросов) и не мог быть проверен. То есть все 31 сайт, «запретивших» краулер в llms.txt, на деле оставались для него открытыми.
- Путать llms.txt с robots.txt. Около 10% ответов по адресу /llms.txt оказались файлами robots.txt. Если вы хотите заблокировать ИИ-краулеры, правила должны быть в robots.txt, и только там.
- Надеяться, что llms.txt блокирует сбор данных. Файл «ничего не разрешает и ничего не блокирует», как формулирует Common Crawl. Ни одна инструкция внутри него не имеет технической силы.
- Указывать в llms.txt одно, а в robots.txt другое. Рассинхронизация создаёт ложное чувство контроля. Всегда проверяйте, что оба файла говорят одно и то же.
- Вставлять промпты и инструкции для нейросетей. Случаи инъекции промптов единичны, но сам формат не предусматривает ни указаний по лимитам запросов, ни заявлений об авторских правах. 6% файлов содержали такие указания, и все они вышли за пределы спецификации.
- Полагаться на автоматически созданный файл, не проверяя его. Если плагин сгенерировал llms.txt с сотней ссылок без описания или вовсе без ссылок, этот файл вряд ли поможет нейросетям понять ваш сайт.
Что делать с этим прямо сейчас?
Автору Дзена и блогеру. Файл llms.txt пока не влияет на то, попадёт ли ваш контент в ответы нейросетей. По данным Ahrefs, 97% файлов llms.txt в их датасете не получили ни одного запроса. Но если вы ведёте сайт за пределами Дзена, проверьте, не создал ли ваш хостинг или CMS пустой шаблон автоматически.
Веб-мастеру и владельцу сайта в РФ. Если вы размещали llms.txt в надежде заблокировать краулеры, это не работает. Управлять доступом можно только через robots.txt. Файл llms.txt полезен для другого: вы составляете каталог своих лучших страниц, который ИИ-система теоретически может учесть при обработке сайта.
Маркетологу и SEO-специалисту. Формат пока в стадии предложения, он не стандартизирован, и ни один крупный ИИ-сервис публично не гарантирует, что читает его. Обновление llms.txt v2, по данным источника, добавило связи между страницами для упрощённого поиска Markdown-версий, но не изменило главного: файл остаётся рекомендацией, а не правилом.
Ситуация с llms.txt напоминает ранние годы robots.txt: формат появился, им начали пользоваться массово, но большинство не понимает, что он делает, а что нет. Для владельцев русскоязычных сайтов я бы рекомендовал начать с robots.txt: пропишите там правила для GPTBot, ClaudeBot, CCBot и других известных краулеров, если хотите ограничить доступ. А llms.txt используйте осознанно, как каталог лучших страниц для нейросетей, а не как замок на дверь. Честная оговорка: исследование Common Crawl основано на одном проходе краулера и не может показать, растёт ли число шаблонных файлов или промпт-инъекций, и читает ли вообще хоть одна ИИ-система эти файлы на практике.
Хотите разобраться, как ИИ меняет работу с контентом?
В dzen.guru мы разбираем практические инструменты для авторов и маркетологов, которые хотят использовать нейросети без иллюзий.
Попробовать dzen.guru
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Смена домена обрушила SEO на 98%: издатель не вернул позиции за четыре месяца
Британский издатель потерял 98% видимости в Google News за две недели после переноса сайта с домена .co.uk на .com, и спустя четыре месяца новый домен так и не…

Как попасть в ChatGPT и AI Overviews для видимости бизнеса
Владельцы локального бизнеса в 2025 году теряют клиентов не из-за плохого сайта, а потому что ИИ-поисковики вроде ChatGPT и Google AI Overviews просто не знают…

Реклама в ChatGPT: разброс цены клика достигает 4 раз, а бенчмарков до сих пор нет
OpenAI с февраля тестирует рекламу в ChatGPT и уже открыла самообслуживание для рекламодателей в 52 странах, но спустя полгода у платформы до сих пор нет…
Комментарии