Игорь Градов
Игорь Градов
6 мин
text

ИИ-контент захватил 10% веба: на коммерческих сайтах его в 10 раз больше, чем на .edu

Каждый десятый текст в интернете уже несёт следы работы нейросети, а среди коммерческих сайтов доля ИИ-контента растёт быстрее всего, и Pew Research Center впервые показал это на выборке из полумиллиона страниц.

ИИ-контент захватил 10% веба: на коммерческих сайтах его в 10 раз больше, чем на .edu
Почему это важно

Pew Research Center обнаружил, что на доменах .com признаки ИИ-авторства встречаются примерно в 10 раз чаще, чем на .edu и .gov. Для тех, кто делает контент на коммерческих площадках, это прямой сигнал: поисковики всё лучше видят такие маркеры, а значит, работа с ИИ-контентом требует осмысленного подхода, а не слепой генерации.

Pew Research Center, один из самых цитируемых исследовательских центров США, 20 августа опубликовал анализ почти полумиллиона англоязычных веб-страниц. Исследователи пропустили их через детектор ИИ-текста и обнаружили признаки машинного авторства или редактуры примерно на 10% страниц. Среди страниц, опубликованных после запуска ChatGPT, доля выросла до 35%. Это не единственная оценка: другие команды называют ещё более высокие цифры, но методология Pew отличается масштабом выборки и типами страниц.

Какие маркеры ИИ-контента нашёл Pew?

Исследователи изучили конкретные языковые признаки на страницах, вышедших после релиза ChatGPT.

  • Длинное тире (em dash) стало встречаться вдвое чаще: с 5,79 до 11,19 использований на 10 000 слов между началом 2023 и началом 2026 года.
  • Оксфордская запятая (запятая перед «и» в перечислении, характерная для англоязычного ИИ-текста) выросла на 63%.
  • Слова-маркеры, типичные для генерации нейросетью, такие как delve («углубляться»), interplay («взаимодействие»), testament («свидетельство»), стали появляться более чем вдвое чаще.
  • Конструкция «это не просто X, это Y» (negative parallelism) выросла с 0,87 до 2,36 на 10 000 слов, хотя по-прежнему остаётся редкой.

Pew подчёркивает: ни один из этих признаков не позволяет уверенно определить авторство конкретного текста, потому что люди тоже используют все эти приёмы. Вывод работает только на больших массивах.

Коммерческие сайты впереди, госсайты почти не затронуты

По данным Pew за шестимесячный период, доля страниц с признаками ИИ-авторства распределилась так:

  • .com (коммерческие): 9,35%
  • .org (некоммерческие): 4,59%
  • .edu (образовательные): 1,03%
  • .gov (государственные): 0,76%

До запуска ChatGPT все четыре типа доменов держались на уровне 1% или ниже. После запуска .com начал расти быстрее остальных, а .edu и .gov остались около прежней отметки. Именно коммерческий сегмент веба, тот самый, с которым работает большинство SEO-специалистов, оказался эпицентром ИИ-контента.

Почему оценки других исследований выше?

Pew не единственный, кто считает долю ИИ-текста в вебе, и цифры расходятся заметно.

  • Graphite (SEO-компания) оценила долю новых англоязычных статей, преимущественно сгенерированных ИИ, в 49,9% за первый квартал 2026 года.
  • Препринт Imperial College London, Internet Archive и Стэнфорда (не прошедший рецензирование) показал 35% к середине 2025.

Разница объясняется выборкой. Pew анализировал все типы англоязычных страниц: форумы, главные страницы, категории. Graphite ограничился только статьями и списками длиной от 100 слов. Форумы и страницы-категории, это не то место, где массово используют ИИ для генерации. Статьи, наоборот, используют.

Все три исследования в той или иной степени опираются на детектор Pangram; Graphite дополнительно использовал Copyleaks и GPTZero.

Что Pew считает «ИИ-контентом»?

Важный нюанс: порог Pew ловит не только полностью сгенерированные тексты, но и отредактированные с помощью ИИ. Страница, которую человек написал сам, а потом «причесал» через встроенный ИИ в Google Docs или Microsoft Word, попадает в ту же категорию, что и текст, целиком созданный нейросетью.

Ни одно из исследований не разделяет эти два сценария. А ИИ-редактирование уже встроено в стандартные текстовые редакторы, поэтому граница между «написал человек» и «написал ИИ» размывается с каждым обновлением.

Что делать с этим прямо сейчас, по ролям

Авторам Дзена и копирайтерам. Если вы используете нейросеть для черновиков, проверяйте текст на типичные маркеры: избыточные длинные тире, однотипные конструкции, слова-паразиты ИИ. В русском языке свой набор маркеров (чрезмерная «гладкость», канцелярские обороты, слово «является» через строчку), но принцип тот же: детекторы учатся, и чем больше маркеров в тексте, тем выше риск пониженного доверия со стороны площадки.

SEO-специалистам. Коммерческие домены, ваша основная территория, именно там концентрация ИИ-маркеров максимальна по данным Pew. Это значит, что поисковики уже имеют статистическую базу для выделения таких текстов. Полезность и точность страницы по-прежнему решают, читать ли её, но риск автоматической пометки растёт.

Предпринимателям в РФ и СНГ. Исследование Pew касается англоязычного веба. Для русскоязычного сегмента аналогичных масштабных замеров пока нет. Но инструменты детекции (Антиплагиат, Text.ru, встроенные фильтры Яндекса) развиваются по той же логике. Не ждите, пока русскоязычный Pew опубликует свои 10%, проверяйте свои тексты сейчас.

Как это выглядит на практике

Возьмите любую свою статью длиной от 1 000 слов, опубликованную на коммерческом домене. Прогоните её через бесплатный детектор (GPTZero или Copyleaks, оба доступны без подписки на базовом уровне). Если детектор показывает более 30% вероятности ИИ-авторства, найдите абзацы-триггеры. Чаще всего это вводные конструкции, «гладкие» переходы между разделами и обобщающие финалы. Перепишите их своим голосом, добавьте конкретный опыт, неровность живой речи. Повторный прогон обычно снижает оценку до 10-15%.

Частые ошибки

Новички часто совершают две ошибки. Первая: полагают, что если детектор «не поймал», текст безопасен. Pew прямо говорит, что ни один маркер не работает на уровне отдельного документа, только на массивах. Детектор может пропустить ваш текст сегодня и поймать завтра после обновления алгоритма. Вторая ошибка: пытаются «обмануть» детектор механической заменой слов-маркеров. Это не помогает, потому что детекторы анализируют не отдельные слова, а распределение паттернов по всему тексту. Единственный надёжный способ снизить ИИ-маркеры: переписать текст с добавлением собственного опыта и конкретики, которую нейросеть не могла знать.

Мнение редакции dzen.guru

Я считаю, что главный вывод из данных Pew не в самих 10%. Главное, что коммерческий веб и остальной интернет разошлись по скорости: .com набирает ИИ-маркеры в разы быстрее, чем .edu и .gov. Для тех, кто зарабатывает контентом, это означает простую вещь: ваш текст конкурирует не просто с другими авторами, а с растущей массой машинного текста на тех же площадках. Выделиться можно только тем, что нейросеть не умеет: конкретным опытом, локальной экспертизой, честной позицией. Используйте ИИ для черновиков и рутины, но финальный голос должен быть вашим. Оговорка: исследование Pew покрывает только англоязычный веб, и прямо переносить его цифры на Рунет некорректно. Но тренд универсален.

Хотите делать контент, который не спутают с машинным?

В dzen.guru мы разбираем, как использовать нейросети для ускорения работы, не теряя авторский голос. Присоединяйтесь к сообществу авторов, которые пишут с ИИ, но звучат как люди.

Присоединиться к dzen.guru

Данные Pew фиксируют момент, когда ИИ-контент перестал быть экзотикой и стал фоновым шумом коммерческого веба. Вопрос уже не «используете ли вы ИИ», а «видно ли это» и «добавляет ли ваш текст что-то, чего нейросеть не выдаст сама».

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Webflow подключила OpenAI Codex: рутину на сайте теперь решает текстовый запрос
text

Webflow подключила OpenAI Codex: рутину на сайте теперь решает текстовый запрос

Webflow 2 июня расширила интеграцию с OpenAI, подключив к платформе Codex и набор готовых навыков (Skills), которые позволяют автоматизировать рутинные задачи…

5 мин
SEO нейросетей на разных рынках: почему ИИ не видит локальную экспертизу бренда
text

SEO нейросетей на разных рынках: почему ИИ не видит локальную экспертизу бренда

Почему это важно Нейросети, на которых строятся поисковые ответы, не наследуют авторитет бренда из одного рынка в другой: 40 локализованных сайтов для модели…

6 мин
Cloudflare EmDash перевела на себя блог с 5 000 rps и готовит релиз 1.0
text

Cloudflare EmDash перевела на себя блог с 5 000 rps и готовит релиз 1.0

Спор о том, может ли Cloudflare EmDash действительно заменить WordPress, перешёл из теоретической плоскости в практическую 12 августа, когда компания перевела…

5 мин