Большие языковые модели упёрлись в потолок: для квадриллиона параметров нужно 296 000 «Википедий»
Большие языковые модели (LLM, нейросети, обученные на огромных массивах текста и способные генерировать связные ответы) с квадриллионом параметров (параметр, это числовая настройка внутри модели, чем их больше, тем сложнее модель) пока остаются за горизонтом, и дело не в вычислительной мощности, а в том, что на планете просто не хватает качественного текста для их обучения.

Крупнейшие большие языковые модели уже перешагнули триллион параметров, но активных из них используется не больше 150 миллиардов, а для следующего скачка в тысячу раз потребовалось бы 296 000 «Википедий», которых физически не существует.
Аналитик, пишущий под псевдонимом и публикующий расчёты на основе открытых данных о размерах датасетов и архитектурах моделей, предложил собственную единицу измерения объёма текста и показал арифметику, которая объясняет, почему квадриллионные модели в обозримом будущем невозможны. Расчёт опирается на закон Шиншиллы (Chinchilla scaling law, правило, по которому число обучающих данных и размер модели растут пропорционально) и реальные объёмы доступных текстов.
| Что | Когда | Кто | Цена |
|---|---|---|---|
| Анализ пределов масштабирования больших языковых моделей до квадриллиона параметров | Лето 2026 | Независимый аналитик | Бесплатная публикация |
Почему квадриллион параметров пока невозможен?
-
Триллион уже есть, но с оговоркой. Ещё в начале 2021 года Google масштабировала Switch Transformer до 1,6 трлн параметров. Но это разреженная архитектура MoE (Mixture of Experts, «смесь экспертов», когда для каждого запроса активируется лишь часть модели). Активных параметров было в разы меньше.
-
Активных параметров у современных моделей не больше 150 млрд. Открытая модель Kimi K3 заявляет 2,8 трлн общих параметров, но активных только 104 млрд. У флагманских моделей Claude, по оценке автора анализа, активных параметров предположительно около 150 млрд.
-
Для обучения модели с квадриллионом параметров нужно 296 000 «Википедий». Автор ввёл единицу Wk (Wikipedia Token Unit), условный объём токенов (токен, минимальная единица текста для модели, примерно три четверти слова) во всех языковых разделах Википедии: около 67,5 млрд токенов. Модели на 1 трлн параметров хватит 296 Wk, а на квадриллион нужно 296 000 Wk.
-
Столько текста на планете нет. Все расшифровки роликов YouTube за всё время существования платформы дают 68,9 Wk. Библиотека Конгресса США, крупнейшая в мире, около 51,9 Wk. Крупнейший открытый датасет FineWeb (2024 год) содержит 222 Wk. Даже если сложить всё вместе, до 296 000 Wk не добраться.
-
Синтетические данные не спасают. Обучать модель на текстах, сгенерированных другой моделью, автор сравнивает с попыткой сделать ксерокопию с ксерокопии: без притока оригинальных идей модель деградирует и начинает выдавать галлюцинации (когда ИИ уверенно выдумывает то, чего не было).
Русский контекст: дефицит данных виден в цифрах
Весь годовой выпуск научных статей на планете (по оценке автора, около 5,14 млн статей в 2022 году) составляет всего 0,5 Wk. То есть учёные всего мира за год производят меньше половины одной Википедии.
Для сравнения: корпус всех текстов и комментариев Хабра (крупнейшая русскоязычная IT-площадка) оценивается в 17 mWk (тысячных долей Wk). Человек, читающий по часу в день на протяжении 80 лет, прочтёт 8,59 mWk.
А сгоревшая Александрийская библиотека со всеми её полумиллионом папирусов, это всего 0,12 Wk.
Эти цифры наглядно показывают: качественного текста на русском языке ещё меньше, чем на английском. Если английская Википедия занимает примерно 10,6% от общего объёма всех языковых разделов, то русская, существенно меньше. Для любой компании, обучающей большие языковые модели на русском (будь то YandexGPT или GigaChat), потолок данных наступает раньше.
| Параметр | Зарубежные LLM | YandexGPT / GigaChat |
|---|---|---|
| Объём русскоязычных данных | Малая доля обучающей выборки | Основной фокус, но объём ограничен |
| Доступ из РФ | Часто ограничен или через VPN | Полный, без ограничений |
| Масштаб модели | До 2,8 трлн параметров (Kimi K3) | Не раскрывается |
Прямое сравнение размеров моделей невозможно: ни Яндекс, ни Сбер не публикуют число параметров своих моделей. Но ограничение по данным действует одинаково для всех.
Как попробовать оценить масштаб самостоятельно?
-
Откройте страницу статистики Википедии (stats.wikimedia.org) и посмотрите, сколько слов содержит русский раздел. Умножьте на 1,365, чтобы получить приблизительное число токенов.
-
Сравните результат с объёмом любого датасета, на котором вы работаете. Если ваш корпус текстов для дообучения (fine-tuning, обучение модели на ваших примерах под узкую задачу) меньше 0,001 Wk, это нормально для узкой задачи, но бесконечно далеко от масштабов, нужных для обучения фундаментальной модели.
-
Попробуйте задать вашей нейросети (YandexGPT, GigaChat или ChatGPT) вопрос на узкую тему, например биографию малоизвестного русского поэта. Результат покажет, где именно модель начинает галлюцинировать из-за нехватки данных.
Что делать с этим прямо сейчас?
Авторам Дзена. Качественный авторский текст, написанный человеком, становится всё ценнее. Нейросети уже упираются в потолок данных, и ваши уникальные материалы, это именно тот ресурс, которого не хватает. Не бойтесь, что ИИ «всё напишет сам»: без оригинального контента модели деградируют.
Маркетологам. Рост моделей замедляется не из-за денег или железа, а из-за дефицита данных. Это значит, что скачкообразного улучшения генерации текста в ближайшие годы может не произойти. Планируйте бюджеты, исходя из текущих возможностей моделей, а не из обещаний «скоро ИИ заменит всех».
Предпринимателям в РФ. Для русского языка потолок данных ещё ближе. Если вы собираете корпоративную базу знаний, структурированные тексты, документацию, FAQ, это актив, который может пригодиться для дообучения моделей под ваши задачи.
Этот анализ ценен не формулами, а простой мыслью: рост больших языковых моделей упирается не в деньги и не в чипы, а в то, что человечество физически не написало достаточно качественного текста. По моим наблюдениям, авторы Дзена часто переоценивают скорость прогресса ИИ и недооценивают ценность собственного контента. Пока индустрия ищет выход (синтетические данные, мультимодальность, новые архитектуры), ни один из этих путей не гарантирует прорыва. Если вы автор и пишете оригинальные тексты, вы буквально создаёте тот ресурс, которого не хватает всей отрасли. Оговорка: все расчёты в анализе приблизительные и основаны на допущениях автора, точные объёмы обучающих данных коммерческих моделей не раскрываются. Сегодня стоит сделать одно: посчитайте объём своего архива текстов. Это ваш актив, и он дорожает.
Частые вопросы
Когда появятся модели с квадриллионом параметров?
По расчётам из анализа, при текущем подходе к обучению, скорее всего, никогда. Для этого потребовалось бы 296 000 «Википедий» обучающих данных, а столько качественного текста на планете не существует. Либо нужен прорыв: кратное повышение эффективности обучения или принципиально новая архитектура.
Зачем модели столько параметров, если активных всё равно мало?
Архитектура MoE (смесь экспертов) позволяет модели хранить знания в триллионах параметров, но для каждого конкретного запроса активировать только часть, обычно в 20 раз меньше общего числа. Это экономит вычислительные ресурсы, но не снимает проблему нехватки данных для обучения.
Влияет ли дефицит данных на русскоязычные модели сильнее?
Да. Русскоязычных качественных текстов объективно меньше, чем англоязычных. Английская Википедия, по оценке автора, составляет около 10,6% от общего объёма всех языковых разделов. Для YandexGPT и GigaChat это означает, что потолок доступных обучающих данных ниже, чем у моделей, обучаемых преимущественно на английском.
Квадриллион параметров остаётся красивой цифрой в заголовках, но арифметика говорит иное: чтобы до него добраться, нужно либо переизобрести обучение, либо дождаться, пока человечество напишет в тысячу раз больше, чем написало за всю свою историю.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Как отменить подписку на айфоне на платное приложение за 2 минуты: пошаговая инструкция
Перечитываю задание. H1 заявлен как «Как отменить подписку на платное приложение на айфоне» — это how-to про отмену подписки на iPhone. Но оригинальный текст…
Бот «Паспарту» на Hermes Agent: модели DeepSeek вместо OpenAI для авторов Дзена
Текст обрывается на полуслове, но фактов из источника достаточно для полноценного how-to. Работаю строго по тому, что есть. Открытый ИИ-ассистент «Паспарту» на…
Модель OpenAI взломала Hugging Face: Альтман призвал к замедлению развития ИИ
Компания OpenAI, лидер в разработке ИИ, устами своего CEO Сэма Альтмана призвала замедлить темпы развития искусственного интеллекта после того, как собственная…
Комментарии