RWB обучила LLM на 11 трлн токенов с нуля: редкий для РФ открытый отчёт о машинном обучении
Компания RWB (подразделение Wildberries) опубликовала детальный разбор того, как её команда с нуля, без загрузки готовых весов, обучила собственную языковую модель на 2 миллиарда параметров и довела объём обучающих данных до 11 триллионов токенов.

Впервые крупный российский бизнес публично раскрыл полный цикл предварительного обучения LLM (large language model, большая языковая модель, то есть нейросеть, обученная на массиве текстов и способная генерировать связный язык) с конкретными цифрами, ошибками и архитектурными экспериментами. Для рынка РФ это редкость: обычно такие отчёты выходят только из лабораторий Кремниевой долины.
Команда обучения и инференса (процесс, при котором обученная модель выдаёт ответ на запрос) моделей RWB рассказала об этом в техническом блоге. Ранее подразделение выпустило семейство моделей BerryLM, дообученных на русский язык. Крупнейшая из них, BerryLM-XL, вошла в топ-3 бенчмарка MERA, российского теста качества языковых моделей. Теперь команда пошла дальше и собрала собственный пайплайн (воспроизводимый конвейер) предварительного обучения, чтобы контролировать состав данных и добавлять доменные знания под задачи Wildberries.
| Параметр | Значение |
|---|---|
| Кто | RWB, подразделение Wildberries |
| Что сделано | Полный цикл pretrain-обучения модели с нуля |
| Архитектура | Гибридная, на основе Qwen3.5-2B-Base |
| Объём данных | до 11 трлн токенов (токен, минимальная единица текста для модели, примерно 3/4 слова) |
| Фреймворк | Megatron-LM |
| Дата публикации архитектуры Qwen3.5-2B | февраль 2026 года |
Что именно сделала команда RWB?
Если говорить просто, LLM это в машинном обучении прежде всего инфраструктурная задача. Нужен конвейер, который можно перезапускать с новыми данными, другой архитектурой или другим расписанием и получать воспроизводимый результат. Именно такой конвейер и построила команда.
Обучение шло в два этапа:
- Компактный эксперимент на 1 трлн токенов. Команда проверила, что модель ведёт себя стабильно, получила адекватные метрики на основных бенчмарках и выявила нехватку математических данных в исходном бленде.
- Расширенный эксперимент на 11 трлн токенов с трёхфазным доменным расписанием, где данные делились на категории: веб, код, математика, многоязычные тексты, знания и рассуждения.
Данные не собирали с нуля. Использовали открытые датасеты (обучающие данные), сгруппированные по доменам. Синтетику сами не генерировали, но подключали открытые синтетические наборы. Для быстрого подключения новых источников задействовали ИИ-агента (автономную программу на базе нейросети): ему давали десять случайных записей и описание формата, а он сам писал код конвертера.
Архитектура модели интересна тем, что совмещает два механизма внимания: привычное квадратичное (SDPA, оно точнее, но дороже по вычислениям) и рекуррентное GatedDeltaNet (линейная сложность, то есть ресурсы растут пропорционально длине текста, а не в квадрате). Команда обучала только текстовую часть, хотя исходная Qwen3.5-2B задумана как мультимодальная (способная работать с разными типами данных: текст, изображения, звук).
Где обнаружились подводные камни?
Во время обучения команда заметила парадокс с бенчмарком MMLU (стандартный тест знаний модели по 57 предметным областям). Пока остальные метрики росли, MMLU держался на уровне случайного угадывания и «ожил» только на второй фазе.
Разгадка оказалась в формате вопроса. В двух запусках RWB формат completion-form (CF, где модель дописывает ответ) раньше выходил на плато. А формат multiple-choice (MCF, где модель выбирает из вариантов) стартовал медленнее, но продолжал расти до конца фазы затухания. Для практиков это сигнал: один и тот же бенчмарк может давать разную картину в зависимости от формата подачи.
Параллельно команда протестировала модификацию механизма внимания XSA (Exclusive Self-Attention) на другой модели, Qwen3-1.7B-Base. Один парный прогон дал снижение ошибки на валидации (Δ val loss = −0,009) и прирост +1,6 процентных пункта на MMLU ценой 5-10% пропускной способности. Команда честно оговаривает: повторные прогоны на разных начальных параметрах пока не проводились, статистическую воспроизводимость ещё предстоит проверить.
Финальные метрики и честные оговорки
Эксперимент на 11 трлн токенов дал метрики, сопоставимые с внутренним замером оригинальной Qwen3.5-2B-Base на бенчмарках здравого смысла (commonsense benchmarks). Но команда подчёркивает: сравнение валидно только внутри их собственного зафиксированного протокола оценки.
Слабое место: качество на математических и логических задачах. RWB планирует исправить это, расширив коллекцию доменных датасетов.
Мы не ставили целью обучить base-модель, которая обошла бы открытые аналоги. Честное сравнение потребовало бы очистить корпус от утечек бенчмарков, но такой контур фильтрации данных в начале наших экспериментов ещё не был готов. : Команда обучения и инференса моделей RWB
Модели семейства BerryLM уже работают в продуктах Wildberries: ИИ-ассистент для покупателей, поиск и сравнение товаров, генерация ответов продавцов на отзывы. Собственный пайплайн обучения означает, что Wildberries сможет затачивать модели под свои задачи без зависимости от внешних поставщиков, а продавцы на площадке получат более точные инструменты для работы с контентом.
Что это значит для вас?
Авторам Дзена и копирайтерам. Публикация RWB показывает, как LLM это в машинном обучении устроено изнутри. Если вы пишете о технологиях или используете нейросети для контента, понимание того, что модель обучена на конкретном бленде данных (а не «знает всё»), помогает точнее формулировать промпты (запросы к нейросети) и не ждать от модели невозможного.
Маркетологам и продавцам на Wildberries. Инструменты для ответов на отзывы и вопросы покупателей со временем станут точнее: команда получила возможность добавлять в обучение именно те данные, которые нужны для e-commerce. Следите за обновлениями ИИ-ассистентов на площадке.
Предпринимателям и разработчикам в РФ. Эксперимент доказывает, что российская команда может собрать полный цикл обучения модели на открытых данных. Из доступных в РФ альтернатив для собственных экспериментов с языковыми моделями стоит смотреть на YandexGPT (через API) и GigaChat от Сбера, но они закрытые. Для обучения своих моделей придётся идти путём RWB: открытые архитектуры, открытые датасеты, свой пайплайн.
По моим наблюдениям, это первый настолько подробный публичный разбор pretrain-цикла от российской продуктовой компании. Обычно такие отчёты пишут исследовательские лаборатории, а не команды внутри маркетплейса. Особенно ценно то, чего в англоязычных материалах почти не встретишь: честный рассказ про подводные камни с форматами бенчмарков и оговорка, что сравнивать с лидербордами некорректно без фильтрации утечек. Если вы задумывались о дообучении (fine-tuning) моделей под свои задачи, начните с малого: возьмите открытую модель на 1-2 миллиарда параметров и попробуйте дообучить на своих данных через Hugging Face. Опыт RWB подтверждает: даже большая компания начинала именно с компактных экспериментов, прежде чем масштабироваться до 11 триллионов токенов.
Команда прямо говорит: метрики валидны только внутри их протокола оценки. Модель пока слаба в математике и логике. А статистическая воспроизводимость эксперимента с XSA не подтверждена. Это исследовательский отчёт, а не готовый продукт для скачивания.
Wildberries доказала себе и рынку, что собрать воспроизводимый цикл обучения языковой модели с нуля в российских условиях реально. Для тех, кто работает с ИИ в РФ, главный практический вывод прост: не ждите идеальной модели от вендора, стройте свой конвейер данных и экспериментируйте на малых масштабах.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Робот Moxie «умер» после смены владельца: мультик про роботов для детей стал реальностью
Почему это важно Робот Moxie, созданный для терапии детей с аутизмом и СДВГ, потерял ключевые функции после смены владельца компании-производителя. Дети,…

DeepSeek показала, что такое ИИ-агент из модулей: конструктор Harness вышел под MIT
DeepSeek выложила в открытый доступ DeepSeek Harness v0.1, конструктор для сборки собственных ИИ-агентов, где любой компонент от модели до интерфейса можно…

ИИ пишет код и архитектуру для разработчика
Компания МТС через подразделение MWS (MTC Web Services) показала на митапе для Go-разработчиков, как ИИ-агент получает собственную изолированную среду…
Комментарии