Игорь Градов
Игорь Градов
6 мин
ai

RWB обучила LLM на 11 трлн токенов с нуля: редкий для РФ открытый отчёт о машинном обучении

Компания RWB (подразделение Wildberries) опубликовала детальный разбор того, как её команда с нуля, без загрузки готовых весов, обучила собственную языковую модель на 2 миллиарда параметров и довела объём обучающих данных до 11 триллионов токенов.

RWB обучила LLM на 11 трлн токенов с нуля: редкий для РФ открытый отчёт о машинном обучении
Почему это важно

Впервые крупный российский бизнес публично раскрыл полный цикл предварительного обучения LLM (large language model, большая языковая модель, то есть нейросеть, обученная на массиве текстов и способная генерировать связный язык) с конкретными цифрами, ошибками и архитектурными экспериментами. Для рынка РФ это редкость: обычно такие отчёты выходят только из лабораторий Кремниевой долины.

Команда обучения и инференса (процесс, при котором обученная модель выдаёт ответ на запрос) моделей RWB рассказала об этом в техническом блоге. Ранее подразделение выпустило семейство моделей BerryLM, дообученных на русский язык. Крупнейшая из них, BerryLM-XL, вошла в топ-3 бенчмарка MERA, российского теста качества языковых моделей. Теперь команда пошла дальше и собрала собственный пайплайн (воспроизводимый конвейер) предварительного обучения, чтобы контролировать состав данных и добавлять доменные знания под задачи Wildberries.

Параметр Значение
Кто RWB, подразделение Wildberries
Что сделано Полный цикл pretrain-обучения модели с нуля
Архитектура Гибридная, на основе Qwen3.5-2B-Base
Объём данных до 11 трлн токенов (токен, минимальная единица текста для модели, примерно 3/4 слова)
Фреймворк Megatron-LM
Дата публикации архитектуры Qwen3.5-2B февраль 2026 года

Что именно сделала команда RWB?

Если говорить просто, LLM это в машинном обучении прежде всего инфраструктурная задача. Нужен конвейер, который можно перезапускать с новыми данными, другой архитектурой или другим расписанием и получать воспроизводимый результат. Именно такой конвейер и построила команда.

Обучение шло в два этапа:

  • Компактный эксперимент на 1 трлн токенов. Команда проверила, что модель ведёт себя стабильно, получила адекватные метрики на основных бенчмарках и выявила нехватку математических данных в исходном бленде.
  • Расширенный эксперимент на 11 трлн токенов с трёхфазным доменным расписанием, где данные делились на категории: веб, код, математика, многоязычные тексты, знания и рассуждения.

Данные не собирали с нуля. Использовали открытые датасеты (обучающие данные), сгруппированные по доменам. Синтетику сами не генерировали, но подключали открытые синтетические наборы. Для быстрого подключения новых источников задействовали ИИ-агента (автономную программу на базе нейросети): ему давали десять случайных записей и описание формата, а он сам писал код конвертера.

Архитектура модели интересна тем, что совмещает два механизма внимания: привычное квадратичное (SDPA, оно точнее, но дороже по вычислениям) и рекуррентное GatedDeltaNet (линейная сложность, то есть ресурсы растут пропорционально длине текста, а не в квадрате). Команда обучала только текстовую часть, хотя исходная Qwen3.5-2B задумана как мультимодальная (способная работать с разными типами данных: текст, изображения, звук).

Где обнаружились подводные камни?

Во время обучения команда заметила парадокс с бенчмарком MMLU (стандартный тест знаний модели по 57 предметным областям). Пока остальные метрики росли, MMLU держался на уровне случайного угадывания и «ожил» только на второй фазе.

Разгадка оказалась в формате вопроса. В двух запусках RWB формат completion-form (CF, где модель дописывает ответ) раньше выходил на плато. А формат multiple-choice (MCF, где модель выбирает из вариантов) стартовал медленнее, но продолжал расти до конца фазы затухания. Для практиков это сигнал: один и тот же бенчмарк может давать разную картину в зависимости от формата подачи.

Параллельно команда протестировала модификацию механизма внимания XSA (Exclusive Self-Attention) на другой модели, Qwen3-1.7B-Base. Один парный прогон дал снижение ошибки на валидации (Δ val loss = −0,009) и прирост +1,6 процентных пункта на MMLU ценой 5-10% пропускной способности. Команда честно оговаривает: повторные прогоны на разных начальных параметрах пока не проводились, статистическую воспроизводимость ещё предстоит проверить.

Финальные метрики и честные оговорки

Эксперимент на 11 трлн токенов дал метрики, сопоставимые с внутренним замером оригинальной Qwen3.5-2B-Base на бенчмарках здравого смысла (commonsense benchmarks). Но команда подчёркивает: сравнение валидно только внутри их собственного зафиксированного протокола оценки.

Слабое место: качество на математических и логических задачах. RWB планирует исправить это, расширив коллекцию доменных датасетов.

Мы не ставили целью обучить base-модель, которая обошла бы открытые аналоги. Честное сравнение потребовало бы очистить корпус от утечек бенчмарков, но такой контур фильтрации данных в начале наших экспериментов ещё не был готов. : Команда обучения и инференса моделей RWB

Почему это касается авторов контента

Модели семейства BerryLM уже работают в продуктах Wildberries: ИИ-ассистент для покупателей, поиск и сравнение товаров, генерация ответов продавцов на отзывы. Собственный пайплайн обучения означает, что Wildberries сможет затачивать модели под свои задачи без зависимости от внешних поставщиков, а продавцы на площадке получат более точные инструменты для работы с контентом.

Что это значит для вас?

Авторам Дзена и копирайтерам. Публикация RWB показывает, как LLM это в машинном обучении устроено изнутри. Если вы пишете о технологиях или используете нейросети для контента, понимание того, что модель обучена на конкретном бленде данных (а не «знает всё»), помогает точнее формулировать промпты (запросы к нейросети) и не ждать от модели невозможного.

Маркетологам и продавцам на Wildberries. Инструменты для ответов на отзывы и вопросы покупателей со временем станут точнее: команда получила возможность добавлять в обучение именно те данные, которые нужны для e-commerce. Следите за обновлениями ИИ-ассистентов на площадке.

Предпринимателям и разработчикам в РФ. Эксперимент доказывает, что российская команда может собрать полный цикл обучения модели на открытых данных. Из доступных в РФ альтернатив для собственных экспериментов с языковыми моделями стоит смотреть на YandexGPT (через API) и GigaChat от Сбера, но они закрытые. Для обучения своих моделей придётся идти путём RWB: открытые архитектуры, открытые датасеты, свой пайплайн.

Мнение редакции dzen.guru

По моим наблюдениям, это первый настолько подробный публичный разбор pretrain-цикла от российской продуктовой компании. Обычно такие отчёты пишут исследовательские лаборатории, а не команды внутри маркетплейса. Особенно ценно то, чего в англоязычных материалах почти не встретишь: честный рассказ про подводные камни с форматами бенчмарков и оговорка, что сравнивать с лидербордами некорректно без фильтрации утечек. Если вы задумывались о дообучении (fine-tuning) моделей под свои задачи, начните с малого: возьмите открытую модель на 1-2 миллиарда параметров и попробуйте дообучить на своих данных через Hugging Face. Опыт RWB подтверждает: даже большая компания начинала именно с компактных экспериментов, прежде чем масштабироваться до 11 триллионов токенов.

Где подвох

Команда прямо говорит: метрики валидны только внутри их протокола оценки. Модель пока слаба в математике и логике. А статистическая воспроизводимость эксперимента с XSA не подтверждена. Это исследовательский отчёт, а не готовый продукт для скачивания.

Wildberries доказала себе и рынку, что собрать воспроизводимый цикл обучения языковой модели с нуля в российских условиях реально. Для тех, кто работает с ИИ в РФ, главный практический вывод прост: не ждите идеальной модели от вендора, стройте свой конвейер данных и экспериментируйте на малых масштабах.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Робот Moxie «умер» после смены владельца: мультик про роботов для детей стал реальностью
ai

Робот Moxie «умер» после смены владельца: мультик про роботов для детей стал реальностью

Почему это важно Робот Moxie, созданный для терапии детей с аутизмом и СДВГ, потерял ключевые функции после смены владельца компании-производителя. Дети,…

5 мин
DeepSeek показала, что такое ИИ-агент из модулей: конструктор Harness вышел под MIT
ai

DeepSeek показала, что такое ИИ-агент из модулей: конструктор Harness вышел под MIT

DeepSeek выложила в открытый доступ DeepSeek Harness v0.1, конструктор для сборки собственных ИИ-агентов, где любой компонент от модели до интерфейса можно…

6 мин
ИИ пишет код и архитектуру для разработчика
ai

ИИ пишет код и архитектуру для разработчика

Компания МТС через подразделение MWS (MTC Web Services) показала на митапе для Go-разработчиков, как ИИ-агент получает собственную изолированную среду…

6 мин