Обучение нейросети с нуля на текстах Warhammer 40K: бесплатный гайд с кодом на Хабре
Почему это важно Русскоязычный практический разбор того, как собрать и предобучить собственную языковую модель с нуля, от токенизатора до запуска, появляется…

Русскоязычный практический разбор того, как собрать и предобучить собственную языковую модель с нуля, от токенизатора до запуска, появляется редко: обычно такие гайды существуют только на английском и без привязки к конкретному датасету.
Владимир, автор цикла на Хабре, опубликовал третью часть пошагового руководства по созданию небольшой языковой модели с нуля, и на этот раз перешёл от теории к сборке и предобучению модели на текстах вселенной Warhammer 40K.
В первых двух частях он обучил токенизатор (программу, которая разбивает текст на минимальные единицы, токены), собрал обучающие данные и реализовал класс трансформер-блока. Третья часть собирает всё воедино: decoder-only архитектура (тип модели, где текст генерируется последовательно, слово за словом, как в GPT), позиционные кодировки, финальный слой и запуск обучения. Для тех, кто давно хотел разобраться в обучении нейросети с нуля на русскоязычном материале, это готовый маршрут с кодом и объяснениями.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Третья часть цикла по сборке и предобучению LLM с нуля на датасете Warhammer 40K | Опубликовано на Хабре (точную дату автор не указал) | Владимир, автор цикла на Хабре | Бесплатно, открытый доступ |
Что разобрано в третьей части?
-
Decoder-only архитектура целиком. Автор объясняет, как токены превращаются в векторы (эмбеддинги, числовые представления слов), как к ним добавляется информация о позиции, как последовательность проходит через несколько трансформер-блоков и как финальный слой выдаёт логиты (необработанные числа, из которых модель вычисляет вероятность следующего слова).
-
Embedding-слой простым языком. Модель не понимает слова напрямую: для неё токен это число. Embedding-слой превращает число в вектор, с которым можно работать математически. В процессе обучения нейросети с нуля модель подбирает векторы так, чтобы похожие по контексту токены оказывались рядом в векторном пространстве.
-
Пять видов позиционных кодировок. Автор разбирает каждый подход отдельно:
- Синусоидальные (фиксированные), из оригинальной статьи «Attention Is All You Need» (2017), дёшево по памяти, но модель не может адаптировать позиционное представление под данные.
- Обучаемые абсолютные, таблица, которая учится вместе с моделью, но не обрабатывает последовательности длиннее заданного максимума.
- Относительные, модели сообщают не номер позиции, а расстояние между токенами.
- RoPE (Rotary Position Embedding), используется в LLaMA, Qwen, Mistral: вместо отдельной таблицы модель «поворачивает» query- и key-векторы на угол, зависящий от позиции, и расстояние между токенами автоматически учитывается при расчёте внимания.
-
ALiBi (Attention with Linear Biases), вообще не добавляет позиционных векторов, а вводит штраф за расстояние прямо в механизм внимания.
-
Зачем нужно несколько трансформер-блоков подряд. Каждый блок выполняет две задачи: attention-часть позволяет токену «посмотреть» на предыдущие токены и собрать контекст, а feed-forward сеть обрабатывает представление каждого токена независимо. Несколько блоков подряд углубляют понимание.
Как попробовать?
- Начните с первой части цикла на Хабре, где автор обучает токенизатор и собирает обучающие данные (pretrain-датасет) из текстов Warhammer 40K.
- Пройдите вторую часть, реализацию трансформер-блока, чтобы понять, из чего состоит «кирпич» модели.
- Перейдите к третьей части: сборка decoder-only модели и запуск предобучения. Код и объяснения доступны в статье.
- Дождитесь следующих частей цикла: автор анонсировал SFT-этап (дообучение модели на парах «вопрос-ответ») и интеграцию с Hugging Face (платформа для хранения и обмена моделями).
Есть ли аналоги для русскоязычного автора?
Если вам нужна не самостоятельная сборка модели, а готовый инструмент для работы с текстом на русском, в России доступны YandexGPT и GigaChat. Но это закрытые модели (закрытая модель, продукт, код которого недоступен, пользователь работает только через интерфейс): вы не видите архитектуру, не управляете обучением и не выбираете данные. Цикл Владимира решает другую задачу: он показывает, как устроена модель изнутри и как пройти путь обучения нейросети с нуля самостоятельно. Для автора Дзена или маркетолога, который хочет понять, что происходит «под капотом» нейросетей, это знание полезнее, чем ещё один API.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Даже если вы не программист, прочитайте хотя бы раздел про embedding-слой и позиционные кодировки. Когда вы пишете промпт (текстовую инструкцию для нейросети), вы по сути формируете ту самую входную последовательность токенов. Понимание того, что модель не «читает слова», а работает с числами и позициями, меняет подход к формулировкам.
Маркетологу. Цикл показывает, что обучить небольшую модель на собственных данных можно без бюджета крупной корпорации. Если у вас накоплена база текстов (отзывы, карточки товаров, FAQ), дообучение (fine-tuning, обучение модели на ваших примерах под узкую задачу) на них перестаёт быть абстракцией.
Предпринимателю в РФ. Все инструменты из цикла открытые: Python, PyTorch. Никаких санкционных ограничений, никакой зависимости от зарубежных API. Для внутренних задач, где данные нельзя отправлять на внешний сервер, собственная модель может оказаться единственным вариантом.
Цикл Владимира закрывает заметную дыру: на русском языке почти нет пошаговых разборов того, как собрать языковую модель с нуля и довести её до работающего состояния. Warhammer 40K как датасет, выбор нестандартный, но именно он делает материал живым: автор не прячется за абстрактными бенчмарками, а показывает конкретный путь от текстов до модели.
Оговорка: это учебный проект, а не конкурент GPT-4 или YandexGPT. Маленькая модель на узком датасете не будет отвечать на произвольные вопросы так же, как большие закрытые модели. Но ценность здесь в понимании механики, а не в продукте.
Что сделать сегодня: откройте первую часть цикла на Хабре, запустите код токенизатора и посмотрите, как ваш собственный текст (хоть статья с Дзена) разбивается на токены. Это занимает полчаса и навсегда меняет представление о том, как нейросеть «видит» ваши тексты.
Частые вопросы
Нужно ли уметь программировать, чтобы пройти цикл?
Да. Цикл написан на Python с использованием PyTorch, и автор приводит реальный код. Без базовых навыков программирования запустить его не получится. Но разделы с объяснениями архитектуры полезны и без кода: они дают понимание того, как устроены все GPT-подобные модели.
Можно ли использовать свои данные вместо текстов Warhammer 40K?
Да. Автор описывает общий процесс: токенизация, сборка датасета, предобучение. Вместо текстов WH40K можно подставить любой корпус, например статьи с Дзена, документацию компании или базу отзывов. Главное, чтобы данных хватило для обучения (автор не называет минимальный объём в этой части, но обещает детали в следующих).
Когда выйдут следующие части цикла?
Автор анонсировал SFT-этап (дообучение на парах «вопрос-ответ») и интеграцию с Hugging Face, но конкретных дат не назвал. Содержание цикла, по его словам, может меняться и дополняться.
Для тех, кто откладывал разбор архитектуры трансформеров «на потом», третья часть цикла Владимира, это точка входа: код открыт, объяснения на русском, а датасет достаточно необычный, чтобы не заснуть на полпути.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

YouTube ужесточил политику контента: три типа ИИ-видео лишают монетизации с 16 июля
YouTube усилил политику контента и монетизации: с 16 июля три типа видео из нейросетей лишают заработка на платформе, и это касается всех участников…

Тест Тьюринга для нейросети Claude Fable 5: где модель себя выдаёт
Я вижу, что оригинал обрывается на полуслове. Работаю строго по тем фактам, которые есть в переданном тексте. Вот тело новости: Anthropic называет Fable 5…

AI-отчёты в Google Search Console: что они показывают и где слепые зоны
Google добавил в Search Console отдельные отчёты по трафику из своих ИИ-поверхностей, и теперь можно увидеть, сколько показов и кликов дали AI Overviews и AI…
Комментарии