Игорь Градов
Игорь Градов
5 мин
ai

Обучение нейросети с нуля на текстах Warhammer 40K: бесплатный гайд с кодом на Хабре

Почему это важно Русскоязычный практический разбор того, как собрать и предобучить собственную языковую модель с нуля, от токенизатора до запуска, появляется…

Обучение нейросети с нуля на текстах Warhammer 40K: бесплатный гайд с кодом на Хабре
Почему это важно

Русскоязычный практический разбор того, как собрать и предобучить собственную языковую модель с нуля, от токенизатора до запуска, появляется редко: обычно такие гайды существуют только на английском и без привязки к конкретному датасету.

Владимир, автор цикла на Хабре, опубликовал третью часть пошагового руководства по созданию небольшой языковой модели с нуля, и на этот раз перешёл от теории к сборке и предобучению модели на текстах вселенной Warhammer 40K.

В первых двух частях он обучил токенизатор (программу, которая разбивает текст на минимальные единицы, токены), собрал обучающие данные и реализовал класс трансформер-блока. Третья часть собирает всё воедино: decoder-only архитектура (тип модели, где текст генерируется последовательно, слово за словом, как в GPT), позиционные кодировки, финальный слой и запуск обучения. Для тех, кто давно хотел разобраться в обучении нейросети с нуля на русскоязычном материале, это готовый маршрут с кодом и объяснениями.

Что Когда Кто выпустил Цена
Третья часть цикла по сборке и предобучению LLM с нуля на датасете Warhammer 40K Опубликовано на Хабре (точную дату автор не указал) Владимир, автор цикла на Хабре Бесплатно, открытый доступ

Что разобрано в третьей части?

  • Decoder-only архитектура целиком. Автор объясняет, как токены превращаются в векторы (эмбеддинги, числовые представления слов), как к ним добавляется информация о позиции, как последовательность проходит через несколько трансформер-блоков и как финальный слой выдаёт логиты (необработанные числа, из которых модель вычисляет вероятность следующего слова).

  • Embedding-слой простым языком. Модель не понимает слова напрямую: для неё токен это число. Embedding-слой превращает число в вектор, с которым можно работать математически. В процессе обучения нейросети с нуля модель подбирает векторы так, чтобы похожие по контексту токены оказывались рядом в векторном пространстве.

  • Пять видов позиционных кодировок. Автор разбирает каждый подход отдельно:

  • Синусоидальные (фиксированные), из оригинальной статьи «Attention Is All You Need» (2017), дёшево по памяти, но модель не может адаптировать позиционное представление под данные.
  • Обучаемые абсолютные, таблица, которая учится вместе с моделью, но не обрабатывает последовательности длиннее заданного максимума.
  • Относительные, модели сообщают не номер позиции, а расстояние между токенами.
  • RoPE (Rotary Position Embedding), используется в LLaMA, Qwen, Mistral: вместо отдельной таблицы модель «поворачивает» query- и key-векторы на угол, зависящий от позиции, и расстояние между токенами автоматически учитывается при расчёте внимания.
  • ALiBi (Attention with Linear Biases), вообще не добавляет позиционных векторов, а вводит штраф за расстояние прямо в механизм внимания.

  • Зачем нужно несколько трансформер-блоков подряд. Каждый блок выполняет две задачи: attention-часть позволяет токену «посмотреть» на предыдущие токены и собрать контекст, а feed-forward сеть обрабатывает представление каждого токена независимо. Несколько блоков подряд углубляют понимание.

Как попробовать?

  1. Начните с первой части цикла на Хабре, где автор обучает токенизатор и собирает обучающие данные (pretrain-датасет) из текстов Warhammer 40K.
  2. Пройдите вторую часть, реализацию трансформер-блока, чтобы понять, из чего состоит «кирпич» модели.
  3. Перейдите к третьей части: сборка decoder-only модели и запуск предобучения. Код и объяснения доступны в статье.
  4. Дождитесь следующих частей цикла: автор анонсировал SFT-этап (дообучение модели на парах «вопрос-ответ») и интеграцию с Hugging Face (платформа для хранения и обмена моделями).

Есть ли аналоги для русскоязычного автора?

Если вам нужна не самостоятельная сборка модели, а готовый инструмент для работы с текстом на русском, в России доступны YandexGPT и GigaChat. Но это закрытые модели (закрытая модель, продукт, код которого недоступен, пользователь работает только через интерфейс): вы не видите архитектуру, не управляете обучением и не выбираете данные. Цикл Владимира решает другую задачу: он показывает, как устроена модель изнутри и как пройти путь обучения нейросети с нуля самостоятельно. Для автора Дзена или маркетолога, который хочет понять, что происходит «под капотом» нейросетей, это знание полезнее, чем ещё один API.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Даже если вы не программист, прочитайте хотя бы раздел про embedding-слой и позиционные кодировки. Когда вы пишете промпт (текстовую инструкцию для нейросети), вы по сути формируете ту самую входную последовательность токенов. Понимание того, что модель не «читает слова», а работает с числами и позициями, меняет подход к формулировкам.

Маркетологу. Цикл показывает, что обучить небольшую модель на собственных данных можно без бюджета крупной корпорации. Если у вас накоплена база текстов (отзывы, карточки товаров, FAQ), дообучение (fine-tuning, обучение модели на ваших примерах под узкую задачу) на них перестаёт быть абстракцией.

Предпринимателю в РФ. Все инструменты из цикла открытые: Python, PyTorch. Никаких санкционных ограничений, никакой зависимости от зарубежных API. Для внутренних задач, где данные нельзя отправлять на внешний сервер, собственная модель может оказаться единственным вариантом.

Мнение редакции dzen.guru

Цикл Владимира закрывает заметную дыру: на русском языке почти нет пошаговых разборов того, как собрать языковую модель с нуля и довести её до работающего состояния. Warhammer 40K как датасет, выбор нестандартный, но именно он делает материал живым: автор не прячется за абстрактными бенчмарками, а показывает конкретный путь от текстов до модели.

Оговорка: это учебный проект, а не конкурент GPT-4 или YandexGPT. Маленькая модель на узком датасете не будет отвечать на произвольные вопросы так же, как большие закрытые модели. Но ценность здесь в понимании механики, а не в продукте.

Что сделать сегодня: откройте первую часть цикла на Хабре, запустите код токенизатора и посмотрите, как ваш собственный текст (хоть статья с Дзена) разбивается на токены. Это занимает полчаса и навсегда меняет представление о том, как нейросеть «видит» ваши тексты.

Частые вопросы

Нужно ли уметь программировать, чтобы пройти цикл?

Да. Цикл написан на Python с использованием PyTorch, и автор приводит реальный код. Без базовых навыков программирования запустить его не получится. Но разделы с объяснениями архитектуры полезны и без кода: они дают понимание того, как устроены все GPT-подобные модели.

Можно ли использовать свои данные вместо текстов Warhammer 40K?

Да. Автор описывает общий процесс: токенизация, сборка датасета, предобучение. Вместо текстов WH40K можно подставить любой корпус, например статьи с Дзена, документацию компании или базу отзывов. Главное, чтобы данных хватило для обучения (автор не называет минимальный объём в этой части, но обещает детали в следующих).

Когда выйдут следующие части цикла?

Автор анонсировал SFT-этап (дообучение на парах «вопрос-ответ») и интеграцию с Hugging Face, но конкретных дат не назвал. Содержание цикла, по его словам, может меняться и дополняться.

Для тех, кто откладывал разбор архитектуры трансформеров «на потом», третья часть цикла Владимира, это точка входа: код открыт, объяснения на русском, а датасет достаточно необычный, чтобы не заснуть на полпути.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

YouTube ужесточил политику контента: три типа ИИ-видео лишают монетизации с 16 июля
ai

YouTube ужесточил политику контента: три типа ИИ-видео лишают монетизации с 16 июля

YouTube усилил политику контента и монетизации: с 16 июля три типа видео из нейросетей лишают заработка на платформе, и это касается всех участников…

5 мин
Тест Тьюринга для нейросети Claude Fable 5: где модель себя выдаёт
ai

Тест Тьюринга для нейросети Claude Fable 5: где модель себя выдаёт

Я вижу, что оригинал обрывается на полуслове. Работаю строго по тем фактам, которые есть в переданном тексте. Вот тело новости: Anthropic называет Fable 5…

7 мин
AI-отчёты в Google Search Console: что они показывают и где слепые зоны
ai

AI-отчёты в Google Search Console: что они показывают и где слепые зоны

Google добавил в Search Console отдельные отчёты по трафику из своих ИИ-поверхностей, и теперь можно увидеть, сколько показов и кликов дали AI Overviews и AI…

6 мин