Дообучение ruGPT3 подняло модель 2020 года до уровня Gemma3 1B от Google
Модель ruGPT-3 XL вышла в конце 2020 года, задолго до появления SFT (обучения следовать инструкциям, Supervised Fine-Tuning), и умела только продолжать текст, но российские разработчики показали, что современные методы дообучения превращают её в полноценную языковую модель уровня 2025 года.

Старый открытый претрейн (pretrain, базовая модель, обученная на сыром тексте) с 1,3 миллиарда параметров после двух этапов дообучения выдаёт результат, сопоставимый с Gemma3 1B, моделью Google 2025 года, и при этом не требует ни дорогих GPU-кластеров, ни месяцев обучения.
Речь о практическом эксперименте, описанном на Хабре. Автор взял семейство ruGPT-3, а точнее версию XL с 1,3 миллиарда параметров, которую в своё время обучали около десяти дней на 256 картах Tesla V100 (объём обучающих данных составлял 80 миллиардов токенов). Модель была конвертирована в современный формат пользователем @efreelancer, после чего к ней применили стандартные скрипты дообучения. Результат: из «продолжателя текста» 2020 года получилась модель, способная вести диалог, отвечать на вопросы и выполнять задания.
Три этапа, которые проходит любая LLM
Прежде чем переходить к инструкции, стоит понять логику. Обучение большой языковой модели (LLM, Large Language Model) состоит из трёх этапов:
- Pretrain (предобучение). Модель получает неразмеченный сырой текст и учится предсказывать следующий токен (токен, это минимальная единица текста: слово, часть слова или знак). На старте веса случайны, по мере обучения проявляются структуры. Результат: базовая модель, которая умеет только продолжать текст.
- SFT (Supervised Fine-Tuning, дообучение с учителем). Модели показывают размеченные примеры: вопрос, ответ, формат. Она учится не просто продолжать, а отвечать, рассуждать, выполнять задания.
- DPO (Direct Preference Optimization, прямая оптимизация предпочтений). Современный метод, упростивший и заменивший RLHF (обучение с подкреплением на обратной связи от людей). Модель «выравнивается»: из двух вариантов ответа учится выбирать лучший.
До 2022 года SFT попросту не существовало. Первой SFT-моделью стала InstructGPT, вышедшая в январе 2022 года. До этого все модели, включая ruGPT-3, были чистыми претрейнами и не понимали концепцию вопроса или задания.
Что понадобится
- Модель ruGPT-3 XL 1.3B, конвертированная в современный формат (ссылка на конвертацию: статья @efreelancer на Хабре)
- Видеокарта с достаточным объёмом VRAM (видеопамяти). Можно обучать как полный дообучение (full finetune), так и через LoRA, DoRA или QLoRA, методы, которые обучают лишь малую часть параметров и требуют меньше памяти
- DPO-датасет IlyaGusev/saiga_preferences от @Takagi, около 30 тысяч записей, 42 миллиона токенов
- Библиотека Hugging Face с SFTTrainer
- Для Windows: пакеты triton-windows и, возможно, flash-attn
- Время: несколько часов на две полные эпохи (полных прохода по датасету)
Пошаговая инструкция rugpt3 дообучения
-
Скачайте и конвертируйте модель. Исходная ruGPT-3 XL хранится в устаревшем формате. Используйте инструкцию @efreelancer для конвертации в формат, совместимый с современными скриптами Hugging Face.
-
Подготовьте SFT-датасет из DPO-данных. Датасет saiga_preferences содержит пары «хороший ответ / плохой ответ». Для этапа SFT нужно отбросить rejected-ответы (отклонённые варианты) и оставить только принятые. Формат, шаблон ChatML:
<|im_start|>system
Ты — полезный и вежливый AI-ассистент. Отвечай кратко и по делу.<|im_end|>
<|im_start|>user
Привет! Какое расстояние от Земли до Луны?<|im_end|>
<|im_start|>assistant
Привет! Среднее расстояние от Земли до Луны составляет около 384 400 километров.<|im_end|>
- Запустите обучение SFTTrainer. Для ускорения компиляции добавьте:
model = torch.compile(model, ...)
Одна эпоха (один полный проход по данным) занимает примерно полтора часа. Автор рекомендует две полные эпохи.
-
Отслеживайте loss. По ходу обучения значение loss (функции потерь, показателя ошибки модели) снижается. Это значит, что шаблоны усваиваются. Датасет маленький (42 миллиона токенов против 80 миллиардов токенов претрейна), поэтому новая информация не перезаписывает базовые знания модели.
-
Проверьте результат. После дообучения модель должна понимать вопрос, давать корректный ответ, соблюдать шаблон. Генерация завершается сама: токен EOS (End of Sequence, конец последовательности) генерируется корректно.
-
Конвертируйте в GGUF и перейдите на llama.cpp. Это упрощает использование модели локально, без тяжёлых фреймворков.
До дообучения ruGPT-3 на вопрос «Кто такой Чебурашка?» уходила в тему чебуреков и генерировала случайный текст про вкус. После rugpt3 дообучения на датасете Сайги модель даёт связный, корректный ответ о персонаже Успенского. На вопрос о Шекспире отвечает сухо, кратко, по делу, как ожидается от ассистента. Модель также усвоила «личность» из датасета: на вопрос «кто ты» представляется Сайгой, потому что именно так выглядели записи в обучающих данных.
- Датасет слишком маленький для универсальности. 30 тысяч записей достаточно для демонстрации, но не для полноценной LLM. Для понимания простого шаблона «вопрос-ответ» хватит 100-200 примеров, а вот для охвата всего спектра сценариев нужен датасет, хорошо сбалансированный по темам и форматам.
- Pretrain не управляется стабильно. Без SFT можно «затравкой» заставить модель переводить или отвечать, но результаты хаотичны: модель перескакивает на другую тему, даёт неполные ответы, путает контекст.
- Не путайте объём данных. 42 миллиона токенов SFT-датасета не перезапишут 80 миллиардов токенов претрейна. Это значит, что базовые знания модели сохранятся, но также значит, что новых знаний от SFT будет мало: модель учится формату, а не фактам.
- Модель наследует «личность» датасета. Если в обучающих данных ассистент представляется определённым именем, модель будет так делать. Учитывайте это при выборе датасета.
Что делать с этим прямо сейчас?
Разработчику и энтузиасту. Эксперимент показывает, что дообучение старого российского претрейна реально даже на одной видеокарте за несколько часов. Не нужно обучать модель с нуля, можно взять готовую базу и довести её до рабочего состояния.
Автору Дзена и копирайтеру. Если вы экспериментируете с локальными моделями для генерации черновиков на русском языке, ruGPT-3 XL после дообучения даёт результат, сравнимый (по заявлению автора эксперимента) с Gemma3 1B. Локальная модель на 1,3 миллиарда параметров не заменит GPT-4, но для коротких задач на русском может оказаться достаточной.
Предпринимателю в РФ. Модель полностью открытая, данные на русском, обучение не требует зарубежных облаков. Для задач, где критична локальность и независимость от внешних API (например, внутренний чат-бот компании), это рабочий вариант. Из российских аналогов на рынке доступны YandexGPT и GigaChat, но они закрытые и работают через API.
Этот эксперимент ценен не столько результатом (модель на 1,3 миллиарда параметров всё равно уступает моделям с десятками миллиардов), сколько методом. Он показывает, что SFT и DPO, это не магия, а понятная последовательность шагов, которую можно воспроизвести. Для тех, кто хочет разобраться, как устроены современные LLM изнутри, лучшего учебного проекта сложно придумать. Честная оговорка: автор сравнивает результат с Gemma3 1B, но формального бенчмарка в материале нет. «Сравним» здесь означает субъективную оценку автора, а не замер на стандартных тестах.
Попробуйте промпт-конструктор dzen.guru
Если вы тестируете локальные модели после дообучения, проверьте их на наших шаблонах промптов для авторов Дзена
Попробовать конструкторГлавное, что стоит вынести из этого эксперимента: претрейн 2020 года не мусор, а фундамент. Два этапа дообучения и несколько часов на GPU превращают «продолжатель текста» в работающего ассистента. Для авторов и разработчиков в России это практический путь к собственной локальной модели, без подписок, без внешних API и без ожидания, пока кто-то сделает это за вас.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Yope привлёк $12,3 млн: приватная социальная сеть без рекламы набрала 15 млн пользователей
Yope, приватная соцсеть без алгоритмов и рекламы, привлекла 12,3 млн долларов в раунде, который возглавил Northzone, инвестор Spotify и Klarna, и теперь…

ServiceNow вложила $40 млн в индийский банковский ИИ: инвестиции открывают доступ к 70+ банкам
ServiceNow вложила 40 миллионов долларов в индийскую BusinessNext, которая автоматизирует банковские процессы с помощью ИИ-агентов и уже обслуживает более 70…
Искусственный интеллект в новостях: пошаговый план для авторов Дзена
Нейросети уже работают в редакциях крупных западных медиа, и опыт их внедрения даёт российским издателям конкретные приёмы, которые можно адаптировать под…
Комментарии