Переводчик с казахского на русский обучили на синтетике: реальных данных для смешанной речи не было
Корпорация «синтетика»: казахско-русский код-свитчинг научились переводить без реальных данных, и вот как это работает.

Исследователи из MWS AI и казахстанских университетов представили метод, который позволяет обучить переводчик с казахского на русский для смешанной речи, где оба языка перемешаны в одной фразе, используя только синтетические данные вместо отсутствующих реальных корпусов.
До сих пор ни одна открытая модель машинного перевода не умела нормально обрабатывать казахско-русский код-свитчинг (переключение с одного языка на другой внутри одного предложения), потому что обучающих данных для такой задачи просто не существовало в открытом доступе.
Казахстан, страна, где в быту, соцсетях и переписке постоянно смешивают казахский и русский. Любой переводчик с казахского на русский спотыкается на таких фразах: модели обучены на «чистых» текстах и не понимают, что делать с гибридом. Группа исследователей из MWS AI, Назарбаев Университета и Казахского национального университета имени Аль-Фараби нашла обходной путь: они взяли обычные параллельные корпуса (юридические документы и пресс-релизы) и синтетически внедрили в них переключение языков. Дообученная на этих данных модель при ручной оценке носителями обошла одну из коммерческих систем перевода. Результат скромный, но он доказывает, что синтетика работает там, где реальных данных нет.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Метод синтетической генерации данных для перевода казахско-русского код-свитчинга | Дата публикации в источнике не указана | MWS AI, Назарбаев Университет, КазНУ им. Аль-Фараби | Исследование, коммерческая цена не применима |
Почему существующие переводчики не справляются?
Код-свитчинг (code-switching) для NLP (обработки естественного языка, то есть всех задач, где компьютер работает с человеческой речью) остаётся одной из самых плохо обеспеченных данными задач. Для популярных пар вроде «английский и испанский» или «английский и хинди» датасеты (наборы данных для обучения) существуют. Для пары «русский и казахский» публичного параллельного корпуса со смешанной речью до этой работы не было.
Авторы собрали вручную корпус KRCS из 618 предложений, где казахская основа перемешана с русскими вставками. Этого хватает, чтобы тестировать модели, но категорически мало, чтобы их обучать.
Пять способов создать данные из ничего
Исследователи взяли два «чистых» корпуса:
- 89 тысяч предложений юридических документов (корпус Назарбаев Университета)
- 80 тысяч пресс-релизов (корпус КазНУ им. Аль-Фараби)
Затем применили пять методов синтетического внедрения код-свитчинга, от простого к сложному:
- cs-1: грубая замена казахского слова на русское
- cs-2: русское слово с казахским окончанием
- cs-3: случайный выбор между первым и вторым методами
- cs-4: статистическое выравнивание через fastalign, которое учитывает, какие слова чаще встречаются вместе в параллельных текстах
- cs-5: выравнивание через SimAlign, инструмент, который анализирует контекст всего предложения через эмбеддинги (числовые представления слов, где близкие по смыслу слова стоят рядом) и подставляет русское слово, которое подходит по смыслу, а не только по словарю
Ключевая деталь: в казахско-русском код-свитчинге казахский язык остаётся «матричным», то есть грамматика, порядок слов и окончания сохраняются казахскими, а русские слова вставляются как отдельные элементы. Метод cs-5 воспроизводит именно эту логику. Первые четыре метода ей пренебрегают.
При обучении заменяли 15% минимальных выровненных единиц (Minimal Aligned Units, пары слов, где каждое слово одной фразы связано со словом другой) на русские эквиваленты. Для коротких предложений (менее 7 слов) делали одну замену.
Какие модели обучали и что получилось?
Авторы дообучили (fine-tuning, обучение уже готовой модели на новых данных под конкретную задачу) четыре модели:
- mBART: до дообучения 4,62 балла BLEU (метрика автоматической оценки перевода, чем выше, тем ближе к эталону), после 12,08
- M2M100: с 5,37 до 12,50 BLEU
- NLLB-600: с 12,26 до 12,95 BLEU, скромный прирост, потому что эта модель уже частично понимала смешанный текст
- NLLB-3.3B: самая крупная из протестированных
Факт, который важнее цифр автоматических метрик: когда пригласили носителей языка и те оценили переводы по шкале Ликерта от 1 до 5, модель авторов набрала 3,09 балла. Коммерческие системы получили 2,80 и 3,49. Разрыв небольшой, но модель, обученная на синтетике, обогнала одну из коммерческих систем в реальной пользовательской оценке.
Методы cs-1 через cs-4 при обучении даже ухудшили качество модели. Улучшил результат только cs-5, потому что его распределение слов ближе к реальной разговорной речи.
Как попробовать?
- Найдите исходную публикацию MWS AI (название метода, корпус KRCS, SimAlign) через научные базы или профильные каналы. Точная ссылка в разбираемом источнике не приведена.
- Если у вас есть параллельный корпус на любой языковой паре, попробуйте метод cs-5: установите SimAlign, задайте порог замены 15% минимальных выровненных единиц и сгенерируйте синтетический датасет.
- Дообучите одну из открытых моделей (NLLB или M2M100 доступны на Hugging Face) на полученных данных.
- Оцените результат не только автометриками, но и ручной проверкой носителями: авторы показали, что BLEU и человеческая оценка могут расходиться.
Сравнение с инструментами, доступными в России
Для переводов казахского и русского в «чистом» виде (без код-свитчинга) доступны «Яндекс Переводчик» и встроенные функции YandexGPT. GigaChat от «Сбера» тоже умеет переводить, но казахский не входит в число его приоритетных языков.
Ни один из этих инструментов, судя по описанной проблеме, не обучен на смешанной казахско-русской речи. Если вы работаете с аудиторией из Казахстана и получаете комментарии или сообщения на гибриде двух языков, стандартный переводчик с казахского на русский, скорее всего, выдаст некорректный результат. Описанный метод пока существует только как исследование и готового продукта на его основе нет.
Что это даёт вам прямо сейчас?
Авторам Дзена, которые пишут для казахстанской аудитории: понимание, почему комментарии на смешанном языке не переводятся нормально, и что проблема не в конкретном сервисе, а в отсутствии данных для всей индустрии.
Разработчикам и техническим специалистам: готовый рецепт синтетической аугментации данных, применимый к любой «бедной» языковой паре. Если вы строите переводчик для узбекского, кыргызского, таджикского с русским, метод cs-5 через SimAlign можно адаптировать.
Предпринимателям в РФ и СНГ: если ваш бизнес работает на казахстанский рынок и вы используете чат-ботов или автоматическую модерацию, учитывайте, что смешанная речь остаётся слепым пятном для всех коммерческих систем. Ручная проверка пока незаменима.
Это исследование не про готовый продукт, а про метод. Но метод ценный. Мы в dzen.guru видим, как авторы из Казахстана и Кыргызстана всё чаще приходят на платформу, и языковой барьер для них реален: ни «Яндекс Переводчик», ни Google Translate не справляются со смешанной речью. То, что синтетические данные позволили модели обойти коммерческий сервис по оценке живых людей, по моим наблюдениям, редкий результат для академической работы. Оговорка: корпус из 618 тестовых предложений невелик, и до промышленного качества далеко. Но если вы разработчик и работаете с языками СНГ, попробуйте SimAlign на своей паре. Это, возможно, самый дешёвый способ получить обучающие данные, которых на рынке просто нет.
Частые вопросы
Можно ли использовать этот метод для других языков СНГ?
Да. Подход не привязан к казахскому: если у вас есть параллельный корпус на «чистой» языковой паре (например, узбекский и русский), вы можете применить ту же схему с SimAlign для генерации синтетических данных со смешанной речью. Качество будет зависеть от размера исходного корпуса и близости языков.
Есть ли готовый сервис перевода смешанной казахско-русской речи?
На момент публикации готового коммерческого продукта на основе этого исследования нет. Модели и код авторы не выложили в открытый доступ (в источнике ссылка не указана). Из доступных инструментов «Яндекс Переводчик» справляется с чистым казахским, но не со смешанной речью.
Почему автоматические метрики показали одно, а люди другое?
Метрики вроде BLEU оценивают совпадение слов с эталонным переводом. Живой человек оценивает смысл, естественность и читаемость. Коммерческие системы выдавали текст, формально близкий к эталону, но носители языка сочли перевод одной из них менее качественным, чем результат модели, обученной на синтетике. Это напоминание: автоматические метрики полезны для массового сравнения, но финальное слово за человеком.
Для тех, кто работает с «бедными» языковыми парами, главный вывод прост: данные можно создать, если знать, как именно люди смешивают языки, и воспроизвести эту логику алгоритмически через контекстное выравнивание, а не случайную подстановку.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Обучение нейросети на своих данных: как превратить LLM из генератора текста в чат-бота
Автор серии статей на Хабре показал по шагам, как взять уже обученную языковую модель и научить её отвечать на вопросы вместо бессвязного продолжения текста,…

Использование ИИ в медицине за $300: российский разработчик собрал диагностику рентгена в одиночку
Компания Microsoft Research выложила в открытый доступ специализированный кодировщик RAD-DINO-MAIRA-2, обученный именно на медицинских рентгеновских снимках, а…

MCP-протокол вместо GUI: Selectel показал, как заменить меню одним вопросом
MCP протокол (Model Context Protocol, открытый стандарт связи между ИИ-моделями и внешними сервисами) уже сегодня позволяет заменить блуждание по меню и…
Комментарии