Яндекс раскрыл инженерную кухню Алисы AI: как сводили две модели в одну омнимодель
Яндекс почти год сводил две отдельные модели Алисы, текстовую и визуальную, в единую омнимодель, и теперь делится конкретными техническими граблями: от архитектуры MoE до проблем с алайнментом, которые полезно знать каждому, кто работает с ИИ.

Яндекс впервые публично раскрыл внутреннюю кухню объединения модальностей в Алисе AI: не маркетинговый анонс, а инженерный разбор компромиссов, ошибок и организационных барьеров, с которыми столкнулась одна из крупнейших команд разработки ИИ в России.
Ещё недавно Алиса отвечала на текст и на картинку так, будто внутри живут два разных ассистента. Так и было: под капотом работали две генеративные модели, LLM (Large Language Model, большая языковая модель, отвечающая за текст) и VLM (Vision Language Model, модель для работы с изображениями), а между ними стоял непрозрачный роутинг (маршрутизация запросов) с разными форматами и разной вёрсткой ответов. Команда Яндекса почти год сводила их в одну омнимодель, мультимодальную модель (мультимодальная значит способная воспринимать разные типы данных: текст, картинки, звук), где текст и изображения живут нативно, в одном наборе весов, без переключений за кадром.
Об этом рассказал Алексей Григорьев, представляющий команду разработки омнимодели Яндекса, вместе с коллегой Данилой Кашиным. Публикация построена не как пресс-релиз, а как инженерный разбор с акцентом на алайнмент (alignment, настройка поведения модели, чтобы она отвечала так, как нужно пользователю, а не «как получилось»).
Зачем вообще объединять модальности?
Аргументов несколько, и они практические:
- Один чат вместо зоопарка сервисов. Пользователь общается с одной сущностью, а команда больше не синхронизирует отдельные модели под каждый тип запроса.
- Масштабируемость. Вместо того чтобы растить две модели параллельно, вкладываются в один пайплайн (конвейер обучения), который выигрывает от масштаба сразу по всем модальностям.
- Синергия качества. Когда текст и картинки живут в общем представлении с ранних стадий, улучшение одной модальности подтягивает другую, а не конкурирует с ней.
- Эмерджентные свойства. У совместно обученной модели появляются навыки, которых не было ни у текстовой, ни у визуальной по отдельности. Например, рассуждение о картинке текстовыми приёмами.
Контекст шире Яндекса: в 2025 году, по данным источника, весь опенсорс (открытые модели) увлечённо объединял генеративные модели. Qwen-Omni сводил LLM, распознавание и синтез речи, Transfusion и Mercury объединяли LLM с диффузионными моделями, Qwen 3.5 замахнулся на нативную мультимодальность из коробки.
Главная сложность не в коде, а в людях?
Да, и это, пожалуй, самый ценный инсайт. За LLM и VLM отвечали разные команды разработки со своими процессами и привычками. Теперь все они должны были буквально заговорить на одном языке.
Метрики добавляли головной боли: у текстов свой набор бенчмарков (тестов производительности), у картинок свой. Тянуть их вверх нужно одновременно, а на практике: улучшил геометрию (распознавание визуальных элементов) и просела грамматика, подтянул тексты и поехало распознавание.
Компромиссы, по словам команды, почти неизбежны.
Рецепт: строго последовательный пайплайн
Раньше пайплайны расходились сразу после первой стадии претрейна (pretrain, базовое обучение модели на огромном массиве данных): у LLM был свой претрейн, свой SFT (supervised fine-tuning, дообучение на размеченных примерах), свой RL (reinforcement learning, обучение с подкреплением, когда модель учится на обратной связи). У VLM всё было своё. Две ветки, две команды, две картины мира.
Новый замысел выпрямил эту вилку в одну цепочку из трёх этапов:
- Омнипретрейн. Визуальную модальность завели во все стадии обучения с самого фундамента, а не добавляли отдельным шагом в конце. Иначе картинки так и остались бы надстройкой, а не родной частью модели.
- Омниалайнмент. SFT и RL на объединённой модели. Именно тут, по словам команды, скрывались самые болезненные грабли.
- Омнипродукты. Выкатка единой модели в реальные сценарии Алисы AI.
Два жёстких ограничения: визуальную модальность нужно было завести в каждую стадию, и при этом нельзя было растерять качество уже сильной текстовой модели, которое оказалось «довольно хрупким».
Что здесь поменяла MoE-архитектура?
MoE (Mixture of Experts, «смесь экспертов», архитектура, где модель активирует только часть своих параметров для каждого запроса, экономя вычисления) стала одним из неочевидных поворотов. По словам команды, два года назад та же затея с объединением модальностей разваливалась, а MoE-архитектура изменила расклад.
Ещё один нетривиальный момент: омнипретрейн пришлось собирать «с конца». Один вид RL переезжал на большую модель легко, а другой рассыпался, по выражению авторов, «прямо на глазах».
Полгода назад уже существовал прототип омнимодели без мультимодальности в первых стадиях претрейна и RL. Результат: метрики по текстам на уровне лучших, но компромиссное качество визуальной части. Именно этот разрыв и мотивировал переход к полному омнипайплайну.
Что делать с этим прямо сейчас?
Авторам Дзена. Алиса AI движется к единой модели, которая понимает и текст, и картинку одновременно. Если вы используете Алису для подготовки контента, тестируйте мультимодальные сценарии: отправляйте изображение вместе с текстовым промптом (запросом к модели), а не отдельно. Раньше это работало через два разных «мозга», теперь должно стать цельнее.
Маркетологам. Объединение модальностей значит, что Яндекс алиса AI со временем будет точнее обрабатывать визуальный контент в связке с текстом. Для задач вроде анализа креативов или описания товаров по фото это практичный инструмент. Пока качество визуальной части, по признанию самой команды, компромиссное, проверяйте результат вручную.
Предпринимателям в РФ. Яндекс алиса AI доступна в России без VPN и подписок на зарубежные сервисы. Для тех, кто строит продукты на базе ИИ, ключевой вывод из публикации: объединение модальностей даёт масштабируемость, но ломает привычные процессы команд. Если вы планируете интеграцию нескольких ИИ-моделей в одном продукте, закладывайте время на организационную перестройку, а не только на код.
Допустим, вы автор канала о еде на Дзене. Раньше вы отправляли Алисе фото блюда и отдельно просили написать рецепт. Омнимодель позволяет отправить фото и текст одним запросом:
[фото блюда] Опиши, что на этом фото, определи ингредиенты и напиши пошаговый рецепт на 4 порции
Результат: модель видит блюдо и пишет текст в одном контексте, не переключаясь между визуальным распознаванием и генерацией. Ответ получается связнее, потому что «текстовый мозг» и «визуальный мозг» больше не разделены.
- Ожидать идеала от визуальной части. Команда Яндекса прямо говорит: качество VLM пока компромиссное. Галлюцинации (когда ИИ уверенно выдумывает то, чего не было) при описании изображений никуда не делись, проверяйте ответы.
- Думать, что «омни» значит «умеет всё». Омнимодель Алисы пока работает с текстом и изображениями. Видео и генерация картинок в описанном пайплайне не упоминаются.
- Игнорировать организационный урок. Если вы руководите командой, где один отдел отвечает за текст, а другой за визуал, главная проблема не техническая, а в том, чтобы люди договорились о единых метриках и процессах.
Яндекс сделал редкую для российского рынка вещь: не просто анонсировал продукт, а публично разобрал внутренние ошибки. Для нас, авторов и практиков, это ценнее любого пресс-релиза. Я вижу тут два практических вывода.
Первый: мультимодальность в Яндекс алиса AI уже работает, но команда сама признаёт компромиссы. Используйте, но не доверяйте слепо, особенно визуальной части.
Второй: урок про организационные барьеры универсален. Если вы объединяете любые ИИ-инструменты в одном продукте или даже в одном рабочем процессе, самая дорогая часть не технология, а согласование людей, которые за ней стоят.
Честная оговорка: публикация описывает процесс, а не финальный результат. Алайнмент, по словам авторов, был «самой болезненной частью», и конкретные метрики итоговой модели в источнике не приведены.
Попробуйте AI-инструменты dzen.guru
Хотите разобраться, как использовать ИИ для создания контента на Дзене? Начните с наших инструментов и гайдов.
ПопробоватьПубликация Яндекса показала главное: объединить модальности можно, но дорого, и самые болезненные ошибки случаются не в коде, а на стыке команд и метрик. Для тех, кто работает с Алисой AI каждый день, практический вывод простой: тестируйте мультимодальные запросы уже сейчас, но держите ручную проверку наготове, пока команда сама говорит о компромиссах.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Open WebUI хватает для прототипа, но не для продакшена: кейс мультиагентной системы
Open WebUI подходит для прототипирования ИИ-продуктов, но начинает ограничивать проект, когда нужны кастомные компоненты, многоагентная логика и контроль…

Gemini 3.8 Flash тратит на 30% больше токенов на задачу: цена та же, счёт растёт
Google 11 июня выпустил Gemini 3.8 Flash, модель, которая делает больше шагов рассуждения на сложных задачах и при той же цене за токен может потратить их…

Perplexity открыла движок Lily для нейросети на Apple Silicon: на 35% быстрее MLX
Perplexity выпустила в открытый доступ Lily, движок для локального запуска нейросети Qwen3.6-35B-A3B на компьютерах Apple Silicon, который на тестах обгоняет…
Комментарии