Яндекс раскрыл, как Алиса ищет по фото и тексту: 0,6 из 35 млрд параметров на запрос
Яндекс опубликовал подробный разбор инженерных решений, которые стоят за быстрыми ответами Алисы AI в Поиске, и выложил в открытый доступ базовую модель Alice AI-T5-35B на 35 миллиардов параметров.

Яндекс впервые раскрыл полный конвейер генеративного ответа в Поиске и показал, как сочетание собственной архитектуры, компактных контекстов и обучения на реальном поведении пользователей позволяет отвечать за секунды даже в пиковые часы.
Команда Alice AI Search отвечает за самый массовый генеративный продукт Яндекса. Для большинства людей именно быстрый ответ в поисковой строке становится первым контактом с Алисой. В июньском релизе инженеры описали три ключевых улучшения: сокращение контекста через модель-экстрактор, переход на разреженную MoE-архитектуру (Mixture of Experts, когда при каждом запросе работает не вся сеть, а только нужные «эксперты») совместно с Encoder-Decoder и онлайн-RL-обучение (обучение с подкреплением на живых сигналах пользователей). Источник деталей: технический блог Яндекса.
Как Алиса формирует быстрый ответ?
Конвейер состоит из трёх последовательных шагов.
- Запрос уходит в поиск. Модель обращается к нескольким видам поиска, включая текстовый и яндекс алиса поиск по фото, и собирает материалы для ответа.
- Экстрактор отсекает лишнее. Следующая модель оставляет только релевантные фрагменты текста. Яндекс называет их «инфоконтекстами» (ИК).
- Генератор собирает ответ. ИК вместе с изображениями, видео и другими найденными материалами поступают в генеративную модель Alice AI, которая формирует финальный текст.
Каждый лишний токен (минимальная единица текста, которую обрабатывает модель) в контексте замедляет генерацию. Поэтому главная инженерная задача: передать модели как можно меньше текста без потери качества ответа.
Экстрактор на 80 миллионов параметров: меньше контекст, быстрее ответ
Для извлечения нужных фрагментов Яндекс обучил с нуля компактную BERT-подобную модель на 80 миллионов параметров. Обучающая выборка составила 4 триллиона токенов из собственного корпуса. Разметку собрали через открытые модели (опенсорсные LLM), получив стартовую версию экстрактора.
Дальше команда пошла глубже: одной релевантности мало, нужен минимальный контекст, полезный конкретному генератору. Часть фактов модель уже «знает» из обучения, и передавать их повторно бессмысленно.
Для этого применили алгоритм на основе Cross-Entropy RL (метод перекрёстной энтропии для обучения с подкреплением): из документа случайно выбираются варианты фрагментов, лучшие по награде (реворду) попадают в «элиту», и распределение обновляется в сторону коротких и точных контекстов. Порог отбора растёт от поколения к поколению, фрагменты становятся компактнее.
Результат: экстрактор научился оставлять сжатый контекст, достаточный именно для генеративной модели Яндекса, что сокращает число входных токенов и ускоряет ответ.
Зачем совмещать Encoder-Decoder и MoE?
MoE-архитектура позволяет держать большую модель (35 миллиардов параметров), но при каждом запросе активировать только часть «экспертов», по данным Яндекса, 0,6 миллиарда активных параметров из 35 миллиардов. Это даёт качество крупной модели при скорости компактной.
Совмещение с Encoder-Decoder (архитектура, где одна часть модели «читает» входной текст, а другая генерирует ответ) позволяет эффективно обрабатывать длинный поисковый контекст и выдавать короткий лаконичный ответ.
Обучение на реальных пользователях: онлайн-RL
Команда использует онлайн-RL-обучение: модель получает сигналы от живых пользователей (клики, дочитывания, отказы) и корректирует поведение. По данным Яндекса, такой подход повлиял и на качество ответов, и на метрики использования продукта. Конкретные цифры улучшений Яндекс в открытом описании не приводит.
Открытая модель: что доступно, а что нет?
Яндекс выложил модель Alice AI-T5-35B-A0.6B Base в открытый доступ. Но с ограничением: внешние пользователи могут запускать инференс (генерацию ответов) через библиотеку Hugging Face Transformers, а оптимизированный production-инференс пока доступен только внутри Яндекса.
Это значит, что модель можно скачать и протестировать, но повторить скорость боевого поиска Яндекса на своём железе не получится.
Что понадобится
- Аккаунт на Hugging Face (бесплатный)
- Python 3.8+ и установленная библиотека Hugging Face Transformers
- GPU с достаточным объёмом видеопамяти (модель на 35 миллиардов параметров требует серверного оборудования)
- Время: от 30 минут на установку и первый запуск
Пошаговая инструкция
- Зарегистрируйтесь на huggingface.co, если ещё нет аккаунта.
- Установите библиотеку Transformers:
pip install transformers torch accelerate
- Загрузите модель Alice AI-T5-35B-A0.6B Base из репозитория Яндекса на Hugging Face (точное имя репозитория указано на странице модели).
- Запустите инференс через стандартный pipeline библиотеки Transformers:
from transformers import AutoTokenizer, AutoModelForSeq2SeqLM
tokenizer = AutoTokenizer.from_pretrained("yandex/alice-ai-t5-35b")
model = AutoModelForSeq2SeqLM.from_pretrained("yandex/alice-ai-t5-35b")
input_text = "Ваш запрос или фрагмент текста"
inputs = tokenizer(input_text, return_tensors="pt")
outputs = model.generate(**inputs)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))
- Оцените результат: модель сгенерирует лаконичный ответ на основе переданного контекста.
- Экспериментируйте с длиной входного текста: чем компактнее контекст, тем быстрее генерация, это главный урок из инженерного подхода Яндекса.
Допустим, вы автор Дзена и пишете статью о достопримечательностях Казани. Вы подаёте на вход модели три абзаца из разных источников. Модель возвращает сжатый ответ с ключевыми фактами без дублирования. Это помогает понять, как работает экстракция контекста: из трёх абзацев модель вытягивает суть, а не пересказывает всё подряд. Для практической работы с контентом полезнее использовать Алису в Поиске напрямую, но эксперимент с открытой моделью покажет, как генеративный поиск «думает».
- Путать открытую модель с продуктом. Alice AI-T5-35B-A0.6B Base это базовая модель без оптимизаций, которые работают в боевом поиске Яндекса. Скорость и качество будут отличаться.
- Запускать на слабом железе. 35 миллиардов параметров не поместятся в обычную игровую видеокарту. Нужен серверный GPU или облачный инстанс.
- Ожидать полный функционал яндекс алиса поиск по фото. Открытая модель работает с текстом. Мультимодальный (работающий с разными типами данных: текст, фото, видео) поиск по изображениям доступен только внутри продукта Яндекса.
- Игнорировать длину контекста. Подавать на вход длинные документы целиком: модель обработает, но медленно. Яндекс не зря обучил отдельный экстрактор на 80 миллионов параметров, чтобы сократить вход.
Что делать с этим прямо сейчас, по ролям
Авторам Дзена. Разбор Яндекса показывает, что генеративный поиск берёт из ваших текстов только компактные фрагменты. Если ключевая мысль размазана по десяти абзацам, экстрактор её может не выделить. Пишите так, чтобы главный факт умещался в два-три предложения подряд.
Маркетологам. Быстрый ответ Алисы это первый контакт пользователя с результатами поиска. Если ваш контент попадает в инфоконтекст, пользователь видит ответ, не кликая на сайт. Оптимизация под генеративный поиск становится отдельной задачей, отличной от классического SEO.
Предпринимателям в РФ и СНГ. Открытая модель Яндекса позволяет изучить, как устроен генеративный ответ изнутри. Для тех, кто строит поисковые или справочные продукты на российском рынке, это возможность протестировать архитектуру без лицензионных ограничений. Но production-скорость пока закрыта внутри Яндекса.
Яндекс сделал нетипичный для российского рынка шаг: не просто выпустил модель, а детально объяснил инженерные решения. Экстрактор на 80 миллионов параметров, который учится сжимать контекст именно под конкретный генератор, это по-настоящему практичная идея. По моим наблюдениям, большинство авторов Дзена пока не задумываются, что их тексты проходят через такой конвейер, а стоило бы. Честная оговорка: открытая модель без production-инференса Яндекса это скорее учебный инструмент, чем рабочий. Реальную скорость и качество вы увидите только в самом Поиске.
Если вы хотите, чтобы ваши тексты попадали в генеративные ответы Яндекса, начните с простого: проверьте, умещается ли главная мысль каждой статьи в три предложения, которые можно вырвать из контекста без потери смысла.
Научитесь писать тексты, которые находит ИИ
Разбираем на практике, как структурировать контент для генеративного поиска Яндекса и других ИИ-систем
Узнать больше
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Генерация документации нейросетями в продакшене: 5 ИИ-агентов обновляют API при каждом коммите
Нейросети генерируют документацию API, и это уже не эксперимент, а рабочая система: компания HOSTKEY опубликовала подробный разбор Invapi, конвейера из пяти…

Чатботы без ИИ: 100 000 вопросов за месяц получил сервис, где отвечают живые люди
ChatTJB появился в апреле 2026 года как арт-проект бывшего менеджера Google Такера Брайанта и за месяц собрал больше 100 000 запросов, хотя на каждый из них…

OpenAI заявила о решении задачи тысячелетия, но математика обвинила её в плагиате
Почему это важно Впервые ИИ-агенты претендуют на решение задачи из «списка тысячелетия», но вокруг доказательства разгорелся спор об авторстве, который ставит…
Комментарии