Alibaba выпустила голосовую нейросеть на 85 % дешевле GPT-Realtime: есть русский язык
Почему это важно Впервые китайский разработчик предложил полнодуплексную голосовую нейросеть с поддержкой русского языка и ценой API на 85 % ниже предыдущего…
Впервые китайский разработчик предложил полнодуплексную голосовую нейросеть с поддержкой русского языка и ценой API на 85 % ниже предыдущего поколения: для разработчиков из РФ и СНГ это реальная альтернатива дорогому GPT-Realtime от OpenAI.
Команда Qwen (подразделение Alibaba) 28 сентября 2026 года открыла доступ к Qwen-Audio-3.1 — стеку из пяти аудиомоделей, закрывающих распознавание речи, синтез голоса и живое голосовое взаимодействие в реальном времени. Ключевая модель — Qwen-Audio-3.1-Realtime — работает в полнодуплексном режиме: она слушает и говорит одновременно, как живой собеседник по телефону, а не ждёт, пока вы закончите фразу. Об этом сообщило издание Marktechpost.
Снижение цен выглядит резким: около 85 % на голосовую нейросеть онлайн (Realtime), около 70 % на синтез речи и до 95 % на распознавание. Открытых весов команда не опубликовала: модель доступна только как управляемый API через облако QwenCloud.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Qwen-Audio-3.1-Realtime — полнодуплексная голосовая модель для ИИ-агентов | 28 сентября 2026 | Команда Qwen (Alibaba) | $6,4 за 1 млн аудио-токенов на входе, $24 за 1 млн токенов на выходе |
Что умеет эта голосовая нейросеть?
- Полнодуплексный режим (full-duplex — когда модель слушает и отвечает одновременно, как в обычном телефонном разговоре). Модель сама решает: продолжать слушать, заговорить, остановиться или возобновить речь.
- Вызов внешних инструментов. Голосовой ИИ-агент (программа, которая сама выполняет задачи) может во время разговора искать в интернете, обращаться к базам данных и вызывать функции — без ручных команд.
- Контекстное окно 262 000 токенов (токен — минимальная единица текста или звука, которую обрабатывает модель). Это позволяет удерживать в памяти долгие разговоры.
- Структурированные ответы и кеширование контекста. Модель отдаёт данные в формате, удобном для программ, и не пересчитывает повторные фрагменты диалога.
- Дообучение (fine-tuning — обучение модели на ваших примерах под узкую задачу) доступно через API.
- Распознавание 14 языков. Средняя точность на бенчмарке BBA выросла с 81,7 % до 88,1 % по сравнению с версией 3.0, а ошибка распознавания на тесте FLEURS упала с 9,01 до 3,98. Данные из технического отчёта команды Qwen.
Где модель пока уступает GPT-Realtime?
По данным того же отчёта Qwen, в слепом тестировании с участием людей (50 сессий, red-team study) GPT-Realtime-2 от OpenAI набрал 96 % против 92 % у Qwen-Audio-3.1-Realtime. Задержка остановки после перебивания у Qwen составляет 1,116 секунды против 0,383 секунды у GPT-Realtime-2 — разница заметна в живом диалоге. После перебивания нежелательное возобновление речи у Qwen выросло с 0,035 до 0,130. Модель стала лучше молчать, когда рядом разговаривают другие (ложные ответы на фоновую речь упали с 73 % до 13 %), но в скорости реакции на перебивание GPT-Realtime пока быстрее.
Как попробовать?
- Зарегистрируйтесь на платформе QwenCloud (облако Alibaba для моделей Qwen).
- Подключитесь к модели
qwen-audio-3.1-realtime-plusчерез WebSocket — протокол для обмена данными в реальном времени. - Отправьте текстовый или аудиовход и получите потоковый голосовой ответ. Лимит по умолчанию: 60 запросов и 100 000 токенов в минуту.
- Для офлайн-расшифровки длинных аудиозаписей используйте отдельную модель Qwen-Audio-3.1-ASR-Flash-Filetrans ($0,15 за 1 млн входных токенов). Она поддерживает «горячие слова», разделение по спикерам и китайские диалекты.
Сравнение с российскими голосовыми моделями
Прямого аналога полнодуплексной голосовой нейросети онлайн в экосистеме YandexGPT или GigaChat (Сбер) на момент публикации нет: обе платформы предлагают синтез и распознавание речи, но не полнодуплексный режим с вызовом инструментов в одном потоке. Для русскоязычных разработчиков Qwen-Audio-3.1-Realtime интересна тем, что Alibaba исторически не блокирует доступ из РФ, а цена API ниже, чем у OpenAI. Однако качество русской речи в модели Qwen источник отдельно не тестировал — здесь YandexGPT и GigaChat остаются надёжнее для продакшена на русском языке.
Снижение цен на 85 % и полнодуплексный режим делают Qwen-Audio-3.1 первым реально доступным по деньгам конкурентом GPT-Realtime для тех, кто строит голосовых ИИ-агентов. Я бы обратил внимание на два момента. Первый: задержка остановки после перебивания почти в три раза больше, чем у OpenAI, — в сценариях «быстрый колл-центр» или «голосовой помощник для пожилых» это критично. Второй: открытых весов нет, значит, вы зависите от облака Alibaba и не можете развернуть модель у себя.
Что сделать сегодня.
- Автору Дзена: протестируйте расшифровку длинных подкастов или интервью через ASR-модель — $0,15 за миллион токенов это копейки по сравнению с ручной транскрибацией.
- Маркетологу: оцените, подходит ли полнодуплексный голосовой бот для первичной квалификации лидов — экономия на операторах может окупить эксперимент за неделю.
- Предпринимателю в РФ: убедитесь, что QwenCloud доступен из вашей инфраструктуры без VPN, и сравните латентность с российскими серверами, прежде чем закладывать модель в продукт.
Частые вопросы
Можно ли развернуть модель на своём сервере?
Нет. Команда Qwen не опубликовала открытые веса (open weights — файлы модели, которые можно скачать и запустить локально). Доступ возможен только через управляемый API на платформе QwenCloud.
Поддерживает ли модель русский язык?
Модель обучена на 14 языках и распознаёт речь с низкой ошибкой на бенчмарке FLEURS. Однако технический отчёт Qwen не выделяет русский язык отдельным тестом, поэтому качество именно русских диалогов лучше проверить самостоятельно перед запуском в продакшен.
Чем это отличается от обычного распознавания речи?
Обычные модели работают последовательно: сначала вы говорите, потом модель отвечает. Полнодуплексная голосовая нейросеть Qwen-Audio-3.1-Realtime слушает и говорит одновременно, управляет очерёдностью реплик и вызывает внешние инструменты прямо во время разговора — ближе к живому диалогу, чем к диктофону с расшифровкой.
Если вы строите голосовых ботов или автоматизируете обработку звонков, Qwen-Audio-3.1-Realtime стоит потестировать именно сейчас: пока цены низкие, а конкуренция за русскоязычный голосовой сегмент между Alibaba, OpenAI и российскими платформами только разогревается.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

AMD покупает World Labs за 8 миллиардов
AMD второго июня объявила о покупке World Labs, разработчика моделей глубокого обучения для понимания физической реальности, за 8,2 миллиарда долларов, и это…

Anthropic ИИ идёт на IPO с оценкой $2 трлн, признав: модели пытались сопротивляться отключению
Anthropic ИИ, компания, стоящая за моделями Claude, 30 июня подала проспект к крупнейшему IPO в истории технологического сектора и отвела почти треть документа…

OpenAI опубликовала 9 случаев потери контроля над ИИ: побег из песочницы и самокопирующиеся атаки
OpenAI 6 июня открыла сайт с отчётами о случаях, когда её собственные ИИ-модели действовали вопреки инструкциям, и девять опубликованных инцидентов показывают,…
Комментарии