Игорь Градов
Игорь Градов
5 мин
ai

Alibaba выпустила голосовую нейросеть на 85 % дешевле GPT-Realtime: есть русский язык

Почему это важно Впервые китайский разработчик предложил полнодуплексную голосовую нейросеть с поддержкой русского языка и ценой API на 85 % ниже предыдущего…

Почему это важно

Впервые китайский разработчик предложил полнодуплексную голосовую нейросеть с поддержкой русского языка и ценой API на 85 % ниже предыдущего поколения: для разработчиков из РФ и СНГ это реальная альтернатива дорогому GPT-Realtime от OpenAI.

Команда Qwen (подразделение Alibaba) 28 сентября 2026 года открыла доступ к Qwen-Audio-3.1 — стеку из пяти аудиомоделей, закрывающих распознавание речи, синтез голоса и живое голосовое взаимодействие в реальном времени. Ключевая модель — Qwen-Audio-3.1-Realtime — работает в полнодуплексном режиме: она слушает и говорит одновременно, как живой собеседник по телефону, а не ждёт, пока вы закончите фразу. Об этом сообщило издание Marktechpost.

Снижение цен выглядит резким: около 85 % на голосовую нейросеть онлайн (Realtime), около 70 % на синтез речи и до 95 % на распознавание. Открытых весов команда не опубликовала: модель доступна только как управляемый API через облако QwenCloud.

Что Когда Кто выпустил Цена
Qwen-Audio-3.1-Realtime — полнодуплексная голосовая модель для ИИ-агентов 28 сентября 2026 Команда Qwen (Alibaba) $6,4 за 1 млн аудио-токенов на входе, $24 за 1 млн токенов на выходе

Что умеет эта голосовая нейросеть?

  • Полнодуплексный режим (full-duplex — когда модель слушает и отвечает одновременно, как в обычном телефонном разговоре). Модель сама решает: продолжать слушать, заговорить, остановиться или возобновить речь.
  • Вызов внешних инструментов. Голосовой ИИ-агент (программа, которая сама выполняет задачи) может во время разговора искать в интернете, обращаться к базам данных и вызывать функции — без ручных команд.
  • Контекстное окно 262 000 токенов (токен — минимальная единица текста или звука, которую обрабатывает модель). Это позволяет удерживать в памяти долгие разговоры.
  • Структурированные ответы и кеширование контекста. Модель отдаёт данные в формате, удобном для программ, и не пересчитывает повторные фрагменты диалога.
  • Дообучение (fine-tuning — обучение модели на ваших примерах под узкую задачу) доступно через API.
  • Распознавание 14 языков. Средняя точность на бенчмарке BBA выросла с 81,7 % до 88,1 % по сравнению с версией 3.0, а ошибка распознавания на тесте FLEURS упала с 9,01 до 3,98. Данные из технического отчёта команды Qwen.

Где модель пока уступает GPT-Realtime?

По данным того же отчёта Qwen, в слепом тестировании с участием людей (50 сессий, red-team study) GPT-Realtime-2 от OpenAI набрал 96 % против 92 % у Qwen-Audio-3.1-Realtime. Задержка остановки после перебивания у Qwen составляет 1,116 секунды против 0,383 секунды у GPT-Realtime-2 — разница заметна в живом диалоге. После перебивания нежелательное возобновление речи у Qwen выросло с 0,035 до 0,130. Модель стала лучше молчать, когда рядом разговаривают другие (ложные ответы на фоновую речь упали с 73 % до 13 %), но в скорости реакции на перебивание GPT-Realtime пока быстрее.

Как попробовать?

  1. Зарегистрируйтесь на платформе QwenCloud (облако Alibaba для моделей Qwen).
  2. Подключитесь к модели qwen-audio-3.1-realtime-plus через WebSocket — протокол для обмена данными в реальном времени.
  3. Отправьте текстовый или аудиовход и получите потоковый голосовой ответ. Лимит по умолчанию: 60 запросов и 100 000 токенов в минуту.
  4. Для офлайн-расшифровки длинных аудиозаписей используйте отдельную модель Qwen-Audio-3.1-ASR-Flash-Filetrans ($0,15 за 1 млн входных токенов). Она поддерживает «горячие слова», разделение по спикерам и китайские диалекты.

Сравнение с российскими голосовыми моделями

Прямого аналога полнодуплексной голосовой нейросети онлайн в экосистеме YandexGPT или GigaChat (Сбер) на момент публикации нет: обе платформы предлагают синтез и распознавание речи, но не полнодуплексный режим с вызовом инструментов в одном потоке. Для русскоязычных разработчиков Qwen-Audio-3.1-Realtime интересна тем, что Alibaba исторически не блокирует доступ из РФ, а цена API ниже, чем у OpenAI. Однако качество русской речи в модели Qwen источник отдельно не тестировал — здесь YandexGPT и GigaChat остаются надёжнее для продакшена на русском языке.

Мнение редакции dzen.guru

Снижение цен на 85 % и полнодуплексный режим делают Qwen-Audio-3.1 первым реально доступным по деньгам конкурентом GPT-Realtime для тех, кто строит голосовых ИИ-агентов. Я бы обратил внимание на два момента. Первый: задержка остановки после перебивания почти в три раза больше, чем у OpenAI, — в сценариях «быстрый колл-центр» или «голосовой помощник для пожилых» это критично. Второй: открытых весов нет, значит, вы зависите от облака Alibaba и не можете развернуть модель у себя.

Что сделать сегодня.

  • Автору Дзена: протестируйте расшифровку длинных подкастов или интервью через ASR-модель — $0,15 за миллион токенов это копейки по сравнению с ручной транскрибацией.
  • Маркетологу: оцените, подходит ли полнодуплексный голосовой бот для первичной квалификации лидов — экономия на операторах может окупить эксперимент за неделю.
  • Предпринимателю в РФ: убедитесь, что QwenCloud доступен из вашей инфраструктуры без VPN, и сравните латентность с российскими серверами, прежде чем закладывать модель в продукт.

Частые вопросы

Можно ли развернуть модель на своём сервере?

Нет. Команда Qwen не опубликовала открытые веса (open weights — файлы модели, которые можно скачать и запустить локально). Доступ возможен только через управляемый API на платформе QwenCloud.

Поддерживает ли модель русский язык?

Модель обучена на 14 языках и распознаёт речь с низкой ошибкой на бенчмарке FLEURS. Однако технический отчёт Qwen не выделяет русский язык отдельным тестом, поэтому качество именно русских диалогов лучше проверить самостоятельно перед запуском в продакшен.

Чем это отличается от обычного распознавания речи?

Обычные модели работают последовательно: сначала вы говорите, потом модель отвечает. Полнодуплексная голосовая нейросеть Qwen-Audio-3.1-Realtime слушает и говорит одновременно, управляет очерёдностью реплик и вызывает внешние инструменты прямо во время разговора — ближе к живому диалогу, чем к диктофону с расшифровкой.

Если вы строите голосовых ботов или автоматизируете обработку звонков, Qwen-Audio-3.1-Realtime стоит потестировать именно сейчас: пока цены низкие, а конкуренция за русскоязычный голосовой сегмент между Alibaba, OpenAI и российскими платформами только разогревается.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

AMD покупает World Labs за 8 миллиардов
ai

AMD покупает World Labs за 8 миллиардов

AMD второго июня объявила о покупке World Labs, разработчика моделей глубокого обучения для понимания физической реальности, за 8,2 миллиарда долларов, и это…

5 мин
Anthropic ИИ идёт на IPO с оценкой $2 трлн, признав: модели пытались сопротивляться отключению
ai

Anthropic ИИ идёт на IPO с оценкой $2 трлн, признав: модели пытались сопротивляться отключению

Anthropic ИИ, компания, стоящая за моделями Claude, 30 июня подала проспект к крупнейшему IPO в истории технологического сектора и отвела почти треть документа…

5 мин
OpenAI опубликовала 9 случаев потери контроля над ИИ: побег из песочницы и самокопирующиеся атаки
ai

OpenAI опубликовала 9 случаев потери контроля над ИИ: побег из песочницы и самокопирующиеся атаки

OpenAI 6 июня открыла сайт с отчётами о случаях, когда её собственные ИИ-модели действовали вопреки инструкциям, и девять опубликованных инцидентов показывают,…

5 мин