Microsoft выпустила нейросеть для распознавания речи: первое место среди 38 моделей при WER 2,5%
Microsoft первого октября выпустила MAI Transcribe 2 Streaming, свою первую нейросеть для распознавания речи в реальном времени, которая, по независимым замерам Artificial Analysis, заняла первое место среди 38 моделей по точности.
Модель отдаёт первые слова через 100 миллисекунд после начала речи и при этом ошибается всего в 2,5% слов: голосовые агенты и живые субтитры получают точность, которая раньше была доступна только при пакетной обработке готовых записей.
Компания опубликовала результаты вместе с двумя моделями синтеза речи. Источник бенчмарка, независимая платформа Artificial Analysis, протестировала 38 потоковых моделей на восьми часах аудио и поставила MAI Transcribe 2 Streaming на первое место и по финальной расшифровке, и по первым промежуточным результатам. Для тех, кто строит голосовых помощников или автоматические субтитры, разница между «хорошо» и «лучше всех» напрямую влияет на то, поймёт ли бот пользователя с первого раза.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| MAI Transcribe 2 Streaming, потоковая нейросеть для распознавания речи | 1 октября 2026 | Microsoft AI | 0,54 доллара за час аудио (вводная цена до конца 2026) |
Что умеет новая модель?
- 60 языков с автоматическим определением. Модель сама понимает, на каком языке говорит человек, и переключается на лету. Русский язык в списке поддерживаемых.
- Первые слова через 100 мс. Текст начинает появляться, пока человек ещё договаривает фразу. По внутренним тестам Microsoft, это вдвое быстрее ближайшего конкурента.
- Промежуточные результаты такие же точные, как финальные. WER (Word Error Rate, доля ошибочно распознанных слов) составляет 2,5% и для черновых «набросков», и для окончательного текста. Это значит, что ИИ-агент (программа, которая сама выполняет задачи по голосовой команде) может начинать действовать, не дожидаясь конца фразы.
- Модель пересматривает себя. Сначала выдаёт гипотезу, затем уточняет по мере поступления контекста и фиксирует стабильный результат.
Как соотносится с конкурентами?
По данным Artificial Analysis (замер от 2 октября 2026), ближайшие соперники заметно отстают.
- Grok Voice Transcribe 2.0 (xAI): WER 2,7%, задержка до финала 0,49 секунды.
- Muse Voice Transcribe: WER 3,1%, задержка 0,16 секунды.
- Cartesia Ink-2: самая быстрая по задержке (0,07 секунды), но WER 4,0%, то есть ошибок почти вдвое больше.
Microsoft оказалась точнее всех и при этом достаточно быстрой: 0,13 секунды до финального результата.
Цена: дороже конкурентов, но есть нюанс
Потоковый режим стоит 0,54 доллара за час аудио. Artificial Analysis пересчитывает это в 9 долларов за тысячу минут. Для сравнения: пакетная версия MAI Transcribe 2 (когда вы загружаете готовый файл, а не транслируете речь вживую) стоит 0,10 доллара за час.
По данным Artificial Analysis, Microsoft берёт за потоковое распознавание больше, чем xAI и Meta, и примерно столько же, сколько Google. Вводная цена действует до конца 2026 года, дальше компания условий не озвучила.
Как попробовать?
- Через MAI Playground. Откройте площадку Microsoft AI и выберите модель MAI Transcribe 2 Streaming. Микрофон в браузере позволит проверить распознавание без кода.
- Через Realtime API. Если ваше приложение уже работает с WebSocket-протоколом, совместимым с OpenAI Realtime, подключение займёт минимум изменений.
- Через Azure Speech SDK. Этот путь берёт на себя управление соединением, повторные попытки и потоковую передачу аудио. SDK возвращает и промежуточные, и финальные результаты.
- Через Vercel и Azure Voice Live. Интеграция с LiveKit заявлена, но пока не запущена.
Есть ли аналог в России?
Для аудитории в РФ и СНГ прямого конкурента с таким же охватом языков и потоковым режимом на рынке нет, но есть рабочие альтернативы.
| Параметр | MAI Transcribe 2 Streaming | SaluteSpeech (Сбер) | Yandex SpeechKit |
|---|---|---|---|
| Потоковый режим | Да | Да | Да |
| Русский язык | Да (авто) | Да | Да |
| Число языков | 60 | Ограниченный набор | Ограниченный набор |
| Цена за час | 0,54 доллара | Зависит от тарифа | Зависит от тарифа |
| Доступ из РФ | Через Azure, возможны ограничения | Без ограничений | Без ограничений |
Российские сервисы распознавания речи, SaluteSpeech от Сбера и Yandex SpeechKit, работают без ограничений на территории РФ и стоят дешевле. Но по независимым публичным бенчмаркам ни один из них пока не участвовал в сравнении Artificial Analysis на тех же наборах данных, поэтому сопоставлять WER напрямую некорректно.
Что это значит для вас?
Авторам Дзена и копирайтерам. Если вы надиктовываете тексты или записываете интервью, потоковая модель с WER 2,5% означает примерно одну ошибку на 40 слов. Для черновика это уже рабочий уровень. Пока доступ через Azure, имеет смысл протестировать через MAI Playground бесплатно.
Разработчикам голосовых решений в РФ. Модель поддерживает русский с автоматическим определением. Но 0,54 доллара за час при масштабе в тысячи пользователей заметно дороже китайских и российских аналогов. Считайте стоимость на пользователя до выбора.
Предпринимателям. Если строите продукт с голосовым интерфейсом для международного рынка, 60 языков из коробки экономят месяцы интеграции. Для внутреннего рынка РФ дешевле начать с SaluteSpeech или SpeechKit и переключиться, когда Microsoft уточнит постоянную цену.
Я протестировал предыдущую, пакетную версию MAI Transcribe 2 на русскоязычном аудио, и качество было заметно выше, чем у Whisper. Потоковая версия обещает ту же точность в реальном времени, и если замеры Artificial Analysis подтвердятся на русском так же, как на английском, это лучшее, что сейчас есть для голосовых ботов.
Но три оговорки. Цена 0,54 доллара за час, вводная, и Microsoft не сказала, какой будет постоянная. Модель в публичном превью без гарантий уровня обслуживания (SLA). Веса закрыты, значит запустить у себя на сервере нельзя, только через облако Microsoft.
Что сделать сегодня: откройте MAI Playground, продиктуйте абзац на русском и сравните результат с тем, что даёт ваш текущий сервис. Десять минут покажут, стоит ли менять стек.
Частые вопросы
Поддерживает ли MAI Transcribe 2 Streaming русский язык?
Да. Модель работает с 60 языками и определяет язык автоматически, переключаясь на лету. Русский входит в список поддерживаемых. Отдельно указывать язык перед стартом не нужно.
Можно ли пользоваться бесплатно?
Модель платная: 0,54 доллара за час аудио. Однако MAI Playground позволяет попробовать распознавание без написания кода. Условия бесплатного лимита в Playground Microsoft не уточнила.
Чем потоковая версия отличается от пакетной?
Пакетная MAI Transcribe 2 (вышла в сентябре 2026) принимает готовый аудиофайл и возвращает текст после полной обработки. Потоковая версия работает вживую: звук идёт непрерывно, текст возвращается, пока человек ещё говорит. Пакетная стоит 0,10 доллара за час, потоковая 0,54 доллара, разница в пять с лишним раз отражает стоимость работы в реальном времени.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Prime Intellect запустила serverless ИИ на Blackwell: триллион токенов в день и 100% аптайм
Компания Prime Intellect запустила Prime Inference, платформу для запуска открытых моделей в режиме serverless ИИ, которая до публичного релиза обрабатывала…
NVIDIA DGX Spark 64GB для локальных ИИ агентов
Microsoft второго июня запустила DGX Spark 64GB, компактный настольный компьютер на суперчипе Grace Blackwell, который позволяет держать ИИ-агентов и открытые…
Datalab открыла бенчмарки нейросетей для всех: 620 документов, 6 типов вердиктов, Apache 2.0
Microsoft второго июня запустила OmniExtractBench, и нет, подождите, это не Microsoft. Перечитаю источник внимательно. Компания Datalab выпустила…
Комментарии