Игорь Градов
Игорь Градов
5 мин
ai

Grok Voice Transcribe 2.0: речь в текст API вдвое точнее при $0,10 за час аудио

SpaceXAI выпустила Grok Voice Transcribe 2.0, обновлённую модель распознавания речи в текст, которая, по заявлению разработчиков, вдвое точнее первой версии при той же цене и уже доступна через Speech to Text API (речь в текст API, программный интерфейс для автоматической расшифровки аудио в текст).

Почему это важно

Модель автоматически определяет язык и переключается между языками прямо внутри одной записи, а число ошибок на коротких фразах на 19 языках упало с 20,6% до 6,8%, то есть ошибок стало примерно на 67% меньше. Для мультиязычных колл-центров и голосовых помощников это прямой аргумент в пользу замены текущего STT-решения (STT, speech-to-text, технология распознавания речи в текст).

Что Когда Кто выпустил Цена
Grok Voice Transcribe 2.0, модель распознавания речи Доступна сейчас, модель ID grok-voice-transcribe-2.0 SpaceXAI Пакетный режим: $0,10 за час аудио. Потоковый режим: $0,20 за час аудио. Цена не изменилась по сравнению с версией 1.0

Grok Voice Transcribe 2.0 построена на аудиофундаменте, который лежит в основе голосового движка Grok Voice. По данным SpaceXAI, Grok Voice уже обрабатывает десятки тысяч звонков в службу поддержки ежедневно, расшифровывает миллионы часов видеозаписей и работает в голосовом помощнике автомобилей Tesla. Обучающие данные (training data) для новой модели собраны из реальных шумных, мультиязычных записей в разных средах, после чего модель прошла этап дообучения (fine-tuning, дополнительная тренировка на узких задачах).

Что изменилось по сравнению с первой версией?

  • Удвоенная точность по заявлению SpaceXAI: улучшение зафиксировано на всех четырёх внутренних тестовых наборах компании, включая телефонию (8 кГц), разговорную речь, распознавание реквизитов (номера телефонов, адреса, email) и короткие фразы на 19 языках.
  • Первое место среди 32 потоковых моделей на публичном лидерборде Artificial Analysis по бенчмарку AA-WER Streaming (около 8 часов тестового аудио). Данные приводит сама SpaceXAI.
  • Автоопределение языка и переключение языков внутри одной записи. SpaceXAI называет мультиязычную точность главным улучшением над версией 1.0.
  • Разделение дикторов (speaker diarization, разметка, кто из собеседников говорит) включено в стоимость.
  • До 8 каналов аудио расшифровываются независимо.
  • Подсказка терминов (key term biasing): до 100 специфичных слов на запрос, чтобы модель не путала профессиональную лексику.
  • Умное определение конца реплики через ML-модель, полезно для голосовых ИИ-агентов (agent, программа, которая сама выполняет задачи по цепочке).
  • Удаление слов-паразитов («э-э», «м-м») включено по умолчанию.
  • Пакетный режим принимает файлы до 500 МБ в 12 форматах. Потоковый режим работает через WebSocket и поддерживает сжатие Opus (около 4 КБ/с против 48 КБ/с для сырого PCM).

Результаты на внутренних тестах SpaceXAI не воспроизведены независимо, о чём компания сообщает открыто.

Кто уже внедрил?

Atlassian Loom перешла на Grok Voice Transcribe 2.0 для расшифровки всех видеозаписей. По словам Atlassian, модель оказалась точнее предыдущего решения. Санчан Саксена, старший вице-президент подразделения Teamwork Collection в Atlassian, описал результат так:

Замыкается цикл от контекста к коду. : Санчан Саксена, SVP Teamwork Collection, Atlassian

Рабочий процесс выглядит так: пользователь записывает план действий в Loom, транскрипт автоматически передаётся в Cursor (редактор кода с ИИ), который вносит правки в код.

Как попробовать?

  1. Получите API-ключ SpaceXAI на сайте x.ai (открытых весов нет, модель доступна только как облачный API, речь в текст API).
  2. Отправьте запрос с параметром model=grok-voice-transcribe-2.0. Пример на curl есть в документации SpaceXAI.
  3. Для потокового режима подключитесь по WebSocket на wss://api.x.ai/v1/stt.
  4. Для мультиязычных записей не указывайте параметр language: модель определит язык сама и переключится, если собеседник заговорит на другом.

Самостоятельный хостинг (self-hosting) невозможен: SpaceXAI не публикует открытые веса (open weights, файлы модели для запуска на своём сервере).

Есть ли аналоги в России?

Для русскоязычных задач распознавания речи доступны, в первую очередь, SaluteSpeech от Сбера и SpeechKit от Яндекса. Обе платформы поддерживают русский язык, потоковый и пакетный режимы, разделение дикторов. Однако автопереключение между языками внутри одной записи, ключевое обновление Grok Voice Transcribe 2.0, у российских сервисов на момент публикации не заявлено как штатная функция. Для тех, кто работает с мультиязычными звонками (например, колл-центры на русском и узбекском или русском и казахском), это пока нерешённая задача на российском рынке.

Что делать с этим прямо сейчас, по ролям?

Разработчику голосовых сервисов в РФ и СНГ. Если ваш колл-центр обслуживает клиентов на нескольких языках, протестируйте Grok Voice Transcribe 2.0 на реальных записях. Автопереключение языков в одном потоке может снять необходимость вручную маршрутизировать звонки по языковым моделям.

Автору Дзена. Расшифровка подкастов и видеоинтервью, частая задача. При цене $0,10 за час пакетной обработки модель дешевле большинства платных сервисов ручной расшифровки.

Предпринимателю. Модель доступна через облачный API без ограничений по географии, но учтите: данные уходят на серверы SpaceXAI. Для чувствительных переговоров это может быть стоп-фактором, а российские регуляторы могут потребовать хранение данных на территории РФ.

Мнение редакции dzen.guru

По моим наблюдениям, рынок речь в текст API за последний год стал заметно плотнее: Deepgram, AssemblyAI, Whisper от OpenAI и теперь обновлённый Grok. SpaceXAI делает ставку на «грязный» звук, шумные линии, акценты, перебивающие голоса, и, судя по заявленным цифрам WER, результат выглядит убедительно. Но я бы не спешил менять рабочий STT-конвейер, пока не появятся независимые тесты: все бенчмарки, кроме Artificial Analysis, приведены самой SpaceXAI. Если вы работаете с русским языком, прогоните пробную партию записей и сравните с текущим решением. Цена не изменилась, так что эксперимент ничего не стоит, кроме времени.

Частые вопросы

Можно ли запустить модель на своём сервере?

Нет. SpaceXAI не опубликовала открытые веса. Grok Voice Transcribe 2.0 работает только как облачный API. Для проектов, где данные не должны покидать контур, это ограничение.

Поддерживает ли модель русский язык?

SpaceXAI заявляет поддержку «десятков языков» и приводит список из 25 языков для форматирования чисел, валют и единиц. Конкретный перечень языков для распознавания речи компания раскрывает в документации API. Перед интеграцией стоит проверить на реальных русскоязычных записях.

Чем отличается пакетный режим от потокового?

Пакетный (batch) режим принимает готовый файл (до 500 МБ) и возвращает текст после обработки. Стоит $0,10 за час аудио. Потоковый (streaming) режим обрабатывает звук в реальном времени через WebSocket и стоит $0,20 за час. Для живых звонков и голосовых помощников нужен потоковый, для архивных записей хватит пакетного.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Новые модели ИИ без галлюцинаций: Jev выдаёт вероятности в 18 раз быстрее ChatGPT

Почему это важно Впервые на рынке появилась модель-трансформер, которая не генерирует текст, а выдаёт калиброванные вероятности, и разработчики уже заменяют ею…

6 мин
ai

Форматы LLM моделей GGUF, GPTQ и AWQ: какой сжимает веса без потери качества

Microsoft выпустила две модели Phi-4 с открытыми весами и мультимодальностью, но без лицензии на коммерческое использование в ЕС Когда вы скачиваете модель с…

7 мин
Что такое ИИ-агент для семьи: Google CC сам читает школьные письма и ведёт календарь
ai

Что такое ИИ-агент для семьи: Google CC сам читает школьные письма и ведёт календарь

Google тестирует CC, ИИ-агента для семей, который сам разбирает школьные письма, заполняет бланки и ведёт общий календарь, но пока работает только в США и…

5 мин