Игорь Градов
Игорь Градов
5 мин
ai

Gradium AI выпустила TTS модель с 81% точности на цифрах и кодах: боты звонят без костылей

Компания Gradium AI 31 августа 2026 года выпустила новую TTS модель (модель синтеза речи, которая превращает текст в голос) и сразу сделала её моделью по умолчанию в своём API и визуальном редакторе Studio, решив главную боль голосовых ботов: корректное произношение номеров телефонов, email-адресов и кодов заказов без предварительной подготовки текста.

Почему это важно

Голосовые ИИ-агенты (боты, которые ведут разговор по телефону вместо оператора) чаще всего ломаются именно там, где точность критична: на цифрах заказа, номерах обратного звонка, адресах почты. Gradium заявляет, что новая TTS модель проходит 81% сложных тестовых фраз по оценке живых слушателей, тогда как ближайшие конкуренты набирают 75% и ниже.

Результаты опубликованы самой Gradium AI, но набор из 500 тестовых предложений компания выложила в открытый доступ на Hugging Face под лицензией CC BY 4.0, так что любой разработчик может проверить заявления на своих данных. Для рынка голосовых ботов в России, где операторы часто диктуют длинные номера договоров и коды подтверждения, это прямой практический сигнал.

Что Когда Кто выпустил Цена
Новая TTS модель (синтез речи), ставшая моделью по умолчанию в API и Studio 31 августа 2026 года Gradium AI Компания не раскрыла тарифы; новым командам предлагают 1 млн кредитов за отчёты об ошибках

Что читает правильно и почему это редкость?

  • Телефоны, email, коды заказов и IBAN произносятся без предварительной нормализации текста. Обычно перед синтезом речи разработчик должен вручную или скриптом переписать «+7 (495) 123-45-67» в текст по цифрам. Gradium заявляет, что их TTS модель делает это сама.
  • 81,0% пройденных сложных фраз по оценке живых носителей пяти языков (английский, немецкий, французский, испанский, португальский). Критерий строгий: одна пропущенная цифра означает провал всей фразы. По данным Gradium, Cartesia Sonic 3.6 набрала 75,1%, ElevenLabs v3 Conversational 65,4%, Fish Audio S2.1 Pro 49,5%, Inworld TTS 1.5 Max 46,5%.
  • 216 мс до первого звука (P50, медиана) на бенчмарке Coval. Это на 170 мс быстрее предыдущей модели самой Gradium. При этом компания честно указывает, что Inworld TTS 2 быстрее: 166 мс. Козырь Gradium не абсолютная скорость, а сочетание скорости и точности.
  • Разброс задержки всего 30 мс между 25-м и 75-м перцентилем на 480 запусках. У Cartesia Sonic 3.6, для сравнения, разброс 165 мс, то есть собеседник на линии иногда ждёт паузу, а иногда нет, и это раздражает сильнее стабильной задержки.
  • Миграция не нужна. Существующие голоса, включая клонированные, работают без изменений: модель автоматически стала версией по умолчанию.

Как попробовать?

  1. Если вы уже используете Gradium AI: ничего делать не нужно. Модель включена автоматически с 31 августа 2026 года, голоса и клоны сохранены.
  2. Если начинаете с нуля: установите Python SDK от Gradium, подключитесь к WebSocket TTS-эндпоинту (точке, куда отправляется текст и откуда приходит аудио) и используйте стандартные идентификаторы голосов.
  3. Хотите получить 1 млн бесплатных кредитов: отправьте в Discord-канал Gradium полный отчёт о случаях, когда модель неправильно произносит сложные фразы. Компания платит кредитами за найденные ошибки.
  4. Хотите проверить заявления сами: скачайте набор из 500 тестовых предложений на Hugging Face (лицензия CC BY 4.0) и прогоните через свою систему.

Есть ли аналоги в России?

Для русскоязычных голосовых ботов основные инструменты синтеза речи это SpeechKit от Яндекса и решения от Сбера. Прямого сравнения с Gradium по методологии «500 сложных фраз с оценкой живыми слушателями» ни Яндекс, ни Сбер не публиковали, поэтому ставить их в один ряд по цифрам было бы некорректно.

Принципиальная разница: Gradium пока не поддерживает русский язык (тесты проведены на пяти европейских языках). Для задач на русском SpeechKit остаётся рабочим вариантом, но проблема с произношением кодов и номеров в нём тоже знакома разработчикам и требует нормализации текста на стороне клиента.

Что делать с этим прямо сейчас, по ролям?

  • Разработчику голосовых ботов для зарубежных клиентов: протестируйте Gradium на реальных сценариях с кодами заказов и email. Если ваш бот обслуживает европейские языки, отказ от ручной нормализации текста экономит часы разработки.
  • Автору Дзена, который озвучивает контент: пока Gradium не поддерживает русский, для вас это сигнал, а не инструмент. Следите за обновлениями: если компания добавит русский с тем же качеством на цифрах, это закроет боль с произношением дат, цен и артикулов в обзорах товаров.
  • Предпринимателю с колл-центром в РФ: русского языка нет, подключать рано. Но идея «модель сама читает номера без подготовки» это критерий, по которому стоит оценивать и российские решения при выборе TTS модели для своего бота.
Мнение редакции dzen.guru

Цифры Gradium выглядят убедительно, но важно помнить: бенчмарк проведён самой компанией. Да, набор данных открыт, методика описана подробно, оценивали живые носители языка, но независимого воспроизведения пока нет. По моему опыту, именно открытость тестового набора отличает честный маркетинг от пустых заявлений: любой конкурент может взять те же 500 фраз и показать свой результат.

Что настораживает: русского языка в тестах нет. Для большинства читателей dzen.guru это значит, что модель пока «посмотреть, но не купить». Что сделать сегодня: скачайте тестовый набор с Hugging Face и прогоните через вашу текущую TTS модель на тех языках, которые вы используете. Вы получите собственный ориентир, с которым можно сравнивать любые будущие релизы, включая российские.

Частые вопросы

Работает ли новая TTS модель Gradium с русским языком?

Нет. По данным компании, тесты проведены на пяти языках: английском, немецком, французском, испанском и португальском. О поддержке русского Gradium не сообщала.

Нужно ли платить за переход на новую модель?

Для текущих пользователей переход произошёл автоматически и бесплатно. Тарифы для новых пользователей компания не раскрыла, но предлагает 1 млн кредитов за полные отчёты об ошибках произношения.

Можно ли доверять результатам бенчмарка?

Бенчмарк проведён самой Gradium, это важная оговорка. Однако компания открыла все 500 тестовых предложений на Hugging Face под свободной лицензией CC BY 4.0. Методика описана: независимые носители языка оценивали аудио, порядок был рандомизирован, громкость нормализована, число сравнений ограничено 40 с перерывом. Это не гарантия объективности, но даёт возможность воспроизвести тест самостоятельно.

Если вы строите голосового бота на европейских языках и устали вручную переписывать номера телефонов в текст для озвучки, Gradium стоит проверить на своих данных: открытый бенчмарк позволяет сравнить до покупки, а автоматический переход избавляет от миграции.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

NEEDLE обновляет бенчмарки нейросетей каждый час: заучить ответы больше нельзя
ai

NEEDLE обновляет бенчмарки нейросетей каждый час: заучить ответы больше нельзя

Microsoft второго июня запустила NEEDLE, открытый бенчмарк (набор тестовых задач для объективной проверки качества нейросетей), который каждый час обновляет…

5 мин
WAIC 2026: роботы и AI for Science
ai

WAIC 2026: роботы и AI for Science

Конференция WAIC 2026, прошедшая с 17 по 20 июля в Шанхае, показала, как быстро китайская индустрия переводит лабораторные разработки в области искусственного…

5 мин
DLSS 5 утёк из билда NBA 2K27: модеры подключили его к десяткам игр за дни
ai

DLSS 5 утёк из билда NBA 2K27: модеры подключили его к десяткам игр за дни

Компания Nvidia не объявляла о запуске DLSS 5, но энтузиасты 27 августа 2026 года нашли рабочую библиотеку нейросетевого рендеринга внутри раннего билда NBA…

6 мин