Нейросеть Sonic 3.6 возглавила оба рейтинга синтеза речи: вдвое дешевле ElevenLabs
Cartesia выпустила Sonic 3.6, модель для синтеза речи в реальном времени, которая 18 августа 2026 года заняла первое место сразу в двух независимых рейтингах качества озвучки Artificial Analysis.

Sonic 3.6 лидирует не только в общем зачёте голосов, но и в контролируемом тесте, где все модели клонируют одни и те же восемь эталонных голосов: побеждает именно движок синтеза, а не размер каталога голосов.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Sonic 3.6, модель синтеза речи нейросетью в реальном времени | Август 2026, примерно через три месяца после Sonic 3.5 | Cartesia | От бесплатного тарифа до $299 в месяц; по данным Artificial Analysis, $49 за 1 млн символов |
Модель вышла в статусе бета-версии и доступна только через облачный API (программный интерфейс, через который приложение обращается к сервису) Cartesia. Открытых весов нет, скачать и запустить на своём сервере нельзя: это закрытая коммерческая модель, вы арендуете доступ. Документация Cartesia пока указывает Sonic 3.5 как стабильную версию, а партнёры компании работают на 3.5.
Это важная деталь для тех, кто планирует внедрение: бета означает, что API может измениться, а для продакшена разумнее дождаться стабильного релиза.
Что именно улучшилось в Sonic 3.6?
- Первое место в двух рейтингах Artificial Analysis. 1 283 Elo на доске Provider Voice (общий зачёт) и 1 123 Elo на доске Controlled Voice (контролируемый тест). На контролируемой доске второе место у предыдущей Sonic 3.5, третье у ElevenLabs Eleven v3.
- Архитектура на моделях пространства состояний (state space models, SSM), а не на трансформерах. SSM обрабатывают длинные последовательности быстрее: Cartesia заявляет задержку до первого звука менее 90 миллисекунд. Это заявленное время модели, а не реальная задержка от конца до конца, которая зависит от сети и вашего сервера.
- Встроенные теги выражений. Прямо в тексте можно вставить
[laughter]или другие невербальные реакции, и модель их воспроизведёт. Полезно для ИИ-агентов (программ, которые ведут диалог самостоятельно) в контакт-центрах. - Клонирование голоса за 10 секунд аудио. Достаточно короткого образца, чтобы модель заговорила нужным голосом.
- Словари произношения с поддержкой IPA (международного фонетического алфавита). Можно задать, как именно читать нестандартное слово.
- Нативная обработка буквенно-цифровых кодов. Номера заказов, телефоны, коды подтверждения читаются корректно без предварительной обработки.
- Демо показывают английскую речь с естественными паузами, словами-заполнителями, а также переключение между хинди и английским (Hinglish).
Цена: вдвое дешевле ElevenLabs, но не самый дешёвый вариант
По нормализованным данным Artificial Analysis, стоимость Sonic 3.6 составляет $49 за 1 млн символов. Для сравнения из того же источника: ElevenLabs Eleven v3 стоит $100 за 1 млн символов, а Speechify Simba 3.2 обходится в $10 за 1 млн символов при рейтинге 1 240 Elo.
Cartesia продаёт не символы, а кредиты. Тариф Scale за $299 в месяц включает примерно 10 667 минут синтеза речи и 15 одновременных запросов. Голосовые агенты для телефонных линий тарифицируются отдельно: $0,06 за минуту.
Коммерческое использование начинается с тарифа Pro за $5. Есть бесплатный тариф для экспериментов.
Как попробовать?
- Зарегистрируйтесь на сайте Cartesia и выберите бесплатный или Pro-тариф ($5).
- Получите API-ключ в личном кабинете и отправьте первый запрос на синтез речи нейросетью через документацию Cartesia (на момент публикации документация ссылается на Sonic 3.5, бета 3.6 доступна через API).
- Для интеграции в голосового агента используйте плагин LiveKit Agents, который поддерживает параметры скорости, громкости и эмоций.
- Проверьте реальную задержку в своей инфраструктуре: заявленные менее 90 мс относятся к модели, а не к вашему маршруту от микрофона до динамика.
Есть ли аналоги для русского языка?
Sonic 3.6 пока демонстрирует возможности на английском и Hinglish. Для русскоязычных задач стоит учитывать, что Cartesia не заявляла поддержку русского языка в текущем релизе.
| Параметр | Cartesia Sonic 3.6 | SaluteSpeech (Сбер) | Yandex SpeechKit |
|---|---|---|---|
| Русский язык | Не заявлен | Да | Да |
| Модель доступа | Облачный API | Облачный API | Облачный API |
| Открытые веса | Нет | Нет | Нет |
| Рейтинг Artificial Analysis | 1 283 Elo (первое место) | Не участвует | Не участвует |
Для контакт-центров и локализации контента на русском языке SaluteSpeech и Yandex SpeechKit остаются основными рабочими инструментами. Если ваши задачи связаны с английским языком или вы строите продукт для международного рынка, Sonic 3.6 по соотношению рейтинга и цены выглядит привлекательно.
Победа в контролируемом тесте Artificial Analysis, где все модели работают с одинаковыми голосами, для меня главный аргумент: это значит, что улучшился сам движок, а не маркетинг. Цена вдвое ниже ElevenLabs при лучшем рейтинге сужает разрыв между качеством и доступностью, и это конкретный сигнал для стартапов, которые строят голосовых агентов на английском.
Но оговорки серьёзные. Бета-статус означает, что API может сломаться или измениться без предупреждения. Русского языка нет. Задержка менее 90 мс заявлена самой Cartesia, независимых замеров пока нет.
Что сделать сегодня: зарегистрируйтесь на бесплатном тарифе и прогоните через API три-четыре сценария своего продукта. Замерьте реальную задержку. Если строите контент на английском для Дзена или YouTube, попробуйте клонирование голоса за 10 секунд: это быстрее любого ручного найма диктора.
Частые вопросы
Можно ли озвучивать тексты на русском языке через Sonic 3.6?
На момент публикации Cartesia не заявляла поддержку русского языка в Sonic 3.6. Демо показывают английскую речь и переключение между хинди и английским. Для русского используйте Yandex SpeechKit или SaluteSpeech.
Чем синтез речи нейросетью на SSM отличается от трансформерной модели?
Модели пространства состояний (SSM) обрабатывают длинные последовательности экономнее по памяти и быстрее, чем классические трансформеры (архитектура, на которой построены GPT и большинство больших языковых моделей). Для синтеза речи это означает меньшую задержку: Cartesia заявляет менее 90 мс до первого звука.
Sonic 3.6 уже стабильна для продакшена?
Нет. Модель выпущена в статусе бета. Документация Cartesia по-прежнему указывает Sonic 3.5 как стабильную, партнёры компании работают на версии 3.5. Для критичных систем разумно тестировать, но не переключать продакшен до стабильного релиза.
Первое место в обоих независимых рейтингах при цене вдвое ниже ближайшего конкурента по качеству делает Sonic 3.6 кандидатом на тестирование для любого проекта с англоязычной озвучкой, но бета-статус и отсутствие русского языка пока ограничивают практическое внедрение.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Google встроила Gemini в Chrome на Android: ИИ пересказывает статьи и сам действует на сайтах
Gemini теперь встроен прямо в мобильный Chrome на Android и умеет пересказывать статьи, отвечать на вопросы по открытой странице и работать с Google Календарём…

ChatGPT для подростков: вместо готовых ответов подсказки, но защита появилась спустя 2,5 года
ChatGPT для подростков появился 9 июня 2025 года, после серии судебных исков к OpenAI из-за отсутствия защиты несовершеннолетних, и впервые предлагает режим…
Искусственный интеллект провалил научную работу: Принстон проверил самосовершенствование ИИ
Microsoft второго июня представила ИИ-агента Scout, который самостоятельно управляет почтой, календарём и заметками пользователя без явных команд. Группа…
Комментарии