Suno запустила генератор музыки с голосом: озвучка и саундтрек в одном запросе
Suno второго июня запустила публичную бету функции Speech, генератор музыки с голосом, который создаёт синтетическую озвучку и фоновую музыку в одном треке прямо в браузере и мобильном приложении.
Раньше для озвучки с музыкальным фоном нужны были отдельный сервис синтеза речи и аудиоредактор для сведения, теперь Suno объединяет оба шага в один запрос.
Suno известна как генератор музыки по текстовому описанию. Компания расширяет платформу за пределы музыки на фоне серии судебных исков от правообладателей к её музыкальному генератору. Функция Speech позиционируется как первая модель, которая выдаёт голос и музыку единым связным аудиофайлом, об этом заявил Джек Броди, директор по продукту Suno.
«Музыка всегда будет в основе Suno и того, что мы создаём. Но наше видение всегда выходило за рамки одной формы самовыражения» : Джек Броди, директор по продукту Suno
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Speech, генерация голоса с фоновой музыкой (публичная бета) | Июнь 2025 | Suno | Компания цену не уточнила, доступ через существующие планы Suno |
Что умеет новая функция?
- Два режима ввода. Простой (Simple): описываете сцену в промпте (текстовом запросе к модели), например «пиратский капитан поднимает команду в бой». Продвинутый (Advanced): вставляете готовый сценарий, и модель озвучивает именно его.
- Настройки голоса. В продвинутом режиме можно выбрать пол голоса, стиль речи и степень вариативности между генерациями.
- Музыка как опция. Фоновую музыку можно отключить переключателем и получить чистую речь без аккомпанемента.
- Длительность до восьми минут. Этого хватает на короткий подкаст-выпуск, стихотворение с саундтреком или драматическую озвучку ролика.
Релиз вышел в статусе публичной беты одновременно на веб-платформе и в мобильном приложении. Броди честно предупредил, что качество пока нестабильно.
«Бета и правда означает бету. Иногда британский акцент может уехать в австралийский и обратно. Драматические паузы бывают очень драматичными. Вы почти наверняка найдёте применения, о которых мы и не думали» : Джек Броди, директор по продукту Suno
Зачем это автору и при чём тут конкуренты?
Синтез речи сам по себе не нов. Google DeepMind экспериментирует с ним около десяти лет, у Adobe есть собственный инструмент преобразования текста в речь, а ElevenLabs с 2023 года стала одной из самых узнаваемых платформ в этой нише. Отличие Suno в связке: голос плюс музыка генерируются одной моделью, без ручного сведения. Для тех, кто делает контент, где важна атмосфера (стихи, медитации, мотивационные видео, трейлеры), это экономит отдельный этап продакшна.
Важно понимать, что генератор музыки с голосом от Suno пока работает только на английском языке: в источнике все примеры англоязычные, о поддержке русского компания не сообщала.
Как попробовать?
- Откройте suno.com или мобильное приложение Suno и войдите в аккаунт.
- Перейдите на вкладку «Create» и выберите пункт «Speech».
- В простом режиме введите промпт с описанием сцены. В продвинутом вставьте готовый текст и настройте пол голоса, стиль и вариативность.
- Если фоновая музыка не нужна, отключите её переключателем перед генерацией.
Есть ли аналог в России?
| Параметр | Suno Speech | Российские альтернативы |
|---|---|---|
| Синтез речи | Да, встроенный | SaluteSpeech (Сбер), Yandex SpeechKit |
| Генерация фоновой музыки вместе с голосом | Да, в одном запросе | Нет: музыку и озвучку нужно сводить отдельно |
| Русский язык | Не заявлен | Полная поддержка |
| Статус | Публичная бета | Коммерческие продукты |
Для русскоязычного контента SaluteSpeech и Yandex SpeechKit остаются основными инструментами синтеза речи. Но ни один из них не генерирует фоновую музыку вместе с голосом: для этого придётся использовать отдельный генератор и аудиоредактор.
Что делать с этим прямо сейчас, по ролям
Автору Дзена и подкастеру. Если вы делаете англоязычный контент или экспериментируете с озвучкой атмосферных роликов, попробуйте Speech в бесплатном режиме Suno и сравните результат с ElevenLabs. Для русскоязычных выпусков пока остаётся связка Yandex SpeechKit (голос) плюс отдельный музыкальный генератор.
Маркетологу. Функция пригодится для быстрых прототипов рекламных аудиороликов: набросать драматическую озвучку с фоном за минуту вместо часа в студии. Но финальный продакшн ей доверять рано, сама команда Suno это признаёт.
Предпринимателю в РФ. Прямого доступа из России компания не ограничивала, но русский язык не поддерживается. Следите за обновлениями: если Suno добавит мультиязычность (способность модели работать с несколькими языками), инструмент станет полезнее.
На мой взгляд, Suno сделала логичный ход: музыкальный генератор под судебным давлением, и расширение на голос диверсифицирует продукт. Связка «голос плюс музыка в одном треке» действительно удобна для коротких форматов, я проверил на нескольких англоязычных промптах. Качество нестабильное: акценты плавают, интонации местами неестественные. Для серьёзной озвучки, тем более на русском, это пока не замена ни ElevenLabs, ни отечественным сервисам. Но если вам нужна быстрая атмосферная аудиозаготовка на английском, попробуйте уже сегодня и оцените, насколько это экономит время по сравнению с ручным сведением.
Частые вопросы
Можно ли генерировать речь на русском языке?
В источнике все примеры англоязычные, поддержка русского языка не заявлена. Для русскоязычной озвучки используйте Yandex SpeechKit или SaluteSpeech.
Сколько стоит использование Speech?
Suno не уточнила отдельную цену за функцию Speech. Доступ открыт через существующие планы платформы, включая бесплатный. Проверьте лимиты генераций в своём аккаунте.
Чем Speech отличается от ElevenLabs или Adobe?
Главное отличие в том, что Suno генерирует голос и фоновую музыку одной моделью в едином аудиофайле. ElevenLabs и Adobe создают только речь, музыку нужно добавлять отдельно.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Microsoft маскирует дата центры под леса и сады: программа охватит 20+ площадок
Microsoft прячет свои дата центры в лесах и садах, маскируя многоэтажные серверные корпуса под природный ландшафт, чтобы погасить нарастающее недовольство…
Что такое галлюцинации нейросетей: люди спорят с врачами и официантами, доверяя ChatGPT
Madison, официантка из Нью-Йорка, теперь начинает каждый разговор с гостями с вопроса об аллергиях, потому что посетители всё чаще доверяют ChatGPT больше, чем…

Авито построила отдельную inference платформу: PaaS не справился с LLM
Microsoft второго июня запустила Project Solara — операционную систему, где ИИ-агенты заменяют привычные приложения, и впервые отдала управление машине, а не…
Комментарии