Text to speech нейросеть Gemini создаёт голоса по описанию: 2000 тембров и 100 языков
Google представила две модели text to speech на базе Gemini 3.8 Flash, которые превращают голосовой синтез из набора готовых голосов в полноценную творческую студию с управлением интонацией, акцентом и подачей по каждой строке сценария.

Впервые text to speech нейросеть от Google даёт создавать голоса с нуля по текстовому описанию на более чем 100 языках и диалектах, включая региональные варианты, а не просто выбирать из списка готовых пресетов.
До сих пор голосовой синтез в экосистеме Google работал через фиксированную библиотеку голосов и отдельный сервис Cloud TTS. Теперь Google встраивает генерацию речи прямо в семейство Gemini и добавляет два специализированных инструмента. Об этом компания сообщила в официальном блоге Google. Модели уже доступны разработчикам в Google AI Studio, а значит, ими можно пользоваться через API (программный интерфейс, через который приложения обмениваются данными).
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Gemini 3.8 Flash TTS и Flash-Lite TTS | Доступны с момента анонса | Компания не раскрыла |
Две модели, две задачи
-
Gemini 3.8 Flash TTS создан для творческой работы: дизайн персонажных голосов с нуля через промпт (текстовое описание нужного голоса), управление актёрской подачей построчно, создание аудиокниг, подкастов, озвучки для игр.
-
Gemini 3.8 Flash-Lite TTS оптимизирован под массовую генерацию: дубляж больших объёмов контента, голосовые ИИ-агенты (программы, которые общаются с клиентами голосом) и создание аудиоконтента, где важна скорость и стоимость, а не ручная настройка каждой реплики.
Обе модели дополняют звуковую линейку Gemini, в которой уже есть модели для перевода в реальном времени (3.5 Live Translate), транскрибации (3.5 Transcribe) и голосового общения (3.8 Live).
Что умеют новые модели?
-
Генерация голоса по описанию. Описываешь промптом нужный голос: «драматический рассказчик с мягким южноамериканским акцентом» или «огнедышащий дракон», модель создаёт голос с нуля. Работает на более чем 100 языках и диалектах.
-
Библиотека из 2 000+ готовых голосов. Включает региональные варианты: мексиканский испанский, квебекский французский, шотландский английский. До этого базовый набор составлял 30 голосов.
-
Клонирование голоса по 30-секундному образцу. Можно воспроизвести свой голос или голос человека, давшего согласие. Система требует голосовое подтверждение от владельца голоса и добавляет водяной знак SynthID (невидимая метка в аудио, которая помогает отличить синтезированную речь от настоящей).
-
Построчное управление подачей. Можно задавать режиссёрские указания для каждой реплики: темп, паузы, шёпот, смех, вздохи, междометия вроде «угу» и «ага» для имитации живого разговора.
-
Сцены на два голоса. Из одного сценария модель генерирует диалог двух персонажей с естественной сменой реплик и раздельными голосами.
-
Длинные аудио без деградации. По заявлению Google, голос сохраняет качество и тембр на протяжении часов непрерывной генерации, что критично для аудиокниг и подкастов.
-
Ремиксование голосов (скоро). Можно будет взять голос из библиотеки и подстроить тембр, высоту, темп и акцент через промпт.
Бенчмарки: первые места на двух рейтингах
По данным Google, Gemini 3.8 Flash TTS занял первое место в общем зачёте бенчмарка (теста производительности) Hume AI Voice Design Benchmark с результатом 71,4 балла и лидирует в моделировании акцентов (60,8 балла). Flash TTS и Flash-Lite TTS также заняли первое и второе места в индексе качества Hume AI Overall Quality Index. Релиз совпал с публикацией слепых пользовательских оценок на Voice Arena, где обе модели вошли в топ по японскому, бразильскому португальскому, вьетнамскому, арабскому, мексиканскому испанскому и хинди.
Важно: это результаты, которые приводит сама Google, независимого аудита на момент публикации не проводилось.
Как попробовать?
- Откройте Google AI Studio по адресу aistudio.google.com.
- Перейдите в раздел аудио-площадки (audio playground), где можно создать голос промптом или загрузить 30-секундный образец для клонирования.
- Напишите сценарий и назначьте голоса для каждой реплики в редакторе на два персонажа.
- Сгенерируйте аудио и скачайте результат.
Доступ через Gemini API открыт разработчикам. Для использования нужен аккаунт Google. О блокировках по региону Google не сообщает, но AI Studio исторически работает не во всех странах.
Сравнение с доступными в России инструментами
| Возможность | Gemini 3.8 Flash TTS | YandexGPT (SpeechKit) | Сбер SaluteSpeech |
|---|---|---|---|
| Генерация голоса по описанию | Да, через промпт | Нет, только готовые голоса | Нет |
| Количество готовых голосов | 2 000+ | Около 20 | Около 10 |
| Клонирование голоса | Да, по 30-секундному образцу | Нет в публичном доступе | Нет в публичном доступе |
| Построчное управление подачей | Да | Частично (разметка SSML) | Частично (разметка SSML) |
| Поддержка языков | 100+ | Русский, частично другие | Русский |
Для автора Дзена, работающего на русскоязычную аудиторию, SpeechKit Яндекса остаётся рабочим инструментом для базовой озвучки. Но если нужны персонажные голоса, дубляж на несколько языков или управление актёрской подачей, Google пока предлагает принципиально другой уровень text to speech нейросети.
Что делать с этим прямо сейчас, по ролям?
Авторам Дзена и подкастерам. Если вы делаете аудиоверсии статей или ведёте подкаст, попробуйте Flash-Lite TTS для массовой озвучки. Два голоса в одном сценарии позволяют собрать диалоговый подкаст без второго ведущего.
Маркетологам и продюсерам. Клонирование голоса за 30 секунд и сохранение профиля открывает путь к масштабируемому брендовому голосу для рекламы, IVR (голосовое меню при звонке в компанию) и видеороликов на нескольких языках.
Предпринимателям в РФ и СНГ. Google AI Studio может быть недоступен напрямую. Проверьте доступ через VPN или через API с серверов за пределами России. Для локальных задач Яндекс SpeechKit и SaluteSpeech закрывают базовые потребности, но не дают генерацию голоса по описанию.
Google фактически превратила text to speech нейросеть из утилиты в творческий инструмент. Я вижу главную ценность не в библиотеке из 2 000 голосов, а в том, что промпт стал инструментом кастинга: описал персонажа словами, получил голос. Для тех, кто делает контент на русском, это пока инструмент с оговорками: региональные варианты русского в списке не упоминаются, хотя «100+ языков» формально русский включают. Проверяйте качество русского синтеза лично, прежде чем строить на нём продакшен. Мой совет: зайдите в AI Studio сегодня, создайте один голос промптом на русском и оцените результат на своей аудитории. Если качество устроит, вы получите озвучку для контента без бюджета на диктора.
Частые вопросы
Можно ли клонировать чужой голос?
Технически модель воспроизводит голос по 30-секундному образцу. Но система требует голосовое подтверждение согласия от владельца голоса, которое должно совпадать с загруженным образцом. Без этого подтверждения создать голосовой профиль нельзя. Каждый сгенерированный файл маркируется водяным знаком SynthID.
Нужно ли платить?
Google не указала стоимость в анонсе. Доступ через Google AI Studio открыт разработчикам. Исторически Google предоставляет бесплатный лимит на API, а дальше тарифицирует по количеству символов. Точные цены для Gemini 3.8 TTS компания не назвала.
Работает ли на русском языке?
Google заявляет поддержку более 100 языков и диалектов. Русский в списке конкретных примеров не упомянут, но по объёму покрытия должен поддерживаться. Качество синтеза на русском стоит проверять самостоятельно: для рынка контента на Дзене это критичный параметр, который никакой бенчмарк не заменит.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Обработка резюме нейросетью: как разобрать 400 откликов за вечер на российском API
Когда в день на одну вакансию приходит 400 резюме, обработка резюме нейросети превращается из эксперимента в рабочий инструмент, и вот конкретный способ…

Премьер Греции признал: политика страны не поспевает за искусственным интеллектом
Греция пытается стать новым домом для ИИ-индустрии, но её премьер-министр Кириакос Мицотакис, выступая перед 250 основателями и инвесторами в Сан-Франциско,…

Проверка договора онлайн ИИ: тест на 8 ловушках показал, что пропускает нейросеть
Нейросети берутся проверять договоры за минуты, но одни ловят все подвохи, а другие пропускают критичные пункты, и разница между ними определяет, подпишете ли…
Комментарии