Gemini TTS генерирует голос по промпту: 2 000+ голосов, 100+ языков, первое место в бенчмарках
Google выпустила две модели синтеза речи: Gemini 3.8 Flash TTS для озвучки персонажей и креативных проектов и Gemini 3.8 Flash-Lite TTS для массового производства аудио, обе доступны через API прямо сейчас.
Впервые в линейке Gemini появился генеративный дизайн голосов: вместо выбора из каталога автор описывает персонажа текстом и получает уникальный голос на одном из 100+ языков и диалектов.
До сих пор Gemini TTS (text-to-speech, синтез речи из текста) предлагал 30 готовых голосов. Обновление, о котором сообщила Google, меняет масштаб: библиотека выросла до 2 000+ голосов, а Flash TTS умеет создавать новые по текстовому описанию. Marktechpost, опубликовавший разбор релиза, отмечает, что обе модели уже доступны через Gemini API и Google AI Studio, но только по API, открытых весов для самостоятельного развёртывания нет. Корпоративный доступ через Gemini Enterprise Google обещает позже, точную дату не называет.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Gemini 3.8 Flash TTS и Flash-Lite TTS | Доступны сейчас (rolling out) | Не раскрыта, доступ по API |
Чем отличаются две модели?
- Flash TTS заточен под творческие задачи: озвучка игр, аудиокниги, подкасты, интерактивные медиа. Позволяет управлять актёрской подачей, темпом, сменой диалекта и репликами-реакциями построчно, прямо в скрипте.
- Flash-Lite TTS рассчитан на объём и экономию: дубляж, массовое создание аудиоконтента, голосовые ИИ-агенты (программы, которые ведут диалог с пользователем голосом). Даёт тонкую настройку тона, темпа и выразительности.
- Обе модели принимают режиссёрские указания естественным языком прямо в тексте сценария.
Генерация голоса по промпту и библиотека на 2 000+ голосов
Flash TTS создаёт голос по текстовому описанию: вы пишете промпт (текстовую инструкцию) с ролью, акцентом и характеристиками, модель генерирует голос. По данным Google, это работает на 100+ языках и диалектах. В демо компания показала мельбурнского диджея, монотонного робота и японского дракона.
Библиотека содержит 2 000+ готовых голосов. Среди них региональные варианты: мексиканский испанский, квебекский французский, шотландский английский. Созданные голоса можно сохранять и переиспользовать с минимальным дрейфом от проекта к проекту. Google также анонсировала функцию ремиксования голоса (voice remixing), когда через промпт можно будет менять тембр, высоту, темп и акцент библиотечного голоса. Дату запуска этой функции компания не назвала.
Долгие записи и диалоги без склеек
- Качество голоса, темп и тембр, по заявлению Google, сохраняются на протяжении часов непрерывного аудио.
- Встроенная постановка диалога на двух голосов: один скрипт порождает многоходовую беседу с раздельными голосами.
- Голосовые реакции: теги вроде
<laughs>,<sigh>,<gasp>добавляют невербальные звуки. - Бэкченнелинг (реплики-подтверждения слушающего, «угу», «да»): метки
|mhm|и|yeah|управляют паузами реакции и комедийным таймингом.
Клонирование голоса и защита
Репликация голоса строится по 30-секундному аудиосэмплу. Google требует, чтобы это был ваш голос или голос, на использование которого у вас есть права. Обязательна устная запись согласия владельца голоса, система сверяет её с эталонным образцом.
Каждый сгенерированный фрагмент содержит водяной знак SynthID (невидимая метка, встроенная прямо в аудио). Клонированные голоса дополнительно несут C2PA (стандарт подтверждения происхождения контента, что-то вроде цифрового паспорта файла). Репликация голоса недоступна через AI Studio в ряде регионов, включая Великобританию, ЕЭЗ и Индию.
Бенчмарки: первое место по данным Hume AI
По данным Hume AI (независимая платформа оценки голосовых моделей):
- Flash TTS занял первое место в Voice Design Benchmark с результатом 71.4.
- Flash TTS лидирует в моделировании акцентов с результатом 60.8.
- В общем индексе качества Hume AI Overall Quality Index Flash TTS на первом месте, Flash-Lite TTS на втором.
- В слепом голосовании Voice Arena обе модели заняли верхние позиции для японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди.
Как попробовать Gemini TTS?
- Откройте Google AI Studio по адресу aistudio.google.com. Модели доступны под идентификаторами
gemini-3.8-flash-ttsиgemini-3.8-flash-lite-tts. - Выберите модель: Flash TTS для творческих задач с детальной режиссурой, Flash-Lite TTS для массовой генерации.
- Напишите промпт с описанием голоса (роль, акцент, характеристики) и текст для озвучки. Режиссёрские указания вставляйте прямо в скрипт.
Корпоративный доступ через Gemini Enterprise Google пометила как «coming soon», точных сроков нет.
Сравнение с российскими инструментами
В России синтез речи предлагают YandexGPT (через SpeechKit) и SberDevices (SaluteSpeech). Обе платформы поддерживают русский язык, работают по API и дают выбор из каталога голосов. Однако генеративного дизайна голоса по текстовому описанию (когда модель создаёт голос с нуля по промпту), как в Gemini TTS, у российских сервисов на момент публикации нет. Каталог голосов у обоих сервисов на порядки меньше, чем 2 000+ у Google. Для русскоязычного контента YandexGPT SpeechKit и SaluteSpeech остаются основным выбором, поскольку Gemini TTS доступен только через API Google и работоспособность из РФ зависит от текущих ограничений доступа.
Что делать с этим прямо сейчас, по ролям?
Автору Дзена. Если вы озвучиваете статьи или ведёте подкаст, Flash-Lite TTS даёт быструю массовую генерацию. Попробуйте создать фирменный голос канала через промпт и сохранить его для всех выпусков. Для русскоязычного контента пока проверьте, как модель справляется с русским: он входит в 100+ языков, но качество именно русской озвучки Google отдельно не выделяла.
Маркетологу. Библиотека из 2 000+ голосов и поддержка региональных диалектов снимает вопрос локализации рекламы на несколько рынков одновременно. Экономика меняется: вместо студии с диктором вы тратите только на API.
Предпринимателю в РФ. Доступ к Gemini API из России требует обхода региональных ограничений. Если ваш продукт ориентирован на зарубежную аудиторию, Gemini TTS покрывает мексиканский испанский, квебекский французский и десятки других вариантов. Для внутреннего рынка Yandex SpeechKit и SaluteSpeech работают без ограничений.
Google сделала ставку на режиссуру: не просто «прочитай текст красиво», а «прочитай эту строку как усталый детектив с мельбурнским акцентом, а на следующей засмейся». Для тех, кто делает аудиоконтент, это заметный сдвиг от выбора голоса к проектированию голоса. По моим наблюдениям, именно управление подачей построчно и невербальные реакции (смех, вздохи, «угу») отличают этот релиз от всего, что предлагают конкуренты на сегодня.
Оговорка: открытых весов нет, значит вы полностью зависите от API Google, ценообразования и доступности. Для РФ это двойной риск: и цена не объявлена, и стабильность доступа не гарантирована.
Что сделать сегодня: откройте AI Studio, сгенерируйте тестовый голос на вашем языке и проверьте качество. Если результат устроит, сохраните голос и используйте в пилотном проекте до того, как Google введёт тарификацию для Enterprise.
Частые вопросы
Gemini TTS работает на русском языке?
Google заявляет поддержку 100+ языков и диалектов, но не публикует полный список. Русский, вероятно, входит в число поддерживаемых, однако качество синтеза для конкретного языка стоит проверять самостоятельно в AI Studio.
Можно ли клонировать чужой голос?
Технически модель строит голосовой профиль по 30-секундному образцу. Но Google требует устную запись согласия от владельца голоса. Система сверяет согласие с эталоном. Без совпадения репликация не сработает. В ряде регионов (Великобритания, ЕЭЗ, Индия) функция недоступна.
Чем Flash TTS отличается от Flash-Lite TTS?
Flash TTS создан для творческой работы: глубокое управление актёрской игрой, смена диалектов, создание голосов с нуля. Flash-Lite TTS оптимизирован под объём и стоимость: дубляж, массовая озвучка, голосовые агенты. По данным Hume AI, Flash TTS занял первое место в общем рейтинге качества, Flash-Lite TTS второе.
Кто работает с аудиоконтентом на нескольких языках, получил инструмент, которого раньше не было: голос по описанию, режиссура по строкам и 2 000+ готовых вариантов из одного API.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
YouTube 2026: ИИ-редактор Shorts и автодубляж стримов открывают авторам иноязычную аудиторию
YouTube второго июня провёл ежегодную конференцию Made On YouTube 2026 и показал набор ИИ-инструментов для авторов, зрителей и стримеров, среди которых…
Open source языковые модели отстают от закрытых уже на 4 месяца: разрыв растёт
Компания Epoch AI, занимающаяся аналитикой прогресса в области искусственного интеллекта, опубликовала данные сводного индекса возможностей ECI (Epoch…

Prompt injection это главная уязвимость LLM: как Gorget заменил заброшенный LLM Guard
Prompt injection (далее «инъекция промпта») это приём, при котором пользователь вставляет в текст скрытую команду, чтобы языковая модель проигнорировала…
Комментарии