Игорь Градов
Игорь Градов
6 мин
ai

Gemini TTS генерирует голос по промпту: 2 000+ голосов, 100+ языков, первое место в бенчмарках

Google выпустила две модели синтеза речи: Gemini 3.8 Flash TTS для озвучки персонажей и креативных проектов и Gemini 3.8 Flash-Lite TTS для массового производства аудио, обе доступны через API прямо сейчас.

Почему это важно

Впервые в линейке Gemini появился генеративный дизайн голосов: вместо выбора из каталога автор описывает персонажа текстом и получает уникальный голос на одном из 100+ языков и диалектов.

До сих пор Gemini TTS (text-to-speech, синтез речи из текста) предлагал 30 готовых голосов. Обновление, о котором сообщила Google, меняет масштаб: библиотека выросла до 2 000+ голосов, а Flash TTS умеет создавать новые по текстовому описанию. Marktechpost, опубликовавший разбор релиза, отмечает, что обе модели уже доступны через Gemini API и Google AI Studio, но только по API, открытых весов для самостоятельного развёртывания нет. Корпоративный доступ через Gemini Enterprise Google обещает позже, точную дату не называет.

Что Когда Кто выпустил Цена
Gemini 3.8 Flash TTS и Flash-Lite TTS Доступны сейчас (rolling out) Google Не раскрыта, доступ по API

Чем отличаются две модели?

  • Flash TTS заточен под творческие задачи: озвучка игр, аудиокниги, подкасты, интерактивные медиа. Позволяет управлять актёрской подачей, темпом, сменой диалекта и репликами-реакциями построчно, прямо в скрипте.
  • Flash-Lite TTS рассчитан на объём и экономию: дубляж, массовое создание аудиоконтента, голосовые ИИ-агенты (программы, которые ведут диалог с пользователем голосом). Даёт тонкую настройку тона, темпа и выразительности.
  • Обе модели принимают режиссёрские указания естественным языком прямо в тексте сценария.

Генерация голоса по промпту и библиотека на 2 000+ голосов

Flash TTS создаёт голос по текстовому описанию: вы пишете промпт (текстовую инструкцию) с ролью, акцентом и характеристиками, модель генерирует голос. По данным Google, это работает на 100+ языках и диалектах. В демо компания показала мельбурнского диджея, монотонного робота и японского дракона.

Библиотека содержит 2 000+ готовых голосов. Среди них региональные варианты: мексиканский испанский, квебекский французский, шотландский английский. Созданные голоса можно сохранять и переиспользовать с минимальным дрейфом от проекта к проекту. Google также анонсировала функцию ремиксования голоса (voice remixing), когда через промпт можно будет менять тембр, высоту, темп и акцент библиотечного голоса. Дату запуска этой функции компания не назвала.

Долгие записи и диалоги без склеек

  • Качество голоса, темп и тембр, по заявлению Google, сохраняются на протяжении часов непрерывного аудио.
  • Встроенная постановка диалога на двух голосов: один скрипт порождает многоходовую беседу с раздельными голосами.
  • Голосовые реакции: теги вроде <laughs>, <sigh>, <gasp> добавляют невербальные звуки.
  • Бэкченнелинг (реплики-подтверждения слушающего, «угу», «да»): метки |mhm| и |yeah| управляют паузами реакции и комедийным таймингом.

Клонирование голоса и защита

Репликация голоса строится по 30-секундному аудиосэмплу. Google требует, чтобы это был ваш голос или голос, на использование которого у вас есть права. Обязательна устная запись согласия владельца голоса, система сверяет её с эталонным образцом.

Каждый сгенерированный фрагмент содержит водяной знак SynthID (невидимая метка, встроенная прямо в аудио). Клонированные голоса дополнительно несут C2PA (стандарт подтверждения происхождения контента, что-то вроде цифрового паспорта файла). Репликация голоса недоступна через AI Studio в ряде регионов, включая Великобританию, ЕЭЗ и Индию.

Бенчмарки: первое место по данным Hume AI

По данным Hume AI (независимая платформа оценки голосовых моделей):

  • Flash TTS занял первое место в Voice Design Benchmark с результатом 71.4.
  • Flash TTS лидирует в моделировании акцентов с результатом 60.8.
  • В общем индексе качества Hume AI Overall Quality Index Flash TTS на первом месте, Flash-Lite TTS на втором.
  • В слепом голосовании Voice Arena обе модели заняли верхние позиции для японского, бразильского португальского, вьетнамского, современного стандартного арабского, мексиканского испанского и хинди.

Как попробовать Gemini TTS?

  1. Откройте Google AI Studio по адресу aistudio.google.com. Модели доступны под идентификаторами gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts.
  2. Выберите модель: Flash TTS для творческих задач с детальной режиссурой, Flash-Lite TTS для массовой генерации.
  3. Напишите промпт с описанием голоса (роль, акцент, характеристики) и текст для озвучки. Режиссёрские указания вставляйте прямо в скрипт.

Корпоративный доступ через Gemini Enterprise Google пометила как «coming soon», точных сроков нет.

Сравнение с российскими инструментами

В России синтез речи предлагают YandexGPT (через SpeechKit) и SberDevices (SaluteSpeech). Обе платформы поддерживают русский язык, работают по API и дают выбор из каталога голосов. Однако генеративного дизайна голоса по текстовому описанию (когда модель создаёт голос с нуля по промпту), как в Gemini TTS, у российских сервисов на момент публикации нет. Каталог голосов у обоих сервисов на порядки меньше, чем 2 000+ у Google. Для русскоязычного контента YandexGPT SpeechKit и SaluteSpeech остаются основным выбором, поскольку Gemini TTS доступен только через API Google и работоспособность из РФ зависит от текущих ограничений доступа.

Что делать с этим прямо сейчас, по ролям?

Автору Дзена. Если вы озвучиваете статьи или ведёте подкаст, Flash-Lite TTS даёт быструю массовую генерацию. Попробуйте создать фирменный голос канала через промпт и сохранить его для всех выпусков. Для русскоязычного контента пока проверьте, как модель справляется с русским: он входит в 100+ языков, но качество именно русской озвучки Google отдельно не выделяла.

Маркетологу. Библиотека из 2 000+ голосов и поддержка региональных диалектов снимает вопрос локализации рекламы на несколько рынков одновременно. Экономика меняется: вместо студии с диктором вы тратите только на API.

Предпринимателю в РФ. Доступ к Gemini API из России требует обхода региональных ограничений. Если ваш продукт ориентирован на зарубежную аудиторию, Gemini TTS покрывает мексиканский испанский, квебекский французский и десятки других вариантов. Для внутреннего рынка Yandex SpeechKit и SaluteSpeech работают без ограничений.

Мнение редакции dzen.guru

Google сделала ставку на режиссуру: не просто «прочитай текст красиво», а «прочитай эту строку как усталый детектив с мельбурнским акцентом, а на следующей засмейся». Для тех, кто делает аудиоконтент, это заметный сдвиг от выбора голоса к проектированию голоса. По моим наблюдениям, именно управление подачей построчно и невербальные реакции (смех, вздохи, «угу») отличают этот релиз от всего, что предлагают конкуренты на сегодня.

Оговорка: открытых весов нет, значит вы полностью зависите от API Google, ценообразования и доступности. Для РФ это двойной риск: и цена не объявлена, и стабильность доступа не гарантирована.

Что сделать сегодня: откройте AI Studio, сгенерируйте тестовый голос на вашем языке и проверьте качество. Если результат устроит, сохраните голос и используйте в пилотном проекте до того, как Google введёт тарификацию для Enterprise.

Частые вопросы

Gemini TTS работает на русском языке?

Google заявляет поддержку 100+ языков и диалектов, но не публикует полный список. Русский, вероятно, входит в число поддерживаемых, однако качество синтеза для конкретного языка стоит проверять самостоятельно в AI Studio.

Можно ли клонировать чужой голос?

Технически модель строит голосовой профиль по 30-секундному образцу. Но Google требует устную запись согласия от владельца голоса. Система сверяет согласие с эталоном. Без совпадения репликация не сработает. В ряде регионов (Великобритания, ЕЭЗ, Индия) функция недоступна.

Чем Flash TTS отличается от Flash-Lite TTS?

Flash TTS создан для творческой работы: глубокое управление актёрской игрой, смена диалектов, создание голосов с нуля. Flash-Lite TTS оптимизирован под объём и стоимость: дубляж, массовая озвучка, голосовые агенты. По данным Hume AI, Flash TTS занял первое место в общем рейтинге качества, Flash-Lite TTS второе.

Кто работает с аудиоконтентом на нескольких языках, получил инструмент, которого раньше не было: голос по описанию, режиссура по строкам и 2 000+ готовых вариантов из одного API.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

YouTube 2026: ИИ-редактор Shorts и автодубляж стримов открывают авторам иноязычную аудиторию

YouTube второго июня провёл ежегодную конференцию Made On YouTube 2026 и показал набор ИИ-инструментов для авторов, зрителей и стримеров, среди которых…

4 мин
ai

Open source языковые модели отстают от закрытых уже на 4 месяца: разрыв растёт

Компания Epoch AI, занимающаяся аналитикой прогресса в области искусственного интеллекта, опубликовала данные сводного индекса возможностей ECI (Epoch…

5 мин
Prompt injection это главная уязвимость LLM: как Gorget заменил заброшенный LLM Guard
ai

Prompt injection это главная уязвимость LLM: как Gorget заменил заброшенный LLM Guard

Prompt injection (далее «инъекция промпта») это приём, при котором пользователь вставляет в текст скрытую команду, чтобы языковая модель проигнорировала…

6 мин