Gemini даёт голос приложениям на 85+ языках: одно API вместо каскада модулей
Google запустила Gemini 3.8 Live и 3.5 Transcribe для создания голосовых приложений с распознаванием речи на 85 и более языках, и для русскоязычных разработчиков это прямой путь к голосовым интерфейсам без переделки под каждый язык.

Gemini 3.8 Live Extended Thinking занял первое место в рейтинге Speech-to-Speech от Artificial Analysis, а модель распознавания речи Gemini 3.5 Transcribe показала 4% ошибок в потоковом режиме и 2,6% в пакетном, при этом сама переключается между языками внутри одного предложения.
Новость опубликована в блоге разработчиков Google. Компания выпустила набор моделей для работы с голосом через Gemini API и Google AI Studio. До сих пор разработчики голосовых приложений часто собирали каскадную архитектуру: отдельный модуль распознавания речи, отдельный языковой процессор, отдельный синтезатор. Новые модели объединяют эти этапы, и это меняет подход к созданию голосовых продуктов.
| Что | Когда | Кто выпустил | Цена |
|---|---|---|---|
| Gemini 3.8 Live и 3.8 Live Extended Thinking (голосовые ИИ-агенты) | Июнь 2025 | Не раскрыта, доступ через Gemini API | |
| Gemini 3.5 Transcribe (распознавание речи) | Выпущена месяцем ранее | Не раскрыта, доступ через Gemini API |
Что умеют новые модели?
Gemini 3.8 Live и 3.8 Live Extended Thinking:
- Асинхронный вызов функций. Модель выполняет запросы к внешним сервисам и инструментам в фоне, продолжая разговор с пользователем. Голосовой ИИ-агент (программа, которая сама выполняет задачи по голосовой команде) не замолкает, пока ищет информацию.
- Визуальный контекст. Модель понимает не только речь, но и изображение с камеры. Пользователь может спросить «что это передо мной?», и агент ответит.
- Точность с кодами и номерами. Корректно разбирает подтверждающие коды, номера заявок и технические данные, где одна ошибка в цифре ломает весь смысл.
- 97 и более языков с сохранением акцента говорящего.
- Пошаговое рассуждение (в версии Extended Thinking): модель «думает» над сложным запросом в фоне и озвучивает ход решения прямо во время разговора.
Gemini 3.5 Transcribe (модель для перевода речи в текст):
- Автоматическое переключение языков. Если человек в одном предложении говорит на русском и вставляет английское слово, модель распознаёт оба языка без ручной настройки. Для российского рынка, где код-свитчинг (переключение между языками внутри фразы) распространён в IT и бизнесе, это снимает серьёзную головную боль.
- Словарь на 1 000 терминов. Разработчик передаёт список специальных слов, названий компаний, профессионального жаргона, и модель ориентируется на него при распознавании.
- Умная расшифровка. Убирает слова-паразиты, исправляет оговорки и форматирует текст так, чтобы его можно было читать без редактуры.
- Поддержка 85 и более языков, включая потоковый режим и пакетную обработку аудиофайлов длиной до 1 часа с разметкой по времени и распознаванием спикеров.
Полный голосовой набор для разработчика
Кроме двух основных моделей, Google предлагает через тот же Gemini API ещё три инструмента:
- Gemini 3.5 Live Translate для голосового перевода на более чем 70 языков.
- Gemini 3.1 Flash TTS для генерации речи с настраиваемыми параметрами.
- Lyria 3.5 для создания музыки.
Все пять моделей работают через единый API. Это значит, что разработчик собирает голосовое приложение с Gemini из готовых блоков, не подключая сторонние сервисы для каждой задачи.
Как попробовать?
- Откройте ai.studio/live и протестируйте модели прямо в браузере через Google AI Studio.
- Клонируйте примеры приложений с GitHub (ссылки в документации Google).
- Подключите Gemini API к своему проекту и используйте «live api skill» для интеграции голосовых функций в существующего ИИ-агента.
Сравнение с российскими аналогами
| Параметр | Gemini 3.5 Transcribe | YandexGPT (SpeechKit) | GigaChat (SaluteSpeech) |
|---|---|---|---|
| Языков | 85+ | Русский, ряд других | Русский, ряд других |
| Автопереключение языков | Да, внутри предложения | Ограничено | Ограничено |
| Пользовательский словарь | До 1 000 слов | Есть | Есть |
| Доступ из РФ | Через VPN или зарубежный сервер | Без ограничений | Без ограничений |
Для проектов, ориентированных только на русскоязычную аудиторию, YandexGPT SpeechKit и SaluteSpeech от «Сбера» работают без ограничений по доступу. Но если приложение должно обслуживать пользователей на десятках языков или обрабатывать речь с частым переключением между русским и английским, Gemini 3.5 Transcribe предлагает то, чего у российских аналогов пока нет в таком объёме.
Что делать с этим прямо сейчас, по ролям
Автору Дзена. Gemini 3.5 Transcribe с умной расшифровкой убирает слова-паразиты и форматирует текст. Если вы записываете подкасты или видео, попробуйте расшифровать выпуск через Google AI Studio и сравните качество с привычным сервисом.
Маркетологу. Голосовые приложения с Gemini Live позволяют строить интерактивных консультантов, которые одновременно разговаривают с клиентом и выполняют запросы к CRM или базе товаров. Это не будущее, это доступный API.
Разработчику в РФ. 85 и более языков и автоматическое переключение кодов упрощают создание голосовых интерфейсов для российского рынка без отдельной настройки под каждый язык. Ограничение: доступ к Gemini API из России требует обходных решений.
Google собрала пять голосовых моделей под одним API и сделала то, чего раньше добивались каскадом из трёх-четырёх сервисов. По моим наблюдениям, 4% ошибок в потоковом распознавании на десятках языков, это уровень, при котором ручная правка расшифровок перестаёт быть обязательным этапом. Первое место 3.8 Live Extended Thinking в рейтинге Artificial Analysis добавляет уверенности, хотя для русского языка конкретных бенчмарков Google не привела. Оговорка честная: из России доступ к Gemini API ограничен, а качество распознавания русской речи стоит проверить лично, прежде чем строить на нём продукт. Сегодня я бы зашёл в ai.studio/live, записал пять минут речи на русском с вкраплениями английского и посмотрел, как модель справится. Это займёт десять минут, но покажет, стоит ли переводить рабочий процесс.
Частые вопросы
Gemini Live работает на русском языке?
Gemini 3.8 Live поддерживает 97 и более языков, Gemini 3.5 Transcribe поддерживает 85 и более языков. Google не перечислила конкретный список, но заявленное количество с высокой вероятностью включает русский. Проверить можно в Google AI Studio.
Можно ли использовать Gemini 3.5 Transcribe бесплатно?
Google не раскрыла цены в анонсе. Доступ открыт через Gemini API и Google AI Studio. Попробовать модель можно на ai.studio/live, условия тарификации указаны в документации Gemini API.
Чем Gemini 3.8 Live отличается от обычного голосового помощника?
Обычный помощник слушает команду, замолкает, обрабатывает и отвечает. Gemini 3.8 Live выполняет фоновые задачи (вызов API, поиск данных) и одновременно продолжает разговор. Версия Extended Thinking ещё и рассуждает пошагово, озвучивая ход мысли, что полезно для сложных запросов.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Google вложит $1 млн в школы Чикаго и превратит архитектуру зданий в публичный хаб к 2028 году
Google вложит $1 млн в борьбу с прогулами школьников и откроет обновлённый центр Томпсона в Чикаго в 2028 году Google представила новые рендеры атриума…

AIUC привлекла $40 млн на аудит ИИ-агентов: как мультимодальность влияет на развитие ИИ-агентов и их контроль
Microsoft представила Scout — агента, который сам ведёт почту, но мне нужно работать с другой темой. Компания AIUC привлекла 40 миллионов долларов и предложила…

Profound привлёк $180 млн за оптимизацию под ИИ-поиск: AI стартапы получают финансирование всё быстрее
Стартап Profound, который разрабатывает маркетинговые инструменты для продвижения брендов в поисковой выдаче ИИ-ассистентов, 10 июня объявил о привлечении 180…
Комментарии