Игорь Градов
Игорь Градов
5 мин
ai

Gemini даёт голос приложениям на 85+ языках: одно API вместо каскада модулей

Google запустила Gemini 3.8 Live и 3.5 Transcribe для создания голосовых приложений с распознаванием речи на 85 и более языках, и для русскоязычных разработчиков это прямой путь к голосовым интерфейсам без переделки под каждый язык.

Gemini даёт голос приложениям на 85+ языках: одно API вместо каскада модулей
Почему это важно

Gemini 3.8 Live Extended Thinking занял первое место в рейтинге Speech-to-Speech от Artificial Analysis, а модель распознавания речи Gemini 3.5 Transcribe показала 4% ошибок в потоковом режиме и 2,6% в пакетном, при этом сама переключается между языками внутри одного предложения.

Новость опубликована в блоге разработчиков Google. Компания выпустила набор моделей для работы с голосом через Gemini API и Google AI Studio. До сих пор разработчики голосовых приложений часто собирали каскадную архитектуру: отдельный модуль распознавания речи, отдельный языковой процессор, отдельный синтезатор. Новые модели объединяют эти этапы, и это меняет подход к созданию голосовых продуктов.

Что Когда Кто выпустил Цена
Gemini 3.8 Live и 3.8 Live Extended Thinking (голосовые ИИ-агенты) Июнь 2025 Google Не раскрыта, доступ через Gemini API
Gemini 3.5 Transcribe (распознавание речи) Выпущена месяцем ранее Google Не раскрыта, доступ через Gemini API

Что умеют новые модели?

Gemini 3.8 Live и 3.8 Live Extended Thinking:

  • Асинхронный вызов функций. Модель выполняет запросы к внешним сервисам и инструментам в фоне, продолжая разговор с пользователем. Голосовой ИИ-агент (программа, которая сама выполняет задачи по голосовой команде) не замолкает, пока ищет информацию.
  • Визуальный контекст. Модель понимает не только речь, но и изображение с камеры. Пользователь может спросить «что это передо мной?», и агент ответит.
  • Точность с кодами и номерами. Корректно разбирает подтверждающие коды, номера заявок и технические данные, где одна ошибка в цифре ломает весь смысл.
  • 97 и более языков с сохранением акцента говорящего.
  • Пошаговое рассуждение (в версии Extended Thinking): модель «думает» над сложным запросом в фоне и озвучивает ход решения прямо во время разговора.

Gemini 3.5 Transcribe (модель для перевода речи в текст):

  • Автоматическое переключение языков. Если человек в одном предложении говорит на русском и вставляет английское слово, модель распознаёт оба языка без ручной настройки. Для российского рынка, где код-свитчинг (переключение между языками внутри фразы) распространён в IT и бизнесе, это снимает серьёзную головную боль.
  • Словарь на 1 000 терминов. Разработчик передаёт список специальных слов, названий компаний, профессионального жаргона, и модель ориентируется на него при распознавании.
  • Умная расшифровка. Убирает слова-паразиты, исправляет оговорки и форматирует текст так, чтобы его можно было читать без редактуры.
  • Поддержка 85 и более языков, включая потоковый режим и пакетную обработку аудиофайлов длиной до 1 часа с разметкой по времени и распознаванием спикеров.

Полный голосовой набор для разработчика

Кроме двух основных моделей, Google предлагает через тот же Gemini API ещё три инструмента:

  • Gemini 3.5 Live Translate для голосового перевода на более чем 70 языков.
  • Gemini 3.1 Flash TTS для генерации речи с настраиваемыми параметрами.
  • Lyria 3.5 для создания музыки.

Все пять моделей работают через единый API. Это значит, что разработчик собирает голосовое приложение с Gemini из готовых блоков, не подключая сторонние сервисы для каждой задачи.

Как попробовать?

  1. Откройте ai.studio/live и протестируйте модели прямо в браузере через Google AI Studio.
  2. Клонируйте примеры приложений с GitHub (ссылки в документации Google).
  3. Подключите Gemini API к своему проекту и используйте «live api skill» для интеграции голосовых функций в существующего ИИ-агента.

Сравнение с российскими аналогами

Параметр Gemini 3.5 Transcribe YandexGPT (SpeechKit) GigaChat (SaluteSpeech)
Языков 85+ Русский, ряд других Русский, ряд других
Автопереключение языков Да, внутри предложения Ограничено Ограничено
Пользовательский словарь До 1 000 слов Есть Есть
Доступ из РФ Через VPN или зарубежный сервер Без ограничений Без ограничений

Для проектов, ориентированных только на русскоязычную аудиторию, YandexGPT SpeechKit и SaluteSpeech от «Сбера» работают без ограничений по доступу. Но если приложение должно обслуживать пользователей на десятках языков или обрабатывать речь с частым переключением между русским и английским, Gemini 3.5 Transcribe предлагает то, чего у российских аналогов пока нет в таком объёме.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Gemini 3.5 Transcribe с умной расшифровкой убирает слова-паразиты и форматирует текст. Если вы записываете подкасты или видео, попробуйте расшифровать выпуск через Google AI Studio и сравните качество с привычным сервисом.

Маркетологу. Голосовые приложения с Gemini Live позволяют строить интерактивных консультантов, которые одновременно разговаривают с клиентом и выполняют запросы к CRM или базе товаров. Это не будущее, это доступный API.

Разработчику в РФ. 85 и более языков и автоматическое переключение кодов упрощают создание голосовых интерфейсов для российского рынка без отдельной настройки под каждый язык. Ограничение: доступ к Gemini API из России требует обходных решений.

Мнение редакции dzen.guru

Google собрала пять голосовых моделей под одним API и сделала то, чего раньше добивались каскадом из трёх-четырёх сервисов. По моим наблюдениям, 4% ошибок в потоковом распознавании на десятках языков, это уровень, при котором ручная правка расшифровок перестаёт быть обязательным этапом. Первое место 3.8 Live Extended Thinking в рейтинге Artificial Analysis добавляет уверенности, хотя для русского языка конкретных бенчмарков Google не привела. Оговорка честная: из России доступ к Gemini API ограничен, а качество распознавания русской речи стоит проверить лично, прежде чем строить на нём продукт. Сегодня я бы зашёл в ai.studio/live, записал пять минут речи на русском с вкраплениями английского и посмотрел, как модель справится. Это займёт десять минут, но покажет, стоит ли переводить рабочий процесс.

Частые вопросы

Gemini Live работает на русском языке?

Gemini 3.8 Live поддерживает 97 и более языков, Gemini 3.5 Transcribe поддерживает 85 и более языков. Google не перечислила конкретный список, но заявленное количество с высокой вероятностью включает русский. Проверить можно в Google AI Studio.

Можно ли использовать Gemini 3.5 Transcribe бесплатно?

Google не раскрыла цены в анонсе. Доступ открыт через Gemini API и Google AI Studio. Попробовать модель можно на ai.studio/live, условия тарификации указаны в документации Gemini API.

Чем Gemini 3.8 Live отличается от обычного голосового помощника?

Обычный помощник слушает команду, замолкает, обрабатывает и отвечает. Gemini 3.8 Live выполняет фоновые задачи (вызов API, поиск данных) и одновременно продолжает разговор. Версия Extended Thinking ещё и рассуждает пошагово, озвучивая ход мысли, что полезно для сложных запросов.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Google вложит $1 млн в школы Чикаго и превратит архитектуру зданий в публичный хаб к 2028 году
ai

Google вложит $1 млн в школы Чикаго и превратит архитектуру зданий в публичный хаб к 2028 году

Google вложит $1 млн в борьбу с прогулами школьников и откроет обновлённый центр Томпсона в Чикаго в 2028 году Google представила новые рендеры атриума…

4 мин
AIUC привлекла $40 млн на аудит ИИ-агентов: как мультимодальность влияет на развитие ИИ-агентов и их контроль
ai

AIUC привлекла $40 млн на аудит ИИ-агентов: как мультимодальность влияет на развитие ИИ-агентов и их контроль

Microsoft представила Scout — агента, который сам ведёт почту, но мне нужно работать с другой темой. Компания AIUC привлекла 40 миллионов долларов и предложила…

7 мин
Profound привлёк $180 млн за оптимизацию под ИИ-поиск: AI стартапы получают финансирование всё быстрее
ai

Profound привлёк $180 млн за оптимизацию под ИИ-поиск: AI стартапы получают финансирование всё быстрее

Стартап Profound, который разрабатывает маркетинговые инструменты для продвижения брендов в поисковой выдаче ИИ-ассистентов, 10 июня объявил о привлечении 180…

4 мин