Игорь Градов
Игорь Градов
5 мин
ai

Google запустила Gemini 3.8 Live: голосовой ИИ на 97 языках рассуждает, не прерывая диалог

Google запустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, две голосовые модели, которые обрабатывают речь и визуальные данные почти в реальном времени и автоматически переключаются между 97 языками прямо в ходе разговора.

Google запустила Gemini 3.8 Live: голосовой ИИ на 97 языках рассуждает, не прерывая диалог

Обе модели доступны разработчикам через Gemini API и Google AI Studio с сегодняшнего дня, а обычным пользователям через поиск Google и приложение Gemini.

Почему это важно

Gemini 3.8 Live Extended Thinking заняла первое место в индексе качества «речь в речь» от Artificial Analysis (82,6 балла) и лидирует в выполнении агентных задач: голосовая модель рассуждает и отвечает одновременно, не прерывая диалог.

Что Когда Кто выпустил Цена
Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking Начало раскатки сегодня (дата публикации оригинала) Google Точную цену Google не назвала, но указала на «конкурентный ценник по сравнению с другими передовыми моделями»

До сих пор голосовые модели от крупных компаний либо хорошо рассуждали, либо быстро отвечали, совмещать то и другое удавалось плохо. Google заявляет, что Gemini 3.8 Live Extended Thinking сдвигает этот компромисс: модель набрала 97,7% на бенчмарке Big Bench Audio (тест на понимание и рассуждение по аудио), 68,6% на τ-Voice и 35,1% на банковском бенчмарке Sierra τ-Voice-banking. Источник всех цифр, пост Google.

Что умеют новые модели?

  • Мультимодальный ввод в реальном времени. Gemini 3.8 Live принимает не только голос, но и визуальные данные (камера, экран), обогащая ответ контекстом того, что видит пользователь.
  • Автоматическое переключение между 97 языками. Модель сама определяет, на каком языке говорит собеседник, и переходит на него прямо посреди разговора, без команды.
  • Параллельное выполнение задач. Пока модель разговаривает с вами, она в фоне вызывает внешние инструменты и API. Если задача занимает время, модель предупреждает фразой вроде «Сейчас проверю» и продолжает диалог.
  • Расширенное мышление (Extended Thinking). Старшая версия рассуждает по шагам и одновременно озвучивает ход решения, например, проговаривает, что именно делает на каждом этапе сложного запроса.
  • Маркировка SynthID. Всё сгенерированное аудио получает неслышимый водяной знак SynthID (цифровую метку, по которой можно определить, что звук создан ИИ, а не человеком), чтобы снизить риск дезинформации.

Где доступны Gemini 3.8 Live и Extended Thinking?

  1. Разработчикам обе модели доступны через Gemini API и Google AI Studio. Откройте Google AI Studio, выберите нужную модель и начните тестировать голосовой ввод.
  2. Корпоративным клиентам обе модели доступны в закрытом превью Gemini Enterprise. Gemini Enterprise for Customer Experience и Google Workspace для бизнеса анонсированы как «скоро».
  3. Обычным пользователям Gemini 3.8 Live доступна в Search Live (голосовой поиск Google). Extended Thinking работает в Gemini Live, а подписчики Google AI Pro и Ultra получают доступ в Docs, Gmail и Keep.

Релиз охватывает 97 языков, включая русский, что делает API доступным для разработчиков из России и СНГ, хотя Google не уточняет региональных ограничений.

Как Gemini 3.8 Live соотносится с YandexGPT и GigaChat?

Прямого сравнения бенчмарков Google с российскими голосовыми моделями нет ни в одном из источников, поэтому корректная таблица «кто лучше» невозможна. Но контекст полезен.

YandexGPT встроен в Алису и работает на русском, GigaChat от Сбера доступен через API и приложение. Обе модели не заявляли поддержку 97 языков и параллельное выполнение инструментов в фоне голосового диалога. Для многоязычных приложений на российском рынке (например, поддержка клиентов из СНГ на нескольких языках) API Gemini 3.8 Live может оказаться проще в интеграции, при условии, что Google не ограничит доступ по региону.

Что делать с этим прямо сейчас?

Автору на Дзене. Попробуйте голосовой диалог с Gemini Live для генерации идей: модель умеет рассуждать вслух, и иногда проще наговорить тему, чем печатать промпт (текстовую инструкцию для ИИ). Доступно через приложение Gemini.

Разработчику и маркетологу. Если ваш продукт обслуживает клиентов голосом, протестируйте Gemini API в Google AI Studio. Ключевой плюс: модель вызывает ваши API в фоне и не молчит, пока ждёт ответа, а ведёт диалог. Для многоязычной аудитории автоматическое переключение языков убирает необходимость определять язык вручную.

Предпринимателю в РФ и СНГ. API формально доступен, но следите за условиями: Google может ввести региональные ограничения. Параллельно держите в поле зрения YandexGPT API и GigaChat API как запасные варианты для голосовых сценариев на русском.

Мнение редакции dzen.guru

По моим наблюдениям, голосовые модели до сих пор проигрывали текстовым в глубине рассуждений. Extended Thinking пытается это исправить: модель не просто отвечает, а рассказывает, как она думает, прямо голосом. Это удобно, когда задача сложная и хочется понять логику ответа, а не просто получить финальную фразу.

Оговорка: бенчмарки, которые приводит Google, это их собственная публикация. Независимых тестов пока нет, и реальное качество на русском языке предстоит проверить.

Мой совет: зайдите сегодня в Google AI Studio, выберите Gemini 3.8 Live Extended Thinking и задайте ей сложный вопрос голосом на русском. Десять минут покажут, годится ли модель для ваших задач.

Частые вопросы

Gemini 3.8 Live бесплатна?

Google не назвала точную цену за API. Для обычных пользователей модель доступна в Search Live. Расширенная версия Extended Thinking в приложении Gemini Live доступна всем, а в Workspace (Docs, Gmail, Keep) требует подписку Google AI Pro или Ultra.

Работает ли Gemini 3.8 на русском языке?

Модель поддерживает 97 языков и автоматически определяет язык собеседника. Google не публикует полный список, но русский входит в число поддерживаемых языков экосистемы Gemini. Качество ответов на русском стоит проверить самостоятельно.

Чем Gemini 3.8 Live отличается от Gemini 3.8 Live Extended Thinking?

Базовая версия (Gemini 3.8 Live) рассчитана на масштаб и экономичность: быстрые, плавные голосовые диалоги. Extended Thinking добавляет многошаговое рассуждение (модель разбивает сложную задачу на этапы и озвучивает ход решения) и показывает лучшие результаты на бенчмарках, но, вероятно, обходится дороже в использовании.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Подписка Meta Verified выросла в Meta One: ИИ-генерация от $7,99 и тарифы для бизнеса до $499
ai

Подписка Meta Verified выросла в Meta One: ИИ-генерация от $7,99 и тарифы для бизнеса до $499

Meta второго июня добавила к своим приложениям подписки на пару долларов, а теперь, 9 сентября, расширила систему до полноценного набора тарифов Meta One, где…

6 мин
ai

Бот «Мигалка» обрабатывает 1000 каналов за секунды: LLM, векторные базы данных и PostGIS

Телеграм-бот «Мигалка» собирает сообщения примерно из тысячи телеграм-каналов и за секунды превращает их в адресные оповещения об опасности для конкретной…

6 мин
Meta открыла WhatsApp Business для ИИ-агентов: как мультимодальность влияет на развитие ИИ-агентов
ai

Meta открыла WhatsApp Business для ИИ-агентов: как мультимодальность влияет на развитие ИИ-агентов

Почему это важно Meta впервые позволила подключать сторонних ИИ-агентов напрямую к настройке WhatsApp Business, и теперь владелец малого бизнеса может…

5 мин