Игорь Градов
Игорь Градов
5 мин
ai

Gemini 3.8 Live вызывает инструменты, не прерывая разговор: $0,005 за минуту аудио

Google запустила Gemini 3.8 Live, две модели для голосовых ИИ-агентов, которые впервые выполняют фоновые задачи и вызывают внешние инструменты, не прерывая разговор с пользователем.

Gemini 3.8 Live вызывает инструменты, не прерывая разговор: $0,005 за минуту аудио
Почему это важно

Голосовые агенты до сих пор работали по цепочке: распознать речь, обработать текст, озвучить ответ. Gemini 3.8 Live объединяет всё в одну модель и запускает инструменты параллельно с диалогом, а цена входа для разработчика составляет $0,005 за минуту аудио на входе.

До этого релиза Google развивала семейство Gemini Audio, месяцем ранее добавив модель Gemini 3.5 Transcribe для транскрипции. Теперь компания закрывает следующий пробел: голосовые агенты, которые умеют рассуждать и выполнять действия, не ломая поток разговора. Обе модели уже доступны через Gemini Live API и Google AI Studio, но только как облачные, без открытых весов и без возможности запустить на своём сервере. Источник новости: Marktechpost.

Что Когда Кто выпустил Цена
Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking Доступны сейчас через API Google $0,005/мин (аудиовход), $0,018/мин (аудиовыход)

Две модели, разные задачи

Релиз включает две модели с чётким разделением ролей.

Gemini 3.8 Live рассчитана на масштаб и экономию. Она ведёт диалог, понимает визуальный контекст (то есть «видит» то, что показывает пользователь) и параллельно вызывает внешние инструменты.

Gemini 3.8 Live Extended Thinking добавляет многошаговое рассуждение прямо во время разговора. Модель думает в фоне, а вслух сообщает промежуточные шаги: произносит фразы вроде «дайте проверю» и затем пошагово рассказывает, что делает. По данным Marktechpost, в демо Google модель конвертировала наброски плюс голосовые правки в работающие компоненты на React и координировала многоэтапное бронирование.

Что нового?

  • Асинхронный вызов инструментов. Модель запускает API-вызовы и внешние инструменты в фоне, продолжая говорить с пользователем. Диалог не прерывается, пока задача выполняется.
  • Визуальный контекст в реальном времени. Агент обрабатывает видеопоток и понимает, что пользователь говорит и что показывает на экране или камере.
  • Точный разбор буквенно-цифровых данных. Модель корректно распознаёт коды подтверждения, номера заявок и технические идентификаторы. Это типичное слабое место голосовых систем.
  • 97 языков с переключением на лету. Модель определяет язык автоматически и переходит между языками внутри одного разговора, сохраняя акцент.
  • Инкрементальное обновление контента. Аудиопоток объединяется со структурированными данными, ответ учитывает текущий контекст.

Бенчмарки: первое место в индексе качества

По данным независимой платформы Artificial Analysis, Gemini 3.8 Live Extended Thinking заняла первое место в рейтинге Speech to Speech Quality Index (индекс качества «речь в речь») с результатом 82,6 балла.

Другие результаты, которые приводит Marktechpost:

  • 68,6% на τ-Voice (оценка выполнения агентных задач голосом)
  • 35,1% на Sierra τ-Voice-banking (банковский сценарий)
  • 97,7% на Big Bench Audio (бенчмарк рассуждений для аудиомоделей)

Gemini 3.8 Live заняла второе место в Speech Agent Arena, оценке на основе предпочтений живых пользователей. Все генерируемые аудиофайлы содержат незаметную водяную метку SynthID от Google DeepMind.

Как попробовать?

  1. Откройте Google AI Studio (aistudio.google.com) и создайте API-ключ для Gemini Live API.
  2. Выберите модель: Gemini 3.8 Live для быстрых задач или Extended Thinking для сложных многошаговых сценариев.
  3. Протестируйте голосового агента через партнёрские платформы, которые берут на себя инфраструктуру потокового аудио: среди них LiveKit, LangChain, Pipecat и Vercel.
  4. Примеры приложений Google выложила на GitHub, они помогут быстрее собрать прототип.

Сравнение с российскими аналогами

Прямого аналога голосовой мультимодальной модели (то есть модели, которая одновременно слушает, говорит, видит и действует) в России пока нет. YandexGPT и GigaChat от Сбера работают с текстом и отдельно с голосом, но не объединяют речь, зрение и вызов инструментов в единый поток.

Возможность Gemini 3.8 Live YandexGPT / GigaChat
Речь в речь без каскада Да Нет, используют цепочку «распознавание плюс текст плюс синтез»
Фоновый вызов инструментов во время диалога Да Нет
Визуальный контекст в реальном времени Да Ограниченно (изображения в чате)
Доступ из РФ Через VPN и иностранный аккаунт Google Без ограничений

Для авторов и предпринимателей из РФ важно: функциональность Gemini 3.8 Live пока доступна только через API Google, в российских сервисах такого уровня голосовой агентности нет.

Мнение редакции dzen.guru

Я вижу в Gemini 3.8 Live реальный сдвиг для тех, кто строит голосовых помощников. До сих пор любая пауза «подождите, проверяю» убивала впечатление от разговора с ИИ. Асинхронный вызов инструментов решает именно эту проблему: агент продолжает говорить, пока в фоне летит запрос к базе или внешнему API.

Цена $0,005 за минуту на входе и $0,018 на выходе делает эксперименты дешёвыми. Десятиминутный разговор обойдётся примерно в $0,23, это меньше двадцати рублей по текущему курсу.

Оговорка: модель закрытая, данные уходят в облако Google, а из России доступ только через обходные пути. Для продакшена в РФ это пока исследовательский инструмент, а не готовое решение.

Что сделать сегодня: откройте Google AI Studio, возьмите пример с GitHub и проверьте, как модель справляется с вашим сценарием на русском языке. Поддержка 97 языков заявлена, но качество русского стоит проверить лично.

Частые вопросы

Можно ли запустить Gemini 3.8 Live на своём сервере?

Нет. Обе модели доступны только через облачный API Google. Открытых весов Google не предоставила, поэтому развернуть их локально или на своей инфраструктуре нельзя.

Работает ли модель на русском языке?

Google заявляет поддержку 97 языков с автоматическим определением и переключением внутри диалога. Русский входит в этот список, но независимых тестов качества именно русской речи на момент публикации нет.

Чем Extended Thinking отличается от обычной версии?

Gemini 3.8 Live Extended Thinking добавляет многошаговое рассуждение: модель разбивает сложную задачу на этапы, думает в фоне и проговаривает промежуточные шаги вслух. Обычная версия быстрее и дешевле, но не рассуждает по шагам. Выбор зависит от сложности задачи: простой FAQ по голосу подойдёт базовая, сложное бронирование с проверками лучше отдать Extended Thinking.

Для русскоязычных разработчиков голосовых агентов это сейчас самый дешёвый способ протестировать агента, который не замолкает на каждом вызове внешнего инструмента, и понять, стоит ли перестраивать свою архитектуру с каскадной цепочки на единую модель.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Приложение для фото с ИИ подсказывает позу до съёмки: 22 000 скачиваний за старт
ai

Приложение для фото с ИИ подсказывает позу до съёмки: 22 000 скачиваний за старт

Приложение для поз на фото с ИИ: два бывших сотрудника TikTok запустили Superpose, камеру, которая подсказывает, как встать в кадре, и это уже скачали 22 000…

5 мин
ai

Как написать рекламу с помощью ИИ за 15 минут: формула промпта и готовые шаблоны

Мне нужно написать how-to статью о том, как написать рекламу с помощью ИИ. Однако оригинал на английском пуст — нет источника с фактами. Это значит, что я не…

6 мин
ai

Нейросети для пожилых: как за 15 минут получить помощника без подписок и английского

Нейросети для пожилых людей перестали быть фантастикой: любой пенсионер с телефоном или компьютером может прямо сегодня получить помощника, который ответит на…

4 мин