Игорь Градов
Игорь Градов
6 мин
ai

Gemini Live генерирует аватары на 97 языках: Google заменила связку сервисов одной моделью

Google запустила Gemini 3.8 Live with Live Avatar, мультимодальную модель, которая отвечает пользователю через анимированного персонажа с синхронизацией губ и мимикой, и впервые встроила аватар прямо в разговорный движок, а не приклеила его сбоку.

Почему это важно

Gemini Live создает говорящих аватаров не как отдельный генератор видео, а как часть модели, которая одновременно видит собеседника, слышит его, отвечает голосом и обращается к внешним сервисам. Для бизнеса это значит: один API вместо связки из языковой модели, синтеза речи и движка анимации.

До сих пор, чтобы собрать «говорящую голову» для поддержки или обучения, разработчику приходилось склеивать несколько сервисов: чат-бот отдельно, озвучка отдельно, анимация лица отдельно. Google объединила всё внутри одной модели и выпустила её в статусе General Availability (GA, полноценный релиз, а не тестовая версия) на корпоративной платформе Google Cloud. Об этом компания сообщила в официальном анонсе.

Что Когда Кто выпустил Цена
Gemini 3.8 Live with Live Avatar статус GA (General Availability) на момент анонса Google (платформа Google Cloud, тариф Gemini Enterprise) не раскрыта

Что умеет Gemini Live с аватарами?

  • Говорящий персонаж в реальном времени. Модель генерирует видео с аватаром до 24 кадров в секунду. Губы синхронизированы с речью, выражение лица меняется вместе с интонацией ответа.

  • 97 языков с переключением на лету. Можно начать разговор на русском, перейти на английский и вернуться обратно. Синхронизация губ и мимика адаптируются к новому языку без перезапуска сессии. Для российских отелей, образовательных платформ и служб поддержки с иностранными клиентами это практически готовый сценарий.

  • Считывание эмоций собеседника. Функция Affective dialogue (адаптивный диалог) учитывает темп речи, паузы и интонацию. Модель отличает спокойный вопрос от раздражённой жалобы и меняет манеру ответа.

  • Фильтрация фонового шума. Функция Proactive audio отсекает посторонние разговоры и шум. Модель старается отвечать только тому, кто обращается именно к ней. Полезно для офиса, магазина или стойки регистрации.

  • Работа с внешними сервисами прямо во время разговора. Через механизм Function calling (вызов функций) аватар может проверить бронь, найти заказ в CRM или запросить данные из внутренней системы. Раньше голосовому ИИ-агенту приходилось замолкать и ждать ответа сервера, теперь модель продолжает диалог, пока операция выполняется в фоне.

  • Свой аватар по одной фотографии. Компании смогут создавать собственных персонажей по одному референсному изображению. Но пока пользовательские аватары доступны только отдельным клиентам после согласования с Google Cloud. Использовать изображения несовершеннолетних и знаменитостей запрещено, нужны права на лицо и голос.

Технические параметры для разработчиков

Взаимодействие идёт через двустороннее соединение WebSocket (постоянный канал связи, когда данные идут в обе стороны без создания нового запроса на каждую реплику).

  • Входящее аудио: формат PCM, 16 кГц
  • Входящее видео: JPEG, до одного кадра в секунду
  • Выходное аудио: 24 кГц
  • Выходное видео: MP4, 24 кадра в секунду
  • Контекстное окно (объём информации, который модель учитывает внутри одной сессии): до 128 тысяч токенов (токен, единица текста, примерно одно слово)
  • При использовании Live Avatar: до 24 тысяч токенов на выходе
  • Идентификатор модели в API: gemini-3.8-live

Как попробовать?

  1. Убедитесь, что у вашей организации есть доступ к Gemini Enterprise на платформе Google Cloud.
  2. Используйте идентификатор модели gemini-3.8-live в API и подключитесь через WebSocket по документации Google Cloud.
  3. Для пользовательских аватаров подайте запрос на согласование с Google Cloud, на старте доступны готовые персонажи и набор голосов.
Где подвох

Google прямо указывает: Live Avatar рассчитан на несколько минут непрерывного разговора, а не на многочасовые сессии. Возможны задержки, тайм-ауты и галлюцинации (когда ИИ уверенно выдумывает то, чего не было). Дата отсечки знаний модели приходится на январь 2025 года, для актуальных данных агенту нужен внешний источник. Стоимость сервиса Google не раскрыла. Всё сгенерированное аудио и видео маркируется невидимым водяным знаком SynthID от Google DeepMind, чтобы можно было отличить цифрового персонажа от реального человека.

Сравнение с российскими аналогами

На момент публикации ни YandexGPT, ни GigaChat (Сбер) не предлагают встроенных говорящих аватаров с синхронизацией губ и мимикой внутри разговорной модели. В России существуют отдельные сервисы генерации «говорящих голов», но они работают как внешние инструменты, их нужно подключать к чат-боту вручную. Gemini Live создает говорящих аватаров единым модулем, и именно этот подход пока не воспроизведён на российском рынке.

Для тех, кому нужен голосовой ИИ-агент на русском языке прямо сейчас, YandexGPT и GigaChat остаются рабочими вариантами для текстовых и голосовых сценариев без визуального аватара.

Что делать с этим прямо сейчас, по ролям

Автору Дзена. Поддержка 97 языков с живой мимикой открывает формат: видеоконсультант, который отвечает подписчикам голосом и лицом. Пока сервис доступен только через Google Cloud Enterprise, но уже можно продумать, какие рубрики выиграют от «говорящей головы» вместо текстового бота.

Маркетологу. Один API вместо связки «чат-бот плюс озвучка плюс анимация» может заметно сократить бюджет на разработку виртуального консультанта. Считайте экономику заранее: стоимость Google пока не назвала.

Предпринимателю в РФ и СНГ. Прямой доступ к Google Cloud Enterprise из России затруднён. Но если ваш бизнес работает с иностранными клиентами или у вас есть юрлицо за рубежом, сервис доступен. Для внутреннего рынка следите за тем, когда Яндекс или Сбер добавят аналогичную функцию, спрос на «цифровых сотрудников» с лицом растёт.

Мнение редакции dzen.guru

Google сделала ход, который выглядит логично: зачем клеить аватар снаружи, если можно вшить его прямо в модель. По моим наблюдениям, большинство существующих решений с «говорящими головами» страдают именно от рассинхрона между ответом бота и движением губ. Если Gemini действительно решает эту проблему на уровне архитектуры, это упрощает жизнь разработчикам.

Но я бы не спешил называть это «цифровым сотрудником». Несколько минут непрерывного разговора, галлюцинации и знания только до января 2025 года означают, что без присмотра живого человека такого аватара на стойку не поставишь. Это пока интерфейс для коротких сценариев, не замена специалисту.

Что сделать сегодня: если вы строите чат-бот или голосовой сервис, зайдите в документацию Google Cloud и посмотрите примеры Live Avatar. Даже если прямо сейчас не подключите, понимание архитектуры поможет, когда аналогичные решения появятся у российских провайдеров.

Частые вопросы

Gemini Live создает аватаров бесплатно?

Нет. Live Avatar доступен в тарифе Gemini Enterprise на Google Cloud. Точную стоимость Google в анонсе не раскрыла.

Можно ли использовать своё лицо для аватара?

Технически модель умеет создавать персонажа по одной фотографии. Но пользовательские аватары пока доступны только отдельным клиентам после согласования с Google Cloud. Использовать изображения несовершеннолетних и знаменитостей запрещено, также нужно иметь права на лицо и голос.

Будет ли это работать на русском языке?

По данным Google, модель поддерживает переключение между 97 языками прямо во время разговора. Синхронизация губ и мимика адаптируются к новому языку без перезапуска сессии. Конкретный список языков Google в анонсе не привела, но 97 языков с высокой вероятностью включают русский.

Теперь ИИ может ошибаться, глядя пользователю прямо в глаза. Но для коротких сценариев поддержки, обучения и консультаций, где важно «человеческое присутствие» на экране, это рабочий инструмент уже сейчас, просто держите живого специалиста за кулисами.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Что такое ИИ-агент и как MWS сжимает его запуск с месяцев до дней
ai

Что такое ИИ-агент и как MWS сжимает его запуск с месяцев до дней

Бизнес-задачу, которую раньше решали месяцами, от прототипа ИИ-агента до его запуска в рабочую среду, платформа MWS AI Agents Platform сжимает до дней, забирая…

6 мин
AI firewall для LLM: 5 слоёв защиты, которые требует корпоративный CISO
ai

AI firewall для LLM: 5 слоёв защиты, которые требует корпоративный CISO

Корпоративный ИИ давно вышел за границы пилотных проектов, и теперь запросы к моделям летят из десятков точек одновременно: от IDE разработчиков и внутренних…

7 мин
TechCrunch Disrupt 2026 даёт скидку до $200: 10 000 участников за три дня
ai

TechCrunch Disrupt 2026 даёт скидку до $200: 10 000 участников за три дня

Текст, продвигающий конференцию TechCrunch Disrupt 2026, предлагает скидки до 200 долларов на билеты и позиционирует три дня мероприятия как способ сжать…

4 мин