Gemini 3.5 Transcribe переводит речь в текст нейросетью с ошибкой 2,6% на 85+ языках
Google выпустила Gemini 3.5 Transcribe, модель для перевода речи в текст, и разделила её на два отдельных API-сервиса: один для потоковой работы в реальном времени, другой для обработки записей, каждый со своими ограничениями.

Модель определяет язык автоматически среди 85+ языков, включая русский, и умеет переключаться между языками прямо внутри предложения, но потоковый сервис ограничен десятью минутами и не различает голоса разных спикеров.
Marktechpost опубликовал разбор новой модели Google для транскрипции. Gemini 3.5 Transcribe пришла на замену Chirp 3 и, по данным независимого бенчмарка Artificial Analysis, показывает среднюю ошибку в словах (WER, word error rate, процент неправильно распознанных слов) 4% в потоковом режиме и 2,6% при работе с записями. Скорость финальной транскрипции выросла на 70% по сравнению с Chirp 3.
Два сервиса вместо одного: в чём разница?
Это не единый продукт, а два раздельных API (программных интерфейса), и каждый закрывает свой сценарий.
Live API (потоковый сервис) выдаёт транскрипцию с задержкой менее секунды. Он принимает аудио кусками по 100 миллисекунд в формате 16-бит PCM, 16 кГц, моно. Поддерживает автоматическое определение голосовой активности и временные токены для мобильных и веб-клиентов, чтобы не хранить API-ключ на устройстве.
Ограничения Live API существенные:
- Сессия длится не больше 10 минут непрерывного потока
- Нет диаризации (разделения речи по спикерам, чтобы понять, кто говорил)
- Нет меток времени на уровне отдельных слов
Interactions API (для записей) закрывает то, чего не может потоковый сервис:
- Диаризация, модель разделяет речь по говорящим
- Метки времени начала и конца для каждого слова
- Словарь подсказок до 1 000 терминов (лучший результат при списке до 100)
- Принимает записи до 1 часа, но при включённой диаризации или метках времени лимит падает до 30 минут
Что понадобится
- Аккаунт Google и доступ к Google AI Studio (бесплатный уровень доступен)
- API-ключ Gemini API (генерируется в Google AI Studio)
- Среда для работы с API: Python, cURL или любой HTTP-клиент
- Аудиофайл в поддерживаемом формате или микрофон для потоковой записи
- 15 минут на первый тест
Google предоставляет бесплатный уровень для соло-разработчиков и стартапов. Платный уровень снимает ограничения по частоте запросов и гарантирует, что ваш контент не используется для улучшения продуктов Google. Для крупных компаний с регуляторными требованиями есть Gemini Enterprise Agent Platform с контролем соответствия и объёмными скидками. Оба варианта находятся в режиме публичного превью, то есть для критичных задач стоит учитывать возможные изменения.
Пошаговая инструкция
-
Зарегистрируйтесь или войдите в Google AI Studio и создайте API-ключ
-
Определитесь с задачей: вам нужна речь в текст в реальном времени (Live API) или обработка готовой записи (Interactions API)
-
Для транскрипции записи через Interactions API отправьте запрос:
POST https://generativelanguage.googleapis.com/v1/models/gemini-3.5-transcribe:generateContent
Authorization: Bearer YOUR_API_KEY
{
"contents": [{
"parts": [{
"inline_data": {
"mime_type": "audio/wav",
"data": "BASE64_ENCODED_AUDIO"
}
}]
}],
"generation_config": {
"response_modalities": ["TEXT"],
"transcription_config": {
"mode": "verbatim"
}
}
}
-
Выберите режим транскрипции:
verbatim(дословный, со всеми «э», «ну», «то есть», повторами) илиsmart(очищенный, без речевых мусорных слов, с исправлёнными самоповторами) -
Если нужна диаризация, добавьте в конфигурацию параметр диаризации и учтите, что лимит файла сократится с 60 до 30 минут
-
Для потоковой транскрипции через Live API настройте WebSocket-соединение, передавайте аудио кусками по 100 мс в формате 16-бит PCM, 16 кГц, моно
-
Получайте промежуточные результаты (
interim_input_transcription, предварительный текст, пока человек ещё говорит) и финальные (input_transcription, подтверждённый текст после завершения фразы)
Verbatim или Smart: какой режим выбрать?
Это ключевое проектное решение. Режим verbatim возвращает всё дословно. Режим smart убирает слова-паразиты, исправляет самокоррекции и форматирует текст.
Пример из документации Google: фраза «Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol» в режиме verbatim сохраняется целиком, а smart возвращает «For the meeting, I think we should invite Bob and Carol».
Критически важно: smart нельзя совмещать с метками времени и диаризацией. Читаемый пересказ и детальный протокол с таймкодами по спикерам, это два отдельных вызова API.
Задача: транскрибировать 20-минутное интервью на русском языке с двумя спикерами.
Шаг 1. Отправили аудиофайл в Interactions API с включённой диаризацией и режимом verbatim. Лимит при диаризации: 30 минут, файл укладывается.
Результат: получили текст с разметкой «Спикер 1» и «Спикер 2», с метками времени для каждого слова. Все «ну», «как бы», «то есть» на месте.
Шаг 2. Отправили тот же файл повторно с режимом smart без диаризации, чтобы получить чистый текст для публикации.
Результат: связный текст без мусорных слов, но без разбивки по спикерам. Два вызова API вместо одного, но итоговый материал готов и к редактуре, и к аудиту.
По стоимости: пакетная обработка обходится примерно в $0,005 за минуту, потоковая в $0,009 за минуту (по данным Marktechpost).
Путаница между двумя API. Live API не поддерживает диаризацию и метки времени. Если вы строите агента (ИИ-агент, программа, которая действует самостоятельно) для обработки звонков и рассчитываете на разделение спикеров в реальном времени, потоковый сервис это не закроет.
Лимит 10 минут в Live API. Для голосового помощника или live-субтитров нужно заранее продумать механизм переподключения сессий. Это не баг, а текущее ограничение превью.
Режим smart + диаризация. Их нельзя включить одновременно. Новички пытаются получить и чистый текст, и разметку спикеров одним запросом, получают ошибку.
Расчёт на автономный хостинг. Открытых весов (open weights, файлы модели для запуска на своём сервере) нет. Модель работает только через облачный API Google, локально развернуть её нельзя.
Что делать с этим прямо сейчас, по ролям
Авторам Дзена и копирайтерам. Если вы записываете подкасты, берёте интервью или надиктовываете черновики, нейросеть для перевода речи в текст экономит часы ручной расшифровки. Отправляете запись в Interactions API в режиме smart, получаете очищенный текст. Русский язык поддерживается с автоматическим определением.
Маркетологам и продуктовым командам. Инструмент полезен для расшифровки звонков с клиентами, вебинаров и пользовательских исследований. Диаризация позволяет автоматически разделить реплики менеджера и клиента. Стоимость пакетной обработки ($0,005 за минуту) делает массовую аналитику звонков доступной.
Разработчикам в РФ и СНГ. Модель поддерживает русский язык и переключение между языками внутри предложения (code-switching, когда спикер перемешивает русский и английский). Live API уже интегрирован с LiveKit, Pipecat, Agora и другими платформами. Из доступных в РФ альтернатив для перевода речи в текст через нейросеть можно рассматривать Yandex SpeechKit и открытую модель Whisper от OpenAI.
Разделение на два API выглядит как честное инженерное решение, а не маркетинговый трюк. Google не стала прятать ограничения потокового режима, а явно зафиксировала: хотите скорость, жертвуйте диаризацией, хотите полный протокол, отправляйте файл.
По моим наблюдениям, для большинства авторов и маркетологов в РФ Interactions API (работа с записями) закрывает 80% задач. Потоковый режим пригодится тем, кто строит голосовых ИИ-агентов или live-субтитры, но лимит в 10 минут пока серьёзно ограничивает сценарии.
Честная оговорка: оба сервиса в публичном превью. Лимиты, цены и доступность могут измениться. Для задач, где критична стабильность и предсказуемость, стоит держать запасной вариант.
Попробуйте AI-ассистент dzen.guru
Автоматизируйте рутину работы с контентом. Загрузите расшифровку и получите готовый черновик для Дзена.
Попробовать бесплатноГлавное, что стоит запомнить: Gemini 3.5 Transcribe это не один инструмент, а два, и выбор между ними определяет, какой результат вы получите. Решите заранее, что важнее: скорость или детальный протокол с разметкой спикеров, и стройте процесс под конкретный API.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Робот утка от Hugging Face за $399: опенсорс, лидар и уникальный голос
Hugging Face через подразделение Pollen Robotics открыла предзаказ на Microduck, десятидюймового одноглазого робота утку на роликах, который поёт собственным…

Cohere Parse 5: vision language модель с 2,3 млрд параметров заменяет OCR за $1,50 на 1 000 страниц
Cohere выпустила Parse 5, модель для извлечения данных из PDF, презентаций и изображений, которая 10 июня стала доступна без листа ожидания через API, AWS…

Лимиты Claude AI падают на треть с 1 сентября: новый токенизатор удваивает потери
Компания Anthropic завершает промоакцию Claude Code 31 августа 2026 года, и недельные лимиты на использование упадут на треть от привычного уровня, а новый…
Комментарии