Транскрипция нейросетью за минуты: Gemini 3.5 Transcribe снизила ошибки до 2,6%
Каждый, кто работал с видео или подкастами, знает: ручная расшифровка аудио отнимает часы, а старые сервисы спотыкаются на шумах, акцентах и профессиональном жаргоне, и 4 июня Google представила Gemini 3.5 Transcribe, модель, которая меняет подход к транскрипции нейросетью.

Google впервые открыла разработчикам доступ к модели транскрипции, которая не просто переводит речь в буквы, а убирает слова-паразиты, расставляет знаки препинания и распознаёт кастомный словарь на 85 и более языках, включая русский.
До сих пор качественная транскрипция нейросетью требовала цепочки инструментов: один сервис расшифровывал, второй чистил текст, третий расставлял тайм-коды. Gemini 3.5 Transcribe объединяет всё в одну модель и работает через API (интерфейс, через который программы обмениваются данными), доступный в Google AI Studio. По замерам аналитической платформы Artificial Analysis, средний показатель WER (Word Error Rate, доля неверно распознанных слов) составляет 4,0% в потоковом режиме и 2,6% при обработке записей. Время до финальной расшифровки сократилось на 70% по сравнению с предыдущей моделью Google Chirp 3, по данным того же Artificial Analysis.
Что умеет модель и в чём отличие от привычных сервисов?
Gemini 3.5 Transcribe доступна в двух режимах через раздельные API:
- Потоковая расшифровка в реальном времени (модель
gemini-3.5-transcribe-live). Двусторонний стриминг с задержкой менее секунды для голосовых приложений, чат-ботов, звонков. - Обработка записанного аудио (модель
gemini-3.5-transcribe). Расшифровка совещаний, звонков, подкастов с разметкой по говорящим и пословными тайм-кодами. Модель разделяет до трёх спикеров, поддержка большего числа пока экспериментальная.
Ключевые возможности, которые выделяет Google:
- Умная очистка текста. Модель сама убирает «э-э», «ну» и самоисправления вроде «встретимся во вторник, нет, в среду», оставляя чистый текст.
- Кастомный словарь. Вы загружаете список терминов, имён, брендов, и модель подстраивает распознавание под них.
- Автоопределение языка. Поддержка более 85 языков, включая работу с акцентами и диалектами.
- Вызов функций. Модель может передавать задачи (генерация картинок, анализ файлов) другим моделям Gemini. Пока доступно в приложении Gemini для macOS.
На бенчмарке FLEURS (стандартный тест многоязычного распознавания речи) модель показывает WER 5,50% в потоковом режиме и 5,04% при обработке записей, по данным Google. Это конкретное улучшение относительно Chirp 3.
Что понадобится
- Аккаунт Google с доступом к Google AI Studio (бесплатный).
- Аудиофайл или микрофон для потокового режима.
- Список специальной лексики (если транскрибируете нишевый контент: медицина, право, техника).
- Время: первая расшифровка занимает 10 минут с настройкой, дальше быстрее.
Пошаговая инструкция
-
Откройте Google AI Studio по адресу
aistudio.google.comи войдите в аккаунт Google. -
Выберите режим Build и создайте новый проект. Google прямо указывает, что в этом режиме можно «vibe code apps with your voice», то есть собирать приложения голосом на лету.
-
Укажите модель. Для записанного аудио выберите
gemini-3.5-transcribe, для потокового режимаgemini-3.5-transcribe-live. -
Загрузите аудиофайл (для режима записи) или подключите микрофон (для потокового). Поддерживаются стандартные форматы.
-
Добавьте кастомный словарь, если нужно. Передайте список терминов в параметрах запроса:
custom_vocabulary: ["YandexGPT", "Дзен", "промпт-инжиниринг", "дообучение"]
-
Запустите расшифровку. Модель вернёт текст с пунктуацией, очисткой от слов-паразитов и (при работе с записью) тайм-кодами и разметкой спикеров.
-
Скопируйте результат или интегрируйте API в свой сервис, если вы разработчик.
Запись совещания длиной 12 минут с тремя участниками, фоновый шум офиса, профессиональная терминология маркетинга.
Что загрузили: MP3-файл, в кастомный словарь добавили «CTR», «Дзен», «Турбо-страницы».
Что получили: чистый текст с разбивкой по спикерам (Speaker 1, Speaker 2, Speaker 3), пословными тайм-кодами, убранными «э-э-э» и самоисправлениями. Термин «CTR» модель не превратила в «ситиар» или «си-ти-ар», а оставила как есть, именно благодаря словарю. Знаки препинания расставлены, абзацы разделены по смене говорящего.
Где уже встроена транскрипция?
Google параллельно интегрировала Gemini 3.5 Transcribe в собственные продукты:
- Gboard на Android (функция Rambler): произносите мысли вслух, модель выдаёт отформатированный текст без «ну» и «типа», а голосом можно вносить правки и менять стиль.
- Приложение Gemini на macOS: голосовые команды в связке с контекстом экрана позволяют суммировать файлы, генерировать изображения, работать с текстом прямо курсором.
- Chrome (скоро): диктовка в любое поле на веб-странице.
Среди платформ, уже работающих с моделью через Gemini Live API, Google называет Agora, LiveKit, LangChain, Pipecat, Vercel. Компании Vivo, Intellitek Health и Lingopal отметили низкую задержку и точность, по данным Google.
Что делать с этим прямо сейчас по ролям?
-
Автору Дзена. Записывайте голосовые черновики статей или расшифровывайте свои видео для текстовых дублей. Кастомный словарь позволяет сохранить нишевые термины без искажений. Экономия: вместо часа ручной расшифровки получаете готовый текст за минуты.
-
Маркетологу. Обрабатывайте звонки с клиентами и внутренние совещания с автоматической разметкой по спикерам. Это сырьё для аналитики, отчётов и обучающих материалов.
-
Разработчику в РФ и СНГ. Поддержка русского языка и кастомного словаря открывает возможность встраивать транскрипцию нейросетью в голосовые сервисы, колл-центры, обработку медицинских или юридических записей. Доступ через API, значит, можно интегрировать в существующий продукт.
-
Предпринимателю. Google AI Studio доступен бесплатно. Для корпоративного использования Google анонсировала доступ через Gemini Enterprise Agent Platform (платформу для бизнеса). Из альтернатив в РФ для распознавания речи есть SaluteSpeech от Сбера и Yandex SpeechKit: они работают с русским языком, но набор интеллектуальных функций (очистка текста, кастомный словарь, вызов функций) у Gemini 3.5 Transcribe шире, по описанию Google.
- Не добавили кастомный словарь. Без него модель может исказить фирменные названия, аббревиатуры, имена. Потратьте пять минут на список терминов перед первым запуском.
- Больше трёх спикеров. Google прямо указывает: поддержка более трёх говорящих пока экспериментальная. Если расшифровываете групповое совещание, будьте готовы к ошибкам атрибуции.
- Ожидание идеала. WER 2,6% для записей означает примерно 2 и 3 ошибки на 100 слов. Это хороший уровень, но финальную вычитку текста для публикации никто не отменял.
- Забыли про доступность. На момент публикации Rambler на Android работает в отдельных странах и языках, Chrome ещё не запущен. Проверяйте, доступна ли функция в вашем регионе.
Я протестировал десятки сервисов транскрипции за последние два года, и главная боль всегда была одна: модель выдаёт «сырой» текст, который нужно вручную чистить от мусора, расставлять знаки и разбивать по спикерам. Google, судя по описанию и первым отзывам партнёров, решает именно эту задачу.
Для тех, кто работает с русским языком, главная ценность в кастомном словаре. Если вы ведёте канал про медицину, право или технику, вы наконец можете загрузить свои термины и получить текст, который не нужно переписывать.
Честная оговорка: модель в публичном превью, не в финальном релизе. Цены для коммерческого использования Google пока не раскрыла. И если ваш проект критически завязан на русский язык, протестируйте параллельно Yandex SpeechKit и SaluteSpeech, чтобы сравнить качество на своих данных, прежде чем встраивать в продакшен.
Транскрипция нейросетью перестаёт быть компромиссом между скоростью и качеством. Если вы откладывали автоматизацию расшифровки из-за качества русского распознавания или отсутствия кастомных словарей, сейчас хороший момент открыть Google AI Studio и проверить модель на своём контенте.
Научитесь работать с ИИ-инструментами на практике
В dzen.guru мы разбираем нейросети не в теории, а на реальных задачах авторов и маркетологов. Подпишитесь, чтобы не пропускать практические разборы.
Подписаться на dzen.guru
Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также
Как собрать ИИ-агентов в единую систему поддержки: пошаговое руководство
Мне нужно написать how-to статью по заданному H1 и плану секций. Однако оригинал (EN) пуст — нет источника с фактами. Это критично: по правилам я не могу…

Google превратил голосовой помощник Gemini Live в агента: задачи идут в фоне днями
Компания Google начала развёртывание крупного обновления голосового помощника Gemini Live, которое позволяет отдавать голосом сложные многошаговые команды и…

AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн
Стартап Instinct, основанный 23-летним Ноа Шинном всего год назад, привлёк 250 млн долларов в раунде Series B и довёл общий объём финансирования до 350 млн…
Комментарии