Игорь Градов
Игорь Градов
6 мин
ai

Транскрипция нейросетью за минуты: Gemini 3.5 Transcribe снизила ошибки до 2,6%

Каждый, кто работал с видео или подкастами, знает: ручная расшифровка аудио отнимает часы, а старые сервисы спотыкаются на шумах, акцентах и профессиональном жаргоне, и 4 июня Google представила Gemini 3.5 Transcribe, модель, которая меняет подход к транскрипции нейросетью.

Транскрипция нейросетью за минуты: Gemini 3.5 Transcribe снизила ошибки до 2,6%
Почему это важно

Google впервые открыла разработчикам доступ к модели транскрипции, которая не просто переводит речь в буквы, а убирает слова-паразиты, расставляет знаки препинания и распознаёт кастомный словарь на 85 и более языках, включая русский.

До сих пор качественная транскрипция нейросетью требовала цепочки инструментов: один сервис расшифровывал, второй чистил текст, третий расставлял тайм-коды. Gemini 3.5 Transcribe объединяет всё в одну модель и работает через API (интерфейс, через который программы обмениваются данными), доступный в Google AI Studio. По замерам аналитической платформы Artificial Analysis, средний показатель WER (Word Error Rate, доля неверно распознанных слов) составляет 4,0% в потоковом режиме и 2,6% при обработке записей. Время до финальной расшифровки сократилось на 70% по сравнению с предыдущей моделью Google Chirp 3, по данным того же Artificial Analysis.

Что умеет модель и в чём отличие от привычных сервисов?

Gemini 3.5 Transcribe доступна в двух режимах через раздельные API:

  • Потоковая расшифровка в реальном времени (модель gemini-3.5-transcribe-live). Двусторонний стриминг с задержкой менее секунды для голосовых приложений, чат-ботов, звонков.
  • Обработка записанного аудио (модель gemini-3.5-transcribe). Расшифровка совещаний, звонков, подкастов с разметкой по говорящим и пословными тайм-кодами. Модель разделяет до трёх спикеров, поддержка большего числа пока экспериментальная.

Ключевые возможности, которые выделяет Google:

  • Умная очистка текста. Модель сама убирает «э-э», «ну» и самоисправления вроде «встретимся во вторник, нет, в среду», оставляя чистый текст.
  • Кастомный словарь. Вы загружаете список терминов, имён, брендов, и модель подстраивает распознавание под них.
  • Автоопределение языка. Поддержка более 85 языков, включая работу с акцентами и диалектами.
  • Вызов функций. Модель может передавать задачи (генерация картинок, анализ файлов) другим моделям Gemini. Пока доступно в приложении Gemini для macOS.

На бенчмарке FLEURS (стандартный тест многоязычного распознавания речи) модель показывает WER 5,50% в потоковом режиме и 5,04% при обработке записей, по данным Google. Это конкретное улучшение относительно Chirp 3.

Что понадобится

  • Аккаунт Google с доступом к Google AI Studio (бесплатный).
  • Аудиофайл или микрофон для потокового режима.
  • Список специальной лексики (если транскрибируете нишевый контент: медицина, право, техника).
  • Время: первая расшифровка занимает 10 минут с настройкой, дальше быстрее.

Пошаговая инструкция

  1. Откройте Google AI Studio по адресу aistudio.google.com и войдите в аккаунт Google.

  2. Выберите режим Build и создайте новый проект. Google прямо указывает, что в этом режиме можно «vibe code apps with your voice», то есть собирать приложения голосом на лету.

  3. Укажите модель. Для записанного аудио выберите gemini-3.5-transcribe, для потокового режима gemini-3.5-transcribe-live.

  4. Загрузите аудиофайл (для режима записи) или подключите микрофон (для потокового). Поддерживаются стандартные форматы.

  5. Добавьте кастомный словарь, если нужно. Передайте список терминов в параметрах запроса:

custom_vocabulary: ["YandexGPT", "Дзен", "промпт-инжиниринг", "дообучение"]
  1. Запустите расшифровку. Модель вернёт текст с пунктуацией, очисткой от слов-паразитов и (при работе с записью) тайм-кодами и разметкой спикеров.

  2. Скопируйте результат или интегрируйте API в свой сервис, если вы разработчик.

Как это выглядит на практике

Запись совещания длиной 12 минут с тремя участниками, фоновый шум офиса, профессиональная терминология маркетинга.

Что загрузили: MP3-файл, в кастомный словарь добавили «CTR», «Дзен», «Турбо-страницы».

Что получили: чистый текст с разбивкой по спикерам (Speaker 1, Speaker 2, Speaker 3), пословными тайм-кодами, убранными «э-э-э» и самоисправлениями. Термин «CTR» модель не превратила в «ситиар» или «си-ти-ар», а оставила как есть, именно благодаря словарю. Знаки препинания расставлены, абзацы разделены по смене говорящего.

Где уже встроена транскрипция?

Google параллельно интегрировала Gemini 3.5 Transcribe в собственные продукты:

  • Gboard на Android (функция Rambler): произносите мысли вслух, модель выдаёт отформатированный текст без «ну» и «типа», а голосом можно вносить правки и менять стиль.
  • Приложение Gemini на macOS: голосовые команды в связке с контекстом экрана позволяют суммировать файлы, генерировать изображения, работать с текстом прямо курсором.
  • Chrome (скоро): диктовка в любое поле на веб-странице.

Среди платформ, уже работающих с моделью через Gemini Live API, Google называет Agora, LiveKit, LangChain, Pipecat, Vercel. Компании Vivo, Intellitek Health и Lingopal отметили низкую задержку и точность, по данным Google.

Что делать с этим прямо сейчас по ролям?

  • Автору Дзена. Записывайте голосовые черновики статей или расшифровывайте свои видео для текстовых дублей. Кастомный словарь позволяет сохранить нишевые термины без искажений. Экономия: вместо часа ручной расшифровки получаете готовый текст за минуты.

  • Маркетологу. Обрабатывайте звонки с клиентами и внутренние совещания с автоматической разметкой по спикерам. Это сырьё для аналитики, отчётов и обучающих материалов.

  • Разработчику в РФ и СНГ. Поддержка русского языка и кастомного словаря открывает возможность встраивать транскрипцию нейросетью в голосовые сервисы, колл-центры, обработку медицинских или юридических записей. Доступ через API, значит, можно интегрировать в существующий продукт.

  • Предпринимателю. Google AI Studio доступен бесплатно. Для корпоративного использования Google анонсировала доступ через Gemini Enterprise Agent Platform (платформу для бизнеса). Из альтернатив в РФ для распознавания речи есть SaluteSpeech от Сбера и Yandex SpeechKit: они работают с русским языком, но набор интеллектуальных функций (очистка текста, кастомный словарь, вызов функций) у Gemini 3.5 Transcribe шире, по описанию Google.

Частые ошибки
  • Не добавили кастомный словарь. Без него модель может исказить фирменные названия, аббревиатуры, имена. Потратьте пять минут на список терминов перед первым запуском.
  • Больше трёх спикеров. Google прямо указывает: поддержка более трёх говорящих пока экспериментальная. Если расшифровываете групповое совещание, будьте готовы к ошибкам атрибуции.
  • Ожидание идеала. WER 2,6% для записей означает примерно 2 и 3 ошибки на 100 слов. Это хороший уровень, но финальную вычитку текста для публикации никто не отменял.
  • Забыли про доступность. На момент публикации Rambler на Android работает в отдельных странах и языках, Chrome ещё не запущен. Проверяйте, доступна ли функция в вашем регионе.
Мнение редакции dzen.guru

Я протестировал десятки сервисов транскрипции за последние два года, и главная боль всегда была одна: модель выдаёт «сырой» текст, который нужно вручную чистить от мусора, расставлять знаки и разбивать по спикерам. Google, судя по описанию и первым отзывам партнёров, решает именно эту задачу.

Для тех, кто работает с русским языком, главная ценность в кастомном словаре. Если вы ведёте канал про медицину, право или технику, вы наконец можете загрузить свои термины и получить текст, который не нужно переписывать.

Честная оговорка: модель в публичном превью, не в финальном релизе. Цены для коммерческого использования Google пока не раскрыла. И если ваш проект критически завязан на русский язык, протестируйте параллельно Yandex SpeechKit и SaluteSpeech, чтобы сравнить качество на своих данных, прежде чем встраивать в продакшен.

Транскрипция нейросетью перестаёт быть компромиссом между скоростью и качеством. Если вы откладывали автоматизацию расшифровки из-за качества русского распознавания или отсутствия кастомных словарей, сейчас хороший момент открыть Google AI Studio и проверить модель на своём контенте.

Научитесь работать с ИИ-инструментами на практике

В dzen.guru мы разбираем нейросети не в теории, а на реальных задачах авторов и маркетологов. Подпишитесь, чтобы не пропускать практические разборы.

Подписаться на dzen.guru
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

ai

Как собрать ИИ-агентов в единую систему поддержки: пошаговое руководство

Мне нужно написать how-to статью по заданному H1 и плану секций. Однако оригинал (EN) пуст — нет источника с фактами. Это критично: по правилам я не могу…

6 мин
Google превратил голосовой помощник Gemini Live в агента: задачи идут в фоне днями
ai

Google превратил голосовой помощник Gemini Live в агента: задачи идут в фоне днями

Компания Google начала развёртывание крупного обновления голосового помощника Gemini Live, которое позволяет отдавать голосом сложные многошаговые команды и…

4 мин
AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн
ai

AI стартап без публичного продукта оценили в $2,5 млрд: финансирование Instinct достигло $350 млн

Стартап Instinct, основанный 23-летним Ноа Шинном всего год назад, привлёк 250 млн долларов в раунде Series B и довёл общий объём финансирования до 350 млн…

4 мин