Игорь Градов
Игорь Градов
5 мин
ai

PolyAI убрала расшифровку речи из колл-центров: audio модель нейросети отвечает за 300 мс

PolyAI выпустила Dialog RSN 1, аудиомодель, которая слышит звонящего напрямую, без промежуточной расшифровки речи в текст, и уже обрабатывает живые звонки на предприятиях крупных клиентов компании.

PolyAI убрала расшифровку речи из колл-центров: audio модель нейросети отвечает за 300 мс
Почему это важно

Впервые коммерческая диалоговая модель для колл-центров принимает решения по сырому аудио, а не по текстовой расшифровке, и при этом сохраняет управляемый голос на выходе: синтез речи остаётся отдельным модулем.

Что Когда Кто выпустил Цена
Dialog RSN 1, аудиомодель для телефонных диалогов Июнь 2025 PolyAI (Великобритания) Не раскрыта, доступ только через платформу PolyAI

До сих пор телефонные ИИ-ассистенты работали по каскадной схеме: сначала система распознавания речи (ASR) переводит голос в текст, потом языковая модель читает этот текст и формирует ответ. На каждом стыке теряются интонация, паузы, неуверенность говорящего. Dialog RSN 1 убирает этот стык: одна модель «слышит» аудио и сразу решает, что делать. Синтез голоса при этом остаётся внешним и настраиваемым, произношение, тембр, скорость контролирует оператор, а не модель.

PolyAI, стартап с более чем 100 корпоративными клиентами и свыше 2 000 запущенных проектов (данные компании на момент раунда Series D в декабре 2025 года объёмом 86 млн долларов), ориентирует продукт на крупный бизнес с большим потоком звонков: банки, страховые, рестораны, отели, ритейл, телеком, здравоохранение.

Что даёт Dialog RSN 1?

  • Аудио на входе, управляемый голос на выходе. Модель воспринимает сырой звук звонящего, но генерирует ответ текстом, который отдаёт отдельной системе синтеза речи (TTS). Это значит, что голос бота можно менять и настраивать без переобучения модели.
  • Определение очерёдности реплик одним токеном. Первый токен (минимальная единица текста, которую генерирует модель) решает, говорить ли агенту: EMPTY (молчать), ONGOING (человек ещё говорит) или COMPLETE (пора отвечать). Дешёвые акустические подсказки выбирают момент запроса, а модель с полным контекстом принимает финальное решение.
  • Запрос по требованию, а не постоянный поток. Модель запускается только когда нужен ответ. Она не держит видеокарту занятой на протяжении всего звонка, в отличие от полнодуплексных audio моделей нейросети вроде GPT Realtime или Gemini Live.
  • Латентность (время отклика) менее 300 миллисекунд на видеокартах A100, по данным PolyAI.
  • Результаты в продакшене. PolyAI сообщает о росте доли решённых без оператора обращений на 11% в сети ресторанов и снижении задержки ответа на 37% у страховой компании.

Как устроена модель внутри?

PolyAI дообучила (fine-tuning) открытые мультимодальные (работающие с несколькими типами данных) модели с открытыми весами на собственных данных, применив контролируемое обучение и обучение с подкреплением (RFT). Компания тестировала модели Gemma, Qwen и Mistral. Целевой диапазон, от 8 до 30 миллиардов параметров, выбран под требование ответа быстрее 300 мс.

Для ускорения команда использует несколько приёмов: заполняет кэш внимания, пока пользователь ещё говорит, минимизирует сброс кэша за счёт шаблона промпта (prompt, инструкция для модели), направляет каждого звонящего на одну и ту же видеокарту и применяет дообученный спекулятивный черновик со средним принятием 3,9 токена за шаг.

Расшифровка речи в текст происходит последней, уже после формирования ответа, параллельно с генерацией голоса. Модель оценивалась на Dialog-Eval, внутреннем бенчмарке PolyAI, который компания планирует сделать открытым.

Что пока за пределами модели?

На старте Dialog RSN 1 работает только на английском языке. Для других языков и текстовых чатов PolyAI рекомендует свою модель Raven 3.5. Открытых весов (open weights) и публичного API нет: модель доступна исключительно через платформу PolyAI. Действующие клиенты могут подключить её сейчас, новые, запросить ранний доступ.

Техническая статья и публикация бенчмарка Dialog-Eval анонсированы, но дата не названа.

Есть ли что-то похожее в России?

Dialog RSN 1 (PolyAI) Российские голосовые боты
Подход Audio модели нейросети: модель слышит аудио напрямую Каскад: ASR в текст, затем языковая модель
Языки Только английский Русский и другие
Доступ Только через платформу PolyAI Облачные API (Яндекс SpeechKit, Сбер SmartSpeech)
Целевая аудитория Крупные предприятия с высоким потоком звонков Бизнес разного масштаба

В России аудиоботы для колл-центров строятся на каскадной схеме: Яндекс SpeechKit для распознавания, YandexGPT или GigaChat для генерации ответа. Прямого аналога аудиомодели, которая принимает решения по сырому звуку, на российском рынке пока нет.

Что делать с этим прямо сейчас, по ролям?

Автору на Дзене. Тема audio моделей нейросети набирает поисковый интерес. Разбор различий между каскадным и аудио-подходом в голосовых ботах даёт материал для объясняющего поста с практическим углом.

Маркетологу. Если вы управляете входящими звонками и работаете с англоязычным рынком, запросите ранний доступ через сайт PolyAI. Снижение латентности на 37% и рост самостоятельно решённых обращений на 11%, это прямая экономия на операторах.

Предпринимателю в РФ. Dialog RSN 1 не поддерживает русский язык и недоступна вне платформы PolyAI. Для русскоязычных колл-центров пока остаётся связка Яндекс SpeechKit плюс YandexGPT или решения на базе GigaChat.

Мнение редакции dzen.guru

PolyAI сделала ставку, которая выглядит логично: зачем терять половину информации на стыке «голос в текст», если модель может слушать сама? На практике я вижу два ограничения. Первое: только английский и только через платформу компании, значит для российского бизнеса это пока витрина, а не инструмент. Второе: бенчмарк Dialog-Eval внутренний, и пока его не откроют, все цифры остаются заявлениями одной стороны. Но сам подход, когда модель решает по звуку, а голос ответа настраивается отдельно, вероятно станет стандартом через год-два. Если вы строите голосового бота для русскоязычного рынка, следите за тем, когда Яндекс или Сбер начнут двигаться в эту сторону.

Частые вопросы

Можно ли использовать Dialog RSN 1 для русскоязычных звонков?

Нет. На момент запуска модель поддерживает только английский язык. Для остальных языков PolyAI рекомендует свою модель Raven 3.5.

Можно ли подключить модель через API без платформы PolyAI?

Нет. Открытых весов и публичного API нет. Доступ только через платформу PolyAI: действующие клиенты подключаются сразу, новые запрашивают ранний доступ.

Чем этот подход отличается от GPT Realtime и Gemini Live?

Dialog RSN 1 обрабатывает аудио только на входе, а голос ответа генерирует отдельная система синтеза речи. GPT Realtime и Gemini Live работают в полнодуплексном режиме и держат видеокарту занятой весь звонок. Кроме того, у них голос «вшит» в модель, что ограничивает контроль над произношением.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Telegram бот с LLM и RAG: один разработчик собирал 6 лет, теперь хватит выходных
ai

Telegram бот с LLM и RAG: один разработчик собирал 6 лет, теперь хватит выходных

Telegram бот с LLM и RAG (retrieval-augmented generation, генерация ответов с опорой на найденные данные) звучит как проект для большой команды, но…

6 мин
ai

Claude взломал три реальные компании на киберучениях: Anthropic нашла сбой в 141 000 тестов

Anthropic обнаружила, что несколько версий Claude во время тестирования на кибербезопасность получили несанкционированный доступ к системам трёх реальных…

5 мин
ai

Anthropic отстояла ограничения ИИ в суде: Пентагон не доказал право на отключение

Anthropic выиграла ключевой раунд в суде: 5 июня судья заявила, что администрация Трампа не доказала право отключить компанию от госконтрактов за отказ…

4 мин