Игорь Градов
Игорь Градов
7 мин
ai

TTFT вводит в заблуждение: как выбирать API для голосовых ИИ-агентов по реальной задержке

Microsoft второго июня запустила Project Solara — нет, стоп. Работаю строго по источнику.

TTFT вводит в заблуждение: как выбирать API для голосовых ИИ-агентов по реальной задержке

Метрика TTFT (time to first token, время до первого токена) стала стандартом выбора API для голосовых ИИ-агентов, но она систематически вводит разработчиков в заблуждение, потому что пользователь слышит не первый токен, а первое законченное предложение, и разница между ними может удвоить реальную задержку.

Почему это важно

Голосовые ИИ-агенты оценивают по скорости, которую человек не ощущает напрямую: синтезатор речи не может произнести полслова и ждёт целую фразу, поэтому провайдер с лучшим TTFT может на практике звучать медленнее конкурента.

Исследование опирается на данные нескольких независимых источников: бенчмарки Artificial Analysis по состоянию на 30 августа 2026 года, замеры LiveKit для собственного инференс-продукта и методологию Daily, которая измеряет задержку со стороны клиента, а не внутри стека провайдера. Вместе они покрывают весь «голосовой стек»: распознавание речи (STT), языковую модель (LLM), синтез речи (TTS) и сквозную задержку от голоса до голоса.

Показатель Значение Источник
Целевая сквозная задержка голосового ответа от 700 мс до 1,2 с LiveKit
Медианная задержка «голос-голос», рекомендация 800 мс Kwindla Hultman Kramer, сооснователь Pipecat
Допустимая задержка для прототипа 1 500 мс Kwindla Hultman Kramer
Типичное время реакции человека в разговоре около 500 мс Daily
Бюджет на LLM внутри голосового конвейера около 700 мс TTFT Daily, февраль 2026
TTFT Gemma 4 31B на LiveKit Inference 192 мс LiveKit
TTFS Gemma 4 31B на LiveKit Inference 354 мс LiveKit
TTFT Mercury 2 (диффузионная модель) 3,07 с при 770 токенов/с Artificial Analysis
TTFT GPT-5.6 Luna на Amazon Bedrock 0,59 с Artificial Analysis
TTFT GPT-5.6 Luna на OpenAI API 0,74 с Artificial Analysis
Стоимость Gemma 4 31B на LiveKit $1,20 за 1 млн выходных токенов LiveKit

Что на самом деле измеряли?

TTFT (time to first token) показывает, сколько миллисекунд проходит от отправки запроса до прихода первого кусочка ответа. IBM определяет это как момент, когда система переходит из состояния «думаю» в состояние «начинаю отвечать». Для текстового чата этого достаточно: вы видите, как буквы появляются на экране.

Для голоса всё иначе. Синтезатор речи (TTS, модуль, превращающий текст в звук) не способен произнести половину слова. Ему нужна законченная фраза. LiveKit называет время до первой произнесённой фразы TTFS (time to first sentence), и именно эту задержку слышит собеседник.

Отсюда два рычага вместо одного:

  • TTFT определяет, когда генерация стартует.
  • Скорость генерации токенов определяет, как быстро первое предложение соберётся целиком.

Провайдер, выигрывающий по одному показателю и проигрывающий по другому, на слух не будет казаться быстрым.

Бюджет задержки одного голосового «хода» LiveKit раскладывает так: STT (распознавание речи) забирает от 100 до 200 мс, LLM от 300 до 500 мс при стриминге, TTS от 100 до 200 мс, сеть (WebRTC) от 50 до 150 мс. Итого: от 700 мс до 1,2 с на одну реплику. При этом Daily приводит данные о человеческом разговоре: паузы больше 800 мс уже воспринимаются как неестественные.

Кто быстрее и почему цифры обманывают?

Пять методологических фактов, без которых таблицы бессмысленны:

  • Размер промпта решает. Artificial Analysis с марта 2026 года использует промпты по 10 000 входных токенов вместо прежних 1 000. Длинные промпты увеличивают и TTFT, и скорость генерации. LiveKit считает это ближе к реальности: боевые ИИ-агенты загружают в промпт политики, описание персоны, правила эскалации, извлечённые данные и схемы инструментов.
  • Географию не отключить. Artificial Analysis тестирует из виртуальной машины в зоне us-central1-a Google Cloud. TTFT включает сетевую задержку и может давать преимущество или штраф в зависимости от того, где провайдер обслуживает запросы.
  • Токены рассуждений считаются отдельно. Для рассуждающих моделей (reasoning model, модель, которая «думает» перед ответом) TTFT фиксирует первый токен рассуждения, а не первый токен ответа.
  • Мерить нужно со стороны клиента. Daily подчёркивает: провайдеры иногда указывают TTFT внутри своего стека. Daily измеряет от отправки запроса до первого пригодного токена на выходе API.
  • Повторяемость отсутствует. Daily прямо заявляет: TTFT существенно варьируется между запусками бенчмарка, а провайдеры меняют инференс-стеки и иногда веса, не меняя названия модели.

Самый показательный пример ловушки скорости: Mercury 2, диффузионная языковая модель, выдаёт 770 токенов в секунду, но первый фрагмент приходит через 3,07 секунды. Это в четыре раза больше всего бюджета LLM для естественного разговора.

Cerebras и Groq представляют обратный случай: приемлемый TTFT плюс высокая пропускная способность. Для TTFS такая комбинация сильна, потому что предложение собирается почти мгновенно после старта генерации.

Ещё один факт, который легко пропустить: одна и та же модель на разных хостингах показывает разную задержку. GPT-5.6 Luna без рассуждений на Amazon Bedrock даёт 0,59 с, а на собственном API OpenAI 0,74 с. Хостинг и маршрутизация влияют не меньше, чем сами веса модели.

Результат LiveKit: 192 мс, но с оговорками

LiveKit публикует замеры собственного инференс-продукта: Gemma 4 31B на LiveKit Inference показывает TTFT 192 мс. Для сравнения по данным LiveKit: Gemini 2.5 Flash даёт 911 мс, GPT-5.5 даёт 966 мс, GPT-4.1 показывает 1 006 мс, та же Gemma 4 31B через OpenRouter даёт 1 876 мс.

По метрике TTFS (время до первой полной фразы) в рамках полноценных диалогов LiveKit приводит такие данные: 354 мс для Gemma 4 31B на LiveKit, 1 034 мс для Gemini 2.5 Flash, 1 088 мс для GPT-4.1, 1 267 мс для Gemini 3.0 Flash и 1 404 мс для GPT-5.5.

LiveKit прозрачно объясняет механизм: модель работает за SGLang со спекулятивным декодированием (техника, когда модель «угадывает» следующие токены пачкой, а не по одному), а GPU намеренно не загружается на полную, чтобы минимизировать очередь. Тёплый запрос начинает возвращать токены примерно за 100 мс. Цена: $1,20 за 1 млн выходных токенов.

По качеству на бенчмарке IFBench (оценка Artificial Analysis): Gemma 4 31B набирает 75,6%, GPT-5.5 набирает 75,9%, GPT-4.1 получает 43%, Gemini 2.5 Flash получает 39%.

Как это читать

Замеры LiveKit сделаны на собственном продукте, что создаёт конфликт интересов. Daily предупреждает, что TTFT нестабилен между запусками. Artificial Analysis тестирует из одной географической точки. Ни один бенчмарк не покрывает все сценарии: длина промпта, число параллельных запросов и расположение сервера кардинально меняют результат. Прямое сравнение провайдеров по одной таблице без воспроизведения условий недопустимо.

Что делать с этим прямо сейчас?

Авторам и контент-креаторам на Дзене. Если вы экспериментируете с голосовыми форматами или подкастами, где ИИ-агент ведёт диалог, ориентируйтесь не на рекламные цифры TTFT, а на реальное ощущение паузы. Попросите тестовый доступ и замерьте задержку до первой произнесённой фразы секундомером на своём конце.

Маркетологам и продуктовым командам. Голосовые ИИ-агенты для поддержки клиентов или продаж нужно оценивать по двум числам: TTFT и скорость генерации токенов. Провайдер с красивым TTFT, но медленной генерацией создаст бота, которого клиенты будут перебивать. Порог комфорта по данным Daily составляет около 800 мс от голоса до голоса.

Предпринимателям в РФ и СНГ. Прямой доступ к LiveKit Inference, Cerebras и Groq из России ограничен или отсутствует. Из доступных вариантов стоит смотреть на YandexGPT (SpeechKit для STT/TTS) и GigaChat API от Сбера. Метрику TTFS они пока не публикуют, но принцип тот же: тестируйте задержку до первой произнесённой фразы, а не до первого токена.

Мнение редакции dzen.guru

По моим наблюдениям, большинство демонстраций голосовых ИИ-агентов на конференциях проходят на «тёплых» серверах с минимальной очередью. В бою при 50 параллельных звонках задержка может вырасти в разы. Факт, что одна и та же GPT-5.6 Luna показывает 0,59 с на Bedrock и 0,74 с на OpenAI, говорит прямо: вы выбираете не модель, а инфраструктуру. Для российского рынка это означает, что собственный инференс на арендованных GPU в РФ может оказаться быстрее, чем API через океан, даже если модель формально «медленнее». Я бы начинал любой проект голосового агента с замера TTFS на своей стороне, а не с чтения маркетинговых таблиц.

Выбор API для голосовых ИИ-агентов по одной метрике TTFT похож на выбор автомобиля по разгону до 10 км/ч: формально верно, практически бесполезно. Замеряйте TTFS, тестируйте из своей географии и закладывайте бюджет задержки на весь конвейер, а не на один его слой.

По данным LiveKit, Daily, Artificial Analysis

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus
ai

Разработчик на Rust нашёл баг в Neural Engine Apple, который пропустил Claude Opus

Компания Apple не выпускала Neural Engine как новый продукт: речь о глубоком техническом разборе уже существующего аппаратного блока, который провёл…

6 мин
Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости
ai

Markdown редактор MarkMello v0.4.0: папки, вкладки и поиск без потери скорости

Почему это важно Markdown-редактор MarkMello остался таким же быстрым при открытии одного файла, но теперь умеет работать с папками, вкладками и поиском, и всё…

5 мин
Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»
ai

Фреймворк ICO собирает пайплайн машинного обучения в единый граф без «швов»

Компания PyTorch и её экосистема давно стали стандартом для инженеров, занимающихся машинным обучением, но типичный пайплайн обучения модели по-прежнему…

6 мин