Игорь Градов
Игорь Градов
7 мин
ai

Голосовой ввод Windows 10 офлайн за 1 секунду: как настроить WhisperType

Автор Дзена, который ведёт канал и параллельно работает в браузере, мессенджере и редакторе, тратит на набор текста больше времени, чем на его обдумывание, а встроенный голосовой ввод Windows 10 через сочетание Win+H отправляет голос в облако Microsoft и работает нестабильно на русском языке.

Почему это важно

Существует способ диктовать текст на русском прямо в Windows 10 без интернета, без подписки и без прав администратора, причём задержка после короткой фразы составляет около одной секунды вместо четырёх.

Проблему решает открытый проект WhisperType, выпущенный под лицензией MIT. Он использует модель Whisper (система распознавания речи от OpenAI) локально, на процессоре, без видеокарты. По данным автора проекта, после установки приложение занимает около 250 МБ, плюс 1,6 ГБ весит сама модель. Актуальная версия на момент публикации 1.3.1. Ниже разбираю, как настроить голосовой ввод в Windows 10 так, чтобы он действительно работал быстро.

Что понадобится?

  • Windows 10 или 11 x64
  • Около 2 ГБ свободного места на диске (250 МБ приложение + 1,6 ГБ модель)
  • Микрофон (встроенный в ноутбук подойдёт)
  • Интернет только на этапе загрузки, потом не нужен
  • Права администратора не требуются
  • Время на установку и настройку: 15 от 20 минут, большая часть уйдёт на скачивание модели

Пошаговая инструкция

  1. Скачайте WhisperType с официального репозитория проекта на GitHub. Ищите релиз версии 1.3.1 или новее.

  2. Установите приложение. Установщик не требует прав администратора. После установки приложение займёт около 250 МБ.

  3. Дождитесь загрузки модели. При первом запуске WhisperType скачает модель deepdml/faster-whisper-large-v3-turbo-ct2 (это версия large-v3-turbo в формате CTranslate2, квантизация (сжатие модели для ускорения) int8_float32). Скачивание потребует около 1,6 ГБ. После этого интернет больше не нужен.

  4. Проверьте горячую клавишу. По умолчанию диктовка запускается и останавливается по хоткею. Нажали, сказали, нажали ещё раз. Текст появляется в том поле, где стоял курсор: в браузере, в мессенджере, в редакторе кода.

  5. Если нужна максимальная точность вместо скорости, смените модель в конфиге на Systran/faster-whisper-large-v3. Распознавание станет аккуратнее, но в несколько раз медленнее. Для большинства задач диктовки скоростная модель turbo предпочтительнее.

Почему Whisper без оптимизации работает медленно?

Главная техническая ловушка, о которую спотыкаются все «наивные» обёртки над Whisper: энкодер (часть модели, которая «слушает» аудио) всегда обрабатывает окно фиксированной длины в 30 секунд. Неважно, сказали вы одно слово «привет» или произнесли монолог на полминуты. Функция pad_or_trim дополняет аудио тишиной до 3000 кадров.

На процессоре Ryzen 5 7500F (6 ядер, 12 потоков) это даёт около 4 секунд на любую реплику. Четыре секунды ожидания после «ок, сделаю» это не голосовой ввод, а упражнение в терпении.

Как WhisperType сократил задержку до одной секунды?

Ключевая оптимизация: сужение окна энкодера до реальной длины записи. В библиотеке faster-whisper нет публичного параметра для этого, поэтому автор проекта использует контролируемый monkeypatch (подмена внутренней функции библиотеки «на лету»):

@contextlib.contextmanager
def encoder_window(frames):
    original = ftr.pad_or_trim
    ftr.pad_or_trim = lambda array, length=frames, **kw: original(array, length, **kw)
    try:
        yield
    finally:
        ftr.pad_or_trim = original

Ширина окна рассчитывается по фактической длительности записи плюс небольшой запас. Минимальный порог установлен на 12 секунд (примерно 1200 кадров). При окне короче 8 секунд модель начинает зацикливаться и повторять одно слово по три, десять раз. На 12 секундах короткая фраза всё равно распознаётся за секунду, так что порог ничего не стоит.

Два обязательных условия, без которых оптимизация ломается

Первое: отключение таймкодов при суженном окне. Это не опция, а условие корректности. С включёнными таймкодами модель на узком окне «переливает» время за границы записи, придумывает продолжение, выдаёт дубли и делает повторные проходы по 6 от 17 секунд. То есть работает медленнее, чем вообще без оптимизации.

without_timestamps = frames is not None  # развязывать нельзя

Второе: схлопывание остаточных повторов на уровне текста. Даже с отключёнными таймкодами изредка проскакивает самоповтор. Первая версия проекта решала это повторным распознаванием на полном окне, что возвращало задержку до 7 секунд. Текущее решение проще: SequenceMatcher проверяет, делится ли строка на 2 или 3 почти одинаковые части (совпадение выше 0.9), и оставляет одну копию.

Как проект справляется с длинной диктовкой?

Для коротких реплик сужение окна решает всё. Но 40 секунд речи это 40 секунд аудио, и физику не обманешь.

WhisperType распознаёт во время записи. Отдельный поток каждые 0,25 секунды проверяет, накопилось ли 8 секунд аудио, отрезает кусок и отправляет его в модель. К моменту, когда вы отпустите горячую клавишу, остаётся только короткий хвост.

Два критичных нюанса:

  • Резать можно только по паузе. Разрез посреди слова задваивает его на стыке кусков. Функция find_cut_point ищет самый тихий фрейм (отрезок по 100 мс), оглядываясь назад на 6 секунд от целевой точки. Если паузы нет, функция честно возвращает «резать рано».
  • Жёсткий предел куска 25 секунд, не 29. Формула: 30 (полное окно) минус 4 (запас) минус 1. При куске в 26 секунд окно перестаёт сужаться, кусок уходит полным проходом с таймкодами, и пользователь видит зависший индикатор. Этот баг существовал до версии 1.1.2, сейчас защищён тестом.
Как это выглядит на практике

Вы открываете браузер, ставите курсор в поле комментария или в редактор Дзена. Нажимаете горячую клавишу, говорите: «Сегодня расскажу, как настроить голосовой ввод в Windows 10 без интернета и подписки, используя открытую модель Whisper». Нажимаете клавишу ещё раз. Через секунду текст появляется в поле ввода, без ошибок в русских словах, без задержки на отправку в облако. Для короткой реплики «ок, сделаю» задержка составляет около одной секунды вместо четырёх у неоптимизированного Whisper.

Частые ошибки

Не уменьшайте минимальное окно ниже 12 секунд. Соблазн велик: зачем слову «привет» двенадцать секунд? Затем, что на окне короче 8 секунд модель начинает зацикливаться: «Привет. Привет. Привет.» до десяти раз. Двенадцать секунд на скорость короткой фразы не влияют.

Не включайте таймкоды при суженном окне. Это не «немного ухудшает результат», а ломает распознавание: задержки вырастают до 6 от 17 секунд, модель начинает галлюцинировать (уверенно выдумывать то, чего вы не говорили).

Не задирайте размер куска при потоковой нарезке выше 25 секунд. При 26 секундах окно перестаёт сужаться, и вы теряете весь выигрыш в скорости.

Не забудьте про модель при первом запуске. Загрузка 1,6 ГБ может занять время на медленном соединении. Без скачанной модели приложение не заработает, но после загрузки интернет больше не нужен.

Что делать с этим прямо сейчас?

Авторам Дзена: голосовой ввод в Windows 10 через WhisperType позволяет диктовать черновики статей прямо в редактор. Текст появляется там, где стоит курсор. Для тех, кому печатать физически некомфортно или кто думает вслух быстрее, чем пальцами, это рабочий инструмент, а не игрушка.

Копирайтерам и маркетологам: снимается зависимость от облачных сервисов диктовки вроде Wispr Flow, которые требуют подписку и отправляют голос на чужой сервер. Конфиденциальность при работе с NDA-текстами или клиентскими данными больше не повод отказываться от диктовки.

Предпринимателям и менеджерам: решение работает полностью офлайн. Нет подписки, нет ежемесячных платежей, нет зависимости от доступности зарубежного сервиса. В условиях, когда часть облачных сервисов ограничивает доступ из РФ, локальный инструмент решает вопрос надёжности.

Мнение редакции dzen.guru

Я протестировал несколько обёрток над Whisper для диктовки, и главное отличие WhisperType от большинства из них именно в оптимизации под CPU. Большинство решений просто «прикручивают Whisper» и получают те самые 4 секунды на каждую реплику, что убивает весь смысл голосового ввода.

Честная оговорка: проект работает только под Windows, только x64. Пунктуацию Whisper расставляет сам, и иногда не так, как хотелось бы. Для финального текста статьи ручная правка всё равно нужна. Но для черновиков, заметок, комментариев и сообщений в мессенджерах результат уже рабочий.

Если вы на Mac или Linux, это решение пока не для вас. Из альтернатив в РФ для голосового ввода можно попробовать встроенные средства YandexGPT (в Алисе), но они облачные, и задержки на стороне сервера тоже заметны.

Голосовой ввод в Windows 10 без облака, подписки и четырёхсекундных пауз после каждой фразы: это то, что WhisperType уже делает в версии 1.3.1. Скачайте, продиктуйте первый абзац и посмотрите, сколько времени вы на самом деле тратили на набор текста руками.

Пишете на Дзене и хотите ускорить работу с текстом?

В dzen.guru мы собираем рабочие инструменты для авторов, от нейросетей для генерации до приёмов продвижения. Подпишитесь, чтобы не пропустить разборы.

Перейти на dzen.guru
Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься
ai

Большие языковые модели пропускают джейлбрейки: какие риски это создаёт и как защититься

Большие языковые модели (LLM, нейросети, которые генерируют текст и код по запросу) обучены отказывать на опасные вопросы, но злоумышленники научились обходить…

6 мин
Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API
ai

Self hosted LLM vs облако: год в Selectel показал, когда своя модель выгоднее API

Контекст — это не про IQ модели, а про безопасность данных: если код нельзя отправить наружу, выбор делается не между «лучшей» и «худшей» моделью, а между…

5 мин
ai

OpenAI впервые остановила новую модель: та научилась взламывать системы без человека

OpenAI второго июня приостановила внутреннюю разработку новой модели Astra, которая по результатам собственных проверок компании может обладать критическими…

4 мин