Игорь Градов
Игорь Градов
5 мин
ai

Транскрибация речи бесплатно и без облака: ставим Whisper на свой ПК за 30 минут

Автор Дзена записал подкаст, провёл созвон или снял ролик, и теперь ему нужен текст: для статьи, субтитров или протокола встречи, а платить за онлайн-сервис не хочется.

Транскрибация речи бесплатно и без облака: ставим Whisper на свой ПК за 30 минут

Ниже пошаговая инструкция, как поставить на свой компьютер с Windows нейросеть Whisper от OpenAI (создатели ChatGPT) и получить транскрибацию речи в текст, не отправляя файлы ни на какой сервер.

Почему это важно

Whisper — открытая модель (опенсорс), она работает локально: аудио не уходит в облако, а результат появляется в виде готового текстового файла и файла субтитров. Для авторов, которые работают с чужой речью или конфиденциальными записями, это принципиально.

Whisper распознаёт русский язык и десятки других. Разработала его компания OpenAI. Модель бесплатна, скачивается один раз и дальше работает без интернета. Транскрибация речи через Whisper подходит для трёх главных задач: превратить запись лекции или подкаста в текст, создать субтитры к ролику, получить протокол встречи, который потом можно скормить любому чат-боту для анализа и краткого пересказа.

Единственное условие: придётся один раз настроить окружение. Звучит страшнее, чем есть, сейчас разберём по шагам.

Что понадобится?

  • Компьютер с Windows 10 или 11
  • Свободное место на диске: от 1 до 6 ГБ в зависимости от выбранной модели
  • Подключение к интернету на этапе установки (после установки не нужно)
  • Аудио- или видеофайл, который нужно расшифровать
  • 20–30 минут времени на первую настройку

Пошаговая инструкция

1. Установите Python

Whisper написан на Python, поэтому без него не запустится. Подойдут версии от 3.8 до 3.11.

Скачайте установщик с официального сайта:

https://www.python.org/downloads/windows/

При установке обязательно поставьте галочку «Add python.exe to PATH». Без этого система не увидит Python из командной строки, и все дальнейшие команды будут выдавать ошибку.

2. Установите FFmpeg

FFmpeg — это бесплатная утилита для работы с аудио и видео. Whisper использует её, чтобы открывать файлы в любых форматах.

Скачайте архив:

https://www.gyan.dev/ffmpeg/builds/ffmpeg-release-essentials.zip

У FFmpeg нет привычного установщика, поэтому действия ручные:

  • Распакуйте архив
  • Переименуйте папку в «FFmpeg» и перенесите её в корень диска C (путь до подпапки bin должен выглядеть так: C:\FFmpeg\bin)
  • Откройте в Windows поиск, наберите «Изменение переменных среды» и откройте найденное окно
  • Найдите переменную Path, откройте её двойным щелчком и добавьте новую строку: C:\FFmpeg\bin
  • Сохраните

Проверьте результат: откройте командную строку и введите:

ffmpeg

Если появилось описание версии, всё готово.

3. Установите Whisper

Откройте командную строку и введите:

pip install -U openai-whisper

Дождитесь окончания загрузки. Проверьте установку командой:

whisper

Если система ответила справкой по использованию, Whisper на месте.

4. Запустите транскрибацию речи

Положите аудио- или видеофайл в удобную папку. Откройте командную строку, перейдите в эту папку и запустите распознавание:

cd C:\моя_папка
whisper "запись.m4a" --model large --language Russian

При первом запуске Whisper скачает выбранную модель (это разовое действие). Затем начнётся распознавание.

После завершения в той же папке появятся файлы с результатом: текстовый файл (.txt) и файл субтитров (.srt).

Какую модель выбрать?

Whisper предлагает несколько моделей разного размера. Чем крупнее модель, тем точнее результат, но тем больше она весит и дольше работает:

  • tiny — самая лёгкая, быстрая, но с заметными ошибками
  • base — чуть точнее, подходит для черновиков
  • small — хороший баланс скорости и качества
  • medium — заметно точнее, особенно на русском языке
  • large — максимальное качество, но требует больше ресурсов

Для русского языка рекомендую начинать со small или medium. Если качество не устроит, переключитесь на large.

Как это применить

Допустим, вы записали 15-минутный созвон с заказчиком в файл meeting.m4a. Открываете командную строку и вводите:

cd C:\Records
whisper "meeting.m4a" --model medium --language Russian

Через несколько минут в папке C:\Records появляется файл meeting.txt с полным текстом разговора и файл meeting.srt с субтитрами, размеченными по времени. Текст можно скопировать в ChatGPT или YandexGPT с промптом (запросом к нейросети): «Сделай краткий протокол встречи с перечнем договорённостей». Получается готовый документ без ручного набора.

Частые ошибки
  • Забыли галочку «Add to PATH» при установке Python. Самая частая проблема: команда pip не распознаётся. Решение: переустановите Python с включённой галочкой.
  • Не добавили FFmpeg в переменные среды. Whisper запускается, но падает с ошибкой при попытке открыть файл. Вернитесь к шагу 2 и проверьте путь.
  • Выбрали модель large на слабом компьютере. Без дискретной видеокарты модель large может обрабатывать минуту записи по 10–15 минут. Начните с small или medium.
  • Не указали --language Russian. Без явного указания языка Whisper пытается определить его автоматически и иногда ошибается, выдавая транслит или распознавая речь как украинскую.
  • Путь к файлу содержит кириллицу или пробелы. Это может вызвать ошибку. Кладите файлы в папку с латинским названием без пробелов.

Что делать с результатом, по ролям

Автору Дзена. Записали голосовой черновик статьи — получили текст. Записали интервью — получили расшифровку для цитат. Транскрибация речи экономит час-два ручного набора на каждом таком материале.

Маркетологу. Протоколы созвонов с клиентом, расшифровки вебинаров для лендингов, субтитры к рекламным роликам. Всё бесплатно и без передачи данных на сторонние серверы.

Предпринимателю. Записи совещаний превращаются в текст, который ИИ-ассистент может свернуть в список задач. Файлы не уходят в облако, это критично, если обсуждаются коммерческие детали.

Мнение редакции dzen.guru

Whisper — не единственный вариант. Транскрибацию речи предлагают и онлайн-сервисы: «Яндекс SpeechKit», сервисы на базе Google, платные решения вроде «Otter.ai». Но у локальной установки есть козырь, который перевешивает всё: данные остаются на вашем компьютере.

По моим наблюдениям, модель medium даёт вполне рабочее качество на русском: ошибки есть, но текст читаем и годится как черновик. Модель large заметно лучше, однако на ноутбуке без видеокарты ожидание затягивается.

Честная оговорка: Whisper не расставляет знаки препинания идеально и не различает спикеров. Если вам нужен протокол с пометками «кто сказал», придётся дорабатывать вручную или использовать дополнительные инструменты.

Пишете на Дзене и хотите ускорить работу с контентом?

В dzen.guru мы собираем проверенные приёмы и инструменты для авторов, которые зарабатывают на текстах.

Попробовать dzen.guru

Локальная транскрибация речи через Whisper занимает 20 минут на настройку и потом работает без подписок, без лимитов, без отправки файлов куда-либо. Для автора, который регулярно переводит голос в текст, это один из самых практичных бесплатных инструментов прямо сейчас.

Поделиться:TelegramVK
Игорь Градов
Игорь Градов

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».

Комментарии

Читайте также

Искусственный интеллект и светофоры: почему выбор целевой функции важнее алгоритма
ai

Искусственный интеллект и светофоры: почему выбор целевой функции важнее алгоритма

Стоп. Заданный H1 и архетип (how-to с пошаговой инструкцией) не совпадают с содержанием оригинала. Оригинал — это аналитическая статья о том, почему…

7 мин
Альтернатива ChatGPT в 8 раз дешевле: как не сломать бота китайскими иероглифами
ai

Альтернатива ChatGPT в 8 раз дешевле: как не сломать бота китайскими иероглифами

Платить за языковую модель в восемь раз меньше и не потерять качество можно, но китайская модель способна вставить иероглифы прямо в русский текст, и к этому…

6 мин
PCA, t-SNE и UMAP: какой метод визуализации данных сохраняет структуру, а какой сливает кластеры
ai

PCA, t-SNE и UMAP: какой метод визуализации данных сохраняет структуру, а какой сливает кластеры

Компания или проект, к которому привязан этот материал, не названы в источнике: текст представляет собой обучающий разбор трёх алгоритмов снижения размерности…

5 мин