Транскрибация речи бесплатно и без облака: ставим Whisper на свой ПК за 30 минут
Автор Дзена записал подкаст, провёл созвон или снял ролик, и теперь ему нужен текст: для статьи, субтитров или протокола встречи, а платить за онлайн-сервис не хочется.

Ниже пошаговая инструкция, как поставить на свой компьютер с Windows нейросеть Whisper от OpenAI (создатели ChatGPT) и получить транскрибацию речи в текст, не отправляя файлы ни на какой сервер.
Whisper — открытая модель (опенсорс), она работает локально: аудио не уходит в облако, а результат появляется в виде готового текстового файла и файла субтитров. Для авторов, которые работают с чужой речью или конфиденциальными записями, это принципиально.
Whisper распознаёт русский язык и десятки других. Разработала его компания OpenAI. Модель бесплатна, скачивается один раз и дальше работает без интернета. Транскрибация речи через Whisper подходит для трёх главных задач: превратить запись лекции или подкаста в текст, создать субтитры к ролику, получить протокол встречи, который потом можно скормить любому чат-боту для анализа и краткого пересказа.
Единственное условие: придётся один раз настроить окружение. Звучит страшнее, чем есть, сейчас разберём по шагам.
Что понадобится?
- Компьютер с Windows 10 или 11
- Свободное место на диске: от 1 до 6 ГБ в зависимости от выбранной модели
- Подключение к интернету на этапе установки (после установки не нужно)
- Аудио- или видеофайл, который нужно расшифровать
- 20–30 минут времени на первую настройку
Пошаговая инструкция
1. Установите Python
Whisper написан на Python, поэтому без него не запустится. Подойдут версии от 3.8 до 3.11.
Скачайте установщик с официального сайта:
https://www.python.org/downloads/windows/
При установке обязательно поставьте галочку «Add python.exe to PATH». Без этого система не увидит Python из командной строки, и все дальнейшие команды будут выдавать ошибку.
2. Установите FFmpeg
FFmpeg — это бесплатная утилита для работы с аудио и видео. Whisper использует её, чтобы открывать файлы в любых форматах.
Скачайте архив:
https://www.gyan.dev/ffmpeg/builds/ffmpeg-release-essentials.zip
У FFmpeg нет привычного установщика, поэтому действия ручные:
- Распакуйте архив
- Переименуйте папку в «FFmpeg» и перенесите её в корень диска C (путь до подпапки bin должен выглядеть так:
C:\FFmpeg\bin) - Откройте в Windows поиск, наберите «Изменение переменных среды» и откройте найденное окно
- Найдите переменную Path, откройте её двойным щелчком и добавьте новую строку:
C:\FFmpeg\bin - Сохраните
Проверьте результат: откройте командную строку и введите:
ffmpeg
Если появилось описание версии, всё готово.
3. Установите Whisper
Откройте командную строку и введите:
pip install -U openai-whisper
Дождитесь окончания загрузки. Проверьте установку командой:
whisper
Если система ответила справкой по использованию, Whisper на месте.
4. Запустите транскрибацию речи
Положите аудио- или видеофайл в удобную папку. Откройте командную строку, перейдите в эту папку и запустите распознавание:
cd C:\моя_папка
whisper "запись.m4a" --model large --language Russian
При первом запуске Whisper скачает выбранную модель (это разовое действие). Затем начнётся распознавание.
После завершения в той же папке появятся файлы с результатом: текстовый файл (.txt) и файл субтитров (.srt).
Какую модель выбрать?
Whisper предлагает несколько моделей разного размера. Чем крупнее модель, тем точнее результат, но тем больше она весит и дольше работает:
- tiny — самая лёгкая, быстрая, но с заметными ошибками
- base — чуть точнее, подходит для черновиков
- small — хороший баланс скорости и качества
- medium — заметно точнее, особенно на русском языке
- large — максимальное качество, но требует больше ресурсов
Для русского языка рекомендую начинать со small или medium. Если качество не устроит, переключитесь на large.
Допустим, вы записали 15-минутный созвон с заказчиком в файл meeting.m4a. Открываете командную строку и вводите:
cd C:\Records
whisper "meeting.m4a" --model medium --language Russian
Через несколько минут в папке C:\Records появляется файл meeting.txt с полным текстом разговора и файл meeting.srt с субтитрами, размеченными по времени. Текст можно скопировать в ChatGPT или YandexGPT с промптом (запросом к нейросети): «Сделай краткий протокол встречи с перечнем договорённостей». Получается готовый документ без ручного набора.
- Забыли галочку «Add to PATH» при установке Python. Самая частая проблема: команда
pipне распознаётся. Решение: переустановите Python с включённой галочкой. - Не добавили FFmpeg в переменные среды. Whisper запускается, но падает с ошибкой при попытке открыть файл. Вернитесь к шагу 2 и проверьте путь.
- Выбрали модель large на слабом компьютере. Без дискретной видеокарты модель large может обрабатывать минуту записи по 10–15 минут. Начните с small или medium.
- Не указали
--language Russian. Без явного указания языка Whisper пытается определить его автоматически и иногда ошибается, выдавая транслит или распознавая речь как украинскую. - Путь к файлу содержит кириллицу или пробелы. Это может вызвать ошибку. Кладите файлы в папку с латинским названием без пробелов.
Что делать с результатом, по ролям
Автору Дзена. Записали голосовой черновик статьи — получили текст. Записали интервью — получили расшифровку для цитат. Транскрибация речи экономит час-два ручного набора на каждом таком материале.
Маркетологу. Протоколы созвонов с клиентом, расшифровки вебинаров для лендингов, субтитры к рекламным роликам. Всё бесплатно и без передачи данных на сторонние серверы.
Предпринимателю. Записи совещаний превращаются в текст, который ИИ-ассистент может свернуть в список задач. Файлы не уходят в облако, это критично, если обсуждаются коммерческие детали.
Whisper — не единственный вариант. Транскрибацию речи предлагают и онлайн-сервисы: «Яндекс SpeechKit», сервисы на базе Google, платные решения вроде «Otter.ai». Но у локальной установки есть козырь, который перевешивает всё: данные остаются на вашем компьютере.
По моим наблюдениям, модель medium даёт вполне рабочее качество на русском: ошибки есть, но текст читаем и годится как черновик. Модель large заметно лучше, однако на ноутбуке без видеокарты ожидание затягивается.
Честная оговорка: Whisper не расставляет знаки препинания идеально и не различает спикеров. Если вам нужен протокол с пометками «кто сказал», придётся дорабатывать вручную или использовать дополнительные инструменты.
Пишете на Дзене и хотите ускорить работу с контентом?
В dzen.guru мы собираем проверенные приёмы и инструменты для авторов, которые зарабатывают на текстах.
Попробовать dzen.guruЛокальная транскрибация речи через Whisper занимает 20 минут на настройку и потом работает без подписок, без лимитов, без отправки файлов куда-либо. Для автора, который регулярно переводит голос в текст, это один из самых практичных бесплатных инструментов прямо сейчас.

Основатель dzen.guru. Эксперт по монетизации и продвижению на Дзен. Автор курса «Старт на Дзен 2026».
Читайте также

Искусственный интеллект и светофоры: почему выбор целевой функции важнее алгоритма
Стоп. Заданный H1 и архетип (how-to с пошаговой инструкцией) не совпадают с содержанием оригинала. Оригинал — это аналитическая статья о том, почему…

Альтернатива ChatGPT в 8 раз дешевле: как не сломать бота китайскими иероглифами
Платить за языковую модель в восемь раз меньше и не потерять качество можно, но китайская модель способна вставить иероглифы прямо в русский текст, и к этому…

PCA, t-SNE и UMAP: какой метод визуализации данных сохраняет структуру, а какой сливает кластеры
Компания или проект, к которому привязан этот материал, не названы в источнике: текст представляет собой обучающий разбор трёх алгоритмов снижения размерности…
Комментарии