Портативная Windows-сборка WhisperX от Neurogen: транскрипция и диаризация без облаков и прав администратора!
Разработчик Neurogen выпустил портативную Windows-сборку WhisperX. Это быстрое распознавание речи на базе Whisper с пословной разметкой времени и разделением говорящих.
Установка выполняется одной кнопкой, не требует прав администратора, а также установки CUDA Toolkit или Anaconda. После инсталляции папку можно скопировать на любой Windows-компьютер с видеокартой NVIDIA и просто запустить.
Функционал
- Расшифровка интервью, лекций, подкастов
- Создание субтитров (SRT/VTT) к видео и стримам
- Разделение по говорящим в записях встреч и созвонов
- Всё работает локально, данные не отправляются в облако
В отличие от веб-сервисов, решение бесплатное, неограниченное по длине аудио и полностью приватное.
Системные требования
- Windows 10/11, 64-бит
- NVIDIA с драйвером R555+ (RTX или GTX 10+ серии) обеспечит ускорение в десятки раз
- Возможна работа на CPU, но медленнее
- Минимум 8 ГБ ОЗУ, для крупных моделей рекомендовано 16+ ГБ
- Около 6 ГБ на диске после установки и дополнительное место под модели
Установка
- Скачайте репозиторий ZIP-архивом или командой
git clone https://github.com/rzaev77/whisperx-portable.git - Распакуйте в любую папку. Важное условие: путь не должен содержать кириллицу.
- Запустите
setup.bat. Первый запуск загрузит около 3–5 ГБ и займёт 10–30 минут. - После завершения для старта интерфейса используйте
WhisperX.bat.
Если видеокарты NVIDIA нет, перед setup.bat выполните: powershell -ExecutionPolicy Bypass -File tools\setup.ps1 -Backend cpu
Использование
Через GUI: выберите аудио или видео, укажите модель (large-v3 для качества, medium для скорости), язык (например ru) и нажмите «Транскрибировать». Результаты появятся в папке output/.
Через drag-and-drop: перетащите файл на WhisperX-CLI.bat, и он обработается с настройками по умолчанию.
Из консоли: команда выглядит так: WhisperX-CLI.bat input.mp3 --model large-v3 --language ru --output_format srt
Полезные советы
- Модели:
tiny→base→small→medium→large-v3. Чем крупнее, тем выше точность и ниже скорость. Для русского языка оптималенlarge-v3. - При нехватке VRAM (ошибка
CUDA out of memory): установитеcompute_type=int8иbatch_size=4в GUI. Это позволит работать даже на 6 ГБ. - Скорость: на RTX 3060 час аудио обрабатывается примерно за 3–5 минут с моделью
large-v3иcompute_type=float16. На CPU тот же файл займёт до 30–60 минут. - Для высокого качества: включите опцию «Выравнивание (временные метки слов)», чтобы получить точные тайминги для субтитров.
- Форматы вывода:
srtдля субтитров,txtдля простого текста,jsonдля машинной обработки с таймкодами и метками говорящих. - Портативность: после
setup.batпапку можно скопировать на флешку и использовать на другом компьютере с NVIDIA без переустановки.
Диаризация (разделение говорящих)
Чтобы получить разбивку вида «Спикер 1: …», «Спикер 2: …», необходимо:
- Зарегистрироваться на huggingface.co
- Принять соглашение на странице модели pyannote
- Создать токен с правом чтения по ссылке: https://huggingface.co/settings/tokens
- Вставить токен в поле «Токен HF» в GUI и активировать галку «Включить диаризацию».
Токен сохранится в config.json рядом с программой, и повторять ввод не потребуется.
Решение проблем
- `Could not load library cudnn_*.dll` — драйвер NVIDIA старее версии R555. Обновите его с nvidia.com или переустановите сборку с ключом
-Backend cpu. - `CUDA out of memory` — попробуйте модель меньшего размера,
compute_type=int8,batch_size=4. - Кириллица в консоли отображается как `???` — это случается на старых версиях Windows без полной поддержки UTF-8. На работу программы это не влияет.
- Полный сброс сборки: выполните
powershell -ExecutionPolicy Bypass -File tools\setup.ps1 -Force. Это очистит папкуruntime/и переустановит компоненты.
Детальная информация — в файле docs/TROUBLESHOOTING.md.
Исходный код и выпуск доступны на GitHub.

