Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Портативная Windows-сборка WhisperX от Neurogen: транскрипция и диаризация без облаков и прав администратора!

Разработчик Neurogen выпустил портативную Windows-сборку WhisperX. Это быстрое распознавание речи на базе Whisper с пословной разметкой времени и разделением говорящих.

Установка выполняется одной кнопкой, не требует прав администратора, а также установки CUDA Toolkit или Anaconda. После инсталляции папку можно скопировать на любой Windows-компьютер с видеокартой NVIDIA и просто запустить.

Функционал

  • Расшифровка интервью, лекций, подкастов
  • Создание субтитров (SRT/VTT) к видео и стримам
  • Разделение по говорящим в записях встреч и созвонов
  • Всё работает локально, данные не отправляются в облако

В отличие от веб-сервисов, решение бесплатное, неограниченное по длине аудио и полностью приватное.

Системные требования

  • Windows 10/11, 64-бит
  • NVIDIA с драйвером R555+ (RTX или GTX 10+ серии) обеспечит ускорение в десятки раз
  • Возможна работа на CPU, но медленнее
  • Минимум 8 ГБ ОЗУ, для крупных моделей рекомендовано 16+ ГБ
  • Около 6 ГБ на диске после установки и дополнительное место под модели

Установка

  1. Скачайте репозиторий ZIP-архивом или командой git clone https://github.com/rzaev77/whisperx-portable.git
  2. Распакуйте в любую папку. Важное условие: путь не должен содержать кириллицу.
  3. Запустите setup.bat. Первый запуск загрузит около 3–5 ГБ и займёт 10–30 минут.
  4. После завершения для старта интерфейса используйте WhisperX.bat.

Если видеокарты NVIDIA нет, перед setup.bat выполните: powershell -ExecutionPolicy Bypass -File tools\setup.ps1 -Backend cpu

Использование

Через GUI: выберите аудио или видео, укажите модель (large-v3 для качества, medium для скорости), язык (например ru) и нажмите «Транскрибировать». Результаты появятся в папке output/.

Через drag-and-drop: перетащите файл на WhisperX-CLI.bat, и он обработается с настройками по умолчанию.

Из консоли: команда выглядит так: WhisperX-CLI.bat input.mp3 --model large-v3 --language ru --output_format srt

Полезные советы

  • Модели: tinybasesmallmediumlarge-v3. Чем крупнее, тем выше точность и ниже скорость. Для русского языка оптимален large-v3.
  • При нехватке VRAM (ошибка CUDA out of memory): установите compute_type=int8 и batch_size=4 в GUI. Это позволит работать даже на 6 ГБ.
  • Скорость: на RTX 3060 час аудио обрабатывается примерно за 3–5 минут с моделью large-v3 и compute_type=float16. На CPU тот же файл займёт до 30–60 минут.
  • Для высокого качества: включите опцию «Выравнивание (временные метки слов)», чтобы получить точные тайминги для субтитров.
  • Форматы вывода: srt для субтитров, txt для простого текста, json для машинной обработки с таймкодами и метками говорящих.
  • Портативность: после setup.bat папку можно скопировать на флешку и использовать на другом компьютере с NVIDIA без переустановки.

Диаризация (разделение говорящих)

Чтобы получить разбивку вида «Спикер 1: …», «Спикер 2: …», необходимо:

  1. Зарегистрироваться на huggingface.co
  2. Принять соглашение на странице модели pyannote
  3. Создать токен с правом чтения по ссылке: https://huggingface.co/settings/tokens
  4. Вставить токен в поле «Токен HF» в GUI и активировать галку «Включить диаризацию».

Токен сохранится в config.json рядом с программой, и повторять ввод не потребуется.

Решение проблем

  • `Could not load library cudnn_*.dll` — драйвер NVIDIA старее версии R555. Обновите его с nvidia.com или переустановите сборку с ключом -Backend cpu.
  • `CUDA out of memory` — попробуйте модель меньшего размера, compute_type=int8, batch_size=4.
  • Кириллица в консоли отображается как `???` — это случается на старых версиях Windows без полной поддержки UTF-8. На работу программы это не влияет.
  • Полный сброс сборки: выполните powershell -ExecutionPolicy Bypass -File tools\setup.ps1 -Force. Это очистит папку runtime/ и переустановит компоненты.

Детальная информация — в файле docs/TROUBLESHOOTING.md.

Исходный код и выпуск доступны на GitHub.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.