Stable Audio 3 Portable: запускаем генерацию музыки с ИИ локально на своём ПК!
Мы протестировали новую портативную сборку Stable Audio 3 от Neurogen. Это семейство открытых моделей для генерации аудио, которое теперь можно запускать на своём компьютере под Windows без сложных манипуляций с pip, venv и CUDA.
Что входит в сборку
- Stable Audio 3 Small-Music (433M) — генерация музыки длительностью до 120 секунд.
- Stable Audio 3 Small-SFX (433M) — создание звуковых эффектов, тоже до 120 секунд.
- Stable Audio 3 Medium (1.4B) — флагманская модель, способная генерировать до 380 секунд аудио.
- T5Gemma — текстовый кодировщик, вшит в кеш и работает полностью офлайн.
- Gradio Web UI и полноценный CLI.
- Готовые запускающие скрипты под каждую модель.
- Автоопределение SOCKS5-прокси для пользователей, которым нужна смена региона.
- Утилита hf_transfer для быстрых параллельных загрузок весов.
Как начать пользоваться
- Распакуйте архив в любую папку, предпочтительно без пробелов в пути.
- Один раз запустите
setup.bat. Он установит зависимости и скачает модели (потребуется около 17 ГБ). - Выберите модель:
- Запустите
gui.bat, чтобы увидеть меню выбора: 1 — музыка, 2 — звуки, 3 — medium. - Или используйте конкретный ярлык:
gui-music.batдля музыки,gui-sfx.batдля звуковых эффектов,gui-medium.batдля флагманской модели (ей нужно 6–7 ГБ VRAM). После этого откроется браузер с интерфейсом.
- Запустите
- Альтернативный вариант — запуск через консоль. Пример команды:
run.bat --model small-music -p "lo-fi beat" --duration 30 -o output\beat.wav
Дополнительные инструменты в сборке
download.bat— докачка или восстановление файлов весов моделей.fix_pagefile.bat— исправление ошибки «файл подкачки слишком мал» (WinError 1455), которая может возникать при загрузке моделей, если используется маленький фиксированный файл подкачки.
Системные требования
- Windows 10/11 (64-bit).
- Видеокарта NVIDIA с поддержкой CUDA 12.6.
- Для Small-моделей достаточно 4 ГБ VRAM. Модель Medium требует 6–7 ГБ VRAM (в 4 ГБ не поместится).
- Около 25 ГБ свободного места на диске (17 ГБ модели и примерно 5 ГБ окружение).
- Аккаунт на Hugging Face и принятые лицензии для всех трёх страниц используемых моделей (ссылки есть в README).
Важный нюанс: библиотека flash-attn под Windows устанавливается некорректно, поэтому модель Medium работает через fallback-механизм внимания. Это немного медленнее, но полностью стабильно. Small-моделям flash-attn не требуется совсем.
Скачать сборку можно по ссылке: Stable Audio 3 Portable.

