Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Stable Audio 3 Portable: запускаем генерацию музыки с ИИ локально на своём ПК!

Мы протестировали новую портативную сборку Stable Audio 3 от Neurogen. Это семейство открытых моделей для генерации аудио, которое теперь можно запускать на своём компьютере под Windows без сложных манипуляций с pip, venv и CUDA.

Что входит в сборку

  • Stable Audio 3 Small-Music (433M) — генерация музыки длительностью до 120 секунд.
  • Stable Audio 3 Small-SFX (433M) — создание звуковых эффектов, тоже до 120 секунд.
  • Stable Audio 3 Medium (1.4B) — флагманская модель, способная генерировать до 380 секунд аудио.
  • T5Gemma — текстовый кодировщик, вшит в кеш и работает полностью офлайн.
  • Gradio Web UI и полноценный CLI.
  • Готовые запускающие скрипты под каждую модель.
  • Автоопределение SOCKS5-прокси для пользователей, которым нужна смена региона.
  • Утилита hf_transfer для быстрых параллельных загрузок весов.

Как начать пользоваться

  1. Распакуйте архив в любую папку, предпочтительно без пробелов в пути.
  2. Один раз запустите setup.bat. Он установит зависимости и скачает модели (потребуется около 17 ГБ).
  3. Выберите модель:
    • Запустите gui.bat, чтобы увидеть меню выбора: 1 — музыка, 2 — звуки, 3 — medium.
    • Или используйте конкретный ярлык: gui-music.bat для музыки, gui-sfx.bat для звуковых эффектов, gui-medium.bat для флагманской модели (ей нужно 6–7 ГБ VRAM). После этого откроется браузер с интерфейсом.
  4. Альтернативный вариант — запуск через консоль. Пример команды:

    run.bat --model small-music -p "lo-fi beat" --duration 30 -o output\beat.wav

Дополнительные инструменты в сборке

  • download.bat — докачка или восстановление файлов весов моделей.
  • fix_pagefile.bat — исправление ошибки «файл подкачки слишком мал» (WinError 1455), которая может возникать при загрузке моделей, если используется маленький фиксированный файл подкачки.

Системные требования

  • Windows 10/11 (64-bit).
  • Видеокарта NVIDIA с поддержкой CUDA 12.6.
  • Для Small-моделей достаточно 4 ГБ VRAM. Модель Medium требует 6–7 ГБ VRAM (в 4 ГБ не поместится).
  • Около 25 ГБ свободного места на диске (17 ГБ модели и примерно 5 ГБ окружение).
  • Аккаунт на Hugging Face и принятые лицензии для всех трёх страниц используемых моделей (ссылки есть в README).

Важный нюанс: библиотека flash-attn под Windows устанавливается некорректно, поэтому модель Medium работает через fallback-механизм внимания. Это немного медленнее, но полностью стабильно. Small-моделям flash-attn не требуется совсем.

Скачать сборку можно по ссылке: Stable Audio 3 Portable.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.