Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Stable Audio 3 Portable: запускаем генерацию музыки с ИИ локально на своём ПК!

Мы протестировали новую портативную сборку Stable Audio 3 от Neurogen. Это семейство открытых моделей для генерации аудио, которое теперь можно запускать на своём компьютере под Windows без сложных манипуляций с pip, venv и CUDA.

Что входит в сборку

  • Stable Audio 3 Small-Music (433M) — генерация музыки длительностью до 120 секунд.
  • Stable Audio 3 Small-SFX (433M) — создание звуковых эффектов, тоже до 120 секунд.
  • Stable Audio 3 Medium (1.4B) — флагманская модель, способная генерировать до 380 секунд аудио.
  • T5Gemma — текстовый кодировщик, вшит в кеш и работает полностью офлайн.
  • Gradio Web UI и полноценный CLI.
  • Готовые запускающие скрипты под каждую модель.
  • Автоопределение SOCKS5-прокси для пользователей, которым нужна смена региона.
  • Утилита hf_transfer для быстрых параллельных загрузок весов.

Как начать пользоваться

  1. Распакуйте архив в любую папку, предпочтительно без пробелов в пути.
  2. Один раз запустите setup.bat. Он установит зависимости и скачает модели (потребуется около 17 ГБ).
  3. Выберите модель:
    • Запустите gui.bat, чтобы увидеть меню выбора: 1 — музыка, 2 — звуки, 3 — medium.
    • Или используйте конкретный ярлык: gui-music.bat для музыки, gui-sfx.bat для звуковых эффектов, gui-medium.bat для флагманской модели (ей нужно 6–7 ГБ VRAM). После этого откроется браузер с интерфейсом.
  4. Альтернативный вариант — запуск через консоль. Пример команды:

    run.bat --model small-music -p "lo-fi beat" --duration 30 -o output\beat.wav

Дополнительные инструменты в сборке

  • download.bat — докачка или восстановление файлов весов моделей.
  • fix_pagefile.bat — исправление ошибки «файл подкачки слишком мал» (WinError 1455), которая может возникать при загрузке моделей, если используется маленький фиксированный файл подкачки.

Системные требования

  • Windows 10/11 (64-bit).
  • Видеокарта NVIDIA с поддержкой CUDA 12.6.
  • Для Small-моделей достаточно 4 ГБ VRAM. Модель Medium требует 6–7 ГБ VRAM (в 4 ГБ не поместится).
  • Около 25 ГБ свободного места на диске (17 ГБ модели и примерно 5 ГБ окружение).
  • Аккаунт на Hugging Face и принятые лицензии для всех трёх страниц используемых моделей (ссылки есть в README).

Важный нюанс: библиотека flash-attn под Windows устанавливается некорректно, поэтому модель Medium работает через fallback-механизм внимания. Это немного медленнее, но полностью стабильно. Small-моделям flash-attn не требуется совсем.

Скачать сборку можно по ссылке: Stable Audio 3 Portable.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.