ByteDance представила Seed Audio 1.0: ИИ-модель генерирует целые звуковые сцены за один проход!
Компания ByteDance открыла доступ к Seed Audio 1.0 — аудиомодели, способной сгенерировать за один проход целую звуковую сцену из одного текстового описания. Модель заточена под озвучку, подкасты и дубляж.
Ключевые возможности
- Точная временная разметка реплик с шагом до 100 миллисекунд.
- Поддержка более 20 языков с переносом тембра между ними.
- Клонирование голосов по эталонным аудиофайлам.
Как это работает
К промптам подключаются до трёх аудиоклипов с помощью специальных тегов. Вместо аудио можно дать картинку с описанием персонажа.
Ограничения и цены
Seed Audio 1.0 пока плохо работает с русским языком, промпт необходимо писать на английском. Лимит по длительности составляет 2 минуты аудио, длина текстового запроса — до 3000 знаков. Стоимость генерации колеблется в диапазоне $0,15–0,19 за минуту.
Попробовать модель можно на официальной платформе: BytePlus Voice Console.
Подробнее о проекте читайте на странице: Seed Audio 1.0.

