ByteDance обновили Seed Audio 1.0: точный тайминг и 20 языков!
Компания ByteDance выпустила обновление своей модели генерации звуков Seed Audio 1.0. Сама модель осталась прежней, но разработчики добавили две важные функции, которые делают работу со звуком гораздо удобнее.
Для тех, кто не знаком с проектом: Seed Audio позволяет по одному текстовому описанию получить целую звуковую сцену — с диалогами, эмоциями, шагами, музыкой и фоновыми шумами. Всё создается за один проход, без сведения отдельных дорожек. Фактически вы управляете звукорежиссёром с помощью текста.
Что нового
Первое и самое главное — точный тайминг. Теперь любую реплику или звук можно привязать к конкретной секунде прямо в промпте, а также задать общую длину трека. Раньше сгенерированная озвучка могла не совпадать по хронометражу с видео, и приходилось всё подгонять в монтаже. Теперь достаточно заранее знать нужную длительность, и модель сама выстроит звук под этот тайминг. Например, можно описать сцену ночной погони с диалогом курьера и диспетчера, указав точное время для каждой реплики, визга тормозов, взрыва и даже осыпающегося стекла. Порядок работы переворачивается: сначала задаётся хронометраж, а потом генерируется звук.
Второе нововведение — расширенная языковая поддержка. Теперь Seed Audio 1.0 работает с 20 языками вместо двух. Среди них английский, китайский, японский, корейский, испанский, немецкий, французский, португальский, тайский, вьетнамский и другие. Русский язык также поддерживается.
Остальные возможности остались на прежнем уровне: клонирование голоса по трём референсам длительностью до 30 секунд, генерация до двух минут за один запрос, объём промпта до 2048 знаков, форматы вывода wav, mp3, pcm, ogg_opus.
Попробовать обновлённую модель можно на платформе console.byteplus.com в разделе Voice. Подробная документация доступна по ссылке: docs.byteplus.com/en/docs/byteplusvoice/seedaudio-01.

