Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

ByteDance обновили Seed Audio 1.0: точный тайминг и 20 языков!

Компания ByteDance выпустила обновление своей модели генерации звуков Seed Audio 1.0. Сама модель осталась прежней, но разработчики добавили две важные функции, которые делают работу со звуком гораздо удобнее.

Для тех, кто не знаком с проектом: Seed Audio позволяет по одному текстовому описанию получить целую звуковую сцену — с диалогами, эмоциями, шагами, музыкой и фоновыми шумами. Всё создается за один проход, без сведения отдельных дорожек. Фактически вы управляете звукорежиссёром с помощью текста.

Что нового

Первое и самое главное — точный тайминг. Теперь любую реплику или звук можно привязать к конкретной секунде прямо в промпте, а также задать общую длину трека. Раньше сгенерированная озвучка могла не совпадать по хронометражу с видео, и приходилось всё подгонять в монтаже. Теперь достаточно заранее знать нужную длительность, и модель сама выстроит звук под этот тайминг. Например, можно описать сцену ночной погони с диалогом курьера и диспетчера, указав точное время для каждой реплики, визга тормозов, взрыва и даже осыпающегося стекла. Порядок работы переворачивается: сначала задаётся хронометраж, а потом генерируется звук.

Второе нововведение — расширенная языковая поддержка. Теперь Seed Audio 1.0 работает с 20 языками вместо двух. Среди них английский, китайский, японский, корейский, испанский, немецкий, французский, португальский, тайский, вьетнамский и другие. Русский язык также поддерживается.

Остальные возможности остались на прежнем уровне: клонирование голоса по трём референсам длительностью до 30 секунд, генерация до двух минут за один запрос, объём промпта до 2048 знаков, форматы вывода wav, mp3, pcm, ogg_opus.

Попробовать обновлённую модель можно на платформе console.byteplus.com в разделе Voice. Подробная документация доступна по ссылке: docs.byteplus.com/en/docs/byteplusvoice/seedaudio-01.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.