Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

ByteDance представила Seed Audio 1.0: ИИ-модель генерирует целые звуковые сцены за один проход!

Компания ByteDance открыла доступ к Seed Audio 1.0 — аудиомодели, способной сгенерировать за один проход целую звуковую сцену из одного текстового описания. Модель заточена под озвучку, подкасты и дубляж.

Ключевые возможности

  • Точная временная разметка реплик с шагом до 100 миллисекунд.
  • Поддержка более 20 языков с переносом тембра между ними.
  • Клонирование голосов по эталонным аудиофайлам.

Как это работает

К промптам подключаются до трёх аудиоклипов с помощью специальных тегов. Вместо аудио можно дать картинку с описанием персонажа.

Ограничения и цены

Seed Audio 1.0 пока плохо работает с русским языком, промпт необходимо писать на английском. Лимит по длительности составляет 2 минуты аудио, длина текстового запроса — до 3000 знаков. Стоимость генерации колеблется в диапазоне $0,15–0,19 за минуту.

Попробовать модель можно на официальной платформе: BytePlus Voice Console.

Подробнее о проекте читайте на странице: Seed Audio 1.0.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.