Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

StepAudio 3: новые аудиомодели для общения, генерации музыки и распознавания речи!

Компания StepFun представила семейство аудиомоделей StepAudio 3. В него вошли решения для живого общения, генерации музыки, синтеза и распознавания речи.

StepAudio 3 Realtime

StepAudio 3 Realtime является полнодуплексной аудио-языковой моделью. Она говорит и слушает одновременно, размышляет вслух, не замолкая. Поддерживаются китайский и английский языки.

StepAudio 3 Music

StepAudio 3 Music отвечает за генерацию песен. Модель планирует структуру, включая куплеты, припев, бридж и аранжировку, создает 48-kHz стерео длительностью до 5 минут 30 секунд. Язык задается описанием песни.

Gen, TTS и ASR

Также в семейство вошли речевая модель с дизайном голоса Gen, TTS и ASR. Для них заявлены китайский, английский, японский, корейский, французский и испанский языки.

Voice Studio пока работает только в разговорном режиме, музыка анонсирована.

Этот пост Вконтакте:

Ещё новости:

Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.
GuppyLM: языковая модель на 9 млн параметров обучается с нуля за пять минут.