StepAudio 3: новые аудиомодели для общения, генерации музыки и распознавания речи!
Компания StepFun представила семейство аудиомоделей StepAudio 3. В него вошли решения для живого общения, генерации музыки, синтеза и распознавания речи.
StepAudio 3 Realtime
StepAudio 3 Realtime является полнодуплексной аудио-языковой моделью. Она говорит и слушает одновременно, размышляет вслух, не замолкая. Поддерживаются китайский и английский языки.
StepAudio 3 Music
StepAudio 3 Music отвечает за генерацию песен. Модель планирует структуру, включая куплеты, припев, бридж и аранжировку, создает 48-kHz стерео длительностью до 5 минут 30 секунд. Язык задается описанием песни.
Gen, TTS и ASR
Также в семейство вошли речевая модель с дизайном голоса Gen, TTS и ASR. Для них заявлены китайский, английский, японский, корейский, французский и испанский языки.
Voice Studio пока работает только в разговорном режиме, музыка анонсирована.

