Step-Audio-R1.1 установил новый рекорд SOTA в аудио-рассуждениях.
Модель Step-Audio-R1.1 от StepFun AI установила новый рекорд (SOTA) на лидерборде Artificial Analysis в категории Speech Reasoning.
Модель обошла конкурентов, включая Grok, Gemini и GPT-Realtime, показав точность 96.4%.
Ключевые особенности модели:
- Native Audio Reasoning (End-to-End) — способность рассуждать непосредственно в аудиоформате без дополнительных преобразований.
- Audio-native CoT (Chain of Thought) — цепочка рассуждений, изначально спроектированная для работы с аудио.
- Real-time streaming inference — возможность работы в режиме реального времени, аналогично живому диалогу.
- FULLY OPEN SOURCE — модель полностью открыта для использования и изучения.
Это достижение указывает на выход аудио-искусственного интеллекта на новый уровень возможностей.
Демо-версия доступна по ссылке: https://modelscope.cn/studios/stepfun-ai/Step-Audio-R1
Страница модели: https://modelscope.cn/models/stepfun-ai/Step-Audio-R1.1

