Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Step-Audio-R1.1 установил новый рекорд SOTA в аудио-рассуждениях.

Модель Step-Audio-R1.1 от StepFun AI установила новый рекорд (SOTA) на лидерборде Artificial Analysis в категории Speech Reasoning.

Модель обошла конкурентов, включая Grok, Gemini и GPT-Realtime, показав точность 96.4%.

Ключевые особенности модели:

  • Native Audio Reasoning (End-to-End) — способность рассуждать непосредственно в аудиоформате без дополнительных преобразований.
  • Audio-native CoT (Chain of Thought) — цепочка рассуждений, изначально спроектированная для работы с аудио.
  • Real-time streaming inference — возможность работы в режиме реального времени, аналогично живому диалогу.
  • FULLY OPEN SOURCE — модель полностью открыта для использования и изучения.

Это достижение указывает на выход аудио-искусственного интеллекта на новый уровень возможностей.

Демо-версия доступна по ссылке: https://modelscope.cn/studios/stepfun-ai/Step-Audio-R1

Страница модели: https://modelscope.cn/models/stepfun-ai/Step-Audio-R1.1

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.