Xiaomi представила новую линейку нейросетевых моделей MiMo V2.
Компания Xiaomi представила обновленную линейку больших языковых моделей MiMo V2.
Флагманская модель MiMo-V2-Pro построена по архитектуре Mixture of Experts (MoE) и имеет 42 млрд активных параметров при поддержке контекста в 1 млн токенов. Согласно данным Artificial Analysis, она занимает 8 место в рейтинге, опережая Claude Sonnet 4.6 на бенчмарке PinchBench, а также демонстрирует лучший результат среди китайских моделей на агентских задачах. Стоимость использования составляет 1 и 3 доллара за 1 млн токенов.
MiMo-V2-Omni — это мультимодальная модель, способная обрабатывать непрерывное аудио длительностью более 10 часов. В качестве примера её возможностей приводится задание, в рамках которого модель создала видеоролик, синтезировала для него звук, исправила ошибку со шрифтом и опубликовала результат в TikTok. Цена за использование этой модели — 0.40 и 2 доллара за 1 млн токенов.
Третья новинка, MiMo-V2-TTS, представляет собой систему синтеза речи с расширенным контролем эмоций и возможностью пения на китайском языке. Оценить её работу можно на платформе в Bilibili.
Для разработчиков уже доступны API моделей, а также интеграция через сервис Openrouter.

