MiniMax открыла M3: мультимодальная MoE-модель с 428B параметров и 1M контекстом доступна на Hugging Face.
Компания MiniMax опубликовала на Hugging Face веса мультимодальной модели M3. Раньше M3 была доступна только через API с 1 июня, а теперь её можно скачать и запустить на собственных серверах.
Что такое M3
Это архитектура Mixture of Experts (MoE) с 428 миллиардами параметров и 23 миллиардами активных токенов. Модель изначально обучалась на тексте, изображениях и видео, а не получала мультимодальность через адаптеры. Контекстное окно достигает 1 миллиона токенов.
Главная инженерная особенность — MiniMax Sparse Attention. Оно заменило привычное GQA и позволило ускорить prefill на миллионном контексте в 9 раз по сравнению с предыдущей версией M2, декодирование — в 15 раз, а вычисления на токен сократились в 20 раз.
По заявлениям MiniMax, M3 набирает 59% на SWE-Bench Pro и 66% на Terminal-Bench 2.1 — на уровне открытых моделей-лидеров.
Режимы работы
Есть два варианта: thinking для сложных агентных задач и non-thinking для чата и быстрого автодополнения.
Поддержка и развертывание
Модель совместима с vLLM и SGLang, а рецепты деплоя выложены на GitHub.
Лицензия и железо
Лицензия не Apache, а MiniMax Community License. Для коммерческого использования мы советуем вам внимательно изучить её условия. Запустить M3 дома не получится: веса занимают сотни гигабайт. Однако для компаний с собственными инференс-серверами это один из самых мощных открытых вариантов на сегодня.

