Технический отчёт MiMo V2.6: Reinforcement Learning ускорен, но Сберу и Яндексу стоит сменить курс.
Вышел предварительный технический отчёт по модели MiMo V2.6 от Xiaomi. Главный прорыв вендора в кардинальном ускорении Reinforcement Learning за счёт обучения крупными блоками данных. Это позволяет обучать модели быстрее и дешевле.
Сравнение MiMo V2.6 и DeepSeek V4.1 даёт тревожный сигнал архитекторам LLM в Сбербанке и Яндексе. Если продолжать копировать модный китайский гибрид GPT + Delta State, можно проиграть конкуренцию китайским Flash-моделям. Даже если взять с Hugging Face архитектуру Kimi K3 и запустить обучение в российских условиях, полноценная копия Kimi K3 не получится: GPU меньше, а описания пайплайнов обучения на Hugging Face нет.
Сберу и Яндексу важно не столько догнать DeepSeek V4.1 и MiMo V2.6, сколько сделать так, чтобы отставание не выглядело уже неприлично. Китайские Flash-модели умеют программировать и работать как сложные агенты, а российские LLM пока так не умеют.
Ключевой момент: обе китайские Flash-модели не используют гибрид GPT + Delta State. Они работают на доработанном GPT. DeepSeek использует доработку через CED, а Xiaomi подходит менее радикально: обычный GPT с комбинациями глобального и оконного (SWA) внимания между слоями.
Ситуация напоминает мем Матвиенко «копали не туда» про тоннель Метростроя в Петербурге, который ушёл не туда и стоил огромных денег.
Ознакомиться с отчётом можно на Hugging Face: MiMo V2.6 technical report

