Сравнение архитектуры внимания: MiniMax, MiMo и DeepSeek V4.
Мы добавили в сравнение модели MiniMax и MiMo.
MiniMax выглядит сильным конкурентом DeepSeek V4 не только по показателям IQ, но и по активным параметрам.
Активные параметры определяют нагрузку на ядра GPU. Также важно, чтобы все эксперты MoE срабатывали максимально часто в пределах одного GPU без трафика в кластере. Второе значительно важнее. В среднем ядра GPU обычно простаивают в кластере на 60% для крупных LLM, так как ждут доставки данных для расчетов. Чем меньше активные параметры, тем выше вероятность этого избежать и повысить утилизацию. У DeepSeek V4 Flash она порядка 80%.
Однако по расходу самого дефицитного ресурса — VRAM — полная победа за DeepSeek. Парадокс еще и в том, что HCA/CSA не только занимают намного меньше места в VRAM, но это и более качественное sparse attention.
HCA дает обзор контекста на уровне абзацев или блоков кода (128 токенов). Очень важно, что HCA дают непрерывное покрытие контекста без пропусков вообще, так кроме DeepSeek никто не умеет. Второй плюс — HCA срабатывают как исходная информация для Lighting «конкурса якорей» из CSA, то есть выбор места цитирования намного точнее. Поскольку CSA вектора сжаты по 4 токена, то реальное накрытие цитированием — более 4000 токенов за раз. Обычно в других LLM это вообще весь бюджет векторов sparse attention, включая и глобальные якоря. Поэтому американские LLM могут накрыть цитированием дай бог 2000 токенов за раз. Причем речь о LLM-гигантах, но они не могут конкурировать с технологией распределенного внимания следующего поколения.

