Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Сравнение архитектуры внимания: MiniMax, MiMo и DeepSeek V4.

Мы добавили в сравнение модели MiniMax и MiMo.

MiniMax выглядит сильным конкурентом DeepSeek V4 не только по показателям IQ, но и по активным параметрам.

Активные параметры определяют нагрузку на ядра GPU. Также важно, чтобы все эксперты MoE срабатывали максимально часто в пределах одного GPU без трафика в кластере. Второе значительно важнее. В среднем ядра GPU обычно простаивают в кластере на 60% для крупных LLM, так как ждут доставки данных для расчетов. Чем меньше активные параметры, тем выше вероятность этого избежать и повысить утилизацию. У DeepSeek V4 Flash она порядка 80%.

Однако по расходу самого дефицитного ресурса — VRAM — полная победа за DeepSeek. Парадокс еще и в том, что HCA/CSA не только занимают намного меньше места в VRAM, но это и более качественное sparse attention.

HCA дает обзор контекста на уровне абзацев или блоков кода (128 токенов). Очень важно, что HCA дают непрерывное покрытие контекста без пропусков вообще, так кроме DeepSeek никто не умеет. Второй плюс — HCA срабатывают как исходная информация для Lighting «конкурса якорей» из CSA, то есть выбор места цитирования намного точнее. Поскольку CSA вектора сжаты по 4 токена, то реальное накрытие цитированием — более 4000 токенов за раз. Обычно в других LLM это вообще весь бюджет векторов sparse attention, включая и глобальные якоря. Поэтому американские LLM могут накрыть цитированием дай бог 2000 токенов за раз. Причем речь о LLM-гигантах, но они не могут конкурировать с технологией распределенного внимания следующего поколения.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.