Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Сравнение архитектуры внимания: MiniMax, MiMo и DeepSeek V4.

Мы добавили в сравнение модели MiniMax и MiMo.

MiniMax выглядит сильным конкурентом DeepSeek V4 не только по показателям IQ, но и по активным параметрам.

Активные параметры определяют нагрузку на ядра GPU. Также важно, чтобы все эксперты MoE срабатывали максимально часто в пределах одного GPU без трафика в кластере. Второе значительно важнее. В среднем ядра GPU обычно простаивают в кластере на 60% для крупных LLM, так как ждут доставки данных для расчетов. Чем меньше активные параметры, тем выше вероятность этого избежать и повысить утилизацию. У DeepSeek V4 Flash она порядка 80%.

Однако по расходу самого дефицитного ресурса — VRAM — полная победа за DeepSeek. Парадокс еще и в том, что HCA/CSA не только занимают намного меньше места в VRAM, но это и более качественное sparse attention.

HCA дает обзор контекста на уровне абзацев или блоков кода (128 токенов). Очень важно, что HCA дают непрерывное покрытие контекста без пропусков вообще, так кроме DeepSeek никто не умеет. Второй плюс — HCA срабатывают как исходная информация для Lighting «конкурса якорей» из CSA, то есть выбор места цитирования намного точнее. Поскольку CSA вектора сжаты по 4 токена, то реальное накрытие цитированием — более 4000 токенов за раз. Обычно в других LLM это вообще весь бюджет векторов sparse attention, включая и глобальные якоря. Поэтому американские LLM могут накрыть цитированием дай бог 2000 токенов за раз. Причем речь о LLM-гигантах, но они не могут конкурировать с технологией распределенного внимания следующего поколения.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.