Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Как технология MLA от DeepSeek удешевляет инференс и раскрывает весь потенциал FlashAttention.

Китайские большие языковые модели демонстрируют впечатляющую экономическую эффективность, и в основе этого успеха лежит технология Multi-Head Latent Attention (MLA), изобретённая в DeepSeek. Мы объясняем, как она устроена и почему позволяет так дёшево обслуживать гигантские контексты.

Суть MLA: один сжатый вектор на все головы внимания

Главный инсайт MLA — хранение не развернутого KV-кэша с десятками векторов для каждой головы, а единого низкорангового сжатого представления (Latent Vector). Вместо множества ключей и значений на токен используется всего один вектор, например размерностью 512, который затем «распаковывается» непосредственно в вычислениях. Это достигается с помощью техники Weight Absorbing Trick: матрицы распаковки математически встраиваются в матрицы запросов и выходных проекций, поэтому явно восстанавливать полные K и V в памяти не требуется. Результат — в десятки раз меньший объём данных в видеопамяти и минимальная нагрузка на шину.

MLA и FlashAttention: идеальная пара

Чтобы понять, почему MLA так хорошо сочетается с FlashAttention, напомним устройство GPU. Есть медленная, но ёмкая HBM (основная видеопамять) и сверхбыстрая встроенная SRAM размером в десятки мегабайт на мультипроцессор. Классический Full Attention вынужден оперировать «плитками» KV-кэша, которые из-за множества голов просто не помещаются в крошечную SRAM, упираясь в пропускную способность HBM. В MLA же запись для одного токена сжимается до крошечного размера (порядка 4,3–68 КиБ вместо мегабайтов), и плитки легко размещаются в быстрой памяти прямо на чипе. Это даёт два преимущества:

  • В одну и ту же SRAM-область помещается кратно больше токенов контекста.
  • Минимизируются операции ввода-вывода: GPU подгружает tiny-вектор из HBM, а все интенсивные вычисления внимания выполняет на Tensor Cores внутри чипа.

Благодаря этому модели уровня Kimi K2.6 и GLM-5.2 могут использовать честный Full Attention на громадных контекстах без скользящих окон и sparse attention, которые вынуждены применять американские архитектуры.

Последствия для отрасли

Технологические выгоды MLA выходят далеко за рамки одной себестоимости. DeepSeek V4 уже применяет распределённое внимание для дополнительного удешевления, а флагманские китайские модели (GLM, Kimi) используют полное внимание на длинных последовательностях, в то время как американские системы полагаются на sparse attention в духе Big Bird — якорные токены и скользящие окна. Это означает, что на больших контекстах китайский «фронтир» видит всё и потому оказывается мощнее.

Американские разработчики пока компенсируют архитектурные ограничения GPT колоссальными вычислительными ресурсами и финансовыми дотациями, однако период экспериментов заканчивается. Глава Anthropic Дарио Амодей последовательно переводит пользователей на тарифы, которые в 10–20 раз выше фиксированных ставок, — это планка безубыточности, и индустрии предстоит учиться жить по счетам.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.