Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Технический отчёт Kimi K3: как Full Attention и MLA позволили обойти Claude Fable 5 в бенчмарках.

Вышел технический репорт Kimi K3. Давайте разбираться, как устроен фронтальный флагман, который побил Claude Fable 5 во множестве бенчмарков и лидербордов.

Начнём с того, что казалось невероятным ещё 1–2 года назад и до сих пор остаётся невероятной технологией для LLM, сделанных «по-американски». Kimi K3 использует настоящий Full Attention в слоях трансформеров. Если американская LLM традиционной реализации просто захлебнётся от потребления памяти и вычислительной нагрузки на контексте 1М токенов из-за квадратичного роста Attention-матриц, то в случае китайской LLM на MLA, который изобрёл DeepSeek, ситуация другая. Размер KV Cache у Kimi K3 составляет всего ~11.6 ГБ (в FP8) или ~23.1 ГБ (в FP16) на 1 сессию. Время «горячего» Prefill на 1М токенов для 16 штук B200 (2 ноды) будет около ~30 секунд. Потом Kimi кеширует уже посчитанные KV Cache, то есть если вы делаете новые запросы, они не считаются заново, а берутся из кеша. Скорость Prefill у них на таком оборудовании около ~25 000–30 000 ток/сек. Поэтому если вы загружаете контекст не целиком, а такими блоками, то ваше ожидание будет не более 1 секунды.

Как такая невиданная для американских инженеров скорость Prefill достигается? MLA позволяет размещать плитки Flash Attention прямо в сверхбыструю память Tensor Cores, фактически расчёт ведётся внутри сверхбыстрых ядер GPU с минимальным обменом с VRAM.

Важно тут отметить, что техники разметки контекста под sparse attention вовсе не потеряли актуальность, так как они удивительно совместимы с тем, как 75% нейросети Kimi K3 на State-слоях в KDA читают контекст. Как увидим дальше, ещё трансформеры периодически отключаются от резидуальных потоков, поэтому даже ещё больше зависите от того, как подаёте контекст для удобства State-модели, так как это основной источник информации модели для принятия решений. Трансформеры нужны больше для точного цитирования.

https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.