Как устроен механизм внимания в трансформерах: краткий математический разбор.
Краткий математический обзор механизма внимания объясняет одну из ключевых идей современных языковых моделей.
В обзоре разбираются токенизация и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание с маскированием, перекрёстное внимание и базовая структура архитектуры Transformer.
Также представлены методы, которые повышают эффективность внимания в современных LLM: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
Рекомендуем ознакомиться с обзором по ссылке: https://arxiv.org/pdf/2604.00965

