Куда катится архитектура LLM: борьба за дешёвый длинный контекст накаляется.
Архитектурная гонка LLM в 2026 году: борьба за дешёвый длинный контекст
Себастьян Рашка разобрал свежие open-weight модели: Gemma 4, Laguna XS.2, ZAYA1-8B и DeepSeek V4. По мнению эксперта, общий тренд сейчас таков: главная борьба идёт не только за качество, а за снижение стоимости обработки длинного контекста.
У reasoning-моделей и агентов узким местом стали KV-кэш, трафик памяти и FLOPs, связанные с вычислением внимания (attention). Поэтому архитектуры всё активнее нацелены на сокращение стоимости инференса.
Gemma 4 делит KV-кэш между слоями. Laguna XS.2 распределяет бюджет внимания по слоям. ZAYA1-8B вычисляет внимание в сжатом латентном пространстве. DeepSeek V4 сжимает KV-кэш вдоль последовательности и усложняет residual stream.
Таким образом, decoder-only трансформер остаётся в строю, но всё, что связано с механизмом внимания, стремительно мутирует. Качество всё ещё определяется данными и рецептом обучения, тогда как архитектура всё чаще нужна, чтобы длинный контекст не сжигал аппаратное обеспечение.
Ознакомиться с полным разбором можно по ссылке: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures

