Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Куда катится архитектура LLM: борьба за дешёвый длинный контекст накаляется.

Архитектурная гонка LLM в 2026 году: борьба за дешёвый длинный контекст

Себастьян Рашка разобрал свежие open-weight модели: Gemma 4, Laguna XS.2, ZAYA1-8B и DeepSeek V4. По мнению эксперта, общий тренд сейчас таков: главная борьба идёт не только за качество, а за снижение стоимости обработки длинного контекста.

У reasoning-моделей и агентов узким местом стали KV-кэш, трафик памяти и FLOPs, связанные с вычислением внимания (attention). Поэтому архитектуры всё активнее нацелены на сокращение стоимости инференса.

Gemma 4 делит KV-кэш между слоями. Laguna XS.2 распределяет бюджет внимания по слоям. ZAYA1-8B вычисляет внимание в сжатом латентном пространстве. DeepSeek V4 сжимает KV-кэш вдоль последовательности и усложняет residual stream.

Таким образом, decoder-only трансформер остаётся в строю, но всё, что связано с механизмом внимания, стремительно мутирует. Качество всё ещё определяется данными и рецептом обучения, тогда как архитектура всё чаще нужна, чтобы длинный контекст не сжигал аппаратное обеспечение.

Ознакомиться с полным разбором можно по ссылке: https://magazine.sebastianraschka.com/p/recent-developments-in-llm-architectures

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.