Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

OVQA: метод онлайн-внимания снижает расход памяти в больших моделях.

Исследователи из Zyphra представили метод Online Vector-Quantized Attention (OVQA), который решает проблему роста потребления памяти при обработке длинных контекстов большими языковыми моделями.

В классическом векторном квантовании (VQ) ключи внимания заменяются ближайшими векторами из статичного словаря. Это ускоряет вычисления, но создает проблему: словарь обучен на одних данных, а во время генерации модель видит другое распределение ключей. Ошибка квантования растет, что снижает точность внимания.

Модификация OVQA заключается в отказе от статического словаря в пользу адаптивного, который обновляется для текущей последовательности. Каждый новый токен обновляет только один ближайший центроид. Это разреженное обновление защищает от катастрофического забывания: старая информация аккуратно перезаписывается по мере необходимости, а не стирается полностью.

Кроме того, метод включает жесткое ограничение на размер состояния, после достижения которого объем памяти перестает расти, а вычислительная сложность остается линейной.

Результаты тестовых экспериментов

  • Модель, обученная на 4 тысячах токенах, уверенно работала с контекстом до 64 тысяч токенов без деградации качества.
  • В задачах внутриконтекстного поиска OVQA почти не уступала полноценному самовниманию, потребляя при этом в 4 раза меньше памяти.
  • На In-Context Learning классическое VQ провалилось, а OVQA вышла на уровень классического внимания, используя всего около 4 тысяч центроидов.
  • В сравнении с линейными альтернативами, такими как Mamba2 и дельта-сети, OVQA стабильнее держит длинный контекст без просадок точности.
  • В задачах Positional ICR OVQA работает немного хуже классического внимания, но демонстрирует достойные результаты.

Новый подход рассматривается как шаг к созданию компактной и адаптивной памяти для моделей, способной удерживать важные детали без постоянного роста кэша.

Подробнее с методом можно ознакомиться в статье на сайте Zyphra и в научной работе на arXiv.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.