Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

OVQA: метод онлайн-внимания снижает расход памяти в больших моделях.

Исследователи из Zyphra представили метод Online Vector-Quantized Attention (OVQA), который решает проблему роста потребления памяти при обработке длинных контекстов большими языковыми моделями.

В классическом векторном квантовании (VQ) ключи внимания заменяются ближайшими векторами из статичного словаря. Это ускоряет вычисления, но создает проблему: словарь обучен на одних данных, а во время генерации модель видит другое распределение ключей. Ошибка квантования растет, что снижает точность внимания.

Модификация OVQA заключается в отказе от статического словаря в пользу адаптивного, который обновляется для текущей последовательности. Каждый новый токен обновляет только один ближайший центроид. Это разреженное обновление защищает от катастрофического забывания: старая информация аккуратно перезаписывается по мере необходимости, а не стирается полностью.

Кроме того, метод включает жесткое ограничение на размер состояния, после достижения которого объем памяти перестает расти, а вычислительная сложность остается линейной.

Результаты тестовых экспериментов

  • Модель, обученная на 4 тысячах токенах, уверенно работала с контекстом до 64 тысяч токенов без деградации качества.
  • В задачах внутриконтекстного поиска OVQA почти не уступала полноценному самовниманию, потребляя при этом в 4 раза меньше памяти.
  • На In-Context Learning классическое VQ провалилось, а OVQA вышла на уровень классического внимания, используя всего около 4 тысяч центроидов.
  • В сравнении с линейными альтернативами, такими как Mamba2 и дельта-сети, OVQA стабильнее держит длинный контекст без просадок точности.
  • В задачах Positional ICR OVQA работает немного хуже классического внимания, но демонстрирует достойные результаты.

Новый подход рассматривается как шаг к созданию компактной и адаптивной памяти для моделей, способной удерживать важные детали без постоянного роста кэша.

Подробнее с методом можно ознакомиться в статье на сайте Zyphra и в научной работе на arXiv.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.