OVQA: метод онлайн-внимания снижает расход памяти в больших моделях.
Исследователи из Zyphra представили метод Online Vector-Quantized Attention (OVQA), который решает проблему роста потребления памяти при обработке длинных контекстов большими языковыми моделями.
В классическом векторном квантовании (VQ) ключи внимания заменяются ближайшими векторами из статичного словаря. Это ускоряет вычисления, но создает проблему: словарь обучен на одних данных, а во время генерации модель видит другое распределение ключей. Ошибка квантования растет, что снижает точность внимания.
Модификация OVQA заключается в отказе от статического словаря в пользу адаптивного, который обновляется для текущей последовательности. Каждый новый токен обновляет только один ближайший центроид. Это разреженное обновление защищает от катастрофического забывания: старая информация аккуратно перезаписывается по мере необходимости, а не стирается полностью.
Кроме того, метод включает жесткое ограничение на размер состояния, после достижения которого объем памяти перестает расти, а вычислительная сложность остается линейной.
Результаты тестовых экспериментов
- Модель, обученная на 4 тысячах токенах, уверенно работала с контекстом до 64 тысяч токенов без деградации качества.
- В задачах внутриконтекстного поиска OVQA почти не уступала полноценному самовниманию, потребляя при этом в 4 раза меньше памяти.
- На In-Context Learning классическое VQ провалилось, а OVQA вышла на уровень классического внимания, используя всего около 4 тысяч центроидов.
- В сравнении с линейными альтернативами, такими как Mamba2 и дельта-сети, OVQA стабильнее держит длинный контекст без просадок точности.
- В задачах Positional ICR OVQA работает немного хуже классического внимания, но демонстрирует достойные результаты.
Новый подход рассматривается как шаг к созданию компактной и адаптивной памяти для моделей, способной удерживать важные детали без постоянного роста кэша.
Подробнее с методом можно ознакомиться в статье на сайте Zyphra и в научной работе на arXiv.

