OSCAR: открытая система двухбитного сжатия KV-кэша от Together AI.
Together AI выложила в открытый доступ метод OSCAR (Offline Spectral Covariance-Aware Rotation), позволяющий сжимать KV-кэш больших языковых моделей до двух бит.
KV-кэш представляет собой структуру, в которой модель хранит промежуточные представления токенов при генерации. На длинных контекстах он занимает значительную часть памяти GPU, и его сжатие позволяет либо обслуживать больше запросов одновременно, либо ускорять чтение из памяти.
Прежние попытки сжать кэш до двух бит приводили к ухудшению качества ответов. OSCAR обходит это ограничение благодаря тому, что поворот активаций перед квантованием рассчитывается на основе статистики внимания. Как предлагают авторы, сначала на калибровочном наборе собираются ковариационные матрицы запросов и значений, взвешенных оценками внимания, а затем из них выводится персональный поворот для ключей и значений каждого слоя. Далее применяется преобразование Адамара, выравнивающее значимость каналов, и перестановка с побитовым реверсом, чтобы соседние каналы попадали в один диапазон при поквантовом сжатии. Первые 64 и последние 256 токенов контекста хранятся в полной точности BF16 как опорные, всё остальное — в двух битах. Калибровка выполняется один раз, поворот и пороги отсечения фиксируются, а вычислительная наценка скрывается внутри ядер декодирования.
Тесты
На задачах AIME25, GPQA-Diamond, HumanEval, LiveCodeBench v6, MATH500 метод удерживается близко к точности базового режима BF16. Разрыв составляет 3,78 пункта на Qwen3-4B-Thinking-2507, 1,42 пункта на Qwen3-8B и около нуля на Qwen3-32B и GLM-4.7-FP8.
Результаты на длинных контекстах
По бенчмарку RULER-NIAH OSCAR работает стабильнее остальных двухбитных методов, но для меньших моделей разрыв с BF16 растёт по мере увеличения контекста: на Qwen3-4B-Thinking-2507 при 128 тыс. токенов точность падает с 81,0 до 39,5 пункта. Для GLM-4.7-FP8 кривая практически совпадает с BF16.
В замерах на NVIDIA H100 скорость декодирования при контексте в 100 тыс. токенов выросла в диапазоне от 2,8 до 3,1 раза относительно BF16. OSCAR совместим с paged attention и встраивается в SGLang без изменений на стороне клиента. Для экспериментов Together AI выложила предвычисленные матрицы поворота для Qwen3-4B-Thinking, Qwen3-8B, Qwen3-32B и GLM-4.7-FP8.
Лицензия и ресурсы
Проект распространяется под лицензией Apache 2.0.

