Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

OSCAR: открытая система двухбитного сжатия KV-кэша от Together AI.

Together AI выложила в открытый доступ метод OSCAR (Offline Spectral Covariance-Aware Rotation), позволяющий сжимать KV-кэш больших языковых моделей до двух бит.

KV-кэш представляет собой структуру, в которой модель хранит промежуточные представления токенов при генерации. На длинных контекстах он занимает значительную часть памяти GPU, и его сжатие позволяет либо обслуживать больше запросов одновременно, либо ускорять чтение из памяти.

Прежние попытки сжать кэш до двух бит приводили к ухудшению качества ответов. OSCAR обходит это ограничение благодаря тому, что поворот активаций перед квантованием рассчитывается на основе статистики внимания. Как предлагают авторы, сначала на калибровочном наборе собираются ковариационные матрицы запросов и значений, взвешенных оценками внимания, а затем из них выводится персональный поворот для ключей и значений каждого слоя. Далее применяется преобразование Адамара, выравнивающее значимость каналов, и перестановка с побитовым реверсом, чтобы соседние каналы попадали в один диапазон при поквантовом сжатии. Первые 64 и последние 256 токенов контекста хранятся в полной точности BF16 как опорные, всё остальное — в двух битах. Калибровка выполняется один раз, поворот и пороги отсечения фиксируются, а вычислительная наценка скрывается внутри ядер декодирования.

Тесты

На задачах AIME25, GPQA-Diamond, HumanEval, LiveCodeBench v6, MATH500 метод удерживается близко к точности базового режима BF16. Разрыв составляет 3,78 пункта на Qwen3-4B-Thinking-2507, 1,42 пункта на Qwen3-8B и около нуля на Qwen3-32B и GLM-4.7-FP8.

Результаты на длинных контекстах

По бенчмарку RULER-NIAH OSCAR работает стабильнее остальных двухбитных методов, но для меньших моделей разрыв с BF16 растёт по мере увеличения контекста: на Qwen3-4B-Thinking-2507 при 128 тыс. токенов точность падает с 81,0 до 39,5 пункта. Для GLM-4.7-FP8 кривая практически совпадает с BF16.

В замерах на NVIDIA H100 скорость декодирования при контексте в 100 тыс. токенов выросла в диапазоне от 2,8 до 3,1 раза относительно BF16. OSCAR совместим с paged attention и встраивается в SGLang без изменений на стороне клиента. Для экспериментов Together AI выложила предвычисленные матрицы поворота для Qwen3-4B-Thinking, Qwen3-8B, Qwen3-32B и GLM-4.7-FP8.

Лицензия и ресурсы

Проект распространяется под лицензией Apache 2.0.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.