Блог vLLM протестировал TurboQuant: насколько эффективна квантизация KV-кэша?
Мы обратили внимание на свежее исследование в блоге vLLM, посвящённое методу квантизации KV-кэша под названием TurboQuant. Около двух месяцев назад внимание сообщества привлекла работа Google годичной давности, которая даже кратковременно повлияла на акции производителей оперативной памяти. Теперь же алгоритм подвергли полноценному тестированию.
Авторы эксперимента взяли три разные архитектуры моделей, прогнали их через бенчмарки и замерили производительность. Результаты получились неоднозначными.
С точки зрения качества варианты TurboQuant с настройками k8v4 и 4bit-nc показали себя достойно. Они почти не теряют баллов в тестах, при этом занимая на 15–35% меньше места, чем кэш fp8. Однако трёхбитная квантизация приводит к серьёзному падению результатов, особенно на задачах, требующих понимания длинного контекста.
Гораздо более сложная ситуация сложилась с производительностью. Хотя размер KV-кэша действительно уменьшается по сравнению с fp8, цена такого сжатия крайне высока. Постоянная деквантизация снижает пропускную способность на величину от 10% до 70% в зависимости от сценария. Таким образом, метод применим при локальном инференсе, но на серверных мощностях его использование нерационально.
Ознакомиться с полными результатами тестирования можно в блогпосте vLLM.

