Liquid AI почти достигла качества BF16 в 4-битных моделях.
Liquid AI выпустила новые Q4_0-чекпоинты для моделей LFM2.5-230M, 350M, 1.2B и 2.6B, обученные с помощью Quantization-Aware Distillation (QAD).
Суть QAD проста: высокоточная модель выступает учителем для уже квантованной 4-битной версии. Это позволяет сохранить низкое потребление памяти и высокую скорость Q4_0, но при этом заметно вернуть качество, которое теряется после обычной квантизации.
По внутренним тестам Liquid AI, новые модели сохраняют примерно от 96,5 до 97,4% качества BF16. Для младших моделей QAD закрывает больше 70% разрыва между обычным Q4_0 и BF16.
Скорость инференса остаётся на уровне обычного Q4_0, поскольку формат GGUF, layout тензоров и runtime не меняются. Модели тестировали в том числе на MacBook Pro с M5 Max, Galaxy S26 Ultra и Raspberry Pi 5.
Официальный блог Liquid AI: liquid.ai/blog/qad

