Bonsai запускает 27B-модель на iPhone с минимальной потерей качества.
Стартап PrismML выпустил Bonsai 27B — бинарную и тернарную версии Qwen3.6-27B, которые сохраняют 90–95% качества исходной модели при сжатии весов в 9.4–14.2 раза. Тернарная версия занимает 5.9 ГБ и работает на ноутбуке (M5 Pro) со скоростью около 26 токенов в секунду, а 1-битная умещается в 3.9 ГБ и генерирует около 11 токенов в секунду на iPhone 17 Pro Max, или около 30 слов в секунду. Это первый случай, когда модель такого класса запускается на телефоне.
Обычное квантование ниже 4–5 бит ломает модели резко, а не постепенно. Текст остаётся гладким и уверенным, но рассуждения начинают противоречить сами себе, вызовы инструментов перестают парситься. До сих пор это обходили только обучением с нуля сразу в низкобитном виде (подход BitNet от Microsoft), но такие модели упёрлись в ~2B параметров. Bonsai конвертирует уже готовую предобученную модель, и главный результат именно в этом: считалось, что при сжатии ниже 4 бит модели ломаются сами по себе, но выяснилось, что дело в методах квантования.
Тернарный значит «троичный». Это способ хранения весов, при котором каждый вес принимает только одно из трёх значений: −1, 0 или +1. В обычной модели каждый вес — это число с плавающей точкой (FP16), например 0.0374, и на него уходит 16 бит. В бинарной модели вес может быть только −1 или +1, то есть хранится один бит, по сути только знак. Ноль здесь важен, потому что даёт модели возможность «выключить» связь между нейронами, то есть сказать «этот вход вообще не влияет на выход». Тернарная версия точнее, а бинарная компактнее.
Усредненные показатели по 15 бенчмаркам от математики и кода до вызова инструментов и работы с изображениями показывают, что деградация ответов по сравнению с исходной Qwen3.6-27B составляет 5.4% у Ternary Bonsai — 80.49 против 85.07 и 11.5% у 1-bit Bonsai, которая показала средний балл 76.11. Сравнение проводилось по единой методике на базе EvalScope с vLLM на NVIDIA H100 в режиме рассуждений, где деградация ниже 4 бит проявляется сильнее всего. Тернарная и бинарная версии теряют заметные баллы на агентных задачах и зрении относительно FP16.
Веса обеих версий выложены на Hugging Face, код на GitHub под лицензией Apache 2.0, а попробовать модель можно в браузере.

