Qwen3.8-27B теперь работает со скоростью 70 токенов/с на ноутбуке. Вышел DFlash 2.
Модель Qwen3.8-27B теперь работает со скоростью 70 токенов в секунду прямо на ноутбуке. Вышел DFlash 2. Это новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов в секунду на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели: буквально ни одного отличающегося токена.
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода описана в блоге: https://inco.ai/blog/dflash2/.

