Unsloth ускорила локальную GLM-5.3-Flash от 1,6 до 3,3 раза.
Команда Unsloth добавила Pull Request в llama.cpp, ускорила декодирование и добавила поддержку MTP, то есть предсказания нескольких токенов за шаг. Об этом сообщается в посте UnslothAI.
Ничего докачивать не нужно: кванты остались теми же, что и неделю назад. В Unsloth Desktop достаточно обновиться, а в llama.cpp нужно собрать ветку Unsloth по гайду.
Прирост растёт вместе с длиной контекста. На коротких промптах ускорение достигает 1,6 раза, на 64 тысячах токенов даже без MTP скорость выросла более чем вдвое. С MTP лучший вариант два черновых токена, при трёх и пяти черновых токенах скорость снова падает.
Требования не изменились: 1-битный квант занимает 100 ГБ памяти, 3-битный занимает 128 ГБ, как у Mac Studio или DGX Spark.

