GLM-5.3 без цензуры: вышел EXL3-квант на 3 бита.
На Hugging Face появилась uncensored-версия GLM-5.3, квантованная в формат EXL3 под ExLlamaV3. Рассказываем, что известно о модели.
Средняя разрядность кванта составляет 3.04 bpw, а веса занимают 273 GiB. В основе лежит полноценная GLM-5.3 от Z.ai. Это MoE на 753B параметров: 256 роутируемых экспертов, из которых 8 активны на каждом токене, плюс один общий эксперт.
Отказы убрали правкой весов без файнтюна. Изменения описаны в файле CRACK_SURGERY.json, а EXL3-квант сделан поверх этой правки.
Качество сжатия проверили: KL-дивергенция против FP8 составляет 0.089, перплексия выросла с 3.302 до 3.440. На tau2-bench агентные метрики почти не просели.
Модель запускали на 8× A100 40GB через TabbyAPI с разбиением слоёв по картам. Контекст ограничили 65K токенов.
Есть особенность с tool calling: GLM пишет аргументы инструментов как сырой текст, а парсер glm4_5 в TabbyAPI пытается разобрать каждое значение как JSON. Из-за этого около 70% вызовов в retail-задачах падают, пока парсер не исправят.
Модель подойдёт тем, кто запускает большие MoE локально и хочет модель без отказов. Защитных ограничений у неё нет, поэтому за результаты, которые она выдаёт, отвечает тот, кто её развернул.
Страница модели на Hugging Face: https://huggingface.co/Infatoshi/GLM-5.3-UNCENSORED-EXL3-3.0bpw.

