ByteShape оптимизировали Qwen-Image-2512: GGUF и Humming.
Пока Alibaba не выпускает новые модели Qwen, команда ByteShape оптимизировала предыдущую версию. Они представили решение для Qwen-Image-2512.
- Шесть уровней квантизации для GGUF: размер моделей варьируется от 8 до 17 ГБ.
- Humming: экспериментальная интеграция, которая работает быстрее GGUF.
- Для vLLM-Omni: объем занимаемой памяти от 8 до 17 ГБ, прирост скорости в 2–3 раза.
Детальное сравнение с оригинальной моделью доступно на сайте разработчиков.

