X-AuT: сжатие аудио-энкодера для речевых LLM на примере Qwen3-ASR-0.6B.
Метод сжатия аудио-энкодера для речевых LLM представлен на примере X-AuT и модели Qwen3-ASR-0.6B. Он убирает 4 из 18 слоёв энкодера, а качество восстанавливается через дистилляцию от большой модели на 1.7B.
В итоге количество параметров снижается на 21%, латентность на автомобильном PPU уменьшается на 21%, а ошибка почти не растёт: плюс 2,5%. Отдельно отметим автомобильную специфику проекта.
Код доступен на GitHub, веса модели на Hugging Face.

