VC-Attention от Nunchux AI ускоряет генерацию видео до 1.7 раза.
Мы обратили внимание на анонс Nunchux AI: компания представила VC-Attention, метод ускорения генерации видео до 1,7 раза.
Стандартное внимание в диффузионных трансформерах замедляет генерацию видео: все вычисления выполняются в FP32, появляется много лишних операций. VC-Attention решает эту проблему без переобучения модели.
V-Smooth группирует похожие токены и снижает ошибку квантования значений. ExpCast-FP8 меняет экспоненту в FP32 на прямой перевод результатов в FP8.
На RTX 5090 внимание Wan2.2 ускорилось в 3,58 раза, а полная генерация в 1,7 раза.
Технологию проверили на моделях:
- Wan2.2
- LongCat-Video
- HunyuanVideo-1.5
- MiniMax-H3
Nunchux Attention является проприетарным расширением VC-Attention. Оно ускоряет MiniMax-H3 в 1,91 раза по сравнению с BF16 FlashAttention-4 на B200.
Бесплатный доступ для H3 обещают скоро открыть, сейчас доступен вейтлист.

