Qwen-Video-Edit: как превратить Qwen-Image-Edit в видеоредактор без отдельного video transformer.
Проект Qwen-Video-Edit выглядит остроумно. Мы не уверены, что это готовый продакшн-инструмент, но подход простой и красивый.
Коротко: Qwen-Video-Edit превращает Qwen-Image-Edit в видеоредактор, не обучая отдельный video transformer.
Авторы берут исходное видео, кодируют его через VAE от Wan 2.1, а полученные временные латенты передают в Qwen-Image-Edit DiT почти как одну огромную картинку: кадры раскладываются в виртуальную сетку, а две небольшие обучаемые projection-прослойки переводят латенты Wan в пространство Qwen и обратно. После редактирования результат дополнительно прогоняется через несколько denoise-шагов Wan 2.2, чтобы улучшить качество и временную стабильность.
На практике цепочка выглядит так:
video → Wan VAE → Qwen-Image-Edit → Wan VAE → Wan 2.2 enhancement → video
Длинное видео режется на куски по 45 кадров, причем каждому куску можно дать отдельную инструкцию. Сейчас опубликованный checkpoint обучен именно под 360p / 45 frames.
Код и веса
- Qwen-Image-Edit transformer: около 40 ГБ весов
- Qwen text encoder + VAE/tokenizer: около 15 ГБ
- Wan 2.1 VAE
- Wan 2.2 A14B для финального enhancement: около 80 ГБ весов
Поэтому требуется серьезный оффлоад, и работа может быть медленной.
Примеры
Project page с примерами: https://yunpeng1998.github.io/Qwen-Video-Edit-Page/
На первый взгляд подход может вызывать вопросы, поскольку Qwen-Image-Edit изначально не является temporal model.
Однако авторы помещают сразу пачку кадров в одно общее представление, поэтому Qwen видит их одновременно.
Это не означает настоящего temporal attention. Модели фактически нужно самой догадаться, что два похожих лица в соседних участках latent-grid это один и тот же человек через 40 мс.
Для этого в конце подключается Wan 2.2.
Мы считаем идею отличной. Как инструмент проект пока вызывает вопросы, но он может вдохновить на нестандартные пайплайны.

