Qwen выпустила AVA-Encoder: видео превращается в редактируемый граф знаний.
Команда Qwen выпустила AVA-Encoder. Это система, которая превращает видео в структурированный граф знаний и фиксирует в нем персонажей, сцены, события, объекты, стили, камеру и аудио.
Агент может читать этот граф, редактировать его и использовать повторно. Мы выделили ключевые возможности проекта:
- Видео конвертируется в граф знаний и обратно в видео. Реконструкция служит метрикой качества: чем точнее восстановлен ролик, тем больше информации сохранил энкодер.
- Граф редактируется: можно заменить персонажа в сцене или поменять стиль освещения, зависимые элементы обновляются автоматически по связям.
- Готовый граф можно передать видеогентам MovieAgent, FilmAgent и Anim-Director. Качество их генерации растет без дообучения.
- Оптимизация проходит в два этапа: внешний цикл обучает политику энкодера до деплоя, внутренний цикл опционально дорабатывает граф конкретного видео в процессе.
Подробнее о проекте мы рекомендуем узнать на GitHub.

