Мультимодальная модель Uni-ViGU генерирует видео и текстовые описания.
Разработана мультимодальная модель для генерации и понимания видео Uni-ViGU. В отличие от других подходов, её основу составляет именно видеогенератор, а не модели, ориентированные на понимание контента.
Ключевая особенность Uni-ViGU — способность генерировать сразу видео и соответствующее ему текстовое описание.
Модель доступна для загрузки. Полный исходный код и детали проекта можно найти на GitHub, а веса модели опубликованы на Hugging Face. Размер файлов составляет 14 ГБ.

