NAVA от ERNIE (Baidu): открытая модель генерирует видео 720p с синхронным звуком и обходит более крупные аналоги.
Команда ERNIE из Baidu представила новую открытую модель NAVA, которая умеет одновременно создавать видео и звук. Несмотря на скромные 6,3 миллиарда параметров, она превосходит конкурентов в 2–5 раз большего размера в тесте Verse-Bench.
Генерация 720p-видео вместе с аудио занимает около минуты на 8 GPU, благодаря технологии Ulysses sequence parallel. Сцена и речь обрабатываются совместно, без отдельного вокодера и дополнительного выравнивания.
Для озвучивания нескольких персонажей можно привязать референсные WAV-файлы к спич-спанам <S>...<E>, задав каждому говорящему свой голос. Композиция кадра, движение и темп определяются через промпт. Модель поддерживает альбомную, портретную и квадратную ориентации из одного чекпоинта.
В основе NAVA лежит бэкбон Wan2.2-TI2V-5B. Больше примеров и ресурсов:

