Motion-Omni: одна модель генерирует речь и движения тела одновременно.
Мы обратили внимание на проект Motion-Omni. Одна модель генерирует и речь, и движения тела по диалогу. Вместо того чтобы запускать TTS и анимацию по отдельности и потом синхронизировать, всё делается из одних и тех же латентных состояний.
- Работает в 5.4 раза быстрее каскадных решений: не надо ждать, пока каждый компонент отработает по очереди.
- Синхронизация зашита в архитектуру, а не доклеивается постфактум.
- Подходит для диалоговых аватаров, виртуальных персонажей и любых сценариев, где персонаж говорит и движется одновременно.
На видео проект сравнивают с MambaTalk. Код доступен на GitHub.

