Вышла нейросеть Happy Horse 1.0 для создания синхронизированного видео и аудио.
Представлена новая модель искусственного интеллекта Happy Horse 1.0, предназначенная для генерации синхронизированного видео и аудиоконтента.
Модель сразу включает в себя 8-шаговую DMD дистилляцию и обладает следующими характеристиками:
- Генерирует диалог, фоновые звуки и шумы.
- Поддерживает семиязычный липсинк: английский, мандаринский, кантонский, японский, корейский, немецкий и французский.
- Разрешение выходного видео — 1080p.
- Архитектура построена на 40-слойном Transformer.
- Объём параметров составляет 15 миллиардов.
- Время генерации 5-секундного клипа в разрешении 1080p на GPU H100 — около 38 секунд.
Исходный код проекта и веса модели на данный момент не публикуются. Подробности можно найти на странице проекта в GitHub и официальном сайте Happy Horse.

