Сбер выпустил открытый токенизатор KVAE-Audio, обгоняющий аналоги от Sony, Meta и Stability AI.
Сбер опубликовал открытый токенизатор KVAE-Audio для диффузионных аудиомоделей. Эта модель решает фундаментальную проблему обучения диффузионных систем, которым требуется максимально качественное сжатое представление данных. Разработчики закрыли эту потребность, представив третью часть семейства KVAE. Ранее команда уже публиковала схожие алгоритмы для работы с видео и картинками, а теперь очередь дошла до аудиоформата.
Система способна обрабатывать треки на частоте 48 кГц, охватывая весь спектр человеческого слуха. Во время обработки алгоритм уплотняет временную шкалу в 960 раз. На выходе получается сверхкомпактное пространство, состоящее из 64 каналов. Такие скромные размерности заметно упрощают тренировку генеративных архитектур.
Ключевой инженерный вызов заключался в адаптации выходных данных именно под диффузию. Классические подходы часто показывают отличные цифры при воссоздании исходного аудио, но плохо справляются с созданием оригинального материала. Чтобы сбалансировать результаты в обеих задачах, авторы применили уникальный метод регуляризации.
На бенчмарках новинка уверенно обходит MMAudio от Sony абсолютно по всем фронтам. При сравнении с DACVAE от Meta и SAME-L от Stability AI разработка выигрывает в качестве генерации и держит паритет в реконструкции, при этом обладая значительно меньшим весом.
Код и веса под свободной лицензией MIT уже лежат на GitHub и Hugging Face. Подробнее на Habr.

