Tencent открыла AuK: универсальная модель для обработки аудио.
Tencent открыла AuK, универсальную модель для обработки аудио. Она выполняет несколько задач через инструкции на естественном языке:
- синтез речи и клонирование голоса без примеров для обучения;
- замена, добавление и удаление слов в записи;
- изменение эмоции, высоты, скорости и громкости голоса;
- удаление акцента и преобразование речи в шёпот;
- переписывание текста песни с сохранением мелодии и голоса;
- удаление шума и реверберации;
- разделение спикеров;
- извлечение вокала из музыки.
Модель содержит 1,5 млрд параметров. Опубликованы веса и код под лицензией MIT, доступны CLI, Gradio и ComfyUI. По данным Tencent, AuK превосходит Qwen3-TTS в заявленных тестах.
Также выпущена AuK-Flash: дистиллированная версия, которой требуется всего четыре шага инференса. В одинаковых условиях она работает в 4,5 раза быстрее полной модели.
Важно учитывать, что 1,5 млрд параметров относятся только к основной модели. Эталонная конфигурация дополнительно загружает Qwen2.5-Omni-3B как мультимодальный энкодер и отдельный VAE. Запуск рассчитан на PyTorch + CUDA, поддержки llama.cpp и GGUF нет.
https://www.orcarouter.ai/blog/auk-open-weights-speech-explained

