Mistral AI выпустила Voxtral TTS — быструю нейросеть для синтеза речи на 9 языках.
Компания Mistral AI представила Voxtral TTS — новую, легковесную и быструю модель синтеза речи, которая демонстрирует наилучшие результаты (SOTA) на девяти языках.
Архитектура модели
В основе модели лежит несколько компонентов:
- Декодер на 3,4 миллиарда параметров, созданный на базе языковой модели Ministral 3B.
- Акустический flow-matching трансформер на 390 миллионов параметров.
- Кастомный нейрокодек на 300 миллионов параметров. Он является каузальным, использует словарь из 8192 семантических токенов и работает с частотой 12,5 Гц.
Ключевые характеристики
- Задержка до первого звука (TTFA) составляет 70 мс для текста длиной в 500 символов.
- Скорость генерации (RTF) достигает примерно 9,7x.
- Модель может нативно генерировать до двух минут аудио за один проход.
- По результатам слепых тестов Voxtral TTS превосходит ElevenLabs Flash v2.5 и демонстрирует качество на уровне «тяжёлой» версии ElevenLabs v3.
Функциональные возможности
Модель поддерживает ожидаемые для SOTA-решения функции: клонирование голоса и эмоций по образцу звука от трёх секунд, работу на девяти языках и zero-shot перенос акцентов.
Доступность
Открытые веса модели доступны на Hugging Face под некоммерческой лицензией CC BY NC 4.0. Коммерческое использование возможно через API, стоимость которого составляет 0,016 доллара за тысячу символов.
Технические детали и демонстрации можно найти в официальном анонсе на сайте Mistral AI.

