Meta Superintelligence Labs представила Muse Voice Transcribe: распознавание речи в реальном времени и диаризацию 20+ говорящих.
Meta (запрещена в РФ) Superintelligence Labs представила первую модель распознавания речи в реальном времени Muse Voice Transcribe. Модель разбирает голос, диаризацию и определение конца фразы на лету без задержек.
Возможности
- потоковое распознавание речи;
- диаризация 20+ говорящих одновременно;
- определение конца реплики в потоке;
- переключение между языками внутри одной фразы;
- настройка на конкретные имена и термины.
Поддержка 25+ языков. Русский язык не указан. В демонстрации модель разбирает восемь человек, говорящих одновременно, и правильно понимает, кто что сказал.
Отдельно точность подтягивается контекстом: если упомянуть конкретное имя или место, модель его узнает и не путает с похожими словами.

