Сбер открыл две open source аудиомодели: GigaAM Multilingual и GigaChat Audio!
Искусственный интеллект уверенно осваивает аудио: современные решения уже не просто превращают речь в текст, но и анализируют эмоции, звуковой контекст и временные события. Сбер сделал важный шаг в этом направлении, опубликовав в открытом доступе сразу две модели: GigaAM Multilingual и GigaChat Audio, которые наглядно показывают эволюцию Speech AI.
Обе модели выложены на Hugging Face (см. коллекцию audiomodels).
GigaAM Multilingual: транскрипция на 70+ языках
GigaAM Multilingual предобучена на 2 миллионах часов речи на более чем 70 языках и дообучена для распознавания русского, английского, казахского, киргизского и узбекского. Это не только инженерное достижение, но и шаг к более инклюзивному ИИ, отлично работающему с русским и так называемыми low-resource языками.
- ai-sage/GigaAM-Multilingual на Hugging Face
- salute-developers/GigaAM на GitHub
GigaChat Audio: диалоги, эмоции и поиск событий в длинных записях
GigaChat Audio умеет вести многошаговые диалоги по аудио, распознавать речь и эмоции, переводить, классифицировать звуки и привязывать события к временной шкале. Модель обрабатывает записи длительностью до 2 часов и показывает сильные результаты в temporal grounding, уверенно локализуя события в продолжительных аудиоматериалах.
- ai-sage/GigaChat3.1-Audio-10B-A1.8B (10B параметров, около 1.8B активных, MoE-архитектура поверх текстовой GigaChat 3.1, лицензия MIT)
Открытые данные для привязки ко времени
Вместе с моделями команда опубликовала синтетический англоязычный датасет TimeGround-1M. Он предназначен для обучения систем, связывающих события с конкретными моментами времени. Это отличный пример того, как развитие ИИ сегодня опирается не только на архитектурные инновации, но и на качественно размеченные данные, поднимающие планку для целых классов задач.
Главный вывод, который мы можем сделать: следующий этап развития искусственного интеллекта связан не только с текстовыми ответами, а с обработкой живой, сложной, временной реальности: голоса, шумов, эмоций, длинных диалогов и контекста. Именно такие открытые проекты, как GigaAM Multilingual и GigaChat Audio, приближают переход от привычных чат-ботов к по-настоящему универсальным мультимодальным системам.

