GigaChat открыла модели анализа речи: аудио-Native LLM, мультиязычный ASR и датасет TimeGround-1M.
Что представили
Команда GigaChat открыла две модели и датасет:
- GigaChat3.1-Audio-10B-A1.8B — audio-native LLM
- GigaAM-Multilingual — мультиязычный ASR
- TimeGround-1M — датасет для привязки событий ко времени в длинном аудио
GigaChat Audio работает со звуком напрямую, без промежуточной расшифровки в текст. Модель ведёт диалог по записи, распознаёт речь, переводит, классифицирует и собирает выжимку с таймкодами. Она способна удерживать до двух часов аудио, обрабатывая созвон или лекцию целиком без нарезки на куски.
Загрузив запись, можно получить резюме и таймкоды, чтобы быстро перемотать к нужному моменту. Ключевое преимущество в том, что модель понимает не только что сказали, но и когда.
GigaAM-Multilingual обеспечивает распознавание речи на русском, английском, казахском, киргизском и узбекском языках. Энкодер предобучен на 2 млн часов и 70+ языках, поэтому дообучение под новый язык или домен требует скромных объёмов данных. Например, грузинский и башкирский языки подняли с одного датасета Common Voice до WER ~4%.
TimeGround-1M представляет собой данные, а не веса. Веса сейчас открывают многие, а полноценные датасеты появляются заметно реже. Этот набор позволяет обучать собственные модели привязки событий ко времени.
Что можно собрать уже сейчас
- ассистент по встречам и лекциям
- поиск по аудиозаписям
- выжимки с таймкодами
- ASR для ботов и приложений
- дообучение под свой язык и домен
У Audio-модели 10 млрд параметров, из которых активны 1,8 млрд, так что её реально запустить на собственном железе. Обе статьи приняты на Interspeech 2026.
Hugging Face:
GigaChat3.1-Audio-10B-A1.8B
GigaAM-Multilingual
TimeGround-1M
Научные статьи:
arXiv:2607.10387
arXiv:2607.10371

