Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Сбер открыл две open source аудиомодели: GigaAM Multilingual и GigaChat Audio!

Искусственный интеллект уверенно осваивает аудио: современные решения уже не просто превращают речь в текст, но и анализируют эмоции, звуковой контекст и временные события. Сбер сделал важный шаг в этом направлении, опубликовав в открытом доступе сразу две модели: GigaAM Multilingual и GigaChat Audio, которые наглядно показывают эволюцию Speech AI.

Обе модели выложены на Hugging Face (см. коллекцию audiomodels).

GigaAM Multilingual: транскрипция на 70+ языках

GigaAM Multilingual предобучена на 2 миллионах часов речи на более чем 70 языках и дообучена для распознавания русского, английского, казахского, киргизского и узбекского. Это не только инженерное достижение, но и шаг к более инклюзивному ИИ, отлично работающему с русским и так называемыми low-resource языками.

GigaChat Audio: диалоги, эмоции и поиск событий в длинных записях

GigaChat Audio умеет вести многошаговые диалоги по аудио, распознавать речь и эмоции, переводить, классифицировать звуки и привязывать события к временной шкале. Модель обрабатывает записи длительностью до 2 часов и показывает сильные результаты в temporal grounding, уверенно локализуя события в продолжительных аудиоматериалах.

  • ai-sage/GigaChat3.1-Audio-10B-A1.8B (10B параметров, около 1.8B активных, MoE-архитектура поверх текстовой GigaChat 3.1, лицензия MIT)

Открытые данные для привязки ко времени

Вместе с моделями команда опубликовала синтетический англоязычный датасет TimeGround-1M. Он предназначен для обучения систем, связывающих события с конкретными моментами времени. Это отличный пример того, как развитие ИИ сегодня опирается не только на архитектурные инновации, но и на качественно размеченные данные, поднимающие планку для целых классов задач.

Главный вывод, который мы можем сделать: следующий этап развития искусственного интеллекта связан не только с текстовыми ответами, а с обработкой живой, сложной, временной реальности: голоса, шумов, эмоций, длинных диалогов и контекста. Именно такие открытые проекты, как GigaAM Multilingual и GigaChat Audio, приближают переход от привычных чат-ботов к по-настоящему универсальным мультимодальным системам.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.