Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

OpenAI выпустила GPT Transcribe для расшифровки аудио. Насколько она хороша для русского языка?

OpenAI выпустила GPT Transcribe, новую модель для расшифровки аудио. Она дешевле прежней и умеет учитывать подсказку с темой записи, а также список терминов, чтобы не путать аббревиатуры. Лаборатория Artificial Analysis сразу протестировала её и поставила на девятое место в своём рейтинге.

Метрикой выступает WER, то есть доля слов, которые модель распознала неправильно. У лидеров таблицы Artificial Analysis, а именно у моделей Alibaba и ElevenLabs, этот показатель составляет около 2%, тогда как новая версия от OpenAI показывает 3,3%.

Важно понимать, что все эти замеры проводились на английском языке. Весь набор данных Artificial Analysis англоязычный, а на популярном лидерборде Hugging Face к нему добавляются лишь пять других европейских языков. Русского нет ни в одном из этих тестов, поэтому общее место в рейтинге ничего не говорит о качестве работы с русской речью.

Для русского языка исследования проводятся отдельно, и здесь лидеры получаются совсем другие. Лучше всех справляется модель GigaAM от Сбера, а рядом с ней держится T-One от Т-Банка, которая обучалась на записях телефонных звонков. Обе они имеют открытые веса и отлично работают на своих данных. Привычная модель Whisper заметно уступает им в русскоязычных тестах.

Степень отставания сильно зависит от того, какую именно речь нужно расшифровать. На чистом, хорошо начитанном аудио разница минимальна: в наборе данных FLEURS показатель WER у Whisper составляет 3,1 против 3,6 у GigaAM. С диктором в тишине обе справляются одинаково. Однако всё меняется на реальных записях. В тесте на десяти русскоязычных наборах, куда входят телефонные звонки, видео из YouTube, записи с далёкого микрофона и речь с нарушениями, средний WER у GigaAM достигает 8,3, тогда как у Whisper он равен 21,0. Решающим фактором становятся шум, качество телефонной линии и живой разговор с перебиваниями.

Среди облачных сервисов для расшифровки русской речи в независимых тестах лучше всего себя показал Scribe v2 от ElevenLabs, а за ним следуют AssemblyAI и Deepgram.

Этот пост Вконтакте:

Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.