Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

OpenAI выпустила GPT Transcribe для расшифровки аудио. Насколько она хороша для русского языка?

OpenAI выпустила GPT Transcribe, новую модель для расшифровки аудио. Она дешевле прежней и умеет учитывать подсказку с темой записи, а также список терминов, чтобы не путать аббревиатуры. Лаборатория Artificial Analysis сразу протестировала её и поставила на девятое место в своём рейтинге.

Метрикой выступает WER, то есть доля слов, которые модель распознала неправильно. У лидеров таблицы Artificial Analysis, а именно у моделей Alibaba и ElevenLabs, этот показатель составляет около 2%, тогда как новая версия от OpenAI показывает 3,3%.

Важно понимать, что все эти замеры проводились на английском языке. Весь набор данных Artificial Analysis англоязычный, а на популярном лидерборде Hugging Face к нему добавляются лишь пять других европейских языков. Русского нет ни в одном из этих тестов, поэтому общее место в рейтинге ничего не говорит о качестве работы с русской речью.

Для русского языка исследования проводятся отдельно, и здесь лидеры получаются совсем другие. Лучше всех справляется модель GigaAM от Сбера, а рядом с ней держится T-One от Т-Банка, которая обучалась на записях телефонных звонков. Обе они имеют открытые веса и отлично работают на своих данных. Привычная модель Whisper заметно уступает им в русскоязычных тестах.

Степень отставания сильно зависит от того, какую именно речь нужно расшифровать. На чистом, хорошо начитанном аудио разница минимальна: в наборе данных FLEURS показатель WER у Whisper составляет 3,1 против 3,6 у GigaAM. С диктором в тишине обе справляются одинаково. Однако всё меняется на реальных записях. В тесте на десяти русскоязычных наборах, куда входят телефонные звонки, видео из YouTube, записи с далёкого микрофона и речь с нарушениями, средний WER у GigaAM достигает 8,3, тогда как у Whisper он равен 21,0. Решающим фактором становятся шум, качество телефонной линии и живой разговор с перебиваниями.

Среди облачных сервисов для расшифровки русской речи в независимых тестах лучше всего себя показал Scribe v2 от ElevenLabs, а за ним следуют AssemblyAI и Deepgram.

Этот пост Вконтакте:

Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.