Qwen3-ASR теперь в OpenRouter: распознавание речи на 0,6 и 1,7 млрд параметров.
Что появилось в OpenRouter
В OpenRouter появились модели Qwen3-ASR для распознавания речи с 0,6 и 1,7 млрд параметров. Сами модели Qwen выложены на Hugging Face ещё в конце января под лицензией Apache 2.0. Теперь их можно использовать через API без собственного сервера: 0,00018 доллара за минуту аудио у младшей модели и 0,00048 у старшей.
Поддержка языков и точность
Обе модели понимают 30 языков и 22 китайских диалекта, сами определяют язык, работают в потоковом и офлайн-режиме, принимают до 20 минут аудио за раз и распознают пение и речь поверх музыки. Русский язык в списке поддерживаемых присутствует.
По русскому языку в техническом отчёте модель 1.7B даёт WER 5,99% на FLEURS и 8,28% на CommonVoice, то есть примерно шесть и восемь неверно распознанных слов из ста. Младшая модель 0.6B заметно слабее: 9,91 и 14,07. Закрытая Qwen3-ASR-Flash точнее обеих: 4,81 и 5,73. Прямого сравнения с Whisper по русскому языку в отчёте нет, а на общей таблице по 30 языкам Whisper large-v3 обходит старшую модель: 8,16 против 12,60.
Скорость обработки
Основное преимущество Qwen3-ASR в скорости. На одной видеокарте модель 1.7B обрабатывает около 67 минут аудио за минуту работы, 0.6B около 108, а в пакетном режиме на 128 потоках счёт идёт на тысячи. В независимом русском тесте на Mac у 0.6B были ошибки в именах и пропадала пунктуация, поэтому для созвонов с терминами мы советуем проверять младшую модель.

