Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Qwen3-ASR теперь в OpenRouter: распознавание речи на 0,6 и 1,7 млрд параметров.

Что появилось в OpenRouter

В OpenRouter появились модели Qwen3-ASR для распознавания речи с 0,6 и 1,7 млрд параметров. Сами модели Qwen выложены на Hugging Face ещё в конце января под лицензией Apache 2.0. Теперь их можно использовать через API без собственного сервера: 0,00018 доллара за минуту аудио у младшей модели и 0,00048 у старшей.

Поддержка языков и точность

Обе модели понимают 30 языков и 22 китайских диалекта, сами определяют язык, работают в потоковом и офлайн-режиме, принимают до 20 минут аудио за раз и распознают пение и речь поверх музыки. Русский язык в списке поддерживаемых присутствует.

По русскому языку в техническом отчёте модель 1.7B даёт WER 5,99% на FLEURS и 8,28% на CommonVoice, то есть примерно шесть и восемь неверно распознанных слов из ста. Младшая модель 0.6B заметно слабее: 9,91 и 14,07. Закрытая Qwen3-ASR-Flash точнее обеих: 4,81 и 5,73. Прямого сравнения с Whisper по русскому языку в отчёте нет, а на общей таблице по 30 языкам Whisper large-v3 обходит старшую модель: 8,16 против 12,60.

Скорость обработки

Основное преимущество Qwen3-ASR в скорости. На одной видеокарте модель 1.7B обрабатывает около 67 минут аудио за минуту работы, 0.6B около 108, а в пакетном режиме на 128 потоках счёт идёт на тысячи. В независимом русском тесте на Mac у 0.6B были ошибки в именах и пропадала пунктуация, поэтому для созвонов с терминами мы советуем проверять младшую модель.

Этот пост Вконтакте:

Ещё новости:

Anthropic включает Auto Mode по умолчанию в Claude Code: ИИ-проверяющий будет принимать решения без участия человека.
OpenAI открыла защитникам доступ к GPT-5.6-Cyber: модель ищет уязвимости нулевого дня и собирает цепочки эксплойтов.
xAI выпустила Grok 4.6: модель сравнялась с GPT-5.6 Sol и стала экономичнее Opus 5.
DeepSeek V4 Pro 0813 тихо вышел в API: миллион токенов контекста и цены от 0,435 доллара.
ByteDance добавила в OpenRouter Seed 2.0 Code, Seed 2.1 Turbo и видеогенератор Seedance 2.0 Mini.
OpenAI показала Ultrafast для GPT-5.6 Sol: до 750 токенов в секунду.
Google выпустила Gemini 3.7 Flash: модель для агентов и кодинга уже в OpenRouter.
Опенсорсная библиотека Kinetics: 140+ анимаций для интерфейсов с кодом для CSS и React.
ИИ-агенты Anthropic воевали и пытались отключить друг друга, лишь бы выполнить задание.
ИИ незаметно захватывает Open Source: доля AI-коммитов на GitHub выросла в десять раз.