Ant Group выпустила Ling-3.0-flash-VL: зрение и агентные задачи в 5,1 млрд активных параметров.
Что известно
Ant Group выпустила Ling-3.0-flash-VL, зрячую версию своей модели Ling-3.0-flash. Архитектура MoE: 5,1 млрд активных параметров из 124 млрд. Новая версия получила понимание изображений и поддержку визуальных агентных задач.
Бенчмарки
Модель сравнивают с Qwen3.8-27B, Gemini 3.5 Flash-Lite и Step-3.7-Flash. Ling-3.0-flash-VL лидирует по подсчёту объектов, распознаванию документов в OmniDocBench, агентным задачам с изображениями (ClawEval-MM с заметным отрывом, WebVoyager) и собственному тесту по чтению медицинских заключений. В MMMU-Pro она на уровне Gemini.
Ling-3.0-flash-VL отстаёт от Qwen3.8-27B в математике по изображениям, в Humanity's Last Exam, чтении графиков и вёрстке по скриншоту, а в WorldVQA сильно уступает Step-3.7-Flash.
Доступность
Весов и страницы модели пока нет ни на HuggingFace, ни на ModelScope. Лицензия текстовой Ling-3.0-flash: MIT.

