Ling-3.0-flash-VL опубликована на HuggingFace: зрение, видео, 256K контекста и MIT.
Мультимодальную модель Ling-3.0-flash-VL теперь можно найти на HuggingFace под лицензией MIT. Это MoE-архитектура: 5,5 млрд активных параметров из 124 млрд, на вход принимаются текст, изображения и видео, контекст достигает 256K.
На OpenRouter доступен бесплатный вариант. Платная версия стоит $0,06 за миллион входных токенов и $0,18 за выходные.
Внутри модели 42 слоя, где KDA и Gated MLA чередуются 5 к 1. VideoRoPE кодирует положение в кадре и порядок во времени, поэтому модель может искать события в длинном видео.
На Artificial Analysis Intelligence Index модель набрала 42 против 38 у текстовой Ling-3.0-flash. Это значит, добавление зрения повысило и общий индекс.
Локально модель запускается через SGLang, в карточке есть готовый docker-образ и рецепты. Для полного контекста 256K нужны четыре карты класса H200.

