Cohere Labs выпустила North Micro Vision: самая маленькая VLM компании сохраняет исходное разрешение картинок!
Мы изучили, чем выделяется новая модель Cohere Labs. Компания выпустила компактную зрительно-языковую модель North Micro Vision на 2,4 млрд параметров. Это самая маленькая модель в линейке VLM компании. Главная особенность в том, что она работает с изображением в исходном разрешении.
Обычно картинку перед подачей в модель сжимают, из-за чего мелкий текст, разметка таблиц и подписи на графиках теряются. Здесь пропорции сохраняются, а верхняя планка соответствует странице A4, отсканированной при 200 dpi. Отсюда и заявленная область применения: документы, таблицы, графики, скриншоты, формы.
Компактный размер удобен для дообучения под свою предметную область. Квантованные сборки, по словам Cohere, пойдут не только на сервере, но и на ноутбуке или устройстве мобильного класса.
Архитектура
Зрительный энкодер на 400 млн параметров вырос из SigLIP 2 и держит исходное разрешение за счёт двумерного RoPE вместе с обученными одномерными позиционными эмбеддингами.
Языковая часть: собственная North Micro LLM на 2 млрд параметров, повторяющая архитектуру Command A+. Три слоя внимания со скользящим окном и RoPE чередуются с одним глобальным слоем, который работает вообще без позиционных эмбеддингов. Получается разделение труда: окна с RoPE держат локальный контекст, глобальный слой смотрит на всё сразу и в разметке позиций не нуждается.
Между ними проектор, и здесь изюминка. Вместо того чтобы отдать языковой модели один готовый набор признаков, Cohere подмешивает эмбеддинги патчей с нескольких уровней зрительного энкодера в соответствующие ранние слои языковой модели. Так модель видит картинку сразу на разных степенях обобщения. Принцип взят из DeepStack.
Тесты
Замеры проводили через VLMEvalKit, сравнивая с восемью моделями размером от 1,6 до 5,1 млрд параметров.
Сильнее всего North Micro Vision выглядит там, куда её и целили. На DocVQA 0,921, на ChartQA 0,808, на AI2D 0,775, на RefCOCO 0,732. Это втрое выше, чем у Ministral и Qwen3-VL.
Общий язык и рассуждение даются слабее. На MMMU 0,329, худший результат в таблице. На MMLU и MMLU-Pro модель тоже уступает большинству соседей.
Лицензирование: Apache 2.0 License.

