Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Cohere Labs выпустила North Micro Vision: самая маленькая VLM компании сохраняет исходное разрешение картинок!

Мы изучили, чем выделяется новая модель Cohere Labs. Компания выпустила компактную зрительно-языковую модель North Micro Vision на 2,4 млрд параметров. Это самая маленькая модель в линейке VLM компании. Главная особенность в том, что она работает с изображением в исходном разрешении.

Обычно картинку перед подачей в модель сжимают, из-за чего мелкий текст, разметка таблиц и подписи на графиках теряются. Здесь пропорции сохраняются, а верхняя планка соответствует странице A4, отсканированной при 200 dpi. Отсюда и заявленная область применения: документы, таблицы, графики, скриншоты, формы.

Компактный размер удобен для дообучения под свою предметную область. Квантованные сборки, по словам Cohere, пойдут не только на сервере, но и на ноутбуке или устройстве мобильного класса.

Архитектура

Зрительный энкодер на 400 млн параметров вырос из SigLIP 2 и держит исходное разрешение за счёт двумерного RoPE вместе с обученными одномерными позиционными эмбеддингами.

Языковая часть: собственная North Micro LLM на 2 млрд параметров, повторяющая архитектуру Command A+. Три слоя внимания со скользящим окном и RoPE чередуются с одним глобальным слоем, который работает вообще без позиционных эмбеддингов. Получается разделение труда: окна с RoPE держат локальный контекст, глобальный слой смотрит на всё сразу и в разметке позиций не нуждается.

Между ними проектор, и здесь изюминка. Вместо того чтобы отдать языковой модели один готовый набор признаков, Cohere подмешивает эмбеддинги патчей с нескольких уровней зрительного энкодера в соответствующие ранние слои языковой модели. Так модель видит картинку сразу на разных степенях обобщения. Принцип взят из DeepStack.

Тесты

Замеры проводили через VLMEvalKit, сравнивая с восемью моделями размером от 1,6 до 5,1 млрд параметров.

Сильнее всего North Micro Vision выглядит там, куда её и целили. На DocVQA 0,921, на ChartQA 0,808, на AI2D 0,775, на RefCOCO 0,732. Это втрое выше, чем у Ministral и Qwen3-VL.

Общий язык и рассуждение даются слабее. На MMMU 0,329, худший результат в таблице. На MMLU и MMLU-Pro модель тоже уступает большинству соседей.

Лицензирование: Apache 2.0 License.

Статья Модель Демо

Этот пост Вконтакте:

Ещё новости:

Технический отчёт MiMo V2.6: Reinforcement Learning ускорен, но Сберу и Яндексу стоит сменить курс.
Вышел Jev Skill Suggestion: мод для Claude Code экономит токены в несколько раз.
Сотрудник уволился в первый рабочий день после контроля в Zoom. Как ИИ меняет удалёнку?
OpenAI запустила 4 бесплатных курса: ИИ для работы, разработки, бизнеса и учёбы.
Google представила открытый оркестратор AX для агентных задач.
Цифры те же, а смысл поехал: как вычитывать правки после ИИ?
Доля написанных нейросетями патчей ядра Linux выросла почти в 50 раз за 7 месяцев.
Google представила Googlebook: сенсорный OLED-экран, 14 часов автономности и встроенный Gemini.
Вышел Grok 4.7: новая модель xAI частично опережает GPT 5.6 Sol и Fable 5.1.
LLM по винтикам: исследовательница OpenAI опубликовала бесплатный конспект!