Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Lance: новая мультимодальная модель от ByteDance теперь в топе Hugging Face!

Лаба Intelligent Creation компании ByteDance выложила Lance — модель, которая в единой архитектуре выполняет понимание, генерацию и редактирование изображений и видео.

При небольшом объёме параметров (6 млрд общих и 3 млрд активных) модель покрывает набор задач от генерации видео по тексту до субъект-ориентированной генерации.

Мы обратили внимание, что на второй день после публикации модель вошла в тройку лидеров рейтинга Hugging Face Trending.

Lance построена по принципу dual-stream MoE: специализированные пути для понимания и для генерации работают в общем контекстном пространстве, но обладают разной модельной ёмкостью.

Авторы придумали собственный механизм позиционного кодирования MaPE, который помогает модели различать роли разнородных визуальных токенов внутри одной последовательности. Когда Lance одновременно учится понимать и генерировать, в одну последовательность попадают визуальные токены разной природы: одни описывают исходное изображение для анализа, другие задают условие для генерации, третьи представляют сам будущий кадр на зашумлённой стадии. Стандартное позиционное кодирование сообщает модели только то, где каждый токен расположен в пространстве и во времени, но ничего не говорит о его роли — и при смешанном обучении модель легко начинает путать, что именно от неё требуется в данной точке.

MaPE добавляет к позиции дополнительный сигнал о принадлежности токена к функциональной группе — фактически снабжает каждый элемент меткой «это для понимания», «это условие», «это то, что нужно сгенерировать», при этом не ломая ни пространственную структуру изображений, ни временной порядок кадров видео. Модель по-прежнему видит «где» и «когда», но дополнительно понимает, «зачем» здесь оказался конкретный токен.

Тесты

  • VBench (генерация видео) — 85,11;
  • MVBench (понимание видео) — 62,0;
  • GenEval (генерация изображений) — 0,90;
  • GEdit-Bench (редактирование) — 7,30.

Лицензирование: Apache 2.0 License.

Полезные ссылки:


Ещё новости:

Вышел Skales: полезный ИИ-агент, который запустится даже на слабом ПК.
Эндрю Ын представил open source ИИ-агента OpenWorker.
Авито запустил флешмоб: что пользователи никогда не доверят ИИ?
Любую книгу можно превратить в навык для нейросети: вышел конвертер book-to-skill.
Anthropic научит Claude проектировать процессоры.
Higgsfield выложили 95-минутный ИИ-фильм Hell Grind со всеми промптами.
Cloudflare выдал ИИ-агентам кошельки и читаемые адреса для оплаты API и контента.
Бывший сотрудник Google запустил «AI-бота», который оказался обычным человеком.
Человек с помощью Claude написал Bluetooth-радар для поиска телефона.
Бабушкины сказки от нейросетей: родители бьют тревогу.