Lance: новая мультимодальная модель от ByteDance теперь в топе Hugging Face!
Лаба Intelligent Creation компании ByteDance выложила Lance — модель, которая в единой архитектуре выполняет понимание, генерацию и редактирование изображений и видео.
При небольшом объёме параметров (6 млрд общих и 3 млрд активных) модель покрывает набор задач от генерации видео по тексту до субъект-ориентированной генерации.
Мы обратили внимание, что на второй день после публикации модель вошла в тройку лидеров рейтинга Hugging Face Trending.
Lance построена по принципу dual-stream MoE: специализированные пути для понимания и для генерации работают в общем контекстном пространстве, но обладают разной модельной ёмкостью.
Авторы придумали собственный механизм позиционного кодирования MaPE, который помогает модели различать роли разнородных визуальных токенов внутри одной последовательности. Когда Lance одновременно учится понимать и генерировать, в одну последовательность попадают визуальные токены разной природы: одни описывают исходное изображение для анализа, другие задают условие для генерации, третьи представляют сам будущий кадр на зашумлённой стадии. Стандартное позиционное кодирование сообщает модели только то, где каждый токен расположен в пространстве и во времени, но ничего не говорит о его роли — и при смешанном обучении модель легко начинает путать, что именно от неё требуется в данной точке.
MaPE добавляет к позиции дополнительный сигнал о принадлежности токена к функциональной группе — фактически снабжает каждый элемент меткой «это для понимания», «это условие», «это то, что нужно сгенерировать», при этом не ломая ни пространственную структуру изображений, ни временной порядок кадров видео. Модель по-прежнему видит «где» и «когда», но дополнительно понимает, «зачем» здесь оказался конкретный токен.
Тесты
- VBench (генерация видео) — 85,11;
- MVBench (понимание видео) — 62,0;
- GenEval (генерация изображений) — 0,90;
- GEdit-Bench (редактирование) — 7,30.
Лицензирование: Apache 2.0 License.
Полезные ссылки:

