Nnets [Neural Networks] — старейший в России культовый ИИ-журнал о нейросетях, искусственном интеллекте и роботах.

Ежедневные новости и аналитика нейромира.

Авторские материалы, исследования, обзоры и подборки.

Будущее уже здесь!

Lance: новая мультимодальная модель от ByteDance теперь в топе Hugging Face!

Лаба Intelligent Creation компании ByteDance выложила Lance — модель, которая в единой архитектуре выполняет понимание, генерацию и редактирование изображений и видео.

При небольшом объёме параметров (6 млрд общих и 3 млрд активных) модель покрывает набор задач от генерации видео по тексту до субъект-ориентированной генерации.

Мы обратили внимание, что на второй день после публикации модель вошла в тройку лидеров рейтинга Hugging Face Trending.

Lance построена по принципу dual-stream MoE: специализированные пути для понимания и для генерации работают в общем контекстном пространстве, но обладают разной модельной ёмкостью.

Авторы придумали собственный механизм позиционного кодирования MaPE, который помогает модели различать роли разнородных визуальных токенов внутри одной последовательности. Когда Lance одновременно учится понимать и генерировать, в одну последовательность попадают визуальные токены разной природы: одни описывают исходное изображение для анализа, другие задают условие для генерации, третьи представляют сам будущий кадр на зашумлённой стадии. Стандартное позиционное кодирование сообщает модели только то, где каждый токен расположен в пространстве и во времени, но ничего не говорит о его роли — и при смешанном обучении модель легко начинает путать, что именно от неё требуется в данной точке.

MaPE добавляет к позиции дополнительный сигнал о принадлежности токена к функциональной группе — фактически снабжает каждый элемент меткой «это для понимания», «это условие», «это то, что нужно сгенерировать», при этом не ломая ни пространственную структуру изображений, ни временной порядок кадров видео. Модель по-прежнему видит «где» и «когда», но дополнительно понимает, «зачем» здесь оказался конкретный токен.

Тесты

  • VBench (генерация видео) — 85,11;
  • MVBench (понимание видео) — 62,0;
  • GenEval (генерация изображений) — 0,90;
  • GEdit-Bench (редактирование) — 7,30.

Лицензирование: Apache 2.0 License.

Полезные ссылки:


Ещё новости:

Субтитры без ручной расшифровки: SmartSub и WhisperSubTranslate.
Стильный промпт для переноса артов в швейцарском стиле со строгой сеткой и броскими цветами!
Jev: новый класс ИИ для быстрых решений и лучшие проекты на GitHub!
Китайский айтишник создал топовую локальную нейронку laya-mlx и заставил её играть в «Змейку».
Теренс Тао: темпы развития ИИ стали слишком быстрыми!
Лучшая 4D-визуализация движений: Gemini, Codex и three.js растянули время.
Китайская ботоферма с ИИ-роботом и физическим «пальцем» обходит проверки соцсетей.
ChatGPT и Claude ошибаются в финансовых вопросах в 57% случаев.
ChatGPT якобы сам отправил письмо в ФБР через Gmail пользователя.
«Ты же говорил, что так можно»: как ИИ выручает бухгалтеров на 1С и их руководителей.