Tencent открыла семейство мультимодальных эмбеддингов WeMM-Embedding.
Tencent открыла набор мультимодальных эмбеддингов. Команда WeChat китайского техгиганта выложила в открытый доступ семейство эмбеддинг-моделей WeMM-Embedding, предназначенных для создания универсальных векторных представлений.
Набор работает с текстом, изображениями, видеороликами, сложными визуальными документами и смешанным контентом, объединяя их в единое семантическое пространство. Эмбеддинги учили с использованием Matryoshka Representation Learning, который позволяет на этапе применения обрезать размерность вектора, экономя память и вычисления. Построено семейство на Qwen3.5, на выходе младшая модель дает нормализованный вектор на 2048 измерений, а старшая на 4096.
В Tencent приводят цифру, что при сжатии до 256 измерений двухмиллиардная модель сохраняет 98,7% исходного качества на задачах с фото и видео.
Опубликованы веса трех размерностей: 2B, 4B и 9B.
Тесты
9B берет новый лучший общий результат на MMEB-v2 (80,6 балла), а 2B обходит Qwen3-VL-Embedding, который вчетверо больше нее. Но есть аргумент сильнее бенчмарков: семейство работает в рекомендациях и поиске WeChat. Оно развернуто для обработки каналов, аккаунтов и электронной коммерции. Команда мессенджера говорит, что WeMM-Embedding показали стабильные улучшения в 14 онлайновых A/B-тестах.
Модели работают с библиотекой Transformers и поддерживаются vLLM и SGLang. Единственным ограничением текущей версии является отсутствие поддержки аудио.
Лицензирование
Apache 2.0 License.

