X2SAM: мультимодальная модель сегментации объектов на изображениях и видео на базе SAM.
Мы рады представить мультимодальную модель X2SAM, основанную на Segment Anything Model (SAM). Она предназначена для точной сегментации объектов на изображениях и в видео, показывая впечатляющие результаты в тестах COCO и LongVideoBench.
Ключевые особенности
- Работает и с картинками, и с видео.
- Принимает текстовые инструкции и визуальные подсказки: точки, bounding boxes, готовые маски.
- Использует Mask Memory для хранения визуальных признаков, что гарантирует стабильность масок между кадрами видео.
Познакомиться с X2SAM можно на официальном сайте, изучить код на GitHub, скачать веса с Hugging Face или опробовать в интерактивном демо.

