Liquid AI показала компактную мультимодальную модель LFM2.5-VL-3B для смартфонов.
Мы изучили новую компактную мультимодальную модель Liquid AI LFM2.5-VL-3B, способную работать на смартфоне.
Модель обходит заметно более крупные аналоги в задачах, связанных с пониманием экранов, привязкой объектов и распознаванием текста.
Возможности модели
- Понимание экранов мобильных, веб и настольных интерфейсов
- Grounding: привязка объектов к координатам по запросу на естественном языке
- Полностраничное OCR с разметкой макета: текст, таблицы, формулы, графики
- Вызов функций и инструментов
- Работа с несколькими изображениями сразу
Технические характеристики
- База LFM2.5-2.6B плюс визуальный энкодер SigLIP2 NaFlex 400M
- Контекст 32 768 токенов, 16 языков, включая русский
- Около 3 ГБ памяти
- 20 токенов/с на Galaxy S26 Ultra
Подробнее: блог Liquid AI, Hugging Face, демо.

