Mobile-O: мультимодальная модель для iPhone, работающая полностью на устройстве.
Проект Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device представляет собой компактную модель с 0.5 или 1.5 миллиардами параметров. Она предназначена для понимания и генерации изображений полностью на мобильном устройстве, например, на iOS.
Одна модель решает задачи визуального понимания, описания, оптического распознавания символов (OCR) и генерации изображений по тексту. Переключение между функциями происходит через чат-интерфейс.
- Генерация изображения занимает около 3 секунд.
- Анализ изображения — примерно 0.4 секунды.
- Модель требует менее 2 ГБ памяти на устройствах с чипами iPhone A17+ или M-series и работает без облачных вычислений.
Архитектура модели включает несколько компонентов:
- FastVLM-0.5B для обработки визуальной и языковой информации.
- SANA-600M — диффузионную модель для генерации.
- Mobile Conditioning Projector для работы с текстовыми запросами.
Ссылки на проект:

