Xiaomi открыла код модели Xiaomi-Robotics-1: vision-language-action для роботов.
Нас очень порадовала новость от Xiaomi: компания открыла исходный код и веса своей модели Xiaomi-Robotics-1 на Hugging Face. Это vision-language-action система, которая объединяет изображение с камеры, текстовые команды и действия робота.
Модель выполняет разнообразные команды в незнакомых помещениях без дообучения под конкретную задачу. Она управляет мобильным роботом с двумя манипуляторами и подвижным корпусом: машина сама перемещается по комнатам, подъезжает к нужному предмету, берёт его и ставит на место. Робот ориентируется только по камере и текстовой команде, без телеуправления и без заранее прописанного сценария, причём и помещения, и конкретные предметы он раньше не видел.
Xiaomi уже выпустила такого робота в реальные квартиры. Он наводил порядок на диване, раскладывал обувь, прибирал стол и складывал вещи в сумку, то есть отрабатывал всю цепочку от навигации по комнате до захвата объекта «с нуля», а не по заученному маршруту.
Отдельно робот справляется с физически неудобными сценариями: он загружает стиральную машину, заправляет принтер, орудуя гибкими листами бумаги, и упаковывает смартфон.
Xiaomi открывает код и веса сразу в трёх размерах: 2, 5 и 10 млрд параметров. Смысл в том, что одна и та же модель переносится на разные корпуса роботов и предсказуемо улучшается с ростом данных и масштаба.

