Nvidia показала Axolotl3D: ИИ дорисовывает невидимые части 3D-объектов.
Исследователи Nvidia показали Axolotl3D: модель, которая собирает 3D-объект из неполных данных и сама достраивает скрытые части.
Обычные генераторы 3D по картинке требуют, чтобы предмет был виден целиком. В реальной жизни так бывает не всегда: половину закрывает стол, часть не попала в кадр.
Axolotl3D принимает всё, что есть:
- до шести фотографий с разных ракурсов;
- положение камер;
- маски видимости, где отмечено, что именно закрыто;
- частичное облако точек, то есть уже известную геометрию.
Облако точек работает как якорь против галлюцинаций: известную форму модель не трогает, а придумывает только недостающее. Тем же способом можно править готовый меш: если перерисовать деталь на одном фото, объект перестроится.
В основе дообученная Hunyuan3D 2.1, признаки из фото извлекает DINOv2.
Модель учили на 407 тысячах 3D-объектов, которые специально портили: прятали части, вырезали куски и убирали ракурсы. Для обучения хватило восьми A100.

