Стартап Фей-Фей Ли научил нейросеть собирать 3D-мир из обычных фотографий

Она доступна отдельным партнёрам в рамках раннего доступа

2 мин.
Стартап Фей-Фей Ли научил нейросеть собирать 3D-мир из обычных фотографий

Стартап World Labs, который основала Фей-Фей Ли, показал мультимодальную модель Atlas для создания трёхмерных сцен по фотографиям и видео. Система работает с текстом, изображениями, роликами и 3D-данными, собирает детализированные пространства и видео в разрешении 1440p, а также строит виртуальные среды для обучения роботов.

Atlas уже доступна отдельным партнёрам в рамках раннего доступа.
Atlas способна принять от 1 до 6 изображений и заданное направление движения камеры, после чего генерирует ролик длительностью до минуты. Виртуальная камера двигается под выбранными углами по заданному маршруту, а система самостоятельно достраивает участки пространства, которых не было видно на исходных кадрах.

Модель умеет превращать несколько обычных фотографий реального помещения в его трёхмерную реконструкцию. Чаще всего для этого хватает 2 или 3 снимков, хотя Atlas способна обработать десятки и даже больше сотни изображений.

Результатом становятся новые ракурсы пространства, карты глубины, облака точек и 3D Gaussian Splats, где объёмная сцена представлена множеством небольших элементов, распределённых в пространстве.

Atlas способна восстановить трёхмерную структуру пространства по обычной записи, а затем показать происходящее с точек, которых в оригинальном ролике вообще не было. Так получается эффект буллет-тайм, и одно событие можно рассматривать с разных сторон, перемещая виртуальную камеру. Для демонстраций World Labs использовала смартфоны и экшн-камеры вместо специализированных систем объёмной съёмки.

Модель способна не только восстановить окружающее пространство, но и спрогнозировать, что увидят камеры робота во время движения по выбранному маршруту.

Atlas создаёт изображения и карты глубины с перспективы камер, установленных на роботе. Система умеет моделировать перемещение объектов и их взаимодействие, а также менять положение предметов, освещение и другие параметры среды. World Labs называет эту концепцию Real-to-Sim, то есть переносом информации из реального пространства в виртуальную симуляцию для подготовки обучающих и тестовых сред.

С технической стороны Atlas представляет собой мультимодальный авторегрессионный диффузионный трансформер. Модель помещает разные виды данных в общий контекст и последовательно формирует новые элементы, совмещая методы, характерные для языковых, графических и видеосистем.

Главная особенность Atlas в том, что изображения, глубина и положение камеры рассматриваются не как разрозненные данные, а как элементы одной пространственной конструкции. За счёт этого система способна сохранять взаимосвязь между объектами и их расположением в трёхмерной среде.

World Labs проверила Atlas на 2 задачах, связанных с генерацией видео по маршруту камеры и восстановлением 3D-пространства по нескольким изображениям. В 1-м испытании независимые оценщики сравнивали результаты Atlas с современными видеомоделями и выбирали работу Atlas в диапазоне от 75 до 94% случаев в зависимости от конкурирующей системы.

Во втором эксперименте Atlas сопоставили со специализированными открытыми моделями по точности трёхмерной реконструкции. Представители World Labs сообщили о меньшей средней ошибке своей системы. При этом все приведённые результаты опубликовала сама компания, и пока они не получили независимого подтверждения.

В дальнейшем технология должна стать основой новых версий Marble, продукта World Labs для создания полноценных трёхмерных миров.