Компания World Labs представила Atlas — универсальную модель для работы с изображениями, видео и трёхмерными сценами. Она может по одному или нескольким снимкам восстановить пространство, показать его с нового ракурса и сгенерировать движение камеры по заданной траектории.
Atlas обучали с нуля одновременно на тексте, изображениях, видео, положении камер и 3D-данных. В основе модели лежит диффузионный трансформер: он постепенно формирует результат, учитывая общую структуру сцены.
Главное отличие от обычных видеогенераторов — камера задаётся не словами вроде «панорама» или «наезд», а точными координатами, углами и маршрутом. Модель достраивает части пространства, которых не было видно на исходных кадрах, и старается сохранить форму и расположение объектов.
В демонстрациях World Labs использовала от одного до шести изображений. Один из примеров — минутное видео в разрешении 1440p. Это показывает верхнюю границу заявленных возможностей, но не означает, что любой ролик будет иметь такое качество и длительность.
В тестах самой компании независимые оценщики чаще выбирали Atlas за точность движения камеры: в 81% сравнений с Gemini Omni Flash, в 75% — с MiniMax H3 и в 94% — с Seedance 2.5. Эти результаты пока не воспроизводились независимо, а соперникам давали текстовые инструкции вместо точной траектории.
Atlas также создаёт облака точек и 3D Gaussian splats — наборы объёмных элементов, из которых можно собрать сцену для просмотра в реальном времени. По данным World Labs, двух-трёх снимков часто хватает для узнаваемой реконструкции, а для более точной модели можно загрузить свыше 100 изображений.
Компания показала применение Atlas для эффекта bullet time, симуляции взаимодействия объектов и обучения роботов на виртуальных RGB-кадрах и картах глубины. Пока это демонстрации, а не доказательство универсальной физической симуляции.
Atlas доступен только отдельным партнёрам в режиме раннего доступа. Публичных цен, весов модели и открытого API у него нет.