월드랩스, 텍스트·이미지·비디오·3D 통합 월드 모델 '아틀라스' 공개
World Labs가 텍스트, 이미지, 비디오, 3D를 하나의 공간적 컨텍스트로 처리하는 차세대 범용 월드 모델 '아틀라스(Atlas)'를 발표했습니다. 아틀라스는 멀티모달 자기회귀 확산 트랜스포머로, 픽셀 단위 카메라 제어가 가능한 이미지·영상 생성(최대 1분, 1440p), 실제 장면의 3D 재구성, 시공간 시뮬레이션, 텍스트 기반 이미지·360도 파노라마 생성 등 폭넓은 작업을 수행합니다. 이는 창작 도구를 넘어 로봇 학습용 Real-to-Sim 워크플로우 등 공간 지능(Spatial Intelligence) 분야의 핵심 인프라로 주목받습니다.
월드 모델(World Model)은 모든 가능한 세계를 생성, 재구성, 시뮬레이션합니다. 월드 모델은 세계가 어떻게 보이고, 어떻게 행동하며, 어떻게 변화하는지 이해함으로써 창작자를 위해 상상 속 세계를 렌더링하고, 실제 세계를 고해상도로 시뮬레이션하며, 로봇이 행동을 계획하도록 돕습니다. World Labs는 공간 지능(spatial intelligence)을 추구하기 위해 이러한 범용 월드 모델을 개발하고 있습니다. 오늘 우리는 차세대 월드 모델인 아틀라스(Atlas)를 소개합니다.
아틀라스는 텍스트, 이미지, 비디오, 3D를 자연스럽게 다룰 수 있도록 처음부터 사전학습된 올라인 모델(omni model)입니다. 아틀라스는 멀티모달 자기회귀 확산 트랜스포머(multimodal autoregressive diffusion transformer)로, 모든 입력이 하나의 공유된 공간적 컨텍스트(spatial context)로 결합됩니다. 아틀라스는 이 컨텍스트를 활용해 다음에 올 내용을 생성하며, 지금까지 본 모든 것과 3D적으로 일관성을 유지하고 그 너머에 있는 것을 상상해냅니다.
아틀라스는 확장 가능하도록 설계되었습니다. 학습 컴퓨팅이 늘어날수록 성능이 향상되며, 앞으로 계속 확장해도 이 추세가 유지될 것으로 기대합니다.
아틀라스는 월드 생성, 재구성, 시뮬레이션에 걸친 폭넓은 작업을 수행할 수 있습니다:
카메라 제어 생성(Camera-Controlled Generation): 아틀라스는 하나 이상의 이미지로부터 픽셀 단위로 정밀한 카메라 제어와 함께 이미지와 비디오를 생성하며, 최대 1분 길이의 1440p 비디오를 출력합니다.
공간 재구성(Spatial Reconstruction): 아틀라스는 1장에서 수십 장의 입력 이미지로 실제 세계 장면을 재구성합니다. 새로운 시점의 이미지 프레임과 명시적 3D 출력을 모두 생성하며, 3D 재구성에 특화된 최신 모델들을 능가합니다.
시공간 시뮬레이션(Space-Time Simulation): 아틀라스는 입력 비디오에서 공간과 시간을 모델링하여 극적인 시각 효과를 위한 비디오 리프레이밍(reframing)과 로봇 분야의 Real-to-Sim 워크플로우를 가능하게 합니다.
이미지 생성(Image Generation): 아틀라스는 텍스트로부터 이미지와 360도 파노라마를 생성합니다. 복잡한 프롬프트를 따르고, 텍스트를 렌더링하며, 다양한 시각 스타일을 생성할 수 있습니다.
아틀라스는 향후 버전의 마블(Marble) 및 World Labs의 다른 제품들을 구동할 예정입니다. 아틀라스에 대한 얼리 액세스를 신청하세요.
카메라 제어 생성
아틀라스는 하나 이상의 참조 이미지를 받아 지정한 임의의 카메라 위치와 각도에서 새로운 시점을 생성합니다. 생성된 시점은 입력 이미지의 내용과 형상과 일치하며, 입력에 보이지 않는 장면 부분을 상상하며 그 너머로 부드럽게 외삽(extrapolate)합니다. 아틀라스는 다양한 유형의 장면, 시각 스타일, 카메라 움직임을 처리합니다.
픽셀 단위의 정밀한 카메라 제어
아틀라스는 정밀한 카메라 지오메트리를 기본 입력 유형으로 사용하여, 텍스트 기반의 대략적인 카메라 지시를 넘어섭니다. 이를 통해 모든 샷의 구도를 잡고 모든 움직임을 제어할 수 있습니다. 여기 예시에서 아틀라스는 단일 입력 이미지로부터 완전한 장면을 생성합니다. 입력 이미지의 내용과 폭넓은 세계 지식을 활용해 새로운 각도에서 장면이 어떻게 보일지 상상합니다. 예를 들어 로봇의 뒷면을 생성하고, 수영장 옆에 잔디밭이 있어야 한다고 추론합니다.
공간적 컨텍스트를 활용한 생성
LLM과 마찬가지로 아틀라스는 먼저 입력을 컨텍스트로 인코딩한 다음, 그 컨텍스트에 조건을 맞춰 출력을 생성합니다. 그러나 아틀라스의 독특한 점은 각 이미지가 3D 공간상의 위치에 기반(grounded)한다는 것이며, 이것이 '공간적 컨텍스트'를 형성합니다. 이 공간적 컨텍스트를 관리하면 완전히 새로운 종류의 창작 제어가 가능해집니다. 예를 들어 서로 관련 없는 두 참조 이미지를 컨텍스트에 배치하고 3D 공간에서 위치를 지정하면, 아틀라스는 두 이미지 사이를 부드럽게 보간하는 세계를 생성합니다. 이러한 예시는 모델의 세계 지식과 창의성을 보여줍니다. 서로 관련 없는 입력 이미지 사이에 문, 복도, 구석 공간 등의 전환부를 상상해 만들어냅니다.
제어 가능한 롱 비디오
아틀라스는 카메라 움직임과 공간적 컨텍스트 관리를 결합하여 정밀한 제어로 긴 비디오를 생성할 수 있습니다. 모든 장면과 모든 카메라 앵글을 직접 설계할 수 있습니다. 이는 당신을 감독의 자리에 앉히는 것입니다. 장면을 직접 연출하는 것이지, 슬롯머신 레버를 당기는 것이 아닙니다. 아래 예시에서는 소수의 참조 이미지를 사용해 1440p 해상도의 1분 길이 비디오를 생성합니다. 장면을 가로지르는 카메라 경로를 직접 설계하면, 아틀라스가 일관된 세계를 생성합니다. 비디오의 나머지 부분도