BSH1_e8f43de41.png Seohui Bae 2026.08.05

[CVPR2026] Beyond Video World Models - 미래의 무엇을 예측해야 하는가

 

이미지 1. CVPR 2026 현장 속 LG AI연구원

 

이번 CVPR 2026 속 세션과 논문에서는 반복적으로 “World Model”이라는 키워드가 등장했습니다. 최근 World Model이라는 용어는 Genie 계열 모델과 같이 Action-Controllable Video 또는 Playable Environment를 생성하는 파운데이션 모델을 지칭하는 맥락에서 자주 사용되고 있습니다 [1,2]. 이와 같은 좁은 의미에서 World Model은 과거의 관측과 행동 정보를 입력 받아, 특정 행동의 결과로 나타날 미래 환경의 변화를 생성하거나 시뮬레이션하는 모델을 의미합니다. 

 

하지만 World Model이라는 용어가 항상 Video Generator만을 뜻해 온 것은 아닙니다. Model-Based Reinforcement Learning에서는 환경의 Latent Dynamics를 학습하고 그 안에서 Planning 또는 Policy Improvement를 수행하는 모델을 World Model이라 불러왔습니다 [3,4]. JEPA 계열의 Representation Learning에서는 Pixel Reconstruction 대신 Abstract Representation을 예측하는 방향이 제안되어 왔고 [5], 최근 Robot Learning에서는 미래 Frame 전체가 아니라 Object Trajectory, 3D Trace, Point Flow와 같이 Task에 직접 연결되는 구조를 예측하는 World Model도 등장하고 있습니다 [10, 11].

 

LG AI연구원이 CVPR 2026에서 확인한 연구들도 모두 같은 형태의 미래를 예측하지는 않았습니다. 어떤 모델은 Action에 따른 미래 Observation을 Video로 생성하고 [6], 어떤 모델은 Vision Foundation Model의 Feature Space에서 미래의 Semantic Change를 예측합니다 [8]. 또 다른 모델은 Robot Manipulation에 필요한 3D Motion을 직접 예측하거나 [10,11], 관측된 장면으로부터 물리적 Dynamics를 학습하여 미래 상태를 Extrapolation합니다 [12]

이 글에서는 CVPR 2026의 World Model 연구를 다음 두가지 질문을 중심으로 살펴봅니다.

첫째, 모델은 세계의 무엇을 표현하고 예측하는가? 미래 Observation 전체를 생성할 수도 있고, Semantic Feature의 변화를 예측하거나, Object Motion, 3D Geometry, Physical State처럼 Task와 직접 연결된 정보를 예측할 수도 있습니다. 

둘째, 예측된 정보는 무엇에 사용되는가? 생성된 미래는 Interactive Simulation에 사용될 수도 있고, Representation Learning, Planning, Robot Control 또는 Uncertainty-Aware Exploration에 사용될 수도 있습니다. 

LG AI연구원이 CVPR 2026에서 발표한 Align While Search(AWS)[9]도 이러한 문제의식과  맞닿아 있습니다. AWS는 미래 Frame을 생성하거나 Transition Dynamics를 학습하는 World Model은 아닙니다. 대신 Agent가 부분 관측 환경에서 현재까지 얻은 관측을 바탕으로 외부 세계에 대한 Belief를 갱신하고, 그 Belief를 이용해 불확실성을 줄일 수 있는 탐색 행동을 선택합니다. 즉 미래를 Rollout하기보다 의사결정에 필요한 현재의 Hidden World State를 추론합니다.

이 글에서는 먼저 Action-Controllable Video Generation을 Learned Simulator의 관점에서 살펴봅니다. 다음으로 미래를 완전한 Frame이 아닌 Predictive Feature로 표현하는 연구, 조작에 필요한 3D Trace와 Point Flow를 예측하는 연구, 그리고 물리적 상태의 Dynamics를 학습하는 연구를 차례로 살펴봅니다. 이후 Forward Prediction과는 다른 축에 있는 Belief-Space Inference로서 AWS를 소개하고, 마지막으로 LG AI연구원에서 연구 개발중인 Electronic Design Automation(EDA) 툴 개발 과정에는 어떤 형태의 World Representation이 실제 의사결정에 유용할지 논의합니다.
 

이 글을 관통하는 핵심 질문은 다음과 같습니다: World Model은 미래 세계를 얼마나 완전하게 생성해야 하는가? 또 좋은 의사결정을 내리는 데 충분한 상태는 무엇이고 어떻게 모델링 하나?

1. World Model을 읽는 두 축: Representation과 역할

World Model은 일반적으로 현재까지의 관측과 행동으로부터 미래 상태를 예측하는 모델로 표현할 수 있습니다.

pθrt+1:t+Hht,,at:t+H-1


여기서 ht는 현재까지의 Observation과 Action History를 요약한 상태이며, rt
는 모델이 예측하려는 World Representation입니다. 
 rt는 미래 Video Frame일 수도 있고, Learned Feature, Object Trajectory, 3D Geometry 또는 물리적 상태일 수도 있습니다.

 

이때 World Model을 구분하는 첫 번째 축은 어떤 Representation을 예측하는가입니다.

rt  xt, ,zt,τt ϕt 

여기서
xt는 사람이 직접 볼 수 있는 Observation, zt는 Learned Predictive Feature, τt는 Trajectory나 3D Trace와 같은 Task-Space Representation, ϕt는 Geometry와 Dynamics를 포함하는 Physical State를 나타냅니다.

두 번째 축은 예측된 Representation을 무엇에 사용하는가입니다. 미래 Video를 생성하더라도 목적은 다양할 수 있습니다. 시각적으로 자연스러운 영상을 만드는 것이 목적일 수도 있고, Agent가 여러 Action의 결과를 비교하는 Simulator로 사용하는 것이 목적일 수도 있습니다. 반대로 사람이 볼 수 있는 Video를 생성하지 않더라도, 예측된 Latent Feature나 Trajectory가 Planning과 Control에 충분하다면 World Model의 역할을 수행할 수 있습니다.

따라서 Representation 사이에는 반드시 다음과 같은 우열이나 계층 관계가 존재하는 것은 아닙니다.

VideoFeatureTracePhysics


각 Representation은 서로 다른 정보를 보존하며, 어떤 표현이 적절한지는 Downstream Decision Problem에 따라 달라집니다. Video는 관측 전체를 표현할 수 있지만 생성 비용이 높고, Feature는 효율적이지만 무엇을 보존할지 결정해야 합니다. Trace와 Point Flow는 Manipulation에 직접 필요한 Motion을 표현하지만 Appearance 정보는 버리며, Physical State는 Extrapolation에 유리하지만 학습해야 하는 Dynamics Structure가 더 강하게 요구됩니다.

이러한 관점에서 CVPR 2026의 연구들을 하나의 계층으로 정렬하기보다, 각 모델이 어떤 World State를 선택했으며 그 선택이 모델의 역할과 어떻게 정렬되는가를 살펴보고자 합니다. 

2. 미래 관측을 생성: Action-Controllable Video World Model

최근 World Model이라는 표현이 가장 강하게 연결되는 영역은 Action-Controllable Video Generation입니다. Genie 계열 모델이 대표적입니다 [1,2]. 이 계열의 모델은 대규모 Video Data로부터 환경의 Dynamics와 Latent Action과 Dynamics를 학습하고, 사용자의 입력이나 Agent의 Action에 반응하는 Interactive Environment를 생성합니다 [1].

 

이 관점에서 World Model은 다음과 같이 쓸 수 있습니다.

pθ(xt+1:t+H,xtat:t+H-1)


여기서
xt는 Frame 또는 Observation이고, at는 Action입니다. 모델은 Action Sequence가 주어졌을 때 그 결과로 나타날 미래 Observation Sequence를 생성합니다. Agent가 어떤 행동을 했을 때 세계가 어떻게 변하는지 Video로 Rollout할 수 있다면, 그 모델은 실제 환경을 대신하는 Learned Simulator로 사용할 수 있습니다 [1,2].

 
Video 형태의 Rollout이 제공하는 장점은 명확합니다. 생성 결과를 사람이 직접 확인할 수 있고, Object Appearance, Background, Camera Motion을 포함한 관측 전체를 표현할 수 있습니다. 또한 충분한 Controllability와 Temporal Consistency가 확보된다면, 생성된 환경 안에서 Agent를 학습하거나 여러 행동의 결과를 비교할 수 있습니다.
 
다만 이 목적을 달성하기 위해서는 단순한 Video Quality 이상의 능력이 요구됩니다. 모델은 Action의 결과를 일관되게 반영해야 하며, Object Identity와 Scene Structure를 긴 시간 동안 유지해야 합니다. 시각적으로 자연스러운 Video가 반드시 Action Consequence를 정확하게 시뮬레이션하는 것은 아니므로, Generative Quality와 World-Model Fidelity를 구분할 필요가 있습니다. 

2.1. Motus: Video, Action, Understanding을 하나의 모델로 
CVPR 2026의 Motus는 Video Generation과 Robot Action Modeling을 하나의 Architecture 안에서 통합하려는 사례입니다 [13]. 기존 Embodied Agent 시스템에서는 Video Generation, Environment Understanding, Action Prediction이 서로 다른 모델로 구성되는 경우가 많습니다. Motus는 Understanding, Video Generation, Action을 담당하는 Expert를 통합하고, 하나의 모델이 World Modeling, Vision-Language-Action Prediction, Inverse Dynamics, Video Generation, Video–Action Joint Prediction과 같은 여러 Mode 사이를 전환하도록 설계합니다.

Motus에서 특히 중요한 요소는 Latent Action입니다. Robot Dataset의 Action Label은 Embodiment와 Control Interface에 따라 크게 달라질 수 있습니다. Motus는 Optical Flow를 이용해 Observation 사이의 시각적 변화를 Latent Action으로 표현하고, 이를 통해 서로 다른 형태의 Video와 Robot Data에서 공유 가능한 Motion Information을 학습하려 합니다.

이 연구는 Action-Controllable Video World Model이 단순한 Environment Generator를 넘어, Perception과 Prediction, Control을 연결하는 Foundation Model로 확장되고 있음을 보여줍니다. World Model이 예측한 미래 Video와 Action Model이 생성한 Control Signal을 별개의 Module로 유지하기보다, 두 Modality를 함께 모델링함으로써 서로의 학습 신호를 공유하려는 방향입니다.

동시에 Motus의 모든 Modeling Mode를 동일한 의미의 World Model로 볼 필요는 없습니다. Video Generation, Inverse Dynamics, Action Prediction은 서로 다른 Conditional Distribution을 학습합니다. Motus의 핵심은 이들을 하나의 단일 Prediction Task로 환원한 것이 아니라, Video와 Action 사이의 공통 Motion Structure를 공유하는 Unified Architecture를 제시했다는 점에 있습니다.

Video World Model은 범용적이고 해석 가능한 Rollout을 제공하지만, 그만큼 높은 Modeling Cost를 요구합니다. 모든 Pixel을 생성한다는 것은 Task에 직접 필요하지 않은 Texture, Lighting, Background, Camera Noise까지 함께 모델링한다는 의미이기 때문입니다. 이 지점에서 미래 Observation 전체가 아니라, 미래를 이해하고 구분하는 데 필요한 Feature만을 예측하는 접근이 등장합니다.

이미지 2. Motus [13] 구조


3. 미래 Observation이 아니라 Predictive State를 예측 
모든 World Model이 미래 Frame을 사람이 볼 수 있는 형태로 생성할 필요는 없습니다. Agent가 행동 결과를 평가하거나 Downstream Perception Task를 수행하는 데 필요한 정보가 Representation Space에 보존된다면, 미래 Feature를 예측하는 것만으로도 유용한 World Model을 구성할 수 있습니다.
 
이러한 모델은 다음과 같이 나타낼 수 있습니다.

pθ(zt+1:t+H,ztc)

여기서
zt는 Action-Free Video Forecasting에서는 c에 명시적인 Action이 포함되지 않을 수도 있습니다.

이 접근의 핵심은 미래 Observation을 완전히 복원하는 것이 아니라, 미래 상태의 차이를 구분하는 데 필요한 Predictive Information을 보존하는 것입니다. Pixel Reconstruction에 필요한 모든 정보를 유지할 필요가 없으므로 모델의 계산량을 줄일 수 있으며, Semantic Forecasting이나 Depth, Segmentation과 같은 Downstream Task에 더 직접적으로 정렬된 Representation을 학습할 수 있습니다.

3.1. DeltaWorld: 미래 Frame이 아니라 Semantic Change를 생성하다
DeltaWorld는 Predictive Feature Space에서 Generative World Modeling을 수행하는 직접적인 사례입니다 [8]. 기존의 Video World Model은 한 Frame을 수백 또는 수천 개의 Spatial Token으로 표현하고, 미래의 모든 Token을 예측합니다. 그러나 연속된 두 Frame 사이에서는 Scene 전체가 바뀌기보다 일부 Object와 Camera의 Motion만이 변화하는 경우가 많습니다.

DeltaTok은 Vision Foundation Model에서 얻은 연속 Frame의 Feature Difference를 하나의 Continuous Delta Token으로 압축합니다. DeltaWorld는 이렇게 만들어진 Delta Token Sequence 위에서 여러 개의 Plausible Future를 생성합니다.

δtTψF(xt)-F(xt-1)pθδt+1:t+Hδt

여기서 F
는 Vision Foundation Model의 Feature Extractor이며, Tψ는 Feature Difference를 Compact Token으로 압축하는 Tokenizer입니다. 모델은 Future Frame 자체가 아니라 Feature Space에서 발생할 Semantic Change를 예측합니다.

이 표현은 512×512 Frame을 사용하는 예시에서 Frame당 1,024개의 Spatial Token을 하나의 Delta Token으로 줄입니다. 이를 통해 여러 가능한 미래를 동시에 생성하는 Multi-Hypothesis Forecasting의 계산 비용을 크게 줄일 수 있습니다.
 
중요한 점은 DeltaWorld의 목적이 Video를 압축한 뒤 다시 정교하게 복원하는 것만은 아니라는 점입니다. 모델이 예측한 Feature는 미래 Segmentation과 Depth Forecasting처럼 Scene Understanding과 연결된 Task를 평가하는 데 사용됩니다. 즉 Predictive State의 품질은 사람이 보기에 얼마나 자연스러운가보다, 실제 미래의 Semantic State와 얼마나 잘 정렬되는가로 평가됩니다.

이미지 3. DeltaWorld [12]


4. 제어에 필요한 움직임을 예측하다: 3D Trace 와 Point Flow 
Robot Manipulation에서는 미래 Scene의 모든 Pixel보다 물체와 Robot이 3차원 공간에서 어떻게 움직이는지가 더 중요할 수 있습니다. Texture, Lighting, Background는 Observation을 사실적으로 Rendering하는 데 필요하지만, 물체를 어느 방향으로 밀거나 Gripper를 어디로 이동할지 결정하는 데는 직접적인 정보가 아닐 수 있습니다.
 
이러한 관점에서는 미래 World State를 Video가 아니라 Task-Space Trajectory로 표현할 수 있습니다.

pθ(τt+1:t+H,ot at:t+H-1 g)

여기서 τt 는 Object, End-Effector 또는 Scene Point의 3D Motion이며, g 는 Task Goal이나 Language Instruction을 나타냅니다.


4.1TraceGen: 3D Motion을 보존하다
TraceGen은 미래 Motion을 Pixel Space가 아니라 3D Trace Space에서 예측합니다 [10]. Trace는 Manipulated Object와 End-Effector의 Scene-Level Trajectory를 나타내며, Appearance와 Background, Camera 차이는 제거하면서 Manipulation에 필요한 Geometric Structure를 보존합니다.

이러한 Representation은 서로 다른 Robot과 Human Video를 하나의 공통 공간으로 변환할 수 있다는 장점을 갖습니다. Robot마다 Joint Configuration과 Control Interface는 다르지만, “어떤 물체가 어디에서 어디로 이동하는가”라는 Scene-Centric Motion은 Embodiment 사이에서 공유될 수 있기 때문입니다.
 
TraceGen은 Heterogeneous Human·Robot Video를 공통된 3D trace로 변환하는 TraceForge를 구축하고, 이 데이터로 Transferable Motion Prior를 학습합니다. 모델은 Target Robot의 소수 Demonstration만으로도 새로운 Task와 Scene에 적응할 수 있으며, 무거운 Pixel-Space Video Generation을 피함으로써 빠른 Inference를 제공합니다.
 
이 연구에서 Representation Compression은 단순한 계산 효율화 이상의 의미를 갖습니다. Trace Space는 Manipulation에 필요한 Invariance를 명시적으로 선택합니다. Camera와 Appearance의 차이는 버리는 반면, Object와 End-Effector의 Geometric Relation은 유지합니다. 즉 무엇을 버리고 무엇을 보존할 것인지가 Downstream Control Problem에 의해 결정됩니다.

이미지 4. TraceGen [8]


4.2. PointWorld: Action에 따른 3D Scene 변화를 예측하다
PointWorld는 State와 Action을 공통된 3D Point-Flow Space에 표현합니다 [14]. 하나 또는 소수의 RGB-D Image와 Robot Action Sequence가 주어지면, 각 Scene Point가 3차원 공간에서 어떻게 이동할지를 예측합니다.

pθ(Δ,Pt+1:t+HPtUt:t+H-1)

여기서 Pt는 관측된 Scene의 3D Point이며, Ut는 Robot Action을 3D Flow로 변환한 표현입니다. 모델의 출력 ΔPt
는 Action에 반응하여 Scene Point가 이동할 것으로 예상되는 Displacement입니다.

Robot Action을 Joint Position이나 End-Effector Command와 같은 Embodiment-Specific Vector로 표현하지 않고, Robot Body가 공간에서 만드는 3D Flow로 나타낸다는 점이 특징적입니다. 이를 통해 서로 다른 Robot Embodiment의 Action을 동일한 Geometric Space에서 다룰 수 있습니다.

PointWorld는 Action-Conditioned Prediction을 Model-Predictive Control에 직접 연결합니다. 여러 Candidate Action에 대해 미래 Point Flow를 Rollout하고, Goal에 가장 가까운 Scene 변화를 만드는 Action을 선택할 수 있습니다. 이 경우 World Model의 출력은 사람이 보는 Video가 아니라, Control Objective를 계산할 수 있는 3D State Transition입니다.

TraceGen과 PointWorld는 모두 3D Motion을 예측하지만 강조점은 다릅니다. TraceGen은 Cross-Embodiment Video에서 Transferable Motion Prior를 학습하는 데 초점을 두며, PointWorld는 현재 Scene과 Candidate Robot Action으로부터 Action-Conditioned 3D Consequence를 예측하고 이를 Planning에 사용합니다.

두 사례는 World Model의 Prediction Space를 Downstream Action Space와 정렬하는 것이 왜 중요한지를 보여줍니다. 좋은 World Model은 반드시 관측 전체를 복원하는 모델일 필요는 없습니다. 의사결정에 필요한 State Variable을 정확하고 빠르게 예측한다면, 더 작은 Representation이 오히려 더 직접적인 Simulator가 될 수 있습니다.

이미지 5. PointWorld [14]


5. 물리 상태 변화를 모델링: Learned Physics Dynamics 
Video나 Trajectory가 미래에 무엇이 나타날지를 표현한다면, Physics-Based Predictive Model은 상태가 어떤 Dynamics에 의해 변화하는가를 모델링하려 합니다.

일반적인 Latent Dynamics는 다음과 같이 나타낼 수 있습니다.

dhtdt=fθ(h(t))h(t+Δt)=ODESolve(fθ, ,h(t) Δt)

여기서 ht는 물체의 Velocity, Acceleration, Material Property와 같은 정보를 포함하는 Latent Physical State이며, fθ
는 시간에 따른 상태 변화를 정의하는 Learned Dynamics입니다.

CVPR 2026의 ParticleGS는 Dynamic 3D Scene을 물리적 Particle System의 관점에서 모델링합니다 [15]. 기존의 Dynamic 3D Reconstruction은 각 시간 (t)에서 Scene의 Deformation을 직접 Fitting하여 관측된 구간을 보강하는 데 강점을 보였습니다. 그러나 Time-Conditioned Deformation을 학습하는 것만으로는 관측 범위 밖의 미래 Motion을 안정적으로 Extrapolation하기 어렵습니다.

ParticleGS는 각 3D Gaussian을 Particle로 간주하고, Scene을 Static Property와 Initial Dynamic Field로 분해합니다. Encoder는 Gaussian마다 Latent Physical State를 만들고, Neural ODE 기반 Evolver는 이 State가 연속시간에서 어떻게 변화하는지를 학습합니다. 이후 decoder가 진화한 Latent State를 다시 Gaussian Deformation으로 변환하여 미래 Scene을 Rendering합니다.

hi(0)=Eψ(Gi)hi(t)=ODESolve(fθ, ,hi(0) t)Gi(t)=Dω(hi(t))

여기서 Gi는 하나의 3D Gaussian이고, hit는 해당 Gaussian Particle의 Latent Dynamic State입니다.

ParticleGS가 Physics-Based Model이라는 것은 Newton Equation이나 Material Simulator가 Hard-Coded되어 있다는 의미는 아닙니다. 모델은 Predefined Physical Law 없이 Video Observation으로부터 Latent Dynamics를 학습합니다. 따라서 이는 명시적 Physics Simulator라기보다, 물리적 State Decomposition과 Continuous-Time Evolution이라는 Inductive Bias를 부여한 Learned Dynamics Model입니다.

이 접근은 Visual Interpolation과 Physical Extrapolation의 차이를 보여줍니다. 관측된 Frame 사이를 자연스럽게 복원하는 모델이 반드시 관측 이후의 Motion을 올바르게 예측하는 것은 아닙니다. Future Extrapolation을 위해서는 시간 Index와 Appearance를 단순히 연결하는 것보다, 상태가 어떤 Transition Rule을 따라 변화하는지를 학습해야 합니다.

Physics-Based World Modeling은 특히 Long-Horizon Prediction에서 중요합니다. 작은 Transition Error가 반복적으로 누적되는 Rollout에서는 순간적인 Visual Quality보다 Conservation, Continuity, Contact와 같은 Dynamics Consistency가 더 중요할 수 있기 때문입니다.

이미지 6. ParticleGS [15]


6. Align While Search: Belief와 Belief-Conditioned Simulator
이제 LG AI연구원이 CVPR 2026에서 발표한 Align While Search를 이 흐름 속에서 위치시켜 보겠습니다 [9]. 먼저 정의를 명확히 하겠습니다. 좁은 의미의 World Model이 다음과 같은 Transition Model을 학습한다고 하면,

pθ(ot+1,htat) or pθ(st+1,stat),

AWS는 별도의 Transition Model을 학습하지 않습니다. 미래 Frame을 생성하는 Video Simulator도 아니고, Latent Dynamics Model을 새로 학습하는 방법도 아닙니다. 대신 AWS는 Frozen Llm을 두 가지 Inference Operator로 사용합니다. 하나는 Latent World Structure에 대한 Posterior를 갱신하는 Belief Updater이고, 다른 하나는 Candidate Action의 결과를 예측하기 위한 Belief-Conditioned Approximate Simulator입니다.
 
LLM Embodied Agent가 ALFWorld와 같은 환경에서 “머그컵을 쓰레기통에 넣어라”와 같은 과제를 수행한다고 생각해보겠습니다. Agent는 전체 집 구조와 모든 물체 위치를 한 번에 볼 수 없습니다. 현재 방과 주변 물체만 관측하고, 그 관측을 바탕으로 다음 탐색 행동을 선택해야 합니다.
 
이때 기존 SFT 기반 Agent는 학습 데이터에서 자주 본 탐색 Trajectory를 재생하는 경향을 보입니다. 탐색을 하기는 하지만, 현재 관측에 근거하지 않은 탐색을 한다는 점이 문제입니다. 환경 Layout이 바뀌면, Agent는 여전히 학습 시점의 평균적인 탐색 패턴을 반복하고, 현재 집의 구조에 맞는 탐색 전략을 구성할 수 없다는 문제가 발생합니다.
 
AWS는 이 실패를 Latent Environment Structure에 대한 Posterior Inference 문제로 바라봅니다. 환경마다 Object Layout은 어떤 잠재 구조 ϕ 에 의해 설명될 수 있다고 가정합니다. 예를 들어 ϕ는 Household Type, Spatial Organization, Object Co-Occurrence Pattern과 같은 자연어 수준의 구조를 나타냅니다. 목표 물체의 위치를 l 이라고 하면, Agent가 추론해야 하는 Latent Variable은 다음과 같습니다.

z=(ϕ, l).
Agent는 History 
ht=(ot), a<t),
가 주어졌을 때 Posterior Belief를 갱신합니다.
bt(z)=p(zht).

그러나 정확한 Posterior Inference를 수행하는 것은 쉽지 않습니다. 
ϕ가 Open-Ended Natural Language Space에 존재하기 때문입니다. AWS는 이를 근사하기 위해 두 수준의 Belief Representation을 사용합니다. 상위 Belief는 소수의 Natural-Language Hypotheses로 Household-Level Latent Structure를 표현하고, 하위 Belief는 후보 위치 집합 위의 Categorical Distribution으로 목표 물체 위치를 표현합니다.

q(zht)=q(ϕht)q(l,ϕht).

첫 번째 LLM 호출은 이 Belief를 갱신하는 데 사용됩니다. 새로운 관측 ot+1과 이전 Belief qt(z)가 주어졌을 때, Frozen LLM은 Posterior Updater F처럼 작동합니다.

qt+1(z)=F(qt,(z),ot+1at).

즉 LLM은 단순한 Policy Generator가 아니라, 현재까지의 관측을 바탕으로 Latent World Structure에 대한 Hypothesis를 수정하고, 그 Hypothesis를 위치 Belief로 Projection하는 Updater로 사용됩니다.

두 번째 LLM 호출은 Action Evaluation을 위한 Simulation에 사용됩니다. Agent가 Candidate Action a를 평가하려면, 그 Action을 취했을 때 어떤 관측 o'가 나올 수 있는지 예상해야 합니다. AWS는 이때 LLM을 Unconditioned Simulator로 쓰지 않고, 현재 Belief qt(z)를 Condition으로 넣어 Future Observation을 Simulate 합니다.

o~'~SLLM(·ht,a,qt(z))

이 차이가 핵심입니다. 단순히 “이 Action을 하면 무엇이 보일까?”를 묻는 것이 아니라, “현재까지의 관측으로 보아 이 집이 이런 구조일 가능성이 높다면, 이 Action 뒤에는 무엇이 보일까?”를 묻는 것입니다. 다시 말해 AWS의 Rollout은 Raw History만이 아니라, 그 History로부터 추론한 Latent World Structure에 Condition되어 있는 것이 핵심입니다.
 
Action Selection은 이 Belief-Conditioned Simulation을 사용해 Expected Information Gain을 근사합니다. Agent는 단순히 목표에 가까워 보이는 행동을 고르는 것이 아니라, Latent Variable z에 대한 Uncertainty를 가장 많이 줄일 수 있는 행동을 선택합니다.

argmaxaEo~'~LLM(·ht,a,qt)DKLq(zht,a,o~')q(zht)+λRalign(a,ht)

이 관점에서 AWS는 “World Model을 학습하는 방법”은 아닙니다. 하지만 Frozen LLM을 Belief-Conditioned Approximate Simulator로 사용한다는 점에서, World-Modeling 논의와 더 직접적으로 연결됩니다. 중요한 것은 LLM Simulator 자체가 항상 정확하다는 것이 아니라, Simulation을 현재 Belief로 Condition함으로써 Action Outcome의 예측을 더 Task-Relevant하게 만든다는 점입니다.
 
따라서 AWS의 핵심은 단순한 Belief Update가 아닙니다. AWS는 Belief를 갱신하고, 그 Belief로 다시 LLM Simulation을 Condition하며, 그 Simulation 결과를 이용해 Information-Seeking Action을 선택합니다. 즉 다음과 같은 Closed Loop를 만듭니다.

observationbelief updatebelief‐conditioned simulationinformation‐gain actionnew observation

이 때문에 AWS를 좁은 의미의 World Model이라고 부르기는 어렵지만, Partial Observability 하에서 World Modeling이 Belief Inference와 Simulation을 통해 Action Selection에 연결되는 사례로 볼 수 있습니다. 미래 관측 전체를 학습된 Dynamics Model로 생성하지 않더라도, 현재 Belief에 Condition된 Approximate Simulation을 사용하면 탐색 행동을 더 Grounded하게 만들 수 있는 것입니다.

7EDA: PCB 설계 자동화를 위한 World Model
앞서 살펴본 연구들은 Application에 따라 World Model이 예측해야 하는 대상이 달라질 수 있음을 보여줍니다. 그렇다면 EDA와 PCB 설계 자동화에서는 Agent가 미래의 무엇을 예측해야 할까요?

여기서부터는 이 질문을 LG AI연구원 DI(Data Intelligence) 랩에서 연구하고 있는 PCB 설계 자동화를 위한 EDA 툴 개발 문제에 적용해보고자 합니다. 우리 그룹이 제안한 PCBWorld [16]는 Agent가 KiCad의 Native Operation을 통해 PCB를 단계적으로 설계하고, 매 단계 갱신된 Board State와 Design Rule Check(DRC) 결과를 관찰하는 Engine-Grounded 환경입니다.

이미지 7. PCBWorld [16]


PCB 설계의 상태는 Board Geometry, Component Placement, Netlist, Routing Topology, Layer Assignment, Via와 Design Rule 등의 Structured Information으로 구성됩니다.

st=Gt, ,N, ,Pt, ,Rt, ,Ct,

여기서 Gt 는 Board Geometry, N 은 Netlist, Pt 는 Component Placement, Rt 는 Routing State, Ct는 Constraint와 Resource State를 의미합니다. Action은 Component 이동, Routing Segment 추가, Layer 변경, Via 삽입이나 Rip-Up과 같은 CAD Operation으로 구성됩니다.

PCBWorld에서는 각 Action의 실행 결과와 Hard Constraint를 KiCad Engine을 통해 정확히 계산할 수 있습니다.

st+1=Tengine(st,at).

따라서 Learned World Model이 이러한 One-Step Transition을 다시 예측하는 것보다, 현재의 선택이 이후 설계 가능성에 미치는 장기적인 영향을 예측하는 것이 더 중요합니다. 현재는 유효한 Routing Action도 다른 Net의 경로를 막거나 특정 Region과 Layer의 Resource를 소진하여, 이후 Dead End나 Rip-Up을 초래할 수 있기 때문입니다.

이때 World Model은 미래 설계 전체를 생성하기보다 Candidate Action의 Long-Horizon Consequence를 예측할 수 있습니다.

y^t:t+H=Mθst,,at:t+H-1,



여기서 y^
 
Completion Probability, Dead-End Risk, Residual Routability, Future Congestion과 Expected Rip-Up Cost 등을 포함할 수 있습니다. 즉 핵심 질문은 “이 Action을 지금 실행할 수 있는가?”를 넘어, “이 Action이 남은 설계를 끝까지 완성할 가능성을 얼마나 보존하는가?”입니다.

이러한 Learned Model은 Exact Design Engine을 대체하기보다, 많은 Candidate Action을 빠르게 평가하는 Planning Surrogate로 활용될 수 있습니다.

Candidate generationLearned predictionEngine verification.

결과적으로 PCB 설계를 위한 World Model의 핵심은 정확한 One-Step State Generation이 아니라, Structured Design State를 바탕으로 Action의 장기적인 Constraint Consequence를 예측하고 효율적인 Search를 지원하는 데 있습니다.

What's Next
CVPR CVPR 2026에서 확인한 World Model 연구의 흐름은 이 용어가 더 이상 하나의 고정된 Architecture를 의미하지 않음을 보여주었습니다. Action-Controllable Video Generation이 가장 가시적인 방향으로 성장하고 있지만 [1,2], Latent Prediction, Robot Trace Generation, Belief-Space Exploration과 같은 연구들은 World Model이 Application에 따라 서로 다른 추상화 수준에서 정의될 수 있음을 보여줍니다 [7,8,9].

따라서 World Model을 평가할 때 “얼마나 사실적인 미래를 생성하는가?”만을 묻는 것은 충분하지 않습니다. 각 Domain에서 더 중요한 질문은 다음과 같습니다: Agent가 좋은 의사결정을 내리기 위해 미래의 무엇을 예측해야 하는가?

자연영상이나 Robot Interaction에서는 Pixel과 Video가 풍부한 Environment Prior를 제공할 수 있습니다. 반면 PCB와 같은 Precision Design Domain에서는 Connectivity, Geometry, Constraint와 Resource State를 보존하는 Structured Representation이 더 적합할 수 있습니다. 특히 Exact Design State와 Deterministic Engine에 접근할 수 있다면, 미래 화면 전체를 생성하기보다 Candidate Action이 장기적인 Feasibility와 Objective에 미치는 영향을 직접 예측하는 편이 효율적입니다.

한편 자연영상에서 학습된 Video Prior가 CAD와 같은 정밀 설계 환경에도 유효하게 전이되는지는 여전히 흥미로운 연구 질문입니다. 다만 그 이득이 Domain-Specific Structured Model이나 Spatial Encoder를 넘어서는지는 Sample Efficiency, Generalization과 실제 Planning 성능을 통해 검증할 필요가 있습니다. 결국 중요한 것은 특정 Representation을 미리 선택하는 것이 아니라, 각 Task의 의사결정에 충분한 Prediction Target을 정의하고 그것이 실제 Search와 Planning을 얼마나 개선하는지 확인하는 일입니다.

LG AI연구원에서는 이러한 관점에서 PCBWorld를 기반으로 Exact CAD Engine과 Learned Model을 결합한 Engine-Grounded Design Agent를 연구하고자 합니다. KiCad에서 추출한 Structured State를 바탕으로 Candidate Routing Action이 장기적인 Routability와 Constraint Interaction에 미치는 영향을 예측하고, 이를 활용해 유망한 Branch와 Engine Verification이 필요한 지점을 선택하는 Planning Component로 확장하는 것이 향후 연구 방향입니다.
참고

[1] Jack Bruce, Michael D. Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie C. Y. Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktaschel. *Genie: Generative Interactive Environments*. arXiv:2402.15391, 2024.

[2] Google DeepMind. *Genie 2: A Large-Scale Foundation World Model*. Technical report / blog post, 2024.

[3] David Ha, Jurgen Schmidhuber. *World Models*. arXiv:1803.10122, 2018.

[4] Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap. *Mastering Diverse Domains through World Models*. arXiv:2301.04104, 2023.

[5] Mahmoud Assran, Quentin Duval, Ishan Misra, Piotr Bojanowski, Pascal Vincent, Michael Rabbat, Yann LeCun, Nicolas Ballas. *Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture*. arXiv:2301.08243, 2023.

[6] Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai. *STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows*. CVPR 2026 Spotlight. arXiv:2511.20462, 2025.

[7] Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Ziang Yan, Yali Wang, Yi Wang, Limin Wang. *InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision*. CVPR 2026. arXiv:2512.01342, 2025.

[8] Seungjae Lee, Yoonkyo Jung, Inkook Chun, Yao-Chih Lee, Zikui Cai, Hongjia Huang, Aayush Talreja, Tan Dat Dao, Yongyuan Liang, Jia-Bin Huang, Furong Huang. *TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos*. CVPR 2026. arXiv:2511.21690, 2025.

[9] Seohui Bae, Jeonghye Kim, Youngchul Sung, Woohyung Lim. *Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents*. CVPR 2026. arXiv:2512.24461, 2025.

[10] Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad. *Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Don’t Know Galileo’s Principle...for now*. CVPR 2026. arXiv:2512.02016, 2025.

[11] Pedro M. P. Curvo, Jan-Willem van de Meent, Maksim Zhdanov. *MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi-Scale Attention*. CVPR 2026. arXiv:2512.01738, 2025.

[12] Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen. *A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens*. CVPR 2026 Highlight. arXiv:2604.04913, 2026.

[13] Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu. Motus: A Unified Latent Action World Model. CVPR 2026. arXiv:2512.13030, 2026

[14] Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, Li Fei-Fei. PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation. CVPR 2026. arXiv:2601.03782, 2026

[15] Jinsheng Quan, Qiaowei Miao, Yichao Xu, Zizhuo Lin, Ying Li, Wei Yang, Zhihui Li, and Yawei Luo. ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-Free Physical Motion Extrapolation. CVPR 2026. arXiv:2505.20270, 2025

[16] Hyungseok Song, Junseok Park, Won-Seok Choi, Seohui Bae, Han-Seul Jeong, Youngjoon Park, Soonyoung Lee. PCBWorld: A Benchmark Environment for Engine-Grounded PCB Design Automation. arXiv:2607.05915, 2026.