
이미지 1. CVPR 2026 현장 속 LG AI연구원
이번 CVPR 2026 속 세션과 논문에서는 반복적으로 “World Model”이라는 키워드가 등장했습니다. 최근 World Model이라는 용어는 Genie 계열 모델과 같이 Action-Controllable Video 또는 Playable Environment를 생성하는 파운데이션 모델을 지칭하는 맥락에서 자주 사용되고 있습니다 [1,2]. 이와 같은 좁은 의미에서 World Model은 과거의 관측과 행동 정보를 입력 받아, 특정 행동의 결과로 나타날 미래 환경의 변화를 생성하거나 시뮬레이션하는 모델을 의미합니다.
하지만 World Model이라는 용어가 항상 Video Generator만을 뜻해 온 것은 아닙니다. Model-Based Reinforcement Learning에서는 환경의 Latent Dynamics를 학습하고 그 안에서 Planning 또는 Policy Improvement를 수행하는 모델을 World Model이라 불러왔습니다 [3,4]. JEPA 계열의 Representation Learning에서는 Pixel Reconstruction 대신 Abstract Representation을 예측하는 방향이 제안되어 왔고 [5], 최근 Robot Learning에서는 미래 Frame 전체가 아니라 Object Trajectory, 3D Trace, Point Flow와 같이 Task에 직접 연결되는 구조를 예측하는 World Model도 등장하고 있습니다 [10, 11].
LG AI연구원이 CVPR 2026에서 확인한 연구들도 모두 같은 형태의 미래를 예측하지는 않았습니다. 어떤 모델은 Action에 따른 미래 Observation을 Video로 생성하고 [6], 어떤 모델은 Vision Foundation Model의 Feature Space에서 미래의 Semantic Change를 예측합니다 [8]. 또 다른 모델은 Robot Manipulation에 필요한 3D Motion을 직접 예측하거나 [10,11], 관측된 장면으로부터 물리적 Dynamics를 학습하여 미래 상태를 Extrapolation합니다 [12].
이 글에서는 CVPR 2026의 World Model 연구를 다음 두가지 질문을 중심으로 살펴봅니다.
첫째, 모델은 세계의 무엇을 표현하고 예측하는가? 미래 Observation 전체를 생성할 수도 있고, Semantic Feature의 변화를 예측하거나, Object Motion, 3D Geometry, Physical State처럼 Task와 직접 연결된 정보를 예측할 수도 있습니다.
둘째, 예측된 정보는 무엇에 사용되는가? 생성된 미래는 Interactive Simulation에 사용될 수도 있고, Representation Learning, Planning, Robot Control 또는 Uncertainty-Aware Exploration에 사용될 수도 있습니다.
LG AI연구원이 CVPR 2026에서 발표한 Align While Search(AWS)[9]도 이러한 문제의식과 맞닿아 있습니다. AWS는 미래 Frame을 생성하거나 Transition Dynamics를 학습하는 World Model은 아닙니다. 대신 Agent가 부분 관측 환경에서 현재까지 얻은 관측을 바탕으로 외부 세계에 대한 Belief를 갱신하고, 그 Belief를 이용해 불확실성을 줄일 수 있는 탐색 행동을 선택합니다. 즉 미래를 Rollout하기보다 의사결정에 필요한 현재의 Hidden World State를 추론합니다.
이 글에서는 먼저 Action-Controllable Video Generation을 Learned Simulator의 관점에서 살펴봅니다. 다음으로 미래를 완전한 Frame이 아닌 Predictive Feature로 표현하는 연구, 조작에 필요한 3D Trace와 Point Flow를 예측하는 연구, 그리고 물리적 상태의 Dynamics를 학습하는 연구를 차례로 살펴봅니다. 이후 Forward Prediction과는 다른 축에 있는 Belief-Space Inference로서 AWS를 소개하고, 마지막으로 LG AI연구원에서 연구 개발중인 Electronic Design Automation(EDA) 툴 개발 과정에는 어떤 형태의 World Representation이 실제 의사결정에 유용할지 논의합니다.
이 글을 관통하는 핵심 질문은 다음과 같습니다: World Model은 미래 세계를 얼마나 완전하게 생성해야 하는가? 또 좋은 의사결정을 내리는 데 충분한 상태는 무엇이고 어떻게 모델링 하나?
1. World Model을 읽는 두 축: Representation과 역할
World Model은 일반적으로 현재까지의 관측과 행동으로부터 미래 상태를 예측하는 모델로 표현할 수 있습니다.
여기서 는 현재까지의 Observation과 Action History를 요약한 상태이며, 는 모델이 예측하려는 World Representation입니다. 는 미래 Video Frame일 수도 있고, Learned Feature, Object Trajectory, 3D Geometry 또는 물리적 상태일 수도 있습니다.
이때 World Model을 구분하는 첫 번째 축은 어떤 Representation을 예측하는가입니다.
두 번째 축은 예측된 Representation을 무엇에 사용하는가입니다. 미래 Video를 생성하더라도 목적은 다양할 수 있습니다. 시각적으로 자연스러운 영상을 만드는 것이 목적일 수도 있고, Agent가 여러 Action의 결과를 비교하는 Simulator로 사용하는 것이 목적일 수도 있습니다. 반대로 사람이 볼 수 있는 Video를 생성하지 않더라도, 예측된 Latent Feature나 Trajectory가 Planning과 Control에 충분하다면 World Model의 역할을 수행할 수 있습니다.
따라서 Representation 사이에는 반드시 다음과 같은 우열이나 계층 관계가 존재하는 것은 아닙니다.
각 Representation은 서로 다른 정보를 보존하며, 어떤 표현이 적절한지는 Downstream Decision Problem에 따라 달라집니다. Video는 관측 전체를 표현할 수 있지만 생성 비용이 높고, Feature는 효율적이지만 무엇을 보존할지 결정해야 합니다. Trace와 Point Flow는 Manipulation에 직접 필요한 Motion을 표현하지만 Appearance 정보는 버리며, Physical State는 Extrapolation에 유리하지만 학습해야 하는 Dynamics Structure가 더 강하게 요구됩니다.
이러한 관점에서 CVPR 2026의 연구들을 하나의 계층으로 정렬하기보다, 각 모델이 어떤 World State를 선택했으며 그 선택이 모델의 역할과 어떻게 정렬되는가를 살펴보고자 합니다.
2. 미래 관측을 생성: Action-Controllable Video World Model
최근 World Model이라는 표현이 가장 강하게 연결되는 영역은 Action-Controllable Video Generation입니다. Genie 계열 모델이 대표적입니다 [1,2]. 이 계열의 모델은 대규모 Video Data로부터 환경의 Dynamics와 Latent Action과 Dynamics를 학습하고, 사용자의 입력이나 Agent의 Action에 반응하는 Interactive Environment를 생성합니다 [1].
이 관점에서 World Model은 다음과 같이 쓸 수 있습니다.
여기서 는 Frame 또는 Observation이고, 는 Action입니다. 모델은 Action Sequence가 주어졌을 때 그 결과로 나타날 미래 Observation Sequence를 생성합니다. Agent가 어떤 행동을 했을 때 세계가 어떻게 변하는지 Video로 Rollout할 수 있다면, 그 모델은 실제 환경을 대신하는 Learned Simulator로 사용할 수 있습니다 [1,2].

이미지 2. Motus [13] 구조

이미지 3. DeltaWorld [12]

이미지 4. TraceGen [8]

이미지 5. PointWorld [14]

이미지 6. ParticleGS [15]

이미지 7. PCBWorld [16]
[1] Jack Bruce, Michael D. Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie C. Y. Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktaschel. *Genie: Generative Interactive Environments*. arXiv:2402.15391, 2024.
[2] Google DeepMind. *Genie 2: A Large-Scale Foundation World Model*. Technical report / blog post, 2024.
[3] David Ha, Jurgen Schmidhuber. *World Models*. arXiv:1803.10122, 2018.
[4] Danijar Hafner, Jurgis Pasukonis, Jimmy Ba, Timothy Lillicrap. *Mastering Diverse Domains through World Models*. arXiv:2301.04104, 2023.
[5] Mahmoud Assran, Quentin Duval, Ishan Misra, Piotr Bojanowski, Pascal Vincent, Michael Rabbat, Yann LeCun, Nicolas Ballas. *Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture*. arXiv:2301.08243, 2023.
[6] Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai. *STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows*. CVPR 2026 Spotlight. arXiv:2511.20462, 2025.
[7] Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Ziang Yan, Yali Wang, Yi Wang, Limin Wang. *InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision*. CVPR 2026. arXiv:2512.01342, 2025.
[8] Seungjae Lee, Yoonkyo Jung, Inkook Chun, Yao-Chih Lee, Zikui Cai, Hongjia Huang, Aayush Talreja, Tan Dat Dao, Yongyuan Liang, Jia-Bin Huang, Furong Huang. *TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos*. CVPR 2026. arXiv:2511.21690, 2025.
[9] Seohui Bae, Jeonghye Kim, Youngchul Sung, Woohyung Lim. *Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents*. CVPR 2026. arXiv:2512.24461, 2025.
[10] Varun Varma Thozhiyoor, Shivam Tripathi, Venkatesh Babu Radhakrishnan, Anand Bhattad. *Objects in Generated Videos Are Slower Than They Appear: Models Suffer Sub-Earth Gravity and Don’t Know Galileo’s Principle...for now*. CVPR 2026. arXiv:2512.02016, 2025.
[11] Pedro M. P. Curvo, Jan-Willem van de Meent, Maksim Zhdanov. *MSPT: Efficient Large-Scale Physical Modeling via Parallelized Multi-Scale Attention*. CVPR 2026. arXiv:2512.01738, 2025.
[12] Tommie Kerssies, Gabriele Berton, Ju He, Qihang Yu, Wufei Ma, Daan de Geus, Gijs Dubbelman, Liang-Chieh Chen. *A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens*. CVPR 2026 Highlight. arXiv:2604.04913, 2026.
[13] Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu. Motus: A Unified Latent Action World Model. CVPR 2026. arXiv:2512.13030, 2026
[14] Wenlong Huang, Yu-Wei Chao, Arsalan Mousavian, Ming-Yu Liu, Dieter Fox, Kaichun Mo, Li Fei-Fei. PointWorld: Scaling 3D World Models for In-The-Wild Robotic Manipulation. CVPR 2026. arXiv:2601.03782, 2026
[15] Jinsheng Quan, Qiaowei Miao, Yichao Xu, Zizhuo Lin, Ying Li, Wei Yang, Zhihui Li, and Yawei Luo. ParticleGS: Learning Neural Gaussian Particle Dynamics from Videos for Prior-Free Physical Motion Extrapolation. CVPR 2026. arXiv:2505.20270, 2025
[16] Hyungseok Song, Junseok Park, Won-Seok Choi, Seohui Bae, Han-Seul Jeong, Youngjoon Park, Soonyoung Lee. PCBWorld: A Benchmark Environment for Engine-Grounded PCB Design Automation. arXiv:2607.05915, 2026.