Preprint
Sep 2026
Spatially Aware World Action Model via Geometric Latent Diffusion
A Spatially Aware World Action Model (SA-WAM), which repurposes a pretrained video model for joint action, RGB, and depth prediction, enabling 3D-aware world modeling and action prediction within a single diffusion backbone.
Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid
· 2 citations