arXiv:世界模型架构、方法、推理范式与应用全景综述
Ranking
Observed public metrics from 1 member.
Merged summary
TL;DR - A ~100-page arXiv survey ("World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications") systematizes world models — internal simulators that learn environment dynamics and roll out action-conditioned futures — and argues they can evolve from future predictors into planning/decision reasoning engines via a latent-space "chain of imagination" (CoI) that contrasts with language-based chain-of-thought.
- Definition & structure: Three properties separate world models from generic predictors — action-conditioning (supporting counterfactuals), multi-step autoregressive rollout, and utility for downstream decisions. Core components: encoder, latent dynamics model, reward predictor, optional decoder; framed as coupled visual, memorial, and control subsystems.
- Architecture taxonomy: Organized by state representation (continuous/discrete/hybrid), dynamics (deterministic, stochastic, implicit value-oriented like MuZero, latent-diffusion or memory-augmented Transformer/SSM predictors), modality (pure vision, language/knowledge-graph, geometric LiDAR 4D, proprioceptive/tactile, multimodal fusion), and learning paradigm — trending toward multi-stage self-supervised pretraining plus imitation/online fine-tuning (V-JEPA 2, Genie, Cosmos, Sora, Dreamer).
- Training objectives & inductive biases: Variational/ELBO reconstruction, implicit value-only (MCTS/self-play), autoregressive next-token, diffusion (high fidelity, multimodal distributions, but costly iterative denoising), and JEPA-family embedding-space prediction (efficient, hallucination-avoiding, but integration with closed-loop control remains open). Physics priors are injected via conservation-constrained dynamics, GNN simulators, object-centric decomposition, equivariance, and neuro-symbolic regression.
- Inference & applications: Four reasoning strategies — imagination-based planning/search, differentiable end-to-end policy learning and offline data augmentation, counterfactual reasoning via an abduction–action–prediction pipeline with causal graphs/SCMs, and risk-aware planning under uncertainty. Applications span robotics, autonomous driving (OccWorld/UniAD 4D occupancy, what-if safety validation), interactive video/digital twins, science (FourCastNet, Pangu-Weather, drug discovery), and medicine — where the survey notes no deployment yet reaches "L4" autonomous planning/control.
Sources (1)
arXiv:世界模型架构、方法、推理范式与应用全景综述
TL;DR - A ~100-page arXiv survey ("World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications") systematizes world models — internal simulators that learn environment dynamics and roll out action-conditioned futures — and argues they can evolve from future predictors into planning/decision reasoning engines via a latent-space "chain of imagination" (CoI) that contrasts with language-based chain-of-thought.
- Definition & structure: Three properties separate world models from generic predictors — action-conditioning (supporting counterfactuals), multi-step autoregressive rollout, and utility for downstream decisions. Core components: encoder, latent dynamics model, reward predictor, optional decoder; framed as coupled visual, memorial, and control subsystems.
- Architecture taxonomy: Organized by state representation (continuous/discrete/hybrid), dynamics (deterministic, stochastic, implicit value-oriented like MuZero, latent-diffusion or memory-augmented Transformer/SSM predictors), modality (pure vision, language/knowledge-graph, geometric LiDAR 4D, proprioceptive/tactile, multimodal fusion), and learning paradigm — trending toward multi-stage self-supervised pretraining plus imitation/online fine-tuning (V-JEPA 2, Genie, Cosmos, Sora, Dreamer).
- Training objectives & inductive biases: Variational/ELBO reconstruction, implicit value-only (MCTS/self-play), autoregressive next-token, diffusion (high fidelity, multimodal distributions, but costly iterative denoising), and JEPA-family embedding-space prediction (efficient, hallucination-avoiding, but integration with closed-loop control remains open). Physics priors are injected via conservation-constrained dynamics, GNN simulators, object-centric decomposition, equivariance, and neuro-symbolic regression.
- Inference & applications: Four reasoning strategies — imagination-based planning/search, differentiable end-to-end policy learning and offline data augmentation, counterfactual reasoning via an abduction–action–prediction pipeline with causal graphs/SCMs, and risk-aware planning under uncertainty. Applications span robotics, autonomous driving (OccWorld/UniAD 4D occupancy, what-if safety validation), interactive video/digital twins, science (FourCastNet, Pangu-Weather, drug discovery), and medicine — where the survey notes no deployment yet reaches "L4" autonomous planning/control.