Awesome World Model Hub Papers · Datasets · Projects
← Back to papers

Learning Action-Conditional and Object-Centric Gaussian Splatting World Models for Rigid Objects

arXiv 2026 58.2 method

TLDR

Proposes MRO-GWM, an object-centric Gaussian splatting world model for predicting rigid object dynamics from actions, evaluated on synthetic data and simulation.

Reasoning

The paper introduces a novel approach combining object-centric Gaussians with a spatio-temporal transformer for action-conditional dynamics, which is a clear strength. However, it lacks real-world experiments and only evaluates on synthetic datasets and simulation, limiting its demonstrated applicability.

Read-first score

Read-first score 58.2, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 45.

Recency 6%
100

Uses a gentle age decay so recent papers surface without erasing older foundations. 2026

Citation impact 18%
81.5

Uses OpenAlex-shaped citation metadata as a bibliometric attention signal, separate from paper quality. citation_normalized_percentile=0.81543922

Methodology quality 18%
70

Screens visible abstract and analysis fields for experiment, dataset, baseline, metric, and limitation evidence. markers=dataset,evaluation

Topical relevance 29%
64.3

Uses existing LLM keyword relevance scores normalized to 0-100. world model,world simulator,generative world model,interactive world model,video world model,world dynamics prediction,model-based reinforcement learning world model

Reproducibility 18%
38

Screens links and visible text for paper, code, dataset, artifact, and repository signals. pdf=True; code=False; dataset=False; markers=dataset

Citation velocity 12%
0

Citation velocity estimates citations per publication-year to reduce old-paper bias. velocity=0.00

Field roles

FoundationFrontierBridgeMethodology anchor

Rank sensitivity

Stability: volatile; rank range: 320.

Keyword Scores

world model
10
world dynamics prediction
9
model-based reinforcement learning world model
8
interactive world model
7
world simulator
5
generative world model
4
video world model
2

Deep Analysis

Innovations

  • Object-centric Gaussian representation for world models, enabling arbitrary object shapes and multi-object scenes
  • Spatio-temporal transformer architecture that predicts future rigid body motion from a history of object Gaussians and future actions
  • Canonical frame representation for object motion, allowing description as rigid body transformation
  • Training from multiple viewpoints to handle partial observations due to occlusions

Methodology

The proposed MRO-GWM represents scenes using object-centric Gaussians, with a spatio-temporal transformer that takes a history of object Gaussians and future actions to predict future rigid body motion. Training uses reconstructions from multiple viewpoints to handle occlusions, and evaluation is performed on synthetic datasets of household objects with robot interactions, as well as in model-predictive control for non-prehensile manipulation in simulation.

Key Results

The model demonstrates prediction performance on synthetic datasets of multi-object dynamics and robot interactions, and is evaluated in model-predictive control for non-prehensile manipulation in simulation.

Limitations

  • Evaluation only on synthetic datasets, not on real-world data
  • Handling of partial observations due to occlusions may still be imperfect
  • Limited to rigid objects, not deformable or articulated objects
  • Only tested for non-prehensile manipulation tasks
  • Simulation-based evaluation, real-world applicability not demonstrated

Tags

world modelsGaussian splattingrigid objectsaction-conditional dynamicsobject-centricspatio-temporal transformerROCV