Diffusion Transformer World-Action Model for AV Scene Prediction
Dataset Analysis
A latent Diffusion Transformer world model predicts future AV camera scenes from actions, outperforming regression on perception metrics.
Provenance
Collected from papers.
Derived from paper: Diffusion Transformer World-Action Model for AV Scene Prediction