Audio-Visual World Models
Dataset Analysis
Proposes Audio-Visual World Models (AVWM) integrating binaural audio and visual dynamics, with a benchmark and a diffusion transformer model for multimodal prediction.
Provenance
Collected from papers.
Derived from paper: Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound