Awesome World Model Hub Papers · Datasets · Projects
← Back to datasets

Audio-Visual World Models

2025 Datasets
Preview for Audio-Visual World Models

Dataset Analysis

Proposes Audio-Visual World Models (AVWM) integrating binaural audio and visual dynamics, with a benchmark and a diffusion transformer model for multimodal prediction.

Provenance

Collected from papers.

Derived from paper: Audio-Visual World Models: Towards Multisensory Imagination in Sight and Sound

Resources