$\mu_0$
2026 数据集
数据集分析
μ0从视频预测3D交互轨迹,无需动作标签实现可扩展机器人学习。
来源线索
来源:huggingface-datasets。
downloads=3152, likes=0
关联论文
$\mu_0$: 一种可扩展的3D交互轨迹世界模型τ₀-WM:面向机器人操作的统一视频-动作世界模型$ω$-EVA:基于潜在交互世界模型的设想、验证与执行3D-Belief: 通过生成式3D世界建模实现具身信念推理3D等视域世界模型——揭示城市不可见几何及其涌现的跨城市特征对监督微调LLM规划器中世界模型恢复的深入观察A geometric relation of the error introduced by sampling a language model's output distribution to its internal stateAGEL-Comp: 交互式智能体中组合泛化的神经符号框架AGWM:面向组合前提环境的可供性基础世界模型AR Forcing:面向长时域机器人导航世界模型ARB4WM:面向连续控制中世界模型的对抗鲁棒性基准ARIS: Agentic and Relationship Intelligence System for Social RobotsActWorld:从可探索到可交互的世界模型——基于动作感知记忆Active Inference作为物理AI代理的测试时缩放定律Active Inference: A method for Phenotyping Agency in AI systems?AdaReP:神经世界模型预测控制中模型失配下的自适应重规划AdaptiveLoad:面向高效视频扩散Transformer训练AffectVerse: Emotional World Models for Multimodal Affective ComputingAffective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization智能体世界建模:基础、能力、法则与超越通过交互临床世界模型将患者动态代理化于大语言模型攻击可信想象:对‘先想象后行动’世界模型的预言机级完整性攻击面向自演化世界模型的具有反事实可控性的自主视频生成用于LLM智能体离线策略评估的自回归扩散世界模型BRo-JEPA:在潜在空间中学习模算术BadDreamer:针对自动驾驶视频世界模型的可迁移后门攻击基于Transformer世界模型的行为不变任务表示学习用于离线元强化学习BiWM:利用双向自回归推进开源交互式视频世界模型商业世界模型CLAW: 通过对抗性潜在正则化学习连续潜在动作世界模型COMAP:面向LLM智能体的世界模型与智能体策略协同演化上下文学习能否支持内在好奇心?Causal Forcing++:可扩展的少步自回归扩散蒸馏用于实时交互式视频生成用于蒙特卡洛树搜索规划的因果对象中心模型Causal Reward World Models: Zero-shot Reward Design for Automated Skill GenerationCausal-rCM:一种统一的教师强制与自我强制开放方案,用于自回归扩散蒸馏在流式视频生成与交互式世界模型中的应用CausalDrive:面向自动驾驶的实时因果世界模型认证世界模型:跨配置、时域和分辨率的可预测性Chreode: A Cell World Model for One-Step Temporal Dynamics and Perturbation PredictionChronoMedicalWorld:一种从纵向护理数据学习患者轨迹的医学世界模型弥合运动执行鸿沟:从语义运动任务约束到运动学控制CoWorld-VLA:在多专家世界模型中思考自动驾驶编码智能体作为世界模拟器表现出色等变世界模型的共形轨道有效信任视界当前世界模型缺乏持久状态核心DREAM-Chunk:基于潜在世界模型的反应式动作分块面向3D机器人模仿学习的数据不对称潜在想象与重排序DeTrack:面向无人机具身跟踪的基准与高度感知双世界模型DecMem:面向分钟级一致世界生成的解耦记忆DeepSight: 通过潜在状态预测实现长时域世界建模的端到端自动驾驶DeformMaster:一种基于视频的可变形物体交互式物理-神经世界模型Delta Forcing:面向交互式自回归视频生成的信任区域引导Demo-JEPA:面向单次跨本体模仿的联合嵌入预测架构DexFuture: Hierarchical Future-State Visuomotor Targeting for Bimanual Dexterous Tool UseDiLA: 解耦潜在动作世界模型用于自动驾驶场景预测的扩散Transformer世界-动作模型DisCo:具有离散相机运动控制的世界模型Discrete-WAM: 统一离散视觉-动作令牌编辑用于世界-策略学习蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习将游戏代码世界模型生成蒸馏到轻量级大语言模型中分而治之:多模态世界模型的解耦表示对齐多模态模型会想象电子羊吗?Dream-MPC: 基于梯度的模型预测控制与潜在想象DreamX-World 1.0:一个通用交互式世界模型梦见他人:多智能体强化学习中世界模型的潜在队友建模基于梯度惩罚潜在动力学的平滑梦境与高效采样具有锚定极线引导的抗漂移导航世界模型Driver-WM: 一种以驾驶员为中心的交通条件潜在世界模型,用于车内动态展开双通道接地世界建模(DCGWM):通过异质外部接地与内向梯度流结构性防止目标干扰崩溃DynaWM: 基于世界模型和动量目标的动力学感知蒸馏方法用于连续楼梯上的平滑运动DynoSLAM: 基于生成式图神经网络的动态SLAM用于真实世界社交导航EA-WM:具有结构化运动到视觉动作场的事件感知生成世界模型EV-WM:事件验证的世界模型用于长时域机器人操作Echo-Memory:动作世界模型中记忆的受控研究通过自我调节的模拟规划实现高效智能体推理EgoCS-400K:面向世界模型的自我中心游戏数据集EgoExo-WM: 利用外视角视频解锁自我世界模型通过对话对齐世界模型的具身多智能体协调Embody4D:一种用于具身4D世界建模的通用数据引擎通过物理交互而非语言监督在世界模型中涌现的语义表征基于轻量级预测世界模型的情感条件短时人体姿态预测EponaV2: 具有全面未来推理的驾驶世界模型训练中保持的精确等变性实现跨对称群的零样本泛化编码代理时代下ARC-AGI-3的可执行世界模型Explainably Safe Reinforcement LearningFeat2Go: 基于视觉特征的价值估计用于具身强化学习反馈世界模型实现扩散策略的精确引导FlowMPC:利用世界模型改进流匹配策略FlowMo-WM:具有物体动量与隐藏环境漂移的世界模型FlyMirage:通过生成式世界模型实现多样化可扩展无人机飞行数据的全自动生成流水线通过推理飞行:自适应无人机集群的主动推理世界模型Foresight:基于动作条件世界模型潜在表示的长时域机器人操作故障检测From Pixels to Concepts: Growing Rich 3D Semantic Scene Graph Forests utilizing Foundation Models从零到英雄:世界模型中的无训练自定义概念生成未来动态三维重建:一种解耦自运动的3D世界模型GE-Sim 2.0:迈向机器人操作的综合闭环视频世界模拟器路线图GEM-4D:几何增强的视频世界模型用于机器人操作GEM:用于占用预测和运动规划的高斯演化模型GEM:基于可变形Mamba的激光雷达世界模型生成Gamma-World:超越双玩家的生成式多智能体世界建模GaussianDream:用于机器人操作的前馈式3D高斯世界模型环境变化下基于视觉的四旋翼导航的世界模型泛化研究GeoSem-WAM: 几何与语义感知的世界动作模型GeoStream:迈向精确相机控制的流式视频生成GroupToM-Bench: Benchmarking Group Theory of Mind and Nonlinear Social Emergence in MLLMsHEAT: 基于轨迹引导的世界模型的异构端到端自动驾驶HERMES++:面向统一驾驶世界模型的3D场景理解与生成HOLO-MPPI:通过分层策略优化实现多场景运动规划HaM-World: 基于软哈密顿世界模型与选择性记忆的规划方法HarmoWAM:通过自适应世界动作模型协调泛化性与精确操作Hi-WM: 人在世界模型中的可扩展机器人后训练Holo-World:面向视频世界模型的统一相机、物体与天气控制HorizonDrive:用于长时域驾驶模拟的自校正自回归世界模型移动世界模型如何指导GUI智能体?世界模型应如何评估?一个以决策为中心的立场IDOL:基于逆动力学的未来预测用于端到端自动驾驶IFPV:一种用于生成式作战规划与高保真计划验证的集成多智能体框架IMWM:直觉模型补充世界模型用于潜在规划IOI:解耦运动学与物理学的交互式世界模型无高斯假设的可识别性:符号世界模型与近无限时间一致性ImageWAM:世界动作模型真的需要视频生成,还是只需图像编辑?通过想象确保分层强化学习的安全性使用基于潜在动作的世界模型从异构演示中进行模仿学习不完善的世界模型是可被利用的Incantation:自然语言作为多实体视频世界模型的动作接口基于视觉与触觉的推理时策略引导拦截未来:面向动态VLA操作的潜在空间预测世界模型逆向贝尔曼方程:从Q值到世界模型你的驾驶世界模型是全能选手吗?JEDI:面向在线基于模型强化学习的联合嵌入扩散世界模型Kairos:面向物理AI的原生世界模型栈LASER:面向连续场重建的学习型主动感知LEIA:面向交互式架构材料的学习环境LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving ModelLaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video GenerationLaST-HD: 从可扩展人类数据中学习潜在物理推理以实现机器人操作LaWAM: 潜在世界动作模型用于高效动力学感知机器人策略LaWM: 基于最小作用量原理的世界模型,用于从视觉观测实现长时域物理一致性超越搜索的潜在几何:在世界模型中摊销规划视频世界模型的潜在空间记忆充分性约束下世界模型的潜在状态设计学习动作条件与物体中心的高斯泼溅世界模型用于刚体物体学习多时间尺度抽象用于层次化组合规划通过残差潜在动作学习基于视觉特征的世界模型利用真实世界视频学习粒子动力学模型提升具身世界模型用于规划与控制轻交互:面向交互式视频世界模型的无训练推理加速LoViF 2026 首届面向4D世界模型的整体质量评估挑战赛 (PhyScore)MAD:面向敏捷四旋翼飞行的地图感知世界模型MBench:视频世界模型记忆能力的综合基准MCP-Cosmos:世界模型增强的智能体在MCP环境中的复杂任务执行MODIP:扩散策略的高效基于模型的优化MaineCoon:追求实时视听社交世界模型将预见转化为行动:世界动作模型中表示对齐的重新利用Mask World Model:预测关键因素以实现鲁棒机器人策略学习Mem-World:记忆增强的动作条件世界模型用于持久机器人操作MemoryVLA++:视觉-语言-动作模型中的记忆与想象时序建模MetaWorld:从单视角视频数据扩展多智能体视频世界模型Mind Dreamer:通过潜在流形上的主动因果干预释放想象力MoVerse:基于全景高斯支架的实时视频世界建模蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估MotionWAM: 迈向基础世界动作模型,实现实时人形机器人全身操控与运动MotuBrain:一种用于机器人控制的高级世界动作模型NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型纳米世界模型:未来视频预测的极简实现NarrativeWorldBench:一个前沿饱和的基准测试与面向长程协同创作音频剧的潜在世界模型NavWAM: 一种用于目标条件视觉导航的导航世界动作模型NavWM:一种用于前瞻性规划的统一导航世界模型网络高效的世界模型令牌流式传输Next Forcing:基于多块预测的因果世界建模Nous:一种用于长期智能体记忆的预测世界模型OSCAR:面向机器人的全具身动作条件视频世界模型OccDirector:语言引导的4D占据空间中的行为与交互生成OmniDrive:一种由LLM编排的多智能体世界模型,具有统一潜在协同压缩,用于多视角驾驶视频生成一张图像足矣:基于文本世界模型的智能一次性图像生成用于长尾空间感知一镜观多界:面向世界模型可解释性的能力类型化接口One Transit Is All You Need: Detecting Exoplanets Through Learned Stellar Behaviour with EXOVEILOptiWorld:物理约束下视频世界生成的最优控制OrbiSim:作为可微分物理引擎的世界模型用于具身智能PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVsPH-Dreamer: 基于端口-哈密顿生成动力学的物理驱动世界模型PLUME:用于多指操作的概率潜在统一世界建模与参数估计PRISM: 先验引导的世界模型想象采样PROWL:优先遗憾驱动的世界模型学习优化PanoWorld:用于一致的全屋全景合成的生成式空间世界模型PanoWorld:几何一致的全景视频世界建模PatchWorld:可执行世界模型的无梯度优化PearlVLA:潜在空间中的渐进式具身动作计划细化PhyGround:生成式世界模型中的物理推理基准测试PhyWorld:面向视频生成的物理忠实世界模型Phys-JEPA: 物理信息驱动的潜在世界模型用于多变量时间序列预测基于物理可控世界模型的物理对象理解物理本征世界模型:生成式世界建模的哈密顿视角Physics-Aware Sparse Learning and Selective Online Adaptation for Euler-Lagrange Robot DynamicsPhysics-IQ 验证PiL-World: 一种用于VLA策略在环评估的块状世界模型从像素到证明:通过并行共形鲁棒模型预测控制的概率安全潜在世界模型控制Pre-VLA: 用于可靠视觉-语言-动作与世界模型推演的抢先式运行时验证可预测但不可规划:面向潜在世界模型的RC-auxPriorZero:弥合语言先验与世界模型以进行决策Prisma-World: 相机可控的多智能体视频世界模型ProDrive:基于自车-环境协同演化的自动驾驶主动规划ProPlay:面向自进化LLM智能体的程序化世界模型探究规模对Atari上数据高效通用Transformer世界模型的影响面向几何一致性的定量视频世界模型评估Quantum Cinema: An Interactive Cinematic Exploration of Quantum Computing Hardware via Generative World ModelsQwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模ReactSim-Bench:自动驾驶中反应性行为世界模型模拟的基准测试ReactiveGWM:在反应式游戏世界模型中操控非玩家角色推理-想象-行动:基于世界模型的闭环大语言模型决策用于自动驾驶重建还是语义?什么使潜在空间对机器人世界模型有用基于世界模型的视频生成中物理一致性的无参考评估ReflectiChain:面向供应链韧性的LLM驱动世界模型中的认知基础在任务无关世界模型中强化VLA渲染而非解码:具有潜在结构解耦的权重空间世界模型驾驭变化的势能:何时反应控制足以实现多目标行为RoboDream:组合世界模型用于可扩展的机器人数据合成RoboFlow4D: 一种轻量级流世界模型,面向实时流引导的机器人操作SANA-WM:基于混合线性扩散Transformer的高效分钟级世界建模SC3-Eval: 通过自一致视频生成评估机器人基础模型SCAR:自监督连续动作表示学习SIMMER:使用世界模型对LLM可执行规划中的潜在故障进行基准测试ST-Gen4D: 将4D时空认知嵌入世界模型用于4D生成SURGE: 无近似与无训练的扩散替代模型粒子滤波器SWAP: 对称等变世界模型用于敏捷机器人跑酷SWEET: 基于图像编辑的稀疏世界建模用于具身任务执行SWoMo:用于白内障手术模拟的神经符号世界模型SafeDojo: 基于交互世界模型的安全强化学习用于视觉-语言-动作策略SafeMCP: 基于环境锚定的前瞻推理实现LLM智能体防御的主动能力调控通过扩散策略优化扩展世界模型强化学习预见明天,行动今天:前瞻驱动的自动驾驶基于因果世界建模的具身科学智能自演化认知框架基于世界模型的自监督分层视觉推理感知运动世界模型:通过逆动力学实现行动导向的感知Shadow-Loom: Causal Reasoning over Graphical World Models of Narratives密封审计上的有符号压缩进展具有古德哈特抗性利用生成式多模态人体生理模型模拟临床干预SkyJEPA:学习长时域世界模型以实现四旋翼飞行器的零样本仿真到现实控制Slot-MPC: 目标条件模型预测控制与对象中心表示Social World Model for Lifelong Social IntelligenceSparseWorld:通过稀疏场景表示的世界模型增强端到端自动驾驶通过数据投毒进行隐蔽的世界模型操纵StressDream:引导视频世界模型实现鲁棒的策略评估与改进海马-内嗅皮层启发的世界模型中的结构抽象与泛化Sub-JEPA:子空间高斯正则化实现稳定的端到端世界模型SurgVista:具有合理器械-组织动力学的长程手术世界建模Sword: 基于动态潜在引导的风格鲁棒世界模型用于VLA策略后训练模拟器TRAP:面向世界模型规划的尾部感知排序攻击TacForeSight:力引导的触觉世界模型用于接触丰富操作针对World Models以破坏机器人学习流水线教视频生成器记住:为视线外的状态演化引出动态记忆基于世界模型的仅动作扩散策略的时序逻辑引导以模式思考:通过模式归纳打破视觉规划中的感知瓶颈Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement PlanningThree-in-One World Model: Energy-Based Consistency, Prediction, and Counterfactual Inference for Marketing InterventionToward AI That Understands Self and Others: A World-Model Theory of Cognitive Diversity and AlignmentToward Compiler World Models: Learning Latent Dynamics for Efficient Tensor Program Search基于世界模型的安全自主机器人血管内介入治疗面向生理信号的混沌理论平衡与潜在动力学世界建模迈向交互式视频世界建模:前沿、挑战、基准与未来趋势Transformers Linearly Represent Highly Structured World Models修剪视觉世界建模评估的长尾将视频模型转化为通用机器人策略USS:面向具身视觉跟踪的统一空间-语义提示与潜在动态学习UWM-JEPA:在信念空间中进行想象预测的世界模型UniT:迈向统一物理语言,用于人-人形机器人策略学习与世界建模通过物理世界建模的统一三维场景理解基于视频先验与异步去噪的统一4D世界动作建模统一驾驶令牌:面向驾驶世界模型与规划的表示与几何引导离散分词器统一对象中心世界模型与扩散策略:面向多阶段机器人任务的层次化框架UniviewVLA:一种统一的多视角视觉-语言-动作模型与世界建模VANDERER: 基于未来感知与视觉好奇心引导的扩散策略的无地图探索VegSim:一种用于情景条件植被模拟的地理空间世界模型基于预测潜变量的视频生成WAM-RL: 基于重建奖励和在线视频SFT的世界-动作模型强化学习WBench:面向交互式视频世界模型评估的全面多轮基准WEAVER:更好、更快、更长:一种有效的机器人操作世界模型Wh0:生成式世界模型作为可扩展的自我中心人类手部操作数据源是什么让视频世界模型潜在表示具有动作相关性:预测优于重建你所想即你所见:通过视觉-语言好奇心驱动VLM智能体的探索假设世界:面向具身场景中通用世界模型的因果基准LeJEPA何时学习世界模型?Why Conclusions Diverge from the Same Observations: Formalizing World-Model Non-Identifiability via an InferenceWords as Difference Makers: How Large Language Models Determine Causal Structure in Text世界行动模型:综述世界动作模型:具身智能的下一个前沿世界模型自蒸馏:训练世界模型解决通用任务机器人学习中的世界模型:全面综述面向物理AI系统中语义通信的世界模型赋能因果数字孪生机器人操作的世界模型:综述世界模型碎片化:通用智能体的结构性认证World Pilot: 利用世界-动作先验引导视觉-语言-动作模型面向混合具身任务中长时程演化的世界-自我建模世界-任务分解用于机器人学习World2VLM:将世界模型想象力蒸馏到视觉语言模型中用于动态空间推理WorldArena 2.0:在模态、功能和平台上扩展具身世界模型基准测试WorldCraft:从相机导航到交互式视频世界模型中的物体操控WorldFly:基于世界模型的无人机导航视觉-语言-动作模型WorldKernel:世界模型是容许可能世界的耦合核WorldMark:交互式视频世界模型的统一基准套件WorldOlympiad:你的世界模型能通过三项全能测试吗?WorldString: 可操作的世界表示X-Cache: 跨块缓存用于少步自回归世界模型推理X-Foresight: 通过预测世界建模的联合视觉-动作因果预测网络小米汽车世界模型:一种融合重建与生成的联合世界模型用于自动驾驶YoCausal:从因果视角看视频生成离世界模型还有多远?dWorldEval:基于离散扩散世界模型的可扩展机器人策略评估minWM:一个用于实时交互式视频世界模型的全栈开源框架stable-worldmodel:一个用于可复现世界模型研究与评估的平台Paper - Voyager: An Open-Ended Embodied Agent with Large Language Models视频生成作为世界模型的机制视角:状态与动态系统工程中问题空间作为语义世界模型的形式化理论ABot-PhysWorld: 具有物理对齐的机器人操作交互式世界基础模型AcceRL:面向视觉-语言-动作模型的分布式异步强化学习与世界模型框架Action Shapley:强化学习中世界模型的训练数据选择度量推进开源世界模型智能体世界模型:用于智能体强化学习的无限合成环境AlignUSER: 通过世界模型实现人类对齐的LLM智能体用于推荐系统评估通过知识性经验学习对齐具身世界模型一种高效的多模态导航系统与单步世界模型超越像素历史:具有持久3D状态的世界模型Boltzmann-GPT:桥接基于能量的世界模型与语言生成BridgeV2W: 通过具身掩码桥接视频生成模型与具身世界模型桥接场景生成与规划:通过统一视觉与运动表示的世界模型驾驶CWM:具身智能体流水线中动作可行性学习的对比世界模型面向机器人控制的因果世界建模跨视角世界模型当前智能体未能利用世界模型作为预见工具DCARL: 一种用于自回归长轨迹视频生成的分治框架先描述后行动:通过蒸馏语言-动作世界模型实现主动智能体引导世界动作模型是否比视觉-语言-动作模型泛化更好?一项鲁棒性研究DreamDojo: 来自大规模人类视频的通用机器人世界模型DreamPlan:通过视频世界模型高效强化微调视觉语言规划器DreamSAC: 通过对称性探索学习哈密顿世界模型DreamWorld: Unified World Modeling in Video GenerationDreamerAD:基于潜在世界模型的高效强化学习自动驾驶方法Drive-JEPA:视频JEPA与多模态轨迹蒸馏的端到端驾驶DriveCtrl: 条件化的仿真到真实驾驶视频生成DrivingGen:自动驾驶中生成式视频世界模型的综合基准DynVLA:学习自动驾驶中动作推理的世界动态EVA:通过逆动力学奖励将视频世界模型与可执行机器人动作对齐通过语义掩码世界模型提升端到端城市自动驾驶的样本效率和鲁棒性面向可靠人机协作的显式世界模型因子化潜在动作世界模型流等变世界模型:面向部分观测动态环境的记忆面向在静态环境之外可靠学习、验证和适应的智能体的基础世界模型从生成引擎到可操作模拟器:世界模型中物理基础的必要性从观察到事件:面向强化学习的事件感知世界模型从部分到整体:具有自适应结构层次的三维生成世界模型GeoWorld:几何世界模型GigaBrain-0.5M:一个从基于世界模型的强化学习中学习的VLA模型Hand2World: 基于自由空间手势的自回归自我中心交互生成先想象后规划:基于世界模型的自适应前瞻智能体学习InSpatio-WorldFM:一种开源实时生成式帧模型基于潜在世界模型的视频生成模型推理时物理对齐视频世界模型中的物理解读面向数据高效自动驾驶的运动学感知潜在世界模型LIVE:长程交互式视频世界建模自动驾驶的潜在世界模型:统一分类法、评估框架与开放挑战Latent-WAM:面向端到端自动驾驶的潜在世界动作建模学习用于规划的不变视觉表示:基于联合嵌入预测世界模型在真实世界中学习Latent Action World ModelsLiveWorld:生成式视频世界模型中视线外动态的模拟MAD:面向高效驾驶世界模型的运动与外观解耦MIND:世界模型中记忆一致性与动作控制的基准测试MMaDA-VLA:统一多模态指令与生成的大型扩散视觉-语言-动作模型MVISTA-4D: 面向机器人操作的一致视角4D世界模型与测试时动作推理MWM:面向动作条件一致预测的移动世界模型MetaOthello:Transformer中多个世界模型的受控研究MetaWorld:面向高层指令接地的层次化世界模型中的技能迁移与组合MobileDreamer:面向GUI智能体的生成式草图世界模型基于可微分世界模型的模型预测控制在离线强化学习中的应用MosaicMem:面向可控视频世界模型的混合空间记忆NeoVerse:利用野外单目视频增强4D世界模型NeuroHex:用于创建世界模型以实现自适应AI的高效六边形坐标系统OCCVAR: 通过下一尺度预测实现可扩展的4D占用预测面向对象的世界模型与蒙特卡洛树搜索的结合面向因果感知强化学习的以对象为中心的世界模型Olaf-World:面向视频世界模型的潜在动作定向Omni-WorldBench:面向世界模型的全面交互中心评估论记忆:世界模型中记忆机制的比较眼不见,心不忘:动态视频世界模型的混合记忆PathWise:通过世界模型进行规划,实现基于自进化大语言模型的自动启发式设计持久机器人世界模型:通过强化学习稳定多步 rolloutPhysicsMind:面向基础视觉语言模型和世界模型的物理推理与预测的仿真与真实力学基准8个Token中的规划:一种用于潜在世界模型的紧凑离散分词器基于世界模型集成的规划PointWorld:面向野外机器人操作的大规模3D世界模型世界模型的概率化梦境通过测试时缩放探究世界模型在空间推理中的有效性解谜:面向离线多智能体强化学习的局部到全局世界模型R2-Dreamer:无需解码器或数据增强的冗余减少世界模型RAE-NWM:密集视觉表示空间中的导航世界模型RAYNOVA: 射线空间中的尺度-时间自回归世界建模ReWorld:面向具身世界模型的多维奖励建模真正实时的长视频生成模型ResWM:面向视觉强化学习的残差动作世界模型ResWorld:面向端到端自动驾驶的时间残差世界模型风险感知世界模型预测控制用于可泛化的端到端自动驾驶说、梦、行:面向指令驱动机器人操作的视频世界模型学习面向分层操作策略的世界模型扩展基于潜在动作的自我改进世界建模基于自监督JEPA的世界模型用于激光雷达占用补全与预测基于4D时空嵌入的自监督多模态世界模型面向3D人体运动预测的语义信念状态世界模型ShareVerse:面向共享世界建模的多智能体一致性视频生成模拟蒸馏:在仿真中预训练世界模型以实现快速真实世界适应Solaris: 在Minecraft中构建多人视频世界模型立体世界模型:相机引导的立体视频生成一致性三位一体:通用世界模型的定义性原则ThinkJEPA: 用大型视觉-语言推理模型赋能潜在世界模型面向挑战性轨迹的物理一致性驾驶视频世界模型UCM:通过时间感知位置编码扭曲统一相机控制与记忆的世界模型UniDrive-WM:面向自动驾驶的统一理解、规划与生成世界模型UniFuture:面向未来生成与感知的4D驾驶世界模型VJEPA:作为概率世界模型的变分联合嵌入预测架构VLA-JEPA: 通过潜在世界模型增强视觉-语言-动作模型VLAW: 视觉-语言-动作策略与世界模型的迭代协同改进VLM-DEWM: 用于制造业中可验证且鲁棒的视觉语言规划的动态外部世界模型基于价值引导的JEPA世界模型动作规划Vega:通过自然语言指令学习驾驶VerseCrafter: 具有4D几何控制的动态真实视频世界模型视觉生成通过多模态世界模型解锁类人推理穿行画作:基于互联网先验的自我中心世界模型什么驱动了联合嵌入预测世界模型在物理规划中的成功?当世界模型做错梦:针对世界模型的物理条件对抗攻击世界动作模型是零样本策略无世界模型的世界属性:从静态词嵌入的共现统计中恢复空间与时间结构World-VLA-Loop: 视频世界模型与VLA策略的闭环学习World2Act:基于技能组合世界模型的潜在动作后训练WorldArena:评估具身世界模型感知与功能实用性的统一基准WorldBench:为世界模型的诊断性评估而澄清物理概念WorldCache: 通过异构令牌缓存免费加速世界模型WorldCache: 内容感知缓存加速视频世界模型WorldRFT:面向自动驾驶的强化微调潜在世界模型规划WorldVLM:结合世界模型预测与视觉-语言推理Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing TestlX-World:可控的自车视角多摄像头世界模型,用于可扩展的端到端驾驶小米电动汽车世界模型:一种融合重建与生成的联合世界模型用于自动驾驶3D与4D世界建模:综述3D4D:通过3D视频生成的交互式、可编辑的4D世界模型3DFlowAction: 从3D流世界模型学习跨实体操作4DWorldBench:面向3D/4D世界生成模型的综合评估框架“良好”调节器可能为智能系统提供世界模型面向具身智能的世界模型综述基于在线模仿预训练世界模型的高效操作模拟到现实迁移方法迈向世界模型:机器人操作综述自动驾驶世界模型综述面向自动驾驶的未来物理世界生成综述基于声学物理信息的世界模型综述综述:从物理模拟器和世界模型学习具身智能幻觉的统一定义,或者:关键在于世界模型,笨蛋AD-L-JEPA: 基于联合嵌入预测架构的自监督空间世界模型用于激光雷达自动驾驶AD-R1: 基于Impartial World Models的端到端自动驾驶闭环强化学习AVD2: 事故视频扩散用于事故视频描述Act2Goal:从世界模型到通用目标条件策略大型语言模型中的主动困惑表达:利用世界模型提升社会推理能力通过闭环世界建模实现视频化身中的主动智能AdaPower:将世界基础模型专用于预测性操作AdaWM:基于自适应世界模型的自动驾驶规划适配视觉-语言模型以评估世界模型在3D游戏中调整世界模型以进行轨迹跟踪推进越野自动驾驶:大规模ORAD-3D数据集与综合基准面向长时域视觉生成与三维空间导航的空中世界模型Aether:几何感知的统一世界建模面向6G的智能体世界建模:近实时生成式状态空间推理对齐网络空间与物理世界:具身人工智能综述Astra: 基于自回归去噪的通用交互式世界模型AstraNav-World: 用于前瞻控制与一致性的世界模型视听世界模型:迈向视觉与听觉的多感官想象回归特征:DINO作为视频世界模型的基础世界模型学习的基准测试更好的世界模型可以提升训练后性能超越生成式AI:用于临床预测、反事实推断和规划的世界模型BiTAgent:一种任务感知的模块化框架,用于多模态大语言模型与世界模型的双向耦合从多模态基础模型中的动力学模型自举世界模型弥合多模态基础模型与世界模型之间的鸿沟CLARITY:通过建模潜在空间中的上下文感知疾病轨迹来指导治疗决策的医学世界模型CVD-STORM:面向自动驾驶的跨视角视频扩散与时空重建模型CWM:一个用于代码生成与世界模型研究的开放权重大语言模型因果制图师:从映射到反事实世界的推理CausalARC:基于因果世界模型的抽象推理ChronoDreamer: 动作条件的世界模型作为机器人规划的在线模拟器使用几何正则化世界模型克隆确定性3D世界缩小基于梯度的规划中世界模型的训练-测试差距共同演化的潜在动作世界模型CoEx:共同进化的世界模型与探索CoIRL-AD:基于潜在世界模型的协作-竞争模仿-强化学习用于自动驾驶CoT-VLA: 面向视觉-语言-动作模型的视觉思维链推理Code World Models for General Game Playing通过前瞻扩散实现一致性世界模型上下文与多样性至关重要:世界模型中上下文学习的涌现Continual Reinforcement Learning by Planning with Online World ModelsCorrectAD:一种自我纠正的智能体系统,用于改进自动驾驶中的端到端规划基于数字孪生条件视频扩散的反事实世界模型世界模型批判Ctrl-World:一种用于机器人操作的可控生成世界模型DC-MPC: 用于连续控制的离散码本世界模型DINO-Foresight: 用DINO展望未来DIO: 可分解隐式4D占用-流世界模型DMWM:具有长期想象能力的双心智世界模型DR. WELL: 基于符号世界模型的动态推理与学习在具身LLM多智能体协作中的应用DREAMer-VXS:一种用于随机、未观测环境中样本高效AGV探索的潜在世界模型DSG-World: 从双状态视频学习3D高斯世界模型演绎思维链增强的社交感知机器人导航世界模型基于扩散策略和多时间尺度世界模型的深度主动推理用于真实世界探索与导航Deep SPI:基于世界模型的安全策略改进DeepVerse:作为世界模型的4D自回归视频生成基于强化学习的文本游戏代理的设计与优化用于验证闭环视觉系统的确定性世界模型灵巧世界模型DiVE: 基于视频扩散Transformer的高效多视角驾驶场景生成DiWA: 基于世界模型的扩散策略自适应解耦世界模型:从干扰视频中学习迁移语义知识以用于强化学习端到端自动驾驶真的需要感知任务吗?基于预测性个体世界模型的梦想驾驶梦想驾驶:使用分析世界模型的基于模型的车辆控制DreamerV3-XP:通过不确定性估计优化探索DriVerse: 基于多模态轨迹提示与运动对齐的驾驶仿真导航世界模型Drive&Gen:协同评估端到端驾驶与视频生成模型DriveDreamer4D:世界模型是4D驾驶场景表示的有效数据机器DriveLaW:在潜在驾驶世界中统一规划与视频生成DriveVLA-W0: 世界模型放大自动驾驶中的数据缩放定律DrivingGPT:利用多模态自回归变换器统一驾驶世界建模与规划双心智世界模型:动态无线网络学习的一般框架用于世界模型增强的视觉-语言-动作模型的双流扩散DyWA: 动态自适应世界动作模型用于可泛化的非抓取操作Dyn-O:构建基于对象中心表示的结构化世界模型Dyna-Think:在AI智能体中协同推理、行动与世界模型模拟动态稀疏性:挑战机器人强化学习基准中学习世界模型的常见稀疏性假设DynamicCity:从动态场景生成大规模激光雷达数据上下文世界模型中用于零样本泛化的动态对齐潜在想象EWMBench: 评估具身世界模型中的场景、运动和语义质量EchoWorld:学习运动感知的世界模型用于超声心动图探头引导通过世界模型与自主人工智能的边缘通用智能:基础、解决方案与挑战基于世界模型的高效多样化协作智能体生成用于人形机器人接触规划的自我视觉世界模型具身AI智能体:世界建模具身思维树:基于具身世界模型的审慎操作规划具身世界模型从开放环境中的导航任务中涌现Emu3.5:原生多模态模型是世界学习者基于BEV世界模型的在线轨迹评估端到端驾驶增强轻量级世界模型中的物理一致性Epona: 面向自动驾驶的自回归扩散世界模型在Veo世界模拟器中评估Gemini Robotics策略在世界模型中评估机器人策略EvoAgent:基于持续世界模型的智能体自主演化以完成长时域任务FASTopoWM: 基于潜在世界模型的快慢车道段拓扑推理FLARE: 隐式世界建模的机器人学习FOUNDER:将基础模型嵌入世界模型以实现开放式具身决策FUTURIST:通过多模态视觉序列变换器推进语义未来预测FantasyWorld: 通过统一视频与3D预测实现几何一致的世界建模FieldSeer I:物理引导的世界模型用于部分可观测下的长时域电磁动力学FlowDreamer: 基于流运动表示的RGB-D世界模型用于机器人操作基础模型作为世界模型:基于文本网格世界的基础研究从二维到三维认知:通用世界模型简要综述从好奇心到能力:世界模型如何与探索动态相互作用从预测到规划:用于协同状态-动作预测的策略世界模型从模仿到探索:基于世界模型的端到端自动驾驶从掩码到世界:世界模型漫游指南从文字到世界:大型语言模型能否成为隐式文本世界模型?FutureSightDrive: 利用时空思维链进行视觉推理的自动驾驶GAF:高斯动作场作为机器人操作的动态世界模型GAIA-2:一种用于自动驾驶的可控多视角生成世界模型GAWM:面向多智能体强化学习的全局感知世界模型GEM:一种可泛化的自我视觉多模态世界模型,用于细粒度自我运动、物体动态和场景组成控制GLAM:基于Mamba的世界模型中的全局-局部变化感知GWM:面向可扩展的高斯世界模型的机器人操作GaussianDWM: 基于3D高斯驾驶世界模型的统一场景理解与多模态生成GaussianWorld: 高斯世界模型用于流式3D占据预测通用智能体需要世界模型通过大型语言模型的测试时扩展生成符号世界模型面向人形机器人的生成式世界建模:1X世界模型挑战技术报告GenieDrive: 面向物理感知的驾驶世界模型,基于4D占用引导的视频生成GeoDrive: 三维几何信息驱动的驾驶世界模型与精确动作控制GigaBrain-0: 一种基于世界模型的视觉-语言-动作模型GigaWorld-0:世界模型作为数据引擎赋能具身AI图世界模型GrndCtrl:通过自监督奖励对齐实现世界模型的空间基础化HERMES:用于同时进行3D场景理解与生成的统一自动驾驶世界模型HERO:面向高效世界模型的分层外推与刷新机制更高的嵌入维度为简单排序任务创建更强的世界模型外科医生距离手术世界模型还有多远?一项关于零样本手术视频生成与专家评估的初步研究混淆世界模型有多难?混元-GameCraft-2: 指令跟随的交互式游戏世界模型I2-World:面向高效动态4D场景预测的帧内-帧间标记化IPR-1:交互式物理推理器ImagiDrive: 一种统一的想象与规划框架用于自动驾驶InDRiVE: 基于潜在分歧的无奖励世界模型预训练用于自动驾驶跨环境世界建模:面向连续与组合动力学认知主体中作为想象网络的内部世界模型JEDI:潜在端到端扩散缓解基于模型的强化学习中智能体与人类性能不对称性KAN-Dreamer:将Kolmogorov-Arnold网络作为世界模型中的函数逼近器进行基准测试KeyWorld:关键帧推理实现高效且有效的世界模型大语言模型的世界模型是心理性的:输出层证据表明大语言模型在机械推理中使用脆弱的内部世界模型LLM-JEPA:大型语言模型与联合嵌入预测架构的结合LLM作为评判者:迈向榜单推荐系统的世界模型LS-Imagine: 基于长短期想象的开世界强化学习LUMOS:基于语言条件的世界模型模仿学习LaGen:面向自回归LiDAR场景生成语言驱动的层次化任务结构作为多智能体学习的显式世界模型语言条件的世界模型通过阅读环境描述提升策略泛化能力大型情感世界模型用于无标签轨迹控制的潜在动作世界模型端到端驾驶中的潜在思维链世界建模基于具身无关预训练世界模型的潜在策略引导潜在空间自回归世界模型用于高效鲁棒的图像目标导航LatticeWorld:一种多模态大语言模型赋能的交互式复杂世界生成框架学习具有群结构潜在空间的抽象世界模型学习原始具身世界模型:迈向可扩展的机器人学习学习真实世界动作-视频动态的异构掩码自回归从音频世界模型学习机器人操作基于自监督学习的预测世界模型探索学习学习用于交互式视频生成的世界模型学习对抗性世界模型用于多智能体强化学习中的自动课程生成学习生成4D LiDAR序列LiDARCrafter:从LiDAR序列进行动态4D世界建模LiSTAR: Ray-Centric World Models for 4D LiDAR Sequences in Autonomous Driving长上下文状态空间视频世界模型LongDWM: 跨粒度蒸馏用于构建长期驾驶世界模型LongScape: 利用上下文感知MoE推进长时域具身世界模型LongVie 2: 多模态可控超长视频世界模型M^3:基于令牌流的模块化世界模型MagicDrive-V2: 面向自动驾驶的自适应控制高分辨率长视频生成ManiGaussian++: 基于分层高斯世界模型的通用机器人双臂操作ManipDreamer:利用动作树与视觉引导提升机器人操作世界模型火星世界模型:基于物理精确三维重建的可控视频合成MaskGWM: 一种具有视频掩码重建的泛化驾驶世界模型Matrix-Game 2.0:一个开源、实时、流式交互世界模型衡量LLMs中的(充分)世界模型:一个方差分解框架Memory Forcing: 用于Minecraft一致场景生成的时空记忆基于离散世界模型的元强化学习用于自适应负载均衡MiLA:面向自动驾驶的多视角高保真长时视频生成世界模型MinD:通过分层世界模型实现统一的视觉想象与控制MindDrive:一个融合世界模型与视觉语言模型的端到端自动驾驶一体化框架MindJourney:基于世界模型的测试时扩展用于空间推理MineWorld:一个基于Minecraft的实时开源交互式世界模型基于世界模型的缺失目标相关信息预测以实现精确的零样本组合图像检索MoVieDrive: 多模态多视角城市场景视频生成MoWM:基于潜在到像素特征调制的混合世界模型用于具身规划MobiWorld:移动无线网络的生成式世界模型MorphoSim:一个交互式、可控、可编辑的语言引导4D世界模拟器Motus:统一潜在动作世界模型多模态梦境:一种基于Global Workspace的世界模型强化学习方法NORA-1.5: 一种使用世界模型和基于动作的偏好奖励训练的视觉-语言-动作模型NRSeg:基于驾驶世界模型的BEV语义分割噪声鲁棒学习结构化世界模型的自然构建块:理论、证据与扩展NavForesee: 一种用于分层规划和双视野导航预测的统一视觉-语言世界模型NavMorph:面向连续环境下的视觉与语言导航的自进化世界模型导航世界模型神经运动模拟器:推动强化学习中世界模型的极限OccProphet:利用观察者-预测者-优化者框架推动纯相机4D占用预测的效率前沿OccTENS:基于时间下一尺度预测的3D占用世界模型机器人占据世界模型离线机器人世界模型:无需物理模拟器学习机器人策略OmniNWM:全知驾驶导航世界模型OmniWorld:用于4D世界建模的多领域多模态数据集一生学习:从无引导探索中推断随机环境的符号世界模型一个模型应对所有任务:在多任务规划中利用高效世界模型OpenTwinMap:面向城市自动驾驶的开源数字孪生生成器Orbis:克服驾驶世界模型中长时域预测的挑战其他车辆轨迹同样必要:一种驾驶世界模型在视频潜在空间中统一自车与他车轨迹PIGDreamer: 特权信息引导的世界模型用于安全部分可观测强化学习PIN-WM: 学习物理信息世界模型用于非抓取操作ParticleFormer:一种用于多物体、多材料机器人操作的三维点云世界模型PhysWorld: 从真实视频到可变形物体的世界模型——通过物理感知的演示合成PhysicalAgent:迈向基于基础世界模型的通用认知机器人基于视觉语言世界模型的推理规划PlayerOne:自我中心世界模拟器PragWorld:在最小语言变化和对话动态下评估LLMs局部世界模型的基准棱镜世界模型:学习混合系统中的组合动力学用于规划ProTerrain: 概率物理信息驱动的粗糙地形世界建模ProphetDWM: 一种用于展开未来动作和视频的驾驶世界模型R-WoM:面向计算机使用代理的检索增强世界模型RELIC:具有长时记忆的交互式视频世界模型RLVR-World:使用强化学习训练世界模型RadarGen:基于摄像头的汽车雷达点云生成Raw2Drive:基于对齐世界模型的强化学习用于端到端自动驾驶(在CARLA v2中)ReSim:面向自动驾驶的可靠世界模拟ReconDreamer: 通过在线恢复构建驾驶场景重建的世界模型测试时观测干预的重新想象:用于视觉模型预测控制的干扰鲁棒世界模型预测面向遥感的世界模型重新思考驾驶世界模型作为感知任务的合成数据生成器重新思考模拟与渲染的二分法:空间世界建模中没有免费午餐RoboHorizon:一种基于LLM辅助的多视角世界模型用于长时域机器人操作RoboScape-R: 统一奖励-观测世界模型用于通过强化学习实现可泛化机器人训练RoboScape:物理信息驱动的具身世界模型机器人世界模型:一种用于鲁棒策略优化的神经网络模拟器RynnVLA-002:统一的视觉-语言-动作与世界模型SAMPO:面向生成式世界模型的尺度级自回归与运动提示SCMA: 基于自洽模型的视觉强化学习适应方法STAGE:一种面向长时域驾驶场景仿真的流式生成世界模型STORM: 搜索引导的生成式世界模型用于机器人操作通过世界模型学习的安全规划与策略优化基于视频世界模型的可扩展策略评估扩展以占据为中心的驾驶场景生成:数据集与方法SceneDiffuser++:基于生成世界模型的城市级交通仿真看得清晰,遗忘深刻:重新审视用于驾驶模拟的微调视频生成器Sekai:面向世界探索的视频数据集基于世界模型的语义通信语义世界模型Semi-SD: 基于环视摄像头的半监督度量深度估计用于自动驾驶面向自动驾驶的半监督视觉中心三维占据世界模型SimWorld:基于世界模型的模拟器条件场景生成统一基准简单、好、快:无负担的自我监督世界模型SimuRA:基于LLM世界模型的模拟推理架构实现通用目标导向智能体先模拟后规划:构建内在用户世界模型以实现用户定制对话策略规划用人工智能模拟视觉世界:路线图SmallWorlds:在隔离环境中评估世界模型的动态理解能力社会世界模型增强的机制设计策略学习社会世界模型高效视觉世界模型规划中的稀疏想象SparseWorld-TC: 轨迹条件稀疏占用世界模型SparseWorld: 一种灵活、自适应且高效的4D占用世界模型,由稀疏动态查询驱动时空预测即规划:一种使用生成世界模型的基于模型的强化学习方法语音世界模型:基于显式推理的因果状态-动作规划StateSpaceDiffuser:将长上下文引入扩散世界模型Surfer:基于世界模型的视觉语言机器人操作框架为双层规划合成世界模型TeleWorld:迈向基于4D世界模型的动态多模态合成时间三平面变换器作为占据世界模型Terra: 可探索的原生3D世界模型与点潜变量TesserAct:学习4D具身世界模型Text2World:用于符号世界模型生成的大语言模型基准测试代码世界模型的双重生活:通过执行轨迹可证明地揭露恶意行为世界模型在塑造自动驾驶中的作用:一项全面综述具身AI智能体世界模型的安全挑战:综述大脑与AI的趋同:用于通用计算的预测性和生成性世界模型三思而后行:受世界模型启发的自动驾驶多模态定位Thinking Ahead: Foresight Intelligence in MLLMs and World Models行而知之:通过多轮交互构建LLM高效世界模型推理时间感知世界模型用于自适应预测与控制迈向记忆辅助的世界模型:通过空间一致性进行基准测试迈向稳定世界模型:在生成环境中测量和解决世界不稳定性面向高一致性具身世界模型的多视角轨迹视频方法迈向基于高效潜在流匹配的基础LiDAR世界模型TraceGen:三维轨迹空间中的世界建模实现跨具身视频学习TransDreamerV3:在DreamerV3中植入Transformer面向样本高效多智能体强化学习的Transformer世界模型U4D: 基于LiDAR序列的不确定性感知4D世界建模UP-VLA:面向具身智能体的统一理解与预测模型UniUGP:统一理解、生成与规划以实现端到端自动驾驶统一视觉-语言-动作模型统一世界模型:耦合视频与动作扩散用于大规模机器人数据集预训练统一世界模型:用于视觉导航的记忆增强规划与预见解锁更智能的设备控制:基于世界模型驱动的代码执行方法的前瞻性规划V-JEPA 2: 自监督视频模型实现理解、预测与规划VAGEN:强化多轮VLM智能体的世界模型推理VCWorld:用于虚拟细胞模拟的生物世界模型VDAWorld:通过VLM导向的抽象与模拟进行世界建模VFMF:通过预测视觉基础模型特征进行世界建模VISTAv2:面向室内视觉-语言导航的世界想象VL-SAFE: 视觉语言引导的基于世界模型的安全感知强化学习用于自动驾驶VaViM与VaVAM:通过视频生成建模实现自动驾驶大脑中的向量量化:世界模型中的网格状编码面向自动驾驶的车辆动力学嵌入世界模型ViPRA:面向机器人动作的视频预测Vid2World:将视频扩散模型打造为交互式世界模型具有长期空间记忆的视频世界模型VideoVerse:你的文本到视频生成器距离世界模型还有多远?基于隐式残差世界模型的视觉中心4D占用预测与规划Visionary:基于WebGPU驱动的高斯泼溅平台构建的世界模型载体面向手术机器人的基于世界模型的视觉运动抓取WMNav:将视觉-语言模型融入世界模型以实现目标物体导航WMPO:基于世界模型的视觉-语言-动作策略优化Web世界模型神经网络学习“世界模型”意味着什么?基础模型发现了什么?利用归纳偏置探测世界模型未知之伤:潜在安全过滤器对部分可观测安全约束的理解程度如何?神经网络何时学习世界模型?WoMAP:面向具身开放词汇目标定位的世界模型WoW:通过具身交互迈向全知世界模型面向具身代理测试时适应的世界模型植入基于世界模型的端到端场景生成用于自动驾驶事故预测世界建模造就更好的规划器:面向具身任务规划的双重偏好优化世界模型可利用人类视频进行灵巧操作世界模型应优先统一物理与社会动态知道何时不知道的世界模型:具有校准不确定性的可控视频生成World Models 解锁强化学习智能体中的最优觅食策略世界模型作为快速运动适应的参考轨迹基于激光雷达观测的陆地机器人自主导航的世界模型面向认知智能体的世界模型:未来网络中的边缘智能变革受世界模型启发的讽刺推理:基于大型语言模型智能体世界中的世界:闭环世界中的世界模型World4Drive:基于意图感知的物理潜在世界模型的端到端自动驾驶World4Omni: 从图像生成世界模型到机器人操作的零样本框架World4RL:基于扩散世界模型的强化学习策略优化用于机器人操作WorldLens:真实世界中驾驶世界模型的全频谱评估WorldModelBench:评判视频生成模型作为世界模型WorldPack: 压缩记忆提升视频世界模型中的空间一致性WorldPlanner: 基于动作条件视觉世界模型的Monte Carlo Tree Search与MPCWorldPlay:面向实时交互世界建模的长期几何一致性WorldVLA:迈向自回归动作世界模型WristWorld: 通过4D世界模型生成腕部视角用于机器人操作X-WIN: 通过预测感知构建胸部X光片世界模型Xray2Xray: 基于胸部X射线的具有体积上下文的世界模型Zero-Splat TeleAssist:一种用于语义遥操作的零样本姿态估计框架通过记忆搜索的零样本世界模型seq-JEPA:不变-等变世界模型的自回归预测学习3D-VLA:一个三维视觉-语言-动作生成世界模型AD3: 隐式动作是世界模型区分多样化视觉干扰物的关键AVID:将视频扩散模型适配为世界模型自适应世界模型:在非平稳性下通过潜在想象学习行为推进人形机器人运动:通过去噪世界模型学习掌握具有挑战性的地形基于世界知识模型的智能体规划基于解耦动态流和图像辅助训练的高效占用世界模型BEVWorld:基于统一BEV潜在空间的多模态世界模型用于自动驾驶BWArea模型:学习世界模型、逆动力学和策略以实现可控语言生成基于世界模型不确定性的软演员-评论家强化学习算法中的有界探索CarDreamer:基于世界模型的开源自动驾驶学习平台CarFormer: 基于学习的目标中心化表示的自动驾驶GPT模型中的因果世界表征CityBench: 评估大型语言模型作为世界模型的能力CoDreamer:基于通信的分散式世界模型语言模型的认知地图:通过语言表示世界模型实现最优规划认知启发的基于能量的世界模型竞争与组合:学习模块化世界模型的独立机制Copilot4D: 通过离散扩散学习自动驾驶的无监督世界模型DINO-WM: 基于预训练视觉特征的世界模型实现零样本规划DOME:驯服扩散模型以实现高保真可控占据世界模型DexSim2Real$^2$:构建显式世界模型以实现精确的铰接物体灵巧操作扩散模型用于世界建模:视觉细节在Atari中的重要性Transformer世界模型是否提供更好的策略梯度?Doe-1: 基于大世界模型的闭环自动驾驶梦想操控:组合世界模型赋能机器人模仿学习与想象力DreamSmooth: 通过奖励平滑改进基于模型的强化学习梦见多重世界:学习上下文世界模型助力零样本泛化DriveDreamer-2: 基于LLM增强的世界模型用于多样化驾驶视频生成DriveDreamer:面向真实世界驱动的自动驾驶世界模型DriveGenVLM: 面向基于视觉语言模型的自动驾驶的真实世界视频生成DriveWorld:基于世界模型的自动驾驶4D预训练场景理解在占用世界中驾驶:基于世界模型的视觉中心4D占用预测与规划用于自动驾驶驶向未来:基于World Model的多视角视觉预测与规划在自动驾驶中的应用DrivingDojo数据集:推动交互式与知识增强的驾驶世界模型DrivingWorld: 通过视频GPT构建自动驾驶世界模型EVA:面向未来视频预测的具身世界模型基于对象中心抽象的高效探索与判别性世界模型学习基于上下文感知标记化的高效世界模型从有限生命主体中涌现的隐式世界模型利用潜在世界模型增强端到端自动驾驶评估生成模型中隐含的世界模型探索自动驾驶中视频生成与世界模型之间的相互作用:一项综述自动驾驶的通用预测模型Generative Emergent Communication: 大型语言模型是一个集体世界模型Genie:生成式交互环境通过生成式世界模型为多智能体决策问题提供有依据的答案基于不完美世界模型将大型语言模型接地于具身环境HarmonyDream:世界模型内的任务协调分层世界模型作为视觉全身人形控制器Hieros:结构化状态空间序列世界模型上的分层想象HoloDrive: 面向自动驾驶的全方位2D-3D多模态街景生成视频生成离世界模型有多远:从物理定律的角度IGOR:图像目标表示是具身AI中基础模型的原子控制单元Imagine-2-Drive:面向自动驾驶的CARLA高保真世界建模通过并行观测预测改进基于标记的世界模型InfinityDrive: 打破驾驶世界模型的时间限制Sora是世界的模拟器吗?关于通用世界模型及其超越的综合综述你的大语言模型是否秘密地是一个互联网世界模型?基于模型的Web智能体规划语言代理遇见因果性——连接LLMs与因果世界模型学习世界模型的潜在动态鲁棒表示从潜在世界模型中学习多重概率决策的自动驾驶面向无约束目标导航的世界模型学习在视觉表示学习中学习与利用世界模型LidarDM:在生成世界中的生成式激光雷达仿真MAMBA:一种有效的元强化学习世界模型方法MagicDrive: 具有多样化3D几何控制的街景生成MagicTime:延时视频生成模型作为变形模拟器将大型语言模型转化为具有前提和效果知识的世界模型使离线强化学习在线化:面向离线视觉强化学习的协作世界模型ManiGaussian: 面向多任务机器人操作的动态高斯溅射利用世界模型掌握记忆任务利用潜在空间生成世界模型缓解自动驾驶模仿学习中的协变量偏移运动提示:通过运动轨迹控制视频生成基于视觉世界模型的多任务交互式机器人集群学习Multimodal foundation world models for generalist embodied agentsOccLLaMA:一种用于自动驾驶的占用-语言-动作生成世界模型OccSora: 作为自动驾驶世界模拟器的4D占用生成模型OccWorld: 学习用于自动驾驶的3D占用世界模型使用合成先验训练的Transformer的一次性世界模型Owl-1: 用于一致长视频生成的全面世界模型PIVOT-R: 基于原语驱动的路径点感知世界模型用于机器人操作PWM:基于大规模世界模型的策略学习物理信息驱动的驾驶世界模型基于自适应世界模型的自动驾驶规划预测与行动:世界建模与智能体建模之间的权衡探究多模态大语言模型作为驾驶世界模型的能力R-AIF: 基于主动推理与世界模型的像素级稀疏奖励机器人任务求解RenderWorld:具有自监督3D标签的世界模型在生成式世界模型中表示位置信息以进行物体操作在线模仿学习的无奖励世界模型RoboDreamer: 学习组合世界模型用于机器人想象SafeDreamer: 基于世界模型的安全强化学习预训练智能体与世界模型的缩放定律SimuDICE: 通过世界模型更新和DICE估计的离线策略优化StoryWeaver: 一个用于知识增强的故事角色定制的统一世界模型TD-MPC2:面向连续控制的可扩展、鲁棒世界模型Terra ACT-Bench: 迈向自动驾驶的动作可控世界模型The Matrix:具有实时移动控制的无限视界世界生成Think2Drive: 通过在潜在世界模型中思考实现准真实自动驾驶的高效强化学习将世界标记化为对象级知识以应对自动驾驶中的长尾事件迈向物理可解释的世界模型:用于视觉轨迹预测的有意义的弱监督表示揭示与改进世界模型中的泛化能力Transformer在迷宫求解任务中使用因果世界模型Transformers与槽编码用于样本高效的物理世界建模UnO:用于感知和预测的无监督占用场理解世界还是预测未来?世界模型综述UniMLVG:面向自动驾驶的多视角长视频生成统一框架,具备全面控制能力利用可控长视频生成释放端到端自动驾驶的泛化能力UrbanWorld:用于3D城市生成的城市场景世界模型VidMan:从视频扩散模型中挖掘隐式动力学以实现高效机器人操作Vista: 一个高保真且多可控的通用驾驶世界模型VisualPredicator: 使用神经符号谓词学习抽象世界模型进行机器人规划WHALE: 面向通用且可扩展的具身决策世界模型具有世界模型的网络智能体:在网页导航中学习与利用环境动态基于RingAttention的百万长度视频与语言世界模型基于世界模型的视觉腿式运动感知世界模型增强强化学习的自主性自动驾驶的世界模型:初步综述融合大型语言模型提示的世界模型用于目标达成世界模型:安全视角WorldDreamer:通过预测掩码标记实现通用世界模型以进行视频生成ADriver-I: 一种用于自动驾驶的通用世界模型分类交通Transformer:基于标记化潜变量的可解释与多样化行为预测FOCUS:面向机器人操作的对象中心世界模型GAIA-1:面向自动驾驶的生成式世界模型学习用语言建模世界MUVO:一种基于几何表示的多模态生成式世界模型用于自动驾驶STORM: 基于随机Transformer的高效世界模型用于强化学习面向强化学习任务泛化的Task Aware DreamerTrafficBots:面向自动驾驶仿真与运动预测的世界模型基于Transformer的世界模型在10万次交互中表现优异Transformer是样本高效的世界模型UniWorld: 基于世界模型的自动驾驶预训练DayDreamer:用于物理机器人学习的世界模型基于像素的深度分层规划DreamerPro: 基于原型表示的无重建模型强化学习DreamingV2:无需重建的离散世界模型强化学习面向自动驾驶规划的分层基于模型模仿学习Iso-Dream:在世界模型中隔离与利用不可控视觉动态Symphony:学习真实且多样化的智能体用于自动驾驶仿真利用离散世界模型掌握Atari游戏梦想控制:通过潜在想象学习行为通过自监督世界模型进行规划探索世界模型PerceptUI:面向UI/UX评估的类人对齐合成用户LLM代理MemoBench:动态变化环境中世界建模的基准测试EO-WM: 一种物理信息引导的世界模型用于概率性地球观测预测世界模型中的幻觉是可预测且可预防的PhysiFormer:学习在世界空间中模拟力学快速LeWorldModelPredRNN: 一种用于时空预测学习的循环神经网络SimVP:更简单却更好的视频预测用于视频预测和填充的扩散模型时间注意力单元:迈向高效时空预测学习OpenSTL:时空预测学习的综合基准MCVD:用于预测、生成和插值的掩码条件视频扩散MemLearner:学习查询上下文记忆以用于视频世界模型从动作到世界建模的可迁移动力学先验学习DreamForge-World 0.1 预览版:一种低计算量、实时可控的世界模型Valdi:价值扩散世界模型ABot-M0.5:统一移动与操作的世界动作模型WorldDirector:构建具有持久动态内存的可控世界模拟器WorldOdysseyBench:面向交互式世界模型长时程稳定性的开放世界基准测试DVG-WM: 解耦视频生成实现高效具身世界模型用于机器人操作从世界模型到世界动作模型:面向机器人的简明教程OPINE-World: 基于本体错误优先的交互式探索的程序化世界建模认证世界模型作为感知时钟:面向主动感知的漂移感知截止时间安全且自适应的云修复:利用神经符号世界模型验证LLM生成的恢复计划预测潜在世界模型的闭环性能:面向LunarLander中非马尔可夫奖励的MPC与基于模型的强化学习的离线检查点选择PhysMani: 基于物理原理的动态物体操作三维世界模型PWM-ArtGen: 面向铰接物体生成的部分世界模型Bridge-WA:预测世界变化的位置和方式以支持机器人动作ACID:基于逆动力学的动作一致性用于世界模型规划WorldSample: 基于世界建模的闭环真实机器人强化学习OWMDrive: 基于4D占用世界模型的因果感知端到端自动驾驶面向LLM智能体规划的自进化世界模型基于结构化自回归建模的长期交通仿真Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型一个视频,一个世界:将单目视频转化为物理4D场景世界模型崩溃作为一种相变在行动前询问世界:预算环境探测用于世界模型校准WorldRoamBench:面向交互式世界模型长时程稳定性的开放世界基准AdaJEPA: 一种自适应潜在世界模型3D点云世界模型:点云补全实现更精确的动态学习RetailSMV: 零售场景中基础视频世界模型的外部视角与自我视角适应演化环境中具身智能体的多尺度世界模型混合物理可行世界模型中的路径规划RoboWorld:用于通用机器人策略评估的快速可靠神经模拟器IRASim:一种用于机器人操作的细粒度世界模型统一视频动作模型EnerVerse-AC:基于动作条件的具身环境展望VLA-RFT:基于世界模拟器中验证奖励的视觉-语言-动作强化微调GigaWorld-1:构建用于机器人策略评估的世界模型路线图Worldscape-MoE: 一种统一的混合专家世界模型,用于可扩展的异构动作控制DynaVieW:基于模式引导的世界模型用于理解层次化视觉动态无人机最后米级精确导航:一种扩散精化空中视觉伺服方法通过协同智能体探索与结构化建模学习任务充分的世界模型Operator-on-F 补充价值等价性:一种用于潜在世界模型的规划时诊断地理多样性胜过数据量:零标签JEPA驾驶世界模型的跨域泛化Mask2Real-WM: 分割掩码作为从仿真到现实的桥梁用于可控灵巧世界模型KAM-WM:基于潜在世界模型的运动学可操作度图用于机器人操作DSWAM:一种用于精细机器人操作的双系统世界动作基础模型Qantara: 多范式JEPA控制的桥流训练MoP-JEPA:面向随机JEPA世界模型的硬分配预测器混合基于表示自编码器的多玩家交互世界模型Deform360:用于可变形世界模型的大规模多视图触觉数据集LongCat-Video 技术报告RynnWorld-4D:面向机器人操作的4D具身世界模型RynnWorld-Teleop: 一种用于数字遥操作的动作条件世界模型AlayaWorld: 长时域与可玩视频世界生成想象出的展开是运动学的,而非动力学的:长时域世界模型失败的诊断WildCity:一个真实世界城市规模的渲染、仿真与空间智能测试平台无限世界与多样化交互PanoWorld:真实世界全景生成Flow-ERD:面向多样化交通仿真的智能体类型感知流匹配与熵正则化蒸馏方法Pathdreamer: 一种用于室内导航的世界模型V-ReasonBench:面向视频生成模型的统一推理基准套件小米机器人-U0:基于世界基础模型的统一具身合成改进学习型时间序列模型的多步预测面向通用交通智能体模拟的多样化行为扩散BehaviorGPT: 基于下一补丁预测的自动驾驶智能体仿真在轨道上的世界中学习驾驶空间中的自我:无人机具身智能中自我意识与空间认知的基准测试GigaWorld-Policy-0.5: 一种由AutoResearch驱动的更快更强的WAM多智能体轨迹预测中的碰撞避免绕行方法用于多步视觉推理的分层去噪RxBrain:具身认知基础模型,联合语言-视觉推理与想象从像素到状态:将交互式世界模型重新构想为游戏引擎世界模型能否助力VLM理解世界动态?LDA-1B:通过通用具身数据摄入扩展潜动力学动作模型重新思考面向具身世界的视频生成模型长视频生成的Mixture of Contexts递归自回归扩散:全局记忆与局部注意力E3DGS:通过颜色作为几何嵌入实现3D高斯泼溅的统一几何-光度等变性SeerGuard:基于世界模型预测的移动图形用户界面代理安全框架Orbis 2: 一种用于驾驶的分层世界模型DSWorld: 面向高效自主智能体的数据科学世界模型从世界反馈中学习:为什么模型不确定性在基于模型的强化学习中不能作为风险信号PAVXploreRL: 物理-动作-视觉世界模型强化学习与动作探索GeoWorldAD:面向自动驾驶的几何世界动作模型视频中的思考:视频生成器真的能推理现实世界吗?强化学习:从算法到基础模型基于Transformer的规划:计算链与结构化上下文窗口基于世界模型的移动网络控制SAGE: 子目标条件动作生成用于潜在世界模型规划面向统一世界建模的掩码视觉动作掩码扩散语言模型是强健且可引导的基于文本的世界模型,用于智能体强化学习Open-AoE:面向具身学习的开放式自我中心操作数据集与工具链Apple-π: 通过视频对基于物理定律的物理智能进行思维基准测试EvolvingWorld:交互文学世界中角色扮演智能体与世界模型协同演化的开放模式框架AlayaWorld:交互式长时世界建模 —— 完整技术报告游戏速度下的生成式世界渲染器ABot-World-0:在单桌面GPU上实现无限交互世界展开带世界状态寄存器的流式多智能体自回归扩散模型Stable Video Infinity: 基于错误回收的无限长度视频生成GameFactorly:利用生成式交互视频创造新游戏LoViC: 基于上下文压缩的高效长视频生成可玩视频生成生成式预训练自回归扩散Transformer基于下一片段扩散的Video-GPTRoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation机器人学中的视频生成模型——应用、研究挑战与未来方向Wonder: 更优的视频世界模型WorldDiT:统一的世界与动作建模扩散架构时间距离JEPA:面向潜在世界模型预测控制的规划感知表示学习VisualPatchWorld:代码世界模型作为规划中的潜在结构化表示ACE-Data-0:以人為中心的環境捕捉作為具身數據引擎PhiZero:基于物理语言构建的世界模型StatePlay:面向机制一致生成的状态感知游戏世界模型INTACT:面向无搜索世界模型的同构意图到动作学习ShadowDancer:通过学习视频及其阴影的统一动态表示,教授视频世界模型任意动作MultiWorld: 可扩展的多智能体多视角视频世界模型从像素进行规划:使用逆动力学模型SlowFast-VGen:面向动作驱动的长视频生成的慢-快学习QQWorld:基于分位数-分位数匹配的世界模型正则化World Action Planner: Generalizable Decision-Making with Action-Conditioned World ModelsODEWorld: 一种基于物理时间流的连续预测架构SG-WAM: 几何感知策略空间中的自引导世界建模HelloWorld:在视频世界模型中实现社交互动角色MiniWorld:从零开始训练视频世界模型的民主化Quo Vadis, World Modeling?WorldClaw: 大规模自主式3D开放世界生成WorldCycle: 面向长程视频世界模型的自验证强化学习Mirage 2: Ai-native ugc game engine powered by real-time world models通过经验合成扩展智能体学习
标签
size_categories:1K<n<10Kmodality:imagemodality:videolibrary:datasetslibrary:mlcroissantregion:us