τ₀-WM
2026 数据集
数据集分析
一种统一视频-动作世界模型,集成策略学习、视频预测与动作评估,用于机器人操作。
来源线索
来源:huggingface-datasets。
downloads=0, likes=0
关联论文
τ₀-WM:面向机器人操作的统一视频-动作世界模型$ω$-EVA:基于潜在交互世界模型的设想、验证与执行3D等视域世界模型——揭示城市不可见几何及其涌现的跨城市特征视频生成作为世界模型的机制视角:状态与动态ABot-PhysWorld: 具有物理对齐的机器人操作交互式世界基础模型AGEL-Comp: 交互式智能体中组合泛化的神经符号框架ARB4WM:面向连续控制中世界模型的对抗鲁棒性基准推进开源世界模型智能体世界建模:基础、能力、法则与超越AlignUSER: 通过世界模型实现人类对齐的LLM智能体用于推荐系统评估攻击可信想象:对‘先想象后行动’世界模型的预言机级完整性攻击用于LLM智能体离线策略评估的自回归扩散世界模型BRo-JEPA:在潜在空间中学习模算术基于Transformer世界模型的行为不变任务表示学习用于离线元强化学习超越像素历史:具有持久3D状态的世界模型BridgeV2W: 通过具身掩码桥接视频生成模型与具身世界模型CWM:具身智能体流水线中动作可行性学习的对比世界模型用于蒙特卡洛树搜索规划的因果对象中心模型CausalDrive:面向自动驾驶的实时因果世界模型ChronoMedicalWorld:一种从纵向护理数据学习患者轨迹的医学世界模型等变世界模型的共形轨道有效信任视界当前世界模型缺乏持久状态核心面向3D机器人模仿学习的数据不对称潜在想象与重排序DeTrack:面向无人机具身跟踪的基准与高度感知双世界模型DeepSight: 通过潜在状态预测实现长时域世界建模的端到端自动驾驶用于自动驾驶场景预测的扩散Transformer世界-动作模型Discrete-WAM: 统一离散视觉-动作令牌编辑用于世界-策略学习蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习世界动作模型是否比视觉-语言-动作模型泛化更好?一项鲁棒性研究DreamDojo: 来自大规模人类视频的通用机器人世界模型DreamWorld: Unified World Modeling in Video GenerationDreamX-World 1.0:一个通用交互式世界模型梦见他人:多智能体强化学习中世界模型的潜在队友建模基于梯度惩罚潜在动力学的平滑梦境与高效采样DriveCtrl: 条件化的仿真到真实驾驶视频生成Driver-WM: 一种以驾驶员为中心的交通条件潜在世界模型,用于车内动态展开DrivingGen:自动驾驶中生成式视频世界模型的综合基准DynaWM: 基于世界模型和动量目标的动力学感知蒸馏方法用于连续楼梯上的平滑运动Echo-Memory:动作世界模型中记忆的受控研究EgoCS-400K:面向世界模型的自我中心游戏数据集Embody4D:一种用于具身4D世界建模的通用数据引擎FAR-Drive: 闭环自动驾驶中的帧级自回归视频生成从生成引擎到可操作模拟器:世界模型中物理基础的必要性GE-Sim 2.0:迈向机器人操作的综合闭环视频世界模拟器路线图GEM:基于可变形Mamba的激光雷达世界模型生成环境变化下基于视觉的四旋翼导航的世界模型泛化研究GeoWorld:几何世界模型HERMES++:面向统一驾驶世界模型的3D场景理解与生成HOLO-MPPI:通过分层策略优化实现多场景运动规划HarmoWAM:通过自适应世界动作模型协调泛化性与精确操作Hi-WM: 人在世界模型中的可扩展机器人后训练世界模型应如何评估?一个以决策为中心的立场IOI:解耦运动学与物理学的交互式世界模型InSpatio-WorldFM:一种开源实时生成式帧模型Incantation:自然语言作为多实体视频世界模型的动作接口你的驾驶世界模型是全能选手吗?JEDI:面向在线基于模型强化学习的联合嵌入扩散世界模型LaST-HD: 从可扩展人类数据中学习潜在物理推理以实现机器人操作LaWM: 基于最小作用量原理的世界模型,用于从视觉观测实现长时域物理一致性充分性约束下世界模型的潜在状态设计自动驾驶的潜在世界模型:统一分类法、评估框架与开放挑战Latent-WAM:面向端到端自动驾驶的潜在世界动作建模学习用于规划的不变视觉表示:基于联合嵌入预测世界模型在真实世界中学习Latent Action World Models轻交互:面向交互式视频世界模型的无训练推理加速LiveWorld:生成式视频世界模型中视线外动态的模拟LoViF 2026 首届面向4D世界模型的整体质量评估挑战赛 (PhyScore)MBench:视频世界模型记忆能力的综合基准MCP-Cosmos:世界模型增强的智能体在MCP环境中的复杂任务执行MIND:世界模型中记忆一致性与动作控制的基准测试MODIP:扩散策略的高效基于模型的优化MaineCoon:追求实时视听社交世界模型将预见转化为行动:世界动作模型中表示对齐的重新利用Mask World Model:预测关键因素以实现鲁棒机器人策略学习Mem-World:记忆增强的动作条件世界模型用于持久机器人操作Mind Dreamer:通过潜在流形上的主动因果干预释放想象力MobileDreamer:面向GUI智能体的生成式草图世界模型蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型纳米世界模型:未来视频预测的极简实现NarrativeWorldBench:一个前沿饱和的基准测试与面向长程协同创作音频剧的潜在世界模型NavWAM: 一种用于目标条件视觉导航的导航世界动作模型网络高效的世界模型令牌流式传输NeuroHex:用于创建世界模型以实现自适应AI的高效六边形坐标系统Nous:一种用于长期智能体记忆的预测世界模型OSCAR:面向机器人的全具身动作条件视频世界模型OccDirector:语言引导的4D占据空间中的行为与交互生成Omni-WorldBench:面向世界模型的全面交互中心评估OmniDrive:一种由LLM编排的多智能体世界模型,具有统一潜在协同压缩,用于多视角驾驶视频生成论记忆:世界模型中记忆机制的比较一张图像足矣:基于文本世界模型的智能一次性图像生成用于长尾空间感知编排现实:从角色扮演到生动可玩的游戏世界——将LLM驱动的世界模拟视为参数化动作POMDPPLUME:用于多指操作的概率潜在统一世界建模与参数估计PROWL:优先遗憾驱动的世界模型学习优化PanoWorld:用于一致的全屋全景合成的生成式空间世界模型PanoWorld:几何一致的全景视频世界建模PathWise:通过世界模型进行规划,实现基于自进化大语言模型的自动启发式设计PearlVLA:潜在空间中的渐进式具身动作计划细化PhyGround:生成式世界模型中的物理推理基准测试PhyWorld:面向视频生成的物理忠实世界模型Phys-JEPA: 物理信息驱动的潜在世界模型用于多变量时间序列预测PhysicsMind:面向基础视觉语言模型和世界模型的物理推理与预测的仿真与真实力学基准PiL-World: 一种用于VLA策略在环评估的块状世界模型8个Token中的规划:一种用于潜在世界模型的紧凑离散分词器基于世界模型集成的规划Prisma-World: 相机可控的多智能体视频世界模型世界模型的概率化梦境通过测试时缩放探究世界模型在空间推理中的有效性面向几何一致性的定量视频世界模型评估Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界建模R2-Dreamer:无需解码器或数据增强的冗余减少世界模型RAE-NWM:密集视觉表示空间中的导航世界模型RAYNOVA: 射线空间中的尺度-时间自回归世界建模ReactSim-Bench:自动驾驶中反应性行为世界模型模拟的基准测试ReactiveGWM:在反应式游戏世界模型中操控非玩家角色重建还是语义?什么使潜在空间对机器人世界模型有用基于世界模型的视频生成中物理一致性的无参考评估风险感知世界模型预测控制用于可泛化的端到端自动驾驶鲁棒梦想家:面向动作控制的增强现实视频生成的偏差感知潜在高斯记忆SANA-WM:基于混合线性扩散Transformer的高效分钟级世界建模SCAR:自监督连续动作表示学习ST-Gen4D: 将4D时空认知嵌入世界模型用于4D生成SWEET: 基于图像编辑的稀疏世界建模用于具身任务执行基于自监督JEPA的世界模型用于激光雷达占用补全与预测基于4D时空嵌入的自监督多模态世界模型Solaris: 在Minecraft中构建多人视频世界模型SparseWorld:通过稀疏场景表示的世界模型增强端到端自动驾驶通过数据投毒进行隐蔽的世界模型操纵立体世界模型:相机引导的立体视频生成StressDream:引导视频世界模型实现鲁棒的策略评估与改进SurgVista:具有合理器械-组织动力学的长程手术世界建模TRAP:面向世界模型规划的尾部感知排序攻击教视频生成器记住:为视线外的状态演化引出动态记忆基于世界模型的仅动作扩散策略的时序逻辑引导一致性三位一体:通用世界模型的定义性原则ThinkJEPA: 用大型视觉-语言推理模型赋能潜在世界模型用想象力思考:基于世界模拟器的智能体视觉空间推理以模式思考:通过模式归纳打破视觉规划中的感知瓶颈面向生理信号的混沌理论平衡与潜在动力学世界建模迈向交互式视频世界建模:前沿、挑战、基准与未来趋势修剪视觉世界建模评估的长尾UWM-JEPA:在信念空间中进行想象预测的世界模型UniT:迈向统一物理语言,用于人-人形机器人策略学习与世界建模统一驾驶令牌:面向驾驶世界模型与规划的表示与几何引导离散分词器VJEPA:作为概率世界模型的变分联合嵌入预测架构基于价值引导的JEPA世界模型动作规划视觉生成通过多模态世界模型解锁类人推理WAM-RL: 基于重建奖励和在线视频SFT的世界-动作模型强化学习WBench:面向交互式视频世界模型评估的全面多轮基准WEAVER:更好、更快、更长:一种有效的机器人操作世界模型是什么让视频世界模型潜在表示具有动作相关性:预测优于重建假设世界:面向具身场景中通用世界模型的因果基准世界行动模型:综述世界动作模型:具身智能的下一个前沿世界模型自蒸馏:训练世界模型解决通用任务机器人学习中的世界模型:全面综述面向物理AI系统中语义通信的世界模型赋能因果数字孪生机器人操作的世界模型:综述面向混合具身任务中长时程演化的世界-自我建模World-R1: 强化文本到视频生成中的三维约束WorldArena 2.0:在模态、功能和平台上扩展具身世界模型基准测试WorldArena:评估具身世界模型感知与功能实用性的统一基准WorldBench:为世界模型的诊断性评估而澄清物理概念WorldCache: 内容感知缓存加速视频世界模型WorldCraft:从相机导航到交互式视频世界模型中的物体操控WorldFly:基于世界模型的无人机导航视觉-语言-动作模型WorldKernel:世界模型是容许可能世界的耦合核WorldMark:交互式视频世界模型的统一基准套件WorldOlympiad:你的世界模型能通过三项全能测试吗?WorldReasonBench:作为未来世界状态预测器的视频生成器的人类对齐压力测试WorldVLM:结合世界模型预测与视觉-语言推理Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing TestlX-Cache: 跨块缓存用于少步自回归世界模型推理X-Foresight: 通过预测世界建模的联合视觉-动作因果预测网络X-World:可控的自车视角多摄像头世界模型,用于可扩展的端到端驾驶小米电动汽车世界模型:一种融合重建与生成的联合世界模型用于自动驾驶YoCausal:从因果视角看视频生成离世界模型还有多远?dWorldEval:基于离散扩散世界模型的可扩展机器人策略评估stable-worldmodel:一个用于可复现世界模型研究与评估的平台3D与4D世界建模:综述3D4D:通过3D视频生成的交互式、可编辑的4D世界模型基于立体强制的4D驾驶场景生成4DWorldBench:面向3D/4D世界生成模型的综合评估框架面向具身智能的世界模型综述面向自动驾驶的未来物理世界生成综述综述:从物理模拟器和世界模型学习具身智能幻觉的统一定义,或者:关键在于世界模型,笨蛋AVD2: 事故视频扩散用于事故视频描述大型语言模型中的主动困惑表达:利用世界模型提升社会推理能力通过闭环世界建模实现视频化身中的主动智能AdaPower:将世界基础模型专用于预测性操作适配视觉-语言模型以评估世界模型在3D游戏中调整世界模型以进行轨迹跟踪推进越野自动驾驶:大规模ORAD-3D数据集与综合基准对齐网络空间与物理世界:具身人工智能综述世界模型学习的基准测试超越生成式AI:用于临床预测、反事实推断和规划的世界模型从多模态基础模型中的动力学模型自举世界模型CLARITY:通过建模潜在空间中的上下文感知疾病轨迹来指导治疗决策的医学世界模型CWM:一个用于代码生成与世界模型研究的开放权重大语言模型因果制图师:从映射到反事实世界的推理CausalARC:基于因果世界模型的抽象推理ChronoDreamer: 动作条件的世界模型作为机器人规划的在线模拟器使用几何正则化世界模型克隆确定性3D世界通过前瞻扩散实现一致性世界模型Cosmos-Drive-Dreams:基于世界基础模型的可扩展合成驾驶数据生成Cosmos-Transfer1基于数字孪生条件视频扩散的反事实世界模型Ctrl-World:一种用于机器人操作的可控生成世界模型DMWM:具有长期想象能力的双心智世界模型基于扩散策略和多时间尺度世界模型的深度主动推理用于真实世界探索与导航Deep SPI:基于世界模型的安全策略改进DeepVerse:作为世界模型的4D自回归视频生成灵巧世界模型DiST-4D: 基于度量深度的解耦时空扩散用于4D驾驶场景生成DiVE: 基于视频扩散Transformer的高效多视角驾驶场景生成解耦世界模型:从干扰视频中学习迁移语义知识以用于强化学习DreamerV3-XP:通过不确定性估计优化探索Dreamland:基于模拟器和生成模型的可控世界创建Drive&Gen:协同评估端到端驾驶与视频生成模型上下文世界模型中用于零样本泛化的动态对齐潜在想象EWMBench: 评估具身世界模型中的场景、运动和语义质量EchoWorld:学习运动感知的世界模型用于超声心动图探头引导通过世界模型与自主人工智能的边缘通用智能:基础、解决方案与挑战Emu3.5:原生多模态模型是世界学习者基于BEV世界模型的在线轨迹评估端到端驾驶EnerVerse:为机器人操作构想具身未来空间在Veo世界模拟器中评估Gemini Robotics策略在世界模型中评估机器人策略视频生成中物理认知演变的探索:综述从二维到三维认知:通用世界模型简要综述从文字到世界:大型语言模型能否成为隐式文本世界模型?FutureSightDrive: 利用时空思维链进行视觉推理的自动驾驶GAIA-2:一种用于自动驾驶的可控多视角生成世界模型GEM:一种可泛化的自我视觉多模态世界模型,用于细粒度自我运动、物体动态和场景组成控制GLAM:基于Mamba的世界模型中的全局-局部变化感知GaussianWorld: 高斯世界模型用于流式3D占据预测通过下一场景预测生成多模态驾驶场景通过大型语言模型的测试时扩展生成符号世界模型视觉中的生成式物理人工智能:综述GenieDrive: 面向物理感知的驾驶世界模型,基于4D占用引导的视频生成GigaWorld-0:世界模型作为数据引擎赋能具身AIGrndCtrl:通过自监督奖励对齐实现世界模型的空间基础化外科医生距离手术世界模型还有多远?一项关于零样本手术视频生成与专家评估的初步研究混元-GameCraft-2: 指令跟随的交互式游戏世界模型IPR-1:交互式物理推理器KAN-Dreamer:将Kolmogorov-Arnold网络作为世界模型中的函数逼近器进行基准测试KeyWorld:关键帧推理实现高效且有效的世界模型LLM-JEPA:大型语言模型与联合嵌入预测架构的结合LUMOS:基于语言条件的世界模型模仿学习LatticeWorld:一种多模态大语言模型赋能的交互式复杂世界生成框架学习具有群结构潜在空间的抽象世界模型学习真实世界动作-视频动态的异构掩码自回归学习对抗性世界模型用于多智能体强化学习中的自动课程生成学习生成4D LiDAR序列LiDARCrafter:从LiDAR序列进行动态4D世界建模长上下文状态空间视频世界模型LongLive:实时交互式长视频生成LongScape: 利用上下文感知MoE推进长时域具身世界模型ManipDreamer:利用动作树与视觉引导提升机器人操作世界模型MaskGWM: 一种具有视频掩码重建的泛化驾驶世界模型Matrix-Game 2.0:一个开源、实时、流式交互世界模型衡量LLMs中的(充分)世界模型:一个方差分解框架MiLA:面向自动驾驶的多视角高保真长时视频生成世界模型MindDrive:一个融合世界模型与视觉语言模型的端到端自动驾驶一体化框架MineWorld:一个基于Minecraft的实时开源交互式世界模型MoWM:基于潜在到像素特征调制的混合世界模型用于具身规划MorphoSim:一个交互式、可控、可编辑的语言引导4D世界模拟器NORA-1.5: 一种使用世界模型和基于动作的偏好奖励训练的视觉-语言-动作模型导航世界模型Occ-LLM:基于占用的大型语言模型增强自动驾驶OccTENS:基于时间下一尺度预测的3D占用世界模型机器人占据世界模型OmniGen:面向自动驾驶的统一多模态传感器生成OmniNWM:全知驾驶导航世界模型OmniWorld:用于4D世界建模的多领域多模态数据集一生学习:从无引导探索中推断随机环境的符号世界模型一个模型应对所有任务:在多任务规划中利用高效世界模型OpenTwinMap:面向城市自动驾驶的开源数字孪生生成器PIN-WM: 学习物理信息世界模型用于非抓取操作基于视觉语言世界模型的推理规划ProTerrain: 概率物理信息驱动的粗糙地形世界建模ProphetDWM: 一种用于展开未来动作和视频的驾驶世界模型RELIC:具有长时记忆的交互式视频世界模型RadarGen:基于摄像头的汽车雷达点云生成ReSim:面向自动驾驶的可靠世界模拟面向遥感的世界模型重新思考驾驶世界模型作为感知任务的合成数据生成器RoboScape:物理信息驱动的具身世界模型SAMPO:面向生成式世界模型的尺度级自回归与运动提示STORM: 搜索引导的生成式世界模型用于机器人操作基于视频世界模型的可扩展策略评估扩展以占据为中心的驾驶场景生成:数据集与方法SceneDiffuser++:基于生成世界模型的城市级交通仿真Sekai:面向世界探索的视频数据集简单、好、快:无负担的自我监督世界模型SimuRA:基于LLM世界模型的模拟推理架构实现通用目标导向智能体SmallWorlds:在隔离环境中评估世界模型的动态理解能力语音世界模型:基于显式推理的因果状态-动作规划StateSpaceDiffuser:将长上下文引入扩散世界模型Surfer:基于世界模型的视觉语言机器人操作框架为双层规划合成世界模型TeraSim-World:面向端到端自动驾驶的全球安全关键数据合成Terra: 可探索的原生3D世界模型与点潜变量Text2World:用于符号世界模型生成的大语言模型基准测试代码世界模型的双重生活:通过执行轨迹可证明地揭露恶意行为具身AI智能体世界模型的安全挑战:综述三思而后行:受世界模型启发的自动驾驶多模态定位Thinking Ahead: Foresight Intelligence in MLLMs and World Models时间感知世界模型用于自适应预测与控制迈向记忆辅助的世界模型:通过空间一致性进行基准测试迈向稳定世界模型:在生成环境中测量和解决世界不稳定性面向高一致性具身世界模型的多视角轨迹视频方法UniOcc:自动驾驶中占用预测与预报的统一基准UniUGP:统一理解、生成与规划以实现端到端自动驾驶VFMF:通过预测视觉基础模型特征进行世界建模VL-SAFE: 视觉语言引导的基于世界模型的安全感知强化学习用于自动驾驶VaViM与VaVAM:通过视频生成建模实现自动驾驶具有长期空间记忆的视频世界模型VideoVerse:你的文本到视频生成器距离世界模型还有多远?基于隐式残差世界模型的视觉中心4D占用预测与规划Voyager:面向可探索3D场景生成的长程世界一致视频扩散WMNav:将视觉-语言模型融入世界模型以实现目标物体导航神经网络学习“世界模型”意味着什么?基础模型发现了什么?利用归纳偏置探测世界模型全身条件化的自我中心视频预测WoW:通过具身交互迈向全知世界模型世界建模造就更好的规划器:面向具身任务规划的双重偏好优化知道何时不知道的世界模型:具有校准不确定性的可控视频生成世界模型作为快速运动适应的参考轨迹面向认知智能体的世界模型:未来网络中的边缘智能变革受世界模型启发的讽刺推理:基于大型语言模型智能体世界中的世界:闭环世界中的世界模型World4Drive:基于意图感知的物理潜在世界模型的端到端自动驾驶WorldLens:真实世界中驾驶世界模型的全频谱评估WorldModelBench:评判视频生成模型作为世界模型WorldPack: 压缩记忆提升视频世界模型中的空间一致性WorldVLA:迈向自回归动作世界模型Xray2Xray: 基于胸部X射线的具有体积上下文的世界模型Yume-1.5: 一种文本控制的交互式世界生成模型Zero-Splat TeleAssist:一种用于语义遥操作的零样本姿态估计框架BWArea模型:学习世界模型、逆动力学和策略以实现可控语言生成Cam4DOcc:自动驾驶应用中仅用摄像头的4D占用预测基准语言模型能否作为基于文本的世界模拟器?CityBench: 评估大型语言模型作为世界模型的能力DINO-WM: 基于预训练视觉特征的世界模型实现零样本规划DOME:驯服扩散模型以实现高保真可控占据世界模型扩散模型用于世界建模:视觉细节在Atari中的重要性Doe-1: 基于大世界模型的闭环自动驾驶梦想操控:组合世界模型赋能机器人模仿学习与想象力梦见多重世界:学习上下文世界模型助力零样本泛化DriveGenVLM: 面向基于视觉语言模型的自动驾驶的真实世界视频生成驶向未来:基于World Model的多视角视觉预测与规划在自动驾驶中的应用DrivingDiffusion: 基于布局引导的多视角驾驶场景视频生成与潜在扩散模型DrivingWorld: 通过视频GPT构建自动驾驶世界模型评估生成模型中隐含的世界模型探索自动驾驶中视频生成与世界模型之间的相互作用:一项综述自动驾驶的通用预测模型Genie:生成式交互环境视频生成离世界模型有多远:从物理定律的角度Imagine-2-Drive:面向自动驾驶的CARLA高保真世界建模通过并行观测预测改进基于标记的世界模型语言代理遇见因果性——连接LLMs与因果世界模型学习世界模型的潜在动态鲁棒表示将大型语言模型转化为具有前提和效果知识的世界模型运动提示:通过运动轨迹控制视频生成基于视觉世界模型的多任务交互式机器人集群学习Multimodal foundation world models for generalist embodied agentsOccSora: 作为自动驾驶世界模拟器的4D占用生成模型Owl-1: 用于一致长视频生成的全面世界模型Panacea:面向自动驾驶的全景可控视频生成基于自适应世界模型的自动驾驶规划探究多模态大语言模型作为驾驶世界模型的能力SubjectDrive:通过主体控制扩展自动驾驶中的生成式数据Terra ACT-Bench: 迈向自动驾驶的动作可控世界模型Think2Drive: 通过在潜在世界模型中思考实现准真实自动驾驶的高效强化学习Vista: 一个高保真且多可控的通用驾驶世界模型WHALE: 面向通用且可扩展的具身决策世界模型WoVoGen: 世界体积感知扩散用于可控多相机驾驶场景生成自动驾驶的世界模型:初步综述世界模型:安全视角WorldSimBench:迈向作为世界模拟器的视频生成模型STORM: 基于随机Transformer的高效世界模型用于强化学习TrafficBots:面向自动驾驶仿真与运动预测的世界模型Transformer是样本高效的世界模型DreamerPro: 基于原型表示的无重建模型强化学习面向自动驾驶规划的分层基于模型模仿学习PerceptUI:面向UI/UX评估的类人对齐合成用户LLM代理MemoBench:动态变化环境中世界建模的基准测试快速LeWorldModelOrca:世界存于你心OpenSTL:时空预测学习的综合基准从动作到世界建模的可迁移动力学先验学习DreamForge-World 0.1 预览版:一种低计算量、实时可控的世界模型Valdi:价值扩散世界模型WorldDirector:构建具有持久动态内存的可控世界模拟器WorldOdysseyBench:面向交互式世界模型长时程稳定性的开放世界基准测试从世界模型到世界动作模型:面向机器人的简明教程OPINE-World: 基于本体错误优先的交互式探索的程序化世界建模Bridge-WA:预测世界变化的位置和方式以支持机器人动作LWDrive: 逐层世界模型引导的视觉语言模型自动驾驶规划基于结构化自回归建模的长期交通仿真ForgeDrive: 自动驾驶中统一视觉与动作生成的双向交叉条件一个视频,一个世界:将单目视频转化为物理4D场景WorldRoamBench:面向交互式世界模型长时程稳定性的开放世界基准Embodied.cpp:面向异构机器人的具身AI模型便携式推理运行时3D点云世界模型:点云补全实现更精确的动态学习RetailSMV: 零售场景中基础视频世界模型的外部视角与自我视角适应AGI Maze:面向世界建模智能体的基准框架物理可行世界模型中的路径规划RoboWorld:用于通用机器人策略评估的快速可靠神经模拟器IRASim:一种用于机器人操作的细粒度世界模型EnerVerse-AC:基于动作条件的具身环境展望GigaWorld-1:构建用于机器人策略评估的世界模型路线图DynaVieW:基于模式引导的世界模型用于理解层次化视觉动态无人机最后米级精确导航:一种扩散精化空中视觉伺服方法Operator-on-F 补充价值等价性:一种用于潜在世界模型的规划时诊断CRISP:基于预测的世界模型预训练的时空相机-雷达驾驶骨干网络Mask2Real-WM: 分割掩码作为从仿真到现实的桥梁用于可控灵巧世界模型DSWAM:一种用于精细机器人操作的双系统世界动作基础模型MoP-JEPA:面向随机JEPA世界模型的硬分配预测器混合基于表示自编码器的多玩家交互世界模型AlayaWorld: 长时域与可玩视频世界生成三思而后行:将树搜索蒸馏为动作评估用于冻结VLA模型无限世界与多样化交互面向具身智能的混合专家(MoE)视频预训练扩展V-ReasonBench:面向视频生成模型的统一推理基准套件小米机器人-U0:基于世界基础模型的统一具身合成面向通用交通智能体模拟的多样化行为扩散在轨道上的世界中学习驾驶视频 = 世界 + 事件流BadWAM: 当世界-动作模型想象正确但行动错误空间中的自我:无人机具身智能中自我意识与空间认知的基准测试多智能体轨迹预测中的碰撞避免绕行方法从像素到状态:将交互式世界模型重新构想为游戏引擎重新思考面向具身世界的视频生成模型长视频生成的Mixture of Contexts递归自回归扩散:全局记忆与局部注意力E3DGS:通过颜色作为几何嵌入实现3D高斯泼溅的统一几何-光度等变性Orbis 2: 一种用于驾驶的分层世界模型GeoWorldAD:面向自动驾驶的几何世界动作模型视频中的思考:视频生成器真的能推理现实世界吗?强化学习:从算法到基础模型基于世界模型的移动网络控制SAGE: 子目标条件动作生成用于潜在世界模型规划面向统一世界建模的掩码视觉动作掩码扩散语言模型是强健且可引导的基于文本的世界模型,用于智能体强化学习SeerGuard:基于世界模型预测的移动GUI智能体安全框架Open-AoE:面向具身学习的开放式自我中心操作数据集与工具链Apple-π: 通过视频对基于物理定律的物理智能进行思维基准测试EvolvingWorld:交互文学世界中角色扮演智能体与世界模型协同演化的开放模式框架游戏速度下的生成式世界渲染器ABot-World-0:在单桌面GPU上实现无限交互世界展开带世界状态寄存器的流式多智能体自回归扩散模型可玩视频生成可玩环境:时空中的视频操控VideoPhy:评估视频生成中的物理常识机器人学中的视频生成模型——应用、研究挑战与未来方向OSCBench:在文本到视频生成中基准测试对象状态变化Wonder: 更优的视频世界模型WorldDiT:统一的世界与动作建模扩散架构时间距离JEPA:面向潜在世界模型预测控制的规划感知表示学习VisualPatchWorld:代码世界模型作为规划中的潜在结构化表示ACE-Data-0:以人為中心的環境捕捉作為具身數據引擎StatePlay:面向机制一致生成的状态感知游戏世界模型基于自监督预测的好奇心驱动探索从像素进行规划:使用逆动力学模型SG-WAM: 几何感知策略空间中的自引导世界建模HelloWorld:在视频世界模型中实现社交互动角色MiniWorld:从零开始训练视频世界模型的民主化DyPES-VLA: 学习共享动力学先验与具身特定控制以实现跨具身操作WorldClaw: 大规模自主式3D开放世界生成
标签
region:usworld-modelvideo-generationbenchmarkreproducibility