AutoWorldModel-Bench:面向自动世界模型研究的以状态为中心的基准
TLDR
AutoWorldModel-Bench:编码代理在八个游戏环境中自主改进世界模型的闭环基准,研究型修改占主导。
评分理由
Strengths: novel benchmark for open-ended research, isolates dynamics from perception, and provides strong empirical results across 64 sessions. Weaknesses: limited to game environments and structured-state representations, with no baseline or metric details in the abstract.
Read-first 评分解释
综合优先阅读分 53.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 59。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:47。
关键词评分
深度分析
创新点
- 用于AI编码代理自主改进世界模型作为开放式研究的闭环基准
- 统一结构化状态表示,跨八个游戏环境使用ground-truth实体状态
- 通过共享张量格式将动力学建模与感知隔离,实现每次运行数分钟的迭代
- 评估前沿编码代理在研究型修改而非超参数调整上的表现
方法
该基准为前沿编码代理(Codex-5.4和Claude Opus 4.6)在八个游戏环境中提供世界模型起点和固定计算预算。所有环境使用统一的结构化状态表示——通过共享张量格式消费的ground-truth实体状态——以将动力学建模与感知隔离。改进通过代理是否产生获胜编辑来衡量,该编辑被分类为非平凡的研究型修改或超参数调整。
关键结果
代理在64次会话中的63次改进了起点;在91%的会话中,获胜编辑是非平凡的研究型修改(新目标、表示、rollout过程或架构变化),表明存在真正的研究行为。