AutoWorldModel-Bench:以状态为中心的自动化世界模型研究基准
TLDR
提出AutoWorldModel-Bench,一个闭环基准,让AI编码智能体在固定计算预算下自主改进八个游戏环境中的世界模型起点。
评分理由
The paper presents a novel benchmark and empirical results across 64 agent sessions, which is a strength. However, the abstract lacks details on baseline comparisons and limitations, and the focus is on agent research rather than advancing world-model methods themselves.
Read-first 评分解释
综合优先阅读分 40.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 36。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:307。
关键词评分
深度分析
创新点
- AutoWorldModel-Bench:一个闭环基准,用于在开放式世界模型改进任务上评估编码智能体作为自主研究者
- 统一的结构化状态表示:从每个游戏中提取真实实体状态,并通过共享张量格式使用,将动力学建模与感知解耦
- 评估前沿编码智能体在研究式修改(新目标、表示、rollout过程、架构更改)上的表现,而非按规格工程任务
方法
该基准提供一个世界模型起点和固定计算预算,要求前沿编码智能体在八个游戏环境中自主改进它。所有环境共享结构化状态表示——以通用张量格式表示的真实实体状态——因此只改变动力学建模,不改变感知。该设置每次运行只需数分钟,并使用Codex-5.4和Claude Opus 4.6在64个会话中进行了测试。
关键结果
在64个会话中,智能体在63个会话中改进了所提供的起点;91%的获胜编辑是非平凡的研究式修改,而非简单的超参数调整。
局限性
- 仅限于八个具有真实实体状态的游戏环境,未涉及感知和真实世界感官挑战
- 仅测试了两个前沿编码智能体(Codex-5.4和Claude Opus 4.6),共64个会话