Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

AutoWorldModel-Bench:面向自动世界模型研究的以状态为中心的基准

arXiv 2026 53.3 method

TLDR

AutoWorldModel-Bench:编码代理在八个游戏环境中自主改进世界模型的闭环基准,研究型修改占主导。

评分理由

Strengths: novel benchmark for open-ended research, isolates dynamics from perception, and provides strong empirical results across 64 sessions. Weaknesses: limited to game environments and structured-state representations, with no baseline or metric details in the abstract.

Read-first 评分解释

综合优先阅读分 53.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 59。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估

主题相关性 42%
49.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:47。

关键词评分

autonomous research agent
8
automated research
8
research automation
8
AI scientist
7
AI for scientific research
7
automated scientific discovery
6
scientific discovery agent
6
automated experimentation
5
experiment design agent
4
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • 用于AI编码代理自主改进世界模型作为开放式研究的闭环基准
  • 统一结构化状态表示,跨八个游戏环境使用ground-truth实体状态
  • 通过共享张量格式将动力学建模与感知隔离,实现每次运行数分钟的迭代
  • 评估前沿编码代理在研究型修改而非超参数调整上的表现

方法

该基准为前沿编码代理(Codex-5.4和Claude Opus 4.6)在八个游戏环境中提供世界模型起点和固定计算预算。所有环境使用统一的结构化状态表示——通过共享张量格式消费的ground-truth实体状态——以将动力学建模与感知隔离。改进通过代理是否产生获胜编辑来衡量,该编辑被分类为非平凡的研究型修改或超参数调整。

关键结果

代理在64次会话中的63次改进了起点;在91%的会话中,获胜编辑是非平凡的研究型修改(新目标、表示、rollout过程或架构变化),表明存在真正的研究行为。

标签