Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

对抗性快速变化的真实世界领域作为基准测试AI科学家能力的测试平台

arXiv 2026 50.7 method

TLDR

提出以对抗性快速演变的真实领域(F1、MTG)作为AI科学家能力基准,发现模型产出合理想法但少有匹配专家方案。

评分理由

The paper introduces a practical benchmarking framework using real-world expert outputs, which addresses limitations of synthetic tasks and retrospective targets. Its strengths include novel domains and concrete evaluation metrics, but weaknesses include limited domain scope and potential subjectivity in defining ground truth for F1 innovations.

Read-first 评分解释

综合优先阅读分 50.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、结果

主题相关性 42%
41.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:40。

关键词评分

AI scientist
10
scientific discovery agent
9
automated scientific discovery
8
AI for scientific research
8
automated research
5
autonomous research agent
4
research automation
4
automated experimentation
1
experiment design agent
1
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • 提出将对抗性、快速演变的真实世界领域作为AI科学家能力基准的测试平台
  • 在Formula 1 2026赛季赛车设计构思中实例化,以真实季前创新作为真值
  • 在Magic: The Gathering套牌构建中实例化,以职业巡回赛套牌列表作为评估目标

方法

该框架让模型在两个复杂、对抗性、快速演变的领域中生成新颖想法:Formula 1(2026年赛车设计概念)和Magic: The Gathering(从最近更新的卡池中构建套牌)。将输出与独立产生的专家真值(真实F1创新和19份职业巡回赛套牌列表)进行比较,以衡量对齐程度。

关键结果

在F1中,GPT-5.2在166个想法中匹配了40个真实创新中的10个;在MTG中,最佳套牌从顶级职业巡回赛套牌中恢复了7张新系列卡牌中的5张,且模型选择的卡牌与职业巡回赛采用率相关(Spearman ρ=0.74, p=0.0003)。

标签