对抗性快速变化的真实世界领域作为基准测试AI科学家能力的测试平台
TLDR
提出以对抗性快速演变的真实领域(F1、MTG)作为AI科学家能力基准,发现模型产出合理想法但少有匹配专家方案。
评分理由
The paper introduces a practical benchmarking framework using real-world expert outputs, which addresses limitations of synthetic tasks and retrospective targets. Its strengths include novel domains and concrete evaluation metrics, but weaknesses include limited domain scope and potential subjectivity in defining ground truth for F1 innovations.
Read-first 评分解释
综合优先阅读分 50.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:40。
关键词评分
深度分析
创新点
- 提出将对抗性、快速演变的真实世界领域作为AI科学家能力基准的测试平台
- 在Formula 1 2026赛季赛车设计构思中实例化,以真实季前创新作为真值
- 在Magic: The Gathering套牌构建中实例化,以职业巡回赛套牌列表作为评估目标
方法
该框架让模型在两个复杂、对抗性、快速演变的领域中生成新颖想法:Formula 1(2026年赛车设计概念)和Magic: The Gathering(从最近更新的卡池中构建套牌)。将输出与独立产生的专家真值(真实F1创新和19份职业巡回赛套牌列表)进行比较,以衡量对齐程度。
关键结果
在F1中,GPT-5.2在166个想法中匹配了40个真实创新中的10个;在MTG中,最佳套牌从顶级职业巡回赛套牌中恢复了7张新系列卡牌中的5张,且模型选择的卡牌与职业巡回赛采用率相关(Spearman ρ=0.74, p=0.0003)。