Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

BoxingGym:自动化实验设计与模型发现进展的基准测试

arXiv 2025 62.2 method

TLDR

BoxingGym基准含10个真实科学领域概率模型环境,评估LLM实验设计与模型发现能力。

评分理由

Strengths: Clear focus on a novel benchmark for automated scientific discovery, with quantitative metrics (EIG) and diverse domains. Weaknesses: Limited to simulated probabilistic models; no real-world experimental validation or comparison to human scientists.

Read-first 评分解释

综合优先阅读分 62.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 72。

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、实验、指标、结果

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
60

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:37。

关键词评分

automated scientific discovery
9
automated experimentation
9
experiment design agent
9
scientific discovery agent
9
autonomous research agent
8
AI for scientific research
8
AI scientist
7
automated research
7
research automation
6
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • 提出了BoxingGym基准,包含10个环境,用于评估自动化实验设计和模型发现。
  • 使用来自真实科学领域的生成式概率模型作为交互环境。
  • 通过期望信息增益(EIG)对实验设计进行定量评估。
  • 通过另一个智能体基于解释的预测以及标准预测误差指标来评估模型发现。
  • 发现LLM表现不佳,且增加显式统计模型并不能可靠地提升性能。

方法

BoxingGym包含10个环境,每个环境实现为来自心理学和生态学等领域的生成式概率模型。智能体与这些环境交互以设计实验并提出/修正科学模型。实验设计通过期望信息增益(EIG)评估,模型发现则通过让智能体解释其模型,然后衡量另一个智能体利用该解释进行预测的能力,同时结合标准预测误差指标进行评估。

关键结果

当前LLM(如GPT-4o)在实验设计和模型发现两方面均表现不佳;为基于LLM的智能体增加显式统计模型并不能可靠地提升性能。

标签

LGAI