Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

DISCOVERYWORLD:用于开发和评估自动化科学发现智能体的虚拟环境

arXiv 2024 77.5 method

TLDR

DISCOVERYWORLD:含120个任务的虚拟环境,用于基准测试自动化科学发现智能体。

评分理由

Strengths include a novel, comprehensive virtual environment with diverse tasks and automatic metrics; weaknesses are that it is simulated rather than real-world, and baseline agents struggle, indicating difficulty but also potential limitations in generalizability.

Read-first 评分解释

综合优先阅读分 77.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 75。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、评估、实验、指标、结果

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

主题相关性 42%
62.5

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:28。

关键词评分

automated scientific discovery
10
scientific discovery agent
10
automated experimentation
9
autonomous research agent
8
experiment design agent
8
automated research
7
AI for scientific research
7
research automation
7
AI scientist
6
literature review agent
1
survey generation
1
paper writing agent
1

深度分析

创新点

  • 首个用于开发和基准测试智能体完成新颖科学发现完整循环的虚拟环境。
  • 120个多样化挑战任务,涵盖8个主题,每个主题有3个难度级别和参数变化,涉及放射性同位素测年、火箭科学、蛋白质组学等。
  • 三种自动评估指标:任务完成度、任务相关动作和发现的解释性知识。
  • 证明强基线智能体表现困难,凸显该环境捕捉新颖发现挑战的能力。

方法

DISCOVERYWORLD是一个模拟的基于文本的环境(可选二维视觉叠加),包含8个科学主题的120个任务。每个任务要求智能体形成假设、设计和运行实验、分析结果并根据结论行动。性能通过三种自动指标评估:任务完成度、任务相关动作和发现的解释性知识。

关键结果

在先前环境中表现良好的强基线智能体在大多数DISCOVERYWORLD任务上表现困难,表明该环境捕捉了科学发现的新挑战。

技术栈

Python

标签

AICL