Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

EurekAgent:智能体环境工程——自主科学发现的唯一关键

arXiv 2026 64.7 method

TLDR

EurekAgent通过工程化智能体环境实现自主科学发现,以低成本在数学内核及ML任务取得SOTA。

评分理由

The paper introduces a novel perspective on environment engineering for LLM-based agents, with clear dimensions and strong empirical results across multiple domains. However, the claim 'all you need' may be overstated, and the approach is limited to metric-driven tasks without addressing literature review or paper writing.

Read-first 评分解释

综合优先阅读分 64.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 79。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、指标、结果

主题相关性 42%
65.8

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:工件、代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:36。

关键词评分

automated scientific discovery
10
scientific discovery agent
10
autonomous research agent
9
research automation
9
automated research
8
automated experimentation
8
AI for scientific research
8
AI scientist
7
experiment design agent
7
literature review agent
1
survey generation
1
paper writing agent
1

深度分析

创新点

  • 将环境工程定位为自主科学发现智能体的关键瓶颈和核心研究方向
  • EurekAgent系统从四个维度工程化智能体环境:权限工程、工件工程、预算工程和人在回路工程
  • 权限工程:实现有界智能体执行和隔离评估
  • 工件工程:基于文件系统和Git的协作
  • 预算工程:预算感知探索
  • 人在回路工程:便捷的人工监督与干预

方法

EurekAgent是一个指标驱动的智能体系统,通过工程化执行环境来塑造智能体行为。它包含四个工程维度:权限工程(限制执行并隔离评估)、工件工程(使用文件系统和Git进行协作)、预算工程(成本感知探索)以及人在回路工程(监督)。智能体在此工程化环境中提出、验证并迭代解决方案。

关键结果

EurekAgent在多个数学、内核工程和机器学习任务上取得了新的最先进结果,包括以不到11美元的总API成本发现新的最先进的26圆填充结果。

标签

AICL