Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

FirstResearch:面向LLM科学发现代理的可审计问题形成框架

arXiv 2026 70.1 method

TLDR

FirstResearch通过结构化研究问题证书使LLM科学发现代理的问题形成可审计,初步评估优于基线。

评分理由

The paper presents a novel framework for making research questions inspectable, with clear methodology and comparative evaluation. Strengths include the certificate design and strong preliminary results; weaknesses are the limited scope (only question formation, not full discovery) and reliance on LLM-based judges without real-world validation.

Read-first 评分解释

综合优先阅读分 70.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:消融、基线、实验、结果

可复现性 25%
85

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:工件、检查点、代码、GitHub

主题相关性 42%
43.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:94。

关键词评分

AI for scientific research
7
scientific discovery agent
7
AI scientist
6
autonomous research agent
6
automated scientific discovery
5
automated research
5
research automation
5
experiment design agent
4
automated experimentation
3
literature review agent
2
survey generation
1
paper writing agent
1

深度分析

创新点

  • FirstResearch:一个面向LLM科学发现代理的基于第一性原理的研究问题形成框架,能够生成可审计的问题
  • 研究问题证书:一种结构化工件,记录原始定义、假设、机制、矛盾、可证伪假设、测试和失败更新规则,以实现显式检查

方法

该框架在十个LLM代理研究主题上进行评估,与受AI co-scientist、Agent Laboratory和AI Scientist-v2启发的提示级别基线进行比较。通过主要的DeepSeek盲审协议和独立的Gemini-2.5-Flash重新评分进行质量评判,并进行了隔离证书组件的消融研究。

关键结果

FirstResearch在Gemini重新评分下得分为4.86/5,而最强基线为4.38/5,Pearson一致性为0.865。消融实验显示仅证书得分达到4.90/5(DeepSeek)和4.88/5(Gemini),而移除证书后两个评审的得分均低于1/5。

局限性

  • 结果是初步的,且依赖LLM评审而非人类领域专家

标签