Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

CycleResearcher:通过自动化评审改进自动化研究

arXiv 2024 67 method

TLDR

提出CycleResearcher和CycleReviewer,利用迭代偏好训练和新数据集实现自动化研究与同行评审的开源LLM代理。

评分理由

Strengths include a novel full-cycle automation framework, new datasets (Review-5k, Research-14k), and promising review accuracy (26.89% MAE reduction). Weaknesses are reliance on simulated reviews and limited real-world validation; the abstract cuts off, potentially missing further results.

Read-first 评分解释

综合优先阅读分 67,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 74。

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集、评估、结果

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

主题相关性 42%
61.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
50

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集、GitHub

研究版图角色

桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:57。

关键词评分

automated scientific discovery
9
automated research
9
research automation
9
autonomous research agent
8
AI for scientific research
8
scientific discovery agent
8
AI scientist
7
paper writing agent
6
literature review agent
5
automated experimentation
2
experiment design agent
2
survey generation
1

深度分析

创新点

  • 首次探索使用开源后训练LLM作为自主代理实现全周期自动化研究与评审。
  • 迭代偏好训练框架,将CycleResearcher(稿件生成)与CycleReviewer(通过强化学习反馈模拟同行评审)配对。
  • 引入两个新数据集Review-5k和Research-14k,捕捉真实世界机器学习研究与同行评审动态。
  • 证明基于LLM的评审者在论文评分预测中相比单个人类评审者将平均绝对误差降低26.89%。

方法

本文提出一个迭代偏好训练框架,其中CycleResearcher执行文献综述和稿件准备,CycleReviewer模拟同行评审以提供强化学习反馈用于论文改进。两个模型均为开源后训练LLM,基于新创建的Review-5k和Research-14k数据集进行训练,这些数据集反映了真实的机器学习研究与评审过程。

关键结果

CycleReviewer在论文评分预测中相比单个人类评审者实现了26.89%的MAE降低。CycleResearcher生成的论文获得5.36的模拟评审分数,超过了人类预印本基线5.24,但低于录用论文水平5.69。

局限性

  • 生成的论文仍落后于录用论文质量(分数5.36对比5.69),表明仍有改进空间。
  • 评估基于模拟同行评审,而非真实会议录用或超出评分预测的人类专家判断。

标签

CLAICYLG