Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

PaperSearchQA:使用RLVR学习在科学论文中搜索与推理

arXiv 2026 54.7 method, benchmark

TLDR

使用RLVR训练搜索代理在科学论文中推理,发布生物医学语料库和QA数据集。

评分理由

Strengths include novel RLVR training for scientific search, large corpus, and dataset. Weaknesses are limited to biomedical factoid QA and not full scientific discovery.

Read-first 评分解释

综合优先阅读分 54.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 43。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、基准、数据集

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集

主题相关性 42%
35.8

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

研究版图角色

前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:70。

关键词评分

literature review agent
8
AI for scientific research
7
automated research
6
research automation
6
autonomous research agent
5
scientific discovery agent
4
AI scientist
3
automated scientific discovery
2
survey generation
2
automated experimentation
0
experiment design agent
0
paper writing agent
0

深度分析

创新点

  • 训练搜索代理使用RLVR在科学论文中进行搜索与推理,针对科学/工程/医学中的技术性问答。
  • 发布包含1600万篇生物医学论文摘要的搜索语料库和包含6万个样本的事实型问答数据集(PaperSearchQA)及基准。
  • 证明RLVR训练的代理优于非强化学习检索基线。
  • 观察到代理的规划、推理和自我验证等行为。
  • 可扩展的数据创建方法,易于推广到其他科学领域。

方法

作者构建了一个包含1600万篇生物医学论文摘要的搜索语料库和一个事实型问答数据集(PaperSearchQA),包含6万个可从该语料库回答的样本。他们在此环境中使用带可验证奖励的强化学习(RLVR)训练搜索代理,并与非强化学习检索基线进行比较。他们还对代理行为进行了定量分析。

关键结果

RLVR训练的搜索代理优于非强化学习检索基线,并且代理表现出规划、推理和自我验证的行为。

标签

LGAICLIR