PaperSearchQA:使用RLVR学习在科学论文中搜索与推理
TLDR
使用RLVR训练搜索代理在科学论文中推理,发布生物医学语料库和QA数据集。
评分理由
Strengths include novel RLVR training for scientific search, large corpus, and dataset. Weaknesses are limited to biomedical factoid QA and not full scientific discovery.
Read-first 评分解释
综合优先阅读分 54.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 43。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:70。
关键词评分
深度分析
创新点
- 训练搜索代理使用RLVR在科学论文中进行搜索与推理,针对科学/工程/医学中的技术性问答。
- 发布包含1600万篇生物医学论文摘要的搜索语料库和包含6万个样本的事实型问答数据集(PaperSearchQA)及基准。
- 证明RLVR训练的代理优于非强化学习检索基线。
- 观察到代理的规划、推理和自我验证等行为。
- 可扩展的数据创建方法,易于推广到其他科学领域。
方法
作者构建了一个包含1600万篇生物医学论文摘要的搜索语料库和一个事实型问答数据集(PaperSearchQA),包含6万个可从该语料库回答的样本。他们在此环境中使用带可验证奖励的强化学习(RLVR)训练搜索代理,并与非强化学习检索基线进行比较。他们还对代理行为进行了定量分析。
关键结果
RLVR训练的搜索代理优于非强化学习检索基线,并且代理表现出规划、推理和自我验证的行为。