HARPA:一种可测试性驱动、基于文献的研究构思框架
TLDR
HARPA是一个生成可测试、基于文献的研究假设的框架,在可行性和基础性上优于基线。
评分理由
The paper presents a novel ideation framework that integrates literature mining and hypothesis design, with strong empirical validation including comparisons to a baseline and an ASD agent. Strengths include clear methodology and significant improvements in feasibility and groundedness; weaknesses may include limited scope of evaluation (only one ASD agent) and potential over-reliance on LLMs.
Read-first 评分解释
综合优先阅读分 54,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:35。
关键词评分
深度分析
创新点
- 可测试性驱动、基于文献的假设生成框架,确保假设既可测试又基于科学文献。
- 受人类启发的构思工作流程:通过文献挖掘识别新兴趋势,探索假设设计空间,并通过定位研究空白和证明设计选择收敛到精确可测试的假设。
- 自适应奖励模型,从先前的实验结果中学习以对新假设进行评分,实现假设质量的持续优化。
- 在可行性和基础性上显著优于强大的基线AI研究者,并且与ASD代理一起使用时在执行成功率上也有相应提升。
方法
HARPA通过挖掘科学文献识别新兴趋势,探索假设设计空间,并通过定位研究空白和证明设计选择收敛到可测试的假设。它从先前的实验结果中学习奖励模型以对假设进行评分。评估将HARPA生成的提案与基线AI研究者在定性维度(特异性、新颖性、整体质量、可行性、基础性)上使用10点李克特量表进行比较,并使用CodeScientist ASD代理测试执行成功率。
关键结果
HARPA提案在特异性、新颖性和整体质量上与基线相当,但在可行性(+0.78,p<0.05)和基础性(+0.85,p<0.01)上显著提升。与CodeScientist一起使用时,HARPA在40次执行中实现了20次成功,而基线为11次,失败更少(16 vs 21)。学习的奖励模型比未训练的基线评分器实现了约28%的绝对增益。