FirstResearch:面向LLM科学发现代理的可审计问题形成框架
TLDR
FirstResearch通过结构化研究问题证书使LLM科学发现代理的问题形成可审计,初步评估优于基线。
评分理由
The paper presents a novel framework for making research questions inspectable, with clear methodology and comparative evaluation. Strengths include the certificate design and strong preliminary results; weaknesses are the limited scope (only question formation, not full discovery) and reliance on LLM-based judges without real-world validation.
Read-first 评分解释
综合优先阅读分 70.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:94。
关键词评分
深度分析
创新点
- FirstResearch:一个面向LLM科学发现代理的基于第一性原理的研究问题形成框架,能够生成可审计的问题
- 研究问题证书:一种结构化工件,记录原始定义、假设、机制、矛盾、可证伪假设、测试和失败更新规则,以实现显式检查
方法
该框架在十个LLM代理研究主题上进行评估,与受AI co-scientist、Agent Laboratory和AI Scientist-v2启发的提示级别基线进行比较。通过主要的DeepSeek盲审协议和独立的Gemini-2.5-Flash重新评分进行质量评判,并进行了隔离证书组件的消融研究。
关键结果
FirstResearch在Gemini重新评分下得分为4.86/5,而最强基线为4.38/5,Pearson一致性为0.865。消融实验显示仅证书得分达到4.90/5(DeepSeek)和4.88/5(Gemini),而移除证书后两个评审的得分均低于1/5。
局限性
- 结果是初步的,且依赖LLM评审而非人类领域专家