ProjectionBench:在渐进信息揭示下评估LLM的科学假设生成
TLDR
一个在渐进信息揭示下评估LLM科学假设生成的基准,衡量创新性和基于推理的能力。
评分理由
Strengths include a novel progressive disclosure framework and automated semantic evaluation. Weaknesses are reliance on semantic similarity, which may not capture true creativity, and the abstract cuts off, leaving results incomplete.
Read-first 评分解释
综合优先阅读分 50,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:35。
关键词评分
深度分析
创新点
- 渐进信息揭示框架,用于评估从最少上下文到全实验细节的假设生成。
- 通过自动语义相似性对原子声明进行评估,以衡量与真实结论的偏离。
- 对多个LLM(GPT-5、GPT-5.4、Gemini 2.5 pro、Gemini 3.1 pro preview)在材料科学子领域的45篇近期论文上进行基准测试。
方法
模型从近期论文中获取研究主题和问题,技术细节逐步揭示。在每个阶段,模型生成假设,这些假设被分解为原子声明,并通过自动语义相似性与原始论文的结论进行比较,以量化对齐和偏离。
关键结果
GPT-5.4和Gemini 3.1 pro的表现优于其前代版本;GPT-5.4即使在最少上下文下也能保持与真实结论的0.7 F1分数对齐。