思想有基因组:科学谱系推理与基于谱系的创意生成基准测试
TLDR
提出IdeaGene-Bench基准,用于评估AI系统在10个科学领域的谱系推理与基于谱系的创意生成能力。
评分理由
The paper presents a novel, well-structured benchmark (IG-Bench) with curated lineage traces and genome objects, enabling systematic evaluation of AI's ability to reason about scientific inheritance and generate coherent ideas. However, the benchmark focuses narrowly on lineage reasoning rather than full scientific discovery, and the reported performance (27.3% for the strongest system) indicates significant limitations.
Read-first 评分解释
综合优先阅读分 49.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:30。
关键词评分
深度分析
创新点
- IdeaGene框架:论文表示为最小化、类型化、基于证据的Idea Genome对象,GenomeDiff记录对齐对象以捕捉六种进化动力学下的继承、突变、丢失、外部引入和新插入。
- IG-Bench:包含1,961条黄金谱系轨迹、1,085个精心整理的Idea Genome对象和920个成对GenomeDiff记录,涵盖10个科学领域的基准。
- IG-Exam:42种任务类型和1,029个实例,用于封闭式谱系推理,涵盖Idea Genome抽象、继承追踪、进化推理和谱系验证。
- IG-Arena:使用基于谱系条件的种群进化分数(PES)评估基于谱系的创意生成,检查继承、与邻近工作的有意义的差异以及未来研究的选择价值。
- 识别出组合瓶颈:最强的基于LLM的科学家在谱系推理上仅达到27.3%的精确准确率,且结构化的谱系上下文会重新排列系统排名,而非均匀地提升所有参与者。
方法
IG-Bench围绕IdeaGene框架构建,包含精心整理的Idea Genome对象和捕捉进化动力学的GenomeDiff记录。该基准提供两种评估:IG-Exam用于封闭式谱系推理任务,IG-Arena用于生成任务,其中提案使用种群进化分数(PES)评分,该分数衡量继承、变异和选择价值。实验在14个基于LLM的科学家上进行。
关键结果
最强的基于LLM的科学家在谱系推理任务上仅达到27.3%的精确准确率,且提供结构化的谱系上下文会重新排列系统排名,而非均匀地提升所有参与者。