Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

思想有基因组:科学谱系推理与基于谱系的创意生成基准测试

arXiv 2026 49.3 method

TLDR

提出IdeaGene-Bench基准,用于评估AI系统在10个科学领域的谱系推理与基于谱系的创意生成能力。

评分理由

The paper presents a novel, well-structured benchmark (IG-Bench) with curated lineage traces and genome objects, enabling systematic evaluation of AI's ability to reason about scientific inheritance and generate coherent ideas. However, the benchmark focuses narrowly on lineage reasoning rather than full scientific discovery, and the reported performance (27.3% for the strongest system) indicates significant limitations.

Read-first 评分解释

综合优先阅读分 49.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、实验

主题相关性 42%
38.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:30。

关键词评分

AI for scientific research
7
AI scientist
6
automated scientific discovery
5
automated research
5
research automation
5
scientific discovery agent
5
autonomous research agent
4
literature review agent
3
survey generation
2
paper writing agent
2
automated experimentation
1
experiment design agent
1

深度分析

创新点

  • IdeaGene框架:论文表示为最小化、类型化、基于证据的Idea Genome对象,GenomeDiff记录对齐对象以捕捉六种进化动力学下的继承、突变、丢失、外部引入和新插入。
  • IG-Bench:包含1,961条黄金谱系轨迹、1,085个精心整理的Idea Genome对象和920个成对GenomeDiff记录,涵盖10个科学领域的基准。
  • IG-Exam:42种任务类型和1,029个实例,用于封闭式谱系推理,涵盖Idea Genome抽象、继承追踪、进化推理和谱系验证。
  • IG-Arena:使用基于谱系条件的种群进化分数(PES)评估基于谱系的创意生成,检查继承、与邻近工作的有意义的差异以及未来研究的选择价值。
  • 识别出组合瓶颈:最强的基于LLM的科学家在谱系推理上仅达到27.3%的精确准确率,且结构化的谱系上下文会重新排列系统排名,而非均匀地提升所有参与者。

方法

IG-Bench围绕IdeaGene框架构建,包含精心整理的Idea Genome对象和捕捉进化动力学的GenomeDiff记录。该基准提供两种评估:IG-Exam用于封闭式谱系推理任务,IG-Arena用于生成任务,其中提案使用种群进化分数(PES)评分,该分数衡量继承、变异和选择价值。实验在14个基于LLM的科学家上进行。

关键结果

最强的基于LLM的科学家在谱系推理任务上仅达到27.3%的精确准确率,且提供结构化的谱系上下文会重新排列系统排名,而非均匀地提升所有参与者。

标签