Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

当AI从事科学:评估自主AI科学家KOSMOS在放射生物学中的表现

arXiv 2025 64.7 system, benchmark, application

TLDR

用随机基因零假设基准评估KOSMOS,三个假设中一个有效。

评分理由

The paper provides a rigorous evaluation with null models and real datasets, but is limited to three hypotheses in a specific domain. Strengths include clear methodology and empirical results; weaknesses include narrow scope and mixed success.

Read-first 评分解释

综合优先阅读分 64.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 72。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、评估、指标、结果

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
60

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:21。

关键词评分

AI scientist
10
autonomous research agent
9
scientific discovery agent
9
automated scientific discovery
8
AI for scientific research
8
automated research
7
research automation
6
literature review agent
5
automated experimentation
4
experiment design agent
3
survey generation
2
paper writing agent
1

深度分析

创新点

  • 使用简单随机基因零假设基准对自主AI科学家(KOSMOS)进行严格评估
  • 将零假设模型审计应用于放射生物学中AI生成的假设

方法

KOSMOS,一个自主AI科学家,为放射生物学问题生成了三个假设。每个假设均使用随机基因零假设基准进行测试,采用斯皮尔曼相关性、经验p值和一致性指数等指标,评估AI的预测是否优于随机基因集。

关键结果

一个假设(CDO1预测辐射反应模块)得到强烈支持(r=0.70,经验p=0.0039);一个用于前列腺放疗结局的12基因特征显著但效应量非唯一(C-index=0.61,p=0.017);而DDR-p53假设未得到支持(rho=-0.40,p=0.76,与随机无法区分)。

局限性

  • KOSMOS产生了一个错误假设和一个不确定结果,表明没有严格审计的AI生成假设可能具有误导性。
  • 显著的12基因特征具有非唯一效应量,限制了其实用价值。
  • 评估仅限于放射生物学中的三个特定问题,因此对其他领域的泛化能力未知。

标签

AICL