Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究

arXiv 2026 63.3 method

TLDR

限制人工智能科学家在药物资产估值中表现的是证据基础而非推理框架;专有数据显著提升覆盖率和决策质量。

评分理由

The paper presents a well-designed ablation study with clear methodology and real-world benchmarks, demonstrating that proprietary evidence is the key bottleneck. However, the findings are domain-specific to drug-asset valuation and may not generalize to other scientific discovery tasks.

Read-first 评分解释

综合优先阅读分 63.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 59。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:消融、基准、数据集、指标、结果

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
49.2

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:66。

关键词评分

AI scientist
9
autonomous research agent
8
AI for scientific research
8
scientific discovery agent
8
automated scientific discovery
7
automated research
7
research automation
6
literature review agent
2
survey generation
1
automated experimentation
1
experiment design agent
1
paper writing agent
1

深度分析

创新点

  • 分层三臂消融实验,分离了专有证据基础与推理框架在药物资产估值AI智能体中的影响
  • 引入完整性感知决策效用指标:知情决策质量 = 决策质量 × 黄金覆盖率
  • 证明专有数据设定了AI科学家所能知晓的上限,推理框架虽能改善校准与纪律,但无法消除事实天花板

方法

受控三臂消融实验,针对一个生产级药物资产估值智能体,在13资产分层基准上进行。A组使用仅网络的普通LLM分析师;B组增加公共结构化工具、14维度估值手册、验证器、客观性策略和红队;C组进一步增加专有的Noah AI语料库(包含精选的管线、试验和交易情报)。评估指标包括区间内准确率、客观性分数、黄金竞争记录恢复率、原始决策质量以及提出的完整性感知决策效用。

关键结果

B组将区间内准确率从0.80提升至0.89,客观性从3.16提升至3.30,但未提升事实天花板;C组恢复了黄金竞争记录的0.96,而A/B组为0.25/0.30;在完整性感知决策效用上,C组达到7.43,A/B组为1.76/2.57,即使完美的非专有数据报告受B组覆盖率限制,上限仅为3.83。

局限性

  • 研究仅限于单一领域(药物资产估值)和特定专有数据集(Noah AI语料库)
  • 基准规模较小(13个资产),可能限制泛化性
  • 完整性感知效用指标依赖于黄金覆盖率估计,该估计可能具有数据集特异性
  • 即使完美的非专有数据报告也受公共工具覆盖率的限制,如3.83上限所示

标签

AI