AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究
TLDR
限制人工智能科学家在药物资产估值中表现的是证据基础而非推理框架;专有数据显著提升覆盖率和决策质量。
评分理由
The paper presents a well-designed ablation study with clear methodology and real-world benchmarks, demonstrating that proprietary evidence is the key bottleneck. However, the findings are domain-specific to drug-asset valuation and may not generalize to other scientific discovery tasks.
Read-first 评分解释
综合优先阅读分 63.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 59。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:66。
关键词评分
深度分析
创新点
- 分层三臂消融实验,分离了专有证据基础与推理框架在药物资产估值AI智能体中的影响
- 引入完整性感知决策效用指标:知情决策质量 = 决策质量 × 黄金覆盖率
- 证明专有数据设定了AI科学家所能知晓的上限,推理框架虽能改善校准与纪律,但无法消除事实天花板
方法
受控三臂消融实验,针对一个生产级药物资产估值智能体,在13资产分层基准上进行。A组使用仅网络的普通LLM分析师;B组增加公共结构化工具、14维度估值手册、验证器、客观性策略和红队;C组进一步增加专有的Noah AI语料库(包含精选的管线、试验和交易情报)。评估指标包括区间内准确率、客观性分数、黄金竞争记录恢复率、原始决策质量以及提出的完整性感知决策效用。
关键结果
B组将区间内准确率从0.80提升至0.89,客观性从3.16提升至3.30,但未提升事实天花板;C组恢复了黄金竞争记录的0.96,而A/B组为0.25/0.30;在完整性感知决策效用上,C组达到7.43,A/B组为1.76/2.57,即使完美的非专有数据报告受B组覆盖率限制,上限仅为3.83。
局限性
- 研究仅限于单一领域(药物资产估值)和特定专有数据集(Noah AI语料库)
- 基准规模较小(13个资产),可能限制泛化性
- 完整性感知效用指标依赖于黄金覆盖率估计,该估计可能具有数据集特异性
- 即使完美的非专有数据报告也受公共工具覆盖率的限制,如3.83上限所示