从结果数据中解析科学推理步骤以进行分子优化
TLDR
DESRO通过分组数据并利用大语言模型从结果中推断科学推理步骤,在18个分子优化任务中取得高成功率。
评分理由
The paper presents a novel framework (DESRO) that addresses the supervision gap in training reasoning models by recovering intermediate reasoning from grouped outcome data, with strong empirical results on molecule optimization. Its strengths include large-scale evaluation and generalization to out-of-distribution scenarios, but it is limited to a specific domain (molecule optimization) and does not cover broader scientific discovery tasks.
Read-first 评分解释
综合优先阅读分 44.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:39。
关键词评分
深度分析
创新点
- 提出DESRO框架,通过分组数据并利用LLM恢复底层逻辑,从结果数据中解读科学推理步骤。
- 在分子优化中实例化:通过将具有共享片段的分子分组,并利用LLM分析结构-性质相关性,从230万条分子性质记录中推断优化原理。
- 训练一个模型,通过可解释的推理过程进行分子优化,实现了最先进的成功率和鲁棒的分布外泛化。
- 通过扩展到反应配体选择,展示了框架的通用性。
方法
DESRO将具有共享片段的分子从230万条性质记录中分组,然后利用大语言模型分析结构变异如何与性质差异相关,从而推断优化原理。基于推导出的推理数据,训练一个模型通过可解释的推理过程进行分子优化,并在18个单目标和多目标优化任务上进行评估。
关键结果
DESRO在18个任务中的15个上取得了最高成功率,鲁棒地泛化到分布外场景(新颖性质组合、未见靶点、自然语言定义的性质),并在严格时间分割下自主重建了专家级别的先导化合物优化轨迹。