SciTrace:面向科学发现代理的轨迹感知安全推理
TLDR
SciTrace将安全推理融入科学发现代理的每个阶段,利用轨迹感知检查防止组合工具链风险。
评分理由
The paper presents a novel framework that addresses a critical gap in safety for LLM-based scientific agents, with strong empirical evaluation across multiple domains and models. However, the abstract lacks details on baseline comparisons and potential limitations of the approach.
Read-first 评分解释
综合优先阅读分 60.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 72。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:35。
关键词评分
深度分析
创新点
- SciTrace框架将安全推理融入科学代理流水线的每个阶段,解决了安全层与核心推理分离的问题。
- 安全内在推理循环(SIR)通过联合任务与安全推理,在思考者、实验者、写作者和审阅者阶段维护累积风险状态。
- 组合工具链验证器(CTV)在执行前进行轨迹感知安全检查,捕捉多步工具序列中的风险。
方法
SciTrace结合了SIR和CTV两种机制。在涵盖六个科学领域的240项高风险研究任务和120项工具相关风险任务上,使用四种骨干模型进行评估,并与其他框架(基线未具体说明)进行比较。评估指标包括工具调用安全性、对抗鲁棒性、科学输出质量以及组合工具链逃逸检测率。
关键结果
SciTrace实现了最先进的安全性,在保持科学输出质量的同时提升了工具调用安全性和对抗鲁棒性,并检测到单步监控器遗漏的78.8%的组合工具链逃逸。