Apodex Discovery:用于评估和构建发现式人工智能的真实世界基准与环境
TLDR
Apodex Discovery 提出发现式AI的基准与环境,以重型求解器和HDS6评估,超越AAV衣壳设计与药物重定位基线。
评分理由
Strengths include a concrete framework, real-world problem selection, independent evaluation metrics, and empirical results in two domains. Weaknesses are that the abstract is truncated, with limited details on baselines and reproducibility, and the new terminology may obscure comparisons to existing agent frameworks.
Read-first 评分解释
综合优先阅读分 62.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 65。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:39。
关键词评分
深度分析
创新点
- 重型求解器架构:由基础模型、harness、工具和控制策略组成,用于进行扩展的、有状态的、可验证的调查研究
- 问题侦察流程:系统调查了16个领域的561个行业,汇集423个高价值现实问题,并从中选出20个用于初始发布
- 统一的环境-任务-回合(environment-task-episode)抽象,提供数据、工具、约束、反馈、轨迹记录,以及对中间产物和最终提交的验证
- HDS6评估指标:独立于最终任务成功,评估工具(Tools)、修复(Repair)、替代方案(Alternatives)、连贯性(Coherence)、证据(Evidence)和范围(Scope)
- TRACES回合接口:通过受控消融实验,将性能差异归因于特定的求解器组件
方法
Apodex Discovery 提出了一个围绕重型求解器构建的发现式AI框架,该求解器结合了基础模型、harness、工具和控制策略。它定义了一种标准化的环境-任务-回合抽象,提供数据、工具、约束、反馈,以及对中间产物和最终提交的验证。评估使用HDS6评分标准进行,该标准独立于最终任务成功,对工具(Tools)、修复(Repair)、替代方案(Alternatives)、连贯性(Coherence)、证据(Evidence)和范围(Scope)进行评分。
关键结果
在AAV衣壳设计中,Apodex在存活率、趋向性、结构预测和生成设计方面以7%的优势超越了已发表的最先进水平。在药物重定位与再配方中,一个任务特定的生物医学环境使GPT-5.5和GPT-5.6-sol的平均归一化预测分数分别比闭卷式主干模型基线提高2.5和7.6个百分点;使用TRACES接口的受控消融实验将性能贡献隔离到特定的求解器组件。