379 篇论文
AI Scientist Systems
End-to-end autonomous research agents that combine ideation, experimentation, analysis, and manuscript generation.
文献综述归纳
研究路线
把想法生成、实验执行、结果分析和论文写作整合在单一闭环中。
尚未覆盖:发表级一致性仅在工作坊或少量生成论文中验证,真实科学贡献的外部验证仍不足。通过逻辑一致性检查、知识检索或对仿真结果的视觉-语言检查,降低理论或物理领域中的静默错误。
尚未覆盖:验证门控仍会遗漏部分静默失败,且与特定领域信号高度耦合。为科学发现智能体提供标准化任务、数据集和人类基线。
尚未覆盖:代理指标与多选题或任务完成指标未必反映完整开放式发现,领域覆盖和真实决策效用有限。将智能体自主性与定点人工监督、自愈执行和可验证报告结合,降低虚构或幻觉输出风险。
尚未覆盖:最优干预点和跨领域成本效益未确定,证据主要来自实验阶段基准。研究共性
- 仅靠自主组件不够,系统普遍加入验证、评审或人工检查以抑制不可靠和虚假输出。
- 端到端工作流收敛为假设—实验—分析—写作闭环。
- 基准和评审式评测正在成为比较AI科学家系统的重要手段。
- 当前系统展现出潜力,但尚未普遍实现可靠的跨领域完全自主发现。
关键差异
- 评测目标不同:有的使用模拟评审或工作坊接受,有的使用领域数值改进、任务完成度或带人类基线的生物学问题。
- 验证策略不同:内部逻辑一致性检查、视觉-语言物理门控、可验证结果报告或标准化基准任务。
- 领域重点不同:通用机器学习、应用数学推理、计算流体力学和组学生物学分别要求不同的基础设施和证据。
- 交互模式不同:完全自主流水线与高杠杆决策点的定点人机协作形成对比。
开放问题
- 自动评审和评分是否与真实科学新颖性、可复现性和下游效用一致?
- 领域专用验证机制能否推广到已展示的狭窄物理和生物场景之外?
- 何种人类协作粒度最合适,如何影响可靠性和成本?
- 如何降低成功率不稳定以及代码、数据、指标、基线和局限性缺失的问题?