Awesome Auto Research Hub 论文 · 数据集 · 项目

汇总分析

研究分析

跨论文归纳研究共性、关键差异、主流方向与趋势演进。

379 篇论文

AI Scientist Systems

End-to-end autonomous research agents that combine ideation, experimentation, analysis, and manuscript generation.

56 方法质量 94 近期性 41 可复现性 39 主题相关性

文献综述归纳

研究路线

端到端自主研究流水线

把想法生成、实验执行、结果分析和论文写作整合在单一闭环中。

尚未覆盖:发表级一致性仅在工作坊或少量生成论文中验证,真实科学贡献的外部验证仍不足。
领域专用发现智能体与验证门控

通过逻辑一致性检查、知识检索或对仿真结果的视觉-语言检查,降低理论或物理领域中的静默错误。

尚未覆盖:验证门控仍会遗漏部分静默失败,且与特定领域信号高度耦合。
基准与评测环境

为科学发现智能体提供标准化任务、数据集和人类基线。

尚未覆盖:代理指标与多选题或任务完成指标未必反映完整开放式发现,领域覆盖和真实决策效用有限。
人机协作研究流水线

将智能体自主性与定点人工监督、自愈执行和可验证报告结合,降低虚构或幻觉输出风险。

尚未覆盖:最优干预点和跨领域成本效益未确定,证据主要来自实验阶段基准。

研究共性

  • 仅靠自主组件不够,系统普遍加入验证、评审或人工检查以抑制不可靠和虚假输出。
  • 端到端工作流收敛为假设—实验—分析—写作闭环。
  • 基准和评审式评测正在成为比较AI科学家系统的重要手段。
  • 当前系统展现出潜力,但尚未普遍实现可靠的跨领域完全自主发现。

关键差异

  • 评测目标不同:有的使用模拟评审或工作坊接受,有的使用领域数值改进、任务完成度或带人类基线的生物学问题。
  • 验证策略不同:内部逻辑一致性检查、视觉-语言物理门控、可验证结果报告或标准化基准任务。
  • 领域重点不同:通用机器学习、应用数学推理、计算流体力学和组学生物学分别要求不同的基础设施和证据。
  • 交互模式不同:完全自主流水线与高杠杆决策点的定点人机协作形成对比。

开放问题

  • 自动评审和评分是否与真实科学新颖性、可复现性和下游效用一致?
  • 领域专用验证机制能否推广到已展示的狭窄物理和生物场景之外?
  • 何种人类协作粒度最合适,如何影响可靠性和成本?
  • 如何降低成功率不稳定以及代码、数据、指标、基线和局限性缺失的问题?
AILGCLmtrl-sciMACYDLIR

312 篇论文

Evaluation, Reliability & Governance

Evaluation, reproducibility, safety, epistemic reliability, governance, and benchmark infrastructure for automated research.

56 方法质量 93 近期性 42 可复现性 37 主题相关性

文献综述归纳

研究路线

端到端自主科研智能体

把想法生成、代码执行、实验运行和论文写作整合到一个自动化工作流中,例如 The AI Scientist、AI Scientist-v2。

尚未覆盖:成功不稳定,提交论文只有部分通过评审,且主要验证到工作坊级别;跨领域和完整会议级可靠性仍未证实。
任务套件与环境设计

通过结构化任务、基线和指标,如任务完成度、任务相关动作和可解释知识,使发现能力可比较,例如 DiscoveryWorld 与 BAISBench。

尚未覆盖:科学领域覆盖有限,任务指标与真实发现价值或下游决策效用之间的一致性尚未建立。
验证与自我纠正

通过物理感知视觉门控、基于事实的报告或多假设失败归因减少静默失败和幻觉式结果,例如 SAGE、AI CFD Scientist。

尚未覆盖:验证门控仍会遗漏部分植入失败;自我纠正尚不能保证完全自主或会议级论文写作。
多智能体与交互式研究平台

协调可定制角色、实时监控、工件检查、回滚或恢复控制以及本地代码集成,例如 Claw AI Lab。

尚未覆盖:评估依赖小型内部案例研究,缺乏跨硬件、数据集和用户设置的标准化外部验证。

研究共性

  • 自主科研系统的评估不仅看想法质量,还看是否产出可运行实验、含指标的结果和有效工件。
  • 当前AI科学家系统仍不够可靠,因此显式验证、评审或失败归因阶段越来越普遍。
  • 评估证据正在转向结构化任务、人类或专家基线、盲审或自动评审,而非单点演示。
  • 可复现性和外部效度记录不均衡;可见例子中开源工件常见,但跨设置验证仍有限。

关键差异

  • 验证目标不同:一些系统检查渲染流场以确认物理有效性,另一些系统模拟稿件评审或将失败实验轨迹归因到根因。
  • 评估对象不同:完全论文接受或盲审分数、任务完成与可解释知识、领域特定的细胞注释与发现问答。
  • 交互与监督不同:完全自主循环、自我纠正循环、任务套件环境和交互式多智能体仪表板意味着不同的人工角色与信任程度。
  • 领域范围不同:部分系统专攻计算流体动力学或组学,另一些面向通用机器学习主题,因而泛化声明难以比较。

开放问题

  • 验证机制如何扩展到当前消融中特定物理或视觉案例之外的静默失败?
  • 任务完成度、自动评审分数和工件质量指标是否与真实科学贡献或下游科研效用一致?
  • 所记录的失败模式和自我纠正收益能否迁移到其他领域、更长周期和完整会议级贡献?
  • 在信任自主科研声明前,应建立哪些最低的外部验证、数据与代码可得性和局限性报告标准?
AICLLGMAmtrl-sciIRDLCY

275 篇论文

Literature Intelligence

Automated literature search, paper reading, citation analysis, literature review, survey synthesis, and research gap discovery.

52 方法质量 92 近期性 41 可复现性 35 主题相关性

文献综述归纳

研究路线

以评分准则引导的综述生成系统,如 ARISE

把主题提示转化为结构化综述,通过角色化LLM代理和迭代评审反馈提升质量。

尚未覆盖:评分准则得分是否代表领域专家接受度与引文可靠性仍无外部验证。
带验证的文献综合与论文生成系统,如 ReasFlow

整合验证、知识检索、文献综合、定理证明、实验和手稿生成。

尚未覆盖:仅在应用数学案例中展示,缺少可见局限性或外部基准比较。
AI科学家的基准与人类基线评测,如 BAISBench

用专家标注的发现任务和研究生水平人类基线比较AI科学家能力。

尚未覆盖:任务限于组学数据,不能单独覆盖文献检索、引文分析和综述综合。
领域无关的自我演化代理框架,如 EvoMaster

提供可扩展的假设优化、自我批判和知识积累基础设施。

尚未覆盖:仅报告四个基准的自报分数,缺少跨领域外部验证和可复现证据。

研究共性

  • 多个系统把文献和学术工作流拆分成检索、起草、验证、评审等角色化LLM代理。
  • 自动质量评分主要依赖LLM评分准则或基准指标,而非成熟的人类同行评审。
  • 人类监督仍以首席研究员角色或人类基线比较形式存在。
  • 现有证据多为自报分数或小样本案例,外部验证和可复现性不足。

关键差异

  • 评测目标不同:综述评分、领域发现问答、端到端论文完成或通用科学基准各有侧重。
  • 交互模式不同:有的以人类首席研究员审阅为循环,有的侧重代理自我演化和知识积累。
  • 领域部署不同:应用数学、组学生物、机器学习论文与通用科学场景对证据要求不同。
  • 监督信号不同:有结构化评分准则、人类专家基线、多AI或人类评审等不同反馈。

开放问题

  • LLM评分准则得分能否与人类专家判断及真实科研效用一致?
  • 长篇幅文献综述中能否保持引文正确、证据可追踪和缺口发现能力?
  • 验证循环与自我演化机制能否在超过四次案例或特定基准之外减少已记录的失败模式?
  • 哪种基准设计能单独评估文献检索、阅读、引文分析和缺口发现,而不仅是AI科学家整体能力?
AICLLGIRDLMAmtrl-sciCY

275 篇论文

Writing & Communication

Automatic paper writing, manuscript drafting, scientific reporting, peer review assistance, and research communication.

47 方法质量 93 近期性 41 可复现性 34 主题相关性

文献综述归纳

研究路线

端到端自主手稿生成

将原始研究目标转化为假设、实验、结果和完整论文,减少人工干预。

尚未覆盖:生成的论文能否在研讨会或特定领域之外稳定被录用仍不确定;不同投稿结果不一致。
验证与有效性门控

在结论进入手稿前发现逻辑、物理、数值或引用错误。

尚未覆盖:领域专用检查仍会漏掉植入的静默失败,且未必能跨领域迁移。
人机协作研究流程

把人工干预放在高杠杆决策点而非逐步监督,从而提高基准表现。

尚未覆盖:哪些干预点可泛化以及专家负担仍不明确。
自纠正失败归因

将实验失败归因到假设、设计或实现层,并路由到正确干预层级。

尚未覆盖:会议就绪写作和长程科学推理仍未解决。

研究共性

  • 自主研究系统正在收敛为模块化阶段:构思、实现、执行、分析、验证和论文起草。
  • 仅靠原始LLM生成不够;需要有效性门控、验证循环或事实约束报告来防止虚假数字和无效结论。
  • 自动评审或LLM评分可接近人类判断,但仍需外部同行评审或领域检查来强化有效性。
  • 较新系统把失败当作信息,加入自纠正或高杠杆人机协作,而不是完全自主循环。

关键差异

  • 交互模式不同:全自动端到端生成与定向人机协作。
  • 验证对象不同:逻辑一致性与LLM评审、领域物理或视觉门控、可验证数值报告。
  • 评测证据不同:LLM评分、研讨会同行录用、基准成功率、盲审分数或失败案例分析。
  • 领域范围不同:通用机器学习流水线与应用数学、计算流体动力学或特定基准主题集。

开放问题

  • 自动审稿评分能否跨领域预测人类会议或研讨会录用,尤其当AI生成投稿出现不一的同行评审结果时?
  • 领域特定有效性门控如何泛化而不继承漏检率,例如十六个植入静默失败中漏掉了两个?
  • 归因引导的自纠正是否改善长程科学写作,还是主要集中在代码与实验执行输出?
  • 在减少专家负担的同时,维持研究质量所需的最少人工干预是什么?
AILGCLMAmtrl-sciDLCYIR

248 篇论文

Hypothesis & Idea Generation

Systems that propose hypotheses, research ideas, experimental directions, or scientific questions.

55 方法质量 93 近期性 41 可复现性 37 主题相关性

文献综述归纳

研究路线

自主实验生成与自我纠正

将假设转化为可执行实验,并通过将失败归因到假设、实验设计或实现层来改善结果。

尚未覆盖:验证门控仍会漏报静默失败;训练仿真器或数据分布之外的领域有效性尚未建立。
形式化理论生成

在因果推断中生成经机器检查的理论产物,通过形式验证降低证明错误。

尚未覆盖:形式证明不保证忠实捕获科学主张;最终产物仍需人工检查。
人机协作科研流水线

将人工干预集中在高杠杆决策点,而非要求完全自主或逐步监督。

尚未覆盖:最优交互模式与跨学科泛化仍未知;证据来自有限案例研究。
面向AI科学家的基准与证据设计

在真实生物数据和多领域实验任务上提供可比较任务以及人类或基线参照。

尚未覆盖:代理指标未必反映真实发现效用;领域覆盖较窄,泛化与污染问题也不确定。

研究共性

  • 自主科学发现系统通常将工作分解为假设生成、实验执行、验证或失败检测和报告。
  • 可靠性被视作核心问题:多个系统加入显式验证、事实约束或证明检查,因为端到端生成会产生无支撑主张。
  • 人类监督仍有用,尤其是在关键决策点干预,而非完全移除或逐步监督。
  • 评估集中于基准分数、工件质量以及与参考自主科研基线的对比。

关键差异

  • 验证信号不同:有的依赖渲染流场的视觉物理检查,有的依赖形式证明助手、可执行结果约束或基于证据的失败归因。
  • 自主程度不同:开放式自主搜索、选择性人机协作或人工审查的形式化产物。
  • 评测目标不同:特定领域的CFD或组学发现任务、广泛多领域基准或内部专家偏好判断。
  • 失败纠正粒度不同:有的路由到假设、实验设计或实现层,有的采用全局反思或自我演化。

开放问题

  • 自主发现系统如何在训练仿真器、数据集或形式假设之外建立外部有效性?
  • 哪种验证机制能在不阻塞合理但异常结果的情况下最好地捕捉静默科学失败?
  • 多少和何时的人类交互最能提升新颖性与可靠性,同时避免逐步监督?
  • 当前基准分数能否预测有意义的科学发现,还是只反映编码、执行和报告质量的提升?
  • 如何审计机器验证的形式化声明与预期非形式科学贡献之间的语义一致性?
AICLLGMAIRmtrl-sciDLCE

178 篇论文

Experiment Automation

Agents that design, execute, monitor, analyze, or iterate experiments, including code-based and lab-based experimentation.

62 方法质量 93 近期性 41 可复现性 43 主题相关性

文献综述归纳

研究路线

端到端自主实验工作流

把研究提示或最小假设转化为可运行代码、实验执行、结果分析和论文生成

尚未覆盖:超出所选代码中心领域后的可靠性;现有工作坊级证据中三篇投稿仅一篇通过同行评审
实验规划与消融基准

通过作者/审稿人消融任务和大语言模型评判器,使自动提出与审查实验扰动变得可比较

尚未覆盖:最佳大语言模型平均召回率约45%,且作者/审稿人性能趋势相反,模型基础假设未解决
模拟发现评测环境

提供受控任务套件和指标,覆盖假设-实验-结论完整周期

尚未覆盖:任务完成度和解释性知识指标是否预测真实科学发现仍未被证明
失败感知经验记忆

把失败实验尝试转化为下游智能体可采纳或拒绝的记录,提升重试和跨任务表现并降低 token 使用

尚未覆盖:证据限于 ScienceAgentBench 与非线性偏微分方程任务;向更广泛实验类型的迁移未验证

研究共性

  • 大语言模型智能体可以完成假设提出、代码实现、实验运行、结果分析和论文撰写的闭环,至少在受限代码领域中成立。
  • 自动评测被广泛用作可扩展代理信号,但同行评审或人类专家仍是最终参照。
  • 当前系统在代码中心任务上更强,在物理实验或更开放场景中的证据不足。
  • 验证、检索、模拟评审或失败记忆等反馈机制有助于改进后续实验迭代。

关键差异

  • 自主程度不同:部分系统追求全自动,部分系统保留人类检查、监控和回滚。
  • 评测目标不同:完整发现任务、论文接受、论文撰写质量、消融召回或 token 效率被分别作为成功标准。
  • 编排方式不同:单智能体流水线、树搜索、多智能体角色、失败策展共享记忆与仪表板控制团队并存。
  • 证据设计不同:模拟环境评测任务完成度,实证研究基准评测缺失消融识别,两类证据尚未统一。

开放问题

  • 模拟任务完成和大语言模型评审分数与实际科研可复现性或影响力之间的一致性仍缺乏证据。
  • 失败感知记忆能否从 ScienceAgentBench 和非线性偏微分方程迁移到其他实验类型?
  • 为何思维链在消融规划上优于智能体设置,且作者与审稿人任务性能趋势相反?
  • 全自动工作坊级论文接受是否能扩展到会议级、多学科和物理实验场景?
  • 可见证据包中多项高排名工作缺少代码、数据集和局限性细节,可复现性边界不明。
AILGCLmtrl-sciMACYCEIR

41 篇论文

Survey Generation

Papers and resources related to Survey Generation.

52 方法质量 88 近期性 42 可复现性 33 主题相关性

文献综述归纳

研究路线

智能体综述起草与迭代优化

通过模块化智能体和基于评分准则或评审的反复修改,把检索到的文献转化为结构化草稿。

尚未覆盖:质量提升常由 LLM 评分准则衡量,而非外部专家一致意见;失败案例和领域迁移证据不足。
检索、证据约束与引用可靠性

通过全文分析、论文卡片、引文图扩展和证据约束引用,改进来源论文的选择与归属。

尚未覆盖:现有证据显示专家引用召回低、精度不一致;缺少跨语料和跨学科的标准化评估。
分类法与层次组织生成

生成或学习类似专家的类别结构,将论文组织成连贯的树状章节。

尚未覆盖:生成分类法存在兄弟重叠、MECE 违规、结构不平衡,与人类专家语义对齐较弱。
综述系统评测与基准设计

通过基准、指标和成对比较评估检索、组织、内容覆盖、结构和引用质量。

尚未覆盖:依赖参考的分类对齐可能惩罚有效替代分类法;代理指标能否预测真实学术效用尚未证明。

研究共性

  • 迭代多步骤智能体工作流在质量、结构和引用相关指标上优于简单单次或仅检索基线。
  • 检索覆盖和引用忠实性是核心瓶颈;系统日益使用论文级摘要或证据约束来支撑主张。
  • 自动评测必要但仍是部分和常常依赖参考的评估,专家评审成本高。
  • 分类法/树状组织被视为不同于流畅写作的能力,采用层次和语义对齐等独立指标。

关键差异

  • 表示方式不同:有的使用自由文本迭代草稿和评分准则,有的使用论文卡片、结构化要点或分类树作为中间产物。
  • 监督/评测目标不同:评分准则引导、多 LLM 成对或 12 维评估、专家分类对齐和真实生物医学验证形成不一致的比较目标。
  • 交互模式不同:多数为全自动多智能体流水线,而受治理研究系统包含科学家在环监督和机构数据控制。
  • 深度依据不同:方法从摘要/关键词检索到全文分析、代码仓库检查和引文图扩展各有差异。

开放问题

  • 当综述主张细致或存在争议时,基于评分准则或多 LLM 的质量分数是否与领域专家判断一致?
  • 为什么现有最佳深度研究智能体只能检索到约 20.92% 的专家引用论文,哪些检索或索引变化能缩小这一差距?
  • 生成分类法能否在无参考和专家对齐之间取得平衡,减少 MECE 违规和结构不平衡,而不强制匹配单个人类分类?
  • 综述生成系统从 LLM 研究主题迁移到非 CS 领域时表现如何,可靠引用仍需哪些证据约束?
CLAIIRDLHCLG

38 篇论文

Hypothesis Generation

Papers and resources related to Hypothesis Generation.

66 方法质量 94 近期性 38 可复现性 47 主题相关性

文献综述归纳

研究路线

自主多智能体假设生成与迭代修正流程

把文献和数据转化为可通过实验反馈、代码执行和结果解释持续更新的假设

尚未覆盖:报告陈述准确性、弱方向拒绝以及超出有限周期和已展示领域后的扩展性仍不确定
人类介入与混合主动研究监督

在自主性与人类判断之间取得平衡,并处理领域条件化的研究控制

尚未覆盖:最佳干预模式以及具身、延迟、异质或伦理场景下可问责闭环仍未建立
面向研究轨迹的结构化搜索与构思机制

在假设搜索中保持受控探索、分支、回溯和长周期一致性

尚未覆盖:难以区分收益来自搜索编排、基础模型能力还是任务特定先验
面向发现能力的基准与评测框架

通过任务、基线、指标和难度度量使系统能力主张具备可比性

尚未覆盖:代理指标与真实科学效用之间的一致性以及更广泛领域覆盖仍缺乏证据

研究共性

  • 多数系统将假设生成视为连接文献或数据分析与实验反馈、代码执行的迭代循环。
  • 多智能体分工较常见,文献搜索、数据分析、构思、执行和验证角色相互分离。
  • 人类监督通常在关键高杠杆决策点最有用,而非逐步全面干预。
  • 可追溯报告和基准任务正在成为评价自主研究系统的重要机制。
  • 当前系统在结构化、可执行、可快速验证的场景中更可信,在难以受控的环境中可靠性不足。

关键差异

  • 人类角色不同:有的系统追求完全自主,有的强调多种人类干预模式,也有综述将自主性视为领域条件化谱系。
  • 探索机制不同:结构化多智能体辩论、进化-系统化研究树、基于代码解释器的迭代优化和强化学习代表不同协调策略。
  • 评测目标不同:生物学任务基准、实验阶段研究基准、方程发现数据集、湿实验验证和报告陈述准确率并行存在,缺乏统一标准。
  • 监督与优化信号不同:自愈反馈、进化搜索、结构化世界模型信息共享和端到端强化学习是提升假设质量的不同路径。

开放问题

  • 如何在保持可追溯性和可验证报告的同时降低错误或不支持的陈述比例?
  • 有价值发现随周期线性增长是否能在超出测试周期数和开放科学领域中继续成立?
  • 哪些评测指标能预测真实世界科学效用,尤其在具身、延迟、异质和伦理约束场景?
  • 哪种结构化探索或人类干预模式能跨领域泛化,又有何种证据能证明这种迁移?
  • 长周期自主研究系统能否在早期拒绝弱方向并保持证据来源,而无需人类清理?
  • 由于许多来源记录未说明局限或发布可复现工件,尚存在哪些验证缺口?
AICLLGGNMADLCENE

37 篇论文

Scientific Discovery Agents

Papers and resources related to Scientific Discovery Agents.

30 方法质量 92 近期性 48 可复现性 22 主题相关性

文献综述归纳

研究路线

科学发现环境与基准

提供标准化任务、交互协议和指标,以评估AI代理在从假设形成到实验和结论的端到端科学发现中的能力。

尚未覆盖:任务覆盖领域有限;基于LLM的评判者与人类专家仅具有中等一致性;结果指标无法检测导致正确结果的错误推理。
代理基础设施与工具增强

自动化发现流程的各个环节——代码生成、湿实验室执行、训练、安全检查——以提升代理效率、可复现性和任务完成率。

尚未覆盖:跨科学领域的泛化性未经验证;多数系统在隔离或模拟任务中评估,而非真实实验室环境;长期自主性与可靠性仍待解决。
忠实推理与安全机制

集成显式检查、结构化证书或安全循环,以确保代理推理与证据一致,并避免危险动作或工具链逃逸。

尚未覆盖:当前安全推理仅在有限任务上评估;在不抑制探索的情况下检测所有组合风险很困难;机制忠实性检查通常需要已知真值,限制了在开放式发现中的使用。

研究共性

  • 所有工作均采用多阶段实验循环(假设、实验、分析)作为代理决策周期。
  • 当前基于LLM的代理不足以进行稳健的科学发现,需要额外的脚手架,如工具、记忆或安全模块。
  • 评估不应仅看任务完成,还应包括过程质量、安全性或推理忠实性。

关键差异

  • 环境类型:有些使用完全基于文本的虚拟实验室,有些依赖具有真实软件约束的代码执行,少数模拟物理湿实验室操作。
  • 安全集成:一种方法将安全推理嵌入代理的每个推理步骤,另一种则在轨迹完成后应用外部安全门。
  • 问题形成:一种路线提倡结构化、可审计的研究问题证书,而其他路线将问题生成作为自由形式的提示步骤,无显式可追溯性。
  • 评估评判者:一项研究报告LLM作为评判者与领域专家之间仅具有中等一致性,而其他研究使用LLM评判者但未进行人类校准,引发了对代理指标可靠性的担忧。

开放问题

  • 如何构建一个无需逐领域重新调整即可泛化到不同科学领域的单一代理基础设施?
  • 当真实机制未知时,哪些自动方法可以检测“正确答案错误机制”失败?
  • 如何设计安全机制以防止组合工具链风险,同时不过度限制代理探索新假设的能力?
  • 验证模拟发现代理能在真实实验室中成功所需的最小现实任务和指标集是什么?
AILGCLcomp-phmtrl-scichem-ph

25 篇论文

Research Agent Benchmarks

Papers and resources related to Research Agent Benchmarks.

8 方法质量 92 近期性 41 可复现性 6 主题相关性

文献综述归纳

研究路线

动作条件控制与规划

使LLM智能体通过闭环决策和反馈执行多步研究动作——查询文献、生成假设、运行实验、自我纠正。

尚未覆盖:在开放式长周期任务中智能体决策的鲁棒性;性能提升来自更好的规划、更大的模型还是领域特定启发式;如何防止错误级联。
评测与证据设计

通过精心设计的基准、指标(如准确率、MAE改进)和受控任务设计(编码问题、综述生成、留出验证)标准化研究智能体的比较。

尚未覆盖:多样化科学领域的覆盖,代理指标与真实研究效用之间的一致性,以及对什么构成自主研究能力有效测试缺乏共识。
系统与可复现基础设施

将智能体工作流打包为可审计、可执行的流水线,产生可重用代码和工件,支持跨环境验证。

尚未覆盖:跨硬件、数据分布和用户设置的标准化外部验证;大多数系统缺乏超出报告实验的全面可复现工件。

研究共性

  • LLM作为研究智能体的核心推理和编码引擎。
  • 研究过程被分解为离散步骤(搜索、规划、编码、验证),并利用反馈信号引导智能体。
  • 评估应超越玩具任务,走向真实科学问题解决,尽管实现方式不同。
  • 可审计性和可复现性正成为研究智能体系统期望的属性。

关键差异

  • 评估方式:静态基准与预定义指标 vs. 动态留出任务迁移测量泛化能力。
  • 领域范围:部分工作针对特定科学领域(材料、数学),其他则瞄准通用研究智能体。
  • 智能体架构:基于强化学习的递归自改进 vs. 基于内部折叠验证的预定义搜索空间分解。
  • 可复现粒度:有些系统提供完整代码和审计日志,而其他仅描述方法无发布工件。

开放问题

  • 当前基准(如学术综述任务、编码问题)是否真正测量了自主研究的进展,还是仅奖励狭隘能力?
  • 在真实情况未知或随时间演化的开放式研究中,如何验证智能体决策质量?
  • 信任研究智能体发现所需的最低证据集(代码、数据、日志)是什么,如何跨领域标准化?

23 篇论文

Automated Experimentation

Papers and resources related to Automated Experimentation.

42 方法质量 86 近期性 40 可复现性 28 主题相关性

文献综述归纳

研究路线

端到端自主研究实验室

自动化从构思、文献分析到实验设计、执行和手稿撰写的完整研究管道,减少人类参与。

尚未覆盖:缺少实证验证及实现原型;依赖社区共识和资源投入;尚未证明在推荐系统或特定分子动力学任务之外的泛化能力。
数字孪生驱动的自主决策

预测实验结果、不确定性和风险,指导显微镜和自驱动实验室的自主操作,实现开放决策与协同优化。

尚未覆盖:验证局限于特定显微镜模态或简单颜色混合任务;噪声动力学和缺失物理机制仍导致预测残差;尚未展示对复杂科学问题的可扩展性。
基于LLM的推理与多智能体工作流

利用LLM智能体提出假设、编辑代码、评估新颖性并推理实验数据,实现偶然发现的操作化并提高采样效率。

尚未覆盖:LLM推理在分布偏移下的可信度和物理可接受性;多智能体协调的开销;缺乏科学推理的标准化基准。
数据质量与实验基础设施

通过噪声检测与纠正(kNN)和FAIR数据管道及自动索引,确保自驱动实验室的数据可靠性和可复现性。

尚未覆盖:方法对特征分布和噪声类型敏感;未在不同仪器模态上验证;依赖特定基础设施(如 nanoHUB)限制了采用。

研究共性

  • 集成物理约束或领域知识对于可靠的自主实验至关重要。
  • LLM 和基础模型正在成为自动化科学推理和实验规划的核心组件。
  • 数据质量、FAIR 原则和可复现性是部署自驱动实验室的关键瓶颈。
  • 需要标准化的基准和评估协议来比较不同的自主实验方法。

关键差异

  • 自动化范围:部分工作瞄准完全端到端自主,而其他工作保留人在环以进行关键决策或捕捉偶然发现。
  • 决策机制:显式模型(数字孪生)与不依赖显式状态表示的隐式 LLM 推理之间存在差异。
  • 应用领域:材料科学强调物理约束和多模态数据,推荐系统则面临公平性和治理挑战。
  • 人类指导的角色:SciLink 主动集成实时专家反馈,而 MLIPilot 和 AutoRecLab 旨在最小化人类干预。

开放问题

  • 如何设计统一的评估框架,平衡科学有效性、计算成本和可复现性,适用于多样化的自主实验系统?
  • LLM 推理轨迹在遇到训练分布之外的新颖物理现象时是否可靠?
  • 何种机制能确保自主实验室产生可重复、可验证的科学结果?
  • 在分布式协同自驱动实验室中,应如何管理数据所有权、隐私和治理?
  • 噪声检测与插补方法能否泛化到高度异构和分布外的实验数据?
LGAImtrl-sciCLdata-anchem-phCEIR

19 篇论文

Literature Review Agents

Papers and resources related to Literature Review Agents.

15 方法质量 89 近期性 36 可复现性 13 主题相关性

文献综述归纳

研究路线

文献综述生成工作流

通过专用或迭代智能体角色自动完成文献综述的组织、写作、编辑和审阅,目标是生成可读且引用准确的输出。

尚未覆盖:现有证据未展示其在多数据集和基线之外的泛化;部分系统未报告限制或代码/数据集工件,跨系统可复现性仍是验证缺口。
文献数据库知识层

将科学文献数据库升级为智能体可访问的检索与证据提取层,支持自然语言查询和证据支持的回答。

尚未覆盖:已报告的收益与 Europe PMC 或特定生物学/问答设置相关,其他领域的覆盖和跨领域标准化验证仍未展示。
集成式科学智能体编排

将假设形成、实验、解释和文献证据组织为集成式科学发现循环,并将组件级自动化作为近期目标。

尚未覆盖:完整组件集成仍未解决;证据包没有提供发现级定量指标,最强主张是 2050 年目标而非已实现结果。
可靠性与对抗评测

评估自动化审阅及相关智能体流程在对抗性文本攻击或基准压力下的脆弱性。

尚未覆盖:对抗鲁棒性证据尚未与真实审阅质量、专家接受度或决策效用建立联系,缺少统一评测协议。

研究共性

  • 研究普遍使用 LLM 编排的智能体来规划互补子查询、提取证据并合成输出,而非依赖单步检索。
  • 引用质量是反复出现的评测目标,通常通过 Citation F1 或与专家共识的一致性来衡量。
  • 文献综述自动化被视为横跨检索、证据基础、写作和审阅的集成问题,组件集成仍是核心挑战。

关键差异

  • 系统拓扑不同:单一 LLM 编排、多智能体角色分工、迭代或层级组织并存。
  • 输出目标不同:面向下游智能体的数据库知识层、完整综述稿件、以及同行评审鲁棒性各有侧重。
  • 评测设置不同:文献综合/声明验证/问答基准、与人类综述的相似度、以及对抗性文本攻击不可直接比较。

开放问题

  • 特定基准上测得的引用精度提升,如何迁移到开放领域或非生物医学文献?
  • 除智能体数量和迭代深度之外,哪些工作流选择对事实准确性和可读性贡献最大?
  • 如何构建标准化协议,将证据基础的综述生成、对抗鲁棒性和专家接受度纳入可比评测?
CL

13 篇论文

Paper Writing Agents

Papers and resources related to Paper Writing Agents.

1 方法质量 90 近期性 47 可复现性 6 主题相关性

文献综述归纳

研究路线

自动化论文起草与生成

从高层想法或大纲生成完整研究论文,减少人工写作负担。

尚未覆盖:生成内容的质量、原创性和事实可靠性;缺乏与人类撰写论文的标准化评估对比。
交互式写作辅助与辅导

在编辑器内提供实时反馈、修改建议和写作指导,提升草稿质量。

尚未覆盖:对不同写作风格和学科的适应性;对最终论文接收或可读性的可衡量影响。
论文评审与批判

生成或评估对科学论文的批判意见,旨在支持或自动化同行评审。

尚未覆盖:批判意见超越表面陈述的依据性;对细微方法论缺陷的覆盖及与实际审稿流程的整合。
多模态论文转换

将论文内容转换为海报、幻灯片或可视化摘要等其他格式。

尚未覆盖:设计质量、内容选取准确性和用户定制化;超越美学吸引力的评估。

研究共性

  • 所有工作均以大语言模型作为论文相关任务的核心推理引擎。
  • 广泛采用多智能体架构分解复杂的写作或分析流程。
  • 研究集中在2025–2026年,表明这是一个新兴但快速发展的领域。
  • 共同强调将工具集成到现有学术环境(如Overleaf)或提供可复现工件。

关键差异

  • 任务范围:部分系统瞄准端到端论文生成,其他则聚焦编辑、评审、海报创作或实验复现。
  • 自主程度:全自动生成对比人机协作的辅导或辅助。
  • 交互模式:编辑器内插件、独立框架或无直接用户交互的基准套件。
  • 评测目标:输出文本质量、批判依据性、复现成功率或检索召回率/精确率。

开放问题

  • 如何超越表面指标评估自动生成论文的创新性和科学贡献?
  • 何种机制能确保生成内容的事实准确性、恰当引用并避免抄袭?
  • 这些智能体在需要深厚领域知识或新颖实验设计的论文上表现如何?
  • 学术出版中的伦理影响和潜在滥用风险是什么,如何缓解?