Awesome Auto Research Hub 论文 · 数据集 · 项目

汇总分析

研究分析

跨论文归纳研究共性、关键差异、主流方向与趋势演进。

341 篇论文

AI Scientist Systems

End-to-end autonomous research agents that combine ideation, experimentation, analysis, and manuscript generation.

55 方法质量 93 近期性 42 可复现性 39 主题相关性

文献综述归纳

研究路线

全自动发现流水线

将构思、代码实现、实验执行、分析和论文写作串联为单一自动化流程,降低每个研究周期的人工投入。

尚未覆盖:输出质量不稳定,仅部分生成的论文通过同行评审,且流水线在未经调优的领域外经常失败。
验证与自我纠正机制

通过内部逻辑检查、基于物理的视觉检查或可验证报告合成,检测并纠正幻觉结果或静默失败,提高生成声明可信度。

尚未覆盖:验证覆盖率不完整——例如视觉-语言门控遗漏了16个植入失败中的2个——且验证器本身可能被看似合理但错误的输出欺骗。
领域特定适配

通过嵌入领域知识、物理约束或专用工具链,将通用AI科学家定制到特定学科(CFD、应用数学、生物学),在这些领域产生可辩护的结果。

尚未覆盖:领域知识注入仍依赖人工整理;对新物理原理的开放式发现仍是未解决的挑战。
基准与评估框架

提供标准化任务、指标和人类基线(如DISCOVERYWORLD、BAISBench),以定量比较AI科学家系统并暴露其弱点。

尚未覆盖:基准任务简化了真实科学复杂性;任务完成度等代理指标尚未与真正的科学洞察力或长期影响对齐。

研究共性

  • 所有系统均以LLM作为科学工作流的核心推理引擎。
  • 每个系统都包含某种形式的结果验证或评估以对抗幻觉。
  • 当前AI科学家性能不足以实现完全可靠的自主发现,人类参与或验证仍然必要。
  • 端到端论文生成是共同目标,但生成手稿的质量波动很大。

关键差异

  • 验证策略:基于逻辑的自审(ReasFlow)vs.物理感知视觉门控(AI CFD Scientist)vs.可验证报告合成(AutoResearchClaw)。
  • 评估目标:自动评审分数(The AI Scientist系列)vs.标准化基准任务(DISCOVERYWORLD、BAISBench)vs.真实同行评审接受(AI Scientist-v2)。
  • 领域通用性:构建通用框架然后应用(The AI Scientist、AutoResearchClaw)vs.从一开始构建领域专用系统(AI CFD Scientist、ReasFlow)。
  • 人类协作模式:PI-研究生隐喻与高层指导(ReasFlow)vs.具有七种粒度级别的多模式干预(AutoResearchClaw)。

开放问题

  • 能否设计验证门控以捕获所有关键失败模式,同时不阻挡新颖但非常规的有效发现?
  • 基准得分和自动评审指标在多大程度上能预测生成研究的实际科学价值或可复现性?
  • 使通用AI科学家在新领域与专用系统竞争所需的最小领域特定组件集合是什么?
  • 在研究周期的哪些阶段,人类干预能比完全自主提供最大的边际收益?
AILGCLmtrl-sciMACYDLIR

284 篇论文

Evaluation, Reliability & Governance

Evaluation, reproducibility, safety, epistemic reliability, governance, and benchmark infrastructure for automated research.

55 方法质量 92 近期性 42 可复现性 37 主题相关性

文献综述归纳

研究路线

端到端自主研究系统基础设施

将LLM集成为可执行完整研究循环(想法生成、代码实现、实验执行、论文撰写)的智能体,减少人工干预。

尚未覆盖:跨领域泛化能力、长程任务中的记忆与上下文保真度、以及在不同条件下智能体生成实验的可重复性。
科学发现智能体的基准与评测设计

提供标准化任务、难度级别和自动或人类评估指标,使自主研究智能体的性能可比较。

尚未覆盖:代理指标(任务完成度、评审分数)与真实科学影响力之间的对齐;基准任务覆盖度与真实研究多样性的差距。
失败归因与可靠性提升

识别自主研究流水线中的重复失败模式,并通过结构化诊断或验证门控提高输出的可信度。

尚未覆盖:归因机制的因果验证;验证门控的残留漏检率(如16个静默失败中漏掉2个);在复杂物理或生物领域的适用性。

研究共性

  • 当前基于LLM的智能体能够部分自动化研究流程,但完全端到端自主科学发现仍不稳定。
  • 自动评审或基于物理的验证等外部门控对于捕获明显错误是必要的,但现有门控仍会遗漏部分失败案例。
  • 标准化基准对衡量进展至关重要,但现有基准覆盖领域有限,且尚未保证与真实科学价值的对齐。
  • 自我纠正和多智能体协作是提升鲁棒性和输出质量的有前景方向。

关键差异

  • 评估方法:有的依赖自动评审器评分,有的采用人类专家评判或真实同行评审,导致对可接受研究质量的判断标准不同。
  • 领域专用性:通用ML研究系统与嵌入了物理或生物先验的领域专用系统(如CFD、组学)在失败模式和泛化主张上难以直接比较。
  • 纠正深度:从简单反思循环到多假设因果失败归因,恢复过程的粒度和可解释性存在差距。
  • 交互模式:完全自主运行与提供可人工干预的交互式仪表板,导致对“自主”的定义和评测方式产生分歧。

开放问题

  • 何种跨领域统一基准既能衡量自主研究能力,又能预测真实科学效用?
  • 如何量化验证门控的可靠性,并将漏检率降低到操作上可接受的阈值以下?
  • 自主系统面对分布外任务或数据时的失败边界在哪里,如何在线检测这些边界?
  • 长程研究智能体如何维持记忆和上下文连贯性,避免级联错误?
  • 多智能体角色设计和通讯协议对最终科学质量的因果影响是什么?
AICLLGMAmtrl-sciIRDLCY

252 篇论文

Literature Intelligence

Automated literature search, paper reading, citation analysis, literature review, survey synthesis, and research gap discovery.

51 方法质量 91 近期性 41 可复现性 35 主题相关性

文献综述归纳

研究路线

科学知识表示与检索用于文献合成

将非结构化论文集转化为结构化的、可检索的知识,以指导生成。

尚未覆盖:检索到的知识是否足以产生超越训练数据的新见解,以及如何处理来源间的矛盾。
智能体规划与迭代优化用于自动文献综述

通过编排多个专业化智能体及其反馈回路,生成高质量、连贯的综述论文。

尚未覆盖:规划机制能在多大程度上提升科学深度而非仅表面格式,以及长周期任务下无记忆退化的可扩展性。
文献情报系统的基准测试与评估设计

提供标准化任务和指标(细胞注释、选择题、评分准则分数)以比较AI科学家能力。

尚未覆盖:覆盖窄领域之外的多样科学文献任务,以及代理指标与真实科学贡献之间的差距。
端到端智能体系统用于文献合成与综述生成

将孤立的模型构想转化为可运行、可复现的流水线,自主生成文献。

尚未覆盖:跨不同科学领域的标准化验证,以及在LLM非确定性行为下确保智能体输出的可复现性。

研究共性

  • 多智能体LLM系统可以自动化文献综述过程的部分环节,但完全自主的文献情报仍未解决。
  • 迭代优化(通过评分准则、验证或进化步骤)对提升输出质量至关重要。
  • 需要人类评估或专家设计的基准来评估输出质量。

关键差异

  • 部分工作聚焦于生成完整综述论文并以评分准则评估质量,而其他工作将文献合成作为更广泛科学发现流程的子步骤。
  • 评估目标不同:领域特定的科学发现任务(如细胞注释)与LLM评分准则判断的通用综述质量。
  • 验证策略各异:内部逻辑验证循环与外部评审智能体根据评分准则打分。
  • 领域范围从领域无关框架到针对应用数学或组学定制的系统。

开放问题

  • 如何验证AI生成文献综述的事实准确性,特别是在处理矛盾或过时来源时。
  • 基于LLM的评估评分准则能否替代人类同行评审以评估科学质量。
  • 这些智能体系统在极大规模文献库和长周期研究项目中的可扩展性,且不发生记忆退化。
  • 全自动科学文献生成的伦理问题,包括抄袭和问责。
AICLLGIRDLMAmtrl-sciCY

251 篇论文

Writing & Communication

Automatic paper writing, manuscript drafting, scientific reporting, peer review assistance, and research communication.

45 方法质量 92 近期性 42 可复现性 34 主题相关性

文献综述归纳

研究路线

端到端自主科研写作系统

自动化完整的科学流程——假设生成、代码执行、结果可视化和手稿起草——减少常规研究和论文写作中的人力投入。

尚未覆盖:跨领域的可靠性、持续的事实准确性,以及在无需大量人工干预的情况下,产出符合严格人类同行评审标准的手稿。
生成论文的评估与质量评测

提供指标、自动评审器和基准(如基于LLM的评分标准、盲评分数、工作坊接收阈值),衡量AI生成的科学写作的质量和完整性。

尚未覆盖:自动指标与真实科学贡献之间的对齐;评估方法在开发时所用特定机器学习子领域或策划基准之外的可推广性。
失败分析与自我纠正机制

识别和分类失败模式(如实现漂移、幻觉数字、记忆退化),并设计自我纠正策略,如多假设归因或内部验证循环,以提高研究稳健性。

尚未覆盖:这些机制是否能在开放式科学探索中预防所有关键故障类型;如何处理涉及交织逻辑和实验错误的复杂多步失败。
人机协作模式

探索不同干预粒度(从完全自主到逐步监督),在高杠杆决策点利用人类专长,同时保持自动化效率。

尚未覆盖:平衡认知负荷、可扩展性和写作质量的最佳交互设计;哪种协作模式对哪种科学写作任务最有利的实证验证。

研究共性

  • 大型语言模型在与代码执行环境和自动评审循环结合时,可以生成连贯的研究论文。
  • 自动化验证——无论是通过逻辑检查、物理模拟还是事实锚定——对于减少生成手稿中虚构或伪造的结果至关重要。
  • 当前系统在长跨度任务中仍经常失败,需要人类干预或迭代自我纠正才能产出可辩护的科学成果。
  • 工作坊级别的接收正成为一个有意义的里程碑,但可以提交会议的完全自主论文生成仍是一个未解决的挑战。

关键差异

  • 适当的自主程度:部分工作主张完全自主的流水线(AI Scientist路线),而另一些工作证明在关键决策点进行精准的人机协作优于完全自主和详尽的逐步监督(AutoResearchClaw)。
  • 验证的本质:方法各异,从内部逻辑一致性审计(ReasFlow)和基于物理的视觉门控(AI CFD Scientist),到将主张约束为实测值的事实锚定报告(SAGE)。
  • 失败处理的作用:一些系统使用单阶段反思循环,而SAGE提出多假设因果归因,将纠正确定性路由到正确流水线阶段,暗示对失败复杂性的假设不同。
  • 领域特异性:通用机器学习框架(AI Scientist)假设广泛适用性,而领域专用系统(ReasFlow用于应用数学,AI CFD Scientist用于流体动力学)认为深度验证需要领域感知的门控和知识检索。

开放问题

  • 在开放式科学任务中,哪些验证方法可以保证AI生成的论文不包含伪造的实验数据或幻觉引用?
  • 如何构建评测基准,衡量AI撰写论文的真实科学贡献,而非仅仅表面写作质量和包含指标的输出?
  • 当底层模型缺乏领域智能或科学品味时,自我纠正的上限是什么?如何在不成为瓶颈的情况下整合人类反馈?
  • 从失败分析(如Why LLMs Aren't Scientists Yet)中得出的设计原则能否被系统地转化为架构约束,以防止最常见的失败模式?
AILGCLMAmtrl-sciDLCYIR

220 篇论文

Hypothesis & Idea Generation

Systems that propose hypotheses, research ideas, experimental directions, or scientific questions.

54 方法质量 92 近期性 41 可复现性 37 主题相关性

文献综述归纳

研究路线

动作条件控制与规划

将假设生成、实验设计与执行连接成闭环,使智能体能够规划干预、响应实验结果并在循环中提升决策质量。

尚未覆盖:性能提升是否源于智能体的规划逻辑而非底层LLM或任务先验,以及该闭环在训练域外分布偏移时的鲁棒性。
评测与证据设计

提供标准化基准(如ARC-Bench、BAISBench),通过任务、指标和人类基线使AI科学家能力的主张具有可比性,并揭示失败模式。

尚未覆盖:对多样化科学领域的覆盖以及代理指标(基准分数)与真实科学发现效用之间的一致性仍然有限。
系统与可复现基础设施

将孤立的智能体转变为可运行、可定制的平台(如多智能体实验室、代码工具),提供工件、监控和可复用工作流,降低构建和复现AI科学家实验的门槛。

尚未覆盖:缺乏跨硬件、数据集和用户设置的标准化外部验证;大多数平台仅基于内部案例研究进行评估。
概念分类与理论

将碎片化的AI科学家系统组织为类别(文献综述、假设生成、实验、分析),识别共同挑战、指标和框架,形成对领域的结构化理解。

尚未覆盖:所提出的分类法缺乏直接实证验证以证明这些类别能预测智能体行为;领域仍缺乏统一的自主科学推理理论框架。

研究共性

  • 可靠的科学发现需要超越原始LLM输出的结构化验证;所有系统都包含某种形式的有效性门控或验证步骤。
  • 多智能体或模块化架构是分解研究工作流为可管理子任务(如构思、执行、分析)的主流设计模式。
  • 当前的AI科学家智能体尚不具备完全自主、端到端生成可投稿会议论文的能力;为保证质量和正确性,人工干预或协作仍不可或缺。

关键差异

  • 形式化验证的角色:部分系统依赖机器验证的证明和陈述审计,而其他系统依赖经验验证或视觉-语言门控,形成形式化与数据驱动验证之间的分歧。
  • 人机协作模式:方法涵盖从完全自主执行到在高杠杆决策点精准引入人机回环,对人工介入的最佳程度和时机尚无共识。
  • 领域特异性:部分工作是领域无关的基础框架,而其他工作则与领域特定工具和物理模型紧密集成,形成通用性与深度之间的权衡。

开放问题

  • 如何弥合形式化或经验验证与生成假设的实际科学价值之间的差距?
  • 基准分数的提升在多大程度上能转化为现实实验室中更有效的AI科学家?
  • 当自我演化智能体在设计评估时未见过的任务分布之外运行时,其失败模式是什么?
AICLLGMAIRmtrl-sciDLCE

158 篇论文

Experiment Automation

Agents that design, execute, monitor, analyze, or iterate experiments, including code-based and lab-based experimentation.

61 方法质量 92 近期性 42 可复现性 43 主题相关性

文献综述归纳

研究路线

端到端自主研究代理系统

从想法生成到实验执行再到论文撰写的完整科学发现流程自动化,减少每次发现循环的人工投入。

尚未覆盖:在严格同行评审下的可靠性(仅一篇工作坊论文被接收),超越ML或应用数学的泛化能力,以及长期安全与伦理审查的处理。
实验规划与执行优化

通过从过往失败中学习或系统化消融规划提高单个实验步骤的效率,减少计算与令牌浪费。

尚未覆盖:LM仅能识别45%的人类期望消融;负知识仅在PDE和ScienceAgentBench任务上展示,对更广泛实验类型的益处尚不明确。
科学发现代理的评测基准

提供标准化任务与指标,比较代理在假设检验、实验设计和发现方面的能力,揭示当前局限。

尚未覆盖:对超越文本或模拟环境的多样化科学实践的覆盖;自动代理指标与真实科学效用之间的一致性。
多智能体协作研究平台

实现基于角色的可定制代理协作,处理复杂研究流程,通过仪表板和工件检查提供人类监督。

尚未覆盖:缺乏对多智能体协调相对于单智能体基线的附加价值的系统验证;平台成熟度及跨硬件和用户环境的可复现性。

研究共性

  • 基于LLM的推理和代码生成是自动化科学实验的核心引擎。
  • 将研究循环分解为假设、实验和分析步骤是常见的架构模式。
  • 自动化评估(模拟评审或基准任务)对于可扩展评估是必要的,但其与人类科学判断的相关性仍不确定。
  • 当前系统在最能完全模拟实验反馈循环或在代码中执行的领域(ML、数学)最有效。

关键差异

  • 自主程度:部分系统旨在完全自动生成论文,无人工干预;另一些则将人类定位为监督代理执行的首席研究员。
  • 评估理念:一个路线使用模拟同行评审(LLM裁判)评判系统输出,另一个使用合成环境中的任务完成指标,第三个则提交至真实工作坊,造成代理指标与真实有效性之间的张力。
  • 失败处理:负知识记忆库与基于树搜索的迭代改进以及简单重试机制形成对比,影响记忆占用和探索策略。
  • 领域特异性:ReasFlow等系统面向理论密集的数学推理设计,而AI Scientist则针对经验性ML,这种专门化影响所需的验证和基础组件。

开放问题

  • 自主代理如何处理昂贵、物理或安全关键的实验领域,超越纯模拟或基于代码的环境?
  • 在长期发现轨迹中,保持自主研究代理与科学严谨性对齐所需的最小人类反馈信号集是什么?
  • 负知识或类似失败记忆方法能否泛化,捕捉不同科学领域间常见的实验陷阱?
  • 社区应如何标准化评估,以便基准分数的提升能转化为更高质量的同行评审科研成果?
AILGCLmtrl-sciMACYCEIR

40 篇论文

Survey Generation

Papers and resources related to Survey Generation.

52 方法质量 88 近期性 43 可复现性 34 主题相关性

文献综述归纳

研究路线

自动化综述生成流水线

从论文检索到起草和修订,端到端合成文献综述,利用迭代精炼和多智能体协调提高连贯性、覆盖度和引用准确性。

尚未覆盖:在没有任务特定调优的情况下跨学科泛化;在极大规模论文集上保持引用召回率;流水线生成质量与真实学术工作流中人类专家判断的一致性。
综述质量的评估基准与指标

提供标准化测试平台和指标(如TaxoBench、Survey-Arena、12维度评估),定量比较自动综述生成系统在检索、组织、内容深度和引用准确性方面的表现。

尚未覆盖:代理指标与真实学术效用之间的差距;依赖单一专家分类法作为参考可能惩罚有效的替代组织方式;非计算机科学或非英语综述任务的覆盖有限。
分类法和知识组织

从参考论文构建研究主题的层次或平面分类法,以结构化综述,实现清晰的论文到类别映射和主题导航。

尚未覆盖:自动生成的分类法在读者效用上是否优于人工策划的分类法;验证基于分类法的组织是否能改善下游理解,而不仅仅是提升结构指标。

研究共性

  • 基于LLM的智能体是综述生成的核心引擎,简单的单次生成不足,必须进行迭代精炼。
  • 引用准确性和内容覆盖度是首要质量维度,系统必须包含显式机制,根据源论文验证主张。
  • 综述的结构连贯性和逻辑组织与事实正确性同等重要,因此需要大纲规划和分类法引导的章节划分。

关键差异

  • 系统采用单一多阶段流水线(如AutoSurvey2)或多智能体协作(如ARISE、Agentic AutoSurvey、DeepSurvey),对于哪种范式能带来更好的可靠性–成本权衡尚无共识。
  • 评估方法存在分歧:一些依赖带有专家标注的定制基准(TaxoBench、CS-TaxoBench),而其他则构建临时人工评估或使用LLM作为评判;缺乏被所有工作接受的标准化外部基准。
  • 源分析深度各异:多数系统在摘要和元数据上操作,但DeepSurvey推动全文和代码库分析,这引发了关于高质量合成所需证据充分性的问题。
  • 人类监督的角色不同:NVAITC AI Scientist强调治理和科学家在环,而许多其他系统瞄准完全自主生成,使得辅助与自动化之间的边界尚未确定。

开放问题

  • 我们如何验证生成综述中的引用真正支持所归属的主张,而不仅仅是基于关键词重叠?
  • 自动化综述在实际工作流中是否能提高研究人员效率或理解力,需要什么样的实验来证明?
  • 当应用于包含不完整或矛盾主张的快速演进预印本文献时,多智能体迭代精炼的失败模式是什么?
  • 能否设计出无参考、但仍与人类对综述组织偏好一致的分类法评估指标?
CLAIIRDLHCLG

37 篇论文

Scientific Discovery Agents

Papers and resources related to Scientific Discovery Agents.

30 方法质量 92 近期性 48 可复现性 22 主题相关性

文献综述归纳

研究路线

科学发现环境与基准

提供标准化任务、交互协议和指标,以评估AI代理在从假设形成到实验和结论的端到端科学发现中的能力。

尚未覆盖:任务覆盖领域有限;基于LLM的评判者与人类专家仅具有中等一致性;结果指标无法检测导致正确结果的错误推理。
代理基础设施与工具增强

自动化发现流程的各个环节——代码生成、湿实验室执行、训练、安全检查——以提升代理效率、可复现性和任务完成率。

尚未覆盖:跨科学领域的泛化性未经验证;多数系统在隔离或模拟任务中评估,而非真实实验室环境;长期自主性与可靠性仍待解决。
忠实推理与安全机制

集成显式检查、结构化证书或安全循环,以确保代理推理与证据一致,并避免危险动作或工具链逃逸。

尚未覆盖:当前安全推理仅在有限任务上评估;在不抑制探索的情况下检测所有组合风险很困难;机制忠实性检查通常需要已知真值,限制了在开放式发现中的使用。

研究共性

  • 所有工作均采用多阶段实验循环(假设、实验、分析)作为代理决策周期。
  • 当前基于LLM的代理不足以进行稳健的科学发现,需要额外的脚手架,如工具、记忆或安全模块。
  • 评估不应仅看任务完成,还应包括过程质量、安全性或推理忠实性。

关键差异

  • 环境类型:有些使用完全基于文本的虚拟实验室,有些依赖具有真实软件约束的代码执行,少数模拟物理湿实验室操作。
  • 安全集成:一种方法将安全推理嵌入代理的每个推理步骤,另一种则在轨迹完成后应用外部安全门。
  • 问题形成:一种路线提倡结构化、可审计的研究问题证书,而其他路线将问题生成作为自由形式的提示步骤,无显式可追溯性。
  • 评估评判者:一项研究报告LLM作为评判者与领域专家之间仅具有中等一致性,而其他研究使用LLM评判者但未进行人类校准,引发了对代理指标可靠性的担忧。

开放问题

  • 如何构建一个无需逐领域重新调整即可泛化到不同科学领域的单一代理基础设施?
  • 当真实机制未知时,哪些自动方法可以检测“正确答案错误机制”失败?
  • 如何设计安全机制以防止组合工具链风险,同时不过度限制代理探索新假设的能力?
  • 验证模拟发现代理能在真实实验室中成功所需的最小现实任务和指标集是什么?
AILGCLcomp-phmtrl-scichem-ph

34 篇论文

Hypothesis Generation

Papers and resources related to Hypothesis Generation.

66 方法质量 94 近期性 39 可复现性 47 主题相关性

文献综述归纳

研究路线

多智能体假设生成工作流

通过将假设形成、数据分析、文献搜索和实验设计等任务分配给专用智能体,并在反馈中迭代优化候选假设,实现科学发现全流程自动化。

尚未覆盖:确保长周期假设质量不因错误传播而下降,防止幻觉式声明,并验证最终输出是否在表面准确性指标之外满足科学严谨性。
结构化搜索与进化假设生成

结合树搜索回溯、进化压力和代码级优化,高效探索大型假设空间,从而发现方程、算法或新机制,而无需穷举枚举。

尚未覆盖:在探索广度与新颖性之间取得平衡,定义可靠的新颖性评分,并证明所提出假设能泛化到搜索算法的训练分布之外。
人机协作假设共创

通过允许人类研究者在高杠杆决策点介入,缓解完全自主系统的脆弱性,既保留科学直觉又减少详尽监督。

尚未覆盖:人类干预的最佳位置,衡量研究者的认知负荷,并确定协作是否能在不重新训练交互策略的情况下扩展到多个领域。
假设生成的基准与评估框架

提供标准化任务和指标(如ARC-Bench、LABBench2),以比较不同AI科学家系统在假设质量、执行正确性和端到端发现性能上的表现。

尚未覆盖:代理指标与真实世界发表或专利级影响力之间的对齐,对不同科学学科的覆盖,以及构建能稳健拒绝弱假设的阴性对照。

研究共性

  • 所有系统都将大型语言模型作为假设生成与优化的核心推理引擎。
  • 发现过程被构建为迭代闭环:假设、执行、分析、更新,映射科学方法。
  • 多智能体或模块化分解优于单体架构,以应对研究任务的复杂性。
  • 可复现性、证据可追溯性以及虚假声明的风险被公认为核心挑战。
  • 评估正转向更现实的、多步骤的基准测试,旨在衡量综合能力而非孤立组件准确率。

关键差异

  • 假设生成机制不同:一些采用结构化多智能体辩论,另一些使用带回溯的进化搜索,还有少数依赖结合强化学习的编程优化。
  • 人类参与程度从完全自主到七种不同干预模式,对于最优参与水平或时机尚无共识。
  • 评估目标是领域特定的:生物学、化学、材料科学、组合优化和方程发现,各自拥有不兼容的成功标准。
  • 架构粒度差异:有的系统在智能体间共享结构化世界模型,有的则保持智能体独立且共享状态极少。
  • 科学有效性的评判在自动化指标与人类专家判断之间分裂,对于如何权衡准确性、新颖性和可复现性尚未达成共识。

开放问题

  • 生成的假设能否在长自主周期内保持100%事实准确性,还是错误累积必然需要人工纠正?
  • 如何设计一个统一的评估协议,既能跨越生物学、化学和算法发现,又能捕捉真实世界的科学效用?
  • 在保证可靠性的前提下,最少需要多少人工干预,又不牺牲自主发现的速度?
  • 当前的自主研究工作流分类是否具有预测系统失效模式的能力,并能指导更安全、更稳健智能体的设计?
AICLLGGNMADLCENE

25 篇论文

Research Agent Benchmarks

Papers and resources related to Research Agent Benchmarks.

8 方法质量 92 近期性 41 可复现性 6 主题相关性

文献综述归纳

研究路线

动作条件控制与规划

使LLM智能体通过闭环决策和反馈执行多步研究动作——查询文献、生成假设、运行实验、自我纠正。

尚未覆盖:在开放式长周期任务中智能体决策的鲁棒性;性能提升来自更好的规划、更大的模型还是领域特定启发式;如何防止错误级联。
评测与证据设计

通过精心设计的基准、指标(如准确率、MAE改进)和受控任务设计(编码问题、综述生成、留出验证)标准化研究智能体的比较。

尚未覆盖:多样化科学领域的覆盖,代理指标与真实研究效用之间的一致性,以及对什么构成自主研究能力有效测试缺乏共识。
系统与可复现基础设施

将智能体工作流打包为可审计、可执行的流水线,产生可重用代码和工件,支持跨环境验证。

尚未覆盖:跨硬件、数据分布和用户设置的标准化外部验证;大多数系统缺乏超出报告实验的全面可复现工件。

研究共性

  • LLM作为研究智能体的核心推理和编码引擎。
  • 研究过程被分解为离散步骤(搜索、规划、编码、验证),并利用反馈信号引导智能体。
  • 评估应超越玩具任务,走向真实科学问题解决,尽管实现方式不同。
  • 可审计性和可复现性正成为研究智能体系统期望的属性。

关键差异

  • 评估方式:静态基准与预定义指标 vs. 动态留出任务迁移测量泛化能力。
  • 领域范围:部分工作针对特定科学领域(材料、数学),其他则瞄准通用研究智能体。
  • 智能体架构:基于强化学习的递归自改进 vs. 基于内部折叠验证的预定义搜索空间分解。
  • 可复现粒度:有些系统提供完整代码和审计日志,而其他仅描述方法无发布工件。

开放问题

  • 当前基准(如学术综述任务、编码问题)是否真正测量了自主研究的进展,还是仅奖励狭隘能力?
  • 在真实情况未知或随时间演化的开放式研究中,如何验证智能体决策质量?
  • 信任研究智能体发现所需的最低证据集(代码、数据、日志)是什么,如何跨领域标准化?

23 篇论文

Automated Experimentation

Papers and resources related to Automated Experimentation.

42 方法质量 86 近期性 40 可复现性 28 主题相关性

文献综述归纳

研究路线

端到端自主研究实验室

自动化从构思、文献分析到实验设计、执行和手稿撰写的完整研究管道,减少人类参与。

尚未覆盖:缺少实证验证及实现原型;依赖社区共识和资源投入;尚未证明在推荐系统或特定分子动力学任务之外的泛化能力。
数字孪生驱动的自主决策

预测实验结果、不确定性和风险,指导显微镜和自驱动实验室的自主操作,实现开放决策与协同优化。

尚未覆盖:验证局限于特定显微镜模态或简单颜色混合任务;噪声动力学和缺失物理机制仍导致预测残差;尚未展示对复杂科学问题的可扩展性。
基于LLM的推理与多智能体工作流

利用LLM智能体提出假设、编辑代码、评估新颖性并推理实验数据,实现偶然发现的操作化并提高采样效率。

尚未覆盖:LLM推理在分布偏移下的可信度和物理可接受性;多智能体协调的开销;缺乏科学推理的标准化基准。
数据质量与实验基础设施

通过噪声检测与纠正(kNN)和FAIR数据管道及自动索引,确保自驱动实验室的数据可靠性和可复现性。

尚未覆盖:方法对特征分布和噪声类型敏感;未在不同仪器模态上验证;依赖特定基础设施(如 nanoHUB)限制了采用。

研究共性

  • 集成物理约束或领域知识对于可靠的自主实验至关重要。
  • LLM 和基础模型正在成为自动化科学推理和实验规划的核心组件。
  • 数据质量、FAIR 原则和可复现性是部署自驱动实验室的关键瓶颈。
  • 需要标准化的基准和评估协议来比较不同的自主实验方法。

关键差异

  • 自动化范围:部分工作瞄准完全端到端自主,而其他工作保留人在环以进行关键决策或捕捉偶然发现。
  • 决策机制:显式模型(数字孪生)与不依赖显式状态表示的隐式 LLM 推理之间存在差异。
  • 应用领域:材料科学强调物理约束和多模态数据,推荐系统则面临公平性和治理挑战。
  • 人类指导的角色:SciLink 主动集成实时专家反馈,而 MLIPilot 和 AutoRecLab 旨在最小化人类干预。

开放问题

  • 如何设计统一的评估框架,平衡科学有效性、计算成本和可复现性,适用于多样化的自主实验系统?
  • LLM 推理轨迹在遇到训练分布之外的新颖物理现象时是否可靠?
  • 何种机制能确保自主实验室产生可重复、可验证的科学结果?
  • 在分布式协同自驱动实验室中,应如何管理数据所有权、隐私和治理?
  • 噪声检测与插补方法能否泛化到高度异构和分布外的实验数据?
LGAImtrl-sciCLdata-anchem-phCEIR

17 篇论文

Literature Review Agents

Papers and resources related to Literature Review Agents.

9 方法质量 87 近期性 37 可复现性 10 主题相关性

文献综述归纳

研究路线

面向代理的检索增强知识层

将文献数据库升级为AI代理可访问的知识层,能分解自然语言查询、执行实时搜索并提取证据,提升检索准确性和下游任务表现。

尚未覆盖:在策划搜索引擎(如Europe PMC)之外的泛化能力,以及依赖单一LLM编排器的脆弱性;缺乏系统在模糊或跨领域查询下行为的证据。
多代理文献综述生成

通过模拟人类工作流,使用专用代理进行大纲、写作、编辑和审阅,自动化生成结构化文献综述,提升可读性、引用质量和整体连贯性。

尚未覆盖:与专家综述相比的事实准确性和深度;评估依赖表面相似度和写作质量指标,而非下游效用或对合成主张的专家验证。
自动同行评审与鲁棒性分析

研究LLM代理在同行评审中的行为和脆弱性,揭示表面修改可操纵评审结果,以及对抗性攻击能破坏评审模型。

尚未覆盖:构建针对此类操纵的防御,确保自动评审的公平性和一致性,验证模拟评审动态是否反映真实人类评审过程。
迭代式与层次化文献组织

提供结构化或迭代的科学论文组织方式,通过层次聚类或迭代检索循环支持研究者导航和综合大量文献。

尚未覆盖:当前数据中缺乏详细的方法和评估证据;更好的组织方式能否直接转化为更高质量的文献综述这一假设尚未验证。

研究共性

  • 基于LLM的代理是实现文献综述任务自动化的可行主干,检索和生成步骤通过多步或多代理工作流进行编排。
  • 事实准确性和可靠性是所有系统共同面临的主要挑战,当前评估指标只能部分捕捉生成综述的质量。
  • 人类综述行为(如迭代精炼、组织和批判性评价)被用作代理工作流的设计模板。

关键差异

  • 自动化的主要目标不同:有的工作旨在改善面向代理的检索接口(信息获取),有的聚焦于生成最终综述文章(内容创作),还有的着眼于审计评审过程本身(元评估)。
  • 评估实践各异——引用F1、写作质量、与人类综述的相似度、攻击下的鲁棒性被孤立使用,缺少覆盖所有方面的共识基准。
  • 交互模式不同:实时在线搜索 vs. 离线批量生成,单代理编排 vs. 多代理协作,人在回路 vs. 完全自主运行。

开放问题

  • 如何在不依赖易受表面修改影响的启发式方法的情况下,验证自动生成综述中的主张是否得到引用证据的支持?
  • 哪些防御机制能使自动评审代理对对抗性论文具有鲁棒性,且如何设计这些防御而不泄露评审标准?
  • 在现有基准上观察到的检索或生成质量提升,在部署到不同科学领域或不同底层搜索索引时能否保持?
  • 什么样的评估协议能同时捕捉生成综述对人类研究者的效用和其主张的事实可信度,超越写作风格和引用重叠?
CL

13 篇论文

Paper Writing Agents

Papers and resources related to Paper Writing Agents.

1 方法质量 90 近期性 47 可复现性 6 主题相关性

文献综述归纳

研究路线

自动化论文起草与生成

从高层想法或大纲生成完整研究论文,减少人工写作负担。

尚未覆盖:生成内容的质量、原创性和事实可靠性;缺乏与人类撰写论文的标准化评估对比。
交互式写作辅助与辅导

在编辑器内提供实时反馈、修改建议和写作指导,提升草稿质量。

尚未覆盖:对不同写作风格和学科的适应性;对最终论文接收或可读性的可衡量影响。
论文评审与批判

生成或评估对科学论文的批判意见,旨在支持或自动化同行评审。

尚未覆盖:批判意见超越表面陈述的依据性;对细微方法论缺陷的覆盖及与实际审稿流程的整合。
多模态论文转换

将论文内容转换为海报、幻灯片或可视化摘要等其他格式。

尚未覆盖:设计质量、内容选取准确性和用户定制化;超越美学吸引力的评估。

研究共性

  • 所有工作均以大语言模型作为论文相关任务的核心推理引擎。
  • 广泛采用多智能体架构分解复杂的写作或分析流程。
  • 研究集中在2025–2026年,表明这是一个新兴但快速发展的领域。
  • 共同强调将工具集成到现有学术环境(如Overleaf)或提供可复现工件。

关键差异

  • 任务范围:部分系统瞄准端到端论文生成,其他则聚焦编辑、评审、海报创作或实验复现。
  • 自主程度:全自动生成对比人机协作的辅导或辅助。
  • 交互模式:编辑器内插件、独立框架或无直接用户交互的基准套件。
  • 评测目标:输出文本质量、批判依据性、复现成功率或检索召回率/精确率。

开放问题

  • 如何超越表面指标评估自动生成论文的创新性和科学贡献?
  • 何种机制能确保生成内容的事实准确性、恰当引用并避免抄袭?
  • 这些智能体在需要深厚领域知识或新颖实验设计的论文上表现如何?
  • 学术出版中的伦理影响和潜在滥用风险是什么,如何缓解?