RATIO
2026 数据集
数据集分析
RATIO是面向科学文献的检索基准,用Address/Broaden/Specify三种构思操作定义相关性,由远程监督和人工/LLM审查构建。
来源线索
来源:papers。
派生自论文:RATIO:面向科学文献中类型化构思操作检索的基准
关联论文
RATIO:面向科学文献中类型化构思操作检索的基准(人类)注意力(依然)是全部所需:人类监督使AI辅助的社会科学研究可靠1GC-7RC: 一张显卡——七大研究挑战!AI智能体做你的工作有多好?AI CFD科学家:面向开放的计算流体动力学发现,具有物理感知的AI智能体AI可以学习科学品味基于合成任务扩展的AI科学家AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究AI科学家作为发现引擎:在改革机构内发展的论证AI科学家产出结果但未进行科学推理AI-Supervisor:通过持久研究世界模型实现自主AI研究监督ARIS:基于对抗性多智能体协作的自主研究像真正的科研人员一样行动:一套评估前沿大语言模型及智能体框架在研究生命周期中表现的基准AgentJet:一种用于智能体强化学习的灵活群体训练框架自主型AI科学家并非为自主科学发现而构建基于潜在基础模型的参数化模拟PDE空间智能体探索Agentic-Ideation: 面向科学构思智能体的样本高效智能体轨迹合成科学新颖性度量评估的公理基准多智能体协作在自动化研究中的实证研究Author-in-the-Loop Response Generation and Evaluation: Integrating Author Expertise and Intent in Responses to Peer ReviewAutoFigure-Edit: Generating Editable Scientific IllustrationAutoResearch AI:面向科学发现的AI驱动研究自动化AutoResearchClaw:基于人机协作的自我强化自主研究AutoSOTA:一种用于发现最先进AI模型的端到端自动化研究系统AutoTrainess:教语言模型自主改进语言模型通过迭代元反思的自主科学发现超越作为助手的AI:迈向宇宙学中的自主发现BioInsight: 多智能体编排实现交互式生物医学知识发现BloClaw:一个全知、多模态的智能工作空间,用于下一代科学发现深度研究智能体能否检索与组织?利用专家分类体系评估综合差距CausalEvolve:基于因果暂存器的开放式发现Clarus:协调自主研究代理实现网络规模的科学协作Claw AI Lab:自主多智能体研究团队与AI科学家竞争:天体物理学研究的智能体驱动方法DOVA:以深思为先的多智能体编排实现自主研究自动化从结果数据中解析科学推理步骤以进行分子优化DeepSurvey-Bench: 评估自动生成科学综述的学术价值DeepSurvey:提升自动综述生成中的分析深度与引用可靠性用于LLM辅助临床手稿准备的确定性完整性门控:一种可审计的生物医学信息学架构算法师早期发现 I:大规模可证明算法合成的潜力测试时发现中的认知不确定性EurekAgent:智能体环境工程——自主科学发现的唯一关键EvoMaster:面向大规模智能体科学的基础演化智能体框架EvoScientist:迈向用于端到端科学发现的多智能体演化AI科学家FlowPIE: Test-Time Scientific Idea Evolution with Flow-Guided Literature Exploration从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法From Passive Generation to Investigation: A Proactive Scientific Peer Review AgentGIANTS: 从科学文献中生成性洞察预测大规模生成文献驱动的科学理论GoodPoint:从作者回复中学习建设性的科学论文反馈HLER:基于多智能体流水线的人机协同经济研究用于实证发现HalluCiteChecker:AI科学家时代中幻觉引用检测与验证的轻量级工具包利用AtomisticSkills进行代理式原子研究面向科学的可检查人工智能:生成式AI治理的研究对象方法Intern-Atlas:作为AI科学家研究基础设施的方法演化图通过竞争优化从多源数据集中联合发现控制偏微分方程LABBench2:面向AI系统进行生物学研究的改进基准测试LECTOR:科学推理图与引言生成的联合优化MIND:面向材料研究的AI合作科学家MVSS:多视角结构化综述生成的统一框架Many Heads Are Better Than One: Improved Scientific Idea Generation by A LLM-Based Multi-Agent System衡量AI代理的生物能力与风险NORA: 一个Harness工程化的端到端空间数据科学自主研究智能体NanoResearch:技能、记忆与策略的协同进化实现个性化研究自动化OR-Agent:连接进化搜索与结构化研究的自动化算法发现PRISM:通过智能仿真建模进行协议优化PRL-Bench:评估大语言模型在前沿物理研究中能力的综合基准PaperBanana:为AI科学家自动生成学术插图ProjectionBench:在渐进信息揭示下评估LLM的科学假设生成利用大语言模型和信息论量化天体物理方法的可重构性:光谱重建案例研究RESCORE:基于LLM的控制系统研究论文仿真恢复RbtAct: Rebuttal as Supervision for Actionable Review Feedback GenerationResearchEVO:面向自动化科学发现与文档撰写的端到端框架重新思考出版:面向人工智能赋能研究的认证框架重新思考AI科学家:面向科学发现的交互式多智能体工作流SciAtlas:面向自动化科学研究的大规模知识图谱SciCoQA: 科学论文与代码对齐的质量保证SciFig: Towards Automating Scientific Figure GenerationSciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse ParsingSciTrace:面向科学发现代理的轨迹感知安全推理用于高维物理系统中自主科学发现的苏格拉底式智能体SoundnessBench:你的AI科学家真的能区分好的和坏的研究想法吗?通过LLM驱动的跨学科灵感激发科学创造力SurveyLens:面向自动综述生成的多学科感知基准AI辅助研究中的校准转向:面向证据许可主张的概念与方法论框架TianJi-Environ: 用于大气环境研究的自主人工智能科学家迈向自动化科学评审:谷歌论文助手工具迈向AI研究的端到端自动化迈向医学AI科学家理解AI驱动的科学研究工具中的使用与参与:Asta交互数据集解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集AI科学家综述基于FAIR数据与计算基础设施的协作数字孪生AI Idea Bench 2025: AI Research Idea Generation Benchmark缺乏强大实现能力的AI科学家难以成功AI城市科学家:面向城市研究的多智能体协同自动化人工智能用于科学发现是一个社会问题AI驱动的自动化可成为下一代科学学研究的基础AISSISTANT:数据科学中的人机协作综述与展望研究工作流ARISE:基于智能体评分准则的迭代式调查引擎,用于自动生成学术论文自主目标演化代理加速科学发现面向科学发现的智能体人工智能:进展、挑战与未来方向综述Agentic AutoSurvey: 让LLMs综述LLMs面向材料发现的推理大语言模型对齐:基于物理感知的拒绝采样AutoEmpirical:基于LLM的实证软件故障分析自动化研究AutoSurvey2:赋能研究人员的下一代自动化文献综述Bayes-Entropy Collaborative Driven Agents for Research Hypotheses Generation and Optimization超越优化:探索自主实验中的新颖性发现Bohrium + SciMaster:构建规模化智能体科学的基础设施与生态系统BoxingGym:自动化实验设计与模型发现进展的基准测试构建你的个性化研究团队:一个用于持续和交互式科学自动化的多智能体框架CASCADE: 通过自主开发与进化实现累积性智能体技能创造大型语言模型能否充分执行时间序列上的符号推理?Citegeist: Automated Generation of Related Work Analysis on the arXiv Corpus基于迭代工作流的深度文献综述自动化DeepScientist: 逐步推进前沿科学发现动态知识交换与双多样性评审:简洁释放多智能体研究团队的潜力使AI科学家能够识别创新:一种评估新颖性的领域无关算法评估Sakana的AI科学家:大胆的宣称、混合的结果,以及有希望的未来?LLMs在科学创新中角色的演变:助手、合作者、科学家和评估者使用好奇心驱动的人工智能科学家探索Flow-Lenia宇宙:发现多样化的生态系统动力学探索kNN噪声特征检测与恢复在自驱动实验室中的局限性从AutoRecSys到AutoRecLab:呼吁构建、评估和治理自主推荐系统研究实验室HybridQuestion:人机协作识别高影响力研究问题通过IS成功模型评估已部署的LLM调查创建工具的影响使用Graph-PReFLexOR的原位图推理与知识扩展InteractiveSurvey:基于LLM的个性化与交互式综述论文生成系统初级AI科学家及其风险报告:基于基线论文的自主科学探索利用预训练大语言模型进行物理信息符号回归的知识集成Kosmos:用于自主发现的人工智能科学家LLM×MapReduce-V3: 通过MCP驱动的分层模块化智能体系统实现交互式深度综述生成LLaMEA-BO:一种用于自动生成贝叶斯优化算法的大语言模型进化算法Large Language Models for Scientific Idea Generation: A Creativity-Centered SurveyLiRA:一个用于生成可靠且可读文献综述的多智能体框架MIR:面向科学研究问题的方法论灵感检索机器学习驱动的材料发现:解锁下一代功能材料——综述MegaScience:推动科学推理的后训练数据集前沿Meow:面向自动学术综述的端到端大纲写作MirrorMind:利用人类科学家的专家视角和集体知识赋能OmniScientist用于设计引力波探测器的神经代理模型OmniScientist:迈向人类与AI科学家共同进化的生态系统OpenLens AI:面向健康信息学的全自主研究代理实现偶然发现的操作化:基于理论在环的多智能体AI工作流用于增强材料表征PhysMaster:构建自主AI物理学家进行理论和计算物理研究PiFlow:基于原则感知的多智能体协作科学发现立场:智能科学实验室需要认知与具身人工智能的融合REMOR: Automated Peer Review Generation with LLM Reasoning and Multi-Objective Reinforcement LearningResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task DecompositionRobin:一个用于自动化科学发现的多智能体系统SGSimEval:面向自动综述生成系统的全面多维度与相似性增强基准SR-Scientist:基于智能体AI的科学方程发现SafeScientist:面向风险感知的LLM智能体科学发现人工智能与机器人科学家在科学发现中的缩放定律SciSage: 一个用于高质量科学综述生成的多智能体框架SlideGen: Collaborative Multimodal Agents for Scientific Slide GenerationSpark: A System for Scientifically Creative Idea Generation面向科学的规范驱动AI:用于自动化和可重复数据分析的ARIA框架AI驱动发现中统计严谨性的结构性强制:一种函数式架构SurGE:科学综述生成的基准与评估框架SurveyEval:面向LLM生成学术综述的全面评估SurveyForge:关于自动调查写作的大纲启发式、记忆驱动生成和多维评估SurveyG:基于层次化引用图的多智能体大语言模型框架用于自动综述生成SurveyGen-I: 基于演化规划与记忆引导的连贯科学综述生成SurveyGen:基于质量感知的大型语言模型科学综述生成SurveyX:基于大语言模型的学术综述自动化TaxoAlign:使用语言模型生成学术分类法AI科学家-v2:通过智能体树搜索实现工作坊级别的自动化科学发现自动化越多,所见越少:AI科学家系统的隐藏陷阱有德机器:迈向人工通用科学aiXiv:由AI科学家生成的下一代开放获取科学发现生态系统“图灵测试”用于人工智能科学家AiSciVision:一种将大型多模态模型专用于科学图像分类的框架BioKGBench: 面向生物医学科学的AI智能体知识图谱检查基准CycleResearcher:通过自动化评审改进自动化研究以AI代理赋能生物医学发现间歇性、异步专家反馈对贝叶斯优化有多大用处?指导大语言模型逐步生成科学文献综述扫描探针显微镜与高性能计算的集成:固定策略和奖励驱动工作流的实现LiveIdeaBench: Evaluating LLMs' Scientific Creativity and Idea Generation with Minimal ContextMARG: Multi-Agent Review Generation for Scientific PapersMLR-Copilot: 基于大语言模型代理的自主机器学习研究MatPilot:人机协作框架下基于大语言模型的AI材料科学家含噪声测量:贝叶斯优化在自动化实验中协同优化噪声与属性发现ResearchAgent:基于大型语言模型的科学文献迭代研究思路生成Reviewer2: Optimizing Review Generation Through Prompt GenerationAI科学家的风险:优先考虑安全保障而非自主性迈向由人工智能科学家团队从基因表达数据中进行科学发现AI赋能科研:科学如何从人工智能中获益的十种方式AutoNMT:简化序列到序列模型研究的框架ChatGPT能否用于生成科学假设?深度学习在扫描透射电子显微镜自动化实验中的应用大型语言模型在维基百科风格综述生成中的应用:NLP概念评估SciMON: Scientific Inspiration Machines Optimized for Novelty基于最小指导的语言模型自主假设验证探索图原生强化学习通过概念重组实现可追溯的科学假设生成基于文献锚定的自主研究:从语料库到前沿计算物理学论文的容错LLM流水线ResearchStudio-Idea: 基于ML会议成果的可循证研究构思技能套件ResearchStudio-Reel:自动化研究从论文到海报、视频和博客的最后一英里重新思考智能体时代的科学发现学习触发:大型强子对撞机中的强化学习在智能体时代重新思考科学发现FirstResearch:面向LLM科学发现代理的可审计问题形成框架从闭环优化到开放决策:用于预测性和自主显微镜的耦合数字孪生Bibby AI:一个编辑器原生的学术研究、写作与出版智能平台CausalDS:数据科学智能体中的因果推理基准测试思想有基因组:科学谱系推理与基于谱系的创意生成基准测试科学发现的进化智能:从进化计算到累积发现系统迈向可审计的AI科学家:面向LLM智能体的假设演化协议GAE:通过强化优化实现科学发现的图增强进化LLMs是否准备好进行科学发现?面向AI科学家能力导向的基准测试NVAITC AI科学家:一个受管控的端到端研究系统——高血压GWAS案例研究迈向自主且可审计的医学影像模型开发OpenResearcher:一种完全开放的长周期深度研究轨迹合成流水线GigaWorld-Policy-0.5:一种由AutoResearch赋能的速度更快、性能更强的世界动作模型ReasFlow:基于知识的多智能体系统辅助应用数学中以推理为中心的科学发现材料自动研究:具有留出迁移的可审计AI科学家工作流程PEARL:面向科学推理图提取的可审计修复SciForma: 保持结构忠实性的科学示意图生成可执行因果研究管线的自动合成与对抗验证IDEAgent:用于研究想法生成的智能体质量-多样性搜索多智能体自动化研究系统的词汇表CausalForge:一个基于形式化基础、自我改进的智能体框架,用于因果推断的自动化研究OmniQEC: discovering practical quantum error-correcting codes by an AI scientistLabEvolver:无需训练的经验演化用于安全且具身化的湿实验室智能体Deep Research 是否可靠?误导性知识导致错误结论面向回合级智能体强化学习的科学发现环境扩展EMBL AI Librarian:面向AI代理的生命科学知识层RecHarness: 一种基于Bandit路由的智能代理框架用于自进化推荐系统DeepCode:开放自主编码无攻击者的博弈:选择压力下LLM驱动的搜索中的基准指纹识别AutoWorldModel-Bench:面向自动世界模型研究的以状态为中心的基准Spark-to-Paper:作为可组合技能的端到端研究论文生成DSAgentBench:智能体能否在真实计算机环境中自动化端到端数据科学工作流?再花一个Token不值得:高效深度研究智能体的边际价值估计不漂移的 AI 科学家:四足导航研究循环中的品味、结构与可证伪发现对抗性快速变化的真实世界领域作为基准测试AI科学家能力的测试平台EviGraph:证据引导的自主研究智能体能力门控规划:目标成本发现与短视实验选择的局限Agentic Auto-Research is Fuzz TestingMechanist:将AI作为科学仪器以发现智能的机制OmniScientist:全模态全学科AI科学家Intern-S2-Preview:科学智能体基础模型修辞如何对AI审稿人实施奖励黑客?——解析基于AI的同行评审中的修辞敏感性How Do Agents Fail on AutoResearch: End-to-End Diagnostic Evaluation on 100 Real-World Frontier Research Tasks大型发现模型:基于实证的模型化开放式搜索问题在于问题:迈向可扩展的数学发现ASI-Bench:超级人工智能的黎明AutoResearch:洞察入,幻觉出FrontierChallenge:评估科学工作流完成度开放世界多智能体环境中的自主数学发现AI科学家的过去与未来SGHA:利用本地语言模型进行基于证据的研究问题发现Symposium:通过可审计记录为AI科学家智能体社区建立信任HypoForge:一种通过科学技能学习实现自动假设生成与测试的自改进多智能体框架社会科学研究设计追踪与评估Learning to Evaluate Before Improving: Automatic Rubric Induction for Automatic Research AgentsPaperGym:以评分标准为中心的科研计划生成进化框架自动化研究者能够可靠地缓解对齐失败