ARISE:基于智能体评分准则的迭代式调查引擎,用于自动生成学术论文
TLDR
ARISE利用专用LLM智能体和评分准则引导的迭代优化自动生成高质量学术综述论文。
评分理由
The paper presents a novel modular architecture with role-specific agents and a structured feedback loop, achieving strong quantitative results. However, it focuses narrowly on survey generation rather than broader scientific discovery, and the abstract lacks details on limitations or generalizability.
Read-first 评分解释
综合优先阅读分 73.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 67。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:47。
关键词评分
深度分析
创新点
- 基于智能体评分准则的迭代优化循环,包含多个评审智能体
- 模块化架构,由专门的大语言模型智能体模拟不同学术角色(主题扩展、引文管理、总结、起草、同行评审)
- 用于结构化多智能体评估的基于行为的评分准则
方法
ARISE采用模块化智能体系统,其中LLM智能体执行不同的学术任务,并通过一个基于评分准则的迭代优化循环,多个评审智能体使用结构化的、基于行为的评分准则评估草稿,综合反馈以改进手稿。评估将ARISE与最先进的自动化系统和近期人类撰写的综述进行比较。
关键结果
ARISE实现了平均评分准则对齐质量得分92.48,在全面性、准确性、格式和学术严谨性方面持续优于基线方法。
技术栈
Large Language Models (LLMs)Agentic systemsRubric-guided evaluationIterative refinement