Awesome Auto Research Hub 论文 · 数据集 · 项目
← 返回论文列表

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

arXiv 2026 62.8 method

TLDR

POISE是一个闭环框架,利用LLM代理自主发现改进的语言模型策略优化算法。

评分理由

The paper presents a novel automated discovery framework (POISE) with strong empirical results on mathematical reasoning tasks, demonstrating significant improvements over GRPO. However, the abstract lacks details on the generalizability to other domains and the computational cost of the iterative process.

Read-first 评分解释

综合优先阅读分 62.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 72。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、评估、实验、验证

主题相关性 42%
60

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:AI scientist、automated scientific discovery、autonomous research agent、automated research、literature review agent、survey generation、automated experimentation、experiment design agent、AI for scientific research、paper writing agent、research automation、scientific discovery agent

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:25。

关键词评分

automated scientific discovery
9
automated experimentation
9
AI scientist
8
automated research
8
AI for scientific research
8
research automation
8
scientific discovery agent
8
autonomous research agent
7
experiment design agent
7
literature review agent
0
survey generation
0
paper writing agent
0

深度分析

创新点

  • POISE:一个用于自动发现语言模型策略优化算法的闭环框架
  • 结构化的、具有谱系关联的档案,将提案、实现、评估和反思联系起来,以支持基于证据的迭代
  • 发现优于GRPO的分析方差缩放和有效性掩码机制

方法

POISE迭代地生成、实现、评估和反思候选策略优化算法,使用结构化档案指导对与训练动态耦合的算法机制进行基于证据的搜索。从GRPO开始,它在数学推理任务上评估了64个候选算法。

关键结果

最佳发现变体将加权Overall从47.8提高到52.5(+4.6),并将AIME25 pass@32从26.7%提高到43.3%,优于GRPO基线。

技术栈

LLM agentsGRPOPOISE

标签

CL