通过大型语言模型的测试时扩展生成符号世界模型
TLDR
通过测试时扩展,LLMs生成符号世界模型(PDDL领域),无需额外训练即超越o1-mini。
评分理由
The paper introduces a novel method using Best-of-N sampling and verbalized ML to generate PDDL domains, achieving over 50% success rate on two tasks. Strengths include no need for extra training and clear outperformance of a strong baseline. Weaknesses are limited task scope and lack of real-world evaluation.
Read-first 评分解释
综合优先阅读分 42,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 29。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:361。
关键词评分
深度分析
创新点
- 扩展LLMs的测试时计算以增强PDDL推理能力,无需额外训练
- 结合Best-of-N采样与言语化机器学习优化,生成高质量PDDL领域
方法
该方法通过扩展LLMs的测试时计算来改进PDDL领域生成。首先使用Best-of-N采样生成初始解,然后通过言语化机器学习以细粒度方式优化解。该方法无需额外训练,并利用PDDL作为形式化规划抽象。
关键结果
该方法显著优于o1-mini,在两个任务(从自然语言描述或PDDL问题生成PDDL领域)上实现了超过50%的成功率。在几乎所有竞赛级规划任务上,该方法也优于当前最先进的方法。