OPINE-World: 基于本体错误优先的交互式探索的程序化世界建模
TLDR
OPINE-World通过交互探索在线学习对象中心程序化世界模型,在ARC-AGI-3上评估。
评分理由
The paper presents a novel approach combining program synthesis with interactive exploration, addressing data efficiency and transfer. Strengths include a clear methodology and benchmark evaluation; weaknesses are limited scope (25 games) and potential scalability concerns.
Read-first 评分解释
综合优先阅读分 42.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:319。
关键词评分
深度分析
创新点
- 使用LLM代理从交互中在线学习以对象为中心的程序化世界模型
- 协作双代理循环:一个在环境中行动,另一个通过回放验证和基于模型的规划合成代码模型
- 由称为本体错误的贝叶斯对象类型充分性度量引导的探索
- 将程序合成的世界模型扩展到没有给定对象词汇的像素渲染环境
方法
OPINE-World是一个LLM代理,通过耦合两个代理在线学习以对象为中心的程序化世界模型:一个与环境交互,另一个使用回放验证和基于模型的规划合成代码模型。探索由贝叶斯本体错误度量引导。评估在ARC-AGI-3基准上进行,其中对象词汇、目标和动作语义被隐藏。
关键结果
OPINE-World在没有逐游戏训练的情况下解决了25个ARC-AGI-3游戏中的20个,并达到了78.4的动作效率分数,与人类基线相比。