一生学习:从无引导探索中推断随机环境的符号世界模型
TLDR
提出OneLife框架,通过条件激活的程序化法则在有限交互下学习随机环境的符号世界模型。
评分理由
The paper addresses a challenging setting (stochastic, one-life exploration) and proposes a novel probabilistic programming approach. Strengths include a new evaluation protocol and handling of sparse rule activation; weaknesses include reliance on a simulated environment (Crafter-OO) and lack of real-world validation.
Read-first 评分解释
综合优先阅读分 60.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:316。
关键词评分
深度分析
创新点
- OneLife框架,在概率编程框架内通过条件激活的程序化法则对世界动态进行建模
- 动态计算图,仅通过相关法则路由推理和优化,避免了扩展挑战
- 新的评估协议,衡量状态排序(区分合理与不合理未来状态)和状态保真度(生成逼真的未来状态)
- Crafter-OO,对Crafter环境的重实现,具有结构化的面向对象符号状态和纯转移函数
方法
OneLife使用具有前提-效果结构的条件激活程序化法则,在概率编程框架中构建动态计算图,仅通过当前状态相关的法则路由推理和优化,从而在稀疏激活下学习随机动态。该框架在Crafter-OO上使用最少的无引导交互数据进行评估,以强基线(可能是神经网络)为对照,并采用状态排序和状态保真度指标。
关键结果
OneLife在23个场景中的16个上,在状态排序和状态保真度方面优于强基线。使用学习模型进行的模拟轨迹成功识别出更优策略,展示了规划能力。
局限性
- 依赖于结构化的面向对象符号状态表示,限制了在缺乏此类结构的环境中的适用性
- 仅在Crafter-OO上进行评估,未展示对其他复杂随机环境的泛化能力
- “一生”约束可能导致状态空间覆盖不完整,仅学习关键动态,可能遗漏罕见或复杂的转移
- 未解决向更大状态空间或更复杂层次动态的扩展性问题