Operator-on-F 补充价值等价性:一种用于潜在世界模型的规划时诊断
TLDR
提出operator-on-F诊断,测量潜在世界模型规划错误,其与回报损失的相关性优于奖励预测误差。
评分理由
Strengths: Novel diagnostic with strong empirical correlation (-0.90) to return loss, demonstrated on TD-MPC2 size sweep and cross-architecture comparison. Weaknesses: Limited to a single environment (cheetah-run) and small number of model sizes (n=5), lacking broader validation.
Read-first 评分解释
综合优先阅读分 38.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:255。
关键词评分
深度分析
创新点
- Operator-on-F:一种规划时诊断,在可观测子集F上比较模型的k步潜在前推与环境的前推,使用模型自身的预测器,补充价值等价性。
方法
该诊断在TD-MPC2模型大小扫描(cheetah-run任务)上进行评估,测量operator误差、奖励预测误差和贝尔曼残差。使用锚定自助法95%置信区间计算operator误差与回报损失之间的秩相关系数,并进行了TD-MPC2与纯SSL潜在世界模型之间的跨架构比较。
关键结果
奖励预测误差在不同模型大小间仅变化约3倍(0.028–0.091),与回报相关性弱(Spearman -0.30),而operator误差范围从0.28到2.62,与回报损失的相关性为-0.90(95%置信区间[-0.90, -0.70])。在317M参数时,operator误差飙升至2.62,规划回报降至0.9,尽管奖励误差仍保持在相同的狭窄范围内。
技术栈
TD-MPC2pure-SSL latent world modelcheetah-run