一镜观多界:面向世界模型可解释性的能力类型化接口
TLDR
提出WorldModelLens,一种能力类型化接口,统一多种世界模型的可解释性方法。
评分理由
The paper identifies a genuine problem of fragmented interpretability tooling for world models and offers a principled interface solution. However, the abstract lacks empirical validation or real-world experiments, making it unclear how effective the proposed substrate is in practice.
Read-first 评分解释
综合优先阅读分 60.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 44。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:453。
关键词评分
深度分析
创新点
- 能力类型化接口,统一了多种世界模型架构(潜在循环、基于token、联合嵌入)的可解释性。
- WorldModelLens基础框架包含四个必需方法和可选头部,使强化学习和自监督模型成为一等公民,无需相互模仿。
- 单一的钩子和缓存层,通过接口暴露时间索引的激活、想象展开和干预回放。
方法
WorldModelLens定义了一个类型化接口,包含四个必需方法(encode, transition, initial state, sample)和通过能力描述符声明的可选头部(decode, reward, continue, actor, critic)。在该接口之上构建了一个钩子和缓存层,用于暴露时间索引的激活、想象展开和干预回放。这种设计使得可解释性方法可以一次性实现,并应用于不同的世界模型架构。
关键结果
摘要中未提及实验结果;论文介绍了接口设计及其预期优势。