探究规模对Atari上数据高效通用Transformer世界模型的影响
TLDR
分析Atari 100k上最小Transformer世界模型的缩放行为,揭示不同缩放机制与联合训练优势。
评分理由
Strengths include systematic scaling analysis and clear demonstration of joint training benefits; weaknesses are limited scope to Atari and offline expert data, lacking real-world validation.
Read-first 评分解释
综合优先阅读分 65.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:387。
关键词评分
深度分析
创新点
- 将模型规模对世界模型的影响与架构机制独立分离
- 识别出Atari环境中不同的缩放机制,部分环境越过插值阈值,其他则停留在经典机制
- 表明多环境联合训练稳定了缩放动态,确保所有环境(无论其固有缩放机制如何)都能获得单调增益
- 证明世界模型保真度的提升直接转化为下游控制性能
方法
本研究使用最小化Transformer世界模型,在Atari 100k基准上基于预设专家策略的固定离线数据集进行训练。分别分析单个任务和统一设置(单个Transformer在26个Atari环境上训练)下的缩放行为。通过完全在模拟动态中学习的策略评估下游控制性能,结果以中位数专家-随机归一化分数报告。
关键结果
单个环境表现出不同的缩放机制:部分在过参数化区域呈现单调改进,而其他环境随着模型增大性能下降。在26个环境上的联合训练稳定了缩放,所有环境均获得单调增益。最佳下游策略达到中位数专家-随机归一化分数0.770。
局限性
- 依赖于预设专家策略的固定离线数据集,限制了向其他数据源的泛化
- 评估局限于Atari 100k基准,可能无法反映更广泛的环境
- 仅关注Transformer世界模型和规模,未探索架构创新或其他模型家族