预训练智能体与世界模型的缩放定律
TLDR
论文展示了世界建模和模仿学习中的幂律与语言建模类似,其系数受分词器、任务和架构影响。
评分理由
Strengths: Provides precise characterization of scaling laws for world models and imitation learning, extending insights from language modeling. Weaknesses: Abstract lacks details on experimental setup and real-world validation; limited to theoretical analysis without concrete results.
Read-first 评分解释
综合优先阅读分 50.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 29。
研究版图角色
方法锚点
排序敏感性
稳定性:volatile;排名波动范围:296。
关键词评分
深度分析
创新点
- 证明了与语言建模类似的幂律也支配着世界建模和模仿学习,特别是在损失与最优模型大小之间。
- 揭示了这些缩放定律的系数受分词器、任务和架构的显著影响,为模型和数据的最优规模提供了细致指导。
方法
本文使用离线数据集上的生成式学习目标预训练具身智能体,建模智能体行为(模仿学习)或环境(世界建模)。然后通过系统变化模型参数、数据集大小和计算量来表征缩放定律,拟合损失与最优模型大小之间的幂律关系。
关键结果
在世界建模和模仿学习中都观察到了与语言建模类似的幂律,但这些定律的系数因分词器、任务和架构的不同而显著变化,从而影响最优资源分配。
局限性
- 缩放定律系数并非通用,且受分词器、任务和架构的具体选择显著影响,限制了跨设置的直接迁移性。
- 该分析基于离线数据集和生成式目标;未涉及在线或其他学习范式的适用性。