Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Nous:一种用于长期智能体记忆的预测世界模型

arXiv 2026 49.4 method

TLDR

Nous采用预测世界模型作为智能体记忆,存储信念更新而非事实,在对话基准上取得优异表现。

评分理由

The paper introduces a novel memory architecture based on predictive world models and Bayesian surprise, with empirical evaluation on the LoCoMo benchmark. Strengths include a principled approach to forgetting and identity resolution; weaknesses include limited scope to conversational memory and reproducibility concerns in baseline comparisons.

Read-first 评分解释

综合优先阅读分 49.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 10。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
94.6

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.94582622

方法质量 18%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标、结果

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:工件

主题相关性 29%
14.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:358。

关键词评分

world model
10
world simulator
0
generative world model
0
interactive world model
0
video world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 基于“知识即预测而非存储”原则的预测性世界模型
  • 每个实体-属性对对应的分类概率分布(维度)
  • 通过信息论惊奇度 S = -log2 P(obs | D) 对观测进行评分,并利用闭式贝叶斯后验更新分布
  • 存储的是信念从先验到后验的偏移量(delta),而非事实本身
  • 通过熵向均匀分布衰减实现自然遗忘
  • 通过实体维度集之间的互信息进行身份消歧

方法

Nous 维护一个预测性世界模型,该模型由对话中观察到的每个实体-属性对对应的分类概率分布(维度)集合构成。新观测通过惊奇度 S = -log2 P(obs | D) 进行评分,并通过闭式贝叶斯后验更新分布,仅存储先验到后验的偏移量(delta)。遗忘通过熵向均匀分布衰减自然产生,身份消歧则利用实体维度集之间的互信息。该模型在 LoCoMo 基准(10 段对话,1,540 个问题)上使用 GPT-4o-mini 作为骨干模型进行评估,采用单跳、多跳、时序和开放域类别的 F1 指标,并与 A-MEM 和 BeliefMem 进行比较。

关键结果

Nous 在 LoCoMo 基准上取得了 F1 分数:单跳 63.50、多跳 55.32、时序 58.57、开放域 62.50。在四个类别中的三个上相比 A-MEM 有显著提升,并在所有四个类别上超过 BeliefMem 自报的数值,但由于可复现性和评估流程差异,比较结果存在局限性。

局限性

  • 可复现性问题:A-MEM 结果的独立引用在类别分配上存在分歧,作者对此进行公开讨论而非单方面解决
  • 评估流程中未受控的差异导致与 BeliefMem 的比较并非完全受控

技术栈

GPT-4o-miniLoCoMo benchmark

标签

agent memoryworld modelBayesian inferencepredictive codinginformation theoryforgettingAICL