Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

先模拟后规划:构建内在用户世界模型以实现用户定制对话策略规划

SIGIR 25 2025 50.7 method

TLDR

提出UDP框架,利用扩散模型和布朗桥构建内在用户世界模型,实现用户定制对话策略规划。

评分理由

Strengths include addressing the overlooked role of user characteristics in dialogue policy planning and introducing a novel three-stage framework. Weaknesses are the lack of real-world experimental validation and limited generalizability beyond dialogue tasks.

Read-first 评分解释

综合优先阅读分 50.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 31。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验、结果

主题相关性 42%
44.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:366。

关键词评分

world model
8
generative world model
6
world simulator
5
interactive world model
5
model-based reinforcement learning world model
4
world dynamics prediction
3
video world model
0

深度分析

创新点

  • 用于用户定制对话策略规划的内在用户世界模型
  • 三阶段UDP框架:用户画像描绘(扩散模型)、用户反馈预测(基于布朗桥的预测器)、用户定制策略规划
  • 在训练中优先处理具有挑战性用户画像的主动学习方法

方法

本文首先利用任务特定的用户画像进行了一项全面研究,评估现有对话策略规划方法,揭示其局限性。随后提出了UDP框架,该框架包含一个内在用户世界模型。UDP分三个阶段运行:(1)用户画像描绘,使用扩散模型动态推断用户画像;(2)用户反馈预测,使用基于布朗桥的预测器预测用户反应;(3)用户定制策略规划,整合这些洞察以优化响应策略。进一步提出了一种主动学习方法,在训练中优先处理具有挑战性的用户画像。在包含协作和非协作设置的基准上进行了实验。

关键结果

全面实验证明了UDP在学习用户特定对话策略方面的有效性,验证了该协议的实用性,并凸显了UDP的鲁棒性和适应性。

标签