Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

LLM作为评判者:迈向榜单推荐系统的世界模型

arXiv 25.11 2025 42.7 method

TLDR

LLM通过成对推理充当榜单推荐世界模型,跨任务数据集实证支持。

评分理由

The paper provides empirical evidence for using LLMs as world models in a specific domain (slate recommendation), which is a strength. However, it is limited to this narrow application and does not address broader world model capabilities or real-world deployment.

Read-first 评分解释

综合优先阅读分 42.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 10。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、数据集、结果

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

主题相关性 42%
14.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:397。

关键词评分

world model
10
world simulator
0
generative world model
0
interactive world model
0
video world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • LLM-as-a-Judge方法用于榜单推荐系统
  • 对榜单进行成对推理以建模用户偏好
  • 对LLM在三个榜单推荐任务上的实证分析

方法

作者使用多个大型语言模型(LLM)在三个跨越不同数据集的任务上进行实证研究。他们通过榜单上的成对推理评估LLM充当用户偏好世界模型的能力,分析任务性能与偏好函数属性之间的关系。

关键结果

研究揭示了任务性能与LLM捕获的偏好函数属性之间的关系,指出了改进方向,并突出了LLM作为推荐系统中世界模型的潜力。

局限性

  • 该研究是探索性的,并未提供完整的榜单推荐世界模型
  • LLM的性能因偏好函数属性而异,表明需要进一步改进
  • 仅限于三个任务和数据集;跨领域的泛化性尚未确立

标签