Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

外科医生距离手术世界模型还有多远?一项关于零样本手术视频生成与专家评估的初步研究

arXiv 25.11 2025 58.5 benchmark, application

TLDR

一项评估零样本手术视频生成的初步研究,揭示了视觉质量与因果理解之间的合理性差距。

评分理由

The paper introduces a novel benchmark (SurgVeo) and evaluation framework (SPP) for surgical video generation, with expert surgeon assessment. Its strengths include a systematic evaluation and quantitative evidence of limitations, but weaknesses are the pilot nature, limited scope (two procedures), and lack of proposed model improvements.

Read-first 评分解释

综合优先阅读分 58.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、结果

主题相关性 42%
57.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:212。

关键词评分

world model
9
video world model
9
generative world model
8
world simulator
6
world dynamics prediction
5
interactive world model
2
model-based reinforcement learning world model
1

深度分析

创新点

  • SurgVeo:首个由专家策划的手术视频生成模型评估基准
  • 手术合理性金字塔(SPP):一个新颖的四层框架,用于从基本外观到复杂手术策略评估手术视频合理性
  • 首次定量证据表明手术AI中视觉上令人信服的模仿与因果理解之间存在'合理性差距'

方法

作者引入了SurgVeo,一个由专家策划的包含腹腔镜和神经外科手术片段的手术基准,以及手术合理性金字塔(SPP),一个四层评估框架(视觉感知、器械操作、环境反馈、手术意图)。他们让Veo-3基础模型对这些片段进行零样本预测,并由四位委员会认证的外科医生组成的专家组根据SPP层级对生成的视频进行评估。

关键结果

Veo-3在视觉感知合理性方面表现出色,但在SPP更高层级(器械操作合理性、环境反馈合理性和手术意图合理性)上严重失败,揭示了视觉模仿与因果理解之间存在明显的'合理性差距'。

局限性

  • 初步研究范围有限(仅涉及两个手术领域:腹腔镜和神经外科)
  • 仅评估了一个基础模型(Veo-3),未与其他视频生成模型进行比较
  • 零样本设置可能无法反映微调或领域自适应模型的性能
  • 专家小组规模较小,仅四位委员会认证的外科医生,可能限制评估的泛化性
  • 未明确讨论评估者间信度或合理性差距的统计显著性

标签