SIMMER:使用世界模型对LLM可执行规划中的潜在故障进行基准测试
TLDR
SIMMER用符号世界模型评估LLM规划中的潜在故障,发现高故障率,反事实模拟可减少故障。
评分理由
The paper addresses an overlooked failure type (latent failures) with a well-defined symbolic world model grounded in real-world cooking scripts, providing clear quantitative results across six LLMs. However, the benchmark is limited to a single domain (kitchen) and uses a symbolic rather than generative or video-based world model, which may limit generalizability.
Read-first 评分解释
综合优先阅读分 53,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 31。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:383。
关键词评分
深度分析
创新点
- 提出SIMMER,首个专门评估LLM规划中潜在故障的基准,这类故障不会立即中止执行但暗中破坏目标达成。
- 定义了基于厨房领域的人工策划符号世界模型,包含77个动作、262个独特对象和约46,800种从真实烹饪脚本导出的语义真实交互。
- 采用状态机执行器,根据世界模型验证计划并检测三类故障:即时前提违规、潜在危害和不可逆故障。
- 证明通过反事实前瞻模拟进行显式状态推理可将潜在故障减少高达72%,不可逆案例减少高达75%,为更鲁棒的LLM规划器提供了有前景的方向。
方法
SIMMER构建了一个针对厨房领域的人工策划符号世界模型,包含77个动作、262个独特对象和约46,800种从真实烹饪脚本导出的可能交互。状态机执行器根据该世界模型验证LLM生成的计划,检测即时前提违规、潜在危害和不可逆故障。该基准评估了六个LLM生成无错误计划的能力,并衡量潜在故障的普遍性。
关键结果
即使是前沿模型,无错误计划最多仅占17%,且高达56%的计划包含潜在故障,其中大多数导致不可逆后果。反事实前瞻模拟将潜在故障减少高达72%,不可逆案例减少高达75%。
局限性
- 该基准仅限于厨房领域,可能无法推广到其他家庭或真实环境。
- 世界模型是符号化且人工策划的,可能遗漏真实物理的细微差别和未建模的交互。
技术栈
LLMs (如GPT-4, Llama)SIMMER基准符号世界模型状态机执行器反事实前瞻模拟