错误设计意图比没有更糟糕:CAD程序补全中头部条件化的Derangement-Control诊断
TLDR
测试LLM在CAD生成中是否读取设计意图头;错误头损害性能,但错乱控制表明效应需学习映射。
评分理由
Strengths include rigorous experimental design with causal controls, multiple seeds, and pre-registered conditions. Weaknesses are limited to a single model and dataset, and the abstract cuts off before discussing limitations or broader applicability.
Read-first 评分解释
综合优先阅读分 64.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 86。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:5。
关键词评分
深度分析
创新点
- 因果错乱控制(打乱头信息),将学习到的头到程序映射与边际分布偏移分离
- 通过可执行几何断言对B-rep实体进行独立评估,打破与基于正则表达式的头提取器的循环性
- 预注册的三种子实验设计,交叉前缀长度和头类型,以诊断头条件化
方法
使用LoRA微调Qwen2.5-Coder-1.5B,在CadQuery程序上附加五特征CADCON头,然后在预注册的{0%, 40%}前缀×{正确, 错误, 遮罩}头矩阵下,用三个种子进行评估。通过生成B-rep实体上的几何断言评分一致性,并使用打乱真实头训练的错乱模型作为因果控制。
关键结果
错误头显著降低多边形和薄几何意图下的一致性,低于无头基线,而错乱控制则不受影响(3/3种子交互显著,p ≤ 4.2×10^{-3})。独立指标将正确头的表面收益从+0.21降至+0.02,揭示指标循环性。
局限性
- 圆形和高设计意图在该检查点处于基线生成下限(~0),因此对对比无信息量
- 损害具有条件特异性:在0%前缀下,无条件基线无法生成有效CAD,因此结果仅适用于条件完成
- 研究限于单一模型(Qwen2.5-Coder-1.5B)和一个CAD程序领域