BenchCAD:面向程序化CAD的全面、行业标准基准测试
TLDR
BenchCAD包含17900个CadQuery程序,覆盖106个工业零件族,用于评估多模态LLM的程序化CAD能力。
评分理由
Strengths include a large, execution-verified dataset spanning diverse industrial parts and multiple evaluation tasks (VQA, code QA, image-to-code, editing). Weaknesses are the focus on a single CAD scripting language (CadQuery) and the lack of coverage for other representations like B-Rep or CSG, limiting generalizability.
Read-first 评分解释
综合优先阅读分 66,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 89。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:7。
关键词评分
深度分析
创新点
- 提出了BenchCAD,一个统一的工业CAD推理基准,包含来自106个工业零件族的17,900个经过执行验证的CadQuery程序。
- 多任务评估框架,涵盖视觉问答、代码问答、图像到代码生成和指令引导的代码编辑。
- 对模型在感知、参数抽象和可执行程序合成方面的能力进行细粒度分析。
方法
BenchCAD包含来自106个工业零件族的17,900个经过执行验证的CadQuery程序。它通过四个任务评估多模态大语言模型:视觉问答、代码问答、图像到代码生成和指令引导的代码编辑。测试了10多个前沿模型,并进行了额外的微调和强化学习实验,以评估分布内和分布外性能。
关键结果
前沿模型通常能恢复粗略的外部几何形状,但无法生成忠实的参数化CAD程序,缺失精细的三维结构、误解设计参数,并将扫掠、放样等复杂操作替换为更简单的草图-拉伸模式。微调和强化学习能提升分布内性能,但对未见零件族的泛化能力仍然有限。
局限性
- 即使在微调和强化学习后,对未见零件族的泛化能力仍然有限。
技术栈
CadQueryMultimodal Large Language Models (MLLMs)Fine-tuningReinforcement Learning