CAD-Coder:用于计算机辅助设计代码生成的开源视觉语言模型
TLDR
CAD-Coder是一个开源视觉语言模型,通过微调从图像生成可编辑的CAD代码,性能优于GPT-4.5和Qwen2.5-VL-72B。
评分理由
The paper introduces a novel dataset and demonstrates strong results with 100% valid syntax and high 3D similarity, but generalizability claims are limited to 'some signs' and real-world evaluation details are sparse in the abstract.
Read-first 评分解释
综合优先阅读分 65.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 99。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:14。
关键词评分
深度分析
创新点
- CAD-Coder:一个开源视觉语言模型,通过微调直接从视觉输入生成可编辑的CAD代码(CadQuery Python)。
- GenCAD-Code数据集:一个包含超过16.3万个CAD模型图像与代码对的新颖数据集,用于训练。
- 展示了在真实世界图像和微调中未见过的CAD操作上的泛化能力。
方法
CAD-Coder是一个在GenCAD-Code数据集(16.3万图像-代码对)上微调的VLM,用于从图像输出CadQuery Python代码。通过与GPT-4.5和Qwen2.5-VL-72B基线进行对比,使用语法正确率和三维实体相似度指标进行评估。
关键结果
CAD-Coder实现了100%的语法正确率和最高的三维实体相似度精度,超越了GPT-4.5和Qwen2.5-VL-72B,并在真实世界图像和未见过的CAD操作上展现出初步的泛化能力。
局限性
- 泛化能力仅为部分,描述为在真实世界图像和未见操作上表现出“一些迹象”,表明在训练分布之外的鲁棒性有限。
技术栈
CadQuery PythonVision-Language ModelGenCAD-Code dataset