BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD
TLDR
BenchCAD is a benchmark of 17,900 CadQuery programs across 106 industrial part families for evaluating multimodal LLMs on programmatic CAD tasks.
Reasoning
Strengths include a large, execution-verified dataset spanning diverse industrial parts and multiple evaluation tasks (VQA, code QA, image-to-code, editing). Weaknesses are the focus on a single CAD scripting language (CadQuery) and the lack of coverage for other representations like B-Rep or CSG, limiting generalizability.
Read-first score
Read-first score 66, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 89.
Field roles
Rank sensitivity
Stability: volatile; rank range: 7.
Keyword Scores
Deep Analysis
Innovations
- Introduction of BenchCAD, a unified benchmark for industrial CAD reasoning with 17,900 execution-verified CadQuery programs across 106 industrial part families.
- Multi-task evaluation framework covering visual question answering, code question answering, image-to-code generation, and instruction-guided code editing.
- Fine-grained analysis of model capabilities across perception, parametric abstraction, and executable program synthesis.
Methodology
BenchCAD comprises 17,900 execution-verified CadQuery programs from 106 industrial part families. It evaluates multimodal large language models on four tasks: visual QA, code QA, image-to-code generation, and instruction-guided code editing. Over 10 frontier models are tested, with additional fine-tuning and reinforcement learning experiments to assess in-distribution and out-of-distribution performance.
Key Results
Frontier models often recover coarse outer geometry but fail to produce faithful parametric CAD programs, missing fine 3D structure, misinterpreting design parameters, and substituting complex operations like sweeps and lofts with simpler sketch-and-extrude patterns. Fine-tuning and RL improve in-distribution performance but generalization to unseen part families remains limited.
Limitations
- Generalization to unseen part families remains limited even after fine-tuning and reinforcement learning.