Awesome AI4CAD Hub Papers · Datasets · Projects
← Back to papers

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

arXiv 2026 66 method

TLDR

BenchCAD is a benchmark of 17,900 CadQuery programs across 106 industrial part families for evaluating multimodal LLMs on programmatic CAD tasks.

Reasoning

Strengths include a large, execution-verified dataset spanning diverse industrial parts and multiple evaluation tasks (VQA, code QA, image-to-code, editing). Weaknesses are the focus on a single CAD scripting language (CadQuery) and the lack of coverage for other representations like B-Rep or CSG, limiting generalizability.

Read-first score

Read-first score 66, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 89.

Methodology quality 25%
100

Screens visible abstract and analysis fields for experiment, dataset, baseline, metric, and limitation evidence. markers=analysis,benchmark,evaluation,experiment,metric,result

Recency 8%
100

Uses a gentle age decay so recent papers surface without erasing older foundations. 2026

Topical relevance 42%
55.6

Uses existing LLM keyword relevance scores normalized to 0-100. AI for CAD,computer-aided design,neural CAD,generative CAD,parametric CAD,B-Rep,boundary representation,constructive solid geometry,CSG,sketch extrusion,CAD generation,CAD reconstruction,text-to-CAD,image-to-CAD,point cloud to CAD,CAD program

Reproducibility 25%
38

Screens links and visible text for paper, code, dataset, artifact, and repository signals. pdf=True; code=False; dataset=False; markers=code

Field roles

FrontierBridgeMethodology anchor

Rank sensitivity

Stability: volatile; rank range: 7.

Keyword Scores

parametric CAD
9
CAD program
9
computer-aided design
8
CAD generation
8
text-to-CAD
8
image-to-CAD
8
AI for CAD
7
generative CAD
7
sketch extrusion
6
neural CAD
5
constructive solid geometry
4
CSG
4
CAD reconstruction
3
B-Rep
1
boundary representation
1
point cloud to CAD
1

Deep Analysis

Innovations

  • Introduction of BenchCAD, a unified benchmark for industrial CAD reasoning with 17,900 execution-verified CadQuery programs across 106 industrial part families.
  • Multi-task evaluation framework covering visual question answering, code question answering, image-to-code generation, and instruction-guided code editing.
  • Fine-grained analysis of model capabilities across perception, parametric abstraction, and executable program synthesis.

Methodology

BenchCAD comprises 17,900 execution-verified CadQuery programs from 106 industrial part families. It evaluates multimodal large language models on four tasks: visual QA, code QA, image-to-code generation, and instruction-guided code editing. Over 10 frontier models are tested, with additional fine-tuning and reinforcement learning experiments to assess in-distribution and out-of-distribution performance.

Key Results

Frontier models often recover coarse outer geometry but fail to produce faithful parametric CAD programs, missing fine 3D structure, misinterpreting design parameters, and substituting complex operations like sweeps and lofts with simpler sketch-and-extrude patterns. Fine-tuning and RL improve in-distribution performance but generalization to unseen part families remains limited.

Limitations

  • Generalization to unseen part families remains limited even after fine-tuning and reinforcement learning.

Tags

AICVSE