CADBench: A Multimodal Benchmark for AI-Assisted CAD Program Generation
TLDR
CADBench is a unified multimodal benchmark for evaluating AI-assisted CAD program generation from images and 3D data, covering 18,000 samples, five modalities, and six metrics.
Reasoning
The paper's strength lies in providing a comprehensive, standardized benchmark that addresses fragmentation in existing evaluations, with diverse modalities and metrics. Weaknesses include reliance on existing models and no novel method; the abstract does not discuss limitations like potential dataset biases or computational costs.
Read-first score
Read-first score 81.9, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 105.
Field roles
Rank sensitivity
Stability: stable; rank range: 0.
Keyword Scores
Deep Analysis
Innovations
- Unified multimodal benchmark CADBench with 18,000 samples from six dataset families, five input modalities, and six metrics for CAD program generation.
- Stratification by B-rep face count and diversity sampling to enable controlled analysis across geometric complexity and object variation.
- Large-scale evaluation of 11 CAD-specialized and general-purpose VLMs, generating 1.4M CAD programs and identifying three recurring failure modes.
Methodology
CADBench aggregates 18,000 evaluation samples from six benchmark families (DeepCAD, Fusion 360, ABC, MCB, Objaverse) across five input modalities (clean/noisy meshes, single-view, photorealistic, multi-view renders) and six metrics (geometric fidelity, executability, program compactness). STEP-based families are stratified by B-rep face count and all families are diversity-sampled. Eleven models are benchmarked by generating over 1.4 million CAD programs.
Key Results
Specialized mesh-to-CAD models substantially outperform code-generating VLMs under idealized inputs; three failure modes emerge: reconstruction quality degrades with geometric complexity, CAD-specialized models are brittle under modality shift, and model rankings change across metrics.