MUSE:面向可制造、功能性和可装配性的文本到CAD生成的基准测试
TLDR
MUSE是一个用于文本到CAD生成的基准,通过VLM评估B-Rep组件的可制造性、功能性和可装配性。
评分理由
The paper addresses a critical gap in Text-to-CAD evaluation by moving beyond geometric similarity to engineering-relevant criteria. Its strengths include a structured three-stage protocol and human-validated VLM judge, but reliance on VLM may introduce biases and experiments show limited success even for strong models.
Read-first 评分解释
综合优先阅读分 69,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 89。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:sensitive;排名波动范围:3。
关键词评分
深度分析
创新点
- 引入MUSE,一个专注于复杂、可编辑的B-Rep装配体并配有结构化设计规范的Text-to-CAD基准。
- 三阶段评估协议(代码检查、几何检查、设计意图对齐),使用设计特定评分标准评估功能性、可制造性和可装配性。
- 采用基于评分标准的VLM评判器实现可扩展评估,并通过人工标注验证其可靠性。
方法
MUSE将实际设计实例与结构化设计规范配对,并通过三阶段协议评估生成的CAD模型:代码检查、几何检查和设计意图对齐。最后阶段使用设计特定评分标准和VLM评判器评估功能性、可制造性和可装配性,并通过人工验证评判器的可靠性。
关键结果
实验揭示了从可执行代码到有效几何再到工程就绪设计的失败级联;即使最强的LLM在细粒度工程标准上也仅取得有限成功。