用大模型生成CAD模型,"长得像"已经不够了——工业制造要求的是毫米级公差。
香港大学联合忆生科技提出的Pointer-CAD v2,通过"先规划、后构建"(Plan-Then-Construct)范式,将参数推理与几何构建彻底解耦。
模型先在文本域产出一份带单位、带符号引用的设计计划,再通过指针机制从参数字典中直接取值构建命令序列,从源头消除量化误差。
凭借这一设计,其15亿参数模型在顶点、边、面三级几何精度上全面超越GPT-5.2、Gemini 3 Pro等顶尖通用大模型,平均领先超过21%。
该工作已入选ECCV 2026,代码已开源。

01
CAD生成的"最后一毫米"
难题
计算机辅助设计(CAD)是现代工业制造的基础环节,仿真与加工流程对精度有着近乎零公差的严格要求。
近年来,基于大语言模型的CAD生成将建模过程建模为序列预测问题,取得了可观进展。
但一个关键矛盾始终悬而未决:现有方法和评测协议只强调视觉相似度,却忽视了精确的几何参数与正确的度量尺度。
论文中给出了一个直观的例子:用户要求生成长方体(1cm×1cm底面、高0.7cm)上叠放一个边长0.3cm的正方体。
当前主流的命令序列方法为了简化自回归预测,需要把连续的数值参数量化到有限的离散数值集合中。
论文以2-bit量化为例做说明(量化粒度可按需选择,2-bit仅为本例的示意设定):数值只剩0.33、0.67等选项,0.7cm的真实高度只能被"四舍五入"成0.67。
形状上看几乎一样,但在工业语境下,这种偏差足以让零件报废。
更棘手的是,现有的评测指标还会进一步掩盖这一问题。
Chamfer Distance(CD)和IoU等形状级指标在归一化后计算,对毫米级数值偏差并不敏感——两个尺寸存在细微差异的模型,IoU可能都高达0.96。
方法在"将就",指标也在"将就",CAD生成距离真正的工业可用始终差着最后一毫米。

02
两条路线,各有各的坎
当前LLM驱动的CAD生成大致分为两条路线:
命令序列表示:用专门的token词表描述参数化操作(sketch-extrude对、倒角、圆角等),token效率高,但参数与操作共享同一tokenized空间,连续几何量必须量化进有限词表,参数保真度先天受损;
代码表示:在CadQuery、FreeCAD等脚本环境中生成可执行代码,天然支持高精度参数,但生成单个模型的token开销约为命令序列的4倍,训练与推理效率大打折扣。
该团队此前的Pointer-CAD(v1,CVPR 2026)通过指针机制支持对中间B-rep几何实体的显式引用,扩展了命令序列的表示能力。
但精确的尺寸控制仍未解决——在其他不受约束的几何配置中,小的数值偏差依然会出现。

03
Plan-Then-Construct:
先把参数想清楚,再动手建模
Pointer-CAD v2的核心思路,是把"数值推理"和"几何构建"这两个认知负荷完全不同的任务拆开,各交给最合适的表示空间。
维度感知的设计计划
在每个生成步骤中,模型首先在文本域产出一份结构化设计计划。
所有几何参数以符号形式书写:长度标记为L、角度标记为A,每个参数绑定明确单位(如<L2=5mm>、<A1=30deg>),支持算术运算与对先前定义参数的引用(如<L3=2*L2>)。
这种表示在度量尺度上准确、可量化,为后续构建提供了显式约束。

参数字典与指针检索
计划中的参数被抽取出来,按长度、角度分为两个参数字典,统一单位后经保符号对数归一化、指数递增频率带的傅里叶编码、门控MLP投影并施加RoPE位置编码,形成参数嵌入集合。
在构建阶段生成命令序列时,每当需要一个数值参数,模型不再从量化词表中"猜"一个离散值,而是预测一个共享嵌入空间中的查询向量。
与参数嵌入计算余弦相似度,直接"指"向字典中的某个参数并原样取用——数值经过多少次生成都不再失真,维度一致性由此得到保证。
三头解码架构
在自回归解码端,Pointer-CAD v2将v1的单头联合解码拆分为三个专用头:Label Head负责预测命令标签token,Value Head负责数值参数嵌入的检索,Pointer Head负责对既有B-rep中面、边等几何实体的引用。
计划token与命令token在同一次前向中由两个模态专用解码头顺序生成,一个控制token分隔两种模态,既协同又解耦。
04
新数据集+新标尺:
让精度"无处遁形"
要训练和检验参数级精度,光有方法不够,还需要对的数据和对的尺子。
数据方面,团队基于Recap-OmniCAD与Recap-OmniCAD+(后者额外包含倒角与圆角操作)。
用Qwen3为每个CAD模型标注结构化设计计划,经语法纠错、程序化参数完整性校验与人工抽检后,构建了OmniCAD-Plan(20.2万个有效模型)与OmniCAD-Plan+(20.9万个有效模型)两个计划级监督数据集。

评测方面,团队提出三级几何精度指标,将评价从"粗粒度结构相似"推向"细粒度参数对齐":
顶点精度(Vertex Accuracy):预测顶点与GT最近点的欧氏距离在容差内才算匹配;
边精度(Edge Accuracy):不仅端点要定位正确,底层几何参数(圆弧的圆心与半径、圆的法向等)也须在容差内对齐;
面精度(Face Accuracy):所有边界边被正确识别,且原始体类型(平面/圆柱/圆锥/球/圆环)与GT一致。
容差设定为GT包围盒最小边长的千分之一,且所有模型在原始位置与尺度下评测、不做归一化——这就迫使模型必须真正理解文本指令中的度量尺度。
此外还引入了可修复模型率RMR@3:错误面不超过3个(约对应一次sketch或extrude的小失误)的模型占比,衡量生成结果在真实CAD工作流中的可用性。
05
实验:小模型的大胜仗
(一)对比专用CAD生成方法

相比CADmium-1.5B,Pointer-CAD v2三级指标平均提升13.49%。
差距最悬殊的是圆弧精度:CADmium-1.5B仅5.61%,Pointer-CAD v2达到68.53%——代码方法虽然数值自由,却常出现结构错误(漏建、错建部件)。
v1形状合理但尺寸有偏差;v2则兼得结构完整与尺寸精确。
在包含倒角、圆角的更复杂数据集OmniCAD-Plan+上优势进一步拉大。
且随着模型规模从0.5B增至7B,领先幅度从13.12%扩大到15.36%,7B模型的RMR@3达到95.23%——几乎所有生成结果都可直接进入实际CAD工作流。

(二)对比通用大模型
团队从测试集抽样2000个模型,让各通用大模型直接生成CadQuery代码评测:

(三)消融实验
对指针机制的消融显示:将参数引用退化为直接回归+最近值匹配(w/o Ref.),平均精度骤降26.54%;去掉计划阶段、直接从原始提示抽取参数(w/o Plan),下降12.96%。
而去掉频率编码和归一化仅分别带来1.15%和0.48%的小幅下降——说明指针检索机制本身对数值尺度变化相当鲁棒,真正关键的在于"显式的参数推理+计划级的参数引用"这一设计。
06
基于计划的模型编辑
由于所有几何参数都显式定义在计划中,修改计划里的一个参数即可直接更新CAD模型,且保持相对比例关系。
例如将"外半径<L1=2m>"改为10m,内外半径、高度等关联尺寸会按计划中定义的引用关系同步调整,无需重新生成整个序列。
这让设计师可以用"改参数"而非"改模型"的方式迭代设计,也为后续的参数化设计自动化打开了空间。

07
局限与展望
团队也坦诚展示了失败案例:在极精细特征(小孔、细长圆柱)上偶有失误,部分错误源于计划阶段的参数误差沿Plan-Then-Construct链路传播。这也是该范式的特点——计划的质量直接决定了构建的上限。
Pointer-CAD v2的意义不止于又一篇SOTA:它同时刷新了CAD生成的表示方法(参数与构建解耦、全精度取值)、数据范式(计划级监督)与评价标准(三级参数保真度指标)。
把"AI生成CAD"从看图说话的相似度游戏,拉回到了工业制造真正在乎的参数与公差上。
当通用大模型在文本、代码、图像上攻城略地时,这类深耕领域结构的工作,或许才是垂直场景落地的钥匙。







