Token导航 LogoToken导航

大模型推动EDA设计流程变革

更新时间 2026-10-05来源 半导体行业观察正文 1.2万字阅读约 38分钟8 张图片

电子设计自动化(EDA)通过一代又一代工具的发展,不断将综合、优化和验证过程自动化,从而持续提升工程设计效率。大语言模型(LLM)进一步延伸了这一发展轨迹,使设计意图能够直接转换为硬件实现。在大多数EDA相关文献中,基于LLM的解决方案通常只用于辅助彼此割裂的设计阶段或单项任务,但这种划分方式掩盖了能力究竟如何形成、系统又如何实现规模化的根本驱动因素。

在本文中,我们提出三个具有层级递进关系的角色,以揭示这种能力累积过程:生成器(Generator),即通过单次生成产生设计产物;智能体(Agent),即借助工具反馈进行迭代并不断优化输出;以及编排器(Orchestrator),即在不同EDA阶段之间协调决策。对现有已发表系统进行梳理后可以发现,一个普遍存在的问题是所谓的“语法陷阱(syntax trap)”:模型接受训练的目标往往是生成“看起来合理”的代码,而非物理上真正正确的硬件;与此同时,工具体系的碎片化以及设计上下文的丢失,又进一步掩盖了某一阶段的决策会如何影响后续设计阶段。

对这三种角色的比较表明,当前方法仍难以扩展到工业级设计,因此有必要转向一种标准化、具备物理感知能力的编排器,在整个EDA流程中连接不同工具和智能体,从而实现更加可靠、更加易用的硬件设计。

介绍

半导体行业正面临日益扩大的生产力缺口,其背后既有全球芯片需求持续增长的推动——到2030年,全球半导体市场规模预计将超过1万亿美元——也有芯片复杂度不断提升的影响。如今的产品已经能够集成数十亿个晶体管,同时采用更加多样化的架构,并面临更加严格的物理约束,而整个开发周期却在不断缩短。电子设计自动化(EDA)工具的引入,旨在通过确定性的、基于物理规律的方法帮助工程师构建并优化设计,从而提升大规模设计执行的效率。然而,在进入EDA工具执行阶段之前,将工程设计意图转化为正式硬件设计产物的过程仍然高度依赖人工,需要反复迭代,并依赖数量有限、集中于少数领域且难以规模化复制的专业领域专家。因此,如何生成正确且经过优化的硬件实现,依然构成芯片设计生产力提升的核心瓶颈。

大语言模型(LLM)为缩小这一生产力缺口提供了一条颇具潜力的路径:通过文本生成,将自然语言(NL)表达的设计意图转换为结构化的硬件设计产物。数字设计本身在很大程度上就是通过结构化文本表达的,包括硬件描述语言(HDL)代码、规格说明、脚本以及约束文件,因此,将LLM引入其中可以被视为这一技术体系的自然延伸。LLM辅助开发已经在软件工程领域展现出明显的生产力提升效果,例如减少人工工作量、缩短迭代周期,这意味着硬件设计同样可能从中受益,不过硬件领域还受到昂贵且由物理规律驱动的验证流程限制。

由此,目前逐渐形成了两种主要架构角色:第一种是生成器(Generator),它通过一次前向推理直接根据自然语言生成设计产物,随后由工程师自行解读工具输出,并人工引导下一轮设计迭代;第二种是智能体(Agent),它在固定流程中将生成过程与自动化工具反馈连接起来,从而闭合这一循环,使每一轮设计都能够自动进行修复和优化。这两类方法已经在若干特定任务中取得可量化的效果提升,包括HDL生成、EDA脚本生成、代码修复、验证 ,以及硬件数据集构建。然而,一些重要局限依然存在,包括难以保证生成设计在物理层面真正可实现、不同EDA阶段之间的推理彼此割裂,以及随着系统自主程度和设计规模不断提升,决策过程变得越来越不透明。

在本文中,我们提出第三种角色——具有物理感知能力的编排器(Orchestrator)——并认为它是LLM角色演进的下一个合理阶段,也是针对上述局限逐渐汇聚形成的一种解决方案。如果说生成器负责“生成”,智能体负责通过迭代不断“修复”,那么编排器则掌握整个设计流程本身的控制权:它能够基于一个持续存在、跨越不同设计阶段的设计状态模型,自适应地判断应该调用哪些工具、以什么顺序调用,以及何时需要重新分配或调整工作重点;与此同时,端到端的决策来源和决策路径,也会作为这种协调机制的一种自然属性显现出来。按照这一框架,当前领域中的能力提升不应仅仅被理解为模型本身能力增强的结果,更重要的是架构层面的演进——也就是LLM如何与工具以及设计上下文连接起来。因此,要解决硬件设计中的“语法陷阱”、EDA阶段割裂、上下文无状态以及可解释性不足等当前智能体系统无法从根本上解决的问题,就需要进一步转向标准化的编排体系。

LLM与数字设计流程之间的不匹配

图片

图1:LLM当前在数字EDA设计流程中的集成情况概览。 其中,a,表示不同技术抽象层级;b,表示按顺序推进的数字设计阶段;c,表示LLM在各阶段中承担的角色。图中同时标出了“语法陷阱”,即由于缺乏物理感知能力而导致LLM应用效果受限的位置。

如图1所示,数字EDA设计流程本质上是一条分阶段的转换流水线,通过一系列不同的抽象层级,将工程设计意图最终转化为经过物理验证的硅芯片实现(图1a)。从自然语言和高层次综合(HLS)规格,到寄存器传输级(RTL)硬件描述,再到门级网表、晶体管标准单元以及最终的物理互连布局,每向上提升一个抽象层级,都会将更低层级的实现复杂性封装到自动化工具之中,使工程师能够以更快的速度和更大的规模表达设计意图,并在每一次抽象层级迁移中带来生产力的跃迁;但与此同时,工程师对于底层物理行为的可见性和控制能力也会相应下降。

图1b进一步将上述抽象层级映射到标准EDA流程中,包括规格定义、设计输入、功能仿真、逻辑综合、布局布线(P&R)以及最终签核等阶段。前端设计阶段主要以语言和文本为媒介,设计意图通常通过设计规格、HDL代码以及约束文件等结构化文本进行表达,因此非常适合引入LLM辅助。目前,LLM已经在多个前端任务中展现出明显效果,包括从自然语言生成设计规格或RTL代码、测试平台(testbench)编写与断言综合,以及Bug总结。

相比之下,后端设计阶段开始转向由物理规律严格约束的表示形式和确定性算法,例如时序收敛、布线可实现性以及设计规则符合性等,这些任务几乎不存在允许近似处理的空间。由于复杂几何结构本身难以通过序列化方式进行编码,LLM实际上对复杂物理表示处于一种“不可见”的状态。因此,目前LLM在后端EDA中的作用基本被限制在仍具有文本属性的任务上,例如综合与P&R工具脚本生成、EDA日志与时序报告解析,以及基于RTL代码进行功耗、性能和面积(PPA)估算。这一边界实际上反映出一个更加根本的问题,即LLM的训练目标与硬件设计需求之间存在错位。

LLM主要通过“下一个Token预测”进行学习,这一训练目标奖励的是语言上的合理性,却没有任何机制能够训练模型理解或保证物理层面的正确性,因此形成了一种内生性的失败模式和目标错位,本文将其称为“语法陷阱(syntax trap)”。在这种情况下,LLM生成的设计可能在浅层的前端评估中看起来完全有效,但一旦进入更深层次、更严格的物理验证阶段,就可能暴露出问题。

例如,一个Verilog模块可能能够成功编译并通过仿真,但其中仍可能存在细微的时序错误,例如错误使用阻塞赋值或非阻塞赋值。这类问题很难通过文本层面的评估被发现,却可能导致最终制造出的硬件发生功能失效。由于这些错误有可能在后续设计阶段中持续传播而不被察觉,最终甚至可能造成芯片重新流片,不仅带来数百万美元的额外成本,还可能导致产品延期数月。

这一陷阱在三个层面上被量化:在语法层面上,55% 的 LLM 生成的 Verilog 适合进行自动化修复,这表明 Token(词元)级别的合理性并不能可靠地转化为语法上有效的硬件描述;在功能层面上,通过仿真是不够的,有 44.2% 通过测试平台(testbench)的设计未能通过形式等价性检查;而在物理层面上,即使是功能正确的设计,相对于人类人工优化的设计,也会产生 1.11–1.38 倍的面积开销。这种错位通过 pass@k 得到了强化——pass@k 是占主导地位的早期指标,它将设计正确性衡量为 k 个样本中能正确编译或仿真的比例,从而在优化语法和功能合理性的同时排除了物理正确性。

“语法陷阱”之所以长期存在,主要有两个根本原因。第一,学习真实硬件行为所需要的物理基础数据,包括综合结果、时序报告以及物理实现结果等,生成成本非常高,需要大量计算资源,而且其数据规模相比传统训练语料要少几个数量级。即便是HDL代码本身也十分稀缺,由于专有IP保护以及应用场景高度多样化,HDL在公开代码语料库中的占比甚至不足0.1%。

第二,HDL代码与最终物理实现结果之间的关系高度复杂,而且往往并非直接对应。即便只是很小的代码修改,也可能对PPA产生巨大且难以预测的影响,因此,仅通过文本本身很难推断设计在物理层面是否真正正确。

针对这一问题,当前研究领域正在从单次生成模式,也就是“生成器(Generator)”,逐渐转向闭环式的智能体优化模式,也就是“智能体(Agent)”。在这种模式下,LLM生成的设计会反复交由EDA工具进行检查,并依据工具反馈持续修改,直到满足相应的质量标准。由此形成了一种“神经—符号闭环(neuro-symbolic loop)”:LLM负责生成候选设计,而EDA工具则负责对物理正确性施加强制约束。

与此同时,一些互补性的研究开始引入面向电路本身的中间表示(IR),帮助LLM获得超越纯文本的理解能力。其中包括用于提升代码结构分析能力的抽象语法树(AST),以及支持信号级物理推理的数据流图(DFG)。例如,与其直接在文本代码中搜索错误,通过解析后的设计语法树追踪发生故障的信号,使VerilogCoder的调试智能体将通过率提高了超过25%。

然而,无论是智能体系统还是经过IR增强的模型,目前在很大程度上仍局限于单个设计任务或单一设计阶段(图1c)。智能体所获得的反馈通常只针对当前正在执行的任务,而IR更多描述的是设计结构本身,而非这些结构在后续阶段可能产生的物理影响。因此,在某一个抽象层级做出的决策,往往仍然与其在其他设计阶段造成的影响相互脱节。这也意味着,未来需要在整个EDA流水线中建立一种“跨层理解(cross-layer understanding)”能力——也就是将当前设计决策与后续物理结果联系起来,而不是像大多数现有LLM-EDA系统那样,只聚焦于彼此孤立的单一设计阶段。

图片

图2:LLM成熟度的发展趋势及当前研究版图。a,基于46篇论文建立的领域分类体系,将每篇论文对应的EDA功能、LLM方法栈以及LLM所承担的角色关联起来。图中进一步从三个维度展示LLM能力的演进:b,自主性(autonomy),即智能体对工作流程的控制程度;c,可解释性(explainability),即决策来源和决策过程的可追溯性;以及d,评估重点(evaluation focus),即所针对的设计挑战。图中标注的趋势线斜率均按照各自坐标轴尺度进行了归一化处理;具有相同排名的数据点仅为方便观察而进行了位置偏移。

调查结果详见补充表1,交互式图表见:https://mattycode101.github.io/LLMs_in_Digital_EDA_Perspective/

LLM在EDA中的当前应用

为了刻画当前局限于单一设计阶段的LLM部署范围及其结构,图2a对46个已发表的LLM-EDA系统进行了映射,并从其功能、方法栈以及LLM在架构中承担的角色三个维度进行分类(完整分类体系及不同类别之间的关系见补充表1和配套的在线交互式可视化)。从功能分布来看,“语法陷阱”的影响十分明显:RTL生成占据了已发表研究中的最大比例,因为这一阶段恰好处于自然语言(NL)与硬件描述最为接近的位置,同时仅通过编译或仿真就可以判断结果是否“看起来合理”;相比之下,后端物理设计阶段在相关研究中的占比仍然非常有限。

从方法层面来看,反馈集成、任务分解,以及检索增强生成(RAG)与上下文学习(ICL)的应用数量合计明显高于预训练、监督微调(SFT)或强化学习(RL)。这进一步说明,当前LLM-EDA系统能力提升的主要来源,并不是模型训练方式本身,而是LLM如何与工具和上下文进行连接。

这一趋势同样体现在LLM角色分布中:目前,智能体(Agent)的数量已经超过生成器(Generator),反映出整个领域正在从单纯生成转向与工具深度集成的迭代优化模式。相比之下,编排器(Orchestrator)仍然非常少见,主要出现在设计空间探索(DSE)和反馈闭环系统中,并且通常由LLM多智能体(LLM-MA)框架提供支持,即将任务拆分给多个通用LLM分别执行。

然而,这种任务分解主要提升的是并行执行能力,而非真正意义上的协调控制。不同角色通常在系统运行前就已经固定,各模块之间的交互也遵循静态的任务交接方式,没有任何一个组件能够依据全局设计状态动态调整整个工作流程 8。这不仅限制了专业化智能体的实际效果,也限制了系统建立跨层理解能力。

图2b–d通过定性评价排名,从三个维度刻画了所选论文的发展趋势,从而揭示这一领域在能力演进上的结构性失衡。图2b显示,自主性(Autonomy)——也就是系统一旦启动后能够在多大程度上独立运行——正在快速提升,按坐标轴归一化后的增长率达到每年8.8%。

这种增长更准确地反映了模型适配方式的演进,而不是模型基础能力本身均匀提升:从生成器层级使用ICL和RAG,到在经过领域适配的硬件语料上进行SFT,再到当前智能体前沿采用来自EDA工具反馈的奖励信号进行RL训练。

强化学习是应对“语法陷阱”的一种重要尝试。与单纯依赖下一个Token预测不同,RL通过多层次奖励信号对模型进行优化,这些奖励可以来自编译结果、功能正确性、综合结果以及PPA目标,从而使生成过程与真实物理结果更加一致,并在经过精心构建的基准测试中取得较强表现。

然而,由于这些奖励通常建立在固定参考集合之上,例如黄金标准设计、testbench覆盖率 ,或特定基准测试对应的基线,因此学习信号仍然高度受限于既有数据分布。这样做虽然能够提升模型在孤立任务中的表现,却很难有效泛化到跨阶段协调,或者建立RTL结构与物理行为之间更深层次的联系,因此“语法陷阱”在很大程度上依然存在。

与此同时,自主性的快速提升并没有带来同等幅度的可解释性提升——这里的可解释性,是指追踪系统为何做出某项决策的难易程度。图2c显示,可解释性的年增长率只有5.8%。随着自主性不断增强,两者之间的差距还在扩大,也就是说,系统正在做出越来越重要的设计决策,但这些决策背后的推理过程反而变得更加难以追踪。

对于半导体行业而言,由于重新流片的成本极高,正式签核要求每一项设计选择与其最终物理结果之间都必须建立可验证的关联,因此,自主性与可解释性之间的这种背离一直被认为是LLM在工业EDA中落地的主要障碍之一。

图2d进一步揭示了另一个类似的问题,即评估重点(evaluation focus)——也就是基准测试主要关注哪类设计属性——其年增长率为6.9%,但总体上依然集中在功能正确性,而工业竞争力真正主要取决于PPA表现。

因此,标准生成类基准测试已经逐渐趋于饱和。在RTLLM 和VerilogEval 等核心基准测试的模块级任务中,领先系统的pass@k已经超过95% ;然而,一旦转向更接近真实生产流程的任务,例如断言编写、testbench构建以及多步骤智能体设计,通过率便会下降到大约3%,最高也无法超过34% 。

当设计规模从孤立模块扩大到层级化系统时,这一问题会进一步加剧。由于LLM受到有限上下文窗口的限制,智能体层级的系统必须不断重新构建设计上下文,而无法长期持续保存完整状态,因此容易造成信息丢失和错误。

这种缺乏持久记忆的现象被称为“无状态性(statelessness)”,它会破坏不同设计阶段之间设计状态的连续性。在小型基准测试中,这个问题尚且可控;但随着模块交互、时序依赖以及实现约束不断增加,对上下文保持和推理能力的要求也会迅速上升,系统在大型设计上的性能因此出现明显下降。已有研究甚至报告,当设计规模超过约3,500行代码后,系统会出现完全失效的情况。

这些趋势进一步表明,碎片化正在成为一种叠加式的结构性限制:大多数系统都定义了自己的工具链、反馈闭环以及内部表示方式,从而阻碍了跨系统复用,也限制了不同专业化LLM之间的协同。

即便目标相同——让LLM具备对硬件设计结构的感知能力——不同研究采用的表示方式往往彼此不兼容。例如,HDLxGraph将设计编码为语法结构与DFG双重表示,用于检索;而CROP则使用由LLM生成摘要进一步得到的稠密向量嵌入。针对其中一种表示方式构建的方法,通常无法直接迁移到另一种体系中。

因此,目前已经出现的一些局部解决方案依然彼此孤立。例如,AutoSilicon和ACE-RTL通过跨会话保留设计知识来缓解无状态问题;RTLSquad显式记录设计决策,而ChipSeek-R1则展示推理步骤,以改善可解释性;MCP4EDA则通过类型化工具接口提升跨阶段协调能力。然而,这些改进基本都是针对特定系统开发的,无法被其他系统直接复用,因此碎片化本身反过来又阻碍了解决方案在不同系统之间传播。

因此,要真正弥合这些能力缺口,需要的并不是更多零散的局部修补,而是一套共享架构:具备统一接口、持久化设计状态,以及内生的决策可追溯能力。

标准化编排器

能够解决可解释性、无状态性和碎片化问题的架构,与其说是增加一个新的组件,不如说是对系统控制权进行重新组织。如图3a–c所示,生成器、智能体和编排器实际上对应三个层层嵌套的推理范围:从单个任务,到完整工作流,再到EDA多阶段之间的整体协调。

编排器与智能体之间最关键的区别在于“控制权”:它能够决定下一步应该执行什么操作,并调用多个智能体分别完成被拆解后的不同任务。上一节所指出的许多局限,本质上都源于当前系统中缺少这样一个统一协调角色。

一旦引入这一角色,标准化接口可以减少系统碎片化,持久化设计状态能够缓解上下文丢失,同时系统还可以持续记录设计决策和工具交互,从而增强决策来源的可追溯性。这些能力并不是彼此独立、额外叠加的功能,而是通过一个可审计的协调层统一管理设计流程之后,自然而然产生的结果,也使LLM辅助EDA有机会从孤立模块进一步扩展到完整芯片设计。

由于不同层级的能力彼此相互关联——工具反馈能够进一步增强一个本身就很强的生成器,但无法弥补基础生成能力本身较弱的问题——因此,只有当智能体层级系统发展到足够成熟的阶段后,编排才真正具有价值。这也解释了为什么这种角色转变恰好在当前阶段开始出现。

这意味着研究问题正在从“如何提高生成质量”,进一步转向“如何实现高效协调”,而标准化则是实现这一转变的前提。开放协议,尤其是模型上下文协议(MCP)和智能体到智能体(A2A)框架,可以使用类型化、与具体协议实现无关的接口,替代过去高度定制化的工具封装,以及依赖自然语言解析日志的方式。

这种变化会带来两方面影响:第一,系统能力改进可以在不同系统之间组合复用,而不再被锁定在某一个封闭系统内部;第二,决策来源和执行链路的可追溯性会成为结构化工具调用自然产生的副产品,而不再需要在事后重新拼接和还原。

当这种协调层被应用到整个设计流程后,通过闭合后端反馈回路并建立跨层理解,目前已经能够实现15–30%的时序改善,以及10–20%的面积改善。

控制权同样为解决“语法陷阱”和评估重点偏差提供了一种架构层面的方案,即将神经—符号反馈机制从孤立的优化闭环扩展到整个EDA流程。确定性的EDA工具仍然负责确保设计正确性,而编排机制则保证这些工具的输出能够作为持续存在的设计上下文,被保留下来并不断影响后续EDA阶段中的决策。

这样一来,在综合或物理实现阶段发现的物理后果,就可以反向影响上游的规格定义或RTL生成,而不再只是到了某些固定检查点后才被动暴露出来。同时,系统还可以通过必要的验证,对每一个设计阶段是否允许继续向下推进进行控制。

为了降低验证成本并加快设计空间探索(DSE),可以引入大电路模型(LCM)作为快速物理代理,以在调用工具之前剔除劣质候选方案;相关的评估器在取得超过 6 倍加速比的同时,功耗预测误差低于 2%。

图3d–e进一步量化比较了不同LLM角色在“从规格到RTL生成”任务中的表现,并分别考察模块级和系统级设计规模。之所以选择这一任务,是为了突出系统的可扩展性问题,因为已有研究指出,当生成的硬件代码超过约100–150行后,设计一致性会出现明显下降。

由于硬件设计性能高度依赖底层模型、提示策略、基准测试以及评估方法,因此,本文并未简单比较单一指标,而是针对每一种角色,从五个维度进行综合汇总:前端正确性、后端PPA质量、验证完整性、求解时间,以及单个设计的成本。具体计算方法见补充表2。

在模块级规模下,生成器和智能体系统在正确性方面已经接近人类水平,同时在求解时间上表现出显著更高的生产效率。然而,两者依然保留着“语法陷阱”的典型特征:表面上的功能成功率很高,但验证完整性相对较弱。

编排器在很大程度上能够缩小这一差距,不过其成本大约提高到六倍。随着设计风险不断上升,这种额外成本也会变得越来越容易被接受。

到了系统级规模,不同方法之间的生产效率差距变得更加明显:生成器和智能体工作流的正确率会大幅下降到20%以下,而编排器的表现则相对稳定,并开始在PPA效率方面超过人类基线。

因此,这些性能提升本质上更多来自架构演进,而不是单纯依靠新一代模型能力提升。这也意味着三种范式分别适合不同角色:生成器适合用于失败成本较低的场景,以加速设计内容生成;智能体适合承担耗时的迭代优化任务;而编排器则通过保持跨阶段一致性和实现经过验证的设计收敛,负责协调系统级开发。

图片

图 3:嵌套 LLM 架构框架与多轴生产力评估。a,协调器层(Orchestrator Tier):人类、LLM 协调器与溯源数据库(Provenance Database)之间的协作接口。b,代理层(Agent Tier):众多无状态代理/生成器由协调器提供规范(specifications),并在自定义流水线中执行这些规范。c,工具层(Tool Tier):访问 EDA 工具以用于产物(artifacts)验证和设计开发。d、e,跨 (d) 模块级(≤150 行代码)和 (e) 系统级(>200 行代码)设计复杂度的 Spec-to-RTL(规范到 RTL)生成的五轴生产力对比。生成器(Generator)、代理(Agent)和协调器(Orchestrator)LLM 架构相对于人类工程师基线进行了评估;绘制的结果、方法论和来源请参见补充表 2。

工业化LLM的发展展望

本文所讨论的向标准化编排转变的趋势,正在从一种前瞻性设想逐步走向实际落地,主要EDA厂商也开始各自独立地向这一LLM角色靠拢。Cadence的ChipStack 基于持久化的IR设计模型,将任务分派给不同的专业化工作单元;Synopsys的AgentEngineer 则将自主优化器纳入“推理—规划—执行—编排”的闭环之中;Siemens的Aprisa 进一步嵌入了可审计的流程内协调机制。这些系统所体现出的特征——持久化状态、类型化协调以及验证门控——与学术界目前逐步收敛形成的方向高度一致。

图4进一步展示了当这类系统实现规模化部署后可能的发展方向,其核心是“智能实验室(Smart Lab)”(图4a):这是一个闭环环境,由编排后的智能体负责主导实验、接收实际测量反馈,并将经过验证的候选设计返回给工程师,由工程师进行最终监督。

目前,这种模式的早期形态已经出现在闭环后端优化,以及横跨数字、模拟和射频领域的跨域优化中。下一步则可能进一步通过可重构逻辑扩展到物理原型验证,从而开始缩小从仿真到真实硅实现之间的“Sim-to-Silicon”差距。

距离实际大规模部署最近的方向,是工作流自动化(图4b),其重点主要集中在那些正确性信号容易获得、即便失败其影响范围也相对可控的任务上。其中,验证成为这一前沿方向的核心,因为验证工作大约占工程投入的47% 。目前,闭环系统已经能够实现87–90%的通用验证方法学(UVM)覆盖率,而一些工业部署案例显示,在RTL生成、仿真和形式验证等环节,工程投入已经实现数量级下降。例如,生成500多行RTL代码的时间,可以从1周缩短到1小时,同时面积还可降低28%。

随着这些任务逐步实现自动化,工程师的角色也将从直接编写代码,转向定义设计意图、设定目标以及监督最终签核。这样的效率提升并不会减少行业对专业能力的需求,相反,它会扩大工程团队在现实条件下能够完成的设计范围,从而更好地应对半导体需求的指数级增长。

在上述自动化能力的基础上,PPA驱动的设计空间探索(DSE)(图4c)将成为另一个重要方向。在这一场景中,编排器能够并行运行大量专业化工作单元的能力将变得至关重要:不同智能体可以同时沿着PPA空间探索不同甚至相互竞争的设计假设。

这将显著压缩过去需要大量人工综合和反复调优才能完成的优化周期。

因此,熟练掌握HDL开发和EDA脚本编写,对于高效开展硬件设计的重要性可能会逐渐降低。这会进一步降低以软件为主的研究人员以及小型设计团队进入硬件开发领域的门槛,并推动硬件加速能力向更高层级的软件与应用栈延伸。

不过,这种“普及化”依然存在明显边界,因为先进制造仍然依赖专有的工艺设计套件(PDK)、由行业现有头部企业掌握的大规模设计数据,以及复杂的制造基础设施。因此,对开放生态而言,更现实的机会在于尽可能复制和补齐现有企业所掌握的资源,并在制造层之上提升互操作性、可移植性以及快速创新能力。

更高程度的自主性也不可避免地具有“双重用途”属性(图4d)。能够加速设计的生成能力,同样会扩大系统的攻击面,例如通过提示注入植入硬件木马、通过云端推理造成知识产权泄露,以及在缺少形式验证的情况下,让隐蔽的功能缺陷或侧信道漏洞持续传播。已有研究报告显示,这类攻击的成功率可以超过90%,而防御检测率仅为25–35%。

不过,带来这些风险的编排机制本身,也可能成为解决问题的一部分。如果将其用于防御,基于LLM的信息流跟踪以及系统化对抗模糊测试,可以在部署之前发现潜在的木马位置和非法状态;与此同时,标准化且具有门控机制的流程本身会天然保留完整的决策和操作追踪记录,从架构层面增强系统抵御隐蔽篡改的能力。

随着Chiplet和3D集成不断增加芯片设计中的交互关系,更丰富的中间表示(IR)以及新兴的世界模型,可能会进一步提升单个智能体的物理推理能力;但要真正实现可靠的芯片开发,越来越关键的仍然是如何在整个设计流程中协调这些能力。

图片

图4:编排器在数字设计中的应用场景。 系统能力以 a)智能实验室(Smart Lab) 为核心向外扩展。智能实验室是LLM编排器协调物理实验或仿真实验的中心环境。在这一环境基础上,可以进一步实现:b)工作流自动化(Workflow Automation),在未来为整个EDA流程提供支持,使工程师的工作重点逐步转向设计意图设定与结果审查;c)PPA驱动的设计空间探索(DSE),利用智能体搜索实现多目标优化;以及 d)自动化安全探测(Automated Security Probing),将硬件防御性检查与对LLM对抗性滥用风险的识别结合起来。

表1:LLM-for-EDA论文分类体系(2023–2026)。 该表按照一套固定的编码框架,对每个系统进行人工分类,其中包括类别型维度——功能(function)、方法(method)和角色(role),以及序数型维度——自主性(autonomy)、可解释性(explainability)和评估重点(evaluation focus)。每个维度都设定了一组封闭且明确定义的等级,每篇论文仅被分配到与其最匹配的一个等级;序数型维度按照能力由低到高划分为1...N级,并以论文首次公开发布的日期作为时间标记。随后,通过对序数等级与发布日期进行最小二乘回归计算增长率,并按照坐标轴跨度(N)进行归一化,最终以每年占完整量程的百分比形式表示(autonomy 8.8%、explainability 5.8%、evaluation focus 6.9%)。

图片
图片

表2: 该表仅覆盖从规格说明到RTL生成这一阶段,因为这是目前最容易量化、证据也最充分的环节。按照基准测试中的模块规模,进一步划分为组件级(≤150行代码)和系统级(>200行代码)两个层级。表中每一个数值均为基于多个来源汇总得到的中心估计值,通过整合所引用研究的数据,在尽可能保持任务一致的同时,降低不同模型、基准测试和评价指标相互混杂所造成的影响;每个单元格的数据来源均在Notes栏中注明。正确性指标采用论文报告的func@1或pass@1中位数(如有);PPA采用相对于人类基线归一化后的面积—功耗比几何平均值的中位数;验证完整性则定义为通过功能验证的设计(form@k)与语法正确设计(synt@k)之间的比例;时间和成本分别对应论文报告的端到端自动化运行时间(seconds)以及每个设计累计产生的API调用费用($)。

对于未公开报告的数据单元格,作者依据所属层级和整体趋势进行了估算,并标记为预测值。凡使用人类表现作为参考基线的指标,均按定义固定:correctness和verification integrity = 100%,PPA = 1.00×;而人类完成设计所需的时间和成本,则分别根据对工程师设计工作量以及工程师小时费率的估算得出。

图片
图片

*免责声明:本文由作者原创。文章内容系作者个人观点,半导体行业观察转载仅为了传达一种不同的观点,不代表半导体行业观察对该观点赞同或支持,如果有任何异议,欢迎联系半导体行业观察。

文章标签大模型智能体
资讯来源:由AI资讯编辑整理自互联网公开内容,版权归原作者所有,未经许可,不得转载。

继续浏览更多资讯

返回资讯目录

相关资讯

更多