芯片人-晒 AI 笔记:从AI4EDA到AI-Native,现有flow只是过渡期
一、三巨头同时亮牌
最近半年,EDA行业有点热闹过头了。
Cadence发了ChipStack AI Super Agent,号称能协调RTL生成、testbench创建、regression编排、debug、formal、UVM、signoff等多专业Agent,还搞了个「shared mental model」来捕获设计意图。Synopsys推出AgentEngineer,从L1到L5定义了自治等级,2026年Converge大会上宣称L4多Agent工作流已经落地。Siemens Fuse更直接,把RAG、MCP、Agent Skills、supervisor-worker架构、recovery loops、HPC集群、RBAC、audit全塞进一个平台。
三巨头同时亮出Agent牌,这不是巧合。
我做芯片做了很多年,看到这些消息的第一反应不是兴奋,而是一个很朴素的问题。这些Agent到底是个什么运行时?它们的「自治」边界在哪里?如果Agent生成的RTL有问题,谁兜底?
说实话,这些问题比Agent本身更值得关注。

二、Agent不是聊天机器人加了工具
很多人对Agent的理解停留在「ChatGPT能调函数了」。这个理解差太远了。
说真的,Agent领域2025到2026年最重要的变化,不是又冒出一个新的prompting技巧,而是「Agent Runtime」正在成为独立的工程层。OpenAI的Agents SDK把agent loop、tools、handoffs、guardrails、sessions、tracing、MCP、human-in-the-loop和sandbox作为构建原语。MCP把Agent访问工具的接口标准化了。A2A进一步把Agent之间的协作协议化了。
你想想看,Claude Code、Codex CLI、LangGraph、CrewAI、AutoGen这些框架,它们的共同方向是什么?是把模型从「单次API调用」包进一个有状态、有权限、有工具、有记忆、有观测、有评测、有恢复能力的runtime。
框架之间的差异,越来越体现在,能不能长期运行,能不能隔离上下文,能不能多人协作,有没有可回放的trace,失败后能不能恢复,而不是单纯能不能调函数。
理论底座其实不复杂。ReAct让模型交替进行推理和行动,一边规划一边通过工具获取反馈。Reflexion把失败后的语言反馈写进记忆,下一轮就能少踩同样的坑。Tree of Thoughts和LATS把推理从单条链扩展成可搜索的思维树。这些理论构成了Agent Runtime的基本语义。
一个现代Agent系统通常包含八类核心抽象。这个表很枯燥,但对理解Agent架构至关重要。
| 抽象 | 解决的问题 | EDA类比 |
|---|---|---|
| Tool Call | 让模型执行原子动作 | run_verilator、query_sta |
| MCP | 标准化外部工具接入 | EDA MCP Gateway |
| Skill | 封装可复用操作手册 | RTL fix playbook |
| SubAgent | 上下文隔离、权限收窄 | DV triage子Agent |
| Memory | 跨会话保存经验 | 项目知识库、known bugs |
| Hook | 生命周期点的确定性控制 | pre-tool permission、stop gate |
| Goal/Plan | 把完成条件持久化 | PPA closure objective |
| Plugin | 打包分发一组工具和skill | EDA agent pack |
读这个表的关键不是记名词,而是看控制权在哪里。Tool、MCP、Skill、SubAgent多由模型主动选择。Hook、Goal、Acceptance Gate则是外层runtime对模型的约束。生产级Agent的可靠性,主要来自后者。

三、从demo到生产,差了一个银河系
Agent领域有个很残酷的事实。同一个模型,在无状态、无权限、无验证的demo里表现很好,进入真实系统后可能因为工具描述不清、上下文爆炸、审批缺失和回滚失败而完全失控。
下面这张检查表是我从报告里摘出来的,它比框架选型更重要。
| 模块 | 必须回答的问题 | EDA场景示例 |
|---|---|---|
| 目标状态 | 完成条件是否可机器判定? | coverage >= 95%、WNS >= 0、lint clean |
| 工具契约 | 工具输入输出是否强类型? | run_formal(properties, timeout, design_hash) |
| 权限 | Agent是否拥有最小权限? | 只能读PDK文档,不能导出netlist |
| 审批 | 哪些动作不可自动执行? | 启动全量regression、批准waiver |
| 回放 | 失败能否复现? | same seed + same commit可复现仿真失败 |
| 安全 | prompt injection如何隔离? | 用户上传spec不可改变系统策略 |
还有几个常见的反模式,我觉得值得说。
第一个是「万能Agent」。一个Agent读所有文档、调所有工具、做所有决策,结果是上下文爆炸、权限过大、错误定位不了。正确做法是按职责拆成supervisor加specialist agents。
第二个是「模型自评完成」。Agent说完成就停止,这在复杂任务里非常危险。必须有Stop hook加acceptance gate,用工具证据判定,不是模型说了算。
第三个是「无预算循环」。失败后无限重试,烧token、占license、卡HPC队列。必须设retry budget和降级策略。
四、三巨头的Agent牌桌
回到三巨头。它们的路线其实差异很大。
Cadence的ChipStack AI Super Agent最激进。公开描述强调多专业Agent协调,RTL、testbench、regression、debug、formal、UVM、signoff全覆盖,还搞了个shared mental model来维护设计意图。2026年又宣布跟NVIDIA OpenShell结合的Level-5 autonomous virtual engineer,号称能在安全沙箱里迭代到closure。
但坦率的讲,Level-5和autonomous这些词应该按vendor claim理解。它显示产业方向,但企业采用还得看可复现案例、工具链覆盖、权限治理和签核边界。
Synopsys的AgentEngineer把Agent描述为能reason、plan、learn、execute的工程加速器,提出L1到L5的自治层级。2026年Converge发布了L4 orchestrated multi-agent design and verification workflow。L4意味着多Agent编排,但具体覆盖哪些工具、数据闭环怎么建、可审计性如何,公开细节有限。
Siemens Fuse是三家里架构描述最详细的。RAG、multimodal EDA data、MCP、Agent Skills、supervisor-worker hierarchical planning、autonomous recovery loops、HPC、RBAC、audit、human checkpoints,覆盖了Catapult、Questa、Aprisa、Calibre等工具。听起来很全面,但也需要验证跨工具上下文饱和、权限和tool schema质量。
报告里有一句话我觉得特别到位。厂商发布中的「Level-4、Level-5、autonomous virtual engineer」应该明确标为vendor claim,跟可复现研究原型区分。芯片设计的最终证据来自可重复工具链,不是发布会PPT。
五、研究前沿在做什么
除了商业系统,学术界和工业研究实验室也在快速推进。有几个方向我觉得特别值得关注。
AlphaChip是AI for chip的标志性路线。它把芯片floorplanning建模为序贯决策游戏,策略模型在网格上逐个放置宏单元,用布局质量作为奖励信号优化。DeepMind公开资料称可以在数小时而不是数周内生成高质量布局,用于Google TPU。不过AlphaChip也有复现争议,企业解读时要把「已宣称的产业应用」和「可独立复现实验」分开。
AlphaEvolve代表另一条更适合EDA的路线。LLM产生代码候选,自动评测器负责正确性和性能评分,候选在进化循环中被选择、变异和保留。DeepMind提到它曾提出针对TPU矩阵乘法算术电路的Verilog rewrite,删除不必要bit,通过验证后集成到upcoming TPU。2026年更新称已成为优化下一代TPU的常规工具。
这两条路线的启发是,不要把所有问题都交给通用LLM。对可评分、可仿真、可搜索的问题,RL、进化搜索、贝叶斯优化和EDA heuristic仍然更适合。LLM的强项在于读规格、提候选、解释日志、组织搜索和写胶水代码。
ChipNeMo说明了一个重要事实,芯片设计的语言和通用软件不一样。RTL、netlist、EDA logs、timing reports都有特殊词法和上下文。NVIDIA用custom tokenizer、domain-adaptive预训练和domain-specific指令对齐,在assistant、脚本生成、bug摘要等任务上评估领域适配收益。
Circuit Foundation Models把范围扩大到多模态电路表征。电路图、netlist graph、RTL tokens、layout images、timing/power tables、waveforms都可以进入自监督预训练。这个方向离工业落地还远,但一旦成熟,会改变Agent理解电路的方式。

六、EDA流程里哪些环节最该先上Agent
报告里有一张EDA流程分段机会地图,我觉得非常实用。它把从需求到签核的每个阶段都列出了高价值Agent任务和推荐自治等级。
| 流程阶段 | 高价值Agent任务 | 推荐自治 |
|---|---|---|
| 需求/规格 | 需求摘要、歧义识别、SVA草案 | L1-L2 |
| RTL设计 | 模块草稿、代码review、局部修复 | L2-L3 |
| 数字验证 | test plan、失败triage、coverage建议 | L2-L4 |
| 形式验证 | property生成、CEX解释、收敛建议 | L2-L3 |
| 综合/STA | 脚本生成、约束候选、违例分类 | L1-L3 |
| P&R | floorplan探索、QoR归因、脚本候选 | L2-L3 |
| DRC/LVS | 错误聚类、版图定位、修复建议 | L1-L2 |
| 签核管理 | 风险dashboard、阻塞项、证据归档 | L1-L2 |
有个规律很清晰。越靠近签核,自治等级越低。这是对的。
短期ROI最高的是Verification Triage Agent。它不直接改设计,而是把regression失败日志、seed、波形、coverage、commit diff聚类,生成root cause hypothesis、owner、最小复现和建议修复路径。安全风险低,价值高,非常适合第一阶段试点。
Formal-first RTL Agent也值得关注。原则是,任何生成RTL的行为都必须伴随验证意图。Agent生成RTL的同时生成SVA、测试计划和边界条件。验证失败时triage agent先判断是RTL bug、testbench bug、property bug还是spec ambiguity。

七、企业怎么落地
说到底,企业不是买几个模型token就能用上Agent的。报告里给出了五步路线,我觉得非常务实。
第一步,建EDA MCP Gateway。把所有工具统一封装,Agent不能直接跑shell,只能调用Gateway暴露的受控接口。先提供只读接口,再逐步扩展。
第二步,上Verification Triage Agent。把失败聚类、归因、最小复现和证据包做出来。不动设计文件,只做分析和建议。
第三步,试Formal-first RTL Agent。从FIFO、arbiter、CSR这些标准化小模块开始。每个任务要求输出RTL加SVA加testbench加trace加coverage。验收条件由工具判定。
第四步,建QoR Goal Graph。围绕WNS、TNS、area、power、congestion等多目标,自动组织实验、归因和候选脚本。约束修改和签核仍由人批准。
第五步,Tapeout War Room Agent。把STA、DRC/LVS、IR/EM、waiver、owner和风险状态汇总成实时dashboard。Agent不替代签责,只负责证据整理和阻塞项追踪。

八、有人说EDA公司会沦为设计服务,我审慎地看了看
最近在一个行业群里看到一种说法。大意是,以后不会有大的EDA公司了,小的EDA最终都会沦为设计服务公司。理由是验证最费人又最依赖数据经验,而数据经验在AI面前是最容易被蒸馏的。还拿当年深圳PCB做类比,说长尾效应还会持续几年,爆发期还没到。
这个判断方向上有共鸣,但有几个地方需要拆开看。
说对的部分,验证确实是芯片设计里最费人的环节,占50到70%的人力。而且验证是典型的经验密集型工作,known bugs库、failure pattern、coverage策略、waiver判断,全靠工程师脑子里的积累。这些东西确实最容易被Agent distill。报告把Verification Triage Agent列为短期ROI最高的试点,逻辑跟这个判断完全一致。
但「不会有大EDA公司」太绝对了。Cadence、Synopsys、Siemens的护城河不只是工具本身,有三样东西AI短期内蒸馏不了。
第一,foundry签约关系。PDK数据、characterization、signoff certification,是多年联合开发堆出来的,不是数据集能替代的。
第二,signoff法律地位。芯片出了bug要追责,foundry只认certified flow。Agent生成的结果再好,没有signoff chain of custody,产线不敢用。
第三,客户lock-in。一个SoC团队的脚本库、flow cookbook、约束模板全部绑在特定工具上,迁移成本极高。
而且三巨头不是在防守,是在主动转型。Cadence的ChipStack、Synopsys的AgentEngineer、Siemens的Fuse,是把工具公司升级成AI-Native EDA平台公司。它们想吃的不是现有蛋糕的一块,是新蛋糕的全部。
「数据经验最容易蒸馏」也大幅低估了。EDA数据不是普通文本日志。timing report的path hierarchy、waveform的多维信息、coverage的交叉关联、PDK参数的敏感性,是多模态、高度结构化、强context-dependent的。报告里说得很清楚,EDA data engineering是整个Agent落地里最难的环节,不是最容易的。
PCB类比方向上对,PCB确实经历了从高端手艺到工具普及的commoditization。但量级差了。PCB是2D routing加少量SI分析,芯片是十亿晶体管级别的3D集成加multi-physics加多domain timing。PCB的commoditization花了15年,芯片只会更长。
说到底,这种看法的核心是悲观叙事。AI蒸馏掉经验壁垒,EDA公司失去价值,沦为服务。
我看到的则是另一面。AI重新定义设计流程,现有flow是过渡态,新的参与者和价值会在AI-Native时代重新出现。验证确实是第一张倒下的多米诺骨牌。但倒下之后是连锁崩塌还是重建格局,取决于谁能先把Agent基础设施建起来。
九、从AI4EDA到AI-Native,现有flow只是过渡期
报告里有个三阶段框架,我觉得值得展开讲。
第一阶段是AI4EDA。AI在现有工具旁边做点状预测和优化,PPA预测、congestion预测、参数调优。这些已经用了好几年了,你我都在用。
第二阶段是Agentic EDA。Agent跑进现有工具闭环里,读规格、生成脚本、跑工具、解析日志、修复错误。三巨头现在亮出的牌都在这一层。
第三阶段是AI-Native Design。这一步不是让AI跑得更快,是重新定义什么叫设计流程。
现有EDA流程,从spec到RTL到gate到GDS的线性pipeline,是Agent到来前的一个临时状态。Agent足够成熟后,我们可能不再需要把设计切成spec、RTL、验证、综合、P&R这些独立阶段。Agent可能把规格直接编译成可验证的候选实现,工具验证嵌入生成循环内部,人只在关键决策点介入。
这不是科幻。AlphaEvolve已经展示了「LLM生成候选加自动评测器筛选加验证门」的闭环,它的Verilog rewrite进了TPU产线。当这种闭环从单个模块扩展到整个系统,现有的阶段划分就会开始瓦解。
但这不意味着明天就能实现。从AI4EDA到AI-Native,中间隔了MCP Gateway、tool contract、Agent Runtime、memory治理、trace replay、evaluation harness,一整套工程基础设施。模型只是其中一环。
所以我的判断是,现阶段做好Agentic EDA的工程基础设施,就是在为AI-Native做准备。那些现在投入EDA data engineering、tool gateway、trace replay和design knowledge graph的企业,未来更强模型一接入就能起飞。没有这些基础设施的,换再强模型也停在演示层。
Agent提速。工具验证。人类签责。
这三句话在AI-Native时代依然成立。只是提速的含义会变,不是让现有流程跑得更快,是让新的流程成为可能。
本文五维定位
AI+芯片|Agent Runtime架构 + EDA流程Agent化 + 商业/研究全景地图
AI工具|MCP Gateway / Triage Agent / Formal-first RTL Agent
AI思想|现有EDA flow是临时状态,AI-Native将重新定义设计流程
AI伦理|vendor claim必须与可复现实验区分,签核责任不可消失
AI与人|Agent提速,工具验证,人类签责
芯片人-晒 AI 笔记
做了多年芯片,现在用芯片的视角看AI
如果觉得不错,随手点赞、在看、转发三连。我们下次再见。

浙公网安备 33010602011771号