芯片人-晒 AI 笔记:从AI4EDA到AI-Native,现有flow只是过渡期

一、三巨头同时亮牌

最近半年,EDA行业有点热闹过头了。

Cadence发了ChipStack AI Super Agent,号称能协调RTL生成、testbench创建、regression编排、debug、formal、UVM、signoff等多专业Agent,还搞了个「shared mental model」来捕获设计意图。Synopsys推出AgentEngineer,从L1到L5定义了自治等级,2026年Converge大会上宣称L4多Agent工作流已经落地。Siemens Fuse更直接,把RAG、MCP、Agent Skills、supervisor-worker架构、recovery loops、HPC集群、RBAC、audit全塞进一个平台。

三巨头同时亮出Agent牌,这不是巧合。

我做芯片做了很多年,看到这些消息的第一反应不是兴奋,而是一个很朴素的问题。这些Agent到底是个什么运行时?它们的「自治」边界在哪里?如果Agent生成的RTL有问题,谁兜底?

说实话,这些问题比Agent本身更值得关注。

图片

二、Agent不是聊天机器人加了工具

很多人对Agent的理解停留在「ChatGPT能调函数了」。这个理解差太远了。

说真的,Agent领域2025到2026年最重要的变化,不是又冒出一个新的prompting技巧,而是「Agent Runtime」正在成为独立的工程层。OpenAI的Agents SDK把agent loop、tools、handoffs、guardrails、sessions、tracing、MCP、human-in-the-loop和sandbox作为构建原语。MCP把Agent访问工具的接口标准化了。A2A进一步把Agent之间的协作协议化了。

你想想看,Claude Code、Codex CLI、LangGraph、CrewAI、AutoGen这些框架,它们的共同方向是什么?是把模型从「单次API调用」包进一个有状态、有权限、有工具、有记忆、有观测、有评测、有恢复能力的runtime。

框架之间的差异,越来越体现在,能不能长期运行,能不能隔离上下文,能不能多人协作,有没有可回放的trace,失败后能不能恢复,而不是单纯能不能调函数。

理论底座其实不复杂。ReAct让模型交替进行推理和行动,一边规划一边通过工具获取反馈。Reflexion把失败后的语言反馈写进记忆,下一轮就能少踩同样的坑。Tree of Thoughts和LATS把推理从单条链扩展成可搜索的思维树。这些理论构成了Agent Runtime的基本语义。

一个现代Agent系统通常包含八类核心抽象。这个表很枯燥,但对理解Agent架构至关重要。

抽象 解决的问题 EDA类比
Tool Call 让模型执行原子动作 run_verilator、query_sta
MCP 标准化外部工具接入 EDA MCP Gateway
Skill 封装可复用操作手册 RTL fix playbook
SubAgent 上下文隔离、权限收窄 DV triage子Agent
Memory 跨会话保存经验 项目知识库、known bugs
Hook 生命周期点的确定性控制 pre-tool permission、stop gate
Goal/Plan 把完成条件持久化 PPA closure objective
Plugin 打包分发一组工具和skill EDA agent pack

读这个表的关键不是记名词,而是看控制权在哪里。Tool、MCP、Skill、SubAgent多由模型主动选择。Hook、Goal、Acceptance Gate则是外层runtime对模型的约束。生产级Agent的可靠性,主要来自后者。

图片

三、从demo到生产,差了一个银河系

Agent领域有个很残酷的事实。同一个模型,在无状态、无权限、无验证的demo里表现很好,进入真实系统后可能因为工具描述不清、上下文爆炸、审批缺失和回滚失败而完全失控。

下面这张检查表是我从报告里摘出来的,它比框架选型更重要。

模块 必须回答的问题 EDA场景示例
目标状态 完成条件是否可机器判定? coverage >= 95%、WNS >= 0、lint clean
工具契约 工具输入输出是否强类型? run_formal(properties, timeout, design_hash)
权限 Agent是否拥有最小权限? 只能读PDK文档,不能导出netlist
审批 哪些动作不可自动执行? 启动全量regression、批准waiver
回放 失败能否复现? same seed + same commit可复现仿真失败
安全 prompt injection如何隔离? 用户上传spec不可改变系统策略

还有几个常见的反模式,我觉得值得说。

第一个是「万能Agent」。一个Agent读所有文档、调所有工具、做所有决策,结果是上下文爆炸、权限过大、错误定位不了。正确做法是按职责拆成supervisor加specialist agents。

第二个是「模型自评完成」。Agent说完成就停止,这在复杂任务里非常危险。必须有Stop hook加acceptance gate,用工具证据判定,不是模型说了算。

第三个是「无预算循环」。失败后无限重试,烧token、占license、卡HPC队列。必须设retry budget和降级策略。

四、三巨头的Agent牌桌

回到三巨头。它们的路线其实差异很大。

Cadence的ChipStack AI Super Agent最激进。公开描述强调多专业Agent协调,RTL、testbench、regression、debug、formal、UVM、signoff全覆盖,还搞了个shared mental model来维护设计意图。2026年又宣布跟NVIDIA OpenShell结合的Level-5 autonomous virtual engineer,号称能在安全沙箱里迭代到closure。

但坦率的讲,Level-5和autonomous这些词应该按vendor claim理解。它显示产业方向,但企业采用还得看可复现案例、工具链覆盖、权限治理和签核边界。

Synopsys的AgentEngineer把Agent描述为能reason、plan、learn、execute的工程加速器,提出L1到L5的自治层级。2026年Converge发布了L4 orchestrated multi-agent design and verification workflow。L4意味着多Agent编排,但具体覆盖哪些工具、数据闭环怎么建、可审计性如何,公开细节有限。

Siemens Fuse是三家里架构描述最详细的。RAG、multimodal EDA data、MCP、Agent Skills、supervisor-worker hierarchical planning、autonomous recovery loops、HPC、RBAC、audit、human checkpoints,覆盖了Catapult、Questa、Aprisa、Calibre等工具。听起来很全面,但也需要验证跨工具上下文饱和、权限和tool schema质量。

报告里有一句话我觉得特别到位。厂商发布中的「Level-4、Level-5、autonomous virtual engineer」应该明确标为vendor claim,跟可复现研究原型区分。芯片设计的最终证据来自可重复工具链,不是发布会PPT。

五、研究前沿在做什么

除了商业系统,学术界和工业研究实验室也在快速推进。有几个方向我觉得特别值得关注。

AlphaChip是AI for chip的标志性路线。它把芯片floorplanning建模为序贯决策游戏,策略模型在网格上逐个放置宏单元,用布局质量作为奖励信号优化。DeepMind公开资料称可以在数小时而不是数周内生成高质量布局,用于Google TPU。不过AlphaChip也有复现争议,企业解读时要把「已宣称的产业应用」和「可独立复现实验」分开。

AlphaEvolve代表另一条更适合EDA的路线。LLM产生代码候选,自动评测器负责正确性和性能评分,候选在进化循环中被选择、变异和保留。DeepMind提到它曾提出针对TPU矩阵乘法算术电路的Verilog rewrite,删除不必要bit,通过验证后集成到upcoming TPU。2026年更新称已成为优化下一代TPU的常规工具。

这两条路线的启发是,不要把所有问题都交给通用LLM。对可评分、可仿真、可搜索的问题,RL、进化搜索、贝叶斯优化和EDA heuristic仍然更适合。LLM的强项在于读规格、提候选、解释日志、组织搜索和写胶水代码。

ChipNeMo说明了一个重要事实,芯片设计的语言和通用软件不一样。RTL、netlist、EDA logs、timing reports都有特殊词法和上下文。NVIDIA用custom tokenizer、domain-adaptive预训练和domain-specific指令对齐,在assistant、脚本生成、bug摘要等任务上评估领域适配收益。

Circuit Foundation Models把范围扩大到多模态电路表征。电路图、netlist graph、RTL tokens、layout images、timing/power tables、waveforms都可以进入自监督预训练。这个方向离工业落地还远,但一旦成熟,会改变Agent理解电路的方式。

图片

六、EDA流程里哪些环节最该先上Agent

报告里有一张EDA流程分段机会地图,我觉得非常实用。它把从需求到签核的每个阶段都列出了高价值Agent任务和推荐自治等级。

流程阶段 高价值Agent任务 推荐自治
需求/规格 需求摘要、歧义识别、SVA草案 L1-L2
RTL设计 模块草稿、代码review、局部修复 L2-L3
数字验证 test plan、失败triage、coverage建议 L2-L4
形式验证 property生成、CEX解释、收敛建议 L2-L3
综合/STA 脚本生成、约束候选、违例分类 L1-L3
P&R floorplan探索、QoR归因、脚本候选 L2-L3
DRC/LVS 错误聚类、版图定位、修复建议 L1-L2
签核管理 风险dashboard、阻塞项、证据归档 L1-L2

有个规律很清晰。越靠近签核,自治等级越低。这是对的。

短期ROI最高的是Verification Triage Agent。它不直接改设计,而是把regression失败日志、seed、波形、coverage、commit diff聚类,生成root cause hypothesis、owner、最小复现和建议修复路径。安全风险低,价值高,非常适合第一阶段试点。

Formal-first RTL Agent也值得关注。原则是,任何生成RTL的行为都必须伴随验证意图。Agent生成RTL的同时生成SVA、测试计划和边界条件。验证失败时triage agent先判断是RTL bug、testbench bug、property bug还是spec ambiguity。

图片

七、企业怎么落地

说到底,企业不是买几个模型token就能用上Agent的。报告里给出了五步路线,我觉得非常务实。

第一步,建EDA MCP Gateway。把所有工具统一封装,Agent不能直接跑shell,只能调用Gateway暴露的受控接口。先提供只读接口,再逐步扩展。

第二步,上Verification Triage Agent。把失败聚类、归因、最小复现和证据包做出来。不动设计文件,只做分析和建议。

第三步,试Formal-first RTL Agent。从FIFO、arbiter、CSR这些标准化小模块开始。每个任务要求输出RTL加SVA加testbench加trace加coverage。验收条件由工具判定。

第四步,建QoR Goal Graph。围绕WNS、TNS、area、power、congestion等多目标,自动组织实验、归因和候选脚本。约束修改和签核仍由人批准。

第五步,Tapeout War Room Agent。把STA、DRC/LVS、IR/EM、waiver、owner和风险状态汇总成实时dashboard。Agent不替代签责,只负责证据整理和阻塞项追踪。

图片

八、有人说EDA公司会沦为设计服务,我审慎地看了看

最近在一个行业群里看到一种说法。大意是,以后不会有大的EDA公司了,小的EDA最终都会沦为设计服务公司。理由是验证最费人又最依赖数据经验,而数据经验在AI面前是最容易被蒸馏的。还拿当年深圳PCB做类比,说长尾效应还会持续几年,爆发期还没到。

这个判断方向上有共鸣,但有几个地方需要拆开看。

说对的部分,验证确实是芯片设计里最费人的环节,占50到70%的人力。而且验证是典型的经验密集型工作,known bugs库、failure pattern、coverage策略、waiver判断,全靠工程师脑子里的积累。这些东西确实最容易被Agent distill。报告把Verification Triage Agent列为短期ROI最高的试点,逻辑跟这个判断完全一致。

但「不会有大EDA公司」太绝对了。Cadence、Synopsys、Siemens的护城河不只是工具本身,有三样东西AI短期内蒸馏不了。

第一,foundry签约关系。PDK数据、characterization、signoff certification,是多年联合开发堆出来的,不是数据集能替代的。

第二,signoff法律地位。芯片出了bug要追责,foundry只认certified flow。Agent生成的结果再好,没有signoff chain of custody,产线不敢用。

第三,客户lock-in。一个SoC团队的脚本库、flow cookbook、约束模板全部绑在特定工具上,迁移成本极高。

而且三巨头不是在防守,是在主动转型。Cadence的ChipStack、Synopsys的AgentEngineer、Siemens的Fuse,是把工具公司升级成AI-Native EDA平台公司。它们想吃的不是现有蛋糕的一块,是新蛋糕的全部。

「数据经验最容易蒸馏」也大幅低估了。EDA数据不是普通文本日志。timing report的path hierarchy、waveform的多维信息、coverage的交叉关联、PDK参数的敏感性,是多模态、高度结构化、强context-dependent的。报告里说得很清楚,EDA data engineering是整个Agent落地里最难的环节,不是最容易的。

PCB类比方向上对,PCB确实经历了从高端手艺到工具普及的commoditization。但量级差了。PCB是2D routing加少量SI分析,芯片是十亿晶体管级别的3D集成加multi-physics加多domain timing。PCB的commoditization花了15年,芯片只会更长。

说到底,这种看法的核心是悲观叙事。AI蒸馏掉经验壁垒,EDA公司失去价值,沦为服务。

我看到的则是另一面。AI重新定义设计流程,现有flow是过渡态,新的参与者和价值会在AI-Native时代重新出现。验证确实是第一张倒下的多米诺骨牌。但倒下之后是连锁崩塌还是重建格局,取决于谁能先把Agent基础设施建起来。

九、从AI4EDA到AI-Native,现有flow只是过渡期

报告里有个三阶段框架,我觉得值得展开讲。

第一阶段是AI4EDA。AI在现有工具旁边做点状预测和优化,PPA预测、congestion预测、参数调优。这些已经用了好几年了,你我都在用。

第二阶段是Agentic EDA。Agent跑进现有工具闭环里,读规格、生成脚本、跑工具、解析日志、修复错误。三巨头现在亮出的牌都在这一层。

第三阶段是AI-Native Design。这一步不是让AI跑得更快,是重新定义什么叫设计流程。

现有EDA流程,从spec到RTL到gate到GDS的线性pipeline,是Agent到来前的一个临时状态。Agent足够成熟后,我们可能不再需要把设计切成spec、RTL、验证、综合、P&R这些独立阶段。Agent可能把规格直接编译成可验证的候选实现,工具验证嵌入生成循环内部,人只在关键决策点介入。

这不是科幻。AlphaEvolve已经展示了「LLM生成候选加自动评测器筛选加验证门」的闭环,它的Verilog rewrite进了TPU产线。当这种闭环从单个模块扩展到整个系统,现有的阶段划分就会开始瓦解。

但这不意味着明天就能实现。从AI4EDA到AI-Native,中间隔了MCP Gateway、tool contract、Agent Runtime、memory治理、trace replay、evaluation harness,一整套工程基础设施。模型只是其中一环。

所以我的判断是,现阶段做好Agentic EDA的工程基础设施,就是在为AI-Native做准备。那些现在投入EDA data engineering、tool gateway、trace replay和design knowledge graph的企业,未来更强模型一接入就能起飞。没有这些基础设施的,换再强模型也停在演示层。

Agent提速。工具验证。人类签责。

这三句话在AI-Native时代依然成立。只是提速的含义会变,不是让现有流程跑得更快,是让新的流程成为可能。


本文五维定位

AI+芯片|Agent Runtime架构 + EDA流程Agent化 + 商业/研究全景地图
AI工具|MCP Gateway / Triage Agent / Formal-first RTL Agent
AI思想|现有EDA flow是临时状态,AI-Native将重新定义设计流程
AI伦理|vendor claim必须与可复现实验区分,签核责任不可消失
AI与人|Agent提速,工具验证,人类签责

芯片人-晒 AI 笔记

做了多年芯片,现在用芯片的视角看AI

如果觉得不错,随手点赞、在看、转发三连。我们下次再见。

posted @ 2026-08-03 20:47  芯片人-晒AI笔记  阅读(7)  评论(0)    收藏  举报