一、引言:从"推理"到"Agent",NPU 架构的范式迁移

2026 年世界人工智能大会(WAIC 2026)上,安谋科技首次曝光面向 Agentic AI(智能体 AI)时代的新一代 NPU 架构——"周易"X3-Pro,并牵头发起开源 AI 操作系统联盟 AIOS,同时展示了基于自研星辰 CPU 与 Arm Ethos 搭建的首代星辰 300 异构计算平台

这三件事并非孤立发布,而是同一个技术意图的三个切面:向 Agentic AI 时代提供异构计算基础设施

过去十年,NPU 的设计目标围绕"单次推理吞吐"展开——CNN 卷积、Transformer 注意力、KV Cache 都是在追求"把一个模型跑得更快、更省电"。而 Agentic AI 改变了负载形态:

  • 负载从"单轮推理"变为"多轮编排":一个 Agent 任务包含感知→规划→工具调用→反思→再推理的循环,NPU 不再只跑一个固定子图,而是在多个异构算子图之间频繁切换。
  • 延迟敏感度从吞吐敏感变为尾延迟敏感:Agent 的交互范式从"回合制对话"走向"持续感知与具身互动",用户体感由 P99 尾延迟决定,而非平均吞吐。
  • 算力从"单核压榨"变为"异构协同":CPU 负责编排/工具调用/沙箱、NPU 负责模型推理、GPU 负责可编程算子,三者必须真正共享内存、低开销调度。

周易 X3-Pro 正是在这一背景下被设计出来。理解它,需要先理解其技术基座——Arm Ethos-U 系列,以及安谋科技在 Arm 架构上的本土化自研路径。


二、周易 NPU 架构技术演进:X1 → X2 → X3-Pro

2.1 周易架构的设计哲学

安谋科技 NPU 产品线首席架构师舒浩博士对 X3-Pro 的定义是三个关键词:统一的、分层的、场景化的计算架构。这三个词揭示了周易架构区别于"纯算力堆叠"型 NPU 的核心:

  • 统一:用一套指令/算子抽象覆盖 CNN、Transformer、Agent 控制流,避免"一个模型一套加速器"的碎片化。
  • 分层:计算单元(MAC/张量阵列)、片上存储(SRAM/寄存器堆)、控制处理器(标量核)三层解耦,可按场景独立扩展。
  • 场景化:不再是"一颗 NPU 打天下",而是面向边缘 Agent、端侧多模态、云端推理等不同场景给出可配置的宏架构。

2.2 三代演进对比

下表为周易三代 NPU 的架构能力演进(X1/X2 规格为基于公开 IP 演进路径的工程分析,X3-Pro 为发布会披露方向):

维度 周易 X1(初代) 周易 X2(改进) 周易 X3-Pro(Agentic)
架构理念 单一推理加速 IP 算力/能效双优化 统一·分层·场景化
主攻负载 CNN 视觉推理 CNN + 轻量 Transformer Transformer + Agent 控制流
MAC 阵列规模 中小规模(百级 MAC/cycle) 可配置扩展(向千级 MAC 演进) 大规模可配置 + 分层阵列
数据精度 INT8 为主 INT8 + 部分 INT16/FP16 INT4/INT8/INT16/FP16 全栈 + 混合精度
稀疏计算 无/弱支持 结构化稀疏 硬件原生 2:4 稀疏 + 非结构化稀疏
动态形状 静态 shape 优先 部分动态 原生动态 shape + 动态控制流
Transformer 支持 间接(拆解为 GEMM) 软件适配 原生(注意力/KV Cache/MoE 路由)
Agent 特性 工具调用加速、长上下文压缩、多图切换
典型场景 端侧视觉 端云推理 边缘 Agent、多模态、具身智能

可以看到,演进主线不是单纯"加 MAC",而是从"算子加速器"演进为"负载感知的异构计算引擎"。X3-Pro 的关键跃迁在于:把 Agent 工作流中频繁出现的"控制流跳转、动态 shape、多模型切换、KV Cache 管理"纳入硬件一等支持,而非交给 CPU 软件模拟。


三、周易 X3-Pro NPU 架构深度剖析

3.1 整体架构图

flowchart TB subgraph HOST["主机侧 / 控制平面"] CPU["星辰 CPU(Cortex-A/M 类)"] DRV["NPU 驱动 / Task Scheduler"] end subgraph NPU["周易 X3-Pro NPU 核"] CTL["控制处理器<br/>Scalar Core + 取指/译码<br/>控制流调度、动态 shape 解析"] DMAC["DMA 引擎<br/>权重/激活搬运、双缓冲"] SRAM["片上 SRAM<br/>分层:Weight Cache / Act Cache / KV Cache 池"] BUS["片内互联总线<br/>NoC + AXI 总线矩阵"] subgraph COMP["计算单元簇"] MAC["MAC 阵列<br/>INT8/INT16/FP16 乘加"] TENSOR["张量核/矩阵单元<br/>大矩阵 GEMM、注意力"] SPARSE["稀疏计算单元<br/>2:4 结构化稀疏压缩/解压"] VEC["向量/标量后处理<br/>激活、归一化、量化反量化"] end POOL["算子融合引擎<br/>Conv+BN+ReLU 融合、MoE 路由加速"] AGENT["Agent 加速单元<br/>多图切换上下文、工具调用前处理"] end subgraph MEM["系统内存域"] DRAM["LPDDR / DDR DRAM"] SMEM["共享 SRAM / 一致性域"] end CPU --> DRV --> CTL CTL --> BUS BUS --> DMAC DMAC <--> SRAM SRAM <--> BUS BUS --> COMP MAC --> VEC TENSOR --> VEC SPARSE --> MAC VEC --> POOL POOL --> AGENT BUS <-->|AXI/ACE 一致性| SMEM SMEM -.-> DRAM DMAC <--> DRAM

3.2 关键模块解析

控制处理器(Scalar Core):X3-Pro 的差异化核心。传统 NPU 的控制核只做命令分发,X3-Pro 将其提升为"控制流解释器",原生解析动态 shape、循环、分支与多图切换。这使得 Agent 工作流中的条件跳转(如"是否调用某工具")无需回退到 CPU,显著降低跨核切换的尾延迟。

MAC 阵列与张量核分层:底层 MAC 阵列负责高密度 INT8/INT16 乘加(对应卷积与小 GEMM),上层张量核负责大矩阵运算与注意力。这种"分层阵列"正是"分层架构"的硬件体现——小算子走 MAC,大算子走张量核,避免大马拉小车。

稀疏计算单元:2:4 结构化稀疏在硬件层面跳过零值权重,理论上对稀疏模型吞吐翻倍;配合非结构化稀疏的位图压缩,可在 Agent 推理的 MoE 专家路由场景中显著降低有效计算量。

片上 SRAM 分层:区分 Weight Cache、Activation Cache 与 KV Cache 池。KV Cache 池是面向长上下文 Agent 的关键设计——长对话场景下 KV Cache 是显存大头,专门池化可避免与权重争夺 SRAM 带宽。

Agent 加速单元:负责多图上下文切换、工具调用结果的前处理(如 JSON 解析辅助、embedding 对齐),把 Agent 编排中频繁但零碎的"胶水计算"就近卸载,减少 CPU↔NPU 往返。

3.3 架构设计原理

3.3.1 MAC 阵列与数据复用

MAC 阵列采用脉动阵列(Systolic Array)变体,兼顾输入复用、权重复用与输出复用。对卷积层利用 IM2COL+GEMM 映射;对 Transformer 的 QKV 投影与 FFN 走张量核的大 GEMM;对注意力 Score/Softmax 走向量后处理单元。数据流调度器(在控制处理器内)根据算子类型选择复用模式,最大化 SRAM 带宽利用率。

3.3.2 稀疏计算

X3-Pro 支持结构化 2:4 稀疏(每 4 个权重最多 2 个非零,硬件掩码压缩)与非结构化稀疏(位图+游程编码)。对 Agent 场景价值在于:MoE(混合专家)模型中每个 token 只激活少数专家,稀疏单元可直接跳过未激活专家的整块计算,把"稀疏路由"从软件模拟变为硬件零开销。

3.3.3 量化支持

全栈精度:INT4(极致压缩端侧小模型)、INT8(主力推理)、INT16(高精度激活,如音频/语音)、FP16(训练-推理一致性与数值敏感算子)。混合精度路径允许同一子图内不同算子用不同精度,由编译器在精度损失与吞吐间权衡。

3.3.4 动态形状

传统 NPU 对静态 shape 优化极致,但 Agent 负载天然动态:变长文本输入、可变工具返回、动态 beam search。X3-Pro 的控制处理器原生支持动态 shape 张量分配与地址重计算,无需为每种长度重编译图,这是"统一架构"覆盖多场景的前提。


四、技术基础参考:Arm Ethos-U 系列架构分析

周易 NPU 与 Arm Ethos 在安谋科技产品线中是"自研 + 授权"协同关系,理解 Ethos-U 有助于看清周易的技术基座。

4.1 Ethos-U85 架构要点

Arm Ethos-U85 是面向边缘 AI 推理的微 NPU,其公开规格为:

  • 算力可扩展:128–2048 MAC/cycle,对应 256 GOPS–4 TOPS(@1GHz)。
  • 精度:INT8 权重 + INT8/INT16 激活,适配视觉与对精度敏感的音频场景。
  • 稀疏:硬件原生 2:4 稀疏,对特定网络吞吐翻倍;权重压缩可减少约 70% 模型体积。
  • 片上 SRAM:29–267 KB 可配置。
  • Transformer 原生:首次原生支持 Transformer 架构网络,与 CNN/RNN 统一。
  • 生态:遵循 TOSA(Tensor Operator Set Architecture)标准,集成于 Corstone-320 子系统,可与 Cortex-A / Cortex-M / Mali GPU 协同。
  • 能效:较上一代 Ethos-U 能耗降低约 20%。

4.2 与周易的关系

Ethos-U 提供了成熟的"MAC 阵列 + 稀疏 + TOSA 算子集 + Corstone 子系统"基座;周易则在 Arm 架构授权基础上做本土化创新:扩展控制处理器以支持动态控制流、增加 KV Cache 池与 Agent 加速单元、强化多模态数据流。可以说,Ethos-U 是"推理加速器"范式的高完成度实现,周易 X3-Pro 是在此之上向"Agent 计算引擎"范式的演进。首代星辰 300 平台采用 STAR-MC2(Cortex-M52)+ Ethos-U55,正是这种"基座验证 → 自研演进"路径的起点。


五、星辰 300 异构计算平台架构

5.1 平台架构图

flowchart LR subgraph SOC["星辰 300 异构 SoC(Armv8.1-M / Helium)"] CPU["星辰 CPU<br/>STAR-MC2 (Cortex-M52)<br/>+ Helium 矢量扩展"] NPU["周易 / Ethos-U55 NPU"] VPU["VPU 视频处理"] ISP["ISP 图像处理"] BUS2["AMBA AXI 互联矩阵"] SRAM2["共享片上 SRAM"] PERI["外设: SPI/I2C/UART/PCIe"] end subgraph EXT["外部"] DRAM2["LPDDR DRAM"] SENSOR["摄像头/麦克风/传感器"] end CPU <--> BUS2 NPU <--> BUS2 VPU <--> BUS2 ISP <--> BUS2 PERI <--> BUS2 BUS2 <--> SRAM2 BUS2 <--> DRAM2 SENSOR --> ISP SENSOR --> VPU

5.2 平台定位

星辰 300 是 AIoT 原型平台,采用 Armv8.1-M 架构,搭载 STAR-MC2 核心并集成 Helium 矢量扩展,配合 Ethos NPU,从传统 MCU 拓展出 AI 算力,面向物联网边缘侧嵌入式设备。它验证了"星辰 CPU + 周易/Ethos NPU + Helium + 互联"的异构组合可行性,是后续大算力平台的设计模板。

5.3 关键技术点

  • Helium 矢量扩展:Armv8.1-M 的 M-Profile Vector Extension,给 MCU 提供标量/向量算力,处理 NPU 不擅长的零碎控制与轻量算子。
  • 统一 AMBA AXI 互联:CPU、NPU、VPU、ISP 共享 AXI 矩阵,是异构协同的物理基础。
  • 共享 SRAM + 外部 DRAM 两级存储:热数据驻留共享 SRAM,大模型权重放 DRAM,由 NPU DMA 双缓冲掩盖延迟。

六、NPU 与 CPU/GPU 的异构协同分析

异构计算的难点不在"把算力做大",而在三个异构核之间如何低开销协同。

6.1 任务调度

  • 粗粒度调度(CPU 主导):CPU 上的 Agent 编排器决定"下一步跑哪个模型/工具",把子图下发 NPU。
  • 细粒度调度(NPU 内部):X3-Pro 控制处理器在核内完成算子级调度、动态 shape 解析、多图切换,避免每个算子都回 CPU。
  • GPU 补位:可编程性强的算子(自定义激活、动态稀疏 Attention 变体)交给 GPU,NPU 专注高密度规则算子。

这种分层调度的价值:把"跨核往返"从算子级降到子图级,是降低 Agent 尾延迟的关键。

6.2 数据共享

零拷贝是异构协同的灵魂。通过统一虚拟地址与共享 buffer 句柄,NPU 输出可直接作为下一阶段输入,无需 CPU 中转拷贝。对于 Agent 的"推理→工具调用→再推理"循环,零拷贝可省去每轮几 KB~几 MB 的内存搬运。

6.3 内存一致性

Arm 体系通过 AMBA AXI/ACE(AXI Coherency Extensions) 提供硬件一致性:

  • ACE 全一致性:CPU cluster 与 NPU 共享同一一致性域,硬件维护 cache 一致性,NPU 可直接读 CPU 最新写入。
  • I/O 一致性(IO-coherent):NPU 的 DMA 访问经互联自动感知 CPU cache 状态,避免显式 cache 维护指令(clean/invalidate),减少同步开销。

对 Agent 场景,一致性意味着"工具返回结果写入 → NPU 立即可见"无需显式刷 cache,直接缩短端到端延迟。这正是星辰 300 选择统一 AMBA 互联的工程理由。


七、Agentic AI 场景的 NPU 需求分析

Agentic AI 对 NPU 提出了区别于传统推理的四类硬需求:

7.1 多模态

Agent 需同时处理视觉、语音、文本。X3-Pro 的统一算子集需覆盖卷积(视觉)、MFCC/Conv1D(语音)、Attention(文本/多模态)。难点是不同模态算子的数据布局与复用模式差异大,分层阵列 + 统一 SRAM 池是平衡点。

7.2 长上下文

长对话/长文档下 KV Cache 膨胀是首要瓶颈。X3-Pro 的应对:专用 KV Cache 池 + 量化压缩(INT4 KV)+ 稀疏注意力加速。这把"长上下文"从纯显存问题变为"SRAM 分层 + 稀疏计算"的协同问题。

7.3 工具调用

工具调用引入控制流不确定性:调不调、调哪个、返回多长。X3-Pro 的控制处理器原生支持动态控制流与多图切换,把"工具调用→结果回灌→再推理"的循环尽可能留在 NPU 内闭环。

7.4 低延迟(尾延迟)

Agent 体感由 P99 决定。降低尾延迟的手段:① 多图切换零开销(Agent 加速单元);② 一致性内存免刷 cache;③ 稀疏跳过未激活专家/MoE 路由;④ DMA 双缓冲掩盖访存。这套组合拳正是 X3-Pro 区别于"高吞吐 NPU"的本质。


八、AIOS 开源联盟的技术定位分析

8.1 AIOS 架构:三大核心引擎

安谋科技市场及生态副总裁梁泉指出,AIOS 架构包含三个核心模块:

  • 模型引擎(Model Engine):负责推理执行与端云协同路由,决定模型在端侧 NPU 还是云端跑、何时卸载。
  • Agentic Engine:负责多轮工具调用与任务编排,是 Agent 行为的中枢。
  • DataFlow 引擎:负责多模态数据流处理,串联传感器→模型→工具→输出的数据通路。

三者对应"算力—编排—数据"三层,恰好与异构硬件(NPU—CPU—VPU/ISP)形成镜像映射。

8.2 OS 范式迁移:从"工具型"到"智能体型"

AIOS 的核心判断是:操作系统正从传统"工具型"(被动响应应用调用)向"智能体型"(主动感知、规划、行动)演进。传统 OS 的进程/文件/IPC 抽象不足以承载 Agent 的"持续感知 + 多轮编排 + 工具沙箱"需求,需要新的中间层。

8.3 与其他 AI OS 的定位对比

维度 AIOS(安谋牵头) 云侧 AI OS 类方案 端侧推理框架类
定位 端侧 AI 原生 OS 中间层 云原生 AI 调度 单设备推理运行时
核心抽象 模型引擎+Agentic+DataFlow 任务/资源编排 算子图执行
硬件耦合 强(异构算力调配、NPU 调度) 弱(云资源池) 中(单设备算子)
开放性 开源联盟 + 极术社区 多为厂商栈 开源框架
落地试点 家用机器人/工业智能装备/AI 穿戴 云服务 单 App

联盟规划四项核心工作:① 联合研发 AIOS 核心组件,攻克异构算力调配、多模态数据互通;② 全线开源系统代码与开发工具;③ 聚焦家用机器人、工业智能装备、AI 穿戴设备试点;④ 推动自研技术接轨海内外行业标准。

注:用户提及的 ANOLISA 类参考方案在公开资料中尚无统一共识定义,本文以"端侧 AI 原生 OS 中间层"作为 AIOS 的横向定位基准,避免对未公开规范的臆测。

AIOS 的技术独特性在于:它是少数从硬件异构调度反向定义 OS 抽象的方案——模型引擎直接对接 NPU 调度、DataFlow 对接 VPU/ISP、Agentic 对接 CPU 编排,使 OS 层与硅底层同构,这是 IP 公司牵头做 OS 的天然优势。


九、竞品 NPU 对比

维度 周易 X3-Pro Arm Ethos-U85 NVIDIA NVDLA 寒武纪 MLU(思元系列) 地平线 BPU(征程5/贝叶斯)
定位 端侧 Agent NPU IP 边缘微 NPU IP 开源 DLA 参考设计 云端/端侧训练推理芯片 车规智驾 SoC NPU
形态 可授权 IP 可授权 IP 开源 RTL 整芯片 整芯片
算力(量级) 可配置,面向 Agent 负载 256 GOPS–4 TOPS@1GHz 模块化可配 数十~数百 TOPS(INT8) 128 TOPS(征程5)
MAC 规模 分层可配置阵列 128–2048 MAC/cycle 2 核×8 MAC×64 mul 张量核+向量核,TP/MTP 贝叶斯架构阵列
精度 INT4/8/16/FP16 INT8 权重+INT8/16 激活 INT16 乘法为主 INT8/16/FP 混合 INT8 为主
稀疏 2:4+非结构化 2:4 硬件原生 无原生稀疏 硬件融合 概率推断优化
Transformer 原生 原生(U85 起) 需拆解为卷积/矩阵 原生 原生(BEV/占用网络)
Agent 特性 多图切换/KV 池/工具加速 偏云端编排 偏感知
一致性 AMBA AXI/ACE AMBA/Corstone 总线接口 NoC 片上网络 车规总线
开放度 授权+联盟生态 授权 IP 完全开源 整芯片+工具链 整芯片+工具链
生态 AIOS/极术社区 TOSA/Corstone 开源社区 NeuWare/MagicMind TogetherOS

对比要点

  • vs Ethos-U85:周易在 Ethos 基座上强化控制流与 Agent 特性,Ethos 在纯推理能效与生态成熟度上更稳。
  • vs NVDLA:NVDLA 是"教学/参考级"开源 DLA(卷积核+SDP/PDP/CDP 流水线),缺乏稀疏与 Agent 支持,胜在完全开源可改。
  • vs 寒武纪 MLU:MLU 是整芯片路线(TP/MTP 集群、Chiplet、张量+向量核),算力上限更高但功耗/形态偏云端;周易是 IP 路线,灵活可集成。
  • vs 地平线 BPU:贝叶斯架构面向车规感知(BEV+占用网络、ISO 26262 ASIL-B),场景专精;周易面向通用 Agent,可配置性更广。

十、边缘 Agent 部署架构分析

10.1 端云协同部署架构

flowchart TB subgraph EDGE["边缘 Agent 设备(星辰300/周易 X3-Pro)"] SENSE["感知层: 摄像头/麦克风/IMU"] DF["DataFlow 引擎: 多模态前处理"] ME["模型引擎: 端侧推理 (NPU)"] AE["Agentic Engine: 规划/工具调用 (CPU)"] TOOLS["本地工具沙箱"] KV["端侧 KV Cache / 记忆"] end subgraph CLOUD["云端"] LLM["大模型推理集群"] KNOW["知识库/RAG"] TOOLS2["云端工具/API"] end SENSE --> DF --> ME ME <--> AE AE --> TOOLS AE <--> KV ME <-->|端云路由: 大模型/复杂推理卸载| LLM AE <-->|RAG 检索| KNOW AE <-->|云端工具调用| TOOLS2

10.2 关键设计

  • 端云路由(Model Engine):小模型/高频推理留端侧 NPU(低延迟、省流量、隐私),大模型/复杂推理卸载云端。路由策略由负载大小、延迟预算、网络条件动态决定。
  • 本地工具沙箱:Agent 工具调用在端侧 CPU 沙箱执行,敏感数据不出端;需强算力时再走云端 API。
  • 端侧记忆与 KV Cache:长对话 KV 压缩驻留端侧 SRAM/DRAM,避免每轮重算,是 Agent 持续交互的能效关键。
  • 隐私与离线:感知数据(图像/语音)在端侧 DataFlow 引擎处理后只上传语义结果,满足隐私与离线可用性。

10.3 部署形态映射

  • 家用机器人:星辰 CPU 编排 + 周易 NPU 多模态推理 + 端云路由大模型。
  • 工业智能装备:强调实时性与确定性,端侧闭环为主,云端做长周期优化。
  • AI 穿戴设备:极致低功耗,端侧小模型(INT4)+ 关键词触发云端。

十一、总结与展望

周易 X3-Pro 的技术意义,不在于又一次"TOPS 数字游戏",而在于它把 NPU 的设计目标从"把一个模型跑快"转向"把一个 Agent 工作流跑顺"。这一转向体现在四个架构决策:

  1. 控制处理器升级为控制流解释器——动态 shape、多图切换、工具调用循环就近闭环,降低跨核尾延迟。
  2. 分层阵列 + KV Cache 池——兼顾小算子密度与长上下文显存压力。
  3. 原生稀疏 + 混合精度——适配 MoE 路由与端侧小模型压缩。
  4. AMBA 一致性互联——让 CPU/NPU/GPU 真正零拷贝、免刷 cache 协同。

配合星辰 300 异构平台验证与 AIOS 开源联盟的 OS 中间层定义,安谋科技试图构建的是一条"硅底层(异构 IP)— OS 中间层(AIOS)— 应用层(Agent)"垂直对齐的端侧 Agent 技术栈。这与"昇腾管推理、鲲鹏管 Agent"的云端分工形成镜像:在端侧,周易 NPU 管推理、星辰 CPU 管 Agent 编排,异构协同替代单核压榨。

展望未来,端侧 NPU 的竞争焦点将逐步从峰值算力转向三件事:Agent 尾延迟优化能力、异构内存一致性效率、动态负载的算子图调度灵活性。周易 X3-Pro 在这三个方向上给出了明确的架构回答,其能否真正定义 Agentic AI 时代的端侧算力范式,最终取决于 AIOS 生态的落地速度与工具链成熟度——而这,正是开源联盟要回答的下一个问题。


参考资料:WAIC 2026 安谋科技发布会公开报道;Arm Ethos-U85 产品简报与官方文档;NVDLA 开源架构文档;寒武纪/地平线公开架构资料。本文技术分析部分基于公开信息与 NPU 架构工程原理推导。