20 TOPS 外挂算力到位,迅为iTOP-RK3588/RK3576 正式解锁端侧大模型部署

端侧大模型的算力缺口正在扩大

端侧大模型落地正在全面加速。储能系统的智能告警、工业产线的视觉质检、服务机器人的实时交互——这些场景对本地推理的需求已经从"可有可无"变成"业务刚需"。但一个现实问题是:RK3588、RK3576 等主流主控虽已集成 NPU,在面对 3B 以上大语言模型时,片外内存带宽成为绕不开的瓶颈——模型参数搬运速度跟不上 NPU 计算吞吐,算力再强也无法充分释放。

 

迅为电子的解决方案是:主控不动,外挂算力

 

RK182X是瑞芯微面向大模型推理场景打造的业界首款3D堆叠AI协处理器,定位为端侧大模型算力加速方案,专门解决大模型在边缘设备上部署时的带宽瓶颈与算力不足问题。

 

迅为iTOP-RK3588 与 iTOP-RK3576 开发板现已完成瑞芯微 RK1820、RK1828 AI 协处理器的适配验证。这款算力卡通过板载 M.2 插槽直连主控,PCIe 高速总线通信,为端侧大模型推理提供专用算力通道,不抢占主控 CPU 与 NPU 资源。

 

 

 

 

 

3D 堆叠拉到1TB/s 带宽破解大模型数据搬运困

 

RK182X 系列采用 3D 堆叠封装工艺,将高带宽 DRAM 垂直集成于计算芯片上方,片上内存带宽理论值达1TB/s,较传统片外 DDR 方案提升约 10 倍。这一架构的核心价值在于:大模型推理时最耗时的"数据搬运"环节被极大压缩,NPU 无需等待数据就位,计算效率显著提升。

迅为RK182X系列目前提供(M.2模组)两款型号:

迅为RK1820/RK1828 (M.2模组)

两款型号峰值算力一致,DRAM 容量差异决定了可承载的模型规模上限。RK1820 面向轻量化部署,RK1828 面向 7B~8B 级多模态模型。

模型生态:40+ 主流模型完成适配

RK182X 算力卡已全面适配主流大语言模型、多模态模型、视觉模型与声音模型,覆盖端侧 AI 主要应用方向。以下是完整适配模型列表:

■ LLM 大语言模型
Qwen2.5-0.5B、Qwen2.5-1.5B、Qwen2.5-3B、Qwen2.5-7B、Qwen3-0.6B、Qwen3-1.7B、Qwen3-4B、Qwen3-8B、HY-MT1.5-1.8B、Youtu-LLM-2B、GLM-Edge、Gemma4、Qwen3-Reranker-0.6B、Qwen3-Reranker-4B、Qwen3-Embedding-4B


■ VLM 多模态模型
Qwen2.5-VL-3B、Qwen2.5-VL-7B、Qwen2.5-Omni-3B (Thinker)、Qwen3-VL-2B、Qwen3-VL-4B、FastVLM-1.6B、InternVL3-2B、InternVL3.5-4B、MiMo-VL-7B-RL、SmoVLM、SmoVLM2、UI_TARS、PaddleOCR-VL、gme-Qwen2-VL-2B


■ CNN / 视觉模型
SigLIP、SigLIP2、MetaCLIP2、DINOv2、DINOv3、MobileNetV1、MobileNetV2、ResNet-50、YOLOv5、YOLOv6、YOLOv8、YOLO-World、Diffusion Policy


■ 声音模型
GROOT、VITS、Qwen3-ASR、Qwen3-TTS、Whisper、SenseVoice、Zipformer

 

上述模型均可在 RK182X 算力卡上完成端侧推理部署。迅为提供的预转换模型库覆盖其中主流模型,到手即可直接运行,完整列表见配套资料包。

配套资料:完整手册目录

适配工作不止于驱动层面的打通。迅为围绕 RK182X 算力卡编写了完整的《RK1820 / RK1828 算力卡开发与部署指南》,以下为手册目录:

第1章 前言    

1.1 大模型发展趋势    

1.2 RK182X产品定位    

1.3 瑞芯微AI发展历程与双轨战略    

1.4 端侧大模型应用方向    

第2章 RK182X算力卡概述    

2.13D堆叠技术    

2.2 模组硬件    

第3章 RK182X SDK 1.0.4资料介绍    

3.1 SDK架构与目录概览    

3.2 SDK目录内容详解    

3.2.1 NPU核心开发套件    

3.2.2 官方文档和应用示例    

3.3 SDK编译    

第4章 搭建快速验证开发环境    

4.1 前提准备工作    

4.2 硬件与软件清单    

4.3 固件安装    

4.4 验证安装状态    

第5章 模型推理测试    

5.1 预转换模型说明    

5.2 CNN 模型测试    

5.3 LLM 模型测试    

5.4 性能模式调整    

5.5 使用aicp自动化测试脚本    

第6章 设备状态与调试    

6.1 rknn-smi 常用命令    

6.2 rknn-console工具    

6.3 多设备管理    

6.4 温控策略    

第7章rknn3-toolkit环境搭建和使用    

7.1 环境准备    

7.2 rknn3-toolkit安装    

7.2.1 直接安装    

7.2.2 conda虚拟环境安装    

7.3 模型转换    

7.3.1 CNN模型转换    

7.3.2 YOLOv5模型转换    

7.3.3 LLM模型转换    

7.4 连板推理    

第8章 rknn3-toolkit-lite环境搭建和使用    

8.1 安装rknn3-toolkit-lite    

8.1.1直接安装    

8.1.2 conda 虚拟环境安装    

8.2 mobilenet分类示例    

8.3 Qwen2.5对话示例    

8.4 Qwen3对话示例    

8.5 Qwen2.5VL多模态示例    

8.6 Qwen3VL多模态示例    

8.7 Gemma4多模态示例    

第9章 rknn3-model-zoo例程演示    

9.1目录结构与构建脚本   

9.2 安装编译工具    

9.2 模型下载和模型转换    

9.3 安装板端RKNPU3环境    

9.4 Python API推理    

9.5 CAPI推理    

9.6 自动化编译    

从硬件安装到模型部署、从 Python 原型验证到 C API 生产集成、从单卡调试到多设备管理,手册覆盖了完整的开发流程。开发者拿到板卡后,按照手册章节顺序操作即可完成全流程验证。

 

为什么选择迅为方案

① 即插即用

M.2 标准接口直插,预编译安装包一键部署,1~2 分钟环境就绪。

② 资料全跑通

RKNN3 SDK V1.0.4 全流程验证,手册从硬件到高级应用全覆盖。

③ 预转换模型库

40+ 主流模型预转换文件,到手即可推理。

④ 持续更新

后续深度测试系列,每期附带完整教程与数据。

系列预告:后续测试内容

本次适配公告为系列内容的首篇。接下来,迅为将发布 RK182X 系列算力卡的深度测试文章,涵盖大模型对话、视觉识别、OCR 文字识别、多路并发、功耗散热等方向。

 

适用硬件平台:

iTOP-RK3588 开发板 / 核心板(板载 M.2 Key-M 插槽)

iTOP-RK3576 开发板 / 核心板(板载 M.2 Key-M 插槽)

RK1820 / RK1828 算力卡(M.2 2280 形态)

posted on 2026-07-23 17:22  topeet  阅读(6)  评论(0)    收藏  举报

导航