260721-kyber-dilithium-hw-2025-2026-survey
260721 Kyber/Dilithium (ML-KEM/ML-DSA) 硬件加速器新增文献(2025–2026)
来源:paper-fetch 对 CCF A/B 会议 + CCF A 期刊(CCS/S&P/USENIX Security/NDSS/ISCA/MICRO/ASPLOS/EUROCRYPT/CRYPTO/CHES(TCHES)/DAC/ICCAD/DATE/FCCM/FPGA/FPL/ReConFig/HPCA/ESORICS/TC/TCAD/TIFS/TDSC)2025–2026 两年的 gather,关键词覆盖 kyber/dilithium 及 NIST 定名后的 ml-kem/ml-dsa。已归入 pqc-ntt-arch topic(staging/pqc-ntt-arch/<slug>/)。8 篇现已全部拿到正文 PDF(2 篇首轮就有:TCHES 直链、ACM 一篇走 QUB 机构知识库开放获取版;其余 6 篇 IEEE Xplore 首轮只抓到摘要页,登录 IEEE Xplore 账号后二次抓取补全全文)——下面每篇"读全文后补充"是二次抓取拿到全文后新增的细节,之前只有摘要时写的部分保留在上面不变。markitdown 对两栏排版 PDF 的表格解析有乱码(尤其 #1),涉及的资源数字未强行摘录以免读错。
算法范围一览
| # | 论文 | Kyber/ML-KEM | Dilithium/ML-DSA |
|---|---|---|---|
| 1 | MDC-NTT Dilithium (TC'25) | ✅ | |
| 2 | LightHD (TC'26) | ✅ | |
| 3 | Plantard-NTT (TC'26) | ✅ | ✅ |
| 4 | OpenTitan OTBN (S&P'25) | ✅ | ✅ |
| 5 | ML-DSA-OSH (DATE'26) | ✅ | |
| 6 | PQCUARK (DATE'26) | ✅ | ✅ |
| 7 | ML-KEM 三层加速器 (TECS'25) | ✅ | |
| 8 | OpenTitan OTBN 改进版 (TCHES'26) | ✅ | ✅ |
只做 Kyber/ML-KEM:#7(唯一一篇单独做 Kyber 的)
只做 Dilithium/ML-DSA:#1、#2、#5
两者都做:#3、#4、#6、#8(4 篇里 3 篇是"通用底层算子加速"路线——NTT 硬件或 ISA 扩展本身对 Kyber/Dilithium 通用,天然覆盖两者;#4/#8 的 OTBN 向量指令同理)
1. High-Performance Hardware Implementation of Crystals-Dilithium Based on Improved MDC-NTT [Dilithium/ML-DSA]
- Venue:TC(IEEE Transactions on Computers,CCF A 刊)Vol.74 No.9,2025-09;DOI
10.1109/TC.2025.3576934 - 作者:Yijun Cui, Junjie Zhong, Bei Wang, Tianyu Xu, Chenghua Wang, Weiqiang Liu(南京航空航天大学 Liu 组)
- 解决问题:Dilithium 传统硬件实现效率低、性能瓶颈明显,尤其在资源受限平台上。
- 架构:
- 并行模乘单元 + 改进的缩放方法(scaling),降低位宽与校准开销
- 改进的 radix-2 MDC-NTT(Multipath Delay Commutator NTT),配合 FIFO/BRAM 缓冲实现流水线并行,拉高主频
- 特点/结果:Xilinx Artix-7 上峰值 191 MHz;在最高安全等级下,KeyGen/Sign/Verify 相比 SOTA 分别提速 26.3%/32.5%/29.6%。
- 读全文后补充:三点贡献原文分别是——①并行多项式乘法单元 + 更紧的 scaling,在 3 个时钟周期内完成大整数乘法的高低位并行分解;②radix-2 MDC-NTT 用双通道 commutator,每级的使能信号直接来自前一级延迟寄存器,减少 BRAM 和逻辑地址处理单元;③面向 Xilinx Artix-7 的统一顶层实现。正文对比了 Beckwith/Land/Zhao/Aikata(KaLi)/Gupta/Mandal 等十余篇前作,定位是"此前工作多偏资源节省或资源-性能折中,缺少专门面向高速场景的设计"。(资源对比表在 markitdown 转换中被拆散成乱码,未强行摘录数字,以免读错。)
2. LightHD: A Lightweight and High-Performance Hardware Accelerator of CRYSTALS-Dilithium [Dilithium/ML-DSA]
- Venue:TC(CCF A 刊)Vol.75 No.5,2026-05;DOI
10.1109/TC.2026.3666457 - 作者:Ziying Ni, Ayesha Khalid, Zhaoyu Zhang, Yijun Cui, Weiqiang Liu, Máire O'Neill(QUB CSIT × 南航 Liu 组联合,与 #1 有作者交叠)
- 解决问题:现有 Dilithium 实现在资源受限设备上适用性差、性能仍偏低——想要同时做到轻量和高性能。
- 架构:
- 双 Keccak(SHA-3)核,两核偏移 26 周期并行运行,加速哈希/采样而不牺牲主频
- 拒绝采样器(rejection sampler)用两个紧凑寄存器精简中间值和计数器
- 小位宽多项式跳过 NTT 第一级(查找表 + 数据重组),NTT 周期减少 11.7%
- 紧凑调度策略,所有中间存储压进单个多项式大小的存储块
- 特点/结果:Artix-7 上硬件开销比 SOTA 轻量实现降低 14.2%;三个安全等级下 KeyGen/Verify 分别快 27.3%/13.5%;Level 5 最佳 Sign 延迟仅 120 µs。
- 读全文后补充:正文明确把 #1(Cui et al., TC'25 MDC-NTT,即参考文献 [23])当作直接对比基线——相比它,LightHD 用了少 2.3× 的硬件,同时三个安全等级下 KeyGen 仍快 11.3%–27.3%、Verify 快 5.0%–13.5%;Level-5 最佳 Sign 延迟 120.3 µs(对比基线 126 µs)。也就是说 #1→#2 不仅是同作者群延续,#2 的论文正文直接拿 #1 当 baseline 做了量化对比,这条演进线比之前只看摘要判断的更"实锤"。
3. Optimized NTT Architecture Based on the Plantard Algorithm for ML-KEM and ML-DSA [Kyber/ML-KEM + Dilithium/ML-DSA]
- Venue:TC(CCF A 刊)Vol.75 No.6,2026-06;DOI
10.1109/TC.2026.3671958 - 作者:Jiansheng Chen, Bei Wang, Ziying Ni, Mengxue Li, Fei Lyu, Yijun Cui(南航/QUB 同一脉络的第三篇)
- 解决问题:模乘是 NTT 的关键瓶颈;Plantard 算法此前一直缺硬件导向的改进。
- 架构:
- 首次对 Plantard 算法做硬件导向改进,提出三个针对格密码定制的增强版本(预处理 twiddle factor 做结果校正、消除额外常数乘法)
- 基于改进算法设计两种 NTT:轻量 BRAM-free 迭代 NTT + 高速 MDC 流水线 NTT,同时覆盖 ML-KEM 和 ML-DSA 参数集
- 特点/结果:Artix-7 上
Plantard_pre_ω相比 Barrett/K²RED 减少 slice 用量 22%–53%、延迟降 41.1%–44.3%;迭代 NTT 面积时间积(ATP)为 SOTA 最优,ML-KEM/ML-DSA 频率分别提升 72.7%/145.4%;流水线 NTT 延迟降 23.7%、ATP 降 4.9%。 - 读全文后补充:三个具体命名的算法变体是 ShiftAdd-Plantard、Plantard_preR、Plantard_preω(分别用分组部分积求和、预处理 R、预处理 twiddle factor ω 三种方式消除额外常数乘法)。流水线 NTT 在 Artix-7 上:ML-KEM 版 LUT/FF/DSP=1919/1615/7 @232MHz,ML-DSA 版 3412/4877/16 @204MHz;换到 Virtex-7 平台可到 303MHz/233MHz,对应延迟 0.56µs/1.44µs;迭代 NTT 在 Artix-7 上达到 278MHz,逼近理论最小周期数。结论段明确写了 future work 是给这套 NTT 加 masking/侧信道防护——这条技术线未来可能直接和 my-ntt 的 masked-NTT 部分正面竞争,值得持续跟踪。
4. Towards ML-KEM & ML-DSA on OpenTitan [Kyber/ML-KEM + Dilithium/ML-DSA]
- Venue:S&P(IEEE Symposium on Security and Privacy,CCF A 会)2025,San Francisco;DOI
10.1109/SP61157.2025.00220 - 作者:Amin Abdulrahman, Felix Oberhansl, Hoang Nguyen Hien Pham, Jade Philipoom, Peter Schwabe, Tobias Stelzer, Andreas Zankl
- 解决问题:如何在已有的(非专为 PQC 设计的)硬件信任根平台 OpenTitan 上,用最小硬件改动跑高效 PQC。
- 架构:
- 先在 OpenTitan 的大数协处理器 OTBN 上做纯软件优化(profiling 找瓶颈)
- 再提出紧耦合扩展:OTBN → Keccak 加速器(KMAC core)接口 + OTBN ISA 支持 256-bit 向量运算
- 特点/结果:不同算子/参数集下相比未改造 OTBN 提速 6–9×;OTBN 内 cell count 增加 <17%,对整个 Earl Grey OpenTitan 核心的开销 ❤️%。
- 读全文后补充:具体提了 5 条新指令——
bn.addv/bn.subv/bn.mulv(SIMD 模加/模减/模乘,带可选条件归约)、一条向量交织指令(NTT/INTT 蝶形运算要用到的 even/odd 下标交织)、bn.shv(向量按位移位)。每条指令都有<type>子变体覆盖不同元素宽度(.8S=32-bit、.16H=16-bit,还有.4D/.2Q更宽的变体),m后缀表示带模归约的版本。正文明确说明没有在 KMAC 改动之上加侧信道防护(因为改动本身不需要),这是一个刻意的 scope 限定,跟本仓库关注的"masked-NTT/侧信道防护"话题形成对照——它是纯性能向的 ISA 扩展,不含防护设计。 - 关键背景(#8 读全文后确认):OpenTitan 的 KMAC 核本身就带一个综合期可选的一阶 Domain-Oriented Masking(DOM)开关,#4/#8 两篇论文都是"全程把 KMAC 当作已 masked 状态"来做性能设计的——即防护和这两篇的性能优化是解耦的,本仓库关心的 DOM vs HPC2 baseline 对比(见
260615-masked-baseline-dom-vs-hpc.md)在 OpenTitan 生态里已经有 DOM 落地先例,可以作为 related work 引用点。
5. ML-DSA-OSH: An Efficient, Open-Source Hardware Implementation of ML-DSA [Dilithium/ML-DSA]
- Venue:DATE(Design, Automation & Test in Europe,CCF B 会)2026,Verona;DOI
10.23919/DATE69613.2026.11539720 - 作者:Quinten Norga, Suparna Kundu, Ingrid Verbauwhede(KU Leuven COSIC)
- 解决问题:完整 ML-DSA(FIPS 204)此前没有开源硬件实现——现有已发表硬件设计屈指可数。
- 架构:基于 Beckwith et al.(FPT 2021)的 Dilithium 实现迁移到 FIPS 204,讨论了 Dilithium→ML-DSA 迁移所需的必要修改;在拒绝采样循环中优化指令调度,预计算关键变量。
- 特点/结果:平均签名延迟提升 16%–36%;核心贡献是填补开源空白,而非追求极致性能。
- 读全文后补充:模乘用 Barrett 归约(只需移位+加法);2×2 蝶形单元同时支持 Cooley-Tukey/Gentlemen-Sande 两种蝶形(NTT 用 CT、INTT 用 GS);3 个 Keccak 核分工——2 个专门采样公开矩阵 A,1 个负责其余采样/哈希,配合足够大的 BRAM 完整缓存矩阵 A 以减少签名过程中的 stall;调度是单状态机的集中式架构。关键优化点:让 Â∘NTT(y) 的乘法一旦两个操作数都算完就立刻开始,而不是等中/高安全等级下 y 的 NTT 算完才动(原设计在这里会不必要地 stall)。具体延迟数字:中安全等级 KeyGen/Sign/Verify = 36.05/142.61/63.66 µs;NIST II–V 四档下 Sign 延迟为 106/143/160 µs(原文只给了三个数,对应其中三档)。
6. PQCUARK: A Scalar RISC-V ISA Extension for ML-KEM and ML-DSA [Kyber/ML-KEM + Dilithium/ML-DSA]
- Venue:DATE(CCF B 会)2026,Verona;DOI
10.23919/DATE69613.2026.11539512 - 作者:Xavier Carril, Alicia Manuel Pasoot, Emanuele Parisi, Oriol Farràs, Carlos Andrés Lara-Niño, Miquel Moretó
- 解决问题:ML-KEM/ML-DSA 的两大计算瓶颈——NTT(多项式乘法)和 Keccak-f1600(采样/哈希)——如何在标量 RISC-V 核内低成本加速。
- 架构:
- Packed SIMD 蝶形单元:支持 2×32-bit 或 4×16-bit 系数的 NTT 蝶形运算
- Keccak 置换引擎:每周期 2 轮 Keccak,私有状态 + 直连 Load-Store Unit(省掉自定义寄存器文件接口)
- 集成进 RV64 核,部署在 FPGA 上;ASIC 综合于 GF22-FDSOI
- 特点/结果:相比 NIST 基线提速最高 10.1×,相比优化软件提速 2.3×,比同类 SOTA 快 1.4–12.3×;ASIC 核心面积仅增加 8%(1.2 GHz),加速单元不在关键路径上。
- 读全文后补充:宿主核是学术开源 RISC-V SoC Sargantana(22nm FDSOI);GF22-FDSOI @1.2GHz 综合结果显示 PQCUARK 单元只占整个核心面积的 8.03%(1120 kGE,核心总计 13712 kGE),其中 Keccak 引擎占大头(1028 kGE)、BFU 蝶形单元很小(92 kGE)。点名对比了两个具体基线:RISQ-V(Fritzmann et al., TCHES'20,RI5CY RV32 核 + Keccak/二项采样/多项式乘法指令)和 Nannipieri et al.(IEEE Access'21,CVA6 RV64 核 + 定制 PQC 算术单元)——两者都被作者用同一套 Cadence Genus + GF22-FDSOI 脚本重新综合以保证对比公平。结果:ML-KEM 上比 RISQ-V 快 1.4–1.7×、比 Nannipieri 快 2.7–2.9×;ML-DSA 上 KeyGen/Verify 比 Nannipieri 快 >6×、签名快 12.3×。Future work 是加向量化扩展,对齐 RVA23 profile 和密码学标准扩展的路线——这个方向如果做实会比现在的 scalar 版更接近专用加速器,值得留意后续版本。
7. A Highly Hardware Efficient ML-KEM Accelerator with Optimised Architectural Layers [Kyber/ML-KEM]
- Venue:ACM TECS(Transactions on Embedded Computing Systems,CCF B 刊)Vol.24 No.2 Article 25,2025-01;DOI
10.1145/3708469(开放获取,CC-BY 4.0) - 作者:Ziying Ni, Ayesha Khalid, Weiqiang Liu, Máire O'Neill(与 #2 LightHD 同一批人,ML-KEM 版对照 ML-DSA 版)
- 解决问题:ML-KEM 在资源受限设备(Artix-7 一类低端 FPGA)上如何同时压面积、提吞吐——延续了对同一批作者此前 MDC-NTT Kyber 工作(2023,
liu-2023系列)的进一步优化。 - 架构:三层计算划分——
- Layer 1:哈希 + 采样
- Layer 2:NTT/INTT + 点乘(PWM)
- Layer 3:加法、压缩、编码
层内流水线 + 层间调度,保证 Layer1/Layer2 中至少一个始终以最短时间运行;提出 2 周期低资源归约算法(LUT + 算术混合);LUT 替代 NTT 第一级省 8 周期;FIFO 交织法把存储单元减少 55%;不使用 BRAM。
- 特点/结果:三个安全等级下计算时间相比此前工作分别降低 48.2%/41.2%/78.1%,面积降低 73%/70%/76%,面积-时间积(AT)改善 15.8%/10.7%/11.3%。
- 读全文后补充:Artix-7 上 level-1 只用 7.5% LUT、3.1% FF、0.5% DSP、0 BRAM;level-5 也只用 8.7% LUT、3.3% FF、0.5% DSP、0 BRAM——面积随安全等级上升几乎不变,主要靠 FIFO 数量的微增。对比对象具体到了参考文献:相比迭代 NTT 架构 [6] 在 level-5 仍有 28.3% 的 AT 优势(尽管速度已经不再领先);相比另一篇 [11] 在 level-3 有 1.52× 的硬件效率提升。全文没有涉及侧信道/masking,是纯性能向工作。
8. Improving ML-KEM and ML-DSA on OpenTitan: Efficient Multiplication Vector Instructions for OTBN [Kyber/ML-KEM + Dilithium/ML-DSA]
- Venue:TCHES(IACR Transactions on Cryptographic Hardware and Embedded Systems,CCF B 刊)Vol.2026 No.2, pp.495–519;DOI
10.46586/tches.v2026.i2.495-519(开放获取,CC-BY 4.0,附代码 GitHub) - 作者:Ruben Niederhagen, Hoang Nguyen Hien Pham
- 与 #4 的关系(更正):论文正文明确写"This work improves upon the instruction set extension proposed in ... 'Towards ML-KEM and ML-DSA on OpenTitan' (OTBN_TW)"——确实是 #4 的直接后续改进,且 Pham 是两篇的共同作者(此前我口头说"不是演进关系"是看错了,只读了摘要页没读正文,这里更正)。
- 解决问题:#4 的 OTBN 向量乘法器硬编码 Montgomery 乘法,多周期延迟高、整数乘法单元利用率低。
- 架构:把模乘从硬件重新挪回软件——提供更通用/强大的整数乘法向量指令(而非专用 Montgomery 乘法器),配合 lazy reduction 降低整体计算开销;给出两种变体,在资源占用和性能间做不同取舍。
- 特点/结果:ML-KEM/ML-DSA 周期数最高提速 17%;ASIC 面积增加至多 6%,FPGA 资源增加至多 4% LUT/20% CARRY4/1% FF(DSP 不变);在各自最高主频下 ASIC 时间-面积积显著优于 #4,同频下至少持平。
- 读全文后补充:OTBN 本身的 SCA 硬化手段是 data-path blanking(防未用数据通路的功耗泄漏)、Hsiao 完整性保护码、内部状态/存储器 secure wipe——这些都是平台既有防护,#8 的改动没有触碰。结论段明确把"用这套新向量指令去优化 masked ML-KEM/ML-DSA 并评估其抗侧信道能力"列为 future work,即当前版本本身不含侧信道防护评估,是留白而非已解决。
交叉观察
- 南航(Weiqiang Liu)× QUB(Khalid/O'Neill)联合体:#1 → #2 → #3 是同一条 MDC-NTT/Plantard-NTT 技术演进线(作者高度交叠:Cui、Liu、Wang、Ni),#7 是这条线在 ML-KEM 侧的姊妹篇(同一套三层架构思路,Ni/Khalid/Liu/O'Neill)。读全文确认 #2 正文直接把 #1 当量化对比基线(少 2.3× 硬件、KeyGen 仍快 11.3–27.3%),不只是同作者群延续,是有明确 benchmark 关系的演进。四篇合起来基本代表了 2025–2026 这两年 Dilithium/Kyber 专用 NTT/整体硬件加速器方向的头部工作,是 my-ntt 最直接的可比较对象。#3 结论段明确写了下一步要加 masking,是这条线上未来最可能和 my-ntt 的 masked-NTT 部分正面碰上的工作。
- OpenTitan OTBN 路线:#4 → #8 是同一目标平台上的连续两代 ISA 扩展设计,核心分歧在"模乘要不要做成专用硬件指令",#8 的结论是"退回软件更通用"。这条线代表"复用现成信任根、走向量 ISA 扩展"而非"专用加速器"的路径。读全文发现 OpenTitan 的 KMAC 核自带综合期可选的一阶 DOM masking,#4/#8 都是在"KMAC 已 masked"的前提下做纯性能优化,#8 结论段明确把"用新指令优化 masked ML-KEM/ML-DSA 并评估抗侧信道能力"列为未解决的 future work——是本仓库 DOM vs HPC2 baseline 调研(
260615-masked-baseline-dom-vs-hpc.md)在 OpenTitan 生态里的一个具体落点/引用素材。 - DATE'26 的 #5、#6:一篇补开源空白(ML-DSA-OSH,基于 Beckwith et al. ICFPT'21 的 Dilithium 设计迁移到 FIPS 204),一篇做标量 RISC-V 扩展(PQCUARK,宿主是 22nm FDSOI 的 Sargantana 学术核,明确对比 RISQ-V/Fritzmann TCHES'20 和 Nannipieri et al. IEEE Access'21 两个具体基线)——都不在南航/QUB 或 OpenTitan 两条线内,是独立第三、四方工作。PQCUARK 结论段提到下一步想做向量化扩展、对齐 RVA23 profile,值得留意后续版本是否会更接近专用加速器。
- 侧信道防护现状小结:8 篇里只有 #3(Plantard-NTT)和 #8(OTBN 改进版)在结论里明确提到"下一步要做 masking/侧信道评估",其余 6 篇都是纯性能向、不涉及物理安全;#4/#8 依赖 OpenTitan 平台自带的 DOM/data-path blanking/完整性码,不是自己设计的防护。也就是说这批 2025–2026 的新论文里,还没有一篇是"专用加速器 + 完整 masked 实现"的组合——如果 my-ntt 要做 masked-NTT,这批文献里暂时还没有直接的同类竞品。
浙公网安备 33010602011771号