上周 arXiv 上了一篇论文,标题看着像硬科幻:Bit2Watt: A Cyber-Physical Vulnerability Exploiting GPU Workloads Across Power and Computing Infrastructures。读完发现这不科幻,是实打实的安全漏洞。三位作者把 GPU 计算任务当武器,通过精确调制 GPU 功耗来破坏本地电网的稳定性,进而反向瘫痪计算服务本身。论文已被 CHES 2026 接收。

这不是攻击电网,是合法租户跑任务

传统电网攻击要么黑入 SCADA 系统,要么物理破坏电力设备。Bit2Watt 不碰这些东西。攻击者只需要是一个合法云租户,在自己的 GPU 实例上跑正常的计算任务,CUDA kernel、矩阵乘法、深度学习训练,什么都行。关键是 怎么跑

核心原理:GPU 的功耗不是恒定的。不同 workload 下的功耗曲线差异巨大:FP32 矩阵乘法满载跑和 idle 之间可以差几百瓦。攻击者通过精心编排 GPU kernel 的启动节奏,在高功耗和低功耗之间快速切换,在供电线上制造出几百 Hz 到几 kHz 的功率振荡。

这些振荡注入到本地电网(特别是高比例分布式能源 DER 的场景),会破坏电网的阻尼特性。论文用阻抗分析和实际电网模拟验证了这个链路:

  • 目标场景:1MW 本地电力系统,90% 分布式可再生能源(光伏为主)
  • 攻击规模:协调 1,000 个 GPU 实例
  • 结果:电流总谐波失真(THD)达到 46.8%,系统阻尼比降到 -0.27

阻尼比变负意味着什么?电网里任何小的扰动都会被放大而不是衰减。这不是让灯闪一下的事——负阻尼系统会自发振荡,触发保护继电器动作,最终导致局部断电。而断电之后,你跑在上面的 GPU 计算任务也没了。

为什么监控系统看不见?

Bit2Watt 的隐蔽性来自三个设计选择:

第一,走的是合法路径。 GPU 跑什么 kernel、怎么跑,是租户的权利。云平台的资源调度器看到的是正常的计算请求,没有越权操作,没有异常系统调用。攻击流量和正常深度学习训练在 API 层面没有区别。

第二,攻击特征在高频段。 常见的云和机房监控采样率通常在秒级甚至分钟级——DCIM 读一次功率数据可能间隔 30 秒。Bit2Watt 制造的功率振荡在几百到几千 Hz,低于一次采样的时间窗口。从监控面板上看,平均功耗可能只是多了一点点。

第三,根源在物理层而非网络层。 现有的入侵检测系统看的是网络流量、系统日志、API 调用链。没人监控 GPU VRM 输出端的电流谐波。这不是同一层的事。

Watt2Bit:还有反馈回路

更狠的是,论文还分析了一条反向路径:Watt2Bit

当电网被攻击导致电压畸变和频率漂移后,这些异常会通过电源模块传导回服务器。不稳定的供电可能导致 GPU 计算错误(静默数据损坏)、DRAM 比特翻转率升高、甚至特定类型的计算任务产生可预测的错误模式。攻击者通过观察计算结果,可以推断电网正在被扰动。

还有一条更直接的:电源线上的电磁辐射(EMI)。功率振荡会在供电线上产生对应频率的电磁信号,这些信号可以通过侧信道被同一数据中心内的其他租户接收。论文指出这可以作为隐蔽信道进行信息外泄——跑任务的同时通过调制功耗向外发数据。

一个完整的 Bit2Watt 攻击闭环:GPU 负载 → 功率振荡 → 电网失稳 → 计算错误/EMI 泄露 → 反馈给攻击者。

这和你有关系吗?

如果你觉得"我又不跑 1,000 块 GPU,跟我也没关系"——Bit2Watt 真正揭示的不是单个攻击的规模问题,而是一个被忽视的攻击面。

现代数据中心是一个紧耦合的 cyber-physical 系统。GPU 集群的功耗密度在持续攀升:H100 单卡 TDP 700W,GB300 更是到了 1,400W。一个 8 卡节点的峰值功耗可以超过 10kW。当几百个这样的节点集中在同一段电力母线上,workload 层面的功率变化就不再是可以忽略的波动了。

论文选 1,000 GPU 只是为了让数值好看。真实场景中,攻击者不需要打瘫整个数据中心——只需要在一个共享电力总线的 rack 级别制造足够大的扰动,让同 rack 的其他租户经历电压跌落或保护跳闸。这是多租户环境下的 denial-of-service via power

防御方向

Bit2Watt 的跨层特性让单点防御很难生效。几个可能的方向:

  • Workload-level power profiling:在 GPU 调度器层面建立功耗指纹基线。正常训练任务的功耗变化是有规律的(iterative pattern),攻击流量则是刻意的高频切换。对 kernel launch 序列做频谱分析可以区分两者。
  • Power-quality monitoring at PDU level:在机柜配电单元(PDU)加入高频采样(kHz 级),监控电流 THD 和功率因数。目前大多数 PDU 的采样精度不在这个量级。
  • GPU power capping with rate limiting:不只是限制平均功耗上限,还要限制功耗变化率(dP/dt)。nVidia 的 nvidia-smi -pl 只能设 power limit,不限制 ramp rate。这需要驱动层或 BMC 层面的改动。
  • Cross-layer anomaly correlation:把 GPU 调度日志、PDU 功率数据、UPS 输出质量做时间轴对齐。单一数据源看不到的攻击,跨层叠加后会出现明显的时间关联。

我的看法

Bit2Watt 的价值不在攻击本身的破坏性,而在于它揭示了一个安全盲区:算力基础设施和电力基础设施之间的接口是裸的。云平台在 CPU/内存/网络层面做了大量隔离和监控,但 GPU 功耗到 PDU 输入这段链路几乎没有安全语义。租户可以把功耗当信号用,而平台不知道也不关心。

这让我想到 2018 年 Meltdown/Spectre 刚出来时的状态——不是每个攻击都能立刻规模化武器化,但它证明了一个此前被当作"不可能"的事情在物理上是成立的。Bit2Watt 做了同样的事:证明了 GPU workload 可以被当作电网的攻击向量。至于是 1,000 张卡还是 100 张,是打瘫整个数据中心还是一个 rack,区别大吗?

对于跑 GPU 集群的团队,这篇论文值得全文阅读。不是因为你马上会被攻击,而是因为它告诉你在设计基础设施安全时漏掉了哪一层。

论文中所有实验均在可控环境和授权设备上进行,电网模拟基于 IEEE 标准测试系统。攻击场景为学术研究目的,不针对任何实际生产系统。

⚠️ 网络安全免责声明

本文内容仅供技术研究与安全学习之用。文中描述的漏洞分析和攻击原理均基于公开学术论文,旨在帮助基础设施运维人员理解新型攻击向量、提升防御能力。

请勿将本文所述技术用于任何未经授权的系统攻击或破坏活动。任何因滥用本文信息而造成的法律后果,由使用者自行承担,与本文作者无关。


参考来源

  • Bit2Watt — arXiv:2607.05993 (Accepted by CHES 2026)
  • Ji, Pan, Xu. Bit2Watt: A Cyber-Physical Vulnerability Exploiting GPU Workloads Across Power and Computing Infrastructures. 2026.