哈佛-CS249r-机器学习系统第二卷-八-

哈佛 CS249r:机器学习系统第二卷(八)

原文:Machine-Learning-Systems-Vol2

译者:飞龙

协议:CC BY-NC-SA 4.0

CMOS 功率方程

每个数字电路通过两种基本机制消耗功率。动态功率源于晶体管在状态之间的切换,而静态功率则源于即使在晶体管名义上关闭时仍然存在的漏电流。Equation 15.1 将总功率消耗形式化为:

*P*[total] = *P*[dynamic] + *P*[static] = *α*[sw]*C**V*²*f* + *V**I*[leak]   (15.1)

动态功率分量 P[dynamic] = α[sw]CV²f 取决于四个参数。开关活动因子 α[sw] 表示每个时钟周期改变状态的晶体管比例,范围为 0 到 1。由于指令组合多样,通用 CPU 通常表现为 α[sw] ≈ 0.1 到 0.3,而专用 AI 加速器通过优化数据流在计算过程中保持更多电路处于活跃状态,可实现 α[sw] ≈ 0.6 到 0.8。负载电容 C 随晶体管数量和互连长度缩放。供电电压 V 以平方关系引入,使得降低电压成为提高能效影响最大的手段。时钟频率 f 决定了每秒操作数。

静态功率分量 P[static] = V ⋅ I[leak] 代表随温度呈指数增长的漏电流,大约每升高 10 摄氏度就会翻倍。这种热依赖性产生了一个反馈回路:更高的功率产生热量,进而增加漏电,漏电又产生更多热量。管理这种热失控限制了可实现的功率密度,并解释了为什么冷却基础设施占据了数据中心能耗的如此大比例(Dayarathna et al. 2016)。

对 AI 系统的实际影响直接源于这些物理特性。电压的二次方依赖关系意味着,将电压从 1V 降至 0.8V 即可使动态功率降低 36%,这还未考虑到较低电压通常支持降频,从而带来额外的线性节能。这一关系解释了为什么专用 AI 加速器能在较低电压但较高利用率下运行,相较于通用处理器实现数量级的能效提升。

为何优化技术能节能

功率方程揭示了特定优化技术实现能效增益的原因。量化将数值精度从 32 位浮点数降至 8 位整数,直接将数据路径电容 C 降低约 4 倍,因为更窄的数据路径需要更少的晶体管和更短的互连。此外,低精度运算因电路具有更大的噪声容限,可实现更低的供电电压 V。综合效应使每次操作的能耗降低 6 到 10 倍,与 INT8 与 FP32 推理能效的公开测量数据高度吻合。

剪枝从神经网络中移除权重,通过消除本会消耗开关能量的计算路径,降低有效电容 C。结构化剪枝移除整个通道或注意力头,比非结构化剪枝获得更大的能效增益,因为它消除了完整的电路路径,而非硬件仍需编排调度的单个操作。

专用加速器通过专门为矩阵乘法和卷积运算设计电路,提高了活动因子 α[sw]。CPU 在典型 ML 工作负载下可能仅激活 10% 的晶体管,而脉动阵列架构可使 70% 以上的计算单元保持活跃,从而在每瓦特功耗下完成更多有效工作。

设施级功率指标

除芯片级功耗外,数据中心基础设施还带来额外的能量开销。公式 15.2 通过电源使用效率 (PUE) 指标捕捉这一关系:

PUE = P_total_facility / P_IT_equipment       (15.2)

电源使用效率 (PUE) 是 ML 系统运营商用来对比设施总功耗与 IT 设备专用功耗 (P[facility]/P[IT]) 的数据中心效率比率。

  1. 意义:它衡量数据中心的基础设施开销。PUE 为 1.0 为理论理想值;PUE 为 1.10 意味着每 100 瓦计算功耗,额外需要 10 瓦用于冷却和配电。

  2. 区别:与计算能效(关注每瓦浮点运算)不同,PUE 关注设施能效:它捕捉有多少能量在到达处理器前就已“浪费”。

  3. 常见误区:常见的误解认为低 PUE 意味着“绿色”数据中心。实际上,PUE 仅衡量效率,而非能源的碳强度;燃煤供电的数据中心 PUE 可能优于太阳能供电的,但环境影响却大得多。

问题:某团队运营一个 2 MW 集群。若设施 PUE 从行业平均水平 (1.58) 优化至最先进水平 (1.10),每年能节省多少能源和资金?

计算:节省的能源是 IT 负载下基础设施开销 (PUE − 1) 的差值。

  1. 开销降低:1.58 - 1.10 = 0.48。

  2. 年节能量:2 MW × 0.48 × 8760 h/年 ≈ 8,409.6 MWh。

  3. 经济节省:8,409.6 MWh × $70/MWh ≈ $588,672。

系统洞察:基础设施优化与算法优化同等重要。PUE 降低 0.48 相当于发现了一个算法“免费午餐”,在不改动一行训练代码的情况下,使整个模型效率提升 30%。对于大型运营商而言,冷却效率是可持续发展的主要经济杠杆。

PUE 为 1.0 表示所有能量均用于计算的完美效率,但这在物理上不可能,因为冷却、配电和照明都需要非零能量。行业平均数据中心 PUE 在 1.5 到 2.0 之间运行,意味着计算之外还有 50% 到 100% 的额外能量用于基础设施(Uptime Institute 2022)。领先的超大规模设施通过先进冷却技术(包括寒冷气候下的自然冷却、高密度 GPU 集群的液冷,以及优化的配电)实现了 1.1 到 1.2 之间的 PUE。

两个水平 PUE 条形图显示相同的 IT 能耗基础加上基础设施开销:PUE 1.58 时额外 58%,PUE 1.10 时额外 10%。

PUE 是计算之上的基础设施能量税。

公式 15.3 形式化了水使用效率 (WUE),捕捉蒸发冷却和其他过程所需的水消耗:

WUE = W_annual_water_usage / E_IT_equipment       (15.3)

单位为升/千瓦时,典型值因气候和冷却技术而异,范围在 0.5 到 2.0 L/kWh 之间。WUE 为 1.8 L/kWh 的数据中心训练一个需 10,000 MWh 的模型,将消耗 1800 万升水,大约相当于 40 到 50 个美国家庭按每年 38 万到 45 万升基准计算的年用水量。

设施级指标指出了工程干预产生最大回报的环节。以下案例研究展示了 ML 驱动的 PUE 优化如何直接转化为可衡量的节能效果。

案例研究:DeepMind 能效优化

Google 的数据中心支撑着搜索、Gmail 和 YouTube 等服务,每天处理数十亿次查询(2023)。这些设施需要大量电力,特别是用于确保服务器最佳性能的冷却基础设施。提高数据中心能效一直是重中之重,但由于冷却系统复杂且环境条件高度动态,传统工程方法面临收益递减(Buyya et al. 2010)。为应对这些挑战,Google 与 DeepMind 合作开发了一套机器学习优化系统,实现大规模能源管理的自动化与增强。

经过十多年优化数据中心设计、节能硬件和可再生能源集成的努力后,DeepMind 的 AI 方法将目标锁定在数据中心最耗能的方面之一——冷却系统。传统冷却依赖于人工设定的启发式方法,这些方法考虑了服务器热输出、外部天气条件和建筑限制。这些系统存在非线性交互,因此简单的基于规则的优化往往无法捕捉其运行的全部复杂性。结果导致冷却效率低下,引发不必要的能源浪费。

DeepMind 团队使用 Google 的历史传感器数据训练了一个神经网络模型,这些数据包括实时温度读数、功率消耗水平、冷却泵活动以及其他运行参数。在 Jim Gao 之前工作的基础上——该工作表明机器学习可以以 99.6% 的准确率预测数据中心 PUE (Gao 2014)——该模型学习了这些因素之间的复杂关系,并能够动态预测最节能的冷却配置。与依赖人工工程师定期调整系统设置的传统方法不同,AI 模型能够根据环境和工作负载条件的变化实时持续适应。

结果显示出显著的效率提升。在实际数据中心环境中部署后,DeepMind 的 AI 驱动冷却系统使冷却能源消耗降低了 40%,从而带来整体 PUE 提升 15%³⁶¹ (Barroso et al. 2019; Evans and Gao 2016)。对于运行在行业平均 PUE 为 1.5 的设施(见方程 15.2),15% 的改进能够挽回因冷却开销而损失的大部分能源。这些改进是在不进行任何额外硬件修改的情况下实现的,展示了软件驱动优化在降低 AI 碳足迹方面的潜力。

DeepMind 案例研究展示了一种罕见的正反馈循环:机器学习优化为其自身提供动力的基础设施。该框架可推广到不同的设施设计和气候条件,为全球数据中心网络提供了一种可扩展的方法。

碳强度及其区域差异

电力消耗的碳影响取决于能源发电结构,这一特征通过碳强度来量化,单位为克 CO₂ 当量每千瓦时(g CO₂eq/kWh)。表 15.1 按能源来源量化了碳强度,展示了这些强度如何剧烈变化:

| 能源来源 | 碳强度 (g CO₂eq/kWh) | 地区示例 |

| --- | --- | --- |

| 煤炭 | 820 至 1,200 | 波兰,西弗吉尼亚 |

| 天然气 | 350 至 500 | 德州联合循环电厂 |

| 太阳能光伏 | 20 至 50 | 加利福尼亚,亚利桑那 |

| 风能 | 7 至 15 | 丹麦,苏格兰 |

| 水电 | 10 至 30 | 魁北克,挪威 |

| 核能 | 5 至 20 | 法国,安大略 |

表 15.1:按能源来源划分的碳强度:电力发电的碳强度在不同能源来源之间相差超过两个数量级。计算的地理位置即使在工作负载相同的情况下也能显著影响排放,通过战略布局可实现数量级的减排。

通过战略性训练地点选择,地理优化可以将碳排放降低 10–50 倍,正如图 15.7 在具有代表性的地区中所示。

图 15.7:地理碳强度:训练任务的碳足迹取决于其运行位置。依赖水电或核能的地区(例如魁北克、法国)的碳强度比依赖煤炭的地区(例如波兰、西弗吉尼亚)低 10 倍至 50 倍。碳感知调度通过将非紧急任务转移到更清洁的电网来利用这种差异。

系统化能源指标

量化能源效率需要系统化的指标,以便在不同硬件架构和算法方法之间进行比较。指标阶梯从每操作能耗,进展到每字节能耗,然后到算术强度与数据移动之间的屋顶线关系。这种进展很重要,因为虽然某些优化可以减少 FLOPs,但如果工作负载的能源主要用于移动字节,则这些优化可能效果甚微。

每操作能耗

计算能源效率的基本指标是每次操作消耗的能量,通常以皮焦耳(picojoules)为单位。对于 AI 工作负载,最相关的指标是每次浮点运算的能耗和每次乘加运算的能耗,其中一次 MAC(乘加)操作同时完成一次乘法和一次加法,相当于两次 FLOP。

硬件架构决定了能源效率,范围可达近四个数量级——从通用 CPU 到专用模拟加速器。表 15.2 按架构量化了能源效率:

| 架构 | 能源效率 (pJ/FLOP 或 pJ/MAC) | 特征 |

| --- | --- | --- |

| CPU(通用) | 100 pJ/FLOP | 利用率低,灵活性高 |

| GPU(张量核心) | 10 pJ/FLOP | 高吞吐量,并行执行 |

| TPU(收敛阵列) | 1-2 pJ/FLOP | 专用矩阵运算,优化数据流 |

| Google Edge TPU | 2-4 pJ/FLOP | 设备端推理,INT8 优化 |

| ARM Ethos-U55 | 0.5-2 pJ/MAC | 微控制器 NPU,亚瓦特 TinyML |

| Maxim MAX78000 | 0.3-1 pJ/MAC | 带局部权重存储的 CNN 加速器 |

| ASIC(INT8) | 0.1 pJ/operation | 固定功能,低精度 |

| 模拟/存储内计算 | 0.01-0.1 pJ/MAC | 新兴技术,存储阵列内计算 |

表 15.2:按架构划分的能源效率:硬件专业化可使每次操作的能耗提升多达四个数量级。数据中心加速器(TPU、GPU)针对吞吐量进行优化,而边缘加速器(Ethos-U、MAX78000)则针对每次推理的能耗进行优化。新兴的模拟计算方法有望带来进一步的效率提升。

四个数量级的分布既反映了电路层面的效率,也反映了影响利用率的架构选择。CPU 执行多样化的指令混合,算术单元平均利用率较低。GPU 通过大规模并行实现更高的利用率。TPU 和 ASIC 通过针对特定操作类型优化的专用数据路径最大化利用率。

精度直接影响每次操作的能耗。在相同频率和电压下,INT8 整数运算消耗的能量大约是 FP32 浮点运算的十六分之一。这得益于位宽减少带来的 4× 数据路径电容降低、更大噪声容限带来的 2× 电压需求降低,以及控制逻辑简化带来的另一 2× 降低。

每字节能耗

在算术强度低的 AI 工作负载中,数据移动往往是能源消耗的主导因素。内存访问的能源成本在存储层次结构中跨越五个数量级:

六级能源阶梯(对数尺度):网络 10,000,NVMe 1,000,DRAM 160,L2 5,L1 1,寄存器 0.1 pJ/byte,跨越五个数量级。

每字节移动能耗跨越五个数量级,从寄存器到网络。

进入/path/to/xxx目录,找到xxx.json

在表达式cvar = avar + bvar中,加法运算符(+)将avarbvar相加,得到它们的和cvar

List.of(arg0, arg1, arg2)中,List接口的工厂方法of()接受一系列的元素,返回包含它们的只读列表。

之后我们这样调用cmd命令:cmd arg0 arg1 arg2

if (condVar > someVal) {console.log("xxx")}

Table 15.3 揭示了关于内存层次结构能源成本的一个关键洞察:从 DRAM 移动数据消耗的能源比执行算术运算多 10 到 100 倍。各行追溯了从寄存器经过 L1 缓存、L2 缓存到 DRAM、NVMe 和网络传输的路径。对于每 FLOP 消耗 10 pJ 的 GPU,从 DRAM 访问一个 FP32 操作数(4 字节乘以 160 pJ/字节 = 640 pJ)的成本是其自身计算成本的 64 倍。此表格清晰地展示了能源层次结构。

| 内存层级 | 能源成本 (pJ/字节) | 访问延迟 |

| --- | --- | --- |

| 寄存器 | 0.1 pJ/字节 | 1 周期 |

| L1 缓存 | 1 pJ/字节 | 3-5 周期 |

| L2 缓存 | 5 pJ/字节 | 10-20 周期 |

| DRAM | 160 pJ/字节 | 200-300 周期 |

| NVMe SSD | 1000 pJ/字节 | 50,000-100,000 周期 |

| 网络 | > 10000 pJ/字节 | 百万级周期 |

Table 15.3: 内存层次结构能源成本:随着内存层次结构向下移动,每字节的能源成本按数量级增加。数据移动很容易主导计算能源。

所得的设计杠杆旨在减少数据移动而非算术运算:

  • 片上内存用于数据复用(带共享内存的 NVIDIA Tensor Core)

  • 优化数据布局以最小化 DRAM 访问(Google TPU 收敛阵列)

  • 压缩以减少数据移动(稀疏张量表示)

这些杠杆共同使可持续性成为一个局部性和复用问题,而不仅仅是更快的算术问题。

算术强度和能源屋顶线

计算与数据移动之间的平衡决定了能源消耗是受计算限制还是受内存限制。Equation 15.4 定义了算术强度(AI),即决定哪种资源主导能源消耗的比率。在这些方程中,O 表示以 FLOPs 计算的操作次数,D[vol] 表示以字节计算的数据体积,E[compute] 表示每 FLOP 的能源消耗,E[move] 表示每移动一个字节的能源消耗:

\[ \text{AI} = \frac{O}{D_{\text{vol}}} \qquad(15.4) \]

以 FLOP/字节为单位测量的算术强度决定了能源消耗的主导因素。Equation 15.5 将总能源表示为计算和内存贡献之和,而 Equation 15.6 则分离出屋顶线风格的主导项:

E[total] = O × E[compute] + D[vol] × E[move]   (15.5)

E[dominant] = max (O × E[compute], D[vol] × E[move])   (15.6)

最大项识别了屋顶线推理中的主要瓶颈;在平衡情况下它并不是总能源。Equation 15.7 定义了计算和内存能源平衡的交叉算术强度:

\[ \text{AI}_{\text{crossover}} = \frac{E_{\text{move}}}{E_{\text{compute}}} \qquad(15.7) \]

对于具有 E[compute] 为 10 pJ/FLOP 和 E[move] 为 160 pJ/byte(DRAM 访问)的 GPU:

\[ \text{AI}_{\text{crossover}} = \frac{160 \text{ pJ/byte}}{10 \text{ pJ/FLOP}} = 16 \text{ FLOP/byte} \]

能源屋顶线模型 (Figure 15.8) 可视化了算术强度与能源效率之间的关系,揭示了不同工作负载类型如何受不同瓶颈的制约。此能源屋顶线模型将性能屋顶线模型转移到能源轴上:Section C.3.1 推导了原始天花板并进行了屋脊点分析,以区分受内存限制和受计算限制的 regimes,同样的交叉点在这里将能源消耗划分为以内存为主导和以计算为主导。

Figure 15.8: 能源屋顶线模型:正如性能屋顶线根据带宽限制 FLOP/s,能源屋顶线根据能源限制 FLOP/J。算术强度低的工作负载(左侧)由内存能源(E[move])主导,而计算密集型工作负载(右侧)受算术能源(E[compute])限制。优化错误的指标会导致收益递减。

为了使这一框架具体化,我们可以将其应用于深度学习中最常见的操作:矩阵乘法。

考虑在具有上述能源特性的 GPU 上,对 FP32 精度的 N[mat] × N[mat] 矩阵进行矩阵乘法 C = A × B

步骤 1:计算 FLOPs 和字节数。

  • FLOPs: 2N[mat]³(对于每个 N[mat]² 输出元素,执行一次乘加运算,并在 N[mat] 个元素上累积)

  • 字节数: 3N[mat]² × 4 字节(读取矩阵 AB,写入矩阵 C,每个 FP32 占 4 字节)

  • 算术强度: \(\text{AI} = \frac{2N_{\text{mat}}³}{12N_{\text{mat}}²} = \frac{N_{\text{mat}}}{6}\) FLOP/byte

步骤 2:确定能源限制因素。Table 15.4 直接比较了三种 regimes。

| 工作负载 | 算术强度 | 计算能源 | 内存能源 | 优化优先级 |

| --- | --- | --- | --- | --- |

| 小型矩阵 (N[mat]= 96) | AI = 96/6 = 16 FLOP/byte | 2 × 96³ × 10 pJ = 17.69 μJ = 0.0177 mJ | 3 × 96² × 4 × 160 pJ = 17.69 μJ = 0.0177 mJ | 在交叉点处平衡 |

| 大型矩阵 (N[mat] = 1000) | AI = 1000/6 = 167 FLOP/byte | 2 × 10⁹ × 10 pJ = 20 mJ | 3 × 10⁶ × 4 × 160 pJ = 1.92 mJ | 提高计算效率 |

| 向量加法 (N[vec] = 1000) | AI = 1000/12000 = 0.083 FLOP/byte | 1000 × 10 pJ = 0.00001 mJ | 12000 × 160 pJ = 0.00192 mJ | 通过融合减少数据移动 |

Table 15.4: 能源瓶颈比较:相同的能源模型根据其主导的能源项将小型密集工作、大型密集工作和逐元素工作进行分类。

系统洞察:能源优化遵循与延迟优化相同的瓶颈逻辑。密集矩阵乘法受益于高效的算术;逐元素工作受益于减少内存移动。

能源屋顶线模型揭示了为什么不同的优化策略适用于不同的工作负载。大型密集矩阵操作受益于更快的算术单元。内存受限的操作,如逐元素内核,受益于数据布局优化、内核融合以减少内存往返以及片上内存利用。此框架为可持续 AI 系统设计的架构和算法选择提供指导。

能源测量技术

量化 AI 系统能源消耗需要在硬件栈的多个层面进行测量,从芯片级仪表盘到设施范围的监控。方法的选择本身是一种工程权衡:硬件计数器提供精细的归因,移动分析器暴露平台特定的子系统,边缘仪表捕获 duty-cycle 行为,系统级工具将组件测量与组件计数器遗漏的设施开销相连接。

硬件功率计数器

现代处理器包含用于功率测量的专用电路,软件可以通过制造商提供的接口进行查询。这些硬件计数器测量实际的功率消耗,而不是基于活动进行估算,提供了微秒级分辨率的真实能源消耗数据。

Intel 的 运行平均功率限制 (RAPL) 接口通过特定于型号的寄存器(MSRs)暴露 CPU 包、DRAM 和集成图形的能源测量。RAPL 报告累积能源,因此测量模式是基于边界的:在受控工作负载区域之前采样计数器,运行工作负载,再次采样它,然后将能源增量除以经过的时间以恢复平均功率。这使得 RAPL 对 CPU 预处理、数据加载和主机端训练工作很有用,但它也定义了其边界。RAPL 不涵盖离散 GPU 能源,可能需要提升的权限,并且必须在了解封装范围和计数器回绕的前提下进行解释。

NVIDIA GPU 功率监控

NVIDIA GPU 通过NVIDIA 管理库(NVML)公开功率测量,可通过nvidia-smi命令行工具或编程绑定访问。GPU 功率监控通常从瞬时功率消耗开始,由于动态电压和频率缩放会导致设备状态从一个内核变化到下一个内核,因此其值可能在计算过程中显著波动。因此,可靠的测量应将推理或训练区间视为轨迹:同步工作负载边界,以固定频率采样功率,对这些样本随时间积分,并报告平均功率和峰值功率。当数据中心 GPU 公开累积能量计数器时,这些计数器更为可取,因为它们可以避免在采样之间对短内核产生混叠。

边缘设备和微控制器则面临不同的测量问题。它们通常缺乏内置功率计数器,以毫瓦而非千瓦的规模运行,并且需要外部仪器进行准确的能源剖析。关键的决策在于工作负载证明多少时间分辨率、轨道归因和成本是合理的。INA219INA226基于 I²C 的电流传感器为开发和验证提供了负担得起的测量方案,其采样速率足以捕捉推理级能耗。对于需要纳秒级分辨率测量单个操作的研究,像Joulescope JS220这样的仪器可以测量从微安级睡眠状态到安培级活动峰值的电流,从而能够表征边缘 AI 工作负载的完整动态范围。对于大规模 TinyML 机群,边缘能源测量变得必不可少,因为小的单设备误差在部署规模上会累积,从而影响全面的可持续性评估。

移动平台能源剖析

在移动平台上,测量取决于平台公开的归因程度。可用的剖析器在直接瓦数和按组件诊断价值之间进行权衡:

  • Android PowerStats HAL:为 CPU、GPU、NPU 和无线电子系统提供按组件的功率归因,使开发者能够识别哪些模型操作主导能耗消耗。

  • 高通 Trepn Profiler:在骁龙平台上提供毫秒级分辨率的功率测量,将功率轨迹与代码执行关联,以优化 NPU 工作负载。

  • ARM Streamline:为 Cortex-A 和 Mali GPU 平台提供带能源注释的剖析,使识别低效内核实现成为可能。

  • Apple Instruments 能源日志:报告 iOS 应用的热状态和能源影响分数,尽管不提供直接的瓦数测量。

移动剖析工具与开发工作流程集成,使在模型部署过程中能够迭代优化设备端推理能耗。表 15.5 概述了跨平台的边缘功率测量仪器,包括分辨率、精度和集成需求。

| 仪器 | 分辨率 | 精度 | 使用场景 |

|---|---|---|---|

| INA219/INA226 | 100 µs 采样 | ±1 % | 低成本嵌入式剖析 |

| PAC1934 | 1 ms,4 通道 | ±2 % | 多轨道 MCU 测量 |

| Joulescope JS220 | 次微秒,纳安级范围 | ±0.1 % | 专业 TinyML 基准测试 |

| Otii Arc Pro | 10 µs,自动化 | ±0.5 % | 自动化电池寿命测试 |

表 15.5边缘功率测量仪器:外部功率监控器使得没有内置计数器的设备能够进行能量测量。Joulescope JS220提供了 TinyML 研究的黄金标准精度,而 INA 系列传感器则为部署验证提供了具性价比的解决方案。

边缘测量方法论

只有当边缘能源测量反映实际部署的工作周期,而非最佳情况的主动推理运行时,才是有用的。可重复的结果需要四个控制措施:

  • 基线特征表征:在所有睡眠状态下测量空闲功耗,因为基线功耗在典型微控制器上可能从深睡眠状态下的 1 µA 变化到空闲活动状态下的 1 mA。

  • 预热期:在测量前执行 100 次或更多推理迭代,以达到热平衡,因为初始迭代可能由于缓存预热和电压调节器稳定而表现出不同的功耗特性。

  • 工作周期核算:在现实工作周期下报告峰值推理功率和平均功率,因为边缘设备通常在推理之间存在显著的空闲期。

  • 外设隔离:在测量模型推理能耗时,禁用或考虑外设功耗,如传感器、无线电和显示器,因为这些可能主导系统总功耗。

对于工作周期核算,方程(15.8)表达了有功功率和空闲功率之间的关系:

[

P_{\text{平均}} = P_{\text{活跃}} \times \delta_{\text{工作周期}} + P_{\text{空闲}} \times (1 - \delta_{\text{工作周期}})

\tag{15.8}

]

其中,(\delta_{\text{工作周期}}) 表示工作周期(进行推理所占时间的比例)。

系统级能源剖析

全面的能源核算需要将芯片级测量与基础设施开销结合起来。方程(15.9)将总能源正式表述为按设施开销缩放的组件贡献之和:

[

E_{\text{总}} = (E_{\text{CPU}} + E_{\text{GPU}} + E_{\text{内存}} + E_{\text{网络}}) \times \text{PUE}

\tag{15.9}

]

由于没有单一计数器能覆盖完整的能源路径,因此系统级剖析器如Intel VTuneNVIDIA Nsight Systems以及开源工具如PowerJoular会跨组件聚合测量结果。对于生产部署,机架级的智能功率分配单元(PDU)提供经过设施验证的测量值,其中包括冷却开销。

方程(15.10)表达了测得的组件功率与总设施能源之间的关系:

[

P_{\text{设施}} = P_{\text{IT}} \times \text{PUE} = (P_{\text{服务器}} + P_{\text{网络}} + P_{\text{存储}}) \times \text{PUE}

\tag{15.10}

]

对于在 PUE=1.4 的设施中消耗 1 MW IT 功率的集群,总设施功耗达到 1.4 MW,其中额外的 400 kW 用于供电冷却、功率转换和基础设施系统。这种对所有计算功率自动的 40%开销凸显了设施效率的关键作用。然而,运行时功耗只是方程中的一部分;为了捕捉我们系统真正的环境成本,我们必须正式化如何将原始千瓦转换为吨级碳排放。

碳足迹计算

考虑一个运行于 100%可再生水力发电的数据中心。其运营碳排放实际上为零,但在该中心训练的 AI并非碳中和。硅的开采、GPU 的制造以及数据中心混凝土的浇筑在服务器 ever 开机之前就已经释放了数千吨二氧化碳。真正的碳足迹计算必须同时考虑运行期间消耗的能源和施工过程中释放的“隐含碳”。

第 15.2.1 节中的生命周期笔记本已经为一次 70B 运行计算了运营碳、隐含碳和总碳。本节将该工作示例转化为正式的核算模型:针对各项的方程,这些方程能够跨工作负载、电网和摊销假设进行推广,而不是给出单一的数值答案。

运营碳计算

运营碳排放源于训练和推理期间的电力消耗,并按电网碳强度进行缩放。方程(15.11)将此量化为能源、电网碳强度和设施开销的乘积:

[

C_{\text{运营}} = E_{\text{总}} \times \text{CI}_{\text{电网}}

\tag{15.11}

其中 E[total] 是来自 方程 15.9(组件能量已按 PUE 缩放)的设施级能量,CI[grid] 是电网的碳强度。设施开销仅通过 E[total] 进入一次,因此不会再次出现在碳方程中。具体的训练排放计算说明了此框架。

考虑在 64 块 A100 GPU 上训练一个 70 亿参数模型,持续 14 天:

步骤 1:计算能量。

  • GPU 功率:在典型训练利用率下,每块 A100 为 400 W

  • 训练时间:14 天 × 24 小时/天 = 336 小时

  • GPU 能量:64 × 400 W × 336 小时 = 8,601,600 Wh = 8,601.6 kWh

步骤 2:添加 IT 支持功率并应用 PUE。

  • 机架配置支持负载后的 IT 能量:11,827.2 kWh

  • 设施 PUE:1.12(高效超大规模数据中心)

  • 总设施能量:11,827.2 kWh × 1.12 = 13,246.5 kWh

步骤 3:计算排放。

  • 电网碳强度:429 g/kWh CO[2](美国平均)

  • 运行排放:13,246.5 kWh × 429 g/kWh = 5682.7 kg = 5.7 t

分析:低碳地区的相同训练。

  • 魁北克电网强度:20 g/kWh(低碳电网)

  • 排放:13,246.5 kWh × 20 g/kWh = 264.9 kg

系统洞察:仅地域选择就导致训练排放相差 21.5 倍。碳感知部署能够在不改变模型架构的情况下改变环境成本。

体化碳评估

如 图 15.9 所示,运行能源主导了典型部署的总拥有成本,但随着电网转向可再生能源,半导体制造的体化碳成为约束条件。

图 15.9:生命周期碳堆叠:五年堆叠柱状图,按年份 1–5 将 AI 部署排放分解为运行能源和体化碳组成部分。对于典型部署,运行能源主导早期柱状图;体化碳(半导体制造和数据中心建设)随着电网去碳化成为约束组件,使硬件寿命成为关键工程杠杆。

图 15.9 的关键洞察在于:随着电网去碳化,来自芯片制造和数据中心建设的体化碳可能成为主导项,使硬件利用率和寿命成为首要的可持续性杠杆。

体化碳包括原材料提取、半导体制造、组装、运输和报废处置的排放。对于 AI 硬件,制造排放由先进半导体工艺的能源密集型特性主导。

先进节点 AI 加速器具有相当大的制造足迹:一块 NVIDIA A100 GPU 每个单元包含约 150 kg CO[2]eq(Luccioni et al. 2023),而 NVIDIA 的 HGX H100 产品碳足迹意味着在将底板足迹均匀分配到其八个 GPU 时,每个 H100 大约为 164 kg CO[2]e(NVIDIA Corporation 2025),包括先进工艺节点的晶圆制造、高带宽内存生产和封装。方程 15.12 将此体化碳在硬件寿命期内摊销,以计算每次使用的排放:

C\_{\\text{embodied,daily}} = \\frac{C\_{\\text{manufacturing}}}{T\_{\\text{lifetime}} \\times 365} \\qquad(15.12)

理解体化碳如何随时间累积,有助于解释为何硬件利用率和寿命主导总生命周期排放。

在租用 GPU 一小时时,会出现一个隐藏成本:费用不仅覆盖电费,还摊销了制造碳债务。

体化碳摊销公式使该分配明确:

C\_{\\text{total}} = C\_{\\text{operational}} + \\left( \\frac{C\_{\\text{manufacturing}}}{T\_{\\text{lifetime,years}} \\times 365 \\times 24} \\times T\_{\\text{job,hours}} \\right)

场景:在 8 块 NVIDIA H100 上训练模型 10 小时。

  • 运行:8 × 0.7 kW × 10 小时 = 56 kWh。在美国平均电网(0.429 kg/kWh)下 = 24 kg。

  • 体化:8 × 164 kg = 1312 kg。

  • 摊销:寿命 = 3 年(26280 小时)。

    • 每小时“租金”= 1312 kg / 26280 小时 ≈ 0.050 kg/h。

    • 作业成本 = 0.050 kg/h × 10 小时 = 0.5 kg。

系统洞察:对于在高碳电网上的长寿命硬件,电力占主导(24 kg vs. 0.5 kg)。然而,在清洁电网(水电,0.020 kg/kWh)中,运行排放降至 1.1 kg,使体化碳成为总足迹的显著部分(约 30.8%)。

此示例假设使用寿命为 4 年,略高于上述生命周期估计中使用的 3 年摊销窗口;此假设很重要,因为更长的寿命会将相同的制造碳分摊到更长的服务期,从而降低每次作业的分摊份额。对于每块具有 150 kg 体化碳(按 NVIDIA 产品碳足迹)的加速器,以及 4 年的数据中心寿命,第一步是每日摊销:150 kg / (4 年 × 365 天/年) ≈ 0.103 kg/天。

第二步是将该每日份额分配给作业。在 64 个加速器上运行 14 天的训练任务将产生 64 × 14 天 × 0.103 kg ≈ 92.1 kg 的摊销体化碳。

92.1 kg 的体化贡献约占上文在美国平均电网下计算的运行排放(5682.7 kg)的 1.6%。如果在魁北克低碳电网中进行训练,其中相同的运行产生 264.9 kg 的运行排放,则体化贡献将占总排放的约 25.8%。

全生命周期碳核算

完整的生命周期评估将运行排放和体化排放跨所有阶段结合起来。方程 15.13 汇总这些贡献:

C[lifecycle] = C[training] + C[inference] + C[embodied]   (15.13)

如 图 15.10 所示,训练在这次单次部署的生命周期快照中占主导,而制造和推理仍然是重要因素。

图 15.10:ML 系统的碳生命周期:单次部署生命周期快照,其中训练占比最大,其次是制造和推理。

图 15.10 的此单次部署快照仅讲述了部分故事。累积图景相反:每天为数百万查询提供服务的模型可能在几个月内,或对于高流量服务,甚至在几天内就超越其全部训练碳足迹,这使得推理优化成为生产系统在模型服务生命周期内最高影响的可持续性干预措施。

两条曲线随模型服务生命周期变化:一条平坦的蓝色训练排放基线和一条陡增的红色累积推理曲线,其 steeply 上升并交叉,使得推理成为总排放的主导部分。

累积推理排放超越一次性训练成本。

对于规模化部署的模型,推理排放通常主导生命周期。考虑一个每天服务 1000 万次查询,每次查询消耗 0.001 kWh 的模型。年度推理能源和排放分解如下:

  • 日能源:1000 万次查询 × 0.001 kWh = 10,000 kWh

  • 年能源:10,000 kWh × 365 天/年 = 3,650,000 kWh

  • 年排放(美国电网):3,650,000 kWh × 0.429 kg/kWh = 1,565,850 kg = 1565.9 t

与上述 7B/64-A100 训练示例(5.7 t)相比,在此规模下的累积推理排放量在大约 1.3 天的部署后超过训练排放量。对于更大规模的训练运行,交叉点可能根据查询量、每查询能耗和电网强度而转移到数周或数月。因此,生命周期视角确定了优先级:对广泛部署的模型优化推理效率,对经常重新训练或进行实验迭代的模型关注训练效率。

区域电网强度数据来源

准确的碳核算需要与所做决策相匹配的电网强度数据。实时碳强度随发电组合变化而变化,而发电组合又根据需求、可再生能源可用性和电厂调度决策按小时变化。数据源的选择取决于团队是估算未来任务、调度实时工作负载,还是审计已完成的运行。

美国能源信息署(EIA)按地区发布历史电网排放因子,并每年更新。对于前瞻性分析,这些年平均值提供合理的估算。ElectricityMap 和 WattTime 提供覆盖全球主要电网的实时碳强度 API,使能碳感知调度系统。对于已完成训练运行的回顾性分析,这些来源的小时级边际排放数据可实现精确归因。Listing 15.1 实现了一个生命周期碳计算器,该计算器将能源测量与电网强度数据集成:


Listing 15.1:生命周期碳计算:计算包括运行排放和隐含排放在内的总碳足迹。

团队可以使用这种程序化方法将总生命周期碳核算直接集成到他们的编排仪表板中。然而,对单个训练运行计算运行排放和隐含排放仅捕捉了问题的一个维度。密集型 AI 数据中心在规模上消耗资源的宏观层面模式揭示了额外的限制和优化机会。

数据中心能源和资源消耗

当传统网络服务器处理 HTTP 请求时,CPU 会短暂升至 20% 的利用率,并立即返回空闲状态。当 GPU 集群训练基础模型时,数千个处理器以 100% 的利用率运行,连续三个月持续消耗最大功率。这种前所未有的、持续不断的热密度从根本上打破了传统数据中心设计,迫使工程师采用液冷并重新设计整个电力分配网络。

因此,设施的可持续性必须被视为一系列约束条件,而不是单一的 PUE 数值。持续的兆瓦需求决定了电网和排放暴露程度,电力输送决定了有多少电力变为有用的 IT 负载,冷却决定了密集机架是否能在不降额的情况下运行,用水量则决定了技术上高效的站点在本地是否可持续。

数据中心能源和 AI 工作负载

在设施规模下,优化目标不再是单个模型,而是围绕每瓦 IT 功率的开销和电网背景。数据中心能源效率在不同设施之间差异显著,因此相同的 IT 工作负载可能施加不同的设施和碳成本。电源使用效率(PUE)在谷歌最高效的设施中低至 1.1,而在典型企业数据中心中可达 2.5,这实际上通过基础设施开销使能源消耗翻倍。地理位置也影响碳强度:在代表性强度下,相同的模型在水能占比高的电网上训练,其运行排放可能比在煤能占比高的电网上训练的模型低几十倍。如果没有可再生能源的获取,这些设施将严重依赖煤炭和天然气等非可再生能源,从而导致全球碳排放。IEA 在其 2025 年《能源与 AI》分析中估计,数据中心电力使用排放约为 1.8 亿吨,并在其基准情景中预测到 2035 年将达到约 3 亿吨,同时仍低于能源部门总排放的 1.5%。³⁶² 随着数据中心容量、训练工作负载和推理需求的增长,AI 的能源负担也可能增加(Patterson et al. 2021)。如果不进行干预,这些趋势可能导致 AI 的环境足迹变得不可持续地大(Thompson et al. 2023; Dodge et al. 2022)。

数据中心的能源需求

相关的设施指标是持续的兆瓦级负载,而不仅仅是模型名称。例如,Meta 运营着横跨多个足球场大小的超大规模数据中心,内部部署了大量 AI 优化服务器。³⁶³ 非官方估计表明,GPT-4 可能在数月内使用了数万颗 A100 级 GPU(SemiAnalysis 2023),但 OpenAI 未披露 GPT-4 的硬件、训练计算、模型规模或训练时长。这些设施依赖高性能 AI 加速器,如 NVIDIA H100 GPU,其架构针对高吞吐量张量工作负载进行了优化,且每瓦性能较前代有所提升(Choquette 2023)。在模型精度允许的情况下,低精度方法可以通过用低精度算术替换全精度算术来提高计算和内存效率(Gholami et al. 2021)。

AI 在各行业的快速采用推动了这种显著的能源消耗。Figure 15.11 展示了一个高增长情景,说明 AI 工作负载在 2024 之后将显著增加数据中心总能源需求。Masanet et al. (2020) 解释了为何应将此情景与历史背景相结合:效率提升 previously 调节了数据中心能源增长,但持续的需求增长可能削弱这种抵消效果。

Figure 15.11:预测需求:一个展示高增长情景的图示表明,AI 工作负载将在 2030 年前显著增加数据中心的电力需求。Masanet et al. (2020) 记录了之前调节数据中心能源增长的历史效率提升;叠加值是情景假设,而非该来源的直接预测。

除了计算需求,冷却占数据中心能源消耗的 30–40% (Ebrahimi et al. 2014),正如 Section 15.4.6 所讨论的那样。

虽然 Figure 15.11 投射了全球趋势,但仅在美国就能看出云和 AI 基础设施如何重塑国家能源规划。Figure 15.12 展示了劳伦斯伯克利国家实验室(LBNL)提供的美国数据中心电力消耗数据,显示从 2014 年的 58 TWh 增至 2023 年的 176 TWh,消耗量翻了三倍。LBNL 的预测将 AI 工作负载视为进一步增长的重要驱动因素,并预测到 2028 年电力消耗将翻一番或翻三倍,高端情景表明数据中心将消耗美国约 12% 的电力。这一轨迹代表了 AI 扩张的物理约束,仅靠软件优化无法消除。

Figure 15.12:能源缺口:美国数据中心电力消耗从 2014 年的 58 TWh 增至 2023 年的 176 TWh,翻了三倍。LBNL 预测到 2028 年将进一步翻倍至 325–580 TWh,并将 AI 工作负载视为增长的重要驱动因素。在高端情景下,数据中心将消耗美国约 12% 的电力,这代表了 AI 扩张的物理约束,仅靠软件优化无法消除。

Distributed Systems Energy Optimization

Large-scale AI training inherently requires distributed system coordination, which introduces additional energy overhead on top of computational demands. The parallelism strategies discussed in Chapter 5 introduce network communication costs that can account for 20%–40% of total energy consumption in large clusters.³⁶⁴ This coordination across thousands of GPUs requires continuous synchronization of computational updates and model parameters³⁶⁵, resulting in data movement between nodes. This communication overhead scales poorly: increasing cluster size causes network energy during all-to-all communication patterns in gradient aggregation to grow superlinearly.

Addressing these communication overheads requires coordinated resource management that goes beyond single-server efficiency at the cluster level. Four operational levers modulate energy budgets at cluster scale:

  • Dynamic Workload Placement: Consolidating training jobs onto fewer nodes during low-demand periods allows idle hardware to enter low-power states, achieving 15%–25% energy savings.

  • Intelligent Scheduling: Leveraging time-zone differences and regional renewable availability to coordinate training across multiple data centers reduces carbon intensity by 30%–50% through temporal load shifting.

  • Multi-Tenant Sharing: Sharing clusters across model training jobs increases GPU utilization from typical 40%–60% to 80%–90%, effectively halving energy per trained model.

  • Batch Processing: Aggregating multiple smaller training jobs utilizes available compute more effectively, reducing the energy overhead of maintaining idle infrastructure.

The common pattern is utilization discipline: systems save energy by avoiding capacity that is powered on but not executing useful model work.

Carbon Benchmarks for AI Workloads

The environmental impact of AI workloads has come into focus as their carbon emissions approach levels associated with traditional carbon-intensive industries. Strubell et al. grounded this concern by estimating that large-scale NLP model development training and architecture search emitted carbon comparable to several passenger vehicles over their lifetimes (Strubell et al. 2019). Patterson et al. subsequently showed that the widely cited architecture search estimates depended heavily on proxy task, hardware, data center efficiency, and grid carbon intensity assumptions (Patterson et al. 2021). To contextualize AI's environmental footprint, larger and more precisely measured BERT-family models exhibit significantly higher per-query carbon emissions (Figure 15.13). The scatter plot shows highest-accuracy variants occupy the upper-right of the chart, with carbon costs rising faster than accuracy gains. This trade-off underscores the need for more sustainable AI practices.³⁶⁶

Figure 15.13: Carbon Footprint Benchmark: Scatter plot of per-inference CO₂ emissions (vertical axis) versus task accuracy (horizontal axis) for multiple BERT-family models. High-accuracy variants sit in the upper-right; carbon costs rise faster than accuracy gains, emphasizing environmental impact of chasing marginal accuracy improvements.

Training large NLP models generates CO₂ emissions comparable to hundreds of transcontinental flights. At the broader industry level, AI and data center emissions are growing rapidly, though the IEA scale estimates cited in this chapter do not yet support direct parity claims with commercial aviation. As AI applications scale to serve billions of users globally, cumulative emissions from sustained inference operations may eventually surpass those generated during training phases.

The lesson is that carbon accounting must distinguish pure training results from deployment inference. Figure 15.14 provides a detailed breakdown of carbon emissions across Meta's diverse large-scale ML workloads, illustrating the environmental impact of different AI applications and architectures. This quantitative assessment of AI carbon footprints grounds mitigation strategies in measured environmental costs rather than estimates.

Figure 15.14: Operational Carbon Footprint of Large-Scale ML Tasks: Stacked bar chart showing lifecycle CO₂e for Meta's recommendation models (RM-1 through RM-5), language models (LM), and multiple open-source large models (BERT-NAS, Evolved Transformer, T5, Meena, GShard-600B, Switch Transformer, GPT-3). Recommendation models are dominated by inference (solid black), while publicly reported open-source baselines report only training footprints (hatched fill), highlighting that scaled inference serving emissions can match or exceed training emissions for deployed systems. Source: (Wu et al. 2022).

Comprehensive Carbon Accounting Methodology

AI's impact extends beyond operational energy. A comprehensive carbon footprint assessment combines three-phase lifecycle analysis (training, inference, manufacturing) with the three standard emission scopes defined by the GHG Protocol. With AI projected to grow rapidly through 2030, understanding total lifecycle costs across all phases and scopes is critical for identifying the highest-impact sustainability interventions.

Within the boundary of owned data center facilities, Scope 1 emissions arise from on-site generation, including backup diesel generators, facility cooling systems, and owned power plants. While many AI data centers primarily use grid electricity, those equipped with fossil-fuel backup systems or on-site generation produce direct emissions.

Scope 2 emissions represent indirect emissions from purchased electricity powering AI infrastructure. This is typically the dominant category for owned facility operations and varies dramatically by geography and grid energy mix. As noted in Section 15.1.1, this geographic lever spans 8x to 40x across typical regional pairs; comparing the dirtiest coal grids to the cleanest hydro grids stretches this range to 10x–80x at the extremes.

Scope 3 emissions constitute the most complex category, encompassing hardware manufacturing, cloud supply chains, transportation, disposal, and downstream use. Semiconductor manufacturing is carbon-intensive.³⁶⁷ For low-utilization hardware or clean-grid deployments, accumulated accelerator emissions can rival months or years of operational emissions; conversely, sustained high-power training on carbon-intensive grids may reach break-even far sooner. At the corporate level or in value-chain AI accounting, Scope 3 often dominates even when Scope 2 leads the operational footprint of a single owned facility.

超越制造,范围 3 排放还包括 AI 部署后的下游影响。诸如搜索引擎、社交媒体平台和基于云的推荐系统等 AI 服务规模巨大,需要在规模上非常庞大,需要在数以百万甚至数十亿的用户交互中进行持续推理。推理工作负载的累计电力需求最终可能超过训练所用的能源,进一步放大 AI 的碳足迹。终端用户设备,包括智能手机、物联网设备和边缘计算³⁶⁸平台,也对范围 3 排放有所贡献,因为它们的 AI 启用功能依赖于持续的计算。在大型科技公司的可持续发展报告中,范围 3 排放往往主导公司范围的排放;将这一份额具体归因于 AI 驱动的服务需要基于工作负载的会计核算,而不仅仅依赖公司范围的总和。

运营排放仅捕捉了 AI 的生产阶段。软件开发本身还增加了一层很少被计入账目的环境影响。

除了直接的训练和推理能耗,AI 的整个软件开发生态系统具有显著但难以测量的碳足迹。数百万次持续集成和持续部署(CI/CD)管道运行、开发期间的持续代码重新编译、像GitHub这样的大型版本控制系统的运行,以及代码审查系统、自动化测试框架和协作开发平台所消耗的计算资源,都对环境影响有所贡献。大型 AI 研究组织可能运行数千次实验性训练任务,其中大部分从未进入生产阶段,在探索过程中消耗大量能源。AI 开发的整个生态系统是耗能的,远远超出了最终模型训练和推理阶段。

GHG Protocol³⁶⁹框架(Institute and Sustainable Development 2023)为这些排放提供了标准分类,概述见图 15.15。三个范围提供了一个工程分类清单:

  • 范围 1(直接排放):源自公司直接运营——备用发电机、公司拥有的发电设施。

  • 范围 2(间接能源排放):从电网购买的电力,是云计算工作负载的主要排放源。

  • 范围 3(价值链排放):超出直接控制范围——半导体制造、硬件运输、AI 加速器的报废处理。

图 15.15:温室气体排放范围:中心辐射式布局,将报告组织置于中心,范围 1(直接排放)、范围 2(购买能源)和范围 3(价值链)作为不同的分支围绕其布置。每个分支列出代表性排放源,支持全面的环境影响评估。来源:Ucircularise。

将这些排放划分到范围 1、2 和 3 框架中,为企业环境报告提供了标准化的术语。在实践中正确应用这一框架需要将典型 ML 平台运营生命周期中的各种隐藏排放源进行分类。

你正在审计一个机器学习平台的碳足迹。请将以下排放源归类到范围 1(直接)、范围 2(间接能源)或范围 3(价值链):

准确分类这些隐藏排放迫使工程团队对其部署的整个价值链承担责任。设施的抽象能源指标及其由此产生的碳足迹最终由机架的物理热力学定律决定。向单个机柜输送120 kW功率并提取由此产生的热量,需要超越传统空调的范畴。

电力输送

当工程师仅为加速器TDP制定预算时,容量规划就会失败。电力在到达 GPU 的电压调节器之前,在每次转换过程中都会损失能量和可靠性余量,因此输送路径既识别了设施的瓶颈,也识别了冷却必须移除的热量。该路径始于建筑物外部:电力以高压交流形式到达,通常为13.8–69 kV,具体取决于国家和设施规模,而专用变电站或变压器场则将其降压至中压。最大的 ML 设施需要自己的变电站,建设时间为18–24 个月,且需要与当地电力公司协调。电网连接是终极瓶颈:无论建筑内部进行多少工程,都无法输送超过电网提供的电力。

时间阶梯图:比较 24 个月的变电站路径与 6 个月的 GPU 采购路径,四倍滞后以比率注释形式标注。

变电站前置时间可能长达 GPU 采购时间的 4 倍。

部署10,000 个 GPU及其所需的电力变电站(以驱动 IT 负载,在7 MW GPU 小计基础上扩展机架支持功率后为9.6 MW)的部署时间表截然不同。在硅路径上,GPU 供应链波动较大,但典型企业交货时间为6 个月。在基础设施路径上,针对新10+ MW变电站的许可、EPC(工程、采购、施工)和电网连接平均耗时24 个月。因此,基础设施的部署时间比加速器本身长4 倍

系统洞察:在 ML 机队时代,主要瓶颈不在于硅的供应链,而在于电网的互联排队。截至 2024 年,仅在美国,就有超过2000 GW的容量在等待电网连接。如果工程师只优化 GPU 利用率却没有 2 年的供电路线图,他们就会发现自己的机队“电力受阻”:昂贵的硅芯片坐在一栋没电的楼里,等待变压器。

在设施内部,不间断电源(UPS)对输入电力进行调节,并在短暂停电时提供电池备份。现代在线双转换UPS系统将交流电转换为直流电,为电池组充电,然后再转换回交流电,这确保了纯净的电力,但会损失3–5 percent的效率。高效率的 Eco-mode 设计在正常运行时跳过该双转换过程,实现98–99 percent的效率,同时对输入异常的防护略有降低。配电单元(PDU)然后将来自UPS的调节电力分配到机架上,通常提供从480 V降压到208/240 V的最终交流步降,以供服务器使用。

一些 ML 设施采用48 V 直流配电,这消除了一个转换阶段,并将效率提高2–3 percent。这一提升不仅仅是在通用数据中心环境中的渐进增益;对于密集的 ML 加速器基板,它解决了硬件本身施加的硬性物理约束。一个配备八颗H100 GPU 的训练节点,每颗功耗为700 W,仅加速器部分就需要超过5,600 W的功率。在传统的12 V供电下,满足该需求需要在基板母线上输送近470 A的电流。在此电流水平下,铜导体自身的I²R损耗会产生显著热量并导致电压下降,从而削弱VRMs的严格电压容差。升至48 V会使输送电流降低四倍,从而将I²R分配损耗降低十六倍。对于高度集成的 ML 基板——如 NVIDIA 的HGX——48 V 直流不仅是一种设计偏好,更是在不熔断电源连接器的前提下以额定功率密度运行的必要条件。谷歌率先在其数据中心采用了48 V 直流配电,而开放计算项目(OCP)已为高密度计算标准化了机架级48 V 直流电源总线。

数据中心电力传输路径

电力转换效率的影响

在 ML 机架功率密度下,95% 与 98% 配电效率的差异是显著的。对于 33 kW 的机架,3% 的效率提升每机架可节省约 0.99 kW 功率。在拥有 300 个机架的设施中,这可节省 297 kW,足以供电约 36 个额外的 GPU 节点,或按此机架功率组合计算约 9 个四节点机架。在电价 $0.07/kWh 的 3 年生命周期内,效率提升可节省约 $546,361 的电费。

最终转换发生在服务器和基板上。每台服务器包含电源单元(PSU),将机架级电压转换为 12 V DC 或直接转换为基板组件所需的多种电压。例如,DGX H100 使用多个总额定功率 10 kW 的高效 PSU,采用 N+1 冗余设计,因此单个 PSU 故障不会使节点下线。电压调节模块(VRM)随后将 12 V DC 转换为 GPU 核心所需的 0.7–1.0 V 以及 HBM 所需的 1.1–1.2 V。这些调节器必须在微秒级内响应负载变化(当 GPU 在空闲和全负载计算之间切换时),且工作效率为 90–95%。

验证您对数据中心电力路径的理解

在每 GPU 700 W 的功耗下,VRM 散发 35–70 W 热量,这必须与 GPU 本身一起冷却。这种 VRM 热量有时会在热设计中被忽视:在冷板覆盖 GPU 的液冷系统中,VRM 通常仍由小风扇风冷,给没有直接液冷接触的其余组件带来了热管理挑战。

所有五个阶段的累计效率通常为 85–90%,这意味着每 100 W 的有用计算,电力传输链本身就有 10–15 W 作为热量损失。这种开销是 PUE 计算的一部分,代表将公用电力转换为有用计算的不可避免成本。

为了具体说明,考虑包含四个 DGX H100 节点的单个机架的功率预算:

表 15.6 详细列出了完整的机架预算,因此设施规模规划包括主机、网络、转换和冷却开销,而不仅仅是 GPU TDP。

| 组件 | 功率 (kW) | 占机架总数 % |

| --- | --- | --- |

| GPU 计算 | 22.4 kW | 67% |

| 主机 CPU 和 DRAM | 3.2 kW | 10% |

| NVSwitch 结构 | 1.6 kW | 5% |

| InfiniBand HCA | 0.8 kW | 2% |

| 电力转换损耗 | 2.8 kW | 8% |

| 冷却开销 (PUE ~1.09) | 2.7 kW | 8% |

| 总计 | 33.5 kW | 100% |

表 15.6:四节点 DGX H100 机架功率预算:GPU 消耗总机架功率的三分之二,但剩余的三分之一(主机系统、网络、电力转换和冷却)无法消除,在规划设施电气基础设施规模时必须将其纳入预算。电力转换损耗(8%)代表五级传输链的累积低效。

正如 表 15.6 所示,32 个 GPU 每个 700 W 共提供 22.4 kW,但仅凭该 GPU 子总计就低估了真实的机架功率需求约 50%。仅基于 GPU TDP 规划设施规模的基础设施规划师将低估电气负载,并可能在调试期间发现其电力容量不足。

同步瞬变挑战

ML 训练工作负载给这条电力链带来了独特的挑战:同步瞬变。在传统的 Web 服务数据中心,成千上万台服务器处理独立请求,其功耗互不相关。总负载平滑且可预测,一天内变化幅度可能只有 10–20%。

而在训练集群中,情况截然不同。所有加速器同步执行相同的计算。当大规模矩阵乘法开始时,集群中数千个 Tensor Core 同时激活,功率需求在微秒内激增 40–60%。当计算暂停以进行梯度同步时,需求同样急剧下降。这些功率斜率给传输链中的每个组件带来压力,从基板上的 VRM 到变电站中的变压器。

场景

一个 512-GPU 训练集群在同步训练步骤期间经历间歇性节点重置。故障似乎与模型代码无关。

故障模式

硬件诊断显示无组件缺陷。可能的根本原因是电力传输链:同步训练步骤可能产生数百千瓦的负载阶跃——在设施开销之前,512 个 GPU 以 600 W 的空闲到峰值摆动约为 300 kW——这超出了上游电力调节设备的响应时间。

后果

电压跌落可能触发加速器欠压保护电路并强制硬重置。缓解措施是本地骑越容量,例如超级电容组,可在较慢的 UPS 和设施系统响应之前平滑瞬变。

系统洞察

ML 集群的行为不像传统数据中心工作负载:跨数千个芯片的功率需求的时间相关性创造了质 itatively 不同的电气工程挑战。

分层防御策略

现代 ML 数据中心通过分层防御策略应对功率瞬变,每层覆盖不同的时间尺度。超级电容组提供第一道防线,在微秒内提供数百千瓦功率以平滑初始浪涌。与响应时间以毫秒计的电池不同,超级电容器以静电方式存储能量并能瞬间放电。典型安装在每机架配置 50–100 kJ 的超级电容存储,足以维持 100 kW 瞬变 0.5–1.0 秒。

具有快速逆变器响应(切换时间 10 ms 以下)的电池备份 UPS 系统处理较长瞬变,并在持续数分钟的短暂电网扰动期间提供骑越能力。

专用电气变电站配合定制变压器设计服务于最大规模安装。这些变压器额定用于 ML 工作负载特有的高 di/dt(电流变化率),采用定制绕组配置,可在无电压畸变的情况下处理快速负载摆动。标准公用变压器专为缓慢变化的负载设计,在承受 ML 训练产生的快速负载变化时可能发生磁饱和。

为了理解这些瞬变的量级,考虑一个 1024-GPU 集群从通信阶段(每 GPU 平均 400 W)过渡到矩阵乘法阶段(每 GPU 700 W)。功率增量为 300 W × 1024 = 307 kW,该过渡约在 100 μs 内发生。功率变化率因此为 307 kW/100 μs = 3.07 GW/s。无源电气元件无法在此速率下响应;只有物理位置靠近负载的储能装置(超级电容器)才能在瞬变传播至建筑物电气配电系统前吸收它。

两条随时间变化的曲线:蓝色低振幅负载线和红色加速功率峰值。

训练阶段转换产生微秒级功率冲击。

电力传输链的累积低效

电力传输链本身在每个阶段都引入低效。公用事业到中压变换损失 1–2%。UPS 损失 3–5%(现代双变换设计)或 1–2%(正常运行期间旁路逆变器的生态模式设计)。PDU 损失 2–3%。基板上的电压调节再损失 5–8%。累计来看,从电网汲取的功率有 10–15% 在到达晶体管前就在传输链中作为热量耗散。这种开销是 PUE 计算的一部分:PUE 为 1.10 意味着传输链和冷却共同消耗 IT 负载之上 10% 的功率。

大规模供电与制冷

电网级供电约束

在最大规模下,数据中心的功耗占据了当地电网容量的显著份额。一个 100,000-GPU 集群,若每个 GPU 为 700 W,则加速器小计功率为 70 MW,但机架配套的支持功率使 IT 负载在 PUE(电源使用效率)之前达到 96.2 MW。加上 PUE,总设施功耗接近 107.8 MW。这相当于为一座小型城市供电。此类装置需要来自电网的专用馈线,通常配备专用变电站和输电线路。电网互联的交付周期可能超过两年,使得电力可用性成为构建 ML 基础设施中交付周期最长的约束之一。

在大规模集群层面,相同的交付限制变成了电网采购问题,而非电费账单问题。GPT-3 的 1,287 MWh 训练运行是本章约 120 户·年 用电量的基准。后续的大型系统未披露可比的训练能耗数据,这正是为何工程学科必须在工作负载层面追踪能耗,而不能仅依赖公开的模型卡片。

当模型与数据增长相互叠加时,这一电网采购问题会恶化。能耗随模型规模扩展的关系近似为线性:在训练令牌数/参数保持不变的前提下,模型参数翻倍大致意味着训练能耗翻倍。当模型规模与数据集规模同时增加时,总训练能耗呈超线性增长。参数量为 10×、训练数据为 10× 的模型,所需能量约为 100×

单次大模型训练活动消耗的电力,相较于发电厂的产出可能已不容忽视。一个 100 MW 的训练设施全功率运行一年将消耗 876 GWh,这与一个 100 MW 风电场的年发电量相当(按 30 percent 容量因子计算,风电场年发电量约 262.8 GWh,因此训练设施需要约 3.3 个大型风电场的等效产出)。

因此,电力可用性与电力来源成为同一项基础设施决策。训练大模型的组织可能寻求将其耗电量与可再生能源发电相匹配,要么将数据中心选址于可再生能源附近(水电、风能、太阳能),要么购买可再生能源证书(RECs)以抵消其电网消耗。

直接投资清洁发电是该决策的最强形式,因为它增加了发电容量,而非仅重新分配信用额度。例如,微软已签署协议从重启的反应堆采购核能,认识到 ML 训练负载的规模与持续性要求能提供基荷电源,而仅靠间歇性可再生能源无法满足。谷歌同样投资了地热能项目,其提供的电力输出稳定,不受天气条件影响。

能源电网的碳强度决定了训练运行的真实环境成本。由太平洋西北部水电大坝供电的设施,排放约 50 g CO[2]/kWh;而以煤电为主的电网排放可达 400 g CO[2]/kWh 或更高。我们 175B 模型的单次训练运行消耗约 1,287 MWh,仅取决于选址,其碳影响即在 64 tonnes515 tonnes 之间波动——高达 的差异,使得选址成为首要的脱碳杠杆。这种太平洋西北水电与中等煤电电网的对比,处于 第 15.1.1 节 所确立的地理跨度的保守一端;更清洁的水电网将进一步拉大差距。这种环境核算可驱动基础设施决策:能将训练集群部署在低碳地区的组织,可能同时实现更低的电力成本(水电通常比化石燃料发电更便宜)和更低的碳足迹,这是经济与环境激励难得一致的契机。

制冷

输送给 GPU 的每一瓦电功率最终都会转化为热量。热力学第一定律保证了这一点:电能转化为计算工作(晶体管翻转),但“工作”产物仅是内存中的比特翻转,其本身能量可忽略不计。所有输入能量均以热能形式离开系统,必须从芯片物理移除、传出机架,并排放至环境中。热传递的基本物理学确立了不可避免的约束:由 33.5 kW 表示的机架级电负载,必须以同等速率被冷却介质吸收并持续带走。哪怕冷却短暂滞后,芯片温度升高,触发热节流降低时钟频率与吞吐量;极端温度下,硅片可能遭受永久损坏。

一条曲线在绿色安全区保持平坦低位,随后随热负载逼近制冷极限而陡然上弯并转红。绿变红的重着色标记了节流临界点:低于此点安全,高于此点急剧恶化。

热限以下芯片安全运行;跨越该限则节流陡增。

空气冷却作为数十年的主流技术,通过将室温空气吹过贴片散热器工作。空气按其比热容(约 1.0 kJ/kg/K)吸热。加热后的空气从机架后部排出,通常比进风口高 15–20 degrees Celsius,再被机房空调(CRAC)机组冷却后循环。

根本问题在于空气是不良热导体。其导热系数仅 0.026 W/m/K,而水为 0.6 W/m/K,铜为 400 W/m/K。若仅靠空气从机架移除 100 kW,风扇须以高速移动巨量空气,消耗机架总功率预算的 30–40 percent 仅用于制冷。

通过简单计算可量化该物理过程。流体带走热量的能力为:

Q = ṁ × c[p] × ΔT

其中 Q 为带走热量(瓦特), 为质量流率(kg/s),c[p] 为比热容(J/kg/K),ΔT 为出口与进口温差。空气的 c[p]1,005 J/kg/K,典型 ΔT15 K(进风 20 degrees C,出风 35 degrees C),移除 100 kW 需质量流率 100,000 ÷ (1,005 × 15) ≈ 6.6 kg/s。按海平面空气密度 1.2 kg/m³,对应体积流率 5.5 m³/s,约 11,713 CFM(立方英尺/分钟)。在服务器机架狭小空间推动如此大风量,需大功率风扇,其自身亦消耗可观功率。

在更高功率密度(> 30 kW / 机架)下,风扇功率开始接近或超越算力功率,此时制冷系统消耗的能量超过其支撑的计算。电源使用效率(PUE)[³⁷⁰] 指标捕捉此开销:PUE 1.5 意味着每 1 瓦算力消耗,额外消耗 0.5 瓦用于制冷与配电损耗。

降低 PUE 是 ML 数据中心的主要工程目标,因为制冷开销属于不产生有效计算的浪费能量。以 10,000-GPU 集群为例,扣除机架支持负载后 IT 功率为 9.62 MW,PUE 1.51.1 之差为 3.85 MW 浪费功率,每年电费约 $2.4M,且需要成比例更多的制冷基础设施以散热。

液冷技术:高密度机器学习机架的热力学必然选择

水的物理优势

水的比热容为 4.18 kJ/kg/K,是空气的四倍以上;导热系数约为空气的 25 倍。这些物理特性使水成为天生优越的传热介质。为了体会这种差异的量级,考虑一下从单个 GPU 移除 700 W 热量需要多少流体流量。空气在温升 15 度时需要每秒数十升的气流(相当于一个小型风洞)。而水在相同温升下仅需约 0.01 升/秒(一股细流)。体积流量上这成千上万倍的差异,就是为什么风冷需要巨大的风扇和精心设计的气流路径,而液冷只需细管和小型水泵。

直达芯片液冷

直达芯片液冷 将冷却水(或专用介电冷却液)通过精加工的铜制冷板引导,冷板直接安装在每个 GPU 封装上。冷板通过一层薄薄的导热界面材料与 GPU 的散热盖物理接触,形成热阻小于 0.1 K/W 的热路径。冷却液在距离晶圆表面几毫米处吸收热量,并通过歧管和管道将热量带到机架或列级的 CDU(冷却液分配单元)

CDU 将热量从芯片级冷却液回路(使用去离子水或介电流体的闭环)传递给建筑的冷冻水回路,后者通过冷却塔或干式冷却器将热量排放到室外环境。这种双回路设计将芯片级冷却液(必须超纯以避免冷板结垢)与建筑级水质(过滤要求较低)隔离开来。

由于液体冷却剂按单位体积吸收热量的效率远高于空气,服务器级风扇可完全移除(或仅保留用于 DIMM 和 VRM 等辅助组件的小型风扇)。冷却功耗开销降至 IT 功耗的 3%-8%,PUE 值达到 1.03-1.08。额外收益是降噪:液冷数据中心比风冷数据中心安静得多,这对与办公室共址或处于噪音管制区域的设施至关重要。

浸没式液冷

更激进的 浸没式液冷 将整块服务器主板浸没在非导电介电液体槽中。流体通过与每个元件表面直接接触吸收热量,省去了冷板、风扇甚至散热片。原理简单:如果电路板的每个表面都接触冷却液,热量就无处积聚,并能在整个组件上均匀带走。

单相浸没冷却

单相浸没冷却 使用全程保持液态的流体,热量靠槽内对流电流带走。加热后的流体上升至液面,经水泵通过热交换器向建筑冷冻水回路释热,再回流至槽底。

双相浸没冷却

双相浸没冷却 更进一步:流体在芯片表面沸腾,吸收汽化潜热(每克能量约为单纯温升的 100 倍),在槽顶冷表面冷凝,再滴落回液面。该循环自持且效率极高,单机架可移除 200 kW 以上热量,PUE 接近 1.02

权衡在于可维护性:更换故障部件需排液或部分浸泡,且介电流体昂贵($20-50/升)。容纳四块服务器主板的单个浸没槽可能装 500-1000 升 流体,仅冷却液成本就达 $10,000-50,000。浸没冷却设施的运维流程与风冷设施截然不同,要求技术人员接受专业培训,且线缆管理方式不同——所有连接器须耐长期浸泡。标准铜缆和连接器在某些介电流体中会腐蚀或膨胀,必须改用专用耐液材料,这增加了成本并缩减了供应链选择。表 15.7 对比了决定这些运维成本何时不可避免的风冷与液冷两种体制。

| 指标 | 风冷(传统) | 液冷(现代) |

| --- | --- | --- |

| 最大功率密度 | ~20-30 kW/机架 | >120 kW/机架 |

| 冷却效率 | PUE ~1.5-2.0 | PUE ~1.05-1.10 |

| 机制 | 强制风冷风扇 | 直达芯片冷却液 |

| 热载体 | 空气 (1.0 kJ/kg/K) | 水 (4.18 kJ/kg/K) |

| 风扇功耗 | 30-40% IT 负载 | <5% IT 负载 |

表 15.7:向液冷的转变:当机架功率密度超过 30 kW 时,风冷所需风扇功率将逼近 GPU 自身消耗的功率。液冷不是高端选项,而是高密度 ML 机架的热力学必然。

图 15.16 给出了这一阈值的物理原因对比:风冷靠大体积气流搬运热量,而液冷靠从芯片到冷却液的直接热路径搬运热量。

图 15.16:冷却架构对比——风冷 vs. 液冷:高密度 ML 机架热管理策略对比。风冷(左)需要海量气流和巨大的风扇开销,在 ~30 kW/机架处触及物理极限。液冷(右)采用直达芯片冷板和大热容冷却液,实现 >100 kW/机架密度且 PUE 显著更低。

图 15.16 与 表 15.7 共同展示了两种路线的鲜明对比。这些冷却技术的资本成本跨越一个数量级。标准风冷基础设施 $2,000-5,000/机架(风扇、CRAC 机组、抗静电地板)。直达芯片液冷 $15,000-25,000/机架(冷板、歧管、CDU、管道)。全浸没冷却 $30,000-50,000/槽(介电流体、密封槽、专用热交换器)。风冷与液冷的盈亏平衡分析取决于机架功率密度:在 20 kW/机架 时,风冷较低的 CapEx 在 3 年生命周期内胜出。在 40 kW/机架 时,液冷较低 PUE(1.08 vs. 1.5)带来的省电可在 18-24 个月 内抵消较高 CapEx。在 60+ kW/机架(密集 ML 基础设施常见密度)时,风冷物理上不可行,比较失去意义。对于我们 175B 模型、32 机架、33.5 kW/机架 的训练集群,直达芯片液冷 是基准选择,在密度、可维护性和成本间取得平衡。浸没冷却虽 PUE 略优(1.03 vs. 1.08),但带来的运维复杂性在该机架密度下许多组织难以接受。

算例:1,024 张 H100(单卡 700 W)

  • IT 功耗1,024 × 700 W = 716.8 kW

  • 风冷 (PUE 1.5):总设施功耗 = 716.8 kW × 1.5 = 1068.0 kW。冷却开销 = 351.2 kW

  • 液冷 (PUE 1.08):总设施功耗 = 716.8 kW × 1.08 = 774.1 kW。冷却开销 = 57.3 kW

节省:液冷节省 293.9 kW 持续功耗。按 $0.07/kWh 计,年节省约 $180,212。3 年硬件生命周期内,仅冷却节省即达 $540,636,往往超过液冷基础设施的安装资本成本。

制冷链的最后一环是热排放:将建筑冷冻水循环中的热量排放到室外环境中。主流技术是冷却塔,它将温水喷淋在填料上,利用蒸发将热量带入大气。蒸发式制冷效率极高(水的汽化潜热为 2,260 kJ/kg,而显热加热仅为 4.18 kJ/kg/K),但会消耗水资源。

采用蒸发式冷却塔的 10 MW 数据中心,每年水耗可轻松超过 1 亿升,具体取决于气候和制冷设计,这在缺水地区已成为一大关切。为直观对比,1.4 亿升水大约相当于 1,000 户家庭的年用水量。随着 ML 数据中心规模增长至 100 MW 甚至更大,其水资源占用成为当地资源规划中不可忽视的因素。

干式冷却器利用风扇吹风穿过散热器,无需蒸发即可冷却,虽杜绝了水耗,但仅当环境气温远低于冷却液温度时才能高效工作,这限制了其在炎热气候下的适用性。许多设施采用混合方案:凉爽天气用干式冷却器,热浪期间启用蒸发式冷却塔。

余热再利用将数据中心的热输出视为资源而非废弃物。ML 加速器集群的热密度相较于传统 CPU 基础设施,创造了一个容易被忽视的优势:其产生热量的品位。传统风冷 CPU 机架排出的热风约为 35 摄氏度,这一温度区间过低,若不借助高能耗热泵,难以实用化再利用。相比之下,液冷 ML 集群从其冷却液分配单元 (CDU) 回流的冷却液温度达 50–65 摄氏度——这种高品位热能非常适合区域供热网络、温室气候调控及工业过程应用。正是这种迫使采用直冷芯片技术的加速器热密度,使得 ML 机架在热力学上成为比传统 IT 基础设施更优的市政余热计划候选者。数个北欧数据中心已将余热供入市政供热网,抵消了冬季原本用于供暖建筑的天然气或电力。一座 10 MW 的 ML 数据中心可提供约 8–9 MW 的有效热量(考虑热泵效率后),足以供暖数千套公寓。当余热的经济价值抵扣数据中心运营成本时,有效 PUE 可降至 1.0 以下,意味着设施产出的有用能量(算力加热量)超过其从电网消耗的能量。

余热再利用的可行性取决于热用户的邻近度。城市数据中心虽面临更高的土地和电力成本,却往往比偏远设施更适合余热再利用,因为它们紧邻居民区和商业供热负荷。这导致一个反直觉的经济优化结果:北欧城市的数据中心虽电价较高,但扣除余热收益后的净运营成本,可能低于电价便宜却无热用户的偏远设施。

对于我们的 175B 模型训练集群,冷却技术的选择没有退路。仅 1,000 颗 H100 的集群,GPU 单独散热功率即达 700 kW,尚未计入 CPU、内存、网络及电源转换损耗。只有液冷能在所需密度下带走这些热量。机架层面是问题从计算转向物理的分水岭,冷却基础设施的设计往往决定了训练集群能否满载运行,还是必须降频以防热失控。

冷却系统可靠性

由于功率密度更高,冷却系统故障在 ML 集群中的后果比传统数据中心严重得多。在单机架 10 kW 的传统风冷数据中心中,CRAC 机组失效会导致温度在数十分钟内缓慢上升,留给运维人员充足的响应时间。而在单机架 100+ kW 的液冷 ML 集群中,冷却液流动中断会在 30–60 秒内使温度达到 GPU 的热关机阈值,因为冷板的热容和管道内极小的冷却液体积仅提供了微乎其微的热缓冲。

快速热失控驱动了多项设计决策。冷却液回路采用 N+1 冗余设计:每个 CDU 配备备用泵,管道歧管含旁通阀,可在 CDU 故障时重新导流冷却液。每块冷板的温度传感器会在冷却液出口温度超标(通常为 65 摄氏度)时立即报警,且 GPU 固件会在结温逼近 83 摄氏度限制时毫秒级降频。

部分设施还保留应急风冷能力作为最后防线。尽管风冷无法在 ML 机架密度下维持满功率运行,但它能让硬件在降频状态下维持在损坏阈值以下,争取时间修复液冷系统。这种纵深防御式的冷却可靠性设计反映出:在万卡 GPU 集群中,一次冷却故障可同时波及数百张 GPU,其潜在财务冲击远超冗余成本。

液冷系统的失效模式与风冷有本质不同。风冷失效相对温和:风扇故障降低风量,温度在数分钟内缓慢上升,留出充足时间供自动负载削减。液冷却可能灾难性失效:冷却液泄漏既可能损坏硬件(若冷却液导电),又会耗尽回路冷却液而丧失制冷能力。快速断开接头允许在不排空整个冷却回路的情况下热插拔服务器节点,是将维护停机时间从小时级压缩至分钟级的关键设计特性。然而,这些接头也是冷却回路中最常见的故障点,因为其 O 形圈密封件在数千次插拔循环后会老化。频繁更换硬件的设施(研究环境常见,节点需定期重组)必须预算季度更换 O 形圈并储备备用接头。

当从独立推理服务器转向紧耦合训练集群时,冷却可靠性的经济账发生剧变。在采用同步并行的分布式训练中,导致一个 Pod 级切片停机的冷却回路故障,会停滞整个作业。设想一次冷却故障触发 1 万 GPU 集群中某 256 GPU Pod 的热关机。直接硬件损失微乎其微,但机会成本巨大。若 CDU 泵维修需 4 小时,按每 GPU 小时 4 美元,直接损失 256 GPU 仅 4,096 美元。然而训练算法要求所有 Worker 同步推进,其余 9,744 GPU 也被迫空转白白耗电。这种“拖后腿效应”将损失推高至 16 万美元算力损耗。加上检查点恢复开销及回滚至上一保存状态的损失——常丢失 30–60 分钟计算进度——单个冷却部件故障的总财务冲击轻松超过 20 万美元。故障成本的非线性放大,使得冷却回路的 N+1 冗余成为训练经济学上的数学必然。

爆炸半径风扇图:一个红色的冷却故障源向六个蓝色受影响组发射箭头,标注表明 Pod 级冷却故障会使同步训练作业停滞。

一次冷却失效可能导致整个训练作业停机。

维持液体回路的物理完整性需要管理复杂的流体化学动态。直接到芯片系统中循环的流体通常是deionized water与特定防腐剂混合,而非普通自来水。为防止galvanic corrosion,导电率必须严格维持在每厘米 1 微西门子(μS/cm)以下,此时回路中不同金属(铜冷板和不锈钢分配管)之间的电位差会腐蚀冷却表面。这种化学平衡是不稳定的:防腐剂会随时间消耗,溶解气体会累积,因此需要每月进行质量测试和每年进行一次全量更换。生物污染同样构成严重威胁。冷板内部微鳍上的Biofilm生长会充当热绝缘体;仅 50 微米厚的有机生长层就可能使热传递系数下降 30%,迫使水泵以最大功率运行以进行补偿。因此,定期使用杀菌剂和定期冲洗系统与驱动程序更新或固件补丁对集群性能同样至关重要。

训练 vs. 推理能耗分析

冷却基础设施管理着集群的巨大热负荷,但该负荷的总大小取决于机群是在执行集中的训练任务还是全球分布的推理工作负载。训练一个巨型语言模型是一场壮观且高度可见的能源事件,类似于发射火箭。将同一模型部署用于服务每日十亿次查询,就像运营一个国际航空机队。训练在数月内以高度集中的方式消耗数千兆瓦时的能源;推理则以查询为单位持续消耗能源,年复一年。了解大部分能源预算的去向,决定了优化工作应聚焦的方向。

优化机会因生命周期阶段而异。训练阶段的优化侧重于计算效率和硬件利用率;推理阶段的优化则强调延迟、吞吐量和边缘部署策略。将可持续性干预措施匹配到每个应用的主要能源消费者上,能够获得最大的回报。

训练能耗需求

训练超大型 AI 模型可能需要包含数十万核心和专用 AI 加速器的计算基础设施,并在数月内持续运行。微软 2020 年披露的用于 OpenAI 的专用超级计算机(专为当时大规模 AI 训练而建)报告称拥有 285,000 个 CPU 内核、10,000 个 GPU,以及每服务器超过 400 吉比特每秒的网络带宽(Langston 2020 中有所量化。降低这一开销需要协同优化硬件架构、并行策略和算法效率。

训练能源成本仅发生一次(每模型一次),但这一次性成本仍决定了设施规模、检查点存储和本次运行的碳核算。可持续性的主要挑战通常出现在部署阶段,此时推理工作负载持续为数百万或数十亿用户服务,当请求量足够大时,其能耗可能超过训练阶段的能耗。

推理能源成本

每当 AI 模型响应查询、对图像进行分类或进行预测时,推理工作负载就会执行。与训练不同,推理会在搜索引擎、推荐系统和生成式 AI 模型等应用中动态且持续地扩展。尽管单个推理请求所消耗的能源远低于训练,但高规模部署服务的累计能源使用量可能比甚至超过与训练相关的消耗(Wu et al. 2022)。

例如,由 AI 驱动的搜索引擎每日处理数十亿次查询,推荐系统持续提供个性化内容,而诸如 ChatGPT 或 DALL-E 等生成式 AI 服务则具有相当高的每查询计算成本。基于 Transformer 的模型由于其高内存和计算带宽需求,推理能源足迹较高。

早期市场预测就已预见到这一转变:2017 年麦肯锡的预测(图 15.17)认为数据中心推理市场将从 45-50 亿美元增长至 2025 年的 90-100 亿美元,而边缘推理市场将从近零增长至 40-45 亿美元,两者均增长速度快于当时较慢增长的训练市场。更有力的证据来自物理测量而非经济数据。Meta 在图 15.14 中的生命周期测量显示,大规模推理服务在部署的推荐模型上的排放可与训练相抗衡甚至超过它;而本章的自身核算表明,一旦请求量足够大,持续服务的能耗将超过一次性训练运行的能耗。

图 15.17:AI 硬件市场增长:麦肯锡分析,将 2017 年的市场估计与当时预测的 2025 年数据中心和边缘市场进行比较。推理工作负载主导了预测增长,其中边缘推理被视为一个重要的新兴细分市场,而训练市场在预测中则增长较为缓慢。

与具有固定能源足迹的传统软件应用不同,推理工作负载会随着用户需求动态扩展。像 Alexa、Siri 和 Google Assistant 这样的 AI 服务依赖于持续的云端推理,每分钟处理数百万语音查询,因此需要不间断运行能源密集型的数据中心基础设施。

解码阶段的能源低效性

第 10 章引入了 prefill 和 decode 作为延迟阶段;可持续性分析复用了同样的划分作为能源模型。prefill 倾向于饱和计算资源,而 decode 则在每生成一个 token 时反复通过内存流式传输模型和 KV-cache 状态。服务足迹的增长是因为 decode 浪费能源的方式与 prefill 不同,且两个推理阶段之间的能源差距显著(图 15.18)。

图 15.18:prefill vs. decode 能源强度:两个并排面板,比较 prefill 和 decode。左侧面板显示了两个阶段的 GPU 利用率条形图 — — prefill 期间(计算饱和)利用率高,decode 期间(受内存带宽限制)利用率低。右侧面板将每个 token 的能源分解为计算和内存组成部分。由于计算单元在等待内存时处于空闲状态但仍消耗静态功率,decode 每次操作的能源效率比 prefill 低 10×–50×。

prefill/decode 的区别,如表 10.20 所总结,不仅限于延迟,还延伸到了能源效率。最近的分析(Ma and Patterson 2026)表明,自回归生成相比批处理本质上是浪费能源的,因为这两个阶段对硬件限制施加了不同的压力。在 prefill 阶段,高算术强度使 GPU 能够从内存读取每个字节时执行数千次操作,在每浮点运算每焦耳(pJ/FLOP)上达到接近峰值的能源效率。而在 decode 阶段,模型必须从 HBM 读取完整的权重集来生成一个单独的 token;此时算术强度较低,导致计算单元在大部分周期内处于空闲状态。

结果是静态功率浪费:GPU 在等待内存传输时会消耗大量的漏电功率和时钟功率。因此,通过 1,000 个顺序解码步骤生成 1,000 个 token,其能耗可能比在单次预填充批次中处理相同的 1,000 个 token 要高出 10–50 倍。这种低效率推动了对专用、内存优化型 NPU 和 TPU 的需求,详见第 2 章,它们优先考虑每瓦特带宽而非原始 TFLOP/s。

边缘 AI 影响

第 11 章中的边缘智能架构实现了超越中心化数据中心的推理。这种分布式方法通过降低数据传输能耗成本和减少对高功耗云基础设施的依赖,提供了独特的可持续性优势。无需将每个 AI 请求都路由到中心化云服务器,模型可以直接部署在用户设备或边缘计算节点上。

然而,在边缘运行推理并不能消除能源担忧,特别是在大规模部署 AI 时。例如,自动驾驶汽车需要毫秒级延迟的 AI 推理,这意味着云处理不切实际。相反,车辆使用车载 AI 加速器,其功能相当于“轮子上的数据中心”(Sudhakar 等人, 2023)。这些嵌入式计算系统处理相当于小型数据中心的实时传感器数据,即使不依赖云推理也会消耗大量功率。

同样,智能手机、可穿戴设备和物联网传感器等消费设备单台仅消耗毫瓦到瓦级功率,但由于数量庞大,总体却给全球能源使用增加了太瓦时级的负荷。因此,边缘计算的效率优势必须与设备大规模部署的现实相权衡。

如果设计得当,边缘部署比云部署更具可持续性。消除数据传输、本地处理效率和占空比操作的结合,与始终连接的云推理相比,可将总系统能耗降低数个数量级。

边缘和移动功率预算

基于 ARM 的边缘设备面临的功率约束与数据中心加速器截然不同。工程选择在于将每个推理工作负载匹配到既能满足延迟和精度要求,又功耗最小的功率层级。

功率预算反映了电池容量、散热能力和部署环境的物理约束。表 15.8 对边缘 AI 功率预算类别进行了分组,并展示了这些约束如何传播:由纽扣电池或能量收集供电的 TinyML 设备平均功耗不能超过毫瓦级,移动设备必须在用户体验与电池寿命之间取得平衡,而汽车系统尽管可使用车载电源,却面临封闭车厢内的散热约束。

| 平台类别 | 空闲功率 | 有源功率 | 峰值功率 | 示例设备 |

| --- | --- | --- | --- | --- |

| TinyML (MCU) | 1–100 µW | 1–50 mW | 100 mW | Arduino Nano 33, STM32H7, Nordic nRF5340 |

| 移动 NPU | 10-100 mW | 0.5–5 W | 10 W | Pixel Tensor, Apple Neural Engine, Snapdragon NPU |

| 边缘 GPU/TPU | 1-5 W | 5–30 W | 75 W | NVIDIA Jetson Orin NX (10–25 W) 和 AGX Orin (15–60 W), Google Edge TPU, RPi AI Kit |

| 自动驾驶汽车 | 10–50 W | 50–200 W | 500 W | Tesla FSD Computer, Mobileye EyeQ, NVIDIA Drive |

表 15.8:边缘 AI 功率预算类别:边缘平台的功耗跨越五个数量级,从亚毫瓦级 TinyML 系统到接近数据中心功耗水平的汽车计算平台。可持续部署要求将工作负载需求与合适的功率层级相匹配。

TinyML 功率状态动态

虽然第 11 章从系统架构角度探讨了 TinyML,但设备端推理的能效同样是一个可持续性考量:数十亿次边缘推理调用在舰队规模下聚合成可测量的碳足迹。TinyML 效率在很大程度上依赖于占空比操作,即设备在深度睡眠和有源推理之间交替。公式 15.14 将平均功率表示为有源功率和睡眠功率的加权和:

P_{\text{average}} = P_{\text{active}} \times \frac{t_{\text{inference}}}{T_{\text{period}}} + P_{\text{sleep}} \times \frac{T_{\text{period}} - t_{\text{inference}}}{T_{\text{period}}} \qquad(15.14)

对于运行在 Cortex-M4 微控制器(原型 C (联邦 MobileNet) 模式,1.6.1 节)上的关键词识别模型:

  • 有源推理功率:每个检测周期 15 mW,持续 20 ms

  • 深度睡眠功率:3.3V 下 10 微安(33 微瓦)

  • 检测周期:1 秒(持续监听)

P_{\text{average}} = 15 \text{ mW} \times \frac{20 \text{ ms}}{1000 \text{ ms}} + 0.033 \text{ mW} \times \frac{980 \text{ ms}}{1000 \text{ ms}}

P[平均] = 0.30 mW + 0.032 mW = 0.33 mW

在此平均功率下,一节 250 mAh 纽扣电池(3.0V 标称)可提供约 2,270 小时的运行时间,近 95 天的持续常开 AI 推理。该计算展示了 TinyML 如何实现高功耗平台无法达到的可持续 AI 部署场景。这些功耗感知设计原则直接延伸至实际工业部署场景。

考虑在工厂传感器节点上部署异常检测模型:

系统参数

  • 模型:用于振动异常检测的自编码器

  • MCU:ARM Cortex-M4,80 MHz

  • 推理延迟:每样本 5 ms

  • 采样率:10 Hz(100 ms 周期)

  • 有源功率:推理期间 12 mW

  • 睡眠功率:3.3V 下 5 微安(16.5 微瓦)

  • 电池:两节 AA 电池(3.0V 下 3000 mAh)

步骤 1:计算占空比和平均功率。

\delta_{\text{duty}} = \frac{5 \text{ ms}}{100 \text{ ms}} = 0.05 \text{ (5% 占空比)}

P[平均] = 12 mW × 0.05 + 0.0165 mW × 0.95 = 0.60 + 0.016 = 0.616 mW

步骤 2:计算电池寿命。 E[电池] = 3000 mAh × 3.0 V = 9000 mWh

t_{\text{寿命}} = \frac{9000 \text{ mWh}}{0.616 \text{ mW}} = 14,610 \text{ 小时} \approx 1.7 \text{ 年}

系统洞察:该部署在标准电池上实现了近两年的持续 AI 供电监控,展示了基于功耗感知原则设计的 TinyML 系统的可持续性潜力。

设备端学习与电池墙

虽然 TinyML 设备上的推理效率极高,但设备端学习带来了陡峭得多的能源挑战。为适应用户的特定声音或步态而个性化模型需要反向传播,其所需的计算和内存是前向推理的 2–3 倍。

移动处理器的热设计功耗 (TDP) 造成了硬性约束,塑造了设备端学习策略的各个方面。现代智能手机通常将 ML 工作负载的持续处理功耗维持在 2–3 W 以防止发热不适,但可在热节流发生前短暂爆发至 5–10 W。这一热设计功耗决定了自适应算法的整个可行空间。

问题:考虑在用户的智能手机上隔夜微调一个小型语言模型(10 亿参数)。这是否可在 5% 电量预算内完成?

计算

  1. 手机电池:典型容量约 15 Wh,即约 54000 J。

  2. 预算:54000 J 的 5% = 2700 J。

  3. 训练成本

    • 前向传播:≈ 2 nJ/参数。

    • 反向传播:≈ 4 nJ/参数。

    • 每 Token 总计:6 nJ/参数 ×10⁹ 参数 = 6 J/Token。

  4. 容量:2700 J / 6 J/Token = 450 Token。

系统洞察

在合理的日常电量预算内,全量微调是不可能的。可持续的设备端学习需要参数高效微调(PEFT)或稀疏更新,以将每个 Token 的能量成本降低 100 倍或更多。

能量消耗的基本物理原理揭示了为什么本地处理对于设备端学习几乎总是优于云端卸载,前提是模型足够紧凑。

能量阶梯显示无线传输每比特约 250,000 pJ,远超 4 pJ FP32 乘法和 0.1 pJ INT32 加法;无线电与乘法的范围单独标注。

无线电传输在能量上远超本地算术运算。

权衡

在本地处理数据还是将其发送到云端之间的架构选择,取决于能量预算。能量消耗的物理原理根据能量通信比提供了明确的答案。

每次操作的能量成本(近似值)

  • 32 位整数加法:0.1 pJ

  • 32 位浮点乘法:4 pJ

  • 无线传输(1 比特):100,000–500,000 pJ(蓝牙/Wi-Fi)

系统洞察

在这些操作成本假设下,传输单个比特的数据所需的能量,大致相当于执行 25,000 到 125,000 次 FP32 乘法,或 100 万到 500 万次 32 位整数加法。当使用少于约每比特 100,000 次浮点运算即可从数据中提取洞察时,本地处理通常比云端卸载更节能。这一比率驱动了联邦学习的架构设计:计算很廉价;无线电传输很昂贵

用于自主边缘 AI 的能量收集

经过充分优化后,TinyML 实现了能量自主运行,设备从环境中收集能量,而不依赖电池:

请参考表 15.9 中的能量收集功率预算:一个优化至 0.5 mW 平均功耗的关键词检测模型,仅在接近所列范围顶端的明亮室内条件下,利用约 5 cm² 的室内光伏收集即可无限期运行。典型的室内部署需要额外的面积、储能、占空比循环,或更低平均功耗的模型,以留出余量应对转换损耗和昏暗光照。这种永久运行模式代表了终极的可持续边缘 AI 部署,其运行能量完全来自环境来源。

| 收集源 | 典型功率 | 可行的 TinyML 应用 |

| --- | --- | --- |

| 室内光伏 (1 cm²) | 10-100 微瓦 | 周期性传感器分类 |

| 室外光伏 (1 cm²) | 1-10 毫瓦 | 持续关键词检测 |

| 热电 (体热) | 10-100 微瓦 | 可穿戴手势识别 |

| 射频收集 (Wi-Fi) | 1-10 微瓦 | 超低占空比传感器节点 |

| 振动压电 | 100 微瓦-1 mW | 工业监测 |

表 15.9:能量收集功率预算:当平均功耗保持在收集能力范围内时,环境能量收集可实现无电池 TinyML 部署。光伏收集为大多数部署提供了最高的功率密度。

级联推理架构

除了单个设备的效率外,架构模式还决定了边缘-云边界间的总系统能耗。级联架构部署一个小型边缘模型(100 KB 以下)在云端推理前过滤输入。公式 15.15 将总能量表示为本地处理加上概率触发的云端成本之和:

E[级联] = E[边缘] + p[升级] × (E[传输] + E[云端])

其中 p[升级] 是需要云端推理的概率(对于设计良好的级联系统,通常为 5-20%)。

以视觉检测系统为例:

  • 边缘模型 (MobileNet-v3 tiny):每张图像分类 0.5 mJ

  • 云端模型 (ResNet-152):每次分类 50 mJ

  • 传输能量:每张图像 10 mJ(蜂窝网络)

  • 升级率:10%(仅发送模糊案例到云端)

E[级联] = 0.5 + 0.10 × (10 + 50) = 0.5 + 6.0 = 6.5 mJ/图像

与始终进行云端推理的每张图像 60 mJ 相比,级联架构在通过选择性云端升级保持准确性的同时,实现了 89% 的能量减少。

唤醒词触发系统

始终开启的系统使用分层唤醒检测来最小化平均功耗:

  1. 超低功耗模拟前端:10 微瓦持续语音活动检测

  2. 微型神经网络唤醒检测器:检测到语音时 100 微瓦

  3. 完整模型推理:确认唤醒词时 10 mW 持续 50 ms

典型语音活动率为 5%,唤醒词出现率为 0.1% 时:

P[平均] = 0.01 + 0.05 × 0.1 + 0.001 × 10 × 0.05 = 0.0155 mW

与始终激活的完整推理 10 mW 相比,分层方法实现了 15.5 µW 的平均功耗,降低了 645.2 倍,使电池供电的语音助手能够实现多年运行。

联邦学习能量分析

边缘端训练消除了数据传输,但增加了本地计算。公式 15.16 对比了联邦学习与中心化方法之间的能量权衡:

E[联邦] = N[客户端] × E[本地训练] + E[聚合]
E[中心化] = N[客户端] × E[传输] + E[云端训练]

当数据大小超过模型更新大小时,联邦学习变得更节能。对于具有丰富传感器数据的隐私敏感应用,联邦方法通常同时实现隐私能量收益,因为传输模型权重更新(兆字节)所需的能量少于传输原始数据(千兆字节),适用于设备端个性化等应用。边缘分析还剩下一个生命周期项:生产设备和加速器的物理供应链。

水、化学品和关键材料

AI 的环境足迹不仅限于电力消耗,还包括物理资源——水、有害化学品和关键材料——这些需要不同的评估方法。全面评估需要衡量额外的生态影响,包括水消耗、有害化学品使用、稀有材料开采和生物多样性破坏,尽管这些具有生态重要性,但往往较少受到关注。生产 AI 芯片的现代半导体晶圆厂每天需要数百万升水,并在工艺中使用超过 250 种有害物质。在已经面临水资源紧张的地区,如台湾、亚利桑那州和新加坡,这种密集用水威胁着当地生态系统和社区。AI 硬件还严重依赖镓、铟、砷和氦等稀缺材料,这些材料既面临地缘政治供应风险,也面临枯竭担忧 (Jha 2014; Chen 2006)。

半导体制造是一个极其耗水的过程 (Cooper et al. 2011)。台积电在亚利桑那州的晶圆厂预计每天消耗 3400 万升水[³⁷¹] (Reuters 2024),占该市总产水量的近 3%。单片 300mm 硅晶圆在整个制造过程中需要超过 8300 升水。图 15.19 说明了典型的晶圆厂水循环,先进回收可回收 60-80% 的水,但仍留下巨大的消耗足迹。

图 15.19:半导体水循环:现代晶圆厂每天消耗数百万升水。为缓解此问题,先进设施实施闭环回收。原水被净化为超纯水 (UPW) 用于工艺制程。废水经处理后回流至 UPW 系统,将净消耗量降低 60%–80%。

图 15.19 的关键启示在于:即使达到 60%–80% 的回收率,先进制程晶圆厂消耗的超纯水绝对体量依然巨大,这给 AI 芯片制造的可持续选址设下了硬性的物理约束。

晶圆制造还严重依赖用于刻蚀、掺杂和清洗的危险化学品。强酸(氢氟酸、硫酸)、二甲苯等挥发性有机化合物,以及砷化氢、磷化氢等剧毒气体被大量使用——一座大型晶圆厂每年可能消耗超过 2,000 公吨酸类物质(S. Kim 等人,2018)。这些物质产生的危险废物流需要经过广泛处理以防止生态危害。

AI 硬件依赖一套稀缺且地缘政治敏感的关键材料。虽然硅很丰富,但高性能芯片需要镓、铟、钽和氦等稀有元素。铟等材料出现在关键材料和濒危元素分析中,因为其供应可能依赖副产品提取、替代方案和回收限制(Rhodes,2019)。稀土提炼的地理集中造成了显著的供应链脆弱性。表 15.10 量化了这种材料依赖挑战的范围。

| 材料 | 在 AI 半导体制造中的应用 | 供应担忧 |

| --- | --- | --- |

| 硅 (Si) | 芯片、晶圆、晶体管的主要衬底 | • 加工制约 • 地缘政治风险 |

| 镓 (Ga) | 基于 GaN 的功率放大器、高频元件 | • 供应有限 • 铝和锌生产的副产品 |

| 锗 (Ge) | 高速晶体管、光电探测器、光互连 | • 稀缺 • 产地高度集中 |

| 铟 (In) | 氧化铟锡 (ITO)、光电子学 | • 储量有限 • 依赖回收 |

| 钽 (Ta) | 电容器、稳定的集成元件 | • 冲突矿产 • 供应链脆弱 |

| 稀土元素 (REEs) | 磁铁、传感器、高性能电子产品 | • 高地缘政治风险 • 开采环境担忧 |

| 钴 (Co) | 边缘计算设备用电池 | • 人权问题 • 地理集中 (刚果) |

| 钨 (W) | 互连、阻挡层、散热器 | • 生产基地有限 • 地缘政治担忧 |

| 铜 (Cu) | 互连、阻挡层、散热器 | • 高纯度来源有限 • 地缘政治担忧 |

| 氦 (He) | 半导体冷却、等离子刻蚀、EUV 光刻 | • 不可再生 • 大气逸散不可回收 • 开采能力有限 |

表 15.10:AI 硬件的关键材料:半导体制造依赖包括硅、镓、锗、铟、钽、钴、钨、铜、氦和稀土元素在内的特定材料,这些材料面临日益加剧的供应限制和地缘政治风险,可能影响 AI 硬件的生产和创新。该表详细列出了这些材料、它们在 AI 系统中的应用以及相关的供应脆弱性,需要采取主动缓解策略。

晶圆厂和数据中心的建设与运营也通过栖息地破坏、水资源紧张和化学排放污染直接影响自然生态系统。半导体行业的废水可用重金属和痕量元素污染附近的河流沉积物(Hsu 等人,2016)。制造产生的废物——包括气体排放、含 VOC 废气和重金属污染废水——需要先进的处理系统,而 AI 硬件的报废处置加剧了日益严重的电子垃圾危机,全球仅有 17.4% 的电子垃圾得到妥善回收(Singh 和 Ogunseitan,2022)。

计算需求的环境代价远不止大气碳排放,还表现为制造中心周围严重的水资源压力和生态破坏。这些供应链成本汇聚到下一个设计杠杆上:庞大且资源密集型的硬件集群在沦为废弃物之前,能保持多长时间的使用价值。

硬件生命周期与电子垃圾

AI 加速器的环境成本在其进行第一次 FLOP 运算之前很久就已开始(Gupta 等人,2022;Luccioni 等人,2023;NVIDIA Corporation,2025)。第 15.3.1.1 节中量化的单颗 H100 制造足迹完全发生在制造阶段。³⁷² 训练我们的 1750 亿参数模型所需的数千颗此类处理器集群——消耗 1,287 MWh 电力——代表了在任何计算发生之前的一笔巨大的前期碳投资。全面的生命周期评估 (LCA) 量化了设计、制造、使用和报废四个关键阶段的累积环境影响。LCA 可揭示制造阶段占据生命周期影响的主要份额,使其成为仅靠运营效率改进无法解决的关键可持续性杠杆。

设想一个视觉模型,其训练需要 2,000 GPU 小时,平均功耗 300 W。部署后,该模型每天服务 100 万次请求,每次请求耗时 50 ms,平均功耗 100 W。

生命周期评估可能表明,仅为微小的效率增益而丢弃功能正常的硬件,其通过本体碳排放造成的环境危害大于节省的运营能耗。要评估新硬件在环境上合理化的临界点,我们必须估算训练成本、推理规模和硬件寿命的交汇点。

四个主要生命周期阶段每一个都对 AI 系统的总环境足迹有所贡献。图 15.20 直观展示了从设计到报废的这一过程,突显了各阶段间的相互依赖性及每个阶段相关的环境影响类别。

图 15.20:AI 系统生命周期:跨设计、制造、使用和报废阶段分析 AI 系统,揭示了超出运营能耗的完整环境影响,涵盖资源枯竭和电子废物。这种生命周期评估允许有针对性地干预,以提升 AI 系统整个生命周期的可持续性。

生命周期序列并非静态分类。随着系统成熟,约束性的可持续性问题会发生转移:设计产生实验性废物,制造锁定本体碳,使用将负载耦合至电网和冷却约束,报废外部化电子废物,而寿命延长则成为将所有早期排放分摊到更多有效工作上的杠杆。

设计与实验阶段

设计阶段

设计阶段涵盖了 ML 模型在部署前的研究、开发和优化——即对架构进行迭代、调整超参数并运行训练实验。该阶段的环境成本往往被低估,因为报告的训练能耗(如 GPT-3 的 1,287 MWh)仅反映了最终的运行,而非先前大量的试错过程。自动化架构搜索技术会评估数百或数千种配置,但其碳足迹取决于计入的内容:代理搜索、完整训练运行、数据中心效率、电网能源结构以及跨下游模型的复用情况 (Strubell et al. 2019; Patterson et al. 2021)。后期高效的 NAS 方法利用权重共享、连续松弛和硬件感知搜索来减少搜索预算 (Elsken et al. 2019)。

表 15.11 揭示了不同模型规模在碳足迹上的巨大差异。

| AI 模型 | 训练 FLOPs | 估算 CO₂ 排放量 (kg) | 等效汽车行驶距离 |

| :--- | :--- | :--- | :--- |

| GPT-3 | 3.1 × 10²³ | 502,000 kg | 190 万 km |

| T5-11B | 2.3 × 10²² | 85,000 kg | 338,000 km |

| BERT (Base) | 3.3 × 10¹⁸ | 650 kg | 2,400 km |

| ResNet-50 | 2.0 × 10¹⁷ | 35 kg | 129 km |

表 15.11:模型碳足迹:训练大型 AI 模型会产生大量碳排放,但最终足迹取决于计算量、硬件效率、数据中心开销和电网碳强度。根据此处使用的核算假设,GPT-3 的训练排放量相当于驾驶 190 万公里。

应对设计阶段的可持续性挑战需要训练效率方面的创新:稀疏训练、低精度运算、权重共享和能量感知 NAS 方法。迁移学习和微调预训练模型复用预训练表征,避免了每个任务都必须从头开始训练 (Raffel et al. 2020)。

制造阶段

AI 硬件的制造极其消耗资源,在进行任何计算之前,其就已承载了第 15.3.1.1 节中确立的每颗 H100 的嵌入式碳排放。半导体制造通过 EUV 光刻等工艺要求极高的精度——每台设备消耗约 1 MW 的持续功率——以及化学气相沉积和离子注入。第 15.5.3 节详述的资源需求揭示了规模:台积电亚利桑那工厂每天消耗 3400 万升水,制造依赖 250 多种有害物质,且供应链依赖于地缘政治高度集中的关键材料。

AI 加速器的两个结构特性使其制造足迹相对于传统芯片被放大。首先,高性能 AI 芯片通常在光刻视场极限(单次光刻曝光可打印的最大晶粒面积)或其附近制造。更大的晶粒会减少每晶圆的良品率,且对随机缺陷极不成比例地敏感:一种可能导致 5% 小晶粒报废的缺陷密度,可能使 20% 甚至更多视场极限晶粒报废,从而有效地浪费了制造每个缺陷单元所消耗的水、化学品和 EUV 能量。其次,大规模推理和训练的内存带宽需求要求采用先进的 2.5D 和 3D 封装——如台积电的晶圆上晶粒上基板工艺,将高带宽内存堆栈直接与加速器晶粒键合。这种集成引入了常规单片 CPU 所不需要的额外制造阶段、化学清洗周期和精密烘烤步骤。结果是,每个可用的 AI 加速器所体现的水消耗、有害化学品使用和工艺能量,远超其晶圆面积本身所暗示的水平,这使得硬件寿命和高利用率成为首要的可持续性杠杆,而非次要考量。

制造 AI 硬件所需的能量巨大,在电网清洁的地区,制造过程的嵌入式影响可能在使用寿命内与运行影响相抗衡。关于环保电子产品的研究指出,低毒性材料、改进的回收利用以及更环保的器件和制造方法是电子生产的可持续性方向 (Cenci et al. 2021; Irimia-Vladu 2014)。

使用阶段

训练和推理期间消耗的运行能耦在第 15.5 节中详述。此处值得关注的是这种消耗的模式及其与电网基础设施的交互。训练我们的 175B 模型所需的 1,287 MWh 代表了高强度、持续的功率消耗——但这种消耗的特性在不同工作负载类型中并不一致,这种区别决定了何种调度干预是切实可行的。

大规模分布式训练运行在数千个加速器上消耗恒定、相关的电力,通常被描述为缺乏灵活性。这种表述低估了分布式训练为容错而内置的调度灵活性。因为千节点集群中的单个硬件故障就可能破坏一次运行,生产训练系统每隔几分钟到几小时就会将状态检查点保存到持久存储中。这种检查点基础设施正是实现碳感知调度的机制:训练作业可在午后电网高峰期(太阳能发电下降、化石能源峰值电厂上线时)暂停,集群状态保存至检查点,并在夜间风力发电提高可再生能源可用性时恢复。保护硬件故障的同一工程机制,因此同时也充当了电网脱碳的调度杠杆——这是一种容错与可持续性的耦合,在无法中途暂停的同步推理服务中没有对应物。

这种灵活性与训练集群持续运行时加剧的“鸭子曲线”问题形成对比。duck curve(鸭子曲线)描述了电网运营商在下午晚些时候太阳能发电下降时必须应对的陡峭爬坡:数据中心在过渡期持续抽取兆瓦级电力会加深该爬坡,并增加对化石燃料峰值电厂的依赖。冷却系统使问题复杂化,在计算功耗之上增加了第 15.4.6 节中量化的开销。利用检查点在高碳窗口期(通常为跨越太阳能-峰值电厂过渡的两到四小时)暂停训练的碳感知调度器,可以将有意义的训练能耗份额转移到边际电网碳强度较低的时段。正如第 15.3 节所述,地理优化解决的是基线问题,但时间调度解决的是给定电网区域内的变化问题。

处置、电子废弃物与嵌入式 AI

AI 硬件创新的快速步伐导致了持续的升级周期(Slade 2007),从而导致全球电子废弃物(e-waste)危机日益严重。全球人类每年产生超过 5000 万吨电子废弃物,其中只有 17.4% 被正式记录为已收集并妥善回收(Singh and Ogunseitan 2022)。用于训练大型模型的高性能服务器通常在三到五年后就会被视为过时。被丢弃的 AI 硬件含有有毒物质——铅、汞、镉和铍——当这些硬件被填埋或送往非正式回收设施处理时,这些物质可能会渗入土壤和地下水(Grossman 2007)。

ML 基础设施中有两种特定机制使得这种过时比传统服务器环境更快、更浪费。AI 加速器很少达到其物理硅的寿命终点;相反,它们因新模型架构暴露出的内存带宽和互连瓶颈而过时。例如,由 PCIe Gen 4 连接的一组 GPU 可能拥有完全正常工作的计算硅,但其互连带宽可能低于维持新型、更大模型的集体通信模式所需的最低带宽。由于互连嵌入在底板而非芯片上,因此整个节点——而不仅仅是加速器——必须被更换。与标准化的 ATX 或 OCP 主板插槽式 CPU 不同,现代 AI 节点将加速器安装在专用底板上,这些底板是围绕特定一代的 NVLinkNVSwitchHBM 设计的。当机队升级以适配新的模型架构时,底板、网络主机通道适配器,以及通常的主机服务器会一起被更换,而不仅仅是简单地更换一张 PCIe 卡。这种架构上的紧耦合会使每次升级周期产生的电子废弃物质量远超单个芯片硅所暗示的水平。

问题因 嵌入式 AI 的兴起而进一步加剧,机器学习功能被整合到数十亿消费设备中。图 15.21 追踪了从 2019 年的 86 亿台联网设备到 2030 年预计的 294.2 亿台的增长,这一十年内增长了超过三倍,历史与预测的分界点大约在 2024 年(Statista 2022)。这一趋势导致了一种分散的、低价值且极难回收的电子废弃物形式。许多 AI 驱动的物联网传感器、可穿戴设备和智能家电被设计为寿命短且升级性有限,使其难以修复或回收(Baldé et al. 2017)。不可更换的锂离子电池、密封外壳和专有部件确保即使是微小的故障也会导致整个设备被替换。

图 15.21:物联网设备增长:联网设备数量的快速增长放大了嵌入式 AI 系统的环境影响,因为短设备生命周期导致电子废弃物 escalate。预计到 2030 年将达到近 300 亿台设备,这需要可持续设计和改进的回收基础设施来缓解日益严重的电子废弃物危机。

短产品生命周期加速了这一循环:有限的软件支持窗口、阻止维修的专有部件以及使拆卸困难的封闭式设计,都在推动设备走向替换而非重复使用。这一电子废弃物负担的不成比例份额落在发展中国家,这些国家常常接收来自富裕国家的废弃电子产品,给那些最缺乏应对能力的人群带来重大的环境和社会成本。

延长硬件寿命

要抵御线性的“获取-制造-丢弃”模式,需要转向 循环经济(Stahel 2016),优先考虑再利用、翻新和回收。当体碳主导生命周期核算时,延长 AI 硬件的功能寿命是减排的最大杠杆之一,因为它能够在更长的时间内摊销高制造排放。将服务器寿命从三年延长至五年,可使每年服务的体碳降低 40%,这一收益甚至可以超过许多本地软件优化。

以下四种生命周期干预措施通过使系统可修复、可升级、可支持和可重复使用来延长硬件服务寿命:

  • 维修权:立法和监管运动通过强调对零件、工具、诊断和维修信息的访问来推回维修限制(Federal Trade Commission 2021)。

  • 模块化设计:允许独立升级加速器、内存或网络接口的 AI 硬件设计,可防止在仅有一个组件过时时丢弃整个系统,这遵循了 Framework 在消费者笔记本电脑中所展示的原则(Incorporated 2022)。

  • 延长支持周期:更长的软件和固件支持可使可用硬件保持安全和运行更长时间,从而推迟其进入电子废弃物流的时间(Forti et al. 2020)。

  • 二次使用计划:将较旧的加速器转移到研究、批处理或低优先级工作负载中,可进一步摊销体碳,而不是直接将硬件送往处理。

这些干预措施将可持续性从废弃物管理提升到生命周期工程。一旦量化了 AI 系统产生的硬件、能源和碳足迹的规模,问题就变成了:哪些具体的工程技术可以减少这种影响?

缓解策略

当数据中心达到其绝对功率上限时,运营商不能仅仅购买更多 GPU。唯一的前进路径是通过算法干预从每瓦中提取更多智能:将 FP32 权重量化为 INT4,修剪不活跃的神经通路,并将训练运行调度在当地电力网络充满多余太阳能时精确执行。缓解是将能源效率视为核心算法约束的过程。

前几节中开发的测量框架揭示了环境成本集中的位置:训练主导研究工作负载,推理主导已部署服务,而制造则贡献了运营效率无法消除的基线。这些发现指导了实施策略,沿着三个轴线发展:算法优化降低每次操作成本,基础设施选择决定这些节约是否能转化为实际的排放减少,以及政策框架确保行业范围内的采用。

实施必须考虑 Jevons 悖论³⁷³(原则):使模型效率提高 10× 可能会增加总使用量,以至于抵消甚至超过预期的节能效果,因为更便宜的计算使以前在经济上不可行的全新应用成为可能。这种反弹效应正是为什么可持续性策略必须关注绝对限制(碳预算、可再生能源采购),而不仅仅是效率速率(每瓦 FLOP/s),需要将技术优化与使用治理相结合,以防止效率提升被部署规模的指数增长所抵消。

多层缓解策略框架

最反直觉的可持续 AI 障碍不是低效,而是成功,这也是为什么缓解措施必须同时确定:由哪一层负责每一项减排,以及由哪个绝对预算来防止反弹效应。节能模型设计、优化硬件部署、可持续基础设施运营和碳感知调度,各自针对生命周期足迹中的不同项。框架选择仅在其改变计算、内存移动、利用率或报告时才具有意义。生命周期感知设计通过检查节省是否经得起训练、推理、制造和使用的考验,防止优化止步于部署阶段。

图 15.22 捕捉了这一效应:随着单位计算成本下降,使用量的增长速度快于效率带来的单位成本下降速度,因此总消耗和环境影响上升而非下降。

图 15.22:杰文斯悖论:计算成本下降推动 AI 使用量增加,可能抵消效率增益并导致总体资源消耗上升;该图描绘了这一效应,展示了成本降低(A 到 B)如何助长需求增长(C 到 D)。这种反直觉的关系凸显了在评估 AI 进步的环境影响时考虑系统性效应的重要性。

该悖论对可持续 AI 战略有深远影响,因为总能耗取决于单次查询成本和需求弹性两者。

你的团队优化了一项翻译服务,将每次查询的计算成本降低了 50%(效率提升 2 倍)。

杰文斯悖论并不否定效率作为一种战略的有效性;它仅意味着效率必须与治理和产能规划相结合。在单个系统层面,效率仍是一个核心杠杆,因为它直接降低了每次有用操作的成本、延迟和能耗。

每一种模型优化技术同时也是一种可持续性工具。剪枝通过消除不必要的参数来降低计算复杂度和能耗。量化在降低内存需求和加速推理的同时削减了功耗。知识蒸馏使更小的模型能以更低的资源需求达到有竞争力的性能。

性能工程与环境责任汇聚于同一目标。优化模型以运行得更快或使用更少内存,同时也能减少其碳足迹。设计高效架构或实施软硬件协同设计,能产出既高性能又环境可持续的系统。

根本洞见在于:可持续 AI 工程与高效 AI 工程高度重叠,但超越了后者。那些使系统能够扩展、性能更好、运营成本更低的工程原则,也使它们更加环保;但可持续性增加了生命周期核算、碳感知部署、绝对资源预算、水和材料约束,以及防范反弹效应的治理。可持续性是良好系统工程的组成部分,而非仅仅是效率的同义词。

生命周期感知开发方法论

生命周期感知开发从工作负载中最大的环境影响项入手,然后选择能改变该项的干预措施。算法设计、基础设施优化、运营实践和治理,只有在围绕测量出的瓶颈排序时,才能减少影响,而非作为通用清单应用(Uddin and Rahman 2012)。

节能算法设计

许多深度学习模型依赖数十亿参数,训练和推理过程中需要数万亿次浮点运算。³⁷⁴ 虽然这些大模型在基准测试中取得最高分,但研究表明其大部分计算复杂度是不必要的。许多参数对最终预测贡献甚微,导致资源浪费。可持续 AI 开发将能效视为设计约束而非事后优化,要求采用软硬件协同设计方法,同时优化算法选择及其硬件实现,以实现单位计算能力的最大效率。

当测量出的瓶颈是未使用的结构、位宽或服务规模时,可持续设计杠杆也随之改变。表 15.12 将瓶颈映射到改变能耗项的干预措施。

| 技术 | 测量瓶颈 | 能量机制 | 代表性证据 |

| --- | --- | --- | --- |

| 剪枝 | 未使用的模型结构 | 移除冗余权重,减小模型体积、计算量和推理时的内存移动 | 结构化剪枝可移除 ResNet-50 等模型高达 90% 的权重,同时保持相当的准确率 |

| 量化 | 位宽 | 降低数值精度,使算术单元和内存传输移动更少的比特 | INT8 运算比 FP32 约节省 16 倍能耗,4-bit 运算可达 64 倍减少,Q8BERT 在极小精度损失下将 BERT 体积缩减 4 倍(Zafrir et al. 2019) |

| 知识蒸馏 (Hinton et al. 2015) | 服务规模 | 将重复推理成本转移为一次性的师生训练过程 | DistilBERT 以 40% 更少的参数和 60% 更快的推理保留了 BERT 97% 的准确率(Sanh et al. 2019) |

表 15.12:按瓶颈划分的算法能耗杠杆:剪枝、量化和蒸馏通过不同机制降低能耗,因此正确选择取决于测量出的瓶颈,而非通用的压缩目标。

该表的三个杠杆有不同的部署注意事项:剪枝³⁷⁵ 取决于稀疏结构和硬件支持,量化³⁷⁶ 在算术和内存移动上复合节省,知识蒸馏³⁷⁷ 将其额外训练成本分摊到重复服务中。

剪枝、量化和蒸馏构成了可持续 AI 开发的核心工具包,但其可持续性价值取决于测量出的瓶颈。在本章中,设计问题不在于如何从第一性原理实现每种压缩方法;而在于如何根据内存移动、服务量、碳强度和生命周期成本对这些杠杆进行排序。

虽然模型压缩、高效架构和碳感知调度提供了效率的技术机制,但随意部署它们会产生边际效益递减。为了实现最大影响,工程团队必须将这些孤立技术综合成一个连贯、优先级明确的策略,优先攻克最大的排放源。

你正在为一个对延迟敏感的应用部署一个 70B LLM。

TinyML 优化栈

TinyML 与生命周期感知系统

TinyML 的具体约束

TinyML 使生命周期论证具体化,因为环境预算表现为硬性的物理包络,而非报告类别。微控制器部署必须将模型及其峰值激活放入 KB 级 SRAM,在传感器或面向用户的截止时间过期前完成推理,并保持在 mW 或 μW 功耗预算内。

标准 INT8 量化提供 4× 内存减少,且通常大幅降低能耗;当稀疏性映射到硬件可见的工作移除时,结构化剪枝可进一步节省。这些技术常能使模型进入合适范围,但能量收集设备需要更严格的序列:首先使内存计划可行,然后降低开关活动,最后寻找能很好利用 表 15.9 中收集能量预算的架构。表 15.13 总结了该序列末端的极端 TinyML 优化技术。

表 15.13:极端 TinyML 优化技术

| 技术 | 典型准确率影响 | 内存减少 | 能耗减少 |

| --- | --- | --- | --- |

| 二值神经网络 (BNNs) | 任务相关 | 高达 32× | 当位操作占主导时达数量级 |

| 面向 MCU 的神经架构搜索 | 不定 | 任务相关 | 相对于基线 2–5× |

:对于在 μW 预算下运行的能量收集设备,这些技术超越传统 INT8/剪枝方法,以模型质量、搜索成本和部署特异性为代价,换取真正自主运行所需的显著效率增益(Courbariaux et al. 2016;Lin et al. 2020;Prakash et al. 2023)。

该序列包含三遍:

  1. 内存适配:微控制器拥有 64 KB 至 2 MB SRAM,因此内存遍历从峰值激活分析开始,而非仅参数计数。若某中间张量超出张量竞技场,则参数量小的模型仍可能失败,故 TinyML 运行时依赖 in-place 操作、tensor-arena 规划和算子融合来复用缓冲区并避免碎片。

  2. 开关能耗:内存计划适配后,能耗遍历询问普通 INT8 运算对部署是否仍过昂贵。对于由太阳能、振动或 RF 收集供电的设备,二值神经网络 (BNNs) 可能是合理的,因为 XNOR 式操作用位操作替换了买加累加工作(Courbariaux et al. 2016)。此权衡非免费:准确率损失因任务而异,故 BNNs 适用于 表 15.9 中收集能量预算内的常开感知比全精度分类余量更重要的应用。

  3. 架构搜索:仅当 SRAM、延迟和收集能量约束显性化后,自动化设计才变得有用。MCUNet 联合搜索网络和推理调度以适配内存受限微控制器,在 256 KB SRAM 设备上展示了 ImageNet 级准确率(Lin et al. 2020);Once-for-All Networks 通过训练超网络摊销搜索,可提取设备专用子网络(Cai, Gan, Wang, et al. 2020);ProxylessNAS 直接针对硬件延迟和能耗优化(Cai et al. 2019)。

这些方法不应视为可持续技术菜单。它们是对特定失败的响应:手工设计模型无法同时满足 SRAM、延迟和收集能量约束。生命周期预算必须记录由此产生的权衡,因为准确率损失、额外搜索或蒸馏训练、以及反弹驱动的部署增长可能抹消名义上的单次推理节省。

生命周期感知系统

许多 AI 部署以短期心态运行:训练模型、部署、数月后替换,将废弃的训练运行或设备代视为昨日成本。生命周期感知系统将这种周转视为足迹的一部分。若模型将反复更新,首个可持续性问题在于下次更新是否需要完全重训。增量学习和迁移学习可减少此浪费,因为在新数据集上微调预训练模型,其计算成本可比从头训练降低数量级(Raffel et al. 2020)。

部署边界与训练边界同等重要。边缘部署可通过在使用点用专用低功耗硬件运行推理来降低通信能耗(Xu et al. 2020),但生命周期核算必须包含制造和替换这些设备的隐含碳。将 LCA 方法论嵌入 AI 工作流,使团队能尽早看到此权衡:云模型、边缘模型和混合级联可能因查询量、设备寿命、电网碳强度和重训频率不同而有不同赢家(International Organization for Standardization 2006a, 2006b)。Henderson et al. ( 2020 ) 主张系统性报告 ML 能耗和碳足迹,以便一致地进行这些比较。正如 Jevons 悖论所警示,核算还必须包含使用增长,因为优化某一阶段若因降低成本而实现更广泛部署,可能增加总影响。

基准测试与运行指标

基准测试在采购和设计时使效率可见时才重要。ML.ENERGY Leaderboard (ML.ENERGY Initiative et al. 2023) 按能效和碳足迹对模型排名,鼓励研究者在追求准确率的同时优化可持续性。MLCommons 将同一理念延伸至标准化度量:MLPerf 基准套件为数据中心和边缘部署定义功耗测量协议,使跨硬件、软件栈和工作负载类别的可持续性声明具备可比性。

正确的效率指标取决于服务模式。批量推理自然表达为 samples/joule,延迟敏感服务表达为 queries/joule,生成式工作负载表达为 joules/token,因为输出长度随请求变化。标准化不使某一平台普遍“绿色”;它使工作负载、测量窗口和能量分母可见,从而使采购和架构决策可用定量论证。

对于亚瓦特级 TinyML 部署,MLPerf Tiny 基准套件在微控制器规模提供同等规范。表 15.14 总结了基准任务及典型能耗需求,跨度从亚毫焦耳到多毫焦耳。测量方法要求外部功率监视器,如 INA219INA226Joulescope 级仪器,并规定预热期、测量窗口和统计报告要求,使微小效率声明可跨提交复现。

表 15.14:MLPerf Tiny 基准任务

| 基准 | 任务 | 参考模型 | 典型能耗 (mJ/推理) |

| --- | --- | --- | --- |

| Visual Wake Words | 图像分类(人员检测) | MobileNetV1 0.25 (250 KB) | 0.1-1.0 mJ |

| Keyword Spotting | 音频分类(12 关键词) | DS-CNN (19 KB) | 0.05-0.5 mJ |

| Anomaly Detection | 时间序列(机器健康) | Deep Autoencoder (5 KB) | 0.01-0.1 mJ |

MLPerf Tiny 基准测试套件

| 图像分类 | 视觉识别 (CIFAR-10) | ResNet-8 (70 KB) | 0.5-5.0 mJ |

|----------------------|-------------------------------|------------------|------------|

表 15.14: MLPerf Tiny 基准测试套件:用于 TinyML 系统的标准化基准测试,在微控制器级硬件上测量准确率、延迟和能耗。参考模型大小指示最小可行部署规模;优化实现通常能实现 2–10 倍更好的能效。

能耗和延迟仍需结合阅读。正如 公式 15.17 所示,能量延迟乘积 (EDP) 通过惩罚仅通过延长耗时来节省功耗的方案,在能耗与响应时间之间取得平衡:

EDP = E × T = P[average] × T² (15.17)

其中 E 是消耗的能量,T 是执行时间,P[average] 是平均功耗。二次延迟项惩罚通过过度延迟实现低能耗的方案。较低的 EDP 表示更高的效率,从而能够比较具有不同能耗-延迟权衡的系统。

对于 TinyML 部署,EDP 有助于识别最佳工作点。以降低时钟频率运行的微控制器消耗的功率较少,但完成推理所需时间更长。EDP 最小化的配置通常在适中的频率下运行,此时电压可以降低(利用 CMOS 功耗中的二次电压项),而不会带来过度的延迟惩罚。

可持续性指标通过创建同时考量能力和环境影响的评估框架,补充了传统性能基准。欧盟《人工智能法案》2024 年要求通用 AI 模型提供商记录已知或估算的模型能耗,这说明了这些指标如何从自愿报告实践转向合规要求。

基础设施优化

算法优化降低了单次操作的能耗,但运行环境决定了这些节省是否能转化为实际的减排。基础设施层面的创新针对计算效率增益得以实现的物理环境:可再生能源集成、碳感知工作负载调度和 AI 驱动的冷却优化,各自针对数据中心栈的不同层级。

绿色数据中心

单个超大规模数据中心的功耗可超过 100 MW,相当于一座小城市³⁷⁸。减少这一足迹需要三种互补策略:可再生能源集成、先进冷却和 AI 驱动优化。

主要云服务商已宣布可再生能源承诺,但间歇性仍是一大挑战。AI 基础设施必须融合储能解决方案和智能调度,将工作负载转移到可再生能源可用性最高的时段。Google 发布的 2030 年全天候无碳能源目标³⁷⁹ 体现了这一目标的更高阶版本:实时将每一单位消耗的电力与可再生能源发电相匹配,而非依赖年度碳抵消。

冷却占据了数据中心电力的很大份额(即 15.4.6 节 中 PUE 处理确立的冷却开销数字)³⁸⁰。液冷通过特制冷却剂直接从加速器转移热量,比传统风冷高效得多,并用于高密度 AI 集群。对该冷却系统的软件控制是另一杠杆:15.2.2.4 节 中的 DeepMind 优化在无需任何硬件变更的情况下,收回了相当大比例的冷却能耗,展示了 AI 改善自身基础设施可持续性的能力。

碳感知调度

电网碳强度随特定时刻可用电源组合的不同而大幅波动——从核能占比高的法国的 50 g CO₂/kWh 到依赖煤电的波兰的 820 g/kWh。碳感知调度 可将 AI 计算动态转移到低碳能源可用的时间和地点。对于具有时空灵活性且可容忍截止日期的工作负载,这可能是最高杠杆率的减排手段之一。

碳感知调度本质上是一个负载转移软件问题。调度器查询实时电网碳强度 API(例如 ElectricityMapWattTime),在碳密集时段(如晚间高峰)暂停非紧急训练作业,并将工作负载迁移到拥有过剩可再生能源的地理区域(如加利福尼亚的光伏高峰或爱荷华的风电高峰)。

Google 的碳智能计算平台³⁸¹ 在大规模上验证了这种方法,在其全球工作负载转移假设下实现了 40% 的碳足迹减少 (Radovanovic et al. 2021)。在 图 15.23 的更广泛能源差距级联中,碳感知调度是系统阶段的步骤之一,为混合生产车队贡献了保守的 1.3 倍平均减少,因为只有部分作业的截止日期足够宽松,可以跨时间或地理进行迁移。

图 15.23: 干预级联中的碳感知工作负载调度:来自 图 15.5 的六步干预级联,此处重述是因为碳感知调度是其系统阶段步骤之一,通过时域和地理转移,为混合车队贡献了保守的 1.3 倍减少。

碳感知调度的有效性取决于准确的实时电网排放数据。平均电网强度适用于事后报告,因为它估算已消耗能源相关的排放。边际排放更适用于调度,因为它估算当工作负载增加或移除需求时,哪台发电机会做出响应。Electricity Maps API 提供全球电网的实时 CO₂ 排放数据³⁸²,而 WattTime 提供边际排放数据,显示哪些电厂将下一个开启或关闭。图 15.24 展示了调度机会:将训练作业转移到低碳地区的低碳时段运行,在不改变任何一行模型代码的情况下,可减少高达 8 倍的排放。

图 15.24: 碳感知调度机会:电网碳强度随地区和一天中的时间而变化。在低碳地区(美国西部)的非高峰时段训练,产生的碳排放比煤电占比高地区(美国东部)的高峰时段少高达 8 倍。当工作负载可移动时,这种地理和时间灵活性给调度器提供了巨大的排放杠杆。

可再生能源的波动性给碳感知调度带来了关键挑战。图 15.25 捕捉了欧洲电网动态:太阳能在正午达到峰值,风能在早晚显示出明显的峰值,化石能源填补空白。这种时间模式决定了 AI 工作负载何时可以在清洁能源上运行。

图 15.25: 欧洲能源结构:可再生能源表现出显著的时间变化性,需要化石燃料补充以满足持续需求。理解这种波动对于有效地将 AI 工作负载调度到可再生能源高可用性时期非常重要。来源:Uenergy charts。

能量感知 AI 框架与冷却优化

能量感知 AI 框架

当能量感知 AI 框架优化工作负载本身而非仅仅转移其位置时,它们便能对调度起到补充作用。Zeus (You et al. 2023) 通过自动寻找最优的能量-性能权衡,在 BERT 训练上实现了 75% 的能量节省;而 Perseus (Chung et al. 2023) 通过缓解能量膨胀,将大模型训练能耗降低了多达 30%。这些工具连同用于排放追踪的 CodeCarbon (Schmidt et al. 2021),使得能量优化不再局限于超大规模公司。

AI 驱动的冷却优化

当数据中心具备足够的传感设备和可控冷却设备时,AI 驱动的冷却优化便成为一种可通过软件部署的杠杆,用于降低数据中心能耗。传统冷却系统依赖具有预设温度阈值的固定控制策略,往往消耗过多能量;一种能适应实时条件的学习型控制器能回收大部分浪费,正如 第 15.2.2.4 节 分析的 DeepMind 部署案例所示,且无需任何硬件变更。

液冷与浸没冷却

作为软件优化的补充,液冷和浸没冷却改变了密集加速器集群的热设计空间。液冷利用特制冷却剂直接从加速器芯片转移热量,其传热效率比风冷高 3,000 倍。浸没冷却将整个服务器机架浸没在非导电液体冷却剂中,彻底消除了传统风冷系统。这些方法在降低功耗的同时实现了更高的算力密度——这对热设计功耗达到每芯片数百瓦的加速器至关重要。

案例研究:Google 的框架

Google 案例研究的价值在于,它将缓解措施分解到了本章一直在追踪的同一层级:模型、机器、机制化和地图。表 15.15 总结了 Google 工程师为减少快速扩张的 AI 工作负载碳足迹而确定的“4 M”要素 (Patterson, Gonzalez, Holzle, et al. 2022)。

| 杠杆 | 干预措施 | 报告的效率效果 | 示例机制 |

| --- | --- | --- | --- |

| 模型 | 选择高效 AI 架构,如稀疏模型或神经架构搜索衍生设计 | 在不牺牲模型质量的前提下,计算需求降低 5–10 倍 | Evolved Transformer 和 Primer |

| 机器 | 使用 AI 专用硬件而非通用系统 | 性能功耗比提升 2–5 倍;TPU 相较于未优化 GPU,碳效率高 5–13 倍 | 张量处理单元 |

| 机制化 | 在高利用率下运行优化的云基础设施 | 相比传统自建数据中心,能耗降低 1.4–2 倍 | 设施 PUE 低于 2021 年研究使用的行业平均基线 |

| 地图 | 将数据中心部署在低碳电力供应区域 | 总排放量降低 5–10 倍 | 对基础设施全域可再生能源使用情况进行实时监控 |

表 15.15:Google 的 4 M 可持续性框架:该框架结合了模型架构、硬件专用化、基础设施效率和碳感知部署,使改进效果在 AI 技术栈各层叠加放大。

这些实践的组合效应产生了乘法级的效率增益。例如,在战略选址的数据中心中,于 TPU 上实施优化的 Transformer 模型,使能耗降低了 83 倍,二氧化碳排放降低了 747 倍。

在 Patterson, Gonzalez, Holzle 等人 (2022) 研究的期间内,系统性的效率改进抑制了能耗增长,即便 AI 部署已扩展至 Google 的整个产品生态系统。这一进展的重要指标在于:在报告期内,AI 工作负载占 Google 总能耗的比例始终维持在 15% 以下。随着 AI 功能在 Google 服务中的扩展,相应的计算周期增长被算法进步、专用硬件、基础设施设计和地理优化所抵消。

实证案例研究展示了可持续 AI 工程如何同时提升能力并降低环境影响。例如,Patterson, Gonzalez, Holzle 等人 (2022) 对比了 GPT-3 与 Google 的 GLaM,报告称在提升质量指标的同时,减少了训练计算量并使用了更低碳的能源;而 GLaM 模型论文则解释了支撑这种高效扩展的混合专家架构 (Du et al. 2022)。

案例研究中的策略——结合系统性度量、碳感知开发、报告透明化和可再生能源转型——可作为可持续 AI 扩展的框架。该分析还指出,早期的外推推断因未计入效率改进和工作负载测量边界,而大幅高估了 ML 能源需求,这凸显了实证测量相较于理论预测的重要性。

可持续 AI 开发工程指南

度量、优化和调度框架提供了分析基础,但落地实施需要确定优先级。以下清单应作为决策辅助阅读:首先生命周期主导项,再选择能改变它的杠杆。

  • 先测量CarbonTrackerCodeCarbon 等工具可追踪训练运行的排放量。团队无法改进未被测量的事物,建立基线指标对于验证优化成效至关重要 (Anthony et al. 2020; Schmidt et al. 2021)。

  • 选择区域:在由可再生能源供电的数据中心训练模型。正如 第 15.1.1 节 所述,代表性区域对的电网碳强度跨度达 8 到 40 倍;将工作负载调度至清洁能源最丰富之处,可立竿见影地降低排放。

  • 优化模型:避免默认训练最大规模模型。剪枝、量化和知识蒸馏能找到满足精度目标的最小模型。一个仅需 10% 资源即可达到 90% 精度的模型,往往比一个需要全量资源才能达到 95% 精度的模型提供更高的现实价值。

  • 避免从头重新训练:迁移学习和微调相比完全重训,能将计算需求降低数个数量级。

  • 选择高效硬件:节能加速器(如 TPU 或专用推理芯片)可降低部署成本。完整的硬件生命周期和面向工作负载的平台选择,与原始吞吐量同等重要。

  • 核算完整生命周期:延长硬件刷新周期和负责任的电子废弃物政策能降低总环境影响。制造阶段往往超过运行阶段能耗,使硬件寿命成为关键可持续性因素。

个体技术选择的累积影响取决于系统性的、全行业范围的采纳。缺乏外部压力时,市场力量会优先考虑速度和规模而非效率。政策和监管框架通过将可持续选择变为财务和法律必然,将工程可能性转化为全行业实践。

政策、法规与前进之路

如果一家公司能通过将其训练集群迁移至完全由廉价、高排放煤炭供电的地区来大幅削减云计算账单,市场机制本身将无法阻止其这样做。工程创新可以提供高效计算的工具,但这需要政策、法规和碳定价,以确保使用这些工具成为财务和法律上的强制要求,而不仅仅是企业公共关系的谈资。

对于系统研究者而言,政策是改变目标函数的控制平面。报告规则使隐性的能源和隐含碳成本变得可度量,碳定价将地理位置转化为一个调度变量,而采购标准则使生命周期核算成为基础设施设计的一部分。下述机制之所以重要,是因为它们决定了哪些优化在舰队规模下变得经济合理。

监管机制

有效的 AI 可持续性治理通过强制报告、排放限制和财政激励相结合的方式运作,尽管全球政策碎片化带来了显著的实施挑战。欧洲联盟凭借强制性方法发挥了主导作用,特别是 EU AI Act³⁸³ 和 企业可持续发展报告指令 (CSRD)³⁸⁴。AI 法案为通用 AI 模型和具有系统性风险的通用 AI 模型设定了单独的义务,包括计算资源文档记录以及已知或估算的模型能耗。CSRD 强制要求大型公司披露其环境影响,包括根据标准化、经审计的报告框架披露 AI 运营产生的范围 1、2 和 3 排放。这一监管转变将能源监控从可选优化转变为法律必要性。

除了测量授权外,各国政府正在探索直接限制机制。这些机制包括设定可用于训练大型 AI 模型的算力上限,这类似于环境政策中使用的 排放交易体系 (ETS)³⁸⁵。此类算力“限额与交易”体系将强制组织在预定义的能源预算内运营或采购额外配额,从而创建计算碳信用市场。碳定价和 碳边境调节机制 (CBAM) 的扩展,正将算力的地理位置转化为直接的财务变量——正如 15.1.1 节 所确立的范围,区域电网的碳强度各不相同,这使得碳感知调度成为关键的合规策略。

为了平衡这些限制,政府激励措施发挥着积极作用。对绿色 AI 研究的财政支持、税收优惠和资助,可以使可持续性成为一种竞争优势。政府还可以利用其公共采购权力,强制要求供应商满足可持续性基准,例如在碳中性数据中心运营或使用能效模型。更广泛的企业报告框架——温室气体协议、TCFD 和 ISSB——审查范围 3 排放,涵盖 GPU 采购和数据中心建设的大量隐含碳,以及外包云计算的运营排放。

行业自律与标准

除了政府强制令,AI 行业正通过自律和通用标准推动显著的环境改善。主要云服务商——Google、Microsoft 和 Amazon——最显眼的承诺集中在将数据中心电力消耗与可再生能源采购相匹配,并增加直接清洁能源供应。更进一步,24/7 无碳能源 (CFE) 的推动旨在将每一小时的能源消耗与实时清洁能源采购相匹配,超越年度平均值和碳抵消,后者可能掩盖对化石燃料电网的实际依赖排放 (Monyei and Jenkins 2018)。

内部碳定价是另一种有效的自律工具。通过为碳排放分配“影子价格”,公司将环境成本直接纳入 AI 项目的财务决策中,从而自然地优先投资于节能硬件和低排放模型。当自愿清单和开源工具反哺这些项目决策时,它们能促进问责制:CodeCarbonML CO2 Impact 等项目提供了框架,允许开发者直接在其工作流中估算和追踪模型碳足迹 (Schmidt et al. 2021; Lacoste et al. 2019)。

标准化基准提供了验证这些努力所需的客观数据。MLCommons 通过其 MLPerf 基准测试套件,纳入了数据中心和边缘部署的功率测量协议。通过建立“每焦耳样本数”和“每 Token 焦耳数”等指标,MLCommons 实现了跨不同硬件和软件平台的 AI 系统效率的公平、透明比较。这些基准结合 绿色软件基金会 等组织的独立可持续性审计,创造了一个可度量的机制,以督促行业问责并推动竞争走向真正更环保的 AI。

公众参与与环境正义

有效的 AI 可持续性治理需要公众支持,这取决于透明度、清晰的沟通和公平的获取。目前,公众对 AI 环境影响的理解有限,且常常在技术救赎论和生态灾难论两种叙事之间两极分化。促进知情讨论要求超越 漂绿³⁸⁶——即对环境责任做出误导性声明的做法——走向真正的、可验证的透明度。

承诺式披露只有在产生可审计数据而非声誉掩护时才有用。蒙特利尔碳承诺 最初是机构投资者承诺每年测量并披露碳足迹,它是一个有用的模型,正是因为其价值在于披露的数据而非承诺本身;同样的标准适用于 AI 组织,其可持续性声明的可信度仅取决于其背后的工作负载级测量。

透明度建立了证据基础;环境正义则询问证据揭示的负担与收益如何分配。正如 15.1.2 节 所确立的,ML 舰队将电力需求、用水、土地压力和电子废物分配给往往无法分享其经济收益的社区,这也是为什么选址是工程设计空间的一部分。在政策层面,这一分配问题成为报告要求:大型 AI 项目的社会影响评估和公平获取条款,将公平关切转化为可审计的义务,而非美好愿景。

未来研究方向

研究议程遵循与缓解框架相同的工程逻辑:消除数据移动、弥合测量鸿沟、避免冗余计算。一个主要方向是开发 非冯·诺依曼计算架构³⁸⁷,如 神经形态计算存内计算。通过在数据存储处进行处理,这些范式旨在消除“冯·诺依曼瓶颈”——即在存储和处理单元之间穿梭数据的高能耗过程,这可能占系统功耗的 60%–80%。成功实施可使某些 AI 工作负载的能效提高 100–1000 倍。

关键实施障碍:测量鸿沟

一个关键的实施障碍是“测量鸿沟”:AI 团队需要标准化的工作负载级能耗和碳排放报告,而不能仅依赖粗略的代理指标(Henderson et al. 2020)。粗略方法通常依赖诸如 GPU 小时数乘以平均电网碳强度之类的代理指标,这些方法无法捕捉真实世界的动态变化,而这些动态变化是关注时间、位置和工作负载边界的报告制度所要求的。开发和标准化颗粒度细、实时的能源和碳核算工具,对于合规性和有效优化至关重要。

减少冗余计算的研究方向

第二个研究方向是在计算到达加速器之前减少冗余计算。研究表明,训练数据的预测价值往往会衰减,这意味着模型经常在庞大的数据集上训练,但收益递减(Wu et al. 2022)。更智能的数据采样、主动学习和数据估值技术可以优化训练过程,仅使用最有信息量的数据,从而在不牺牲准确性的前提下减少计算浪费。最终,结合算法效率、硬件创新、可再生能源采用和透明治理的综合方法,是确保 AI 发展轨迹与全球可持续发展目标保持一致的必要条件。

通过更智能的数据策展来最小化冗余计算,直接将法规合规性与运营效率结合起来。阻碍可持续 AI 的最大危险不是技术限制,而是错误的假设——那些导致善意的团队无意中增加其环境足迹的误判。

谬误与陷阱

可持续性涉及违反直觉的物理规律,效率提升可能增加总消耗,而地理选择的主导地位超越了所有其他优化。这些谬误和陷阱捕捉了那些通过错误分配优化精力而浪费算力预算和地球资源的错误。

谬误云计算自动使 AI 系统更加环境可持续。

工程师假设云服务商运行高效且可持续。在生产环境中,地理区域通过电网碳强度差异主导了所有其他因素。在美平均电网(429 g/kWh)上,使用 64 块 A100 训练 7B 模型 14 天会产生 5.7 t CO[2];而在魁北克的水电电网(运行期 20 g/kWh)上仅产生 264.9 kg CO[2]——对于这种美平均电网与魁北克电网的对比,差异约为 21.5 倍,这处于 15.1.1 节 确立的 8 到 40 倍地理差异范围内。燃煤电网排放 800–1000 g CO[2]/kWh,而管理良好的水电来源排放 10–50 g CO[2]/kWh。正如 15.3 节 所示,团队如果在不检查电网碳强度的情况下部署到默认云区域,就会浪费必要碳预算的大量倍数,将“云可持续性”变成了一场地理彩票,而非固有优势。

陷阱仅关注运行能耗,而忽视隐含碳和生命周期影响。

团队优化训练效率,却忽视制造排放。在低碳电网中,隐含碳可能主导车队级足迹核算。正如 15.3.1.1 节 所量化,一块 A100 加速器从制造中隐含约 150 kg CO[2](Luccioni et al. 2023);对于上述 14 天、64 块 A100 的训练运行,未摊销的前期负担约为 9.6 公吨 CO[2]。按 4 年服务寿命摊销,归属于这个特定 14 天作业的份额约为 90 kg,但未摊销的车队级数字主导了总足迹核算:它超过了魁北克清洁电网上该作业的运行排放(运行排放极小)。将硬件寿命从 3 年延长至 5 年可减少 40% 的摊销隐含碳。仅关注运行效率的组织,在优化 PUE 或计算效率的边际收益时,错失了采购和折旧这一杠杆。

谬误TDP 即实际功耗。

热设计功耗(TDP)是冷却系统必须处理的最大持续功耗,而非加速器在特定工作负载下实际消耗的瓦数。实际功耗随利用率、内存访问模式和时钟频率变化:H100 空闲约 50–80 W,运行推理工作负载时为 250–400 W,仅在张量核心占用率高的持续训练期间才接近其 700 W TDP。对推理车队使用 TDP 进行能源计算会高估碳排放(推理很少维持峰值功率),而对具有动态加频超出公开包络的新型硬件进行持续训练则会低估碳排放。驱动地理部署决策的碳和电力成本估算(15.3 节)应使用每个工作负载类别的实测平均功率,而非数据手册上的 TDP。

陷阱将 PUE 作为完整的环境指标使用。

数据中心运营商在可持续性披露中报告 PUE,工程师将该数字视为总结效率的单一指标。PUE 仅衡量设施总功耗与 IT 功耗的比率;它无法说明用水量、制造隐含碳或设施消耗电力的碳强度。运行在以煤电为主的电网(820 g CO[2]/kWh)上、PUE 为 1.06 的数据中心,其运行碳足迹远大于运行在水电(10 g CO[2]/kWh)上、PUE 为 1.40 的数据中心——约 60 倍的差异被单纯的 PUE 隐藏了。报告总环境影响需要 PUE、WUE(用水效率)、电网碳强度和隐含碳摊销共同参与。没有任何单一指标是充分的。

谬误效率提升自动减少总环境影响。

工程师假设将推理成本减半就能将环境影响减半。杰文斯悖论警告说,效率提升可能通过扩大使用量而增加总消耗。在反弹场景中,将 Token 成本从每 1,000 个 $0.06 降至 $0.002(提升 30 倍),同时诱导查询量增加 100 倍,尽管单次查询效率提高,但总排放量反而增长。将推理能耗降低 4 倍的量化变更,如果放宽的成本约束使部署扩张超过 4 倍,仍会增加总能耗。团队如果在没有使用治理的情况下优化效率,因此可能将可持续性胜利转化为消费增长,这需要 图 15.22 中杰文斯分析所激励的碳预算和使用上限。

陷阱将碳抵消视为减少实际排放的替代品。

组织购买抵消信用以中和排放,却不验证抵消质量。现实中,对自愿碳市场的分析显示,60–90% 的信用因基线虚高、固碳非永久性、或项目本身无论如何都会发生等原因,未能实现声称的减排。一家在燃煤电网(1000 g CO[2]/kWh)上训练模型并购买抵消的公司,花费比直接迁移到可再生能源区域(20–50 g CO[2]/kWh)高 2–3 倍,却实现了更差的环境结果。抵消项目需 5-20 年固碳,而计算排放是即时的。将抵消置于实际减排之上的团队,错失了 15.1.1 节 确立的地理杠杆,并延缓了能带来永久改善的可再生能源转型。

谬误:组件级优化保证生命周期改进

团队在未分析部署规模的情况下降低训练成本以提高可持续性。在生产环境中,训练-推理权衡往往会使总排放量反转。若模型剪枝 40% 以节省训练能耗,却需要 2× 推理算力,当服务查询量超过 1 亿次时,总生命周期排放量将增加——生产系统在 3 到 6 个月内即可达到这一临界点。边缘部署虽使数据中心能耗降低 60%,但制造 1 万台专用设备会增加 1500–2000 千克隐含碳排放(为云端训练排放的 10 倍)。将 GPU 寿命从 3 年延长至 5 年,可使分摊的隐含碳排放减少 40%,但可能牺牲 15–25% 的运行效率;生命周期盈亏平衡点取决于电网碳强度:在清洁电网上,延长寿命占优;在脏电网上,效率优先。有效的可持续性要求跨第 15.3.1.2 节进行整体分析,而非局部优化。

陷阱:在组件边界而非生命周期边界评估可持续性

模型为节省训练能耗而被激进剪枝,结果在推理阶段需大量计算开销以补偿精度损失,这说明了局部优化的危险。当硬件团队汇报加速器效率却不含采购碳排放、平台团队汇报 PUE 却不含电网强度、模型团队汇报训练排放却不含预期服务量时,会犯同类错误。避免这些系统性陷阱,需要第 15.3.1.2 节建立的生命周期边界:训练、服务、隐含碳、区域电网组合、硬件寿命、需求增长必须联合评估,然后才能称某项变更为可持续。

总结

生命周期边界是最终综合的主线:可持续架构必须将训练、服务、隐含碳、电网组合、硬件寿命、需求增长纳入统一核算。可持续 AI 是机器学习车队的“物理极限”。高性能 ML 系统可以优化逻辑、利用专用硬件、启动全球服务、强化防御边界,却仍可能在环境测试中失败。最终的门控约束在于:这些系统能否在地球的能源、水、物料边界内存在。

可持续性是核心工程需求,而非可有可无的“加分项”。生命周期碳足迹跨度从第 15.3.1.1 节量化的单 H100 隐含碳,到训练期间消耗的数千兆瓦时。解码阶段的带宽受限低效——自回归生成使加速器在等待内存而非计算时空转消耗静态功率——解释了为何转向专用、内存优化加速器,是云端与边缘的生存策略。杰文斯反弹效应补全了全景:若效率提升导致用量指数级增长,仅靠效率无法解决危机。

可持续性是工程学科,而非公关活动。碳预算、供电约束、冷却能力对车队扩张构成硬性上限,任何营销辞藻都无法规避。杰文斯悖论使此点尤为清晰:降低单次查询成本的效率增益,常触发需求爆发,吞噬原本节省的资源,即无治理的技术优化是自毁的。组织若在采用几项效率技巧后便视可持续性为已解决问题,便重蹈了导致工业能耗上升两个世纪的覆辙。

能跨训练、推理、制造隐含排放量化生命周期碳排,并能设计尊重电网碳强度的碳感知调度策略的从业者,将可持续性纳入与延迟预算、内存容量同等严谨的工程学科。这些技能将可持续性从抽象的企业目标转化为可度量的工程约束。当法规、采购或碳定价使环境影响成为运行包络一部分时,这种核算将像容错、安全一样,成为 ML 系统工程的基石。

  • 功率是硬天花板:车队无法计算超过其场地所能供应的兆瓦数、冷却、水、电网容量。因此可持续性是模型规模的生存约束,而非在原本完备的架构外包裹的一层公关外衣。

  • 需求能超越效率:在 2012–2019 扩展窗口期,AI 算力需求年增约 6.2×,而硬件效率年增仅 1.5×。若无算法与治理限制,即使单次运算成本下降,功率墙仍会到来。

  • 解码在结构上浪费能量:自回归服务长期处于带宽受限状态,加速器在等待内存时持续汲取静态功率。可持续服务需要量化、稀疏化、批处理纪律与内存优化硬件,因为仅靠 FLOP 效率无法触及主导损耗。

  • 碳始于启动前:高达 30% 的生命周期排放隐含于硬件制造中,在首个查询运行前已产生。采购、硬件寿命、复用、电子废弃物策略,在生命周期核算为边界时皆为 MLOps 决策。

  • 位置改变足迹:碳感知调度可按本章 8 到 40 倍的代表性区域因子削减排放,前提是灵活作业可跨电网迁移。效率必须与工作负载放置、需求治理配合,否则杰文斯反弹会花光节省量。

本书大部分章节以效率为杠杆,使其他一切成为可能——每章都为同一结果减少字节、FLOP、焦耳。可持续性是该杠杆撞上无法撼动的墙之处。数据中心有固定功率包络,无论计算、通信、协调量多大,均无法汲取超过设施上限的功率;热力学极限是那一个收敛于三者之上的约束。效率无法逃离天花板,杰文斯悖论表明它反而可能加速逼近,因为更廉价的计算会被大量购买,直到节省量耗尽。守住极限不仅需要效率,更需要刻意决定实际使用多少新增的廉价算力。

ML 车队的环境足迹可量化、受约束,这使物理生存性成为系统设计问题的一部分。安全、鲁棒性、可持续性共同构成生产 AI 的工程基石。技术上可靠的系统仍可能造成社会危害。在第 16 章中,我们将转向治理框架、公平性要求、伦理护栏,确保我们的车队服务于构建它的社会的价值观,完成从“如何构建机器”到“服务于谁”的转型。

此处用于确保测验在部分开始前正确插入。

  • 判定 ML 系统是否真正可持续,需要何种生命周期边界?

  • 当设施功率、冷却或电网容量成为约束性瓶颈时,车队设计应如何改变?

  • 推理能耗何时主导训练能耗?这应如何改变模型与服务设计?

  • 碳感知调度应如何在排放减少与延迟、可靠性、安全约束间取得平衡?

负责任的 AI

车队治理覆盖层包裹数据、训练、服务、监控、政策、公平性、隐私、审计、问责与事件响应。

目的

为何那些不满足责任要求的系统根本无法部署,而与其技术能力无关?

在高风险受监管场景中,无法解释其决策、记录其行为或支持审计的模型,无论其技术能力如何,都可能面临部署关卡。表现出人口统计学偏见的模型,在适用反歧视规则的场合会带来法律、运营和声誉风险。无法被审计的模型无法满足许多企业治理要求。这些并非软性偏好,而在受监管或企业环境中可能成为硬性关卡:未能通过这些关卡的系统可能被阻拦部署,无论其准确率、延迟或任何其他技术指标如何。从将负责任 AI 视为伦理到将其视为工程的转变反映了这一现实:对于高风险 AI 系统,法律和治理要求可使透明度、监督、文档记录和风险管理成为部署就绪的一部分。将责任视为可选项的组织可能会发现,其系统在部署时被法律、监管或声誉约束所阻拦,无论技术卓越程度如何都无法克服。责任已成为基础设施,而非愿景。用 C³ 术语来说,责任是对整个车队的协约束:在允许算力运行前,必须建立安全性和公平性保证。

  • 将公平性、透明度、问责制、隐私和安全转化为可度量的部署关卡

  • 计算公平性指标并诊断由基础率或不完美预测引起的不兼容性

  • 跨人口统计群体、漂移和车队规模反馈回路设计偏见检测与公平性监控

  • 在延迟、算力、可审计性和用户可争议性约束下选择解释方法

  • 在准确率、算力和治理要求下评估隐私、遗忘及鲁棒性缓解措施

  • 分析部署语境中的人机反馈回路、自动化偏见和价值冲突

  • 评估能够维持文档记录、问责制、安全审查和合规的治理结构

治理 imperatives (注:原文为 "The Governance Imperative",单数)

2018 年,路透社报道亚马逊放弃了一个基于历史简历数据训练的实验性招聘算法,因为发现它系统性地惩罚女性候选人 (Dastin 2018)。该系统满足许多常规运营要求:它可以被构建、评估并集成到招聘工作流中。然而它学到的是过去成功的申请人以男性为主,编码的是历史偏见而非基于才干的资质。该模型在统计上是优化的,却在伦理上是灾难性的,证明了技术卓越可能与深远的社会危害共存。

在 图 1.13 所示的车队栈中,负责任 AI 是治理层,即系统与现实世界接触的点。底层提供算力、数据移动、分布式执行、服务基础设施、安全控制、鲁棒性机制和可持续性预算。治理层增加了决定机器为何运行及服务于谁的约束,确保一个原本正确的系统不会强加社会危害。如果铁律定义了效率,负责任 AI 定义了稳定性:确保系统输出不会破坏其运行所在社会的稳定。这种不稳定是具体的:输出有毒内容的模型会侵蚀用户信任(反馈回路不稳定),歧视性的模型会降低其自身未来训练数据的质量(分布不稳定),泄露隐私的模型则招致监管关停(运营不稳定)。因此负责任 AI 属于目标函数内部,而不仅仅是对成品解决方案进行事后约束检查。

生产级 AI 有其自身的系统议程,涵盖架构、基础设施、数据处理、安全和鲁棒性挑战 (Stoica et al. 2017)。安全与隐私、分布偏移下的鲁棒性、环境可持续性直接位于治理层之下。这些能力解释了如何构建和运行安全、鲁棒且可持续的 ML 系统。负责任 AI 解决了单凭技术卓越无法回答的问题:这些系统对受影响的人是否负责任地运行。

亚马逊招聘事件揭示了负责任 AI 的核心挑战:系统在算法上可能合理,却延续不公。该问题超越个体偏见,涵盖了每日影响数十亿生命的系统中的透明度、问责制、隐私和安全。这与韧性不是同一问题。韧性 AI 通过对抗攻击和硬件故障应对系统完整性威胁;负责任 AI 询问一个正常运行的系统是否产生与人类价值观和集体福祉一致的结果。这种区别将抽象伦理原则转化为工程约束。公平性、透明度和问责制必须成为可量化机制和可验证的系统属性,而非在服务路径完成后附加的最终审查项。

软件工程为此演进提供了先例。早期系统仅优先功能正确性。随着复杂度增长,该领域发展出可靠性工程、安全保障和可维护性分析方法论。ML 部署产生了可比的成熟压力,但社会规模更大:模型可中介信贷分配、医疗诊断、教育评估和刑事司判。不同于常规软件故障表现为崩溃或数据损坏,负责任 AI 故障可能延续系统性歧视、损害民主制度、并削弱公众对有益技术的信心。

负责任 AI 是设计、审计和运行 ML 系统以满足可度量的公平性、安全性、隐私和问责标准的实践——将伦理原则转化为可验证的系统属性,以约束模型训练、部署决策和运营监控。

  1. 重要性:负责任 AI 约束施加真实成本:公平性感知训练可能延长训练时长,实时偏见监控可能消耗服务路径延迟,按需可解释性可能需要额外模型评估或异步工作节点算力。在车队规模下,这些防护措施必须像可靠性或安全控制一样进行预算。反之,一个存在持久子群体错误差距的面部识别系统,在被检测前可能影响数百万用户,产生的监管和法律成本远超监控投资。

  2. 区别:与 AI 伦理(定义关于系统应做什么的规范性原则)不同,负责任 AI 工程定义了强制执行这些原则的技术机制——偏见检测算法、差分隐私实现、审计追踪,以及使合规可度量、可验证而非仅停留在愿景层面的架构护栏。

  3. 常见陷阱:一个常见误解是负责任 AI 是应用于成品模型的最终合规审查。若责任约束未从数据收集阶段就设计进去,后续修复通常需要根本性重训练:在有偏标签上训练的模型,无法仅靠事后阈值调整实现公平校准,因为学到的表征本身就编码了偏见。

负责任的人工智能:一门系统性的工程学科

因此,负责任的人工智能构成了一门系统性的工程学科,包含四个相互关联的维度:将伦理原则转化为可衡量的系统需求,检测并缓解有害的算法行为,解决超越单个系统的 社会技术动态,以及在组织和监管背景下应对实施挑战。公共框架如美国国家标准与技术研究院 (NIST) 人工智能风险管理框架、ISO/IEC 42001 和 23894、经济合作与发展组织 (OECD) 人工智能建议书,以及联合国教科文组织 (UNESCO) 人工智能伦理建议书,均体现了从抽象原则向可治理的风险管理、问责制、透明度和人工监督的转变 (Tabassi 2023;International Organization for Standardization and International Electrotechnical Commission 2023b,2023a;Organisation for Economic Co-operation and Development 2024;UNESCO 2022)。隐私保护机制、鲁棒性技术和可持续性指标为这种融合提供了技术基础。负责任的人工智能框架将这些能力与偏见检测算法、隐私保全机制、组织治理结构和利益相关者参与流程相结合,将负责任的人工智能视为合理工程实践的基础,而非应用于成品系统的补充约束。

这种融合是一项重大的基础设施投资。附录 C.2 提供了生产规模的车队基线和服务能力数据,可据此估算开销,使工程师能够根据用于原始服务的相同单加速器吞吐量指标来衡量这项“税收”成本。这项成本是必须预配的必要基础设施,类似于安全性 (第 13 章) 和冗余性 (第 7 章) 在分布式系统中被纳入预算的方式。

将公平性、透明度、问责制和隐私视为严格的工程规范而非抽象理想,使负责任的人工智能从愿望转化为实践。以下的系统性方法将这些核心伦理原则直接映射到机器学习生命周期的机械阶段,将每一项原则转化为具有可衡量标准的具体设计约束。这四个关注点必须按顺序阅读,因为每一项都依赖于其前一项:仅靠技术解决方案无法解决价值冲突,缺乏技术实施的伦理原则仍停留在愿望阶段,而缺乏组织支持的孤立干预注定会失败。

核心原则与机器学习生命周期

一个能自动检测内存泄漏并阻止部署的持续集成管道,同样必须阻止这样一种部署:系统检测到专门针对老年用户的准确率下降了 15%。负责任的人工智能将伦理原则转化为硬性的工程不变量。正如单元测试防止逻辑回归一样,持续集成/持续部署 (CI/CD) 管道必须嵌入公平性、隐私和问责制检查,将人口统计学偏差视同致命的软件异常来处理。

公平性作为一种稳定性约束发挥作用。用控制理论术语来说,公平性确保系统的误差分布在不同人口子群中保持不变。违反此约束的系统是不稳定的:它将通过反馈循环(例如预测性警务)降解自身的训练数据并失去用户信任,最终导致系统崩溃。这一原则既包含统计指标,也涵盖关于公平、正义和结构性偏见的更广泛规范性关切。下文的公平性部分将详细探讨正式的数学定义。

同一控制平面视角使得 可解释性 充当系统可观测性:它是控制平面向人类操作员暴露内部状态的机制 (Phillips et al. 2020)。没有可解释性,系统就是一个在开环下运行的黑箱,无法调试故障模式或验证安全约束。解释机制必须同时支持对单个决策和整体模型行为的解释。它们可以在决策做出后生成以详述推理过程,称为事后解释;也可以内嵌于模型设计中以实现透明运行。神经网络架构在固有可解释性方面差异巨大,通常网络越深越难以解释。因此,可解释性支持错误分析、合规性审查和用户信任。

这种可观测性必须与 透明度 相配合:公开人工智能系统如何被构建、训练、验证和部署。透明度包括披露数据来源、设计假设、系统局限性和性能特征。虽然可解释性侧重于理解输出,但透明度关注系统更广泛的生命周期。

一旦系统行为变得可见,问责制 即提供机制让个人或组织对人工智能结果负责。它涉及可追溯性、文档记录、审计以及补救损害的能力。问责制确保人工智能故障不被视为抽象的故障,而是被视为具有现实影响的后果。

在目标函数层面,价值对齐 要求人工智能系统追求与人类意图和伦理规范一致的目标。在实践中,这涉及技术挑战,包括奖励设计和约束规范,以及关于代表和强制执行谁的价值观的更广泛问题。

生命周期还需要 人工监督:人类判断在监督、纠正或叫停自动化决策中的作用。这包括运行期间的环中有人,以及确保人工智能使用对社会价值观和现实复杂性负责的组织结构。

隐私、鲁棒性和人工监督从不同角度阐述了同一个观点:仅靠原则无法确保负责任的系统。从抽象理想到具体实践的转化,需要在机器学习生命周期中进行系统性集成,每项原则在数据收集、模型训练、评估、部署和监控中以不同方式体现。关键问题是当这些原则在优先级上发生竞争时,如何进行交互。

跨机器学习生命周期整合原则

公平性、透明度、问责制、隐私和安全定义了人工智能系统符合伦理且行为可预测的含义。将这些原则转化为指导模型如何训练、评估、部署和维护的具体约束,是核心工程挑战。

在实践中实施这些原则,需要理解每一项如何为系统行为设定具体期望:

  • 公平性:模型必须以考量历史偏见的方式对待不同子群体。

  • 可解释性:模型决策必须让开发者、审计员和最终用户能够理解。

  • 隐私:数据收集和使用必须尊重同意、目的和访问边界。

  • 问责制:职责必须在整个系统生命周期中被分配、追踪和强制执行。

  • 安全性:模型即使在不确定或变化的环境中也必须可靠运行。

透明度与可解释性

机器学习系统经常因缺乏可解释性而受到批评。在许多情况下,模型作为不透明的“黑箱”运行,产生的输出难以让用户、开发者和监管者理解或审查。这种不透明性构成了信任的重大障碍,特别是在刑事司法、医疗保健和金融等高风险领域,在这些领域问责制和救济权至关重要。例如,美国用于评估再犯罪风险的 COMPAS 算法被发现存在种族偏见[³⁹¹]。

可解释性是指理解模型如何产生预测的能力。它包括局部解释,阐明单个预测;以及全局解释,描述模型的总体行为。相比之下,透明度包含对更广泛的系统设计和运行的公开性。这包括披露数据来源、特征工程、模型架构、训练程序、评估协议和已知局限性。透明度还涉及预期用例、系统边界和治理结构的文档记录。

可解释性和透明度的重要性超越了技术考量,延伸至法律要求。在许多司法管辖区,这些原则是法律义务而非可选指南。根据 GDPR,具有法律效力或类似重大影响的纯自动化决策触发 第 22 条 的保障措施和相关透明度义务,包括根据访问权和知情权规定提供有关所涉及逻辑的有意义信息,但受法定例外情况限制 (European Parliament and Council of the European Union 2016; European Data Protection Board 2018)[³⁹²]。其他领域类似的监管压力强化了将可解释性和透明度视为核心架构要求的必要性。

实施这些原则需要预判不同利益相关者的需求,他们的竞争性价值观和优先级在第 16.7.3 节中得到了全面探讨。因此,为可解释性和透明度进行设计,需要决定如何以及在何处跨系统生命周期呈现相关信息。

透明度和可解释性还支持系统随时间的可靠性。随着模型被重新训练或更新,可解释性和可追溯性机制允许检测意外行为、启用根因分析并支持治理。这些机制嵌入到系统的结构和运行中,为信任、监督以及与机构和社会期望保持一致提供了基础。

虽然透明度和可解释性使利益相关者能够了解系统行为,但它们并不能保证这种行为是公平的。模型可以完全透明地说明其如何做决策,同时仍系统性地使某些群体处于不利地位。这一区别促使我们将公平性作为一个单独的、互补的原则进行探讨。

机器学习中的公平性

算法公平性

算法公平性是指模型的错误分布或结果在受保护的人口群体中保持不变(或变化受限)这一可度量属性。

1. 意义

它将公平性从一种直觉转化为多目标优化问题。在铁律中,实现公平往往需要以总准确率(Accuracy)为代价换取群体特定的校准,校准在每个受保护群体内分别进行检查,以确保系统的收益与危害得到公平分配。

2. 区别

与平均准确率(掩盖了总体中的差异)不同,算法公平性关注子群分布(p(Y|X, Group)),识别模型在少数群体中失效的地方。

3. 常见陷阱

一个常见的误解是认为存在单一的“公平”解决方案。实际上,不同的公平性定义(例如人口统计学平等与机会均等)在数学上往往不兼容,除非在特殊情况下,否则无法同时满足:满足一个必然违反另一个,要求工程师做出明确的政策选择。

两列对比模型准确率。无约束基线列(灰色)达到 85%;人口统计学平等约束列(橙色)达到 81%,付出了 4 个百分点的公平性代价。

公平性约束损失了几个百分点的准确率,这就是责任税。

机器学习中的公平性提出了超越透明度的复杂挑战。核心要求是自动化系统不应对受保护群体造成不成比例的不利影响。因为这些系统是在历史数据上训练的,它们容易复制并放大嵌入在该数据中的系统性偏见模式。如果缺乏周密设计,机器学习系统可能会无意中强化社会不平等,而非缓解它们。

一个广泛研究的例子来自医疗领域。美国医院用于分配护理管理资源的一种算法³⁹³被发现系统性地低估了黑人患者的健康需求(Obermeyer et al. 2019)。该模型使用医疗支出作为健康状况的代理变量,但由于长期存在的获取和支出差异,黑人患者不太可能产生高额费用。结果,模型推断他们病情较轻,尽管他们往往有同等或更大的医疗需求。这个案例说明,当历史不平等未被妥善考量时,看似中立的设计选择(如代理变量选择)可能产生歧视性结果。对这类模型强制执行公平性约束会产生可度量的成本,这一现象称为公平性税

公平性税的计算隔离了一个标准:人口统计学平等,要求各群体的正向决策率相等。它不代表所有公平性目标;它展示了在该节将人口统计学平等与机会均等及机会平等进行比较之前,强制执行该标准的系统成本。

问题

考虑一个准确率为 85% 的信贷模型。A 群体(多数群体)违约率为 20%。B 群体(少数群体)因系统性因素违约率为 40%。如果强制执行人口统计学平等(相同的批准率),准确率会发生什么变化?

数学分析

批准率事实定义了政策变更;下面的准确率数值是在该场景的留出验证集上测得的,其中额外的 B 群体批准带有更高的违约风险。

  1. 无约束:模型批准预测违约概率 < 30% 的所有人。

    • A 群体批准率:80%。

    • B 群体批准率:60%。

    • 总准确率:85%。

  2. 受约束(平等):必须以 80% 的比率批准 B 群体。

    • B 群体新阈值:批准违约概率 < 50% 的申请人。

    • 这迫使模型批准 B 群体中许多有风险的申请人。

    • 新总准确率:81%。

系统洞察

公平性不是免费的。强制执行平等付出了 4 个百分点的准确率代价(在此信用评分场景中相对准确率下降约 4.7%)。这就是公平性税,即纠正历史偏见的显性成本。

考虑到延续偏见的这些风险,从业者需要正式方法来评估公平性。已经开发出一系列正式标准,量化模型在由敏感属性定义的群体中的表现。在介绍这些定义之前,将符号框架化为表达竞争性公平性目标的方式会有所帮助,而不是将其视为证明练习。

在审视正式定义之前,根本挑战在于公平性可能意味着不同的操作约束。系统可能同等对待所有人,考虑不同的基线条件,优化平等结果,保障平等机会,或强制执行平等待遇。这些选择导向不同的数学标准,每个标准捕捉公平性的不同侧面。

接下来的小节使用概率符号介绍正式的公平性定义。这些指标(人口统计学平等、机会均等、机会平等)贯穿于机器学习公平性文献并塑造监管框架。重点在于理解直觉:每个指标度量什么及为何重要,而非数学证明。每个定义后的具体示例阐释了实际应用。如果概率符号不熟悉,可从文字描述入手,稍后再回顾正式定义。

假设模型 h(x) 预测二元结果(如贷款偿还),令 A 代表具有子群 ab 的敏感属性。该领域采用三种广泛认可的公平性定义:

人口统计学平等

人口统计学平等是模型正向预测率与群体成员身份无关的公平性约束(Pr(h(x)=1|A=a) = Pr(h(x)=1|A=b))。

1. 意义

它是最简单且限制最严格的公平性指标。它要求模型在各群体间产生平等的结果,无论数据集中基础基率差异如何。

2. 区别

与机会均等(关注假阳性等错误率)不同,人口统计学平等仅关注最终预测,忽略预测与真实标签之间的关系。

3. 常见陷阱

常见误解认为人口统计学平等能确保“公平”。实际上,它可能迫使模型牺牲校准:为满足平等约束,模型可能不得不故意将某群体中的合格个体误分类,或将另一群体中的不合格个体误分类。

人口统计学平等询问有利结果(如贷款批准或治疗转介)是否在由敏感属性 A 定义的子群中以相等比率发生。形式上,若满足以下条件,模型满足人口统计学平等:Pr(h(x)=1|A=a) = Pr(h(x)=1|A=b)

在医疗案例中,该标准将询问黑人与白人患者是否以相同比率被转介护理,而不考虑其潜在健康需求。这听起来像平等获取,但忽视了医疗状况和风险的真实差异,当需求分布不均时可能导致过度矫正。忽略基础基率差异的局限性促使了更细致的公平性标准出现。

机会均等

等化概率

等化概率要求模型的预测在给定真实标签的条件下与群体成员身份条件独立。具体而言,真阳性率和假阳性率必须跨群体相等:Pr(h(x) = 1 | A = a, Y = y) = Pr(h(x) = 1 | A = b, Y = y),其中 y ∈ {0, 1}

也就是说,对于每个真实结果 Y = y,模型在群体 A = aA = b 上应产生相同的预测分布。因此,模型对于具有相同真实结果的个体,无论其是否符合正向结果资格,都应跨群体表现出相似行为。这确保了错误(漏报和误报)均等分布。

应用于医疗案例,等化概率将确保具有相同实际健康需求(真实标签 Y)的患者,无论种族如何,被正确或错误转诊的可能性均等。原始算法通过少转诊病情相当或更重的黑人患者违反了这一点,凸显了不平等的真阳性率。

机会均等

机会均等是等化概率的一种较宽松放松,仅关注真阳性率 (Hardt et al. 2016)。它要求在本应获得正向结果的个体中,获得正向结果的概率跨群体相等:Pr(h(x) = 1 | A = a, Y = 1) = Pr(h(x) = 1 | A = b, Y = 1)

机会均等确保合格个体(Y = 1)无论群体成员身份如何,都能被模型平等对待。

在我们的持续示例中,该度量将确保在确实需要护理的患者中,黑人和白人个体被模型识别的机会均等。在美医院系统案例中,算法使用医疗支出作为代理变量导致未能满足此标准:有重大健康需求的黑人患者因历史支出较低而较少获得护理。下面的计算示例使用相同的贷款决策计算所有三个标准,展示了单一模型为何以不同方式在每个公平性测试中失败。

考虑一个在 200 位申请人上评估的简化贷款审批模型,两个人口群体(群体 A 和群体 B)各 100 人。模型进行预测,随后观察实际还款结果:

群体 A (100 位申请人)

  • 模型批准:70 位申请人(40 位实际还款,30 位违约)

  • 模型拒绝:30 位申请人(5 位本会还款,25 位本会违约)

群体 B (100 位申请人)

  • 模型批准:40 位申请人(30 位实际还款,10 位违约)

  • 模型拒绝:60 位申请人(20 位本会还款,40 位本会违约)

计算人口统计学平价

Pr(h(x) = 1 | A = a) = 70/100 = 0.70
Pr(h(x) = 1 | A = b) = 40/100 = 0.40

差异:0.70 - 0.40 = 0.30(30 个百分点差距)

模型以实质性更高的比率批准群体 A 申请人,违反人口统计学平价,而不考虑实际还款能力。

计算机会均等(真阳性率)

实际会还款的申请人中(Y = 1):

Pr(h(x) = 1 | A = a, Y = 1) = 40/(40 + 5) = 40/45 ≈ 0.89
Pr(h(x) = 1 | A = b, Y = 1) = 30/(30 + 20) = 30/50 = 0.60

差异:0.89 - 0.60 = 0.29(真阳性率 29 个百分点差距)

模型违反机会均等:在会还款的合格申请人中,群体 A 成员有 89% 被正确批准,而群体 B 成员仅 60%。

计算等化概率(真阳性率 + 假阳性率)

TPR 值已在上文计算。对于不会还款的申请人的假阳性率(Y = 0):

Pr(h(x) = 1 | A = a, Y = 0) = 30/(30 + 25) = 30/55 ≈ 0.55
Pr(h(x) = 1 | A = b, Y = 0) = 10/(10 + 40) = 10/50 = 0.20

模型也有不平等的假阳性率:它错误批准 55% 将违约的群体 A 申请人,但仅 20% 将违约的群体 B 申请人。这揭示了模型对群体 A 更“宽容”,即使他们不会还款。

系统洞察:该模型违反所有三个公平性标准。解决一项标准并不自动满足其他标准。事实上,不可能性定理证明这些标准在数学上可能冲突。

上述计算示例揭示了该贷款审批模型同时违反所有三个公平性标准。这不仅仅是糟糕的模型设计,而是反映了当群体间基础率不同时,任何分类器都必须面对的根本数学张力。这些张力激发了约束任何公平分类器所能达到的不可能性结果。

这些定义捕捉了公平性的不同方面,通常相互不兼容[³⁹⁴] (Kleinberg et al. 2016; Chouldechova 2017)。一个大学录取示例具体说明了这种张力。

目标 1(人口统计学平价)是录取学生使录取班级反映申请人池的人口统计,或许是 50% 来自群体 A 和 50% 来自群体 B。目标 2(机会均等)是确保在所有合格申请人中,跨群体录取率相同,使 80% 合格群体 A 申请人被录取且 80% 合格群体 B 申请人被录取。如果一个群体有更高比例的合格申请人,实现人口统计学平价(目标 1)要求拒绝其部分合格申请人,违反机会均等(目标 2),如图 16.1 所示。不存在数学修复;选择是关于优先考虑哪种公平性定义的价值判断。

公平性不可能性定律(原理)精确概括了录取示例刚演示的内容:除特殊情况如相等基础率或完美预测外,校准风险分数通常不能同时满足跨群体的等化误差率条件,而人口统计学平价增加了进一步冲突,因为它约束选择率而非分数校准或误差率。满足一项标准可能排除另一项,因此工程师必须像对待延迟预算那样对待公平性指标——由利益相关者选择的显式权衡,由系统强制执行,并监控违规。确定优先考虑哪个指标需要仔细考虑应用背景、潜在危害和利益相关者价值观,详见第 16.7.3 节。

图 16.1:公平性不可能性权衡

图 16.1:公平性不可能性权衡:可视化为何常见公平性标准会冲突。当基础率不同且预测不完美时,校准风险分数通常不能同时满足等化误差率条件;人口统计学平价增加了单独的选择率约束,可能与任一目标冲突。这迫使工程师基于应用背景做出明确的规范性选择。

公平性指标分歧指标

图 16.2 通过在具有不同群体基准率的合成情景中扫描分类阈值,将此权衡具体化。在每个阈值处,至少有一个公平性指标被显著违反,说明了更广泛的操作性教训:在不均衡基准率下,校准和等错误率标准通常存在冲突,而诸如人口统计学平等之类的选择率标准则会增加进一步的限制。

图 16.2:阈值处的公平性指标分歧

图 16.2:阈值处的公平性指标分歧:三个标准公平性指标——人口统计学平等、均等几率和均等机会——在分类阈值变化时,针对具有不同群体基准率的分类器进行计算。在每个阈值处,至少有一个指标被显著违反,说明了不均衡基准率和不完美预测如何在选择率、错误率和机会标准之间迫使实际权衡。

认识到这些张力,操作系统必须将公平性视为贯穿机器学习生命周期的整个过程的约束。它受到数据收集和表示方式、目标和代理的选择方式、模型预测的阈值方式以及反馈机制构建方式的影响。例如,在排序模型和分类模型之间的选择,即使使用相同的底层数据,也可能导致不同群体之间的访问模式出现差异。

公平性指标有助于形式化公平目标,但通常仅限于预定义的人口统计类别。在实践中,这些类别可能过于粗糙,无法捕捉真实世界数据中存在的全部差异范围。

交叉性公平性

标准公平性分析的一个关键局限在于,它通常独立地评估身份的单一轴(例如,种族或性别)。这可能会掩盖这些属性交叉点上存在的深刻差异。

一个标记的 2x2 肤色-性别网格。大多数单元格显示高准确率,而深肤色女性单元格呈猩红色并标记为 65%,展示了单轴审计掩盖的交叉失败。

错误集中在交叉点:深肤色女性。

例如,一个面部识别系统可能对“男性”和“浅肤色人群”均达到 99% 的准确率,但对“深肤色女性”的准确率仅为 65% (Buolamwini 和 Gebru 2018)。如果审计仅分别检查种族和性别,则模型看起来是公平的。这一现象有时被称为公平性杰利曼德,要求评估模型在交叉子群(例如,种族 × 性别)上的性能,以检测和缓解复合偏见。

公平性的原则性方法必须考虑重叠和交叉身份,确保模型行为在可能未被事先明确标记的子群之间保持一致。该领域的近期工作强调了在广大人口切片上实现预测可靠性的必要性 (Hébert-Johnson 等人,2018),强化了公平性必须被视为系统级要求而非局部调整的理念。这种对公平性的扩展视角突出了设计架构、评估协议和监控策略的重要性,以支持对模型行为更细致、敏感于上下文的评估。

定量公平性测量

形式化公平标准只有在从业者能够测量违反程度并建立可操作的干预阈值时才能付诸实践。由此产生的数学框架量化了差异,并确定何时应采取纠正措施。

四个点度量将第 16.2.3 节中的公平标准转化为审计员可设阈值的数字。每个度量 equalizes 不同的量,因此每个都揭示了同一分类器的不同失败。表 16.2 对它们进行了定义,并在贷款示例中进行了评分,其中组 A 的批准率为 0.70,组 B 的批准率为 0.40,合格申请者的真阳性率分别为 0.89 和 0.60,不合格申请者的假阳性率分别为 0.55 和 0.20。

| 指标 | Equalizes | 公式 (a, b) | 贷款值 | 何时选择它 |

| --- | --- | --- | --- | --- |

| 不同影响比率(五分之四规则) (Feldman 等人,2015) | 较低批准率除以较高批准率 | \(\frac{\min_g \Pr(h=1 \mid g)}{\max_g \Pr(h=1 \mid g)}\) | \(\frac{0.40}{0.70} = 0.57\) | 需要法律认可的筛选;DI < 0.8 表明存在不同影响 |

| 统计平等差异 (Calders 和 Verwer,2010) | 批准率的加法差距 | \(\Pr(h=1 \mid a) - \Pr(h=1 \mid b)\) | \(0.70 - 0.40 = 0.30\) | 在许多群体之间进行比较或跟踪漂移;常见审计阈值 \(\|SPD\| \le 0.10\) |

| 均等机会差异 (Hardt 等人,2016) | 合格申请者中的真阳性率 | \(\Pr(h=1 \mid a, Y=1) - \Pr(h=1 \mid b, Y=1)\) | \(0.89 - 0.60 = 0.29\) | 伤害是拒绝值得服务的个体 |

| 平均几率差异 (Hardt 等人,2016; Bellamy 等人,2019; Bird 等人,2020) | 真阳性率和假阳性率 | \(\frac{1}{2}[\,|\Delta\text{TPR}| + |\Delta\text{FPR}|\,]\) | \(\frac{1}{2}[0.29 + 0.35] = 0.32\) | 两种错误类型都重要;AOD = 0 在完全均等几率时成立 |

表 16.2:贷款示例中的公平性指标:四个群体公平性指标,每个 equalizes 不同的量,在贷款批准模型上进行评估。不同影响比率是法律认可的筛选测试;加法差异更易于随时间跟踪;平均几率差异捕捉了真阳性和假阳性错误差距。

这四个指标按设计存在分歧:0.57 的不同影响比率意味着低批准率群体仅获得高批准率群体批准率的该比例,已经违反了五分之四规则。加法差距 0.30、机会差距 0.29 和平均几率差距 0.32 各自量化了同一差异的不同维度。单一数字不足以说明问题,这就是为什么上述不可能结果迫使部署方明确选择优先考虑哪个指标。

校准

如果在模型分配得分 s 的个体中,正结果的比例在各组之间相等,则该模型对敏感属性满足得分校准 (Kleinberg 等人,2016):\(\Pr(Y=1 \mid s(x)=s, A=a) = \Pr(Y=1 \mid s(x)=s, A=b), \forall s\)

得分校准是每个得分的条件;对于硬二进制预测,一个相关的平等条件是预测为正例中的正预测值(精确度)相等,而得分校准是更强的要求,即这种平等在每个得分水平上都成立:

PPV(a) = \frac{\Pr(Y=1, h(x)=1 \mid A=a)}{\Pr(h(x)=1 \mid A=a)} = PPV(b)

从贷款示例中可以看出:

\begin{align*}
\text{PPV}(a) &= \frac{40}{70} = 0.571 \\
\text{PPV}(b) &= \frac{30}{40} = 0.750
\end{align*}

正预测值差距为 0.750 − 0.571 = 0.179。B 组的预测阳性有 75% 的时间实际上是阳性,而 A 组的仅有 57% 准确。这违反了高风险决策的预测平价,并揭示了该模型在预测 A 组批准结果时可靠性较低。要证明评分校准本身,需要比较各组在匹配评分区间内的结果频率。

校准对于个人依赖预测概率的高风险决策至关重要。校准不良的模型会系统性地高估或低估特定群体的风险,导致资源错配和信任侵蚀。

公平性指标的实践应用

定义这些指标是容易的部分;在已部署的模型群中持续计算它们才是工程成本显现的地方。在转向阈值权衡和显著性检验的机制之前,先看看这些指标在生产规模下要求什么,因为这种成本决定了系统能负担得起监控哪些指标。

测量开销产生的原因是:计算特定群体指标需要为每个受保护群体维护单独的统计数据。对于 k 个群体和 m 个指标,这需要 𝒪(km) 个额外的计数器,以及每个评估周期 𝒪(km) 个统计检验。在高吞吐量系统中(>10K QPS),必须通过采样或异步聚合来管理这种开销。

数据需求构成挑战,因为公平性审计需要具有代表性的样本的真实标签(Y)和敏感属性(A)。在联邦或隐私保护环境中,获取这些数据可能与隐私目标冲突。加密聚合统计或用于群体指标的差分隐私等技术,有助于协调公平性监控与隐私要求。

因此,敏感属性的可用性是一项工程设计选择,而非背景假设。系统可能在获得同意后直接收集属性,仅为聚合审计推断它们,将其托管在受限服务中,计算加密或差分隐私的群体统计数据,在抽样标签上离线审计,或宣布该指标在该部署中不可测量。每种选择都会改变组织可用的公平性证据以及监控管道产生的隐私风险。

阈值选择需要领域专业知识和利益相关者的投入,以建立可接受的差异阈值。法律阈值(例如“五分之四规则”)提供了起点,但特定情境的危害评估应决定最终值。记录阈值基本原理,以支持审计和合规。

时间稳定性要求随时间监控公平性指标,以检测因分布漂移、反馈循环或模型更新导致的退化。带有自动告警的持续监控(例如,“若 |SPD| > 0.15 持续 7 天则告警”)可在危害累积前实现主动干预。

阈值设定与公平性权衡

实践中,可通过按群体调整分类阈值来操纵公平性指标。给定评分函数 s(x)(例如预测概率),定义群体特定阈值 τ[thr, a]τ[thr, b],使得 ha = 𝟙[s(x) ≥ τ[thr, a]] 对于群体 a 成立,群体 b 同理。

为实现统计均等性,求解:Pr (s(x) ≥ τ[thr, a] | A = a) = Pr (s(x) ≥ τ[thr, b] | A = b)

为实现机会均等,求解:Pr (s(x) ≥ τ[thr, a] | A = a, Y = 1) = Pr (s(x) ≥ τ[thr, b] | A = b, Y = 1)

对于机会均等化,真阳性率和假阳性率约束必须同时成立。这是一个约束优化问题,可通过后处理求解(Hardt et al. 2016)。

然而,阈值调整有其局限性。如果群体间基础率差异巨大(即 Pr (Y = 1 | A = a) ≠ Pr (Y = 1 | A = b),通过阈值调整实现一种公平性标准将因不可能定理而必然违背其他标准。由此产生的准确率成本可直接量化。

权衡:满足公平性约束通常需要偏离最优准确率阈值。这种偏差即为“公平性税收”。

场景:某信用模给申请人评分 0 至 100 分,使用与公平性税收示例相同的留出信用验证集。

  • A 组(多数群体):平均分 70,高还款率。最优阈值 = 60。

  • B 组(少数群体):平均分 50,较低还款率(因系统性因素)。

无约束优化(最大利润)

  • 所有人阈值 = 60。

  • 批准率[A] = 80%,批准率[B] = 60%。

  • 准确率 = 85%。

公平性约束(统计均等性)

  • 约束:B 组批准率必须等于 A 组(80%)。

  • 新阈值[B] = 50。

  • 结果:B 组假阳性增加。整体准确率降至 81%。

系统洞察:“公平性成本”为 4 个百分点的准确率,即本场景下约 4.7% 的相对准确率下降。工程决策需权衡这一可测量的准确率权衡与社会公平收益。

前述示例衡量了施加统计均等性导致的总体准确率下降,但未展示系统如何在决策时强制执行约束。实践中,均等化要求设置群体特定阈值:多数群体一个阈值,少数群体一个不同的、较低的阈值。差异化阈值要求推理时访问敏感属性,并引发关于显性基于群体待遇的担忧,这在某些司法管辖区本身可能被视为不公平或非法。具体的阈值设定场景能更清晰地说明其机制。

考虑一个输出概率 s(x) ∈ [0, 1] 的信用评分模型。历史数据显示:

A 组:1000 名申请人,600 人会还款(Y = 1),400 人会违约(Y = 0

  • Y = 1 的评分分布:均值 μ[A]^+ = 0.72,标准差 σ[A]^+ = 0.15

  • Y = 0 的评分分布:均值 μ[A]^− = 0.45,标准差 σ[A]^− = 0.18

B 组:1000 名申请人,400 人会还款(Y = 1),600 人会违约(Y = 0

  • Y = 1 的评分分布:均值 μ[B]^+ = 0.65,标准差 σ[B]^+ = 0.16

  • Y = 0 的评分分布:均值 μ[B]^− = 0.40,标准差 σ[B]^− = 0.17

假设条件评分分布近似正态,具有上述均值和标准差,对两组使用单一阈值 τ[thr] = 0.60 得出真阳性率:

\begin{align*}
\text{TPR}_a &= \Pr(s(x) \geq 0.60 \mid A=a, Y=1) \approx 0.79 \\
\text{TPR}_b &= \Pr(s(x) \geq 0.60 \mid A=b, Y=1) \approx 0.62
\end{align*}

这一 17 个百分点的差距违反了机会均等。要将 B 组的 TPR 均等化至 A 组约 0.79 的水平,可将 B 组阈值降至 τ[thr, b] = 0.52,同时保持 τ[thr, a] = 0.60。然而,此调整将 B 组的假阳性率从约 0.12 提高至约 0.24,导致 B 组申请人的精确度从约 0.78 降至约 0.69。

系统洞察:这说明了根本权衡:通过阈值调整实现机会均等,以降低校准度和增加接收较低阈值群体的假阳性为代价。决策涉及在机会公平与预测可靠性之间权衡。

统计测量公平性违规

统计显著性检验

为了确定观察到的差异是否具有统计显著性而非抽样噪声,从业者应计算置信区间并进行假设检验。对于人口统计学平等,使用双比例 Z 检验检验原假设 H[0] : Pr(h(x) = 1 | A = a) = Pr(h(x) = 1 | A = b)。检验统计量为:

z = \frac{\hat{p}_a - \hat{p}_b}{\sqrt{\hat{p}(1-\hat{p})\left(\frac{1}{n_a} + \frac{1}{n_b}\right)}}

其中 [a] 和 [b] 为样本通过率,\(\hat{p} = \frac{n_a\hat{p}_a + n_b\hat{p}_b}{n_a + n_b}\) 为合并比例,n[a], n[b] 为样本量。

以贷款案例为例,n[a] = n[b] = 100,[a] = 0.70,[b] = 0.40:

\begin{align*}
\hat{p} &= \frac{100(0.70) + 100(0.40)}{200} = 0.55 \\
z &= \frac{0.70 - 0.40}{\sqrt{0.55(0.45)(0.02)}} = \frac{0.30}{0.0704} = 4.26
\end{align*}

z = 4.26(远超临界值 z[0.05/2] = 1.96),故拒绝 H[0],结论:人口统计学平等违规在 p < 0.001 水平上具有统计显著性。针对机会均等与赔率均等化,可通过限定 Y = 1 或 Y = 0 的子人群构建类似检验。统计显著性不代表实际显著性;即使统计显著,若幅度极小也可能可接受。反之,小样本中的大幅差异虽未达统计显著,仍需干预。

上述定量框架将公平性从抽象原则转化为可度量的工程约束。通过建立指标、阈值与统计检验,从业者可在 ML 全生命周期中系统评估公平性,并基于数据决定何时干预。

问题

某欺诈检测模型作用于两个群体。人口统计学平等与机会均等对部署揭示了什么?

变量

  • Group A (majority,多数群体):TP = 450, FP = 50, FN = 30, TN = 470 (n[records] = 1000)。

  • Group B (minority,少数群体):TP = 180, FP = 70, FN = 120, TN = 630 (n[records] = 1000)。

数学分析

  1. 人口统计学平等(正预测率):Pr(Ŷ = 1)。

    • Group A: (450 + 50)/1000 = 0.50。

    • Group B: (180 + 70)/1000 = 0.25。

    • Gap:0.25。(违反五分之四法则:0.25/0.50 = 0.5 < 0.8)。

  2. 机会均等(TPR):TP/(TP + FN)。

    • Group A: 450/(450 + 30) = 0.938。

    • Group B: 180/(180 + 120) = 0.60。

    • Gap:0.338。(严重违规)。

系统洞察

修正 TPR 需降低 Group B 的阈值以捕获更多欺诈(减少 FN),但这很可能增加 Group B 的 FP(误报),恶化预测平等。这具体演示了不可能定理:单一公平性约束无法孤立变更。

公平性考量超越算法结果,延伸至部署负责任 AI 系统所需的计算资源与基础设施。当高能耗 AI 基础设施集中于已处于劣势的社区时,会产生包括环境正义在内的更广泛公平性影响[³⁹⁵]。

负责任 AI 技术的计算强度制造了一种数字鸿沟:获取公平、透明、可问责的 AI 系统变得取决于经济资源。实施公平性约束、差分隐私机制、全面可解释性工具会增加训练、服务、存储或审查成本,相较于无约束模型。持续公平性监控、差分隐私随机梯度下降、按需解释等计算密集型防护措施,资源充足的组织更易全面部署;资源受限部署可能为效率牺牲防护。结果可能形成双层体系:资源充足的用户和应用更易获得负责任 AI,潜在加剧而非缓解现有不平等。这些资源约束带来普及化挑战,更广泛的影响则制造数字鸿沟与准入壁垒,冲击服务不足社区。

这些考量指向本章核心论点:每个负责任 AI 属性都是系统级属性,而非模型属性。 公平性源于数据工程实践、建模选择、评估程序、决策策略的交互;无法孤立至单一模型组件,亦无法仅靠事后调整解决。隐私、可解释性、鲁棒性、可问责性同理:均源于整条流水线而非模型权重。因此负责任 ML 设计将公平性视为基础约束,贯穿系统全生命周期的架构选择、工作流、治理机制。这种系统级视角将各原则转化为 ML 生命周期各阶段的具体工程需求:公平性要求群体级性能指标与跨人群的差异化决策阈值;可解释性需要运行时计算预算,其成本取决于方法使用梯度、扰动采样、Shapley 值近似还是精确子集枚举;隐私涵盖数据治理、同意机制、生命周期感知的保留策略;可问责性要求追踪基础设施,含模型注册表、审计日志、人工覆盖机制。

这些原则在系统开发中相互作用并产生张力。隐私保护技术可能降低可解释性;公平性约束可能与个性化冲突;鲁棒监控增加计算成本。正如表 16.1 所示,每个原则在数据收集、训练、评估、部署、监控各阶段均有体现,强化了负责任 AI 非事后考量而是架构承诺。然而,这些原则的实施可行性关键取决于部署语境:云、边缘、移动端、TinyML 环境各施加不同约束,塑造哪些负责任 AI 特性在实践中可实现。

隐私与数据治理

隐私与数据治理呈现超越威胁模型视角的复杂挑战,同时与上述公平性、透明度原则产生根本张力。安全导向的隐私防范未授权访问。负责任的隐私决定系统是否应收集某数据字段,若必须收集,如何在全生命周期最小化暴露。这种更广视角产生固有张力:公平性监控要求收集分析敏感人口统计数据,可解释性方法可能泄露训练样本信息,全面透明可能与个人隐私权冲突。负责任 AI 系统须通过审慎设计选择,在保护、问责、效用间取得平衡。

ML 系统常依赖大量个人数据支撑模型训练与个性化功能。这种依赖带来用户隐私、数据保护、伦理数据管理的重大责任。数据质量与治理直接影响负责任 AI 原则的落地能力。负责任 AI 设计视隐私为核心约束而非附属功能,须贯穿系统全生命周期的各项决策。

机器学习系统中的隐私、安全性与鲁棒性

隐私与效用的张力

支持隐私面临的核心挑战之一,在于数据效用与个体保护之间固有的张力。丰富、高分辨率的数据集能够提升模型的准确性和适应性,但同时也增加了暴露敏感信息的风险,尤其是在数据集被聚合或与外部来源关联时。例如,在广泛文本语料库上训练的大语言模型已被证明会记忆³⁹⁶特定字符串,这些字符串随后可通过模型查询或对抗性提示检索出来 (Carlini et al. 2021)。

超越显性敏感数据

隐私挑战不仅限于显性的敏感数据,还延伸至看似无害的信息。可穿戴设备追踪生理和行为信号,包括心率、运动轨迹或位置,单独看来可能无伤大雅,但结合起来却能描绘出详细的用户画像。当用户对其数据如何被处理、保留或传输缺乏可见性或控制权时,这些风险会进一步加剧。

隐私作为系统原则

应对这些挑战,要求将隐私视为一项系统原则,这意味着需要稳健的数据治理。这包括明确收集何种数据、在何种条件下收集,以及征得何种程度的同意和透明度。基础的数据工程实践——包括数据验证、模式管理、版本控制和血缘追踪——为落实这些治理要求提供了技术基础设施。负责任的治理要求关注标注实践、访问控制、日志基础设施,并遵守管辖区的法律要求。这些机制旨在约束数据在系统中的流动方式,并对其使用情况进行问责记录。

图 16.3 概述了数据管道早期阶段的关键隐私检查点,重点标出了诸如差分隐私、联邦学习和安全聚合等防护措施如何降低攻击者对原始个人数据的可见性。实际实现往往涉及更细致的权衡和上下文敏感的决策,包括独立的同意与治理控制,但该图为识别隐私风险产生的环节及如何通过负责任的设计选择加以缓解提供了一个脚手架。

隐私保护机器学习管道

图 16.3:隐私保护机器学习管道:一种在最小化数据暴露的前提下训练全局模型的多阶段架构。该管道应用了一系列顺序防护措施——差分隐私、联邦学习和安全聚合——逐步降低攻击者对原始个人数据的可见性。

薄弱数据治理的后果

薄弱数据治理的后果有据可查。基于理解不透彻或有偏数据集训练的系统,可能会延续结构性不平等或无意中暴露敏感属性。前文介绍的 COMPAS 案例中,围绕数据溯源和使用的不透明,使得有效的评估或补救成为不可能。在临床应用中,数据集往往反映出缺失值或人口统计学偏斜等伪影,同时损害了性能和隐私。如果没有明确的数据质量和文档标准,此类脆弱性就会变成系统性的。

贯穿机器学习全生命周期的隐私

隐私不仅仅是孤立算法或数据处理器的关注点;它必须作为系统的一个结构性属性来处理。关于同意收集、数据保留、模型设计和可审计性的决策,共同构成了机器学习管道的隐私态势。这包括不仅要在训练期间,还要在推理和持续运行期间预判风险。诸如成员推理攻击³⁹⁷等威胁,凸显了将隐私保护嵌入模型架构和接口行为的重要性。

法律框架

法律框架反映了这一理解。诸如 GDPRCCPA³⁹⁸ 以及日本的《个人信息保护法》(APPI)等法规,对数据最小化、目的限制、用户同意、删除权或擦除权提出了具体义务 (European Parliament and Council of the European Union 2016; California Legislature 2023; Personal Information Protection Commission, Japan 2023)。这些要求将伦理期望转化为可强制执行的设计约束,强化了在系统开发中将隐私视为核心原则的必要性。

隐私作为一项横向承诺

隐私是 第 16.2.3 节 中为公平性确立的系统级论点的第二个实例:它是一项跨越同意收集、保留策略、模型设计、服务部署和可审计性的承诺,而非某个单一阶段的属性。它要求跨技术和组织领域进行协调,以确保数据使用符合用户期望、法律授命和社会规范。与其将隐私视为需与功能性权衡的约束,负责任的系统设计从一开始就整合隐私,使其指导架构、塑造接口,并约束模型的构建、更新和部署方式。

过渡到安全性与鲁棒性

隐私保护防止了未经授权的数据泄露,但负责任的系统还必须确保即使隐私机制无法防范所有风险时,系统行为依然可预测。一个模型可能满足所有隐私约束,却在遇到意外输入或对抗条件时灾难性地失效。安全性与鲁棒性解决的是这一互补问题:系统如何失效,而不仅仅是数据如何被保护

安全性与鲁棒性

定义与范围

安全性与鲁棒性在 第 14 章 中作为解决硬件故障、对抗攻击和分布偏移的技术属性被引入,它们同时也是负责任 AI 的原则,其内涵超越了威胁缓解。技术鲁棒性确保系统在对抗条件下存活;负责任的鲁棒性确保系统行为符合人类期望和价值观,即使在技术上功能正常时也是如此。一个模型可能对位翻转和对抗扰动具有鲁棒性,但如果它在边缘情况下不可预测地失效,或优化了与用户福祉错位的目标,其行为仍不安全,不宜部署。

机器学习中的安全性,是指确保模型在正常条件下行为可预测,并在压力或不确定性下以受控、非灾难性的方式失效。与之密切相关,鲁棒性关注模型在存在变化(无论是输入、环境还是系统配置的变化)时,保持稳定一致性能的能力。这些属性共同构成了在安全关键领域负责任部署的基础,在这些领域机器学习输出直接影响物理或高风险决策。

实际要求

在实践中确保安全性与鲁棒性,要求预判系统可能遇到的全部条件范围,并设计在训练分布之外依然可靠的行为。这不仅包括管理输入的变异性,还包括处理模型如何应对意外相关性、罕见事件以及故意诱导失效的尝试。例如,美国国家运输安全委员会 (NTSB) 对 Uber 2018 年坦佩撞人案的调查表明,自动驾驶故障可能综合了感知、预测、安全员和组织控制等多重问题,而非单一模型错误所能概括 (National Transportation Safety Board 2019)。

一个典型的失效模式源于对抗性输入³⁹⁹:精心构造的扰动,在人类看来无害,却会导致模型输出错误或有害的预测(Szegedy et al. 2013)。此类漏洞并不局限于图像分类;在音频、文本和结构化数据等多种模态中均有观测到,它们揭示了高维空间中学习到的表示的脆弱性。解决这些漏洞需要专门的方法,包括对抗性防御和鲁棒性技术。这些行为表明,鲁棒性不仅要在训练期间考虑,更要作为系统与现实世界复杂性交互的整体属性来考量。

一个相关的挑战是分布偏移⁴⁰⁰:训练数据与部署时遇到的条件之间不可避免的不匹配。无论是由于季节性、人口结构变化、传感器退化还是环境变异性,即便没有对抗性操纵,这种偏移也会降低模型的可靠性。应对分布偏移挑战需要系统性的方法来检测并适应不断变化的条件。

负责任的机器学习设计将鲁棒性视为一项系统性要求。应对它不仅仅意味着提升单个模型的性能。它涉及设计能够预见不确定性、暴露自身局限性,并在预测置信度低时支持回退行为的系统。这包括设置置信度阈值、支持拒绝决策、以及将人工监督集成到运营工作流中等实践。这些机制对于构建能够优雅降级而非静默或不可预测地失效的系统至关重要。

这些单模型层面的考量延伸至更广泛的系统要求。安全性和鲁棒性还在架构和组织层面施加要求。关于如何监控模型、如何检测故障、以及如何治理更新的决策,都会影响系统能否有效应对不断变化的条件。负责任的设计要求将鲁棒性视为塑造机器学习系统整体行为的约束,而非孤立模型的属性。这种系统级的安全与鲁棒性视角引出了问责与治理的问题。

问责与治理

机器学习中的问责是指识别、归因并处理自动化决策后果的能力。它不仅限于诊断故障,还要确保系统行为的责任被明确分配、危害可被补救,并通过监督和制度流程维护道德标准。没有这些机制,即使初衷良好的系统也可能在无补救措施的情况下造成重大危害,从而破坏公众信任并动摇合法性。

与责任通常归属于可识别的开发者或操作员的传统软件系统不同,机器学习中的问责是分散的。模型输出由上游数据收集、训练目标、流水线设计、接口行为和部署后反馈共同塑造。这些相互关联的组件通常涉及技术、法律和组织领域的多方参与者。例如,如果一个招聘平台产生了有偏见的结果,问责不仅可能落在模型开发者身上,也可能落在数据提供者、界面设计师和部署机构身上。负责任的系统设计要求显式地映射并治理这些关系。

治理不善会阻碍机构识别或纠正有害的模型行为。Google Flu Trends 未能预见分布偏移和反馈回路,其后果便是说明了用户搜索行为的未建模变化、媒体驱动的查询激增以及缺乏对 CDC 监测地面实况的充分重新校准所带来的后果(Lazer et al. 2014)。持续的高估多年未得到纠正,最终导致该模型被弃用。

法律框架也反映了问责设计的必要性。诸如《伊利诺伊州人工智能视频面试法案》(Illinois General Assembly 2020)和《欧盟人工智能法案》(European Parliament and Council of the European Union 2024)等法规,对高风险应用施加了透明度、同意、文档记录和监督等要求。这些政策将问责嵌入的不仅是系统产生的结果,还包括支持其使用的操作程序和文档记录。内部组织变革,包括引入公平性审计和在定向广告系统中施加使用限制,展示了监管压力如何催化治理方面的结构性改革。

为问责而设计意味着支持系统生命周期每个阶段的可追溯性。这包括记录数据溯源、记录模型版本控制、启用人工覆盖,并保留足够的日志以供事后分析。模型卡片⁴⁰¹(Mitchell et al. 2019)和数据集数据表⁴⁰²(Gebru et al. 2021)等工具,就是使系统行为可解释和可审查的典型实践。Mitchell 等人提出的模型卡片,是随训练好的 ML 模型附带的简短文档,提供针对预期应用相关的文化、人口统计和表型群体的基准评估。同样,Gebru 等人提出每个数据集都应附带一份数据表,记录其动机、构成、收集过程和推荐用途,这类似于电子元件附带规格书。然而,问责不能简化为仅靠文档记录;它还需要反馈、争议解决和救济机制。

在组织内部,治理结构有助于正式确立这种责任。道德审查流程、跨职能审计和模型风险委员会,为预见下游影响和应对新出现的担忧提供了论坛。这些结构必须由基础设施支撑,允许用户争议决策,并允许开发者通过纠正措施进行响应。例如,允许解释或用户发起复审的系统,有助于弥合模型逻辑与用户体验之间的鸿沟,尤其是在错误影响重大的领域。

架构决策也发挥着作用。接口可以被设计为呈现不确定性、允许升级处理,或在适当时暂停自动化操作。日志记录和监控流水线必须配置为检测道德漂移的迹象,例如子群体性能下降或意外的反馈回路。在统一可观测性难以维持的分布式系统中,问责必须通过架构保障来嵌入,例如安全协议、更新约束或可信组件。

治理并不意味着集中控制。相反,它涉及以透明、可执行且可持续的方式分配责任。技术团队、法律专家、最终用户和机构领导者都必须能够获得评估系统行为并在必要时干预所需的工具和信息。随着机器学习系统变得更加复杂并嵌入重要基础设施,问责必须通过成为架构和流程中的基础性考量,而非部署后添加的反应层,来相应地进行扩展。

尽管有这些治理机制,有意义的问责制仍面临挑战:区分基于合法因素的决策与可能延续历史偏见的虚假相关性。这一挑战需要仔细关注数据质量、特征选择和持续监控,以确保自动化决策反映公平合理的推理,而非源自有偏历史数据的问题模式。

上文探讨的原则和技术为负责任 AI 提供了概念和技术基础,但其实际实施关键取决于部署架构。云系统可支持复杂的 Shapley 值解释和实时公平性监控,但 TinyML 设备必须依赖静态可解释性和编译时隐私保障。边缘部署能实现本地隐私保护,却限制了全局公平性评估。这些架构约束不仅仅是实现细节;它们从根本上决定了不同用户和应用能获得哪些负责任 AI 保护。

场景:招聘推荐模型必须在发布前选择关键公平性指标。

问题:哪个指标最符合合格候选人在各群体间拥有可比机会的场景?

回答:均等几率通常最适合招聘,因为它要求相等的真阳性率和假阳性率。当基础比率不同时,人口统计学公平性可能强制拒绝合格候选人,而校准仅确保 0.8 等分数在各群体中含义相同。

该示例说明为何指标选择是治理决策而非单纯计算:选定的公平性定义决定了系统被允许做出哪种错误权衡。选择数学上合适的公平性指标是第一步,但计算这些指标需要访问人口统计数据并产生巨大计算开销。当从集中式云环境转向受隐私和带宽约束的分布式边缘部署时,强制执行这些数学保障变得复杂得多。

本节将公平性、可解释性、透明度、问责制和价值对齐重构为控制平面不变量而非事后审查项,将其映射至 ML 生命周期各阶段,并量化了公平性税和负责任 AI 开销。

从原则到机制

权衡判断

负责任 AI 跨部署环境

在拥有海量集中式数据库和无限云 GPU 的情况下,审计模型偏见很简单。但在严格隐私法规禁止访问人口统计数据的百万部智能手机联邦学习模型上审计,则是完全不同的工程问题。部署环境从根本上决定了哪些负责任 AI 技术在数学上和法律上可行。

这些架构差异重新分配了可行防护措施和责任主体。资源可用性、延迟约束、用户界面设计以及连接性的有无,决定了负责任 AI 原则能否在不同部署环境中一致执行。同一模型在云端可能支持丰富解释、持续监控和集中审计,嵌入间歇性连接设备时却需要静态验证和简化防护。

计算资源的地理和经济分布增加了另一层公平性。高性能 AI 系统通常需要靠近大型数据中心或高带宽互联网连接,造成的服务质量差异与现有社会经济不平等高度重合。农村社区、发展中地区和经济弱势地区常因网络延迟、带宽受限和距离计算基础设施远而体验降级的 AI 服务质量。美国联邦通信委员会报告记录了持续的宽带差距:农村地区拥有达标固定宽带的可能性远低于城市地区。对负责任 AI 而言,基础设施鸿沟决定了实时可解释性、持续公平性监控和隐私保护计算,对受自动化决策影响最大的用户和社区是否切实可行。

系统可解释性

可解释性的约束条件是部署环境,而非技术选择:计算容量、延迟预算、界面设计和数据访问决定了能否运行何种解释方法。云系统可负担繁重的事后方法,如 Shapley 值归因(SHAP)和局部代理解释(LIME)[⁴⁰³];移动和边缘设备通常仅能负担单次显著性图[⁴⁰⁴];TinyML 设备往往完全不支持运行时解释,只留下开发时检查这一机会。第 16.6 节阐述了该矩阵预设的技术级机制和成本;表 16.3 记录了各环境下的可行性。

表格无法捕捉的两个维度使可解释性区别于其他原则。一是受众:最终用户需要简明摘要(如“睡眠期间心率升高”),而开发者、审计员或监管机构需要归因图、概念激活或决策追踪,因此同一部署常需同时呈现两种解释界面。二是时机:无人机或工业控制回路运行时无闲暇计算解释,只能记录内部信号供事后分析;而金融风险评分或医疗诊断等异步系统可在决策后渲染深度解释。在部署的延迟、能耗和界面限制内规划两者,才使可解释性成为设计约束而非部署后的愿望。

公平性约束

公平性呈现平行的部署问题,其约束条件是数据可见性。拥有人口统计标注数据集的云平台可计算群体级指标、运行公平性感知训练和事后审计。联邦学习[⁴⁰⁵]或设备端部署则不行:无单一实体观测全局人口统计分布,故群体级公平性审计不仅昂贵,且在无隐私保护聚合下数学上不可能,公平性必须内置于训练或数据集策展之初。表 16.3 记录了各环境差异;数据可见性限制的两个后果值得深究,因其跨部署反复出现。

首先是决策阈值策略,而不仅仅是模型质量,决定了实际公平性。即使模型在各群体间的准确率相等,当分数分布不同时,统一阈值仍会产生不同影响,因此除非预先考虑并将特定群体阈值嵌入策略中,否则移动贷款审批系统可能会系统性地少批某一群体。第二是缺乏全局上下文的个性化会悄悄加剧差异:局部自适应模型旨在实现个体公平,即在任务相关的相似度度量下,相似个体获得相似决策(Dwork 等,2012),但对边缘化用户稀疏或噪声数据的重新训练,可能会导致模型漂向强化现有鸿沟。这种漂移是一个反馈循环。偏向特定院校候选人的招聘平台,在基于自身有偏结果重新训练时会放大不平等,这也是缓解措施必须涵盖部署监控、数据记录和影响评估,而非单次审计的原因。图 16.4 说明了偏见放大反馈循环,除非被绿色干预点打断,否则每个阶段都会放大现有偏见。

图 16.4:偏见放大反馈循环:当 ML 系统基于自身输出重新训练时,训练数据中的历史偏见会通过模型预测、下游结果和被强化的数据传播,然后反馈为更有偏的重训练数据。每个阶段边("trains on"、"produces"、"creates"、"feeds into")都会放大扭曲。实心绿色干预箭头显示了三个外部缓解点(数据审计、公平性指标和影响审计),可打破循环。

图 16.4 中的循环揭示了为何事后公平性审计是不够的:如果不在数据、模型、预测和重新训练这四个阶段中的每一个进行干预,每次迭代都会复合前一次引入的偏见,将微小的初始偏斜变成系统性差异。因此,公平性从指标选择转变为生命周期约束:数据可见性决定了可测量的内容,阈值策略决定了错误落在何处,反馈基础设施决定了差异是衰减还是复合。

同样的部署分割带来了下一个负责任 AI 的张力。在本地保留敏感数据可保护用户,但支持隐私的本地性也移除了许多公平性审计所需的全局可观测性。

隐私架构

隐私继承了相同的中心化权衡,且更加尖锐。在云端聚合数据可实现大容量建模和监控,但集中了泄露和监控的风险,因此必须配合强加密、访问控制和可审计性。在移动、联邦或 TinyML 客户端本地保存数据可降低中心风险,但也移除了监控或强制合规所需的全局可观测性,迫使隐私防护必须在部署前编译进模型和固件,且没有运行时信道进行调整。表 16.3 记录了各环境的定位。

该表无法显示的约束是,隐私是在服务层而非仅在训练时被评判的。即使满足每个形式化隐私定义的模型仍可能泄露:成员推理攻击通过读取模型输出恢复用户记录是否在训练集中,因此防御必须延伸至接口设计、速率限制和访问控制。此外,如果数据收集不透明,技术上合规的系统仍可能违背用户预期,这使得同意界面和清晰披露成为隐私架构的一部分,而非 UI 的事后考虑。

隐私保护数据流,但不保证系统输出在输入偏移、传感器退化或对手探测接口时保持可靠。这一缺口从隐私架构引向安全与鲁棒性架构:系统还必须定义其在压力下的行为方式。

跨部署的安全与鲁棒性

安全与鲁棒性的约束条件是延迟预算,因为它决定了哪种防御能够运行。云服务可负担不确定性估计器、分布变化检测器、对抗输入过滤和 API 速率限制;但具有毫秒级预算的自主导航或控制回路无法做到,必须预先预计算其回退动作。表 16.3 记录了各环境的划分;在受限极端下,TinyML 系统完全没有运行时监控或更新信道,因此鲁棒性必须通过保守设计和部署前测试静态构建。

该表无法显示的后果是,回退本身也是一个延迟预算问题。当行人检测置信度低时选择弃权的配送机器人只解决了一半问题;接管弃权情况的人工审核员、基于规则的默认值或升级队列,必须在与受保护模型相同的时间预算内执行。因此,鲁棒系统不是避免所有错误的系统,而是能可见地、可控地、安全地失败的系统,这取决于关于感知、置信度估计、回退路由和恢复的具体选择。这些选择也定义了治理表面:系统必须指定谁可观察危害、谁可干预、谁对结果负责。

治理结构

问责制通过具体的可追溯基础设施实现,其约束条件是环境能承载多少此类基础设施。云平台支持模型注册表、遥测仪表板和结构化事件管道,可将预测追溯至特定模型、输入或配置。TinyML 设备不具备这些:无连接、无持久存储、无运行时可配置性,问责制必须通过加密固件签名、固定审计追踪和部署前文档静态嵌入,有时在制造阶段强制执行,因为部署后无法纠正。表 16.3 记录了各环境在此光谱上的位置。

最考验这一点的是移动部署,因为责任分散在本地模型、远程服务和接口设计中,出错时往往不清哪一层该负责。那里的治理依赖于可访问的救济途径,以及在用户层面浮现、解释和争议决策的机制,嵌入接口和周围服务架构中,而非作为策略覆盖层事后加上。跨所有环境,维持问责制意味着像规划成功一样审慎规划失败:定义异常如何检测、角色如何分配、记录如何维护、补救如何进行,所有这些在日志中可追溯、通过接口可强制执行。治理还必须核算基础设施选择的环境与分布影响,因为部署 AI 系统的组织不仅对算法结果负责,还对资源使用对环境正义和公平获取的广泛影响负责。

设计权衡

跨部署上下文的治理挑战揭示了一个普遍模式:负责任 AI 的权衡是架构权衡。机器学习系统并非在理想化的孤岛中运行;它们必须在有限资源、严格延迟要求、不断演变的用户行为和监管复杂性中,驾驭相互竞争的目标。

云端部署与设备端部署的权衡

由于拥有充足的计算和存储资源,基于云端的系统通常支持广泛的监控、公平性审计、可解释性服务和隐私保护工具。然而,这些优势通常伴随着集中式数据处理,这带来了与监控、数据泄露和复杂治理相关的风险。相比之下,设备端系统(如移动应用、边缘平台或 TinyML 部署)提供了更强的数据本地性和用户控制权,但限制了部署后的可见性、公平性检测手段和模型适配能力。

架构层面的张力

目标之间的张力往往在架构层面变得显而易见。例如,具有实时响应要求的系统(如可穿戴设备手势识别或自主刹车)无法在推理过程中承担计算详细可解释性解释的开销。设计者必须选择是否预计算简化输出、将解释推迟到异步分析阶段,或在运行时设置中完全省略可解释性。

个性化与公平性

个性化与公平性之间也存在冲突。基于本地使用数据适应个人的系统,往往缺乏评估人群子群体间差异所需的全局背景。确保个性化预测不导致系统性排除,需要精心的架构设计,在用户级适应与群体层面的公平性与可审计性机制之间取得平衡。

隐私与鲁棒性

隐私和鲁棒性目标也可能发生冲突。鲁棒系统通常受益于记录罕见事件或用户异常值以提高可靠性。然而,记录此类数据可能与隐私目标冲突,或违反数据最小化的法律约束。在敏感行为必须保持本地化或加密的场景中,鲁棒性必须预先设计进模型架构和训练过程中,因为事后优化可能不可行。

环境与公平性影响

负责任 AI 的计算需求产生的张力,超越了技术优化范畴,延伸至环境正义和公平获取问题。节能部署通常需要简化模型并削减公平性监控能力,这在环境可持续性与伦理保障之间制造了权衡。例如,在联邦学习中实施差分隐私会使单设备能耗增加 25%–40%,这可能使此类隐私保护措施对于电池受限设备变得过于昂贵⁴⁰⁹。

系统层面的挑战

综上,这些部署案例揭示了一个更广泛的系统层面挑战。负责任 AI 原则不能孤立考量。它们相互作用,针对某一原则的优化可能会制约另一原则。恰当的平衡取决于部署架构、利益相关者优先级、领域特定风险、错误后果,以及计算资源需求的环境和分配影响。因此,负责任的机器学习设计取决于在选择方法前使这些约束显性化,以便最终系统能针对其必须适应的实际部署环境进行评估。

表 16.3 通过对比负责任 AI 原则在云端 ML、边缘 ML、移动端 ML 和 TinyML 系统中的不同体现,综合了部署权衡。每种环境基于计算能力、连接性、数据访问和治理可行性等因素,对可解释性、公平性、隐私、安全性和问责制施加不同的约束。

没有任何部署环境能在所有原则上占据主导地位;每种环境都做出不同的妥协。正如表 16.3 所揭示的,云端系统支持复杂的可解释性方法(SHAP、LIME)和集中式公平性监控,但通过数据聚合引入隐私风险。边缘和移动端部署提供更强的数据本地性,但限制了部署后的可观测性和全局公平性评估。TinyML 系统面临最严峻的约束,要求静态验证和编译时隐私保证,且没有运行时调整的机会。这些约束不仅仅是技术限制,还决定了不同用户和应用能访问哪些负责任 AI 功能,产生了公平性影响——只有资源充足的部署才能负担得起全面的防护措施。理解这些部署约束,为在实践中将负责任 AI 原则具体化的技术方法提供了必要背景。

表 16.3:部署权衡

| 原则 | 云端 ML | 边缘 ML | 移动端 ML | TinyML |

| :--- | :--- | :--- | :--- | :--- |

| 可解释性 | 支持复杂模型和方法,如 SHAP 和采样方法 | 需要轻量级、低延迟方法,如显著性图 | 要求面向用户的可解释输出,通常将深度分析推迟到云端 | 因硬件受限而严重受限;主要为静态或仅编译时 |

| 公平性 | 大规模数据集允许偏见检测和缓解 | 本地化偏见更难检测,但允许设备端调整 | 高度个性化使群体层面公平性追踪复杂化 | 数据极少限制偏见分析和缓解 |

| 隐私 | 集中式数据面临泄露风险,但可使用强加密和差分隐私方法 | 敏感个人数据在设备端要求设备端保护 | 与用户身份紧密绑定,要求感知同意的设计和本地处理 | 分布式数据降低集中风险,但给匿名化带来挑战 |

| 安全性 | 易受黑客攻击和大规模攻击 | 真实世界交互使可靠性至关重要 | 在用户监督下运行,但仍需优雅降级 | 需要静态安全边界、看门狗和故障安全行为 |

| 问责制 | 企业政策和审计允许追溯和监管 | 碎片化供应链使问责制复杂化 | 要求清晰的面向用户的披露和反馈路径 | 要求跨漫长、复杂的硬件链条进行追溯 |

| 治理 | 外部监管和法规(如 GDPRCCPA)可行 | 要求开发者和集成商自治 | 平衡平台政策与应用开发者选择 | 依赖内置协议和加密保证 |

表 16.3:部署权衡:由于计算、连接和治理约束各异,负责任 AI 原则在不同部署环境中体现不同;云端部署支持复杂的可解释性方法,而 TinyML 严重限制了它们。在为云端、边缘、移动端和 TinyML 环境设计机器学习系统时,优先考虑可解释性、公平性、隐私、安全性和问责制等特定原则,需要仔细权衡这些约束。

技术方法选择

部署分析确立了一个关键洞见:负责任 AI 技术的可行性取决于架构约束。TinyML 设备无法运行 SHAP 解释;边缘系统无法实施实时公平性监控;移动应用无法存储全面问责制所需的审计日志。因此,负责任的机器学习要求针对上述约束图谱选择技术方法:检测偏见、保护隐私、确保鲁棒性和提供可解释性,只有当它们适配数据质量、计算预算、部署需求和服务栈(这些因素决定技术能否运行)时,才在操作层面具有意义。

负责任 AI 方法的必要性

这些方法的必要性始于模型的学习方式。训练数据包含历史偏见和不公平关联,在有偏历史数据上训练的招聘算法可能会通过将人口统计特征与成功挂钩来重现歧视性模式。模型学习的是相关性而非因果性,因此反映不公平社会结构的统计模式可能会被优化,仿佛它们是有意义的关系。仅针对准确性进行优化的传统机器学习因此与公平性目标产生张力。有效的解决方案必须将相关约束集成到数据收集、训练、服务或监控中,而不是在训练后将其作为次要修正附加上去。

以下的运维技术分为三大互补类别,每类在准确性、计算成本和实现复杂度方面都有独特的权衡。检测方法能及早识别有问题的行为以便干预,为偏见、漂移和性能问题提供预警系统。缓解技术通过算法干预和鲁棒性增强来预防或减少有害结果。验证方法使系统行为对评估自动化决策的开发者、审计员、监管机构和受影响用户变得可读、可理解。

负责任 AI 技术的计算开销

下一节将详细拆解技术方法,但它们的系统成本在实现细节之前就已显现。表 16.4 展示了负责任 AI 技术的性能影响:检测、缓解、验证、隐私和解释技术分别对训练、推理、内存和准确性施加不同的成本。先阅读该表可让工程师将负责任 AI 方法视为可部署的系统选择,而非抽象的道德标签。

| 技术 | 准确性损失 | 训练开销 | 推理成本 | 内存开销 |

| --- | --- | --- | --- | --- |

| 差分隐私 (DP-SGD) | 2–5% | 15–30% | 极小 | 10–20% |

| 公平性感知训练 (重加权/约束) | 1–3% | 5–15% | 极小 | 5–10% |

| 近似 SHAP (Tree/Kernel) | 不适用 | 不适用 | 50–200% | 20–100% |

| 精确 SHAP | 不适用 | 不适用 | 50–1,000× | 50–200% |

| 对抗训练 | 2–5% | 100–300% | 极小 | 50–100% |

| 联邦学习 | 5–15% | 200–500% | 极小 | 100–300% |

表 16.4:负责任 AI 技术的性能影响:该表为容量规划提供规划范围,而非通用的基准测试结果。差分隐私 和公平性约束主要影响训练和验证预算;可解释性成本则高度依赖变体,近似 TreeSHAP 和基于内核的方法需要重复的模型计算,而精确 SHAP 随特征数量呈组合爆炸式增长。这些规模范围有助于工程师在选择负责任 AI 实现之前推理生产约束。

这些开销范围应视为场景假设,而非断言某篇引用论文确立了单一通用税收。实际开销因模型架构、数据集规模、攻击强度、解释方法、硬件、通信模式和实现质量而显著不同。关键在于架构层面:负责任 AI 控制消耗真实的训练、服务、内存或审查容量,因此必须在发布前纳入预算。这些开销数字也是 16.2.1.1 节 中公平性论点具体化之处:无力承担表中训练、推理和内存预算的组织,也无力承担这些保护措施,因此对公平或私密模型的权利取决于其背后的算力预算。

由于这些计算成本和架构约束极大地影响系统设计,工程团队必须根据其特定的部署现实仔细选择合适的工具。无论环境如何,采取纠正措施的第一步都是知道问题存在,这使得检测方法成为所有其他负责任 AI 干预的基础。

偏见检测与公平性监控

一个在全国部署的信用评分模型开始以正常速率的两倍拒绝来自特定邮政编码的合格申请人。如果没有偏见检测基础设施,这种差异会在数周或数月内持续存在,直到有人注意到。偏见检测将理论上的公平性定义转化为实时的、运维级的遥测数据。正如站点可靠性工程师监控延迟仪表盘一样,负责任 AI 工程师监控人口统计学均价仪表盘,利用基于切片的分析来识别模型何时开始对特定子群体失效。

偏见检测与缓解

16.2.3 节 中探讨的公平性定义为“公平意味着什么”提供了数学精度:人口统计学均价、机会均等化几率和机会均等均有数学定义。然而,从业者面临一个实际挑战:在每秒处理数千次预测的生产系统上计算这些指标。使用上述公式进行手动计算在大规模下不可行。这种定义与部署之间的鸿沟激励了专用工具的开发。

在部署系统中实施公平性不仅需要原则性目标或理论指标;它要求具备系统感知的方法,能够跨机器学习生命周期检测、衡量和缓解偏见。可以使用诸如 Fairlearn (Bird et al. 2020) 之类的工具来实现实际的偏见检测。

清单 16.1 支持跨人口统计群体进行离线或 CI 阶段的公平性审计,揭示了贷款批准率因种族而异的令人担忧的差异:从亚裔申请人的 94% 到黑人申请人的 68%。基于前文讨论的系统级约束,公平性必须被视为一种架构考量,它与数据工程、模型训练、推理设计、监控基础设施和策略治理相交叉。虽然人口统计学均价、机会均等化几率和机会均等等公平性指标形式化了不同的规范性目标,但它们的实现取决于架构衡量子群体性能、支持自适应决策边界以及在运行时存储或呈现群体特定元数据的能力;部署时监控将在本节后面处理。

清单 16.1:使用 Fairlearn 进行偏见检测:跨人口统计群体评估贷款审批模型,以呈现表明歧视性模式的批准率和假阳性差异。

实时公平性监控架构

在许多真实环境中,尤其是移动、联邦或嵌入式系统中,敏感属性(如性别、年龄或种族)可能在推理时不可用,这使得难以跟踪或审计模型在不同人口群体中的表现。数据收集和标注策略对于模型生命周期全过程的公平性评估至关重要。在这些情境下,公平性干预必须在数据策划或训练阶段上游进行,因为部署后重新校准可能不可行。即使数据可用,结合用户反馈的持续再训练管道如果未显式监控公平性退化,也可能强化现有差距。例如,适应用户行为的设备端推荐模型,若缺乏检测用户交互或输出中人口统计失衡的基础设施,可能会放大先前的偏见。

图 16.5 说明了公平性约束如何与部署选择产生张力。在一个二元贷款审批系统中,两个子群体(Subgroup A 用蓝色表示,Subgroup B 用红色表示)需要不同的决策阈值以实现相等的真阳性率。对所有群体使用单一阈值会导致不同的结果,可能使 Subgroup B 处于劣势。通过为每个群体调整阈值来解决这种失衡可能提高公平性,但这要求模型服务栈支持条件逻辑、推理时能访问敏感属性,并建立治理框架以解释和证明对不同群体的差别对待的合理性。

图 16.5: **Threshold-Dependent Fairness**: 跨子群体变化分类阈值允许相等的真阳性率,但增加了模型服务的复杂性,并要求推理时访问敏感属性。实现公平性需要仔细考虑子群体特定性能,因为单一阈值可能对某些群体产生不成比例的影响,凸显了机器学习系统中准确性与公平结果之间的张力。

公平性干预可应用于管道的不同节点,但每种都有系统层面的影响。

预处理方法 通过采样、重加权或增强来重平衡训练数据,需要访问原始特征和群体标签,通常通过保留血统的特征存储或数据湖实现。这些方法适合具有集中式训练管道和高质量标注数据的系统。

相比之下,在处理方法 将公平性约束直接嵌入优化目标。这些方法需要支持自定义损失函数或约束求解器的训练基础设施,并可能需要更长的训练周期或额外的正则化验证。训练技术和优化方法(包括自定义损失函数和约束优化)为实现这些公平感知训练方法提供了基础。

在服务层,后处理方法 包括应用特定群体阈值或调整分数以均衡结果,要求推理系统能基于敏感属性或引用外部策略规则进行条件判断。这要求模型服务基础设施、访问控制策略和日志管道之间的协调,以确保差别对待既可审计又在法律上可辩护。模型服务架构(包括请求路由、特征查找和条件推理路径)详述了在生产系统中实现此类条件逻辑的基础设施要求。任何后处理策略都必须仔细验证,以确保不损害用户体验、模型稳定性或对属性使用的司法管辖区法规合规性。

可扩展的公平性执行通常需要更高级的策略,如多重校准,它确保模型预测在广泛的交叉子群体中保持校准。大规模实施多重校准需要动态生成子群体划分、计算各组校准误差、并将公平性审计集成到自动化监控系统中的基础设施。这些能力通常仅在具有成熟可观测性和指标管道的大规模云部署中可用。在嵌入式或 TinyML 等受限环境中,由于遥测有限且模型逻辑固定,此类技术不可行,公平性必须完全在设计时验证。

跨部署环境,维护公平性需要生命周期感知机制。模型更新、反馈循环和接口设计都影响公平性随时间的演变。如果再训练管道不包含公平性检查、日志系统无法追踪子群体结果、或用户反馈引入训练分布未捕捉的微妙偏见,公平感知模型可能会退化。监控系统必须能够暴露公平性回归,再训练协议必须能访问子群体标注的验证数据,这可能需要数据治理政策和伦理审查。这些监控系统的实现需要用于 MLOps 实践的生产基础设施,而隐私保护技术对于联邦公平性评估至关重要。

公平性不是一次性优化,也不是孤立模型的属性。它源于数据获取、特征工程、模型设计、阈值设定、反馈处理和系统监控等协调决策。将公平性嵌入机器学习系统需要架构远见、运营纪律以及跨越完整部署栈(从训练工作流到服务基础设施再到用户面向接口)的工具支持。

偏差检测的社会技术影响远超技术度量。当公平性指标识别出差距时,组织必须应对复杂的利益相关者审议过程(详见 16.7.3 节)。这些决策涉及相互竞争的利益相关者利益、法律合规要求和价值权衡,无法仅通过技术手段解决。

实时公平性监控架构

在生产系统中实施负责任 AI 原则,需要将公平性监控、可解释性和隐私控制直接集成到模型服务基础设施中的架构模式。图 16.6 演示了这些负责任 AI 组件如何与现有 ML 系统基础设施集成,展示了从用户请求经过匿名化、模型推理、公平性监控到解释生成的数据流。

图 16.6: **Production Responsible AI Architecture**: 实时公平性监控需要集成组件,将每个推理请求通过数据匿名化、偏差检测和解释生成进行处理,同时维护审计追踪,并在公平性阈值被违反时触发警报。虚线显示了基于检测到的偏差模式进行模型更新的反馈循环。

架构与治理

该架构之所以奏效,是因为三条治理路径共享模型服务栈,而非独立于其旁运行。数据匿名化层在模型推理前实施保护隐私的转换,采用诸如 k-anonymity⁴¹³ 或差分隐私噪声注入等技术。该层并非零成本:隐私转换会消耗延迟、CPU 和内存,因此必须纳入模型服务 SLO 预算内,而不能视为外部合规步骤。

实时公平性监控会为每次预测更新仅依赖预测的指标(如人口统计学均等),并跨受保护群体维护滚动统计。依赖标签的指标(如机会均等化和机会均等)在延迟结果或审计标签到达时异步更新,对于标签窗口过小、无法支持稳定估计的群体,这些指标保持非激活状态。系统会标记超出可配置策略阈值的差异,其存储和计算占用随受保护群体数量、决策分段和保留窗口而缩放。

解释引擎为模型决策生成 SHAPLIME 解释,特别是针对需要用户补救的负面结果。精确解释往往超出内联服务预算,因此生产系统依赖近似、缓存、采样或异步生成,以在延迟与保真度之间权衡。后续的实现应被视为一种架构模式,而非需死记硬背的 API:公平性指标进入服务路径,阈值超标时触发告警。清单 16.2 将这些组件整合进一个监控系统,该系统处理推理请求,跨受保护群体计算预测时的公平性指标,并在真实结果可用时更新机会均等化等依赖标签的指标。

清单 16.2:生产级公平性监控

生产级公平性监控:处理推理请求、计算滚动预测时公平性指标、并在结果到达时更新依赖标签指标的偏差检测。

此生产级实现演示了负责任 AI 原则如何转化为具有可量化性能影响的具体系统架构。表 16.4 中汇总的开销范围解释了为何公平性监控、隐私转换和解释生成必须作为服务路径能力进行预置,而非在模型部署后才添加。设计生产系统时,这些开销必须与可靠性和合规要求相平衡。

监控成本是将公平性从离线审计转变为运营信号的代价。观察仍不等于补救:公平性缓解贯穿预处理、训练中约束、后处理及持续子群监控。下一层转移到不同的责任边界,系统必须防止私密数据通过日志、输出或模型权重泄露,并须在用户撤回数据权利时支持删除或撤销。

本节将静态公平性定义转化为实时遥测:基于切片的检测(使用 Fairlearn)、CI 阶段审计、人口统计学均等与机会均等化的生产监控,以及观察差异与补救差异的区别。

检测差异

从信号到行动

隐私、遗忘与鲁棒性缓解

当用户依据 GDPR 等隐私法规行使擦除或删除权利时(European Parliament and Council of the European Union 2016),从数据库中删除其数据行很简单。但从已训练于该数据的神经网络权重中删除其数据,则是一个根本更难的问题:模型无法通过行删除来“遗忘”特定人脸或信用卡号码。缓解措施家族因其保护的边界而异:

  • 隐私机制:这些控制减少泄露。

  • 遗忘机制:这些控制移除或限制保留的影响。

  • 鲁棒性机制:这些控制在压力下保持行为。

  • 验证机制:这些控制产生证据证明防护措施仍在生效。

机器遗忘⁴¹⁴ 和隐私保护解决了该挑战中的删除与泄露部分,提供了从编译模型中剔除特定训练数据影响的机制。

隐私保护

隐私约束贯穿数据收集、模型行为和用户交互。它们不仅由伦理和法律义务塑造,还由系统的架构属性及部署上下文决定。隐私保护的技术手段旨在防止数据泄露、限制记忆,并维护用户权利(如同意、选择退出和数据删除),特别是在从个性化或敏感信息中学习的系统中。

大语言模型已被证明会记忆并暴露个别训练字符串,包括姓名、地点或私人通讯片段(Carlini et al. 2021)。这种记忆给隐私敏感型文本生成系统带来风险,例如在用户日志上训练或适配的助手,其训练数据可能编码受保护或受监管的内容。例如,适应用户语音或消息的语音或聊天助手可能无意中保留特定短语,后者可能通过精心设计的提示或查询被提取。

记忆风险不仅限于语言模型。图 16.7 表明,在图像数据集上训练的扩散模型可再生成训练集中的视觉实例(Carlini et al. 2023)。左侧面板为原始训练图像,右侧面板为扩散模型对该同一实例的重建;二者的高度相似即为记忆的证据,因为若模型仅学习了肖像的一般分布,便无法复现特定个体。此类行为凸显了一个更普遍的漏洞:当代生成式模型架构能内化并复现训练数据,往往无显式信号或意图,且难以检测或控制。

图 16.7:扩散模型记忆:图像扩散模型可复现训练样本(Carlini et al. 2023),揭示了除语言模型外的非预期记忆风险,并凸显了当代神经架构的普遍脆弱性。在敏感数据集上训练时,此类记忆构成隐私隐患。

模型同样易受成员推理攻击,攻击者试图判断特定数据点是否属于训练集(Shokri et al. 2017)。此类攻击利用模型对已见与未见输入的细微行为差异。在医疗或法律预测等高风险应用中,仅知晓某个体记录被用于训练,即可能违背隐私期望或监管要求。

隐私保护技术与机器遗忘

差分隐私

为缓解此类漏洞,已开发出一系列隐私保护技术。一种规范的形式化方法是差分隐私⁴¹⁵,它提供了一种保证:单个数据点的包含或排除对模型输出具有统计上有界的影响。诸如差分隐私随机梯度下降(DP-SGD)之类的算法通过在训练期间裁剪梯度并注入噪声,将这一理念应用于深度学习(Abadi 等人 2016)。当隐私核算、裁剪和噪声校准针对威胁模型得当时,这些方法可限制记忆并降低推理攻击的风险。

然而,差分隐私引入了显著的系统级权衡。训练期间添加的噪声可能会降低模型准确性、增加训练迭代次数,并需要更大的数据集来维持性能。这些限制在资源受限的部署中尤为突出,例如移动、边缘或嵌入式系统,这些系统的内存、算力和电量预算受到严格约束。在这些场景下,可能需要将轻量级隐私技术(例如特征混淆、本地差分隐私)与限制数据收集、缩短保留期或在边缘强制执行严格访问控制的架构策略相结合。

使用 DP-SGD(差分隐私随机梯度下降)在敏感消息上训练下一个词预测器可降低训练数据提取风险,但这种保护是以算力和准确性为代价的。

隐私参数 ϵ 即隐私预算。ϵ 越低意味着隐私越强但噪声越大。

强隐私(ϵ = 1)

梯度被大幅裁剪(C = 1.0,裁剪了 40% 的更新)且噪声大(σ = 1.0)。模型收敛需要 3 倍的训练轮数。训练成本从 460 万美元跃升至约 1380 万美元。准确率下降 6%。

中等隐私(ϵ = 8,示例设置)

噪声较小(σ = 0.5)。训练开销 30%。准确率下降 1%。

弱隐私(ϵ = 10)

极小噪声。准确率损失小于 1%。形式化保证有限。

隐私不是非黑即白的。它是一条连续曲线,组织以算力成本和模型准确性换取用户信任。关键的工程决策在于跨系统生命周期分配隐私预算:训练期间花费多少 ϵ,部署后查询保留多少,以及如何向用户和监管机构传达这些权衡。

隐私实施还取决于模型之外的基础设施。数据收集接口必须支持知情同意和透明度。日志系统除非严格必要,否则不应保留敏感输入,且必须支持访问控制、过期策略和可审计性。模型服务基础设施必须经过设计,以防止输出过度暴露导致内部模型行为泄露或允许重构私有数据。这些系统级机制要求机器学习工程、平台安全和组织治理之间的紧密协调。

隐私不仅必须在训练期间强制执行,还必须贯穿整个机器学习生命周期。重训练管道必须考虑已删除或撤销的数据,特别是在有数据删除强制规定的司法管辖区。监控基础设施必须避免在日志或仪表板中记录个人身份信息。隐私感知遥测收集、安全飞地部署和用户级审计跟踪可支持这些目标,特别是在具有严格法律监管的应用中。

架构决策也因部署环境而异。基于云的系统可能依赖差分隐私、加密和访问控制的集中式实施,并由遥测和重训练基础设施提供支持。相比之下,边缘和 TinyML 系统必须将隐私约束构建到部署模型本身中,通常没有运行时可配置性或反馈通道。在这种情况下,静态分析、保守设计和嵌入式隐私保证必须在编译时实施,并在部署前进行验证。

因此,隐私预算贯穿整个管道:技术防护、接口控制、日志和保留策略以及合规机制必须协同工作,以最小化已部署系统生命周期中的风险。没有任何单一机制(包括差分隐私)单独就足够。

隐私保护技术产生的复杂社会技术张力远远超出了技术实施层面。差分隐私机制可能会以不成比例地影响代表性不足群体的方式降低模型准确性,从而在隐私和公平目标之间产生冲突。这些挑战需要持续的利益相关者参与,详见第 16.7.3 节,组织必须在数据控制、个性化和合规性等相互竞争的价值观中进行导航。当考虑到用户权利和数据治理的动态性质时,这些隐私挑战变得更加复杂。

机器遗忘

上述隐私机制保护数据在收集和训练期间的安全,但它们未解决一个时间维度的问题:当用户行使其合法权利要求遗忘其数据时,在该数据上训练的模型仍在其学习到的参数中保留其影响。即使原始数据已从存储系统中删除,隐私侵犯依然持续存在。机器遗忘解决了隐私的这一时间维度,确保数据删除权利不仅延伸至数据库,还延伸至模型本身。

隐私保护并不止步于训练阶段。在许多实际系统中,用户可能有权撤销同意或请求删除其数据,即使模型已训练并部署(欧洲议会和欧盟理事会 2016;加利福尼亚州立法机关 2023)。支持这一要求引入了一个核心技术挑战:在不完全重新训练的情况下,从训练好的模型中移除特定数据点的影响,这在算力、存储和连接受限的边缘、移动或嵌入式部署中往往不可行。

传统的数据删除方法假设完整的训练数据集仍可访问,并且模型在移除目标记录后可以从头重新训练。图 16.8 对比了传统模型重训练与机器遗忘方法:重训练涉及使用修改后的数据集从头重建模型,而遗忘旨在不重复整个学习过程的情况下移除特定数据点的影响。

![图 16.8:模型更新策略](https://github.com/OpenDocCN/dsai-notes-pt3-zh/tree/master/docs/hav-cs249r-mlsys-vol2/img/file379.svg)

在具有严格延迟、算力或隐私约束的系统中,重训练与遗忘的区别变得至关重要,因为全量重训练的底层假设在实践中很少成立。许多部署的机器学习系统出于安全、合规或成本考虑,并不保留原始训练数据。在这样的环境中,全量重训练通常不切实际且会造成操作中断,特别是当数据删除必须是可验证的、可重复的和可审计的时。

机器遗忘与对抗鲁棒性

机器遗忘旨在解决这一限制,即在不完全重新训练模型的情况下,移除单个数据点对已训练模型的影响 (Cao and Yang 2015)。Cao 和 Yang 首先将该问题形式化,提出了一种通用方法,将学习算法转化为求和形式,从而仅通过重新训练包含目标信息的组成模型,而非整个模型,实现了高效的数据影响移除。以 Cao 和 Yang 的表述及 SISA 式训练为代表的方法,通过调整内部参数、修改梯度路径,或隔离并剪枝模型组件来近似这种行为,使得最终预测反映未包含已删除数据时的学习结果 (Bourtoule et al. 2021)。这些技术可能需要简化的模型架构、额外的追踪元数据,或在模型准确性和稳定性上做出妥协。它们还引入了验证方面的新负担:如何证明删除已以有意义的方式发生,尤其是在模型内部状态不可完全解释的情况下。

对数刻度下的两级成本阶梯。顶层,完全重新训练耗资 460 万美元;底层,SISA 分片遗忘耗资 4.6 万美元,约便宜 100 倍。

SISA 遗忘比完全重新训练便宜约 100 倍。

用户针对一个基于 1 TB 数据训练的模型,援引 GDPR 第 17 条(“擦除权”)。

基线(完全重新训练):在此规模场景下,一个 GPT-3 量级的 1750 亿参数模型在 1024 块 A100 GPU 上重新训练约 34 天,成本约 460 万美元。

工程修复(SISA):分片、隔离、切片与聚合训练将数据划分为 K=100 个独立分片,训练 100 个子模型。要删除一个数据点,只需重新训练包含该数据点的特定分片(1% 的数据)。新成本:4.6 万美元。耗时:约 8.2 小时。

权衡:准确率下降 3%-7%,因为每个子模型看到的数据变少了。推理变慢,因为预测必须跨 100 个子模型进行聚合。对于每天接收 1000 次擦除请求的集群,SISA 将遗忘从“经济上不可能”转变为“可管理的运营成本”——代价是模型质量。

机器遗忘的动机因监管框架而得到强化。根据《通用数据保护条例》(GDPR)、《加州消费者隐私法案》(CCPA)及其他司法管辖区的类似法规,删除权或擦除权可能产生压力,要求对训练中使用的个人数据负责 (European Parliament and Council of the European Union 2016; California Legislature 2023)。机器遗忘是一项技术策略,旨在减少或移除已删除记录的影响,因为模型状态本身可能保留个人数据,但法律要求取决于具体情境,并非普遍要求对每个模型进行强制性重新训练。生成式模型复现个人内容或版权数据的高调事件,凸显了将感知删除机制集成到负责任系统设计中的现实紧迫性。

从系统角度看,机器遗忘引入了非同小可的架构和运营要求。系统必须能够追踪数据血统,包括哪些数据点对特定模型版本有贡献。这通常需要结构化的元数据捕获和训练流水线插桩。此外,系统必须支持面向用户的删除工作流,包括认证、提交和删除状态反馈。验证可能需要维护版本化的模型注册表,以及确认更新后的模型不再表现出已删除数据残留影响的机制。这些操作必须跨越数据存储、训练编排、模型部署和审计基础设施,并能抵御故障或回滚。

资源受限的部署进一步放大了这些挑战。TinyML 系统通常运行在无持久存储、无连接且模型高度压缩的设备上。一旦部署,它们无法针对删除请求进行更新或重新训练。在此类设置中,机器遗忘在部署后实际上不可行,必须在初始模型开发阶段通过静态数据最小化和保守的泛化策略来强制执行。即使在基于云的系统中,重新训练更易处理,遗忘也必须应对分布式训练流水线、跨服务复制,以及跨模型快照和日志同步删除的困难。

尽管存在这些挑战,机器遗忘对于负责任的系统设计变得愈发重要。随着机器学习系统变得更加嵌入式、个性化和自适应,撤销训练影响的能力成为维护用户信任和满足法律要求的核心。关键在于,遗忘无法在部署后事后改造。它必须在架构和策略设计阶段加以考虑,从一开始就将血统追踪、重新训练编排和部署滚动更新的支持构建到系统中。

机器遗忘代表了隐私思维的转变,从保护收集了什么数据,转向控制这些数据继续影响系统行为多久。这种面向生命周期的视角为模型设计、基础设施规划和合规性带来了新挑战,同时也为更用户可控、透明和可适应的机器学习系统奠定了基础。负责任的 AI 系统还必须在具有挑战性的条件下(包括蓄意攻击)保持可靠行为。

对抗鲁棒性

对抗鲁棒性在第 14 章 (Chapter 14) 和第 13 章 (Chapter 13) 中作为针对蓄意攻击的防御进行了探讨,也是负责任 AI 部署的基础。除了防范恶意对手,对抗鲁棒性还能确保模型在遇到自然发生的变化、边缘情况和偏离训练分布的输入时,表现可靠。一个易受对抗扰动影响的模型,揭示了其学习表征中根本的脆弱性,这种脆弱性甚至会在非对抗场景下损害可信度。

机器学习模型,尤其是深度神经网络,已知易受微小、精心设计的扰动影响,导致预测显著改变。这些漏洞通过对抗样本的概念首次被形式化 (Szegedy et al. 2013),凸显了模型在精心策划的训练数据上的表现与在真实世界变异性下的行为之间的鸿沟。一个在干净输入上可靠运行的模型,可能在面对仅略微偏离其训练分布的输入时失效,这种差异人类难以察觉,却足以改变模型输出。NIST 的对抗机器学习分类法将这些故障视为更广泛的攻击与缓解格局的一部分,后者还包括投毒、隐私攻击、攻击者能力和生命周期阶段 (Vassilev et al. 2025)。

负责任 AI 系统中的鲁棒性与验证

对抗攻击的现实影响

威胁已超越理论层面。对抗样本已被用于操纵真实系统,包括内容审核管道(Bhagoji 等人 2018)、广告拦截检测(Tramèr 等人 2019)和语音识别模型(Carlini 等人 2016)。在自动驾驶或医疗诊断等安全关键领域,即使是罕见故障也可能导致高后果结果,损害用户信任或为恶意利用敞开攻击面。

图 16.9:对抗扰动

图 16.9:对抗扰动:一种精心设计的噪声模式,加到猪的原始图像上,会生成一张新图像,该图像在视觉上人类无法察觉差异,却能导致机器学习模型以高置信度误分类。来源:Microsoft。

根本原因:架构失配

从根本上说,对抗脆弱性源于模型假设与部署条件之间的架构失配。许多训练管道假设数据是干净、独立且同分布的。相比之下,部署系统必须在不确定性、噪声、领域偏移和可能的对抗篡改下运行。在此语境下,鲁棒性不仅包含抵抗攻击的能力,还包含在退化或不可预测条件下保持行为一致的能力。

训练时防御

对抗训练

提升鲁棒性始于训练阶段。对抗训练是一种广泛研究的技术,它用扰动样本增广训练数据(Madry 等人 2018)。Madry 及其同事将对抗训练表述为一个极小极大优化问题,利用 Projected Gradient Descent (PGD)⁴¹⁶ 生成的对抗样本训练模型。

对抗训练为鲁棒优化提供了一个原则性框架,已成为该领域的基石。它有助于模型学习更稳定的决策边界,但通常会增加训练时间并降低干净数据上的准确率。大规模实施对抗训练还对数据预处理管道、模型检查点基础设施和验证协议提出了要求,以适应扰动输入。

架构修改

架构修改也能促进鲁棒性。约束模型的 Lipschitz 常数⁴¹⁷、正则化梯度敏感度或强制表征平滑的技术,可使预测更稳定。

这些设计变更必须与模型的表达需求和底层训练框架兼容。例如,对于输入精度有限的嵌入式系统,或必须遵守安全关键阈值的场景,平滑模型可能更受青睐。

推理时策略

感知不确定性的决策

推理时,系统可实施感知不确定性的决策。当置信度低时,模型可拒绝预测,或将不确定输入路由至后备机制,如基于规则的组件或人工介入系统。这些策略要求部署基础设施支持后备逻辑、用户升级工作流或可配置的拒绝策略。例如,若模型置信度低于指定阈值,移动诊断 App 可能会返回“结果不确定”,而非给出潜在有害的预测。

部署后监控

监控基础设施在部署后维护鲁棒性方面发挥关键作用。分布偏移检测、异常追踪和行为漂移分析,使系统能识别鲁棒性随时间退化的情况。实施这些能力要求持久记录模型输入、预测和上下文元数据,并建立安全通道以触发重训练或升级。这些工具自身引入系统开销,必须与遥测服务、告警框架和模型版本控制工作流集成。

形式化与替代防御

认证防御

除经验性防御外,形式化方法提供更强保证。认证防御⁴¹⁸(如随机平滑 Cohen 等人 2019)提供概率性保证:模型输出在有界输入区域内将保持稳定。

输入预处理

更简单的防御如输入预处理,通过降噪、压缩或归一化步骤过滤输入以移除对抗噪声。这些变换必须足够轻量以支持实时执行,尤其是边缘部署,同时须足够鲁棒以保留任务相关特征。

集成建模

另一种方法是集成建模,聚合多个多样化模型的预测。这虽增强鲁棒性,但增加推理管道复杂度、内存占用,并使部署和维护工作流复杂化。

系统约束与可行性

延迟、内存、功耗预算和模型更新节奏等系统约束,强烈制约哪些鲁棒性策略可行。对抗训练增加模型体积和训练时长,可能挑战 CI/CD 管道并增加重训练成本。认证防御要求计算余量和推理时间容忍度。监控需要日志基础设施、数据保留策略和访问控制。终端侧和 TinyML 部署尤其往往无法容纳运行时检查或动态更新。此类情况下,鲁棒性须静态验证并编译时嵌入。

整体鲁棒性

鲁棒性源于训练、模型架构、推理逻辑、日志记录和后备路径的协同。孤立来看鲁棒的模型,若部署在缺乏监控或接口防护的系统中,仍可能失效。反之,甚至部分鲁棒的模型,若嵌入可检测不确定性、限制不可信输入暴露、并在出错时支持恢复的架构中,仍能提升整体系统可靠性。因此负责任设计会预判模型在真实压力下的失效模式,并构建使这些失效可被检测、可恢复且安全的基础设施。

验证方法

若检测识别出问题、缓解试图修复,则验证为利益相关者提供证据,以理解并审计系统是否安全部署。这构成负责任 AI 生命周期的第三支柱。不同于将性能压缩为单一标量指标的标准准确率评估,负责任验证是一个多利益相关者过程,在约束条件下审视系统行为。不同利益相关者需要不同证明:开发者需要粒度调试工具隔离失效模式,审计师需统计证据证明无歧视以合规,监管者要求正式一致性评估,最终用户要求针对具体决策的可行动解释。证据包可含公平性审计、隐私预算检查、对抗及分布偏移测试、解释保真度检查,以及与部署变更挂钩的再验证触发器。

可解释性与可理解性

这种严格验证的工程成本是巨大的。一个包含公平性审计、对抗鲁棒性测试和可解释性验证的综合验证体系,会大幅延长模型评估阶段。这项投资是合理的,因为它转移了成本的发生位置:部署前验证中发现的问题会在发布前得到修复,而相同问题若在生产环境中暴露,其修复成本会高出几个数量级,因为已部署的公平性或安全性缺陷必须被检测到、在整个集群中回滚,并向用户和监管机构解释,而不是仅在笔记本中修复。因此,验证不是 one-time gate(一次性关卡),而是 continuous process(持续过程)。通过初始验证的模型,随着数据分布的变迁可能会陷入不合规状态,这就需要在部署流水线中设置自动化的重新验证触发器(第 12 章)。

表 16.5 按风险类别总结了证据包。该表不是一个单独的清单;它是一种在部署前使残余风险显性化的方式。

| 风险类别 | 证据工件 | 运营责任人 |

| --- | --- | --- |

| 公平性 | 分层指标、阈值、置信区间 | 产品负责人和模型风险评审员 |

| 隐私 | 隐私预算、删除证据、保留和访问日志 | 数据治理和隐私工程团队 |

| 鲁棒性 | 漂移测试、损坏测试、金丝雀测试、红队探测 | ML 平台和事故响应团队 |

| 可解释性 | 保真度测试、稳定性检查、救济文档 | 模型团队和面向用户的运营团队 |

| 治理 | 批准记录、残余风险责任人、重新验证触发器 | 评审委员会或问责发布授权方 |

表 16.5:按风险类别划分的验证证据:负责任的验证结合了多种证据,因为没有单一指标能证明系统可以安全部署。每个风险类别都需要可衡量的工件和运营责任人。

最显眼且计算量最大的验证形式是可解释性。虽然公平性指标提供了聚合的统计保证,但可解释性提供了实例级验证,允许用户和操作员核实为何做出某个特定决策。这弥合了统计正确性与个体信任之间的鸿沟。

可解释性与可理解性

使用传统基于规则系统的贷款官可以准确地告诉申请人为何被拒绝:“您的债务收入比超过 40%。” 然而,神经网络则基于数百万次稠密矩阵乘法输出拒绝决策。可解释性和可理解性是用于打开这个黑箱的工程技术,使我们能够为每一个高风险的自动化决策生成有数学依据、人类可读的理由。

可解释性在系统验证、错误分析、用户信任、法规遵从和事故调查中发挥着核心作用。在医疗、金融服务和自主决策系统等高风险领域,解释有助于判断模型是基于合理理由还是虚假相关性做出决策。例如,可解释性工具可能揭示诊断模型对图像伪影而非医学特征过度敏感,这是一种否则可能无法被发现的失效模式。根据 GDPR 风格的访问和告知条款,对于符合条件的自动化决策,系统可能需要提供关于所涉及逻辑的有意义信息,这加强了对解释的系统性支持需求。

背景:2019 年,苹果和高盛因知名科技领袖(包括史蒂夫·沃兹尼亚克)报告称,尽管财务共享且信用状况相当,他们获得的信用额度却比配偶高 10 倍,而面临强烈的公众审视(纽约州金融服务部 2021)。

失效模式:争议的核心在于加剧了这种差距的工程失效:当客户致电询问为何被拒绝时,支持人员无法回答。算法没有提供救济、没有解释,也没有申诉机制。

后果:纽约州金融服务部进行了调查,认定苹果信用卡和高盛不存在公平借贷违规,但该事件仍暴露了感知到的不透明、糟糕的客户支持和有限的救济渠道,如何破坏对高风险自动化信贷决策的信任。

系统教训:可解释性充当客户服务接口,而不仅仅是调试工具。一个无法解释其高风险决策的系统在操作层面上是脆弱的,无论其聚合准确率如何。当客户无法理解或质疑结果时,解释层的缺失会将聚合模型决策转变为声誉和治理危机。

可解释性方法大体上可根据其作用时机和与模型结构的关系进行分类。事后方法在训练后应用,将模型视为黑箱。这些方法不需要访问模型内部权重,而是从模型行为中推断影响模式或特征贡献。常见的事后技术包括特征归因方法,如输入梯度、积分梯度[⁴¹⁹](Sundararajan 等 2017)、GradCAM[⁴²⁰](Selvaraju 等 2017)、LIME(Ribeiro 等 2016)和 SHAP(Lundberg 和 Lee 2017)。Sundararajan 及其同事通过确定两个基本公理——灵敏度和实现不变性——引入了积分梯度,归因方法应满足这些公理,并证明大多数先前方法违反了这些性质。

事后方法广泛应用于图像和表格领域,其中解释可渲染为显著性图或特征排名。为了说明 SHAP 归因在实践中如何工作,考虑一个训练好的随机森林模型,基于三个特征预测贷款审批(approve = 1deny = 0):income(收入)、debt_ratio(负债率)和 credit_score(信用评分)。对于一位被拒绝的特定申请人,收入 45,000 美元,负债率 0.55(55% 的收入用于偿债),信用评分 620,模型以 0.92 的概率预测拒绝。基于合作博弈论中的 Shapley 值,SHAP 值衡量每个特征将预测从基线(所有训练数据的平均预测,Pr(approve) = 0.50)移动到这一个体预测的贡献。

SHAP 框架[⁴²¹]通过在所有可能的特征子集上评估模型来计算每个特征的贡献。从 0.50 的基线预测开始,加入收入(45K,略低于平均)会使批准概率降低 0.05。

加入 debt_ratio(0.55,较高)会使批准概率额外大幅降低 0.25。加入 credit_score(620,低于阈值)会使批准概率中等程度降低 0.12。最终预测变为 0.50 − 0.05 − 0.25 − 0.12 = 0.08,对应 Pr(deny) = 0.92。这表明高负债率对拒绝的贡献最大(-0.25),其次是低于平均的信用评分(-0.12),而收入影响极小(-0.05)。此类解释具有可操作性:将负债率降至 40% 以下可能会扭转决策。

然而,这种严谨性伴随着巨大的计算成本。这个 3 个特征的示例需要评估 2³ = 8 个特征子集。对于拥有 20 个特征的模型,精确枚举需要 2²⁰ ≈ 100 万 次子集评估。基于树模型的 SHAP 实现利用模型结构将其降低到多项式时间,但深度学习模型通常需要基于采样估计的近似算法(KernelSHAPDeepSHAP)。虽然 SHAP 提供了理论上有依据的、可加性的特征归因,并满足理想属性(局部准确性、缺失性、一致性),但这些成本使得 SHAP 在没有近似、缓存或异步服务策略的情况下,难以用于高吞吐系统的实时解释。

另一种事后解释方法涉及反事实解释⁴²²,它描述了如果以特定方式修改输入,模型的输出将如何变化。这些在面向决策的应用中尤为相关,例如信贷或招聘系统。例如,反事实解释可能会指出:如果申请人的申报收入更高或债务更低,他们本会获得贷款批准 (Wachter et al. 2017)。反事实生成需要访问领域特定的约束和真实的数据流形,这使得其集成到实时系统中变得具有挑战性。

第三类技术依赖于基于概念的解释,旨在将学习到的模型特征与人类可解释的概念对齐。例如,TCAV 将用户定义的概念表示为概念激活向量,并测试模型预测在其内部表示中对这些概念的敏感程度 (B. Kim et al. 2018)。这些方法在领域专家期望用熟悉的语义术语获得解释的领域特别有用。然而,它们需要带有概念标注的训练数据或用于概念检测的辅助模型,这引入了额外的基础设施依赖。

虽然事后方法灵活且广泛适用,但它们也有局限性。因为它们是在事后近似推理,可能会产生看似合理但具有误导性的基本原理。它们的有效性取决于模型平滑度、输入结构和解释技术的保真度。这些方法通常最适用于探索性分析、调试或面向用户的摘要,而不作为内部逻辑的权威说明。

相比之下,固有可解释模型在设计上就是透明的。示例包括决策树、规则列表、带单调性约束的线性模型和 k-近邻分类器。这些模型直接暴露其推理结构,使利益相关者能够通过一组可解释的规则或比较来追踪预测。在再犯预测或医疗分诊等受监管或安全至关重要的领域,即使以牺牲一些准确性为代价,也可能更倾向于使用固有可解释模型 (Rudin 2019)。然而,这些模型通常难以很好地扩展到高维或非结构化数据,且其简单性可能限制在复杂任务中的性能。

图 16.10 可视化了不同模型类型沿谱系的相对可解释性:决策树和线性回归在设计上提供透明度,而神经网络和卷积模型等更复杂的架构需要外部技术来解释其行为。这种区别对于根据给定应用选择合适的模型至关重要,特别是在监管审查或利益相关者信任至关重要的场景中。

图 16.10:模型可解释性谱系:固有可解释模型(如线性回归和决策树)提供透明的推理,而复杂模型(如神经网络)需要事后解释技术来理解其预测。这一区别基于应用需求指导模型选择,在受监管领域或利益相关者信任很重要时优先考虑透明度。

混合方法旨在将深度模型的表达能力与可解释组件的透明度相结合。例如,概念瓶颈模型 (Koh et al. 2020) 首先预测中间的可解释变量,然后使用简单的分类器生成最终预测。ProtoPNet 模型 (Chen et al. 2019) 通过将示例与学习到的原型进行比较来进行分类,为用户提供视觉类比以理解预测。这些混合方法在需要部分透明度的领域很有吸引力,但它们引入了新的系统设计考量,例如存储和索引学习到的原型以及在推理时呈现它们的需求。

Olah 等人和 Geiger 等人的工作将机制可解释性应用于逆向工程神经网络的内部操作。这一研究方向受程序分析和神经科学启发,试图将神经元、层或激活模式映射到特定的计算功能 (Olah et al. 2020; Geiger et al. 2021)。许多示例聚焦于传统可解释性工具不足的大型基础模型,但系统层面的义务更为广泛:检测工具、存储和因果测试必须使内部机制可审计。

从系统角度来看,可解释性引入了许多架构依赖。解释必须在系统约束内生成、存储、呈现和评估。所需基础设施可能包括解释 API、用于存储归因图的内存、可视化库以及捕获模型中间行为的日志机制。模型通常必须添加钩子或配置为支持重复评估,特别是对于需要采样、扰动或反向传播的解释方法。

Exact SHAP subset evaluations explode from 3 to 20 features.

Exact SHAP cost explodes with feature count.

这些需求直接与部署约束相互作用,并施加必须纳入系统设计的性能成本。SHAPLIME 可能需要重复的模型评估、扰动采样、代理模型拟合或子集枚举,而反事实方法需要约束优化 (Lundberg and Lee 2017; Ribeiro et al. 2016; Wachter et al. 2017)。在生产部署中,这些成本转化为具体的架构选择:解释可能需要异步工作进程、采样解释率、缓存,或部分因可解释性而选择的独立模型。

对于资源受限环境,基于梯度的归因方法通过复用训练时的反向传播基础设施提供了更高效的替代方案。然而,这些方法对于复杂模型的可靠性较低,且可能在模型更新时产生不一致的解释。边缘部署通常通过预计算的规则近似或简化的决策边界来实现可解释性,牺牲解释保真度以换取可行的延迟配置。

存储需求

存储需求也会随解释需求显著增长。为表格数据存储 SHAP 值每个特征每次预测约需 4–8 字节,因此对于每天记录 100 万次预测的系统,月度存储量为 3000 万次预测乘以特征数量再乘以 4–8 字节。图像的梯度归因图根据分辨率不同,每个解释可能需要 1–10 MB;若以同样的每天 100 万次的速率记录每个图像解释,除非对解释进行采样、压缩或缩短保留窗口,否则每月大致需要 30–300 TB。这些数据量要求谨慎的数据生命周期管理和保留策略。

跨机器学习生命周期的可解释性

可解释性贯穿整个机器学习生命周期。在开发阶段,可解释性工具用于数据集审计、概念验证和早期调试。在推理阶段,它们支持问责制、决策验证和用户沟通。部署后,解释可能被记录、在审计中呈现,或在错误调查期间被查询。系统设计必须支持这些阶段中的每一个,确保解释工具集成到训练框架、模型服务基础设施和面向用户的应用程序中。

压缩与优化的影响

压缩和优化技术也会影响可解释性。剪枝、量化和架构简化常用于 TinyML 或移动端场景,但可能扭曲内部表示或阻断梯度流,降低基于归因的解释的可靠性。在这种情况下,必须在优化后验证可解释性,以确保其仍然有意义且可信。如果解释质量很重要,这些转换必须被视为设计约束空间的一部分。

面向可解释性的设计

因此,可解释性落地的方式与本章其他属性相同:它是预算内的服务路径基础设施,而非模型工作后附加的功能。面向可解释性的设计需要仔细决策:谁需要解释、什么样的解释有意义,以及如何在系统的延迟、算力和接口预算下交付这些解释。随着机器学习嵌入关键工作流,解释能力成为安全、可信和可问责系统的核心要求。

社会技术挑战

可解释性的社会技术挑战集中在技术解释与人类理解之间的鸿沟。虽然算法可以生成特征归因和梯度图,但利益相关者往往需要与其心智模型、领域专业知识和决策过程相一致的解释。审查 AI 生成诊断的放射科医生,需要引用医学概念和视觉模式的解释,而非抽象的神经网络激活。这种转化挑战要求技术团队与领域专家持续协作,开发出既技术准确又实用有意义的解释格式。解释可能以意想不到的方式塑造人类决策,给解释性信息的呈现和解读带来新的责任。由于解释是证据而非控制动作,它们必须反馈给监控系统,以检测部署后负责任行为是否发生变化。

模型性能监控

无论训练时的评估多么严格,都无法保证模型部署后的可靠性能。现实环境是动态的:输入分布因季节性而漂移,用户行为因系统输出而演变,情境期望随政策或法规而变化。这些因素可能导致预测性能和系统可信度随时间下降。在训练或验证条件下表现良好的模型,在生产环境中仍可能做出不可靠或有害的决策。

此类漂移的影响不仅限于原始准确性。如果子群分布相对于训练集发生偏移,或先前与结果相关的特征在新情境中变得不可靠,公平性保证可能失效。可解释性需求也可能演变,例如当新的利益相关者群体寻求解释,或监管机构引入新的透明度要求时。因此,可信度并非训练时赋予的静态属性,而是由部署情境和运营反馈塑造的动态系统属性。

为确保长期负责任的行为,机器学习系统必须包含持续监控、评估和纠正行动的机制。监控不仅涉及跟踪聚合准确性;它要求跨相关子群呈现性能指标、检测输入分布偏移、识别异常输出并捕获有意义的用户反馈。这些信号必须与围绕公平性、鲁棒性和透明度的预定义期望进行比对,并关联到可执行的系统响应,如模型重新训练、重新校准或回滚。

实施有效的监控依赖于稳健的基础设施。系统必须以结构化且安全的方式记录输入、输出和上下文元数据,供持续的可观测性管道使用(图 16.11)。

公平性监控管道

图 16.11:公平性监控管道:面向已部署模型的端到端可观测性。模型预测跨人口统计细分进行子群指标计算;阈值检查识别性能或公平性退化;警报触发自动重新训练或人工审查。此持续反馈循环确保负责任 AI 属性在部署后得到维护。

这需要遥测管道捕获模型版本、输入特征、预测置信度和推理后反馈。这些日志支持漂移检测,并为公平性和鲁棒性的事后审计提供证据。监控系统还必须与警报、更新调度和策略审查流程集成,以支持及时且可追溯的干预。

监控还支持反馈驱动的改进。例如,重复的用户分歧、纠正请求或操作员覆盖可能预示着有问题的行为。这些反馈必须被聚合、验证并转化为对训练数据集、数据标注流程或模型架构的更新。然而,此类反馈循环也有风险:有偏的用户响应可能引入新的不公平,过度记录可能损害隐私。设计这些循环需要用户体验设计、系统安全和伦理治理之间的仔细协调。

负责任 AI 监控规模

负责任 AI 监控本身成为一个生产数据系统。

规模化生产环境下的负责任 AI 监控

在全球生产车队的规模下,负责任的 AI 监控成为一个巨大的数据工程挑战。一个平台每天服务约 8.64 亿次推理,峰值 10,000 QPS,覆盖 50 个不同的人口统计学子群,必须持续跟踪至少 150 个指标(例如,每个群体的假阳性率、真阳性率和校准误差)。即使采用 1% 的采样率,每天也会产生 864 万个监控事件。存储必要的元数据(预测输入、置信度分数、真实标签和敏感属性),按每条记录 200 字节估算,每天需要约 1.7 GB 存储空间,而完整的审计日志消耗会大得多。这种规模引入了一个元监控问题:监控基础设施本身成为一个复杂的分布式系统,必须保证可靠、安全且具成本效益。针对 150 个活跃指标,仅 5% 的标准误报率每天就会触发约 7.5 个虚假告警,导致严重的告警疲劳。因此,有效的监控需要智能聚合、分层告警逻辑和自动化根因分析,以区分真实的公平性漂移与统计噪声。

部署架构下的监控机制差异

监控机制随部署架构而异。

云端系统

在云端系统中,丰富的日志记录和计算能力支持实时遥测、定期公平性审计,并将新数据持续集成到再训练管道中。这些环境支持动态重配置和集中式策略执行。然而,遥测数据量可能在成本、隐私风险和法规合规性方面带来自身的挑战。

移动端系统

在移动端系统中,连接间歇且数据存储有限。监控必须轻量级且能抵御同步延迟。本地推理系统可异步收集性能数据并聚合传输至后端系统。隐私约束通常更严格,尤其是个人数据必须留在设备上时。这些系统需要谨慎的数据最小化和本地聚合技术,在保持可观测性的同时保护隐私。

边缘部署

边缘部署(如自动驾驶汽车、智能工厂或实时控制系统)要求低延迟响应,且在极少外部监督下运行。这些系统的监控必须嵌入运行时内部,对传感器完整性、预测置信度和行为偏差进行内部检查。这些检查通常需要低开销的不确定性估计、异常检测或一致性验证实现。系统设计者必须预判故障条件,确保异常行为触发安全回退程序或人工干预。

TinyML 系统

TinyML 系统运行在深度嵌入式硬件上,无连接、无持久存储、无动态更新路径,呈现最受限的监控场景。在这些环境中,监控必须在部署前设计并编译进系统。常用策略包括输入范围检查、内置冗余、静态故障转移逻辑或保守验证阈值。一旦部署,这些模型独立运行,任何部署后故障可能需要物理设备更换或固件级重置。

核心挑战

核心挑战是通用的:已部署的 ML 系统不仅要在初期表现良好,还必须随着环境变化持续负责任地运行。监控提供了将系统性能与伦理目标及问责结构关联的可观测层。没有监控,公平性和鲁棒性就会变得不可见;没有反馈,错位就无法纠正。因此,监控是让机器学习系统随时间保持自适应、可审计并与其预期目的对齐的运营基础。

监控部分闭合了技术闭环:偏差检测、差分隐私、对抗训练和可解释性为负责任 AI 实现提供了必要能力,但也揭示了一个根本局限。仅靠技术正确性无法保证有益结果。 请看三个具体例子:

  1. 公平性审计系统检测出贷款审批模型存在种族偏见,但组织缺乏解读结果或实施修正的流程。技术能力存在,组织惰性却阻碍了补救。

  2. 差分隐私提供了数据保护的形式化数学保证,但用户不理解这些保护,继续不当分享敏感信息。隐私方法按设计工作,行为语境却削弱了其有效性。

  3. 可解释性系统生成技术上准确的特征重要性分数,但受影响个体因界面设计和素养障碍无法获取或解读这些解释。

这些例子表明,负责任的 AI 实现依赖于技术能力与社会技术语境、组织激励、人类行为、利益相关者价值观和制度治理结构之间的对齐。维持这种对齐需要提供运营可观测性的监控机制。然而,生成式 AI 的出现改变了我们必须监控的“故障”本质。

生成式时代的责任

生成式 AI 不会取代上述的公平性、隐私和可解释性关切;它改变了控制面。操作员不再仅审计标签或特征归因,而必须治理提示词、检索上下文、奖励模型和开放式输出。

从判别式分类向生成式大语言模型(LLM)的转变,从根本上改变了责任的工程表面。公平性不再仅是标签组间的统计均价指标;它演变为生成式对齐,即在提示词组合爆炸的可能性下,约束开放式随机输出保持有益、无害、诚实的复杂优化问题。这要求从静态数据集策展动态行为塑造转型,通常通过多阶段对齐流程实现(图 16.12)。

图 16.12:基于人类反馈的强化学习(RLHF)对齐管线:生成式模型对齐的六阶段流程:(1) 预训练基座模型,(2) 基于演示的监督微调 (SFT),(3) 人类偏好收集,(4) 奖励模型训练,(5) 近端策略优化 (PPO) 训练,(6) 最终对齐模型。图中还标注了标签成本、计算开销、对齐税,以及三种 RLHF 失效模式(奖励黑客、内部目标错位、权力寻求行为)。

约 2022–2024 年大语言模型中常见的指令微调流水线,使用基于人类反馈的强化学习(RLHF)作为连接人类价值观与模型权重的社会技术桥梁

通过在人类偏好上训练奖励模型——在该场景中,5 万至 50 万次成对比较,每个标签成本为 0.50 美元至 5.00 美元——工程师有效地将主观判断编译成了一个可微分的损失函数。Proximal Policy Optimization (PPO) 是策略优化阶段,它在约束策略偏离监督基线程度的同时,依据该奖励模型更新模型。这一对齐过程引入了 对齐税,常表现为标准 NLP 基准测试中 2%–8% 的性能下降,因为模型用原始能力换取了安全约束。对人类标注员的依赖引入了 代表性差距:如果标注投资仅反映了狭窄的人群切片,由此产生的“对齐”模型将内在过拟合于该特定的文化或社会经济背景。Constitutional AI(宪法 AI)提供了一条替代工程路径,利用一组高层原则指导 AI 对自身输出的反馈,从而减少对大规模人工标注的依赖,并将价值观显式化在提示词中,而非隐式化在标注员池中。

在检索增强生成(RAG)架构中(第 10 章),责任与核心模型解耦

LLM 可能通过大量的 RLHF 实现了完美对齐,但如果检索层浮现了受污染的上下文,仍可能生成有毒或有偏见的回复。如果检索索引不成比例地浮现有偏见的历史文档,模型——被调整为忠实于其上下文——将传播这种偏见,无论其内部安全训练如何。这使得 上下文过滤 成为一个独立的基础设施组件,在检索到的文本块到达生成上下文窗口前,对其进行毒性和偏见验证。

在许多 LLM 服务栈中,系统提示词 与检索过滤、策略分类器、遥测和发布门控一起,作为一种早期配置控制运作

这些隐藏指令(例如,“你是一个乐于助人的助手。请勿提供医疗建议。”)定义了系统的操作边界。在 1 万个以上不同部署配置的规模下,管理这些提示词变成了一个分布式配置管理问题,类似于权重分发。对系统提示词的一次未版本化变更,都可能微妙地改变数百万次交互的伦理态势,这使得提示词版本控制、对齐回归测试和渐进式发布,对于安全而言,与模型训练过程本身同样关键(第 12 章)。

系统提示词和 RLHF 对齐共同构成了重要但脆弱的技术护栏

当这些护栏失效时,无论是通过蓄意越狱,还是绕过奖励模型的微妙边缘情况,现实变得清晰:AI 安全无法完全通过数学来解决。算法与使用它的人类之间复杂的社会技术动态,需要同等的关注。

社会技术动态

一家医院部署了一个高精度的败血症预测模型,但死亡率并未改善。医生因警报疲劳而不堪重负,直接无视了模型的预警。一个在数学上无瑕、完美公平、高度可解释的模型,当它与人类心理、组织激励或工作场所的运营现实错位时,在生产环境中仍会惨遭失败。

前几节的技术工具解决了定义明确的问题:检测偏见、保护隐私、生成解释。败血症案例标志着该工具箱的尽头。社会技术工程要求一种不同的推理模式:不再是优化目标函数,而是分析利益相关者冲突;不再是调整超参数,而是驾驭伦理权衡;不再是衡量技术性能,而是评估社会影响。系统现在必须同时满足计算约束和人类价值观,而任何数量的优化都无法解决两者之间的冲突。

部署的系统创造了重塑其建模环境的反馈循环,引入了人类和算法单独都无法解决的人机协作风险,并暴露了没有任何优化能满足的利益相关者价值冲突。这些动态决定了负责任的 AI 实施在实践中成败。

系统反馈循环

社会技术反馈不变量(原则 )捕捉了这一动态:部署的模型塑造了其运行的环境,使得未来的数据 pt + 1 成为模型过往决策 ft 的函数。此处,pt 表示系统在时间 t 观察到的输入分布,而 ft 表示作用于这些输入的已部署模型或决策策略。系统需要 闭环治理——可靠性要求对反馈循环建模,而不仅仅是前向推理。

机器学习系统不仅观察和建模世界;它们也塑造世界。一旦部署,其预测和决策往往会影响它们旨在分析的环境。这种反馈改变了未来的数据分布,修改了用户行为,并影响了机构实践,在模型输出和系统输入之间形成了一个递归循环(图 16.4)。随着时间的推移,这种动态可能放大偏见、固化差距,或无意中偏离模型原本设计服务的目标。

该现象有据可查的一个典型例子是预测性警务。当一个基于历史逮捕数据训练的模型预测某个社区犯罪率较高时,执法部门可能会向该区域派遣更多巡逻。这种增加的巡逻导致更多事件被记录,这些记录又被用作未来模型训练的输入,进一步强化了模型最初的预测。即使模型在一开始并无显性偏见,其融入反馈循环也会导致一种自我实现的模式,对已经过度被监管的社区产生不成比例的影响。

推荐系统在数字环境中表现出类似的动态。一个以参与度为优先的内容推荐模型,可能逐渐缩小用户接触内容的范围,导致强化现有偏好或两极分化观点的反馈循环。这些效应可能难以通过传统性能指标检测,因为系统持续优化其训练目标,甚至在偏离更广泛的社会或认识论目标时也是如此。

从系统视角看,反馈循环给负责任的 AI 提出了核心挑战。它们破坏了独立同分布数据的假设,并使公平性、鲁棒性和泛化性的评估复杂化。依赖静态测试集的标准验证方法,可能无法捕捉模型对数据生成过程不断演变的影响。一旦建立了此类循环,除非解决底层数据动态,否则旨在改善公平性或准确性的干预可能效果有限。

为应对反馈循环而设计负责任的系统,需要对机器学习系统采取全生命周期视角。这不仅要求随时间监控模型性能,还要求理解系统输出如何影响环境,这些变化如何被新数据捕获,以及再训练实践如何缓解或加剧这些影响。

反馈循环与系统风险

在基于云的系统中,这些更新可能会频繁且大规模地发生,并有广泛的遥测数据可用于检测行为漂移。相比之下,边缘和嵌入式部署通常在离线或可观测性有限的情况下运行。一个根据用户交互调整恒温器行为的智能家居系统,可能会以改变家庭环境的方式强化能源消费模式或舒适度偏好,进而影响模型未来的输入。如果没有连接性或集中监督,这些循环可能无法被识别,尽管它们会影响用户行为和系统性能。运维监控实践(包括漂移检测、性能跟踪和自动告警)对于检测和管理生产系统中的这些反馈动态至关重要。

系统必须配备机制来检测分布漂移、识别行为塑造效应,并支持与系统预期目标一致的纠正性更新。反馈循环本身并非有害,但必须被识别和管理。如果置之不理,它们会引入系统性风险;如果经过深思熟虑的处理,它们为学习系统在复杂、动态环境中负责任地适应提供了机会。

案例研究:Ofqual 算法标准化模型

背景:2020 年,由于 COVID-19 大流行导致 A-level 考试取消,Ofqual(英格兰资格监管机构)部署了一个算法标准化模型来分配成绩。该模型旨在应对成绩膨胀,利用学校的历史成绩分布来调整教师的个人预测(Ofqual 2020;Department for Education and Ofqual 2020)。

失效模式:虽然设计初衷是维持总体标准,但保留历史成绩分布的工程约束使许多个人结果与教师评估脱钩。历史上表现优异学校的学生更有可能看到预测成绩被保留,而历史成绩较弱学校的高分学生可能会被降级以符合学校的统计先验。

后果:该算法强制执行了一个反馈循环,即过去的机构表现制约了未来的个人结果。由此导致的信心丧失迫使政府和 Ofqual 几天内恢复使用中心评估成绩。

系统教训:在缺乏个人公平性约束(排名保留)的情况下,针对聚合统计属性(防止膨胀)进行优化,会创建一个数学上“正确”但社会灾难性的系统。

人机协作

人类操作员将反馈循环风险转化为共享控制问题。机器学习系统通常不是作为独立代理部署,而是作为涉及人类决策者的大型工作流中的组件。在医疗、金融和交通等许多领域,模型作为决策支持工具,提供预测、风险评分或建议,由人类操作员审查并采取行动。这种协作配置引发了关于人机之间责任如何共享、信任如何校准以及监督机制如何在实践中实施的问题。

人机协作既带来机遇也带来风险。设计得当时,系统可以增强人类判断、减轻认知负担并提高决策一致性。然而,设计不当可能导致自动化偏见⁴²³,即用户即使在存在明显错误的情况下也过度依赖模型输出。

相反,过度的不信任可能导致算法厌恶,即用户因缺乏透明度或感知可信度而忽视有用的模型预测。协作系统的有效性不仅取决于模型性能,还取决于系统如何传达不确定性、提供解释并允许人类覆盖或纠正。

自动化偏见往往通过制度结构中的不对称责任得到强化。在刑事司法或医疗等高风险领域,人类决策者面临的后果取决于他们是否同意算法。考虑两种场景:场景 A,法官推翻“高风险”算法评分并释放被告,后者随后再犯罪。法官因“无视科学”面临公众审查和潜在职业后果。场景 B,法官遵循“高风险”评分并不必要地拘留被告。责任被分散给算法(“系统这么说”)。

这种不对称造成了强烈的制度性顺从压力,人类监督变成了为避免个人责任而对算法决定的“橡皮图章”。负责任的 AI 设计必须通过保护行使判断的操作员、要求对“同意”正如对“不同意”进行辩护,来明确应对这一问题。

监督机制必须根据部署环境量身定制。在医疗分诊或自动驾驶等高风险领域,人类可能需要实时监督自动化决策。这种配置给人类操作员带来认知和时间要求,并假设在需要时能快速可靠地进行干预。然而在实践中,持续的人工监督通常不切实际或无效,特别是当操作员必须监控多个系统或缺乏明确的干预标准时。

从系统设计角度来看,支持有效监督不仅仅是提供原始模型输出的访问权限。界面必须构建为在正确的时间、以正确的格式、带有适当的上下文呈现相关信息。置信度评分、不确定性估计、解释和变更警报都能在启用人工监督方面发挥作用。工作流必须定义何时以及如何可能进行干预、谁有权覆盖模型输出,以及此类覆盖如何被记录、审计并纳入未来的系统更新。

考虑一个医院分诊系统,它使用机器学习模型对急诊科患者进行优先级排序。模型为每位来院患者生成风险评分,并呈现建议的分诊类别。原则上,人类护士负责确认或覆盖建议。然而,如果模型输出在没有充分理由的情况下呈现(例如贡献特征的解释或不确定性的背景),护士即使在边缘情况下也可能遵从模型。随着时间的推移,模型输出可能成为事实上的分诊决定,尤其是在时间压力下。如果发生分布漂移(例如由于新疾病或患者人口结构变化),护士可能既缺乏态势感知,也缺乏检测模型性能下降所需的界面支持。在这种情况下,人工监督的表象掩盖了一个责任实际上已转移给模型、却缺乏明确问责或补救措施的系统。

在这样的系统中,人工监督不仅仅是政策声明的问题,而是基础设施设计的函数:预测如何呈现、保留什么信息、如何实施干预,以及反馈循环如何将人类决策与系统更新联系起来。如果没有这些组件的整合,监督就会变得支离破碎,责任可能会不可见地从人类转移到机器。

放射科 AI 助手案例

考虑一个部署 AI 助手进行肿瘤检测的放射科部门。

  • 人类灵敏度S_human = 92%

  • AI 灵敏度S_AI = 95%

有人可能会假设组合系统的性能将超过 95%。然而,关于自动化偏见的研究表明,人类接受错误 AI 建议的比率高达 60%-80%。如果 AI 出错(概率 1 − S[AI] = 0.05)且人类盲目接受(α = 0.7),仅被接受的 AI 错误就会产生 0.05 × 0.7 = 0.035 的故障概率。在这个简化的上界情形下——假设每一个未被接受的 AI 错误都会被纠正——灵敏度为 96.5%;一旦加入人工覆盖错误、假阳性、疲劳和界面延迟,真实工作流程的表现可能会更差。

随着 AI 可靠性的提高,人类的警惕性会下降——这一现象被称为可靠性悖论

Two trend lines: model accuracy rises while the red human override rate falls.

较高的 AI 准确率反而可能降低人类的警惕性。

  • 在 AI 准确率为 90% 时,人工覆盖率可能为 R[override] = 15%

  • 在 AI 准确率为 99% 时,R[override] 降至 ≈ 2%

剩余 1% 的错误几乎永远不会被捕获,因为人类已将他们的信任校准到了“完美”机器上。这造成了信任校准鸿沟系统看起来越安全,其罕见故障就变得越危险。 负责任的设计要求引入摩擦——强迫人类为接受行为提供理由——以人为降低 α 并保持人在回路中。

决策支持与自动化之间的界限往往是流动的。最初旨在辅助人类决策者的系统,可能随着信任度的增加或组织激励的转变,逐渐承担更大的自主权。这种转变可能在没有明确政策变更的情况下发生,导致事实上的自动化却缺乏相应的问责结构。因此,负责任的系统设计必须预见随时间推移的使用变化,并确保即使对自动化的依赖增加,适当的检查机制依然到位。

人机协作需要模型能力、界面设计、操作政策和制度监管的审慎整合。协作不仅仅是插入一个“人在回路中”这么简单;这是一个跨越技术、组织和伦理维度的系统性挑战。为监督而设计,意味着嵌入允许干预、支持知情信任、并支持人类操作员与机器学习系统共担责任的机制。

规范多元主义与价值冲突

人机协作揭示了一个更深层的系统约束:不同利益相关者往往持有相互冲突的价值观和优先级。现实世界的 ML 部署迫使我们面对无法通过算法解决的价值张力。技术卓越是值得信赖的 AI 的必要条件,但并不充分,因为利益相关者对公平性、隐私和问责制持有合理但不同的概念,这些概念无法通过更好的算法来协调。

负责任的机器学习不能简化为单一目标的优化。在现实环境中,机器学习系统被部署在由多元且往往相互冲突的人类价值观塑造的环境中。高风险部署使这些张力具体化。

场景:一个团队为青少年构建了一款心理健康聊天机器人,利用 ML 检测危机情况并推荐干预措施。该系统必须平衡多个合法但不相容的目标:

医疗功效:基于循证实践优化最佳临床结果。这建议采取积极干预,一旦模型检测到潜在自残风险(即便置信度很低)即提醒父母、咨询师或急救服务,因为假阴性可能是致命的。

患者自主权:尊重青少年的隐私和能动性。许多青少年寻求心理健康支持,正是因为他们无法与父母或权威人物交谈。激进的通知政策可能会阻止脆弱的青少年使用该系统,使他们完全失去支持。

隐私保护:将数据收集和保留降至最低,以保护敏感的心理健康信息。这建议采用本地处理、不记录对话、不与第三方共享,但也阻止了系统通过学习交互来改进,或在模型不确定时进行人工审查。

资源效率:在计算和人工监管预算内运行。让人类咨询师介入每一个被标记的交互能提供更好的照护,但在大规模下成本高得难以承受。完全自动化的响应降低成本,但在复杂情况下可能提供不当指导。

法律合规:满足强制报告要求和责任标准。在许多司法管辖区,检测到迫在眉睫伤害的系统必须通知当局,无论临床判断认为通知是有益还是有害,都会覆盖患者自主权和隐私。

这些价值观并非可以通过更好的工程来协调的模糊需求。它们反映了关于系统应实现什么以及应优先考虑谁这一根本不同的概念。针对医疗功效优化(积极干预)直接与患者自主权(最小干预)冲突。隐私保护(不保留数据)与资源效率(从交互中学习)冲突。法律合规(强制报告)可能与临床功效(基于信任的治疗关系)冲突。

没有任何算法能决定哪个价值应占主导。不同利益相关者持有合理但不同的立场:临床医生可能优先考虑功效,青少年可能优先考虑自主权,律师可能优先考虑合规,预算官员可能优先考虑效率。技术团队必须促进利益相关者的审议,以确定在特定语境下哪些权衡是可以接受的,这是一个根本上属于规范性的决策,先于并约束技术优化。

系统启示:负责任的 AI 权衡是系统需求,而非事后的政策备注。部署架构必须在优化开始前就编码利益相关者的选择。

对某一利益相关者而言公平的结果,在另一利益相关者眼中可能被视为不公平。同样,优先考虑准确性或效率的决策可能与透明度、个人自主权或减少伤害等目标相冲突。这些张力并非偶然;它们是结构性的。它们反映了机器学习系统所嵌入的社会的多元本质,以及它们被部署的制度环境的多元本质。

公平性是价值冲突的一个特别突出的领域。公平性可以用多种方式形式化,但这些方式往往相互不相容。满足人口统计学平等的模型可能违反均等几率;优先考虑个体公平的模型可能破坏群体层面的平等。在这些定义中做出选择并非纯粹的技术决策,而是一个规范性决策,需结合领域语境、歧视的历史模式以及受模型结果影响人群的观点来判断。在实践中,包括工程师、用户、审计员和监管机构在内的多方利益相关者,可能对哪些定义最合适及其原因持有相互冲突的看法。

价值冲突超越了公平性本身。可解释性与预测性能、隐私与个性化、短期效用与长期后果之间也存在冲突。这些权衒因系统部署架构的不同而以不同方式显现,揭示了价值冲突与 ML 系统的设计和运行有多么深刻的关联。

考虑一个部署在移动设备上的语音助手。为了增强个性化,系统可能会在本地学习用户偏好,而无需将原始数据发送到云端。这种设计提高了隐私保护并降低了延迟,但如果使用模式未被充分代表的用户收到的预测准确性或响应性较差,也可能导致性能差异。改善公平性的一种方法是使用群体级统计数据集中更新,但这样做会引入新的隐私风险,并可能违背用户对本地数据处理的预期。在此,设计必须在隐私、公平性和个性化这些有效但相互竞争的价值观之间进行权衡。

在基于云的部署中,例如信用评分平台或推荐引擎,透明度与专有保护之间经常产生张力。最终用户或监管机构可能要求清楚解释决策的原因,特别是在后果重大的情况下,但所使用的模型可能依赖于复杂的集成或专有训练数据。披露这些内部细节可能涉及商业敏感信息,或在技术上不可行。在这种情况下,系统必须协调机构问责制与商业保密性之间相互竞争的压力。

在边缘系统中,例如家庭安防摄像头或自主无人机,资源限制通常决定模型选择和更新频率。优先考虑低延迟和能效可能需要部署压缩或量化模型,但这些模型对分布偏移或对抗性扰动的鲁棒性较差。更有弹性的模型可以提高安全性,但可能会超出系统的内存预算或违反功耗限制。在此,安全性、效率和可维护性必须在硬件施加的权衡下取得平衡。效率技术和优化方法对于在资源受限环境中实施负责任的 AI 至关重要。

在 TinyML 平台上,模型被部署到没有持久连接的微控制器上,权衡更为显著。系统可能针对固定数据集上的静态性能进行优化,但一旦部署,无法纳入新的公平性约束、基于更新的输入进行重新训练或生成解释。硬件限制从根本上决定了在资源受限设备上哪些负责任的 AI 实践是可行的。价值冲突不仅限于模型优化什么,还延伸到系统部署后能支持什么。

反复出现的系统约束是 规范性多元主义,而非抽象的哲学挑战。多目标优化、约束训练和公平性感知评估等技术方法有助于呈现和形式化权衡,但它们不能消除对判断的需求。关于代表谁的价值观、减轻哪些危害以及如何平衡相互竞争的目标,这些决策无法通过算法做出。它们需要审议、利益相关者输入以及超越模型本身的治理结构。

参与式设计和价值敏感设计方法提供了潜在的前进路径。这些方法不将价值观视为部署后待优化的参数,而是寻求在需求阶段就让利益相关者参与,明确定义伦理权衡,并追踪它们如何在系统架构中具体化。虽然没有任何设计过程能同时满足所有价值观,但那些对其权衡保持透明且开放修订的系统,更有利于长期维持信任和问责制。

机器学习系统并非中立工具。它们嵌入并体现了价值判断,无论这些判断是显式指定还是隐性假设。对负责任 AI 的承诺要求承认这一事实,并构建能够反映并响应其运行环境中伦理和社会多元主义的系统。

透明度与可争议性

只有当利益相关者能够理解并质疑系统决策时,价值冲突才变得可治理。透明度使用户、开发者、审计员和监管机构能够了解系统如何运行,评估其局限性,并识别危害来源。然而,仅靠透明度是不够的。在高风险领域,个人和机构不仅必须理解系统行为;在必要时,他们还必须能够质疑、纠正或撤销它。这种 可争议性 能力——即质疑和抗辩系统决策的能力——是问责制的一个重要特征。

机器学习系统中的透明度通常侧重于披露:揭示模型如何训练、依赖什么数据、设计中嵌入了什么假设,以及已知的什么限制影响其使用。模型卡和数据集数据表等文档工具通过以结构化、可复现的格式形式化系统元数据来支持这一目标。这些资源可以改善治理、支持合规并告知用户预期。然而,作为披露的透明度并不保证有意义的控制。即使技术细节可用,用户可能缺乏制度支持、界面工具或程序化途径来抗辩对其造成不利影响的决策。

要从透明度迈向可争议性,机器学习系统必须设计具备解释、救济和反馈机制:

  • 解释:系统提供针对接收者需求和语境的可理解输出理由。

  • 救济:个人可以改变其情况并获得不同的结果。

  • 反馈:用户可以报告错误、争议结果或发出担忧信号,这些信号可纳入系统更新或监督流程。

在实践中,这些机制往往缺失,特别是在大规模部署或嵌入低资源设备的系统中。例如,在移动贷款申请系统中,用户可能在没有解释的情况下收到拒绝通知,且没有机会提供额外信息或申诉。即使其他地方存在文档,界面层面缺乏透明度也使系统实际上不可抗辩。同样,临床环境中部署的预测模型可能生成指导治疗决策的风险评分,却不向医生展示底层推理。如果模型对特定患者亚群表现不佳,且这种行为不可观察或不可争议,结果可能是无法轻易诊断或纠正的非故意伤害。

从系统角度来看,实现可争议性需要跨技术和制度组件的协调。模型必须暴露足够信息以支持解释。界面必须以可用且及时的方式呈现这些信息。组织流程必须到位,以审查反馈、响应申诉并更新系统行为。日志记录和审计基础设施不仅要跟踪模型输出,还要跟踪用户干预和覆盖决策。在某些情况下,技术保障措施,包括人工介入覆盖和决策弃权阈值,也可通过确保模糊或高风险决策交由人工判断来服务于可争议性。

实现可争辩性:基础设施与机构责任

可争辩性的基础设施成本

实施可争辩性会带来具体的基础设施成本,这些成本随系统吞吐量和复杂性而扩展。存储重构决策所需的元数据——输入特征、模型版本和决策阈值——需要持久化存储,其占用空间取决于特征维度、解释载荷和保留窗口。按需使用 Shapley 值或反事实生成解释会增加足够的延迟,以至于有争议的决策通常需要异步处理队列来维持服务 SLA。根据欧盟《人工智能法案》等框架为高风险系统维护不可变的审计追踪,要求将存储、溯源和监管能力作为推理集群的一部分进行预算,而非作为单独的政策工件 (European Parliament and Council of the European Union 2024)。

可争辩性技术栈

从架构上讲,可争辩性需要一个专门的可争辩性技术栈,这是一种类似于微服务中分布式追踪的设计模式。该技术栈必须编排四个耦合组件:

  • 决策溯源:系统通过加密方式将特定输出与所使用的确切模型二进制文件和输入向量关联起来。

  • 解释生成:一个高延迟服务仅在用户请求时触发资源密集型的解释方法。

  • 申诉路由:工作流将有争议的决策导向具备相应领域专业知识的人工审核员。

  • 结果追踪:系统通过记录申诉是否推翻了机器决策来闭环。

没有这种集成基础设施,调试算法错误就变得不可能,因为系统缺乏将特定用户投诉追溯到有问题的权重或训练数据所需的细粒度谱系。

垂直中立可争辩性技术栈,包含溯源、解释、申诉和结果阶段;溯源阶段被强调。

可争辩性是一个生产技术栈,而不仅仅是一个政策术语。

部署上下文的差异

可行的可争辩性程度因部署上下文而异。在中心化云平台中,可能提供完整的解释 API、用户仪表板和申诉工作流。相比之下,在边缘和 TinyML 部署中,可争辩性可能仅限于日志记录和基于批量同步反馈的定期更新。在所有情况下,机器学习系统的设计都必须承认,透明度不仅仅是技术披露的问题。它是系统的一个结构性属性,决定了用户和机构能否以有意义的方式质疑、纠正和治理自动化决策的行为。

责任的机构嵌入

如果没有机构支持,透明度和可争辩性机制就会失效。机器学习系统不是孤立运行的:其开发、部署和持续管理嵌入在包含技术团队、法务部门、产品负责人、合规官员和外部利益相关者的环境中。在这类系统中,责任不是单一行为者或组件的属性;它分布在角色、工作流和治理流程中。因此,为负责任的 AI 进行设计需要关注这些系统构建和使用所处的机构环境。

分布式责任与问责缺口

跨角色分发责任既带来机遇也带来挑战。一方面,多方利益相关者的参与提供了制衡,有助于防止有害结果。另一方面,责任的分散可能导致问责缺口,即没有任何个人或团队拥有明确的权力或激励在问题出现时进行干预。当危害发生时,可能不清楚过错在于数据管线、模型架构、部署配置、用户界面,还是周围的组织环境。

一个说明性的案例是 Google Flu Trends (谷歌流感趋势),这是一个因机构错位而失败的广泛引用案例。该系统试图从搜索数据预测流感爆发,最初表现良好,但由于用户行为的改变和数据分布的偏移,逐渐与现实背离。这些问题多年未得到纠正,部分原因在于缺乏既定的系统验证、外部审计流程,或在模型性能下降时的升级机制。该失败并非源于单一技术缺陷,而是源于缺乏一个能够应对漂移、不确定性和开发团队外部反馈的机构框架。

运营成本与治理瓶颈

运营严谨性伴随着可衡量的成本。公开的负责任 AI 标准和内部审查流程表明,治理会通过影响评估、模型审查、红队演练和文档关卡增加发布延迟。持久系统的观点在于:审查能力成为部署规划的一部分:如果每次高风险发布都需要专门审查,审查队列就会像安全审查或容量审批一样成为瓶颈。因此,责任开销不是沉没成本,而是针对撤回有偏见模型或在全球车队中修补活跃漏洞这类更高成本的一份保险费。

技术与组织基础设施的耦合

将责任嵌入机构不仅需要分配问责制。它需要设计流程、工具和激励机制,以允许负责任的行动。版本化模型注册表、模型卡片和审计日志等技术基础设施,必须与道德审查委员会、模型风险委员会和 红队测试⁴²⁴ 程序等组织结构相耦合。这些机制确保技术洞见具有可操作性,反馈跨团队整合,以及用户、开发者或监管机构提出的担忧得到系统性而非临时性的解决。

跨部署上下文的治理

所需的机构支持级别因部署上下文而异。

  • 大规模云平台:治理结构可能包括内部问责审计、合规工作流和负责监控系统行为的专门团队。

  • 小规模部署(包括嵌入医疗设备或公共基础设施的边缘或移动系统):治理可能依赖跨职能工程实践和外部认证或监管。

  • TinyML 部署:在连接性和可观测性受限的情况下,机构责任可通过上游控制来行使,例如安全关键验证、嵌入式安全约束和已部署固件的生命周期追踪。

结论

在所有情况下,负责任的机器学习都需要技术系统与机构系统之间的协调。这种协调必须贯穿整个模型生命周期,从最初的数据获取和模型训练到部署、监控、更新和最终退役。它还必须纳入外部行为者,包括领域专家、民间社会组织和监管机构,以确保责任不仅在开发团队内部得到行使,而且在机器学习系统运行的更广泛生态系统中得到行使。

因此,系统层面的论点超越了服务栈,延伸至组织:责任是系统如何随时间被治理、维护和争辩的一种动态属性,不归任何单一模型或团队所有。通过政策、基础设施和问责机制将其嵌入机构,才能使机器学习系统与其旨在服务的社会价值观和运营现实保持一致。

综合来看,机构责任、价值冲突、反馈回路、人机协作、可争议性和计算公平性表明,从第 16.4 节到第 16.6 节的那些技术基础无法单独确保负责任 AI。那些技术基础仍然必要,但它们需要组织授权、运维遥测和升级路径,才能经受住与已部署系统的实战考验。资源约束同样决定了谁能开发、部署并从负责任 AI 能力中受益,因此实施选择绝非单纯的局部工程细节。否则,一个无人负责的公平性指标、一个无申诉流程的解释、或一个无整改预算的监控信号,就会沦为“无法落地的证据”。一旦 AI 系统改变了其运行环境,工程团队就必须在截止日期压力、资源限制和相互竞争的激励下,将负责任 AI 原则转化为企业常规流程。

本节阐述了为何数学上合理、公平、可解释的模型在人类机构中仍会失效:重塑数据的反馈回路、自动化偏见与机构盲从、利益相关者间的规范多元主义,以及作为生产技术栈而非政策口号的可争议性。

诊断人机交互

关于回路与利益相关者的推理

实施挑战与 AI 安全

数据科学团队希望推迟一个月部署,以对新生成式模型进行严格的公平性审计。高管团队眼见竞争对手发布类似功能,要求模型必须在周五前上线。这就是负责任 AI 的实施现实。问题鲜在于工程师是否知道如何测试偏见;而在于组织架构、预算和业务优先级是否允许他们有时间和权力真正去做。

该场景暴露了技术能力与运营权力之间的实施鸿沟。负责任 AI 方法提供了必要工具,但其有效性取决于组织结构、数据基础设施、评估流程,以及远超算法开发范畴的持续承诺。只有当这些实施支撑能经受住截止日期压力、产品激励和部署后漂移时,系统才能长期保持负责任的行为。

将负责任 AI 落地到生产级 ML 系统的实际障碍,遵循经典的“人-流程-技术”框架:

人的挑战

包括组织架构、角色定义、激励对齐和利益相关者协调,这些决定了负责任 AI 原则能否转化为持续的组织行为。

流程挑战

包括标准化缺口、全生命周期维护程序、相互竞争的优化目标和评估方法论,这些影响负责任 AI 实践如何融入开发工作流。

技术挑战

包括数据质量约束、计算资源限制、可扩展性瓶颈和基础设施缺口,这些决定了负责任 AI 技术能否在生产规模下有效运行。

这些分类之所以重要,是因为当组织激励、开发工作流和生产基础设施无法支撑同一义务时,负责任 AI 就会失效。

该框架的要点在于协调,而非分类。当人、流程、技术被独立处理时,负责任 AI 就会失效:无人负责的公平性指标无法触发整改、无遥测数据的治理流程无法察觉漂移、无数据血缘的隐私技术无法响应删除请求。有效实施需要系统级策略,将责任同时嵌入机器学习部署的架构、基础设施和工作流这三个维度之中。

组织架构与激励

负责任机器学习的实施不仅取决于技术可行性,更取决于系统开发与部署所处的组织情境。在企业、研究实验室和公共机构内部,责任必须转化为具体的角色、工作流和激励。然而在实践中,组织架构往往将责任碎片化,导致难以跨工程、产品、法务和运营团队协调伦理目标。

负责任 AI 要求在子群体性能评估、可解释性分析、对抗鲁棒性测试,以及差分隐私或联邦训练等隐私保护技术集成等实践上持续投入。这些活动耗时且资源密集,却往往落在用于评估团队生产力的正式绩效指标之外。例如,团队可能被激励快速交付功能或达性能基准,即使这样做会损害公平性或忽视潜在危害。当伦理尽职调查被视为可选任务,而非系统生命周期的集成组件时,它就会在截止日期压力或组织动荡中变得脆弱、易被降级。

责任归属的模糊性进一步加剧了问题。在许多组织中,没有单一团队负责确保系统长期符合伦理行为。模型性能归一团队所有,用户体验归另一团队,数据基础设施归第三团队,合规归第四团队。当出现预测中的差异化影响或解释质量不足等问题时,可能缺乏明确协议来识别根因或协调缓解措施。结果,开发者、用户或审计师提出的担忧可能得不到解决,这并非出于恶意,而是因缺乏流程和跨职能对齐。

建立有效的负责任 AI 组织架构,需要的不仅是政策宣言。它要求运行机制:指定承担伦理监督责任的角色、文档化的升级路径、部署后监控的问责制,以及奖励团队伦理远见和系统可维护性的激励。在某些组织中,这可能表现为负责任 AI 委员会、跨职能评审委员会,或贯穿模型全生命周期与开发者协作的模型风险团队。在另一些组织中,领域专家或用户倡导者可能被嵌入产品团队,以预判下游影响并结合情境评估价值权衡。

系统伦理行为的责任分布在多个主体中,包括工业界、学术界、公民社会和政府。图 16.13 将这种分布映射到嵌套的问责层级上,从实施技术实践的个人团队、组织安全文化,到行业级认证和政府监管 (Shneiderman 2022, 2020)。在组织内部,这种分布必须通过将技术设计与战略监督及运营控制相连接的机制来镜像。没有这些链接,责任就会变得分散,初衷良好的努力可能会被系统性的错位所破坏。

图 16.13:责任层级

有效以人为中心的 AI 实施需要跨嵌套层级的共同问责。从核心的开发团队向外,延伸至组织行业政府/社会,每一个外围环层都强制执行内层无法自我施加的规范。外部约束点,包括 ISO AI 管理标准、公平性测试、模型卡片、红队测试、影响评估、GDPR、《欧盟 AI 法案》以及行业特定法律,将这些层级与实践相结合(国际标准化组织和国际电工委员会 2023b;欧洲议会和欧盟理事会 2016;欧洲议会和欧盟理事会 2024)。

负责任的 AI 不仅仅是技术卓越或监管合规的问题。它是一个系统级挑战,要求将伦理目标与机器学习系统的设计、部署和维护所依赖的制度结构相协调。创建并维持这些结构对于确保责任不仅嵌入模型,更嵌入管控其使用的组织中至关重要。同样的所有权问题在数据层变得具体:团队可能知道如何审计数据集,却缺乏改变它所需的权限、访问权或基础设施。

数据约束与质量鸿沟

尽管广泛认识到数据质量对负责任的机器学习至关重要,但改进数据管道在实践中仍然是最困难的实施挑战之一。开发人员和研究人员通常理解代表性数据、准确标注和历史偏见缓解的重要性。然而,即使意图明确,结构性和组织性障碍也经常阻碍有意义的干预。数据责任往往分散在各团队间,受制于遗留系统,或嵌入在难以变更的更广泛制度流程中。

数据工程原则,包括数据验证、模式管理、版本控制、血缘追踪和质量监控,为应对这些挑战提供了技术基础。然而,将这些原则应用于负责任 AI 会增加额外的复杂性:公平性要求评估跨人口群体的代表性,偏见缓解要求了解历史数据收集实践,隐私保护限制了允许使用的验证技术。此处描述的组织挑战反映了拥有强大数据工程基础设施与有效利用它以支持负责任 AI 目标之间的差距。

子群体不平衡、标签歧义和分布偏移,每一种都影响跨域的泛化和性能,是负责任 ML 中公认的关注点。这些问题通常表现为校准不良、分布外失效或评估指标中的人口统计学差异。然而,在现实环境中解决这些问题需要的不仅仅是技术知识。它需要访问相关数据、获得机构对修正的支持,以及足够的时间和资源对数据集本身进行迭代。在许多机器学习管道中,一旦数据被收集且训练集被定义,数据管道实际上就被冻结了。即使发现性能差异,团队可能既缺乏权限也缺乏基础设施来中途修改或扩展数据集。即使在具有验证和特征存储的自动化数据管道中,一旦数据集版本控制和数据血缘被锁定到生产环境中,事后纠正训练分布仍然很困难。

在医疗、教育和社会服务等领域,这些挑战尤为突出。数据获取可能受法律约束、隐私法规或跨组织协调的限制。例如,开发分诊模型的团队可能会发现,其训练数据对小型或农村医院的患者代表性不足。纠正这种不平衡需要与外部合作伙伴协商数据访问、对齐特征标准,并解决标注实践中的不一致性。即使所有方都同意改进的必要性,后勤和运营成本也可能高得令人望而却步。

收集更具代表性数据的努力也可能遇到伦理和政治顾虑。在某些情况下,额外的数据收集可能使边缘化人群面临新的风险。这种曝光悖论——即因排除而受害最深的个体也最容易遭受滥用——使通过扩展数据集来改善公平性的努力变得复杂。例如,收集更多非二元性别个体的数据以支持性别敏感应用的公平性,可能会提高模型覆盖率,但也引发了关于同意、可识别性和下游使用的严重担忧。团队必须谨慎应对这些张力,往往缺乏明确的制度指导。

问题:一个在 5 家医院数据上训练的医学影像模型总体准确率达到 94%,但在代表性不足的人群(农村患者、老年患者、深色皮肤患者)上仅为 78%。弥合这一差距需要来自 50 多家医院、跨越不同地理、人口统计和设备类型的代表性数据。

数学计算

  1. 数据获取成本:每张标注医学影像 50–200 美元,每个代表性不足的子群体需要 100,000 张图像。

  2. 代表性税场景:对于 10 个子群体,按成本区间中位数计算,10 个子群体 × 每子群体 100,000 张图像 × 每张 125 美元,仅数据获取成本即达 1.25 亿美元。

对比单个子群体约 1250 万美元与十个子群体约 1.25 亿美元的两阶成本梯图,未含协调开销。

代表性成本随子群体覆盖范围扩大而增加,而非仅随数据集大小。

  1. 数据协调:跨不同扫描仪、协议和标注惯例的数据协调增加 30%–50% 的开销,总成本达到 1.625 亿–1.875 亿美元。

系统洞察:代表性税使得在多数人群上实现高聚合准确率,比实现公平性能在物质上便宜得多。受偏见模型伤害最大的人群,在训练数据中也是最昂贵的。数据预算必须按子群体覆盖缺口而非聚合效用分配——这是一个根本不同于最大化总体准确率的优化目标。

数据收集系统中的上游偏见即使在数据丰富时也可能持续存在且不受约束。许多组织依赖第三方数据供应商、外部 API 或并非为公平性或可解释性设计的运营数据库。例如,电子健康记录常用于临床机器学习,往往反映了系统性的护理差异,以及编码种族或社会经济偏见的记录习惯(Himmelstein et al. 2022)。下游工作的团队可能对这些记录如何创知之甚少,且缺乏解决嵌入式危害的杠杆。

改进数据集质量往往不是任何单一团队的职责。数据管道可能由独立于 ML 工程或模型评估团队的基础设施或分析团队维护。这种组织碎片化使得协调数据审计、追踪来源、或实施将模型行为与底层数据问题联系起来的反馈回路变得困难。在实践中,数据集质量的责任往往落入空白地带:虽被认为重要,却极少被优先考虑或分配资源。

应对负责任机器学习实施中的挑战

应对这些挑战需要在基础设施、工作流和跨职能沟通方面进行长期投资。数据验证、自动化审计和数据集文档框架(例如模型卡、数据表或数据营养项目⁴²⁵)等技术工具会有所帮助,但前提是它们嵌入在拥有授权和支持、能根据发现采取行动的团队中。

因此,提高数据质量从根本上说是一个关于如何在系统生命周期中分配、共享和维持数据责任的问题,而不仅仅是更好的工具问题。一旦责任到位,当有效目标发生冲突时,团队仍须决定哪个负责任 AI 目标应占主导地位。

平衡竞争目标

机器学习系统设计通常被视为一个优化过程,即提高准确性、降低损失或最大化效用。然而,在负责任的机器学习实践中,优化必须与一系列竞争目标相平衡,包括公平性、可解释性、鲁棒性、隐私和资源效率。这些目标并不总是一致的,在某一维度上的改进可能导致另一维度的权衡。虽然这些张力在理论上已被充分理解,但在实际系统中管理它们仍是一个持续且未解决的挑战。

以模型准确性与可解释性之间的权衡为例。在许多情况下,更具可解释性的模型(包括浅层决策树和线性模型)的预测性能低于复杂的集成方法或深度神经网络。在低风险应用中,这种权衡可能是可接受的,甚至是首选的。然而,在医疗或金融等高风险领域,决策会影响个人的福祉或机会获取,团队往往陷入对性能的需求与对透明推理的需求之间。即使在开发阶段优先考虑了可解释性,在部署时也可能因追求模型准确性的边际增益而被覆盖。

个性化与公平性之间也存在类似的张力。为最大化用户参与度而训练的推荐系统可能会激进地进行个性化,利用细粒度行为数据为个别用户定制输出。虽然这种方法能提高部分用户的满意度,但可能会固化人口群体间的差距,特别是当个性化依赖于与种族、性别或社会经济地位相关的特征时。增加公平性约束可能会在群体层面减少差距,但代价是降低部分用户的感知个性化程度。这些效果往往难以衡量,更难向面临优化参与度指标压力的产品团队解释。

隐私引入了另一组约束。差分隐私、联邦学习或本地数据最小化(Biega 等人 2020)等技术可以有效降低隐私风险。但它们也会引入噪声、限制模型容量或减少训练数据的获取。在中心化系统中,这些成本可能通过基础设施扩展或混合训练架构来吸收。然而,在边缘或 TinyML 部署中,权衡更为尖锐。一款肩负本地推理任务的可穿戴设备,往往必须同时平衡模型复杂度、能耗、延迟和隐私保证。支持某一约束通常会削弱另一约束,迫使系统设计者在同等重要的目标间确定优先级。这些张力还会因部署特定的设计决策而进一步放大,例如量化级别、激活剪裁或压缩策略,它们会影响模型同时支持多个目标的有效性。

这些权衡不仅仅是技术性的;它们反映了关于系统旨在实现何种目标、服务于何种对象的更深层规范性判断,详见第 16.7.3 节。负责任的机器学习开发要求使这些判断显性化,在具体语境下评估它们,并使其接受利益相关者输入和机构监督。

使这一挑战在实施中尤为困难的是,这些竞争目标极少由单一团队或职能部门负责。建模团队可能优化性能,负责任 AI 小组可能监控公平性,而法律或合规部门处理隐私。缺乏刻意协调时,系统级的权衡可能会被隐性地、零碎地或在不可见长期后果的情况下做出。久而久之,结果可能是一个在孤立环境下表现良好,但嵌入生产基础设施后却无法达到其伦理目标的模型。

平衡竞争目标不仅需要技术熟练度,还需要对透明度、审议和跨团队对齐的承诺。系统设计应旨在揭示权衡而非掩盖它们,为约束感知开发留出空间,而非追求狭隘的优化。在实践中,这可能要求重新定义“成功”的面貌,不再将其视为单一指标上的性能,而是系统行为与其在更广泛社会或运营语境中预期角色之间的持续对齐。

在前三个挑战(组织结构、数据质量和竞争目标)中,出现了一个模式:负责任 AI 的失败很少源于技术无知。团队理解公平性指标、隐私技术和偏见缓解方法。相反,失败发生在组织碎片化将责任分散却无问责、数据约束即使在意图明确时也制造技术障碍、以及竞争目标迫使规范性权衡伪装成技术问题的交叉点。当建模团队优化性能、合规团队处理隐私、产品团队独立优先考虑参与度时,系统级的伦理行为是意外产生而非设计而成。这些本质上是社会技术治理问题,需要跨越组织边界的清晰所有权结构、为伦理审计设计的数据基础设施,以及使价值权衡显性化的审议流程。当系统必须随时间大规模维持负责任行为时,这些挑战变得更为严峻。

可扩展性与维护

负责任的机器学习实践通常在模型开发的早期阶段引入:公平性审计在初始评估期间进行,可解释性方法在模型选择期间应用,隐私保护技术在训练期间考虑。然而,随着系统从研究原型过渡到生产部署,这些实践经常退化或消失。原则上可能实现的与生产中可持续实现的之间的差距,是负责任 AI 的核心实施挑战。

许多负责任 AI 干预措施在设计时未考虑可扩展性。公平性检查可能在静态数据集上执行,但未集成到持续的数据摄入管道中。解释方法可能使用开发时工具开发,但从未转化为可部署的面向用户界面。隐私约束可能在训练期间强制执行,但在部署后监控或模型更新期间被忽视。在每种情况下,原本负责任的设计意图都未能在系统扩展和生命周期变化中持久保持。

生产环境:可扩展性与维护挑战

生产环境引入了新的压力,重塑了系统优先级。模型必须在多样化的硬件配置上运行,与不断演进的 API 交互,为数百万用户提供低延迟服务,并在运营压力下保持可用性。例如,在 CPU、GPU 和边缘加速器间保持一致行为,要求框架抽象层、运行时调度器和硬件专用编译器之间进行紧密集成。这些约束要求持续适应和快速迭代,往往导致难以自动化或度量的活动被降级处理。负责任 AI 实践,尤其是那些涉及人工审查、利益相关者咨询或事后评估的实践,可能难以融入快节奏的 DevOps⁴²⁶ 流水线中。

维护引入了进一步的复杂性。机器学习系统很少是静态的。新数据被摄入,重新训练被执行,特征被弃用或添加,使用模式随时间推移而发生偏移。在缺乏严格的版本控制、变更日志和影响评估的情况下,很难追踪系统行为如何演变,或者与责任相关的属性(如公平性或鲁棒性)是否得以保留。组织人员流动和团队重组会削弱机构记忆。负责维护已部署模型的团队可能并非最初开发或审计该模型的团队,这会导致系统目标与部署行为之间无意的错位。这些问题在持续学习或流式学习场景中尤为严峻,因为概念漂移和数据分布偏移要求主动监控和实时更新。

这些挑战在多模型系统和跨平台部署中被放大。推荐引擎可能由数十个相互作用的模型组成,每个模型针对不同的子任务或用户群体进行优化。部署在移动端和边缘环境中的语音助手可能维护同一模型的不同版本,以适应本地硬件约束。在如此分布式的系统中协调更新、确保一致性并维持负责任的行为,需要能够不仅跟踪代码和数据,还能跟踪价值观和约束的基础设施。

应对可扩展性和维护挑战,要求将负责任 AI 视为一种生命周期属性,而非一次性评估。这意味着将审计钩子、元数据追踪和监控协议嵌入系统基础设施。这也意味着创建能在团队交接中持久化的文档,定义能在项目移交中存续的问责结构,并确保系统更新不会无意中抹除在公平性、透明度或安全性方面来之不易的改进。虽然此类实践事后实施起来很难,但可以通过负责任优先的工具和工作流,从一开始就将其集成到系统设计中。

责任必须随系统扩展。部署在现实环境中的机器学习模型不仅要在发布时满足道德标准,还要在复杂性、用户覆盖范围和运营范围增长时持续满足这些标准。实现这一点需要持续的组织投入和架构规划,而不仅仅是单一时间点的技术正确性。

标准化与评估鸿沟

尽管负责任机器学习领域已经产生了大量工具、指标和评估框架,但在如何系统性地评估一个系统在实践中是否负责任方面,仍缺乏共识。许多团队认识到公平性、隐私、可解释性和鲁棒性的重要性,但往往难以将这些原则转化为一致的、可衡量的标准。基准测试方法论为标准化评估提供了有价值的框架,但将这些方法适配到负责任 AI 指标上仍是一个活跃的开发领域。缺乏形式化的评估标准,加上工具和框架的碎片化,对大规模实施负责任 AI 构成了重大障碍。

这种碎片化在机构间和机构内都显而易见。学术研究经常引入新的公平性或鲁棒性指标,这些指标难以在实验环境之外复现。相比之下,工业团队必须优先考虑那些能与生产基础设施干净集成、非专家可解读、且可随时间监控的指标。因此,在一个语境下开发的实践可能无法很好地迁移到另一个语境,跨系统的性能比较可能不可靠或具有误导性。例如,一个模型在某基准数据集上使用人口统计学平等性评估公平性,可能无法满足另一领域或司法管辖区中机会均等的要求。没有共享标准,这些评估仍然是临时性的,难以建立对系统在不同语境下负责任行为的信心。

负责任 AI 评估还面临分析单元(通常是单个模型或批处理作业)与部署层级(包括数据摄入管道、特征变换、推理 API、缓存层和人工介入工作流等端到端系统组件)之间的错位。一个在孤立状态下显得公平或可解释的系统,一旦集成到更广泛的应用中,可能无法维持这些属性。支持整体、系统级评估的工具仍处于开发不足阶段,且关于如何在生产 ML 栈中评估交互组件间的责任,几乎没有指导。

进一步使问题复杂化的是缺乏生命周期感知的指标。大多数评估工具应用于单一时间点,通常是在部署前。然而,负责任 AI 属性(如公平性和鲁棒性)是动态的。它们取决于数据分布如何演变、模型如何更新以及用户如何与系统交互。如果没有持续或定期的评估,很难判断系统部署后是否仍与其预期的道德目标保持一致。部署后监控工具虽存在,但很少与用于评估初始模型质量的开发阶段指标集成。这种脱节使得难以发现道德表现的漂移,或将观测到的危害追溯到其上游源头。

工具碎片化进一步加剧了这些挑战。负责任 AI 工具常分散在不相连的包、仪表板或内部系统中,每个都针对特定任务或指标设计。团队可能用一个工具做可解释性,另一个做偏见检测,第三个做合规报告,却缺乏用于推理系统级权衡的统一接口。缺乏互操作性阻碍了团队间协作,使文档编制复杂化,并增加了重要评估被跳过或不一致执行的风险。这些挑战因特征存储、推理网关和模型注册表等组件间缺乏元数据传播或事件日志钩子而变得更加复杂。

上文引入的失败迁移案例具体体现了这一问题:一个模型在某基准上通过人口统计学平等性认证为公平,却在新领域或司法管辖区下的机会均等测试中失败,因此该认证无法随模型迁移。弥合这一鸿沟要求评估标准可跨域度量和审计,应用于完整系统管道而非孤立模型,并作为经常性的生命周期活动重复执行,以便发布时的通过结果不会在分布漂移中悄然失效。在这些实践成为共享标准而非临时性做法之前,负责任 AI 仍停留在原则描述层面,难以在实践中验证。

负责任的 AI 无法通过孤立干预或静态合规检查来实现

负责任的 AI 无法通过孤立干预或静态合规检查来实现。它需要架构规划、基础设施支持和机构流程,以在系统生命周期内持续维系伦理目标。随着 ML 系统的规模扩大、形态多样化并嵌入敏感领域,强制执行公平性、鲁棒性和隐私性等属性的能力,不仅要在模型选择时得到支持,还必须贯穿再训练、量化、服务和监控等各个阶段。如果缺乏持续监管,负责任的实践就会随着系统演进而退化,尤其是当工具、指标和文档的设计初衷不是为了在部署期间乃至之后追踪并保留这些实践时。

应对这一挑战需要更高程度的标准化、将责任感知实践更深度地集成到 CI/CD 流水线中,以及对支持伦理前瞻性的系统基础设施进行长期投入。目标不是在代码中完善伦理决策,而是让责任成为一种运维属性——可追溯、可测试,并与大规模机器学习系统的约束与功能相契合。

实施决策框架

鉴于这些实施挑战,从业者需要系统性的方法,根据部署上下文和利益相关者需求,确定负责任 AI 原则的优先级。同一原则在高风险个体决策、安全关键系统、隐私敏感应用、大规模消费者系统、资源受限部署和研究环境中,可能要求完全不同的工程处理方式。

四条决策启发式指导实践中的这些权衡:

  • 当多个原则发生冲突时,与利益相关者协商以确定哪种危害最为严重。第 16.7.3 节中探讨的心理健康聊天机器人案例表明,此类冲突需要审议解决,而非算法解决。

  • 当计算预算受限时,按风险确定原则优先级。高风险决策即使成本高昂,也要求公平性/可解释性。低风险应用可采用轻量级方法。

  • 当部署上下文发生变化时,重新评估原则优先级。云端模型迁移至边缘端将失去中心化监控能力;需通过预部署验证和本地防护措施进行补偿。

  • 当利益相关者价值观不同时,显式记录权衡取舍,并建立竞争机制,允许受影响用户质疑决策。

表 16.6 提供了一个从业者决策框架,将这些部署上下文映射到主要原则、实施优先级和可接受的权衡,使决策能保持上下文敏感性,而非一概而论。

| 部署上下文 | 主要原则 | 实施优先级 | 可接受的权衡 |

| :--- | :--- | :--- | :--- |

| 高风险个体决策 (医疗诊断、信贷/贷款、刑事司法、就业) | 公平性、可解释性、问责制 | 跨受保护群体的强制性公平性指标;针对负面结果的可解释性;边缘情况的人工监督 | 为换取可解释性接受一定的准确率预算,并接受有延迟上限的解释;更高的计算成本 |

| 安全关键系统 (自动驾驶汽车、医疗设备、工业控制) | 安全性、鲁棒性、问责制 | 经认证的对抗防御;形式化验证;失效安全机制;全面日志记录 | 接受巨大的验证和对抗训练开销;保守的置信度阈值;冗余推理 |

| 隐私敏感应用 (健康记录、金融数据、个人通信) | 隐私性、安全性、透明度 | 差分隐私 (ε≤1.0);本地处理;数据最小化;用户同意机制 | 接受隐私-效用权衡和更高的客户端计算;有限的模型更新;降低个性化程度 |

| 大规模消费者系统 (内容推荐、搜索、广告) | 公平性、透明度、安全性 | 跨人群统计特征的偏见监控;解释机制;内容策略执行;反馈回路检测 | 在规模下平衡可解释性成本(采样或异步解释);为公平性检查预留服务路径延迟预算,并投资监控基础设施 |

| 资源受限部署 (移动端、边缘端、TinyML) | 隐私性、效率、安全性 | 本地推理;数据本地化;输入验证;优雅降级 | 牺牲实时公平性监控;使用轻量级可解释性(梯度代替 SHAP);仅预部署验证;有限的模型复杂度 |

| 研究/探索性系统 (内部工具、原型、A/B 测试) | 透明度、安全性 (危害预防) | 已知局限性文档化;受限用户群体;监控非预期危害 | 内部使用可降低复杂公平性/可解释性优先级;专注于可观测性和快速迭代 |

表 16.6:从业者决策框架:基于部署上下文确定负责任 AI 原则的优先级,展示了不同系统类型的主要原则、实施优先级和可接受的权衡。当原则冲突或资源受限时,该框架指导从业者做出符合上下文的决策。

该框架提供了初步指导,但应将其视为一种分诊机制,而非完整的治理方案。它明确了在每个部署上下文中哪些约束值得优先关注,并随着系统、上下文和社会期望的演变,为重新评估留出了空间。迄今为止探讨的挑战仍假设系统在人工监督下运行。工程师检测偏见并干预;操作员监控公平性指标;开发者响应漂移。然而,某些系统必须以超越人类审查速度的方式行动。自动驾驶汽车在毫秒级响应;交易算法在人类审查成为可能前执行数千笔交易;内容审核系统每天处理数十亿帖子。这些自主系统要求将负责任 AI 框架从实施挑战延伸至一个更根本的问题:确保系统追求的目标与人类价值观一致,即使在持续人工监督之外运行。

AI 安全与价值对齐

随着机器学习系统获得更强的自主性和能力,价值对齐挑战呈指数级扩大。上述探讨的负责任 AI 技术(包括偏见检测、可解释性和隐私保护)提供了必要能力,但在系统以更大独立性运行时,也暴露出根本局限。考虑这些既定方法在自主上下文中如何失效。

Fairlearn 中实现的偏见检测算法,需要持续的人工解读和纠正行动。自动驾驶汽车的感知系统可能对使用助行器的行人表现出系统性检测偏见,但若无人工监督,偏见检测指标就只是记录在案的统计数据,毫无补救路径。测量偏见的技术能力虽存,但自主系统缺乏判断适当响应的能力。

可解释性框架与自主系统

可解释性框架预设了能够解读并依据解释采取行动的人类受众。自主交易系统可能为其决策生成完美准确的 SHAP 解释,但如果在系统每秒执行数千笔交易前没有人类进行审查,这些解释就会变得毫无意义。系统通过其设计者从未预料到的方法优化其目标(利润),使得解释成为事后记录,而非决策辅助工具。

隐私保护技术(如差分隐私)可保护个别数据点,却无法解决更广泛的价值错位问题。自主内容推荐系统可能通过本地差分隐私保护用户隐私,同时却针对宣传误导信息或有害内容的参与度指标进行优化。当系统的根本目标与用户福祉相冲突时,单纯的技术隐私合规显得苍白无力。

负责任 AI 框架虽属必要,但随着系统获得自主性,其作用变得不再足够。这些技术预设了人类监督、受限目标和相对可预测的运行环境。AI 安全将这些关注点延伸至可能优化与人类意图不一致的目标、在不可预测环境中运行、或通过设计者未预料到的方法追求目标的系统。

AI 安全与价值对齐

随着机器学习系统在自主性、规模和部署复杂性上不断提升,责任的内涵已扩展至模型层面的公平性或隐私担忧之外。AI 安全工作将这些担忧框架为:源自错误目标的事故风险、奖励黑客攻击、可扩展监督、安全探索和分布漂移 (Amodei et al. 2016);而对齐工作则强调确保系统随时间推移追求与人类意图一致的目标 (Russell 2021)。这些担忧属于 AI 安全⁴²⁷ 领域,该领域专注于防止高能力 AI 系统产生非预期或有害的结果。一个核心挑战在于,高能力 ML 模型往往优化代理指标⁴²⁸(如损失函数、奖励函数或参与度信号),而这些指标并不能完全体现人类价值。

推荐系统提供了一个具体例子:针对可衡量的参与度代理指标(如点击量或观看时长⁴²⁹)进行优化的模型,可能在提升该代理指标的同时损害更广泛的用户福祉。生产环境中的推荐器显式优化预期观看时长等参与度信号 (Covington et al. 2016),而对 YouTube 的审计则考察了推荐路径如何使用户接触到政治极端内容 (Ribeiro et al. 2020)。这种行为符合代理指标,却与实际目标背道而驰,形成了一个强化不良结果的反馈循环。系统学会了优化可衡量的奖励,而非预期的以人为中心的结果,从而形成了 图 16.14 所捕捉的强化循环。其结果是涌现出反映规格博弈或奖励黑客攻击⁴³⁰ 的行为,这是价值对齐和 AI 安全的核心关切 (Amodei et al. 2016)。

Reward Hacking Loop

图 16.14:奖励黑客攻击循环:最大化可衡量的奖励(如点击量)可能激励非预期的模型行为,从而破坏用户满意度这一预期目标。优化代理指标会导致系统目标与期望结果之间的错位,给 AI 安全中的价值对齐带来挑战。

Norbert Wiener 曾写道:“如果我们为达成目的,使用了一种机械力量,而我们又不能有效地干涉它的运作……我们最好非常确定,塞进机器里的目的,正是我们真正想要的目的” (Wiener 1960)。

当优化超出持续人工干预的范围时,Wiener 的警告便成为一种系统需求。价值对齐询问的是:嵌入模型、奖励函数和部署策略中的目标,是否仍然代表该系统原本旨在服务的人类目的。正如 Russell (2021) 在《人类相容的人工智能》中所论,许多 AI 研究预设待优化的目标是已知且固定的,因而专注于优化的有效性,而非目标本身的设计。

在部署层面,困难的部分在于规定一个目标,使其在系统与动态环境、多方利益相关者及反馈回路交互时依然有效。静态目标函数和奖励信号无法编码所有这些条件。价值敏感设计等框架为在系统设计期间引出并整合利益相关者价值提供了正式流程,但系统的义务更为广泛:目标设计、监督和部署后监控必须被视为耦合的控制机制。

缺乏这种耦合,智能系统可能会追求狭窄的性能目标(例如准确率、参与度或吞吐量),却产生社会不期望的结果。在上述条件下实现稳健对齐,仍是 ML 系统研究中一个开放且重要的领域。由此产生的失效模式在优化复杂目标的系统中司空见惯。例如在强化学习 (RL) 中,模型往往学会利用奖励函数中非预期的方面,这种现象被称为规格博弈⁴³¹ 或奖励黑客攻击。

当目标中未显式包含的变量被以最大化奖励但违背人类意图的方式操纵时,就会出现此类失效。近年一种特别有影响力的方法是基于人类反馈的强化学习 (RLHF)⁴³²,即利用人类提供的偏好信号对模型进行训练或微调 (Christiano et al. 2017; Ouyang et al. 2022)。

虽然该方法优于标准 RL,能提升对齐度,但也引入了治理风险。Ngo (Ngo et al. 2022) 指出了 RLHF 引入的三种潜在失效模式:

  • 情境感知型奖励黑客攻击,模型利用人类的易错性。

  • 出现泛化至训练分布之外的不对齐内在目标。

  • 发展出寻求权力的行为,以保持奖励最大化能力,甚至以牺牲人类监督为代价。

这些担忧并非局限于假设场景。Amodei 等人 (2016) 概述了 AI 安全的五大具体挑战:

  • 在策略执行过程中避免负面副作用。

  • 缓解奖励黑客攻击。

  • 在真实评估昂贵或不可行时,确保可扩展监督。

  • 设计安全探索策略,在不增加风险的前提下鼓励创新。

  • 实现对测试环境中分布漂移的鲁棒性。

对车队运营商而言,每项挑战都映射为一个控制平面需求:约束副作用、监控奖励黑客攻击、预算可扩展监督、限制探索范围、发布前测试分布漂移。随着系统规模扩大、部署于多样化场景、并与实时反馈或持续学习集成,每项需求都变得更为尖锐。

这些安全挑战在减少人工监督的自主系统中尤为明显。

自主系统与信任

在有限的人工监督下自主系统运行的后果

在有限实时人工监督下自主系统运行的后果在自动驾驶中尤为明显。一个著名的近期案例是加利福尼亚州机动车管理部门(DMV)因"对公共安全构成不合理风险"而暂停了 Cruise 的部署和测试许可(CNBC 2023a)。其中一起事故涉及一名行人刚在绿灯亮起时进入斑马线,这是一个感知与决策的边缘情况,导致了碰撞(CNBC 2023b)。2018 年发生了一起更悲剧的案例,一辆处于自动驾驶模式的 Uber 自动驾驶汽车未能将推着自行车的行人识别为需要避让的行人,导致一名行人死亡;美国国家运输安全委员会(NTSB)的报告将该故障认定为自动驾驶系统设计、安全员以及组织安全管理失效的共同结果(National Transportation Safety Board 2019)。

虽然自动驾驶系统往往是公众关注的焦点,但其他领域也存在类似风险。近期冲突的报告记录了远程驾驶和自主军事系统的使用日益增加(Reuters 2023),这不仅引发了安全性和有效性担忧,还提出了关于伦理监督、交战规则和责任归属的棘手问题。当自主系统失效时,谁应承担责任在法律和伦理层面均未得到解决(Centre for International Governance Innovation 2023)。

核心张力:人类自主性 vs. 机器自主性

从根本上说,这一挑战反映了人类自主性与机器自主性之间更深层的张力。工程学和计算机科学学科历来强调机器自主性,致力于提升系统性能、最小化人工干预并最大化自动化。对 ACM 数字图书馆的文献计量分析发现,截至 2019 年,引用"自主性"的高被引论文中有 90% 关注的是机器自主性,而非人类自主性(Calvo et al. 2020)。生产力、效率和自动化被广泛视为默认目标,往往未经审视其所隐含的假设或对人类能动性和监督的权衡。

然而,当系统在动态、不确定的环境中运行,且安全行为的完整规约变得不可行时,这些目标可能会使人类利益处于风险之中。这种困难在形式上由框架问题和资格问题所体现,两者都凸显了为现实世界行动的成功列举所有先决条件和应急情况的不可能性(McCarthy 1981)。框架问题询问动作执行后世界上哪些事实仍保持相关;资格问题询问动作安全之前必须满足哪些隐藏前提。在实践中,此类局限表现为脆弱的自主性:系统在名义条件下表现胜任,却在面对模糊性或分布偏移时静默失效或危险失效。

形式化安全框架

为应对这一问题,研究人员提出了形式化安全框架,如 Responsibility-Sensitive Safety(RSS,责任敏感安全)(Shalev-Shwartz et al. 2017),它将抽象安全目标分解为对系统行为的数学定义约束,如最小距离、制动曲线和优先通行条件。这些形式化方法允许在特定假设和场景下验证安全属性。然而,这些方法仍易受其试图解决的相同局限性影响:它们仅取决于编码其中的假设,且往往需要大量领域建模,难以很好地推广至未预见的边缘情况。

ML 系统的安全案例模式

对于 ML 系统团队而言,实用的工件是安全案例,而非信任声明。表 16.7 展示了该模式:命名运行包络、证明模型已在该包络内接受测试的证据,以及当证据不再成立时停止或回滚车队的控制措施。

| 安全案例要素 | 系统证据 | 运营门控 |

| --- | --- | --- |

| 运行包络 | 运行设计域、传感器假设、天气、地理、速度和自主等级 | 阻止在已验证包络外部署 |

| 场景覆盖 | 稀有事件语料库、仿真覆盖、回放日志、接管记录和近碰撞遥测数据 | 在金丝雀扩展前要求达到覆盖阈值 |

| 运行时护栏 | RSS 式距离规则、置信度阈值、回退机动和人工接管延迟 | 当护栏触发时触发安全停车、人工接管或受限模式 |

| 车队控制 | 金丝雀发布、集中式安全仪表盘、违规预算和熔断回滚路径 | 当车队级安全指标超出阈值时暂停发布或回滚模型 |

表 16.7:自主系统安全案例:可信赖的自主性被实务化为可审计的安全案例:经过验证的运行包络、覆盖证据、运行时护栏和车队级回滚控制。相同模式适用于除车辆外的无人机、机器人、交易系统以及其他动作速度快于持续人工审查许可的 ML 系统。

以人为本的设计方法

另一种方法强调以人为本的系统设计,确保人类判断和监督始终处于自主决策的核心。Value-Sensitive Design(价值敏感设计)(Friedman 1996)主张通过显式考量能力、复杂性、误述和用户控制的流动性等因素,将用户价值融入系统设计。最近,METUX model(METUX 模型,用户体验中的动机、投入与繁荣)通过识别六个"技术体验球"(采用、界面、任务、行为、生活和社会),延伸了这一思路,这些球影响技术如何支持或损害人类繁荣(Peters et al. 2018)。这些思想植根于 Self-Determination Theory(自我决定理论,SDT),后者定义的自主性并非技术意义上的控制,而是按照个人价值观和目标行事的能力(Ryan and Deci 2000)。在系统设计中,这些框架转化为工件:需求、界面功能、用户控制、反馈渠道、升级路径和审计证据。

在 ML 系统背景下,这些视角凸显了设计架构、界面和反馈机制以保留人类能动性的重要性。例如,优化参与度指标的推荐系统可能通过不透明方式塑造用户偏好而干扰行为自主性。通过跨 METUX 六个球评估系统,设计者能预判并缓解损害有意义自主性的下游效应,即使在短期系统性能看似最优的情况下亦是如此。

更广泛的安全启示

上述技术安全挑战一旦自主系统与工作者、用户、监管机构及数十亿请求交互,即成为车队级设计约束。更广泛的启示在于:安全不能简化为模型指标;它取决于决定自动化如何改变工作、用户如何校准信任、政策如何因地区而异、以及罕见故障如何大规模累积的运行环境。

自动化、公众理解与监管格局

自动化改变了工作组织的方式,影响着安全设计决策。麻省理工学院未来工作特别工作组(未来工作 2020),科学传播的失败可能放大对人工智能系统运作方式的误解(沙弗尔 2023)。这对部署安全至关重要:当用户缺乏对模型不确定性、数据偏差或决策边界的理解时,他们可能在需要人类判断干预的情境中盲目信任系统输出。从系统工程角度看,公众理解是部署环境的一部分:人工智能-人类系统的安全属性不仅取决于技术系统本身,还取决于用户是否能够适当校准其信任并识别需要人工覆盖的情况。

分散的全球监管格局

安全工程需求受到分散的全球监管格局塑造,该格局将人工智能风险视为可验证的指标。

  • 欧盟人工智能法案(2024): 采用基于风险的结构,包含禁止行为、高风险系统、对部分系统的透明度义务以及最低或无风险用途;高风险部署面临合规性、文档和记录义务(欧洲议会和欧洲联盟理事会 2024)。

  • 美国:

    • 行政命令 14110(2023)曾建立联邦人工智能安全报告门槛,但此后被行政命令 14148(2025 年 1 月)废除。

    • 行政命令 14179 指示各机构审查并修订与前一命令相关的人工智能行动。

    • 行政命令 14409(2026 年 6 月)将联邦重点转向人工智能创新、网络安全和关键基础设施防御(总统办公室 2023、2025a、2025b、2026)。

  • 中国: 《生成式人工智能服务管理暂行办法》(2023)对部分面向公众的服务实施安全评估和算法备案要求,而非普遍的发布前评估(中国网络空间治理等 2023)。

对于全球机器学习车队而言,合规性成为一个复杂的分布式系统问题:法兰克福的推理节点可能需要不同于弗吉尼亚或新加坡节点的安全配置、数据保留政策和人机协同阈值。这需要一个灵活的配置控制平面,能够向边缘节点推送特定于地理位置的安全策略,同时不分割核心模型架构。

标注为“小规模罕见,车队规模确定”的风险饱和曲线

在车队规模下,罕见故障将成为预期事件。

车队级安全工程

安全还必须作为车队级属性进行工程化,而不仅仅是模型级属性。一个在隔离环境下安全合规率达 99.9% 的单一模型看似健壮,但当部署在每天服务数十亿请求的 10,000 个推理节点上时,其 0.1% 的故障率将保证每天发生数百万起安全事件。在此规模下,罕见故障将累积为统计上的必然事件。

为此,需要借鉴可靠性工程的分布式安全模式:

  • 断路器:当 aggregate 安全指标低于阈值时自动停止服务。

  • 金丝雀部署:仅将 1% 的流量路由至新模型版本,以在生产环境中验证安全属性。

  • 集中式遥测仪表板:将每个节点的安全违规聚合为全局视图。

正如第 12 章所述,运营基础设施必须将安全违规视为关键系统警报,触发自动回滚,就像延迟尖峰或错误率上升时所做的那样。

核心人工智能安全原则仍然成立:仅靠技术卓越是不够的。安全系统需要关注其运行的人员和组织环境,包括塑造设计决策的经济激励,以及最终用户在与自治系统互动时带来的理解。

负责任人工智能的结构性成本

负责任人工智能不能像容错性一样事后补丁加入系统。表格 16.4 中目录化的结构性成本各自都伴随供应后果:

  • 偏差漂移监控需要在每个推理请求上预留延迟空间。

  • SHAP 解释需要一个专用的异步工作节点车队。

  • DP-SGD 需要更大的训练预算。

  • 影响评估需要放慢 CI/CD 节奏。

这些不是可选的附加组件,而是生产机器学习系统的承重部件。在高风险或受监管的部署中,如果未在高级设计阶段预留这些成本,即使核心模型性能强劲,也可能导致发布受阻或被迫重新设计。

诸如延迟开销之类的结构性成本必须从第一天起就纳入核心架构;负责任人工智能不能简单地“螺栓式”附加在成品上。行业中那些诱使团队采取危险伦理捷径的普遍谬误,值得被明确识别和拆除。

谬误与陷阱

负责任人工智能涉及伦理原则在数学和技术层面上相互冲突的反直觉权衡。来自传统软件背景的从业者常常假设伦理准则可以直接翻译为实现,而未认识到涉及的不可能定理和计算成本。这些谬误和陷阱捕捉了导致系统在开发阶段看似公平,但在生产环境中违反公平标准或造成不可接受的计算开销的误解。

谬误:偏见将随着更多数据和更好算法而消失

谬误偏见将随着更多数据和更好算法而消失。

在生产环境中,偏见往往反映出无论技术改进如何都会持续存在的结构性属性。第 16.2.3 节 中描述的医疗算法每年影响 2 亿美国人,尽管是在全面数据上训练的,但仍导致黑人患者参与护理项目的比例下降了 50%。问题不在于数据量,而在于代理选择:将医疗支出作为健康代理系统地低估了历史支出较低人群的需求。

数学分析表明,当群体间基础率不同时,校准后的风险评分通常无法同时满足均等误差率条件,除非在诸如完全预测之类的特殊情况下。那些通过纯技术手段追求“消除偏见”的组织,在无法实现或未充分指定的优化问题上浪费了工程资源,同时忽略了为其特定环境选择哪些公平标准进行优先级排序所必需的利益相关者参与和价值审议。

陷阱:将可解释性视为可选功能

陷阱将可解释性视为在核心功能实现后才添加的可选功能。

这种方法忽略了开销的置换:使模型的推理过程透明化需要消耗计算资源,这反过来会制约架构设计。正如表 16.4 所示,近似 SHAP 解释并非零成本;即使是有限的解释预算,也会增加请求延迟和内存压力。在本规模估算示例中,一个服务于 100 ms 延迟要求、吞吐量为 10,000 QPS 的推荐系统,若不重新审视 SLA,就无法在不增加额外开销的情况下引入解释工作:示例中的解释预算会使每个请求增加 50 ms 到 200 ms,导致总延迟升至 150 ms–300 ms。服务基础设施必须从初始架构阶段就考虑解释预算进行重新设计,包括预计算近似值或选择天然可解释的模型架构。

谬误达成单一公平指标即保证系统整体公平。

从业者常优化人口统计学平权,即使不同群体的通过率相等,随后便假定这意味着公平对待。现实中,公平指标之间可能在数学上相互冲突。第 16.2.3 节中的贷款审批示例演示了这一点:要使两个群体均达到 70% 的通过率以实现人口统计学平权,需要降低 B 群体的阈值以提高通过率,但这种选择率的修正可能会降低精确度,并导致不同群体的通过决策承载不同的风险含义。不可能性结果表明,当基础概率不同且预测不完美时,校准与等错误率条件通常无法同时成立;人口统计学平权还会增加一个单独的选择率约束。仅针对单一指标优化部署的系统,在生产环境中会被发现违反其他法律相关的公平标准,使组织面临诉讼和监管处罚风险。

陷阱将负责任 AI 视为纯粹的合规开销。

这种视角忽略了通过降低风险和拓展市场所创造的商业价值。差分隐私使组织能在更明确的隐私保证下处理敏感数据,但也带来了必须在训练预算中规划的隐私-效用权衡。公平感知训练和监控可降低差异化影响风险:第 16.2.3.5 节所述的“五分之四规则”建立了一个实用的筛选阈值,而歧视诉讼或监管审查可能带来巨大的补救成本和声誉损失。一个全面的偏见监控流水线理应在重大子群体入学率下降演变为外部审计发现前将其暴露出来,从而在缺乏监控基础设施时避免系统性危害和法律后果。

谬误事后调整阈值即可使已部署系统变得公平。

这种观点将公平视为单一决策边界问题,而非耦合的系统属性。移动阈值虽可使某一指标达标,但也会改变校准、精确度、业务含义、法律文档及用户体验。在生产环境中,阈值不仅仅是笔记本中的一个数字;它是嵌入在服务代码、人工复核、审计记录及下游决策中的策略。

陷阱在未分析阈值权衡与校准影响的情况下实施公平约束。

群体特定阈值虽可满足真正例率相等,但也改变了决策语义:若 A 群体阈值为 0.75,B 群体为 0.60,相同的分数可能导致不同决策,且即使底层评分模型保持校准,不同群体获批申请人的阳性预测值也可能发散。贷款专员看到通过决策时,若无群体特定阈值策略的文档记录,无法知晓该决策在不同群体中是否代表相同的还款风险含义。生产系统发现,群体特定阈值需要大量文档、员工培训和审计追踪,以解释为何相同分数在不同群体产生不同决策,从而造成运营复杂性和法律风险。正确的方法要求在训练期间联合优化多个公平标准,而非依赖事后阈值调整,并接受表 16.4 量化的准确率-公平性权衡。

谬误监控仪表盘本身即能创造问责制。

仪表盘可暴露公平性漂移、解释失败或滥用趋势,但无法决定谁必须采取行动。负责任的监控流水线需要责任人、阈值、升级路径和补救预算。否则系统只会积累证据而不改变行为:告警失效,公平性退化变成被接受的基线,受影响用户无渠道申诉决策。

陷阱在无补救责任归属的情况下启动监控。

团队常因策略要求可视化而接入公平性、安全性或隐私指标,却留下响应路径未定义。这制造了虚假的控制感。无团队负责的指标不是控制手段;它只是一条日志记录。生产责任要求将每个监控信号绑定到发布门禁、事主、回滚权限或人工复核能力,以便组织在指标失效时能够采取行动。

上述案例的共同根源在于忽视上下文的阈值调整。只有当系统同时考虑到下游人口效应、文档要求、运营能力和法律风险时,数学公平约束才是负责任的。摒弃这些局部谬误,将负责任 AI 从合规清单转变为基础架构级强制要求,从而完成 ML Fleet 的治理层构建。

概要

负责任 AI 是机器学习车队的治理基础设施。生产级 ML 已需要物理基础设施、分布式执行、服务系统、安全控制、鲁棒性机制和可持续性预算。负责任 AI 增加了确保全球机器服务于人类价值而非破坏它们所需的护栏和治理框架。

论述从抽象伦理推进到具体工程约束,分析了数学公平指标及迫使显式规范选择的不可避免的不可能性定理。考察了可解释性的技术基础(SHAP、LIME)和隐私保护数据治理,随后将相同的基础设施视角延伸至生成式对齐,其中 RLHF 和系统提示词作为社会技术机制,控制 LLM 车队中的模型行为。

表 16.8 说明了为何公平性需要显式权衡。考虑一个跨两个人口统计群体评估的贷款审批系统:

该示例报告了包括假阳性率在内的分解公平指标,因此同一预测表可能满足一项标准却不满足其他标准。均等化几率要求真正例率和假阳性率同时匹配;因此此表展示的是假阳性率平权这一较窄情况,而非完全的均等化几率。

| 指标 | 定义 | 群体 A | 群体 B | 差距 |

| --- | --- | --- | --- | --- |

| 通过率 | (TP + FP) / 总数 | 55% | 40% | 15 pp |

| 真正例率 (TPR) | TP / 实际阳性 | 90% | 60% | 30 pp |

| 假阳性率 (FPR) | FP / 实际阴性 | 20% | 20% | 0 pp |

| 阳性预测值 (PPV) | TP / 预测阳性 | 82% | 75% | 7 pp |

表 16.8:解聚公平性指标

一个假设的贷款审批系统满足均等化的假阳性率(0 个百分点差距),但违反了人口统计学平价(15 个百分点的审批差距)和机会均等(30 个百分点的 TPR 差距)。这些指标暴露了不兼容的运营优先级,因此生产系统必须明确选择优先考虑哪个公平性标准。

该表使本章的核心约束具体化:一个公平性指标可能看起来已满足,而其他指标却揭示了巨大的差异。

负责任 AI 即系统工程

负责任 AI 本质上是系统工程关注点,而非部署后叠加的伦理外衣。

公平性监控管道带来的可测量延迟和计算开销,必须在架构设计阶段预算,而非事后强行塞入生产系统。SHAP 和 LIME 等可解释性机制带来的推理成本乘数会影响容量规划和 SLO 合规。针对系统提示词、模型版本控制和审计日志的治理框架,需要与其他基础设施组件同等的 CI/CD 严谨性。这些是具有可量化成本的架构需求,将其视为可选附加组件,必然导致在截止日期压缩时它们成为首批被削减的能力。

本章形式化的不可能性定理,明确了从业者通过痛苦经历发现的事实:公平性不是要优化的单一指标,而是一组需要规范性选择的相互竞争的约束。 能够定量理解这些权衡、计算差分隐私开销、指定差异影响检测的监控基础设施、并设计能跨模型集群扩展的治理机制的工程师,为负责任 AI 带来了一种纪律,将其从愿望转化为工程实践。

核心原则

  • Responsibility gates deployment(责任制约部署):在受监管或企业环境中,如果系统无法记录行为、解释决策、支持审计或分配所有权,则准确性和延迟无关紧要。治理是决定 Compute 是否被允许运行的 Coordination 约束。

  • Fairness has no hidden optimum(公平性无隐藏最优解):本章表格显示,一个贷款系统可能拥有 0 个百分点的假阳性差距,却同时背负 15 个百分点的审批差距和 30 个百分点的真阳性差距。不同的基础率将公平性转化为显性的规范性选择,而非单一指标。

  • Oversight consumes capacity(监督消耗产能):公平性监控、审计日志、解释生成和隐私保护训练会增加延迟、存储、计算和准确性成本。SHAP 风格的解释和 DP-SGD 必须在架构和 SLO 中预算,而非等到法务审查到来时才追加。

  • Generative governance is infrastructure(生成式治理即基础设施):系统提示词、RLHF 策略、工具权限、模型版本和安全评估是运营制品。它们需要所有权、CI/CD、回滚和监控,因为它们像权重一样直接驾驭模型行为。

  • Evidence needs an owner(证据需要责任人):仪表板、解释和申诉只有在有团队能够调查、补救、回滚或升级故障时,才能保护用户。当每个可衡量的义务都有可问责的运营路径时,负责任 AI 才成为工程实践。

约束的本质转变

迄今为止,本书中的每一个约束都有最优解。延迟、内存、能源,甚至鲁棒性都可以被衡量、权衡并推向最佳可达点,工程师的工作就是找到它。公平性是第一个没有这种最优点的约束,因为本章的不可能性结果不是一个待填补的鸿沟,而是一个岔路口。这改变了工作的性质。工程师可以量化每个分支并使系统遵守所选路径,但“选择”本身是一种任何指标都无法执行的规范性人类行为,工程能做的最诚实的事,是拒绝将这种选择伪装成计算。

随着负责任治理与性能、安全、鲁棒性和可持续性相结合,生产级 ML 成为一个完整的工程问题,而非孤立优化的集合。第 17 章 将这些原则综合为分布式 ML 系统工程的统一视角,提炼出指导实践的持久经验,无论未来几年会涌现何种具体技术。


此处用于确保测验在部分开始前正确插入。

  • 工程师应如何在应用存在不等基础率时,在不兼容的公平性指标中做出选择?

  • 哪些部署门控、责任人和补救路径能将负责任 AI 指标转化为可强制执行的控制?

  • 当解释增加延迟、存储和服务容量成本时,应如何设计可解释性?

  • 对于行为取决于提示词、工具、策略和模型版本的生成式系统,需要哪些治理机制?

Conclusion 结论

Blueprint-style fleet-scale ML systems map with labeled areas for infrastructure, fabric, storage, distributed training, serving, operations, security, sustainability, and governance.

Purpose 目的

What does it mean to engineer intelligence when the unit of design is no longer a model, but a fleet?

当设计单元不再是单个模型,而是一个舰队(fleet)时,工程化智能意味着什么?

Fleet stack(舰队栈)不仅是一系列主题的序列;它是一门工作学科。物理基础设施确立速率和极限;分布式协议将这些极限转化为协调成本;部署系统将训练好的模型转化为具有延迟、可用性和成本义务的服务;治理约束决定这些服务能否保持安全、鲁棒、可持续和可问责。六大原则形成一个整体结构,使工程师能在最佳局部选择在某层产生对另一层约束时,跨越整个舰队进行推理。用 C³ 术语来说,专业习惯是识别 ComputeCommunicationCoordination 哪个是约束瓶颈,然后跨层追踪该约束,直到被工程化的对象是整个舰队,而不仅仅是模型。

  • 将六大原则综合为分布式 ML 系统的约束图谱

  • 使用 C³ 术语、故障率、服务义务和治理约束评估舰队设计

  • 分析基础设施、分布式训练、推理、运维和治理如何跨舰队栈交互

  • 将安全、公平、隐私、碳排放和可靠性义务转化为可衡量的设计约束

  • 构建一种工程判断,平衡规模、可持续性、责任和运营纪律

Synthesizing Distributed ML Systems 综合分布式 ML 系统

只有当成千上万的加速器、Fabric 链路、存储层级、调度器、服务副本、安全控制和治理检查作为一台机器协同工作时,前沿模型才能成为生产系统。任何一层都可能绑定整个系统:

  • Storage bottleneck(存储瓶颈):缓慢的检查点可能浪费一个训练窗口。

  • Fabric bottleneck(互联网络瓶颈):拥塞的 Fabric 可能抹除扩展收益。

  • Serving bottleneck(服务瓶颈):配置不足的服务池可能将模型质量转化为用户可见的延迟。

  • Governance bottleneck(治理瓶颈):未被衡量的责任约束可能在技术系统就绪后阻止部署。

这种集成约束将基础 ML 工程与分布式 ML 工程区分开来。基础 ML 工程关注单一制品:神经网络的权重,通过训练算法和架构设计在单个系统上优化。分布式 ML 工程关注使该制品大规模存在的基础设施:数据中心、分布式协议和治理框架,将静态模型文件转化为活的全球服务。六大原则定义了这一转变。

车队技术栈是深思熟虑的设计。基础层构建了物理基底:使分布式机器学习成为可能的硅片、线缆和存储。这个基底至关重要,因为每一个上层决策都继承了它的限制。忽视加速器拓扑的训练策略、忽视数据加载吞吐量的存储计划,或忽视网络争用的调度策略,最终都将与其下层的物理规律发生冲突。

分发层接着展示了这些物理限制如何转化为系统协议。工作分区、梯度同步、容错以及资源编排并非独立的关注点;它们是将多台机器变为一个有用的训练或服务系统的机制。部署层将同样的逻辑向外延伸,推理、性能工程、边缘部署和运维将训练好的模型转化为具有延迟、可用性和成本义务的服务。负责任车队层增加了最后的约束:技术能力必须保持安全、稳健、可持续且可问责。这些层级共同装备了工程师,使其能在从算法选择、基础设施设计到治理框架的各个层面做出明智决策。

分布式机器学习系统的六大原则

开篇提到的工程实践——先插桩、为余量设计、软硬件协同设计——只有在它们指出了试图打破的约束时才变得有用。以下六大原则即为那些持久的现实:每一条都指出了一项约束、一个核心问题,以及一个决定分布式 ML 系统能否扩展的关键指标。

单节点基础受严格数学约束管辖,如铁律,性能关乎定量物理。车队规模工程将这一基础转移到了概率和运维现实中:链路争用、工作节点故障、调度器做出过时决策,以及策略约束改变了技术上可行设计的实际能力。连接这两个领域的桥梁是车队定律(\(T\_{\text{step}}(N) = \frac{T\_{\text{compute}}}{N} + T\_{\text{comm}}(N) + T\_{\text{sync}}(N) - T\_{\text{overlap}}\)),其完整推导见第 B.3 节并贯穿全文。车队定律作为铁律的分布式对应物,将单机执行转化为网络集群的力学机制,驱动大规模观测到的运维行为。其三个项直接映射到组织本卷的 C³ 分类法:T_compute/N 为计算,T_comm(N) 为通信,T_sync(N) 为协调。

这些原则构成了一个分层架构,映照了图 17.1 中综合的车队技术栈。在物理基础层,基础设施决定能力⁴³³,因为硬件物理学设定了硬性限制。在中间层的运维现实中,通信占主导且故障成常态:这是运行分布式系统的日常动态,直接由车队定律的网络项和同步项驱动。在治理层,两大原则作为规范性约束,限制“可以构建什么”而非仅限于“技术上可能什么”:责任约束设计,可持续性是一阶成本。从这个技术栈中涌现出第六条原则:规模创造质变。

Figure 17.1

图 17.1:车队技术栈:物理基础(车队)决定能力,而分发层(分布式 ML)和服务层(部署)定义了工程环境。这些受治理要求(负责任车队)约束,并具有规模创造质变这一统一学科的涌现属性。

| 原则 | 核心问题 | 关键指标 | 章节参考 |

| --- | --- | --- | --- |

| 通信占主导 | 瓶颈是什么? | 网络带宽利用率 | 第 6 章 |

| 故障成常态 | 如何恢复? | 平均故障间隔时间 (MTBF)、检查点开销 | 第 7 章 |

| 基础设施决定能力 | 什么是可能的? | FLOP/s、内存带宽 | 第 2 章 |

| 责任约束设计 | 谁受影响? | 公平性指标、审计追踪 | 第 16 章 |

| 可持续性是一阶成本 | 成本几何? | kWh/训练、碳足迹 | 第 15 章 |

| 规模创造质变 | 1000 倍规模下什么会坏? | 扩展效率 | 第 5 章 |

表 17.1:分布式机器学习系统的六大原则:这些原则捕捉了 ML 系统从单机走向分布式生产时发生的质变。每条原则关联特定指标和章节,相关概念在这些章节中深入展开。

第一原则是通信可能成为规模下的约束项 (Z. Jiang et al. 2024; Narayanan et al. 2021)。在许多同步训练模式中,除非拓扑、重叠和批处理围绕它们设计,否则梯度同步和拖尾效应将占主导地位。生产推理系统也可能因尾部效应⁴³⁴而变为延迟受限 (Dean and Barroso 2013),即最慢的工作节点决定响应时间,无论其他节点完成得多快。

第 5 章和第 6 章详细阐述了这一原则,展示了 Horovod 风格的环形 AllReduce⁴³⁵ (Sergeev and Balso 2018)、梯度压缩⁴³⁶ 以及计算与通信重叠如何解决通信瓶颈。对于密集集合工作负载,传统的超预订结构往往成为瓶颈,这促使采用高分割带宽结构和与 ML 通信模式匹配的传输选择。识别通信何时为活跃约束,能明确算法优化何时有效,何时仅是在同样受限的资源间转移工作。同一通信结构也揭示了第二原则:分布式系统有更多可能故障的组件,单个阻塞的秩或缓慢的工作节点就能拖垮整个作业。

第二原则:大规模持续故障

第二原则随之而来:在分布式规模下,组件故障不是偶尔发生,而是持续发生。Meta 在 16,384 块 GPU 上训练 Llama 3 的经历记录了 54 天内 419 次意外中断,平均每 3.1 小时发生一次中断 (Dubey et al. 2024)。硬件故障、网络分区和服务中断都是系统必须在无人干预下处理的常规事件。大规模 ML 训练的同步性质放大了每次故障的代价:单个失败的秩(rank)会阻塞集体操作中所有其他秩,迫使整个集群回滚到最后一个检查点。因此,单次事件造成的算力损失随集群规模线性扩大,这正是检查点频率和恢复架构不是事后考量,而是一级设计维度的原因。

第 7 章 确立了架构师必须从一开始就嵌入故障处理。检查点策略在恢复粒度与开销之间取得平衡。弹性训练⁴³⁷ 能动态适应不断变化的集群成员,而优雅降级则在容量减少时维持服务质量。将故障视为例外情况的系统无法在生产部署中存活。

通信与故障共同构成了分布式系统的运行现实,即车队栈的中间层。两者都依赖于它们之下的物理基础,这使得基础设施成为第三原则。第 2 章 表明,基础设施决定了哪些工作负载成为可能,而不仅仅是它们运行得有多快。集群级剖分带宽和芯片级功率密度设定了车队能够训练的模型和批次大小的硬性上限,这与训练算法如何调优无关。

第三原则:基础设施即硬约束

内存墙使这一原则具体化:虽然算力(TFLOP/s)可以很充裕,但内存带宽(GB/s)仍然是自回归解码的门控约束。第 10 章 和 第 15 章 量化了无法将数据从 HBM 足够快地移动到处理器,如何使自回归生成天生低效。掌握车队需要理解这些物理极限,从芯片级热密度到集群级剖分带宽。一旦基础设施决定了系统做什么,治理就决定了系统被允许做什么。

解码点位于内存斜率上,低于算力上限。

解码受内存带宽限制,位于屋顶线脊线的左侧。

第四原则:负责任的工程

第四原则是负责任的工程。第 16 章 将 AI 风险管理框架转化为工程约束 (Tabassi 2023)。特定于安全的风险,如奖励黑客、分布偏移和可扩展监督,表明了为何这些约束需要实施机制 (Amodei et al. 2016)。公平性、透明度、问责制、隐私和安全是贯穿 ML 生命周期的第一性要求,塑造着系统架构。

posted @ 2026-09-06 04:02  绝不原创的飞龙  阅读(10)  评论(0)    收藏  举报