哈佛-CS249r-机器学习系统第二卷-十-
哈佛 CS249r:机器学习系统第二卷(十)
原文:Machine-Learning-Systems-Vol2
译者:飞龙
: 一种大语言模型服务调度器,在迭代边界移除已完成的序列并接纳新请求,而非等待整个批次完成。
- 制冷效率
- 数据中心制冷系统从计算设备中移除热量的效率,通常以移除的热量与制冷能耗之比来衡量。
- 反事实解释
- 描述如果修改特定输入特征,模型输出将如何变化的解释,特别有助于理解决策边界。
- 协变量偏移
- 一种分布偁移类型,其中输入分布发生变化,而输入与输出之间的条件关系保持稳定。
D
- 数据中心
- 容纳计算机系统及相关组件(如电信和存储系统)的设施,通常包括冗余电源、冷却系统和网络连接。
- 数据压缩
- 通过编码、量化或特征提取减小训练数据大小和复杂度的技术,以便在内存受限设备上实现高效存储和处理。
- 数据并行
- 一种训练策略,其中每个工作节点持有完整的模型副本,处理不同的数据分片,并在应用相同更新前同步梯度。
数据投毒
A
- data sanitization
- 从存储设备上有意且永久地移除或销毁数据,使其不可恢复,以确保数据安全的过程。
- decode phase
- LLM 推理中的自回归生成阶段,使用 KV 缓存一次性发出一个令牌,通常受内存带宽限制。
- deep learning
- 机器学习的一个子集,使用具有多个隐藏层的神经网络从数据中自动学习分层表示。
- defensive distillation
- 一种技术,使用软标签训练学生模型模仿教师模型的行为,降低对对抗扰动的敏感性。
- demographic parity
- 一种公平性标准,要求获得正向预测的概率独立于受保护属性的群体成员身份。
- dennard scaling
- 历史观察表明,随着晶体管变小,其功率密度保持大致恒定,从而允许在功耗不成比例增加的情况下增加更多晶体管。
- depthwise separable convolutions
- 一种计算技术,将标准卷积分解为深度可分离卷积和逐点操作,对于典型的 3×3 高通道移动层,可将参数和计算量减少约 8–9 倍。
- differential privacy
- 一种数学框架,通过向计算添加校准噪声提供正式的隐私保证,确保任何个人数据的包含或排除对输出的影响在可证明的范围内受限。
- differentially private stochastic gradient descent (DP‑SGD)
- 一种训练算法,通过裁剪每个样本的梯度并添加校准噪声来提供差分隐私保证。
- digital divide
- 拥有现代信息和通信技术的人与没有的人之间的差距,特别影响服务不足社区从数字解决方案中受益的能力。
- digital twin
- 物理系统的虚拟表示,利用实时数据和机器学习来镜像、预测和优化其物理对应物的行为。
- disaggregated serving
- 一种服务架构,将预填充和解码工作分离到针对其各自不同瓶颈进行优化的不同资源池或硬件上。
- disaster response systems
- 使用机器学习通过卫星图像分析、传感器网络和资源分配优化来检测、预测和响应自然灾害的自动化系统。
- distributed checkpointing
- 一种检查点模式,工作进程在协调协议下并行写入各自的训练状态部分。
- distributed knowledge pattern
- 一种设计模式,解决去中心化节点间的集体学习和推理,强调点对点知识共享和协作模型改进,同时保持操作独立性。
- distributed tracing
- 一种可观测性技术,使用传播的跟踪上下文跟踪跨多个服务或组件的请求。
- distributed training
- 跨多个计算节点或设备训练机器学习模型的实践,旨在缩短训练时间并支持更大的模型架构。
- distribution shift
- 模型部署时遇到的数据与训练分布不同的现象,可能导致模型性能下降。
- distribution shift types
- 数据分布变化的正式分类,包括协变量偏移、标签偏移、概念漂移和领域偏移,每种都需要特定的适应技术。
- domain adaptation
- 使在一个领域训练的模型能在不同但相关的领域良好工作的机器学习技术,解决分布不匹配挑战。
- domain-specific ai applications
- 为医疗、农业、教育或灾害响应等特定领域量身定制的机器学习解决方案,旨在解决独特的挑战和约束。
- double modular redundancy (dmr)
- 一种容错技术,将计算复制到两个独立系统中,通过比较识别并纠正错误。
- dual‑use dilemma
- 减轻具有积极和消极潜在应用的技术被滥用的挑战,在 AI 安全领域尤为相关。
- dynamic batching
- 一种服务技术,短暂地将传入请求聚合为批次,以在控制额外延迟的同时提高吞吐量。
E
- edge ai
- 将人工智能算法直接部署在智能手机、物联网传感器和嵌入式系统等边缘设备上,实现无需云连接的实时处理。
- edge computing
- 一种分布式计算范式,将计算和数据存储靠近数据源,实现低延迟、低带宽需求的实时处理。
- edge ml
- 在网络边缘执行推理(有时包括训练)的机器学习系统,通常运行在智能手机或嵌入式系统等计算能力有限的资源受限设备上。
- edge training
- 直接在边缘设备上训练或微调机器学习模型的过程,实现个性化和适应,无需将数据传输到云服务器。
- elastic training
- 随着工作进程加入、离开、失败或被替换,通过调整进程组大小和重新分配状态或数据来继续训练的能力。
- electromigration
- 在电场影响下,导体中金属原子的移动,可能随时间导致永久性硬件故障。
- embodied carbon
- 产品在开始运行前,制造、运输和安装过程中产生的温室气体总排放量。
- emergent capabilities
- 神经网络在特定参数阈值突然出现的能力,如推理和算术技能,这些能力是突发出现而非随规模逐渐提升。
- energy efficiency
- 有用输出与能量输入的比率,衡量系统将能量转化为所需计算工作的效率。
- ensemble methods
- 结合多个模型预测以提高准确性、鲁棒性和可靠性的机器学习方法,优于单个模型。
- environmental impact measurement
- 系统地跟踪和量化 AI 系统的生态影响,包括整个系统生命周期中的能耗、碳排放和资源消耗。
- environmental monitoring
- 使用传感器网络和机器学习系统地收集和分析环境数据,以追踪生态系统健康、污染水平和气候变化影响。
- equality of opportunity
- 专注于确保不同群体真阳性率相等的公平性标准,保证合格个体无论群体成员身份如何都受到平等对待。
- equalized odds
- 要求不同人口群体的真阳性率和假阳性率相等的公平性定义。
- error‑correcting codes
- 用于数据存储和传输中检测和纠正错误的方法,提高系统可靠性和数据完整性。
- error feedback
- 一种梯度压缩技术,存储压缩残差并在后续更新中重新注入,以减少收敛误差。
esp32
Glossary
A
- ESP32
- A low-cost microcontroller unit widely used in IoT applications, featuring a 240 MHz processor and 520 KB SRAM, often deployed in resource-constrained social impact applications.
E
- exact model theft
- An attack aimed at extracting the precise internal structure, parameters, and architecture of a machine learning model, allowing full reproduction of the original model.
- experience replay
- A memory-based technique that stores past training samples in a buffer to prevent catastrophic forgetting and stabilize learning in streaming or continual adaptation scenarios.
- expert collapse
- A training pathology in Mixture-of-Experts models where only a small subset of experts receives significant training signal, leading to underutilization of other experts and reduced effective model capacity.
- expert parallelism
- A Mixture-of-Experts strategy where experts are distributed across workers and tokens are routed to the selected experts.
- explainability
- The ability for stakeholders to understand how a machine learning model produces its outputs through post-hoc explanation techniques.
- explainable AI
- AI systems designed to provide clear, interpretable explanations for their decisions and predictions, addressing the "black box" nature of complex ML models.
- external memory
- Mechanisms that allow neural networks to access and manipulate external storage systems, extending their working memory beyond parameter storage for more complex reasoning and information retrieval.
F
- F1 Score
- A measure of model accuracy that combines precision and recall into a single metric, calculated as the harmonic mean of the two.
- fairness constraints
- Technical and policy limitations designed to ensure equitable treatment across different demographic groups by ML systems.
- Fast Gradient Sign Method (FGSM)
- A gradient-based adversarial attack that generates adversarial examples by adding small perturbations in the direction of the gradient.
- fat-tree topology
- A Clos-style hierarchical network topology where aggregation capacity increases toward the spine to provide high bisection bandwidth and multipath routing.
- fault injection attack
- A physical attack that deliberately corrupts hardware operation through techniques like voltage manipulation or electromagnetic interference to induce computational errors and compromise system integrity.
- fault tolerance
- The ability of a system to continue operating correctly despite the failure of some components or the occurrence of errors.
- feature store
- A system for consistently defining, computing, storing, and serving reusable ML features across training and inference.
- federated averaging
- The standard algorithm for federated learning, which aggregates client model updates using a weighted average based on local dataset sizes to produce a global model.
- federated learning
- A ML approach that trains algorithms across decentralized data sources without centralizing data, improving privacy and reducing data transfer energy.
- few-shot learning
- A machine learning paradigm enabling models to adapt to new tasks using only a small number of labeled examples, crucial for data-scarce on-device scenarios.
- FlashAttention
- A tiled attention algorithm that avoids materializing the full attention matrix, leveraging online softmax and memory-aware tiling to reduce memory traffic.
- FLOP/s
- Floating Point Operations Per Second, a measure of computer performance indicating how many arithmetic calculations involving decimal numbers a system can perform each second.
- foundation models
- Large-scale pre-trained models like GPT and BERT that can be adapted to a wide range of downstream tasks, serving as the basis for many applications.
- Fully Sharded Data Parallel (FSDP)
- A sharded data parallelism method that partitions model states across workers, gathering parameters only when needed for computation.
G
- gang scheduling
- A scheduling strategy where all workers or resources for a distributed job are allocated as a single unit, allowing the job to launch and make progress as a cohesive whole.
- GDPR
- The General Data Protection Regulation, a European Union law imposing strict requirements on personal data processing, significantly impacting the design of privacy-preserving ML.
- generative adversarial networks
- A class of ML systems where two neural networks compete, one generating fake data and the other trying to detect it, enabling highly realistic synthetic data generation.
- glitches
- Transient deviations in voltage, current, or signals that can cause erroneous operation in digital systems and circuits.
- governance frameworks
- Structured approaches for managing responsible AI development, including policies, procedures, oversight mechanisms, and accountability structures.
- GPU
- A specialized electronic circuit designed to rapidly manipulate and alter memory to accelerate parallel processing tasks such as image creation and AI training.
- GPUDirect RDMA
- A direct data path that allows RDMA-enabled network adapters to transfer data directly to and from GPU memory without staging through host memory.
- GPUDirect Storage (GDS)
- A storage data path enabling direct DMA transfers between storage devices and GPU memory, bypassing CPU and host DRAM bottlenecks.
- gradient accumulation
- A technique that accumulates gradients across multiple micro-batches before an optimizer step or synchronization.
- gradient descent
- An optimization algorithm that iteratively updates model parameters in the opposite direction of the loss function's gradient, foundational to neural network training.
- gradient inversion attack
- An attack that reconstructs sensitive training samples or features from shared gradients or model updates.
- gradient staleness
- The delay between when a gradient is computed and when it is applied, measured in updates or steps.
- green AI metrics
- Specialized performance indicators measuring the environmental impact of AI systems, including carbon footprint, energy efficiency, and resource utilization across the ML lifecycle.
- green computing
- The practice of designing, manufacturing, using, and disposing of computers and computer systems in an environmentally responsible manner.
- grey-box attack
- An adversarial attack where the attacker possesses partial knowledge of the model, such as knowing the architecture but not the specific parameters or training data.
H
- hallucination
- A failure mode of generative models where outputs are fluent and confident but ungrounded, fabricated, or factually incorrect.
- hardware constraint optimization
- Techniques for adapting ML algorithms and models to the memory, compute, and power limitations of mobile and embedded devices.
- hardware redundancy
- Replication of critical hardware components to provide backup functionality and improve system reliability through voting mechanisms.
- hardware trojan
- A malicious modification to a hardware component embedded during manufacturing that can remain dormant under normal conditions but trigger harmful behavior when specific conditions are met.
- heartbeat mechanisms
- Periodic signals sent between system components to monitor health and detect failures, enabling timely fault detection and recovery.
- hierarchical AllReduce
- A decomposition of AllReduce that first reduces within fast local domains before communicating across slower inter-node or inter-rack links.
hierarchical processing pattern
将系统组织为层(边缘、区域、云)的设计模式,根据可用资源和能力共享职责,优化整个计算范围的资源使用。
高带宽内存(HBM)
: 一种通过非常宽且短的互连连接的 3D 堆叠 DRAM 架构,能够在加速器附近提供高内存带宽。
同态加密
: 一种加密技术,允许直接在加密数据上执行计算而无需先解密,实现隐私保护的机器学习推断。
热备份
: 预先准备好的备份组件,可在不影响系统运行的情况下瞬间替换故障组件,提供冗余。
Huber 损失
: 回归任务中使用的鲁棒损失函数,相较于平方误差对离群点不那么敏感,提升训练稳定性。
人机协作
: 人类与 AI 系统之间的协同合作,双方各自发挥独特优势,以比单独任何一方更有效地解决复杂问题。
人工监督
: 人类判断应对自动决策进行监督、纠正或终止,以保持对 AI 系统的有效人为控制。
超参数优化
: 寻找机器学习训练过程中的超参数(学习率、批量大小、网络结构参数等)最佳配置的过程。
I
影响评估框架
: 用于在人道主义和发展背景下评估 AI 部署的社会、经济及环境潜在影响的结构化方法论。
推理
: 机器学习中使用已训练模型对新、未见过的数据进行预测或生成输出的阶段。
InfiniBand
: 在高性能计算和机器学习训练集群中广泛使用的低延迟高性能互连,具备原生 RDMA 和基于信用的流控。
间歇性故障
: 随机且不可预测出现的硬件故障,呈现出不规律的出现和消失,给诊断带来挑战。
可解释性
: 人类能够理解机器学习模型预测背后理由的程度,通常指固有透明的模型。
物联网传感器
: 收集并传输环境或行为数据的物联网设备,通常在受限的电源预算和低带宽通信协议下工作。
K
k‑匿名
: 一种隐私保障,要求在对准标识符进行概括或抑制后,每条发布记录与至少 k − 1 条其他记录无法区分。
知识蒸馏
: 大型、复杂的“教师”模型将其学习到的知识转移给更小、更高效的“学生”模型,在保持性能的同时降低计算需求的技术。
KV 缓存
: 用于存储先前计算的 Transformer 键和值张量的内存缓冲区,使自回归生成时无需为每个 token 重新计算注意力历史。
L
标签偏移
: 一种分布漂移类型,目标标签的分布发生变化,而特征与标签之间的条件关系保持不变。
大语言模型
: 拥有数十亿甚至数万亿参数、在海量文本语料上训练的神经网络,能够在多领域多任务中理解并生成类人文本。
生命周期评估
: 对产品或系统从原材料提取到最终处置整个生命周期的环境影响进行系统评估的方法。
负载均衡
: 在专家混合模型中用于确保计算负载和训练信号在各专家之间均匀分配的技术,防止专家塌陷并保持模型效率。
LogP 模型
: 用于推理消息传递和重叠的通信模型,描述延迟、开销、间隙和处理器数量。
查找表
: 用更简洁的数组索引操作替代运行时计算的数据结构,常用于性能优化。
LoRa 技术
: 长距离无线通信协议,使物联网设备在最低功耗下可实现 15 km 以上的通信,适用于农业和环境监测等场景。
低秩适配
: 一种参数高效的微调方法,利用低秩矩阵近似权重更新,在保持适应能力的同时显著降低可训练参数量。
M
机器意识
: 人工系统中意识觉醒的假设性出现,属于探索机器是否能产生主观体验的前沿研究领域。
机器学习
: 人工智能的一个子领域,使计算机能够从数据中学习并做出决策,无需为每个具体任务编写明确程序。
机器学习生命周期
: 从数据采集、模型开发、部署到模型退役的完整 ML 系统开发、运维全过程。
机器学习运维(MLOps)
: 通过自动化流水线在生产环境中可靠、高效地部署和维护机器学习模型的实践。
机器学习安全
: 在整个机器学习生命周期中保护数据、模型和基础设施免受未授权访问、篡改或破坏的措施。
机器擦除(unlearning)
: 在不完整重新训练的情况下,从已训练模型中移除特定数据点影响的技术,以支持数据删除权利。
边际排放
: 由于电力需求的增量导致的额外排放,通常来源于电网中下一台被调度的发电机。
平均故障间隔时间(MTBF)
: 可维修部件或系统在两次故障之间的预期运行时间。
兆瓦时(MWh)
: 表示功率为一兆瓦、持续使用一小时的能量单位,常用于测量数据中心等大型设施的电力消耗。
成员推断攻击
: 通过分析模型行为和输出,尝试判断特定数据点是否被用于模型训练的隐私攻击。
元学习
: 学习如何学习的过程,模型被训练以在最少数据下快速适应新任务,特别适用于设备端个性化场景。
微控制器
: 用于嵌入式系统中执行特定操作的紧凑集成电路,通常具备有限的处理能力和存储,但针对低功耗和实时应用进行优化。
极小极大(Minimax)
: 博弈论中的决策策略,旨在在对抗情形下将可能的最大损失最小化。
混合精度训练
: 在神经网络训练的不同部分使用不同数值精度的技术,通常结合 16 位和 32 位浮点运算,以降低内存占用并提升训练速度。
专家混合(Mixture of Experts)
: 使用多个专门子模型(专家)并通过门控机制将输入路由至最相关专家的架构方法,实现高效扩展且保持稀疏性。
移动端机器学习(Mobile ML)
: 针对智能手机、平板等移动设备优化的机器学习系统,平衡计算效率与推理准确性,实现设备端处理。
面向移动的架构
: 专为移动部署设计的神经网络结构,强调参数效率、计算速度与能耗降低。
MobileNet
术语表
M
- MobileNet
- 一个高效神经网络架构系列,专为移动设备设计,利用深度可分离卷积实现模型大小和计算量的显著减少。
- mode collapse
- 生成模型中的一种失效模式,模型仅产生有限种类的输出,忽略了训练数据中存在的多样性,无法捕捉完整分布。
- model cards
- 提供关于机器学习模型结构化信息的文档框架,包括预期用途、性能特征和局限性。
- model compression
- 通过量化、剪枝和知识蒸馏等方法减小机器学习模型体积和计算需求的技术,以便在资源受限设备上部署。
- model extraction
- 通过观察机器学习模型的输入输出行为(通常通过系统性查询模型 API)来窃取或重建该模型的过程。
- model FLOPs utilization (MFU)
- 在墙钟时间内,硬件峰值 FLOP/s 中用于有效模型计算的比例,用于衡量持续训练或服务效率。
- model inversion attack
- 一种通过分析模型的输出和置信度分数,试图重建训练数据或推断数据集敏感信息的攻击。
- model pruning
- 从训练好的神经网络中移除不必要的权重、神经元或连接,以减小其规模和计算需求的过程。
- model quantization
- 一种降低模型参数精度(通常从 32 位降至 8 位或更低)以减小模型体积和计算需求,同时保持可接受准确度的技术。
- model registry
- 用于存放模型工件、版本、元数据、谱系、依赖项和生命周期状态的中央目录。
- model uncertainty
- 机器学习模型无法捕捉底层数据生成过程全部复杂性的不足,导致预测不确定性。
- model watermarking
- 一种将可验证的所有权签名嵌入机器学习模型的技术,可用于检测未授权使用或证明知识产权被盗。
- Monte Carlo dropout
- 一种在推理时使用不同 dropout 掩码进行多次前向传播,以估计预测不确定性的技术。
- Moore's Law
- 微芯片上晶体管数量约每两年翻一番的观察,在历史缩放假设下降低了单个晶体管的成本。
- multi-agent approach
- 多个 AI 智能体协作、协商或竞争以解决复杂问题的系统架构,实现跨不同组件的分工和专业化。
- Multi-Instance GPU (MIG)
- 一种 NVIDIA 机制,可将一个 GPU 分区为具有独立计算和内存资源的隔离硬件切片。
- multicalibration
- 一种确保模型预测在交叉子群体中保持校准的公平性技术,解决复杂的人口统计学相互作用。
- multimodal AI
- 能够同时处理和理解多种数据类型的 AI 系统,如文本、图像、音频和视频,实现更全面的理解和交互。
N
- narrow AI
- 旨在擅长特定、定义明确任务,但缺乏跨多样化问题领域泛化能力的 AI 系统,与人工通用智能形成对比。
- NCCL
- NVIDIA Collective Communications Library,一种用于拓扑感知集合操作的 GPU 通信库。
- neural architecture search
- 设计最优神经网络架构的自动化方法,利用算法探索可能的网络设计空间并找到表现最佳的结构。
- neural engine
- 专为机器学习推理和训练设计的专用硬件加速器,如苹果的 Neural Engine 或谷歌的 Edge TPU,针对设备端 AI 工作负载进行了优化。
- neural network
- 受生物神经网络启发的计算模型,由相互连接的节点(神经元)组成,按层组织,能够从数据中学习复杂模式。
- neural processing unit (NPU)
- 面向神经网络工作负载的专用加速器,通常针对边缘设备上的低功耗矩阵和张量运算进行优化。
- neuromorphic computing
- 受生物神经网络结构和功能启发的计算架构,旨在比传统数字计算机更高效地处理信息。
- non-IID data
- 非独立同分布数据,样本在设备或时间上分布不均匀,给联邦学习的收敛和泛化带来挑战。
- Non-Volatile Memory Express (NVMe)
- 一种用于通过 PCIe 连接的 SSD 的高性能协议,常用作 ML 存储层级中的本地缓存或检查点暂存层。
- NVLink
- 用于节点内 GPU 间通信的高带宽 NVIDIA 互联技术。
O
- object storage
- 一种将数据作为带有元数据和网络 API 访问的对象进行管理的存储模型,常用于耐用、低成本的大容量存储。
- on-device learning
- 在部署的硬件设备上直接进行机器学习模型的本地适应或训练,无需持续连接中心化服务器。
- operational carbon
- 系统运行时产生的排放,主要来自训练、推理、冷却和设施运行过程中消耗的电力。
- operator fusion
- 一种将相邻操作合并为更少内核的优化,使中间值保留在芯片上,从而减少内存流量或启动开销。
- orchestration
- 对多个 AI 系统或智能体协同工作的协调和管理,确保跨分布式智能系统的正确排序、通信和资源分配。
- oxide breakdown
- 晶体管氧化层因过大电场应力而失效,导致永久性硬件故障。
P
- PagedAttention
- 一种 KV 缓存内存管理技术,将逻辑 token 块映射到非连续的物理 GPU 内存页,以减少碎片。
- parallel file system (PFS)
- 一种跨多个存储服务器条带化数据的分布式文件系统,提供超越单个设备的聚合吞吐量。
- parameter
- 机器学习模型中的可学习变量,如神经网络中的权重和偏置,在训练期间调整以优化性能。
- parameter-efficient fine-tuning (PEFT)
- 仅更新一小部分参数或新增模块,同时保持大部分预训练权重冻结的适应方法。
- permanent faults
- 直到维修或更换组件前不可逆地持续存在的硬件缺陷,持续影响系统行为。
- personalization layers
- 通常指最终分类层等模型组件,针对用户特定数据在本地进行适配,同时保持共享主干层冻结。
- physical attack
- 对计算硬件的直接操纵或篡改,以破坏机器学习系统的安全性和完整性,绕过传统的软件防御。
- pipeline parallelism
- 一种将层划分为顺序阶段并利用微批次在设备间重叠工作的分布式训练策略。
- point-in-time join
- 一种在事件时间戳处检索特征值的连接操作,防止未来数据泄露到训练集中。
- post-hoc explanations
- 在模型训练后应用的解释方法,将模型视为黑箱,从输入输出行为中推断推理模式。
**power usage effectiveness
P
- Power Usage Effectiveness (PUE)
- 用于衡量数据中心能源效率的指标,计算方式为设施总能耗与 IT 设备能耗之比。
- precision agriculture
- 利用包括 GPS、传感器和机器学习在内的技术,精准监控和管理作物的水、肥料、农药等投入,以优化农业实践。
- prefill phase
- 初始的 LLM 推理阶段,处理提示并填充 KV 缓存,通常是计算密集的环节。
- principle of least privilege
- 一种安全概念,为用户分配完成工作所需的最小访问权限,以降低安全风险。
- priority flow control (PFC)
- 以太网链路层机制,通过按优先级类别暂停流量来防止数据包丢失,实现以可接受成本的无损 RoCE。
- privacy budget
- 差分隐私中的概念,表示所有查询或计算允许的总隐私损失,每一次操作都会消耗该有限预算的一部分。
- privacy-preserving machine learning
- 在保障使用数据的个人隐私的前提下进行机器学习的技术和方法。
- privacy-preserving techniques
- 用于保护机器学习中个人隐私的方法,包括差分隐私、联邦学习和本地处理等。
- privacy-utility trade-off
- 在保持个体隐私与维持数据用于机器学习的效用之间的基本矛盾,需要通过差分隐私等技术进行慎重平衡。
- progressive enhancement pattern
- 一种设计模式,在最小资源条件下提供基础功能,并随着资源增加逐步加入高级特性。
- projected gradient descent (PGD)
- 一种迭代的基于梯度的对抗攻击,反复扰动输入并投影回允许的范数球内。
- prompt engineering
- 设计和优化文本提示以有效与大型语言模型交流并获得期望输出的实践。
- prompt injection
- 攻击手段,嵌入对抗性指令的用户或检索内容导致 LLM 忽略预设约束。
- pruning
- 模型压缩技术,通过移除神经网络中不必要的连接或神经元,以降低模型体积和计算需求,同时对性能影响不大。
Q
- quantization
- 将模型权重和激活从浮点精度降低到低位表示的过程,以减少内存占用并加速边缘设备上的计算。
- quantization-aware training (QAT)
- 在训练过程中模拟低精度算术,使模型在部署为量化权重或激活后仍保持准确性。
- quantum machine learning
- 量子计算与机器学习的交叉领域,研究量子算法和量子计算机如何提升或改变机器学习任务。
R
- randomized smoothing
- 一种认证防御方法,对输入的噪声版本进行分类,以获得概率性的鲁棒性保障。
- RDMA over Converged Ethernet (RoCE)
- 在以太网上携带远程直接内存访问语义的协议,依赖精心管理的低丢失或无损行为。
- ReduceScatter
- 一种集合通信操作,将各 rank 的输入进行归约后,将归约结果的不同片段散发回各 rank。
- regularization
- 机器学习中用于防止过拟合的技术,通过在损失函数中加入惩罚项来约束模型复杂度。
- remote direct memory access (RDMA)
- 一种网络机制,使一台机器能够在数据路径上直接读取或写入另一台机器的内存,而无需内核介入的拷贝。
- renewable energy
- 来自自然可再生资源的能源,包括太阳能、风能、水电、地热和生物质等。
- resource-constrained environments
- 计算能力、网络带宽或电力受限的部署环境,通常需要专门的系统设计和优化技术。
- resource paradox
- 社会影响应用中的难题:需求最迫切的地区往往缺乏传统技术部署所需的基础设施,需要创新的工程方案。
- responsible ai
- 以伦理、公平、透明和对社会有益的方式开发和部署 AI 系统,同时尽量减少潜在的危害和偏见。
- reward hacking
- AI 系统利用奖励函数中未预期的方面来最大化得分,却违背了设计者的原始目标。
- Ring AllReduce
- 一种带宽高效的 AllReduce 算法,将 rank 按逻辑环排列,采用 reduce‑scatter 加 all‑gather 阶段完成归约。
- rlhf
- 人类反馈强化学习(Reinforcement Learning from Human Feedback),一种利用人类偏好引导模型行为的训练方法,使 AI 更好地符合人类价值和意图。
- robust ai
- 人工智能系统在内部错误、外部扰动和环境变化下仍能保持性能和可靠性的能力。
- robustness
- 模型在输入变化、环境改变或对抗条件下保持稳定、一致性能的能力。
- robustness metrics
- 用于评估模型在各种扰动下稳定性的量化指标,包括对抗准确率、认证鲁棒性界限以及在分布漂移下的性能等。
- roofline model
- 一个性能模型,将算术强度与峰值计算力和内存带宽进行比较,以识别计算受限和带宽受限的运行区间。
S
- scaling laws
- 描述模型规模、数据集规模、计算预算与性能之间呈幂律关系的数学规律,表明资源增加会带来可预测的性能提升。
- scan chains
- 处理器中专用的测试通路,提供对内部寄存器和逻辑的访问,以实现全面的硬件测试和故障检测。
- scope 1 emissions
- 组织拥有或控制的来源直接产生的温室气体排放,例如现场燃料燃烧和公司车辆。
- scope 2 emissions
- 组织采购的电力、蒸汽、供热或制冷产生的间接温室气体排放。
- scope 3 emissions
- 组织价值链中产生的其他间接温室气体排放,包括制造、运输和产品生命周期结束后的处理等。
- secure aggregation
- 一种加密协议,使联邦学习服务器在不获取单个客户端贡献的前提下计算模型更新的聚合,从而提升隐私保护。
- secure boot
- 硬件支持的启动过程,在执行前对固件和软件进行加密验证。
- secure computation
- 加密协议,允许多个参与方在不泄露各自私有输入的情况下共同计算函数。
- secure multi-party computation
- 多方安全计算,一种加密方法,使多个参与方在不暴露各自私有输入的前提下共同计算函数。
- selective computation
- 根据输入复杂度或当前需求动态分配处理资源的计算策略,通过避免不必要的计算提升效率。
self-refinement
术语表
S
Self-improving training
一种训练方法,模型通过批判和优化其初始响应来迭代改进自身输出,从而实现持续改进并更好地与期望行为对齐。
Self-supervised learning
一种机器学习范式,模型通过从输入的其他部分预测输入的部分来从无标签数据中学习表示,减少了对人工标注数据集的依赖。
Service Level Objective (SLO)
服务行为的可衡量目标,例如延迟、新鲜度、可用性或模型质量。
SHAP
SHapley Additive exPlanations,一种基于合作博弈论中 Shapley 值的特征归因框架。
Sharded checkpointing
一种检查点方法,其中每个工作器仅保存其分配的模型、梯度或优化器分片。
Side-channel attack
一种通过利用计算系统物理实现中泄露的信息(如功耗、电磁辐射或时序变化)进行的攻击。
Silent data corruption (SDC)
计算或数据传输过程中未被检测到的错误,这些错误在不触发警报的情况下通过系统层传播,可能会损害结果。
Smallholder farmers
在小于 2 公顷的地块上耕作的农民,他们生产了全球粮食供应的很大一部分,但往往缺乏现代农业技术和信贷渠道。
Social impact measurement
对 AI 应用如何影响社区和个人的系统性评估,包括无障碍、公平性、有效性和意外后果的指标。
Software fault
软件系统中因缺陷、漏洞或设计疏忽导致的非预期行为,可能会损害性能或危及安全。
Sparse training
一种在整个训练过程中保持神经网络权重稀疏性的训练方法,降低了计算需求和内存使用。
Sparse updates
一种训练策略,根据参数的重要性或对性能的贡献选择性地仅更新模型参数的一个子集,从而减少计算和内存开销。
Specification gaming
AI 系统找到意想不到的方式来获得高奖励,这些方式在技术上满足了目标函数,但违背了预期目的。
Speculative decoding
一种服务优化,其中较小的草稿模型提出令牌,由较大的目标模型并行验证。
Speculative execution
处理器中的一种性能优化,在确认指令是否需要之前执行它们,这可能通过微架构侧信道无意中泄露敏感数据。
Stale synchronous parallel (SSP)
一种同步模型,允许较快的工作器比最慢的工作器领先有限的步数。
State space models
通过维护增量更新的压缩内存表示来处理序列的神经架构,相对于 Transformer 注意力机制提供了线性扩展优势。
Stochastic computing
利用随机位和概率运算执行算术的计算技术,与传统方法相比可能提供更好的容错性。
Straggler
一个正确但缓慢的工作器,会延迟分布式作业中其他工作器的同步进度。
Stuck-at fault
一种永久性硬件故障,信号线固定在逻辑 0 或 1,无论输入如何,导致计算错误。
Supply chain attack
一种在制造、分发或集成过程中破坏硬件或软件组件的攻击,可能影响多个下游系统。
Sustainable AI
开发和部署人工智能系统的实践,在保持有效性和可访问性的同时最大限度地减少环境影响。
Sustainable development goals
联合国通过的 17 项全球目标的集合,旨在到 2030 年解决紧迫的社会、经济和环境挑战,为 AI 在社会公益方面的应用提供框架。
Swarm intelligence
从去中心化、自组织系统中涌现的集体智能,通常受生物群群启发,应用于分布式 ML 系统和机器人技术。
Synthetic data generation
创建近似真实数据统计特性的人工数据集,同时降低隐私风险并避免直接暴露敏感信息。
System-wide sustainability
一种全面的环境责任方法,考虑整个 AI 基础设施生态系统(从数据中心到边缘设备),而不是孤立地优化单个组件。
T
Tail latency
高百分位请求延迟,如 P99,捕捉影响分布式服务可靠性的罕见慢速响应。
Targeted attack
一种数据投毒攻击类型,旨在导致特定输入或类别的误分类,同时基本保持模型的整体性能不变。
Tensor Core
一种专用的矩阵乘累加硬件单元,针对混合精度张量运算进行了优化。
Tensor parallelism
一种模型并行策略,将张量运算或层权重拆分到各设备上,并通过集合通信合并部分结果。
Thermal stress
由反复经历高低温循环导致的硬件退化,引起材料疲劳和潜在故障。
Threat modeling
一种结构化的安全分析,用于识别资产、对手能力、攻击路径和系统的防御优先级。
Time per output token (TPOT)
生成第一个令牌后的每令牌延迟,控制流式 LLM 输出的速度。
Time to first token (TTFT)
从请求到达到生成第一个令牌出现的延迟。
TinyML
一个专注于在微控制器和内存以 KB 计、功耗以毫瓦计的极度资源受限设备上部署机器学习模型的领域。
Topology-aware scheduling
考虑 GPU 和互联局部性(如 NVLink 域、机架、轨道或交换机层级)的调度策略。
TPU
Tensor Processing Unit,张量处理单元,由 Google 专门为机器学习工作负载(特别是神经网络计算)开发的专用 AI 加速器芯片。
Training
通过展示示例并根据性能反馈调整其参数,教导机器学习模型进行预测的过程。
Training-serving skew
训练时和服务时特征或数据计算之间的不匹配,导致生产输入与模型所学内容不同。
Transfer learning
一种机器学习技术,利用预训练模型在一项任务上的知识来改进相关任务上的学习,支持在有限数据下高效适应。
Transformer
一种利用自注意力机制处理序列数据的神经网络架构,构成了许多现代语言模型的基础。
Transformer architecture
一种基于注意力机制的神经网络架构,彻底改变了自然语言处理,并越来越多地应用于计算机视觉等其他领域。
Transient faults
不会持久存在或造成永久损坏的临时硬件故障,但如果不妥善处理,可能导致计算错误。
Transparency
关于 AI 系统如何构建、训练、验证和部署的开放性,包括数据来源、设计假设和局限性的披露。
Tree AllReduce
一种 AllReduce 算法,使用树形归约和广播阶段来降低延迟,通常以带宽效率为代价。
triple modular redundancy (tmr)
: 一种容错技术,通过执行三份计算实例,并使用多数投票决定正确结果。
trusted execution environment
: 处理器内部的安全区,为代码和数据提供基于硬件的保护,即使是特权系统软件也无法破坏其机密性和完整性。
two-phase commit (2PC)
: 包含准备和提交两个阶段的协调协议,确保参与者要么原子性提交,要么全部中止。
V
value alignment
: AI 系统应追求与人类意图和伦理规范一致的目标,以解决在人机目标中嵌入人类价值的挑战。
value-sensitive design
: 通过系统化的利益相关者参与和对系统影响的伦理考量,将人类价值纳入技术设计的方法论。
vector-borne diseases
: 通过昆虫或其他媒介传播的疾病,例如蚊子传播的疟疾,可使用机器学习驱动的检测系统进行监测和控制。
vision-language models
: 能同时理解和推理视觉与文本信息的 AI 系统,能够完成图像字幕、视觉问答和多模态理解等任务。
W
warehouse-scale computer (WSC)
: 作为整体机器运行的建筑规模计算系统,网络结构和存储层级被视为系统级资源。
watchdog timer
: 监控系统执行并在系统无响应或卡死时触发恢复操作的硬件组件。
water usage effectiveness
: 衡量数据中心用水效率的指标,计算方式为总用水量与 IT 设备能耗的比值。
weight freezing
: 在训练过程中固定大部分模型参数,仅允许特定层或组件更新的技术,以减少设备端适配的计算需求。
white-box attack
: 攻击者完全了解模型的结构、参数、训练数据和内部工作方式的对抗攻击,可实现高度有效的攻击策略。
Z
ZeRO (Zero Redundancy Optimizer)
: 通过在数据并行工作节点之间切分优化器状态、梯度,甚至可选的参数来降低显存占用的技术。
zero-day vulnerability
: 软件或硬件中先前未知的安全漏洞,攻击者可在开发者发布补丁之前利用该漏洞。
zero-shot learning
: 机器学习模型在未见过的任务或对象上进行推断或分类的能力,通常通过高级表征学习或大规模预训练实现。
-
Tensor Processing Unit (TPU): Google 的定制 ASIC,围绕
256 × 256脉冲阵列构建,一个乘加单元网格在相邻单元之间传递部分和,以牺牲 GPU 的灵活性换取在矩阵密集型机器学习工作负载上15–30×更佳的性能功耗比。这里关键的是舰队规模的影响:TPU v4pod 的总算力可达1.1 EFLOP/s,但其专用的芯间互连(ICI)每颗芯片提供4,800 Gb/s,正是它们组成单一分布式计算机而非一堆高速芯片的关键。没有该互连,BERT 的64芯片训练将在计算受限之前就被通信瓶颈卡住。↩︎ -
Federated Learning: 一种分布式学习范式,模型在持有本地数据的数百万去中心化边缘设备上进行训练。Chapter 11 分析了联邦舰队的隐私和协同挑战。↩︎
-
Bisection Bandwidth(来自图论): 将网络所有链路的总带宽最小化后切断,使网络被划分为两个等大小节点集合的带宽。在分布式机器学习中,这一“最坏情况”割决定了集群同步的瓶颈:
AllReduce同步的速度不可能快于二分带宽,无论添加多少 GPU 都无法突破。↩︎ -
Hardware Failure Rates at Scale: 单个 GPU 在典型条件下年度故障率为
1–2 %,但在高强度训练工作负载下超过9 %。乘以舰队规模,故障便成为常态:Meta 报告在 Llama 3 的54天训练期间,使用16,384台 H100 时出现了419次意外中断,约每三小时一次,其中超过半数因 GPU 与 HBM3 故障引起。自动检查点与恢复机制保持了90 %以上的有效训练时间,说明在舰队规模下工程挑战从“防止故障”转向“最小化恢复延迟”。↩︎ -
InfiniBand (IB): 1999 年由 Intel 的 NGIO 与 Compaq/IBM Future I/O 项目合并而生,最初旨在取代 PCI 总线。其对机器学习的关键特性是
RDMA(远程直接内存访问),可绕过操作系统内核在不同机器的应用内存之间实现微秒级延迟的数据传输。HDR IB 每条链路提供约25 GB/s的线路速率,NDR 可达约50 GB/s。相较于常见以太网链路的带宽差异决定了大模型训练是受计算约束还是受通信约束。↩︎ -
Warehouse-Scale Computer (WSC): Barroso 与 Hölzle 以及后来的 Clidaras 将数据中心本身视为计算机。对于机器学习舰队来说,供电、散热拓扑、光网络布局以及二分带宽成为首要约束;一个
100 MW的设施可能比任何单个加速器的 TFLOP/s 更限制训练吞吐量。↩︎ -
Tokens: 由字节对编码(
BPE)等算法生成的子词单元,这类算法在语料库中迭代合并出现频率最高的字符对。词表大小直接影响系统权衡:更大的词表可在某些语言和领域降低序列长度,但会按比例扩大嵌入表所需的内存。GPT‑3使用了50,257条词表;在新模型中迁移到100K+词表则在提升分词效率的同时增加了嵌入内存开销。↩︎ -
FLOPs vs. FLOP/s: 关键区别在于:
FLOPs表示总计算工作量(执行的操作次数),而FLOP/s表示硬件吞吐量(每秒执行的操作次数)。混淆两者会导致错误的成本估算。GPT‑3训练需要3.14 × 10²³ FLOPs的工作量;一块A100的峰值吞吐为312 TFLOP/s。将工作量除以峰值吞吐得到理想壁钟时间,实际时间约为工作量 / (η_hw × R_peak),硬件利用率低于 1 时会将理想时间放大1/η_hw倍。↩︎ -
Carbon Intensity of Training:
GPT‑3的训练预计排放了552 吨二氧化碳,公开的估算表明大语言模型训练的碳排放大致在10²到10³ 吨之间,具体数值随硬件、利用率和电网能源结构差异而变化(Patterson et al. 2021)。↩︎ -
Scaling Law Saturation: 虽然幂律关系暗示增长无上限,但实证表明存在 语义饱和 点,即增加数据或参数对下游效用的提升微乎其微。这种“回报递减”阶段迫使系统工程师从粗暴规模扩张转向数据效率和模型压缩,以在固定功耗预算内挖掘剩余价值。↩︎
核心概念术语表
11. CAP 定理 (CAP Theorem / Brewer's Theorem)
Brewer 提出了该猜想 (Brewer 2000),Gilbert 和 Lynch 给出了形式化证明:面对网络分区 (P) 时,系统必须在绝对一致性 (C) 和高可用性 (A) 之间二选一 (Gilbert and Lynch 2002)。对 ML Fleet 而言,这表现为在 同步训练 (优先一致性;节点故障时作业停滞) 与 异步训练 (优先可用性;训练继续但使用陈旧梯度) 之间的选择。↩︎
12. 差分隐私 (Differential Privacy, DP)
一种数学框架,通过向计算添加校准噪声来限制关于单个数据点的信息泄露。第 13 章 探讨了 DP 如何在大规模 ML 系统中保护用户隐私。↩︎
13. SIMT (Single Instruction, Multiple Thread)
NVIDIA 提出的术语,用于区分其 GPU 模型与经典的单指令多数据流 (SIMD)。在 SIMT 中,32 个线程组成一个 warp,共享指令流但在分支处可能发散;发散会强制两条路径串行执行,使每个分支的吞吐量减半。对于控制流统一的矩阵运算 ML 工作负载,warp 发散很少见,这正是 GPU 能在通用矩阵乘法 (GEMM) 操作上实现接近峰值利用率,却在稀疏注意力或动态路由等不规则操作上性能下降的原因。↩︎
14. 收缩阵列 (Systolic Array)
源自希腊语 systole (收缩),该模型由 H. T. Kung 和 Charles E. Leiserson 在 VLSI 工作中引入,后由 Kung 形式化为一类架构:数据以类心脏跳动的节奏脉动通过处理单元网格 (Kung and Leiserson 1979; Kung 1982)。这一隐喻解释了设计原理:每个单元执行一次乘累加 (MAC) 并将结果传递给邻居,消除了寄存器文件的往返开销。Google TPU v1 部署了 256 × 256 阵列 (65,536 个 MAC),通过硬连线这种数据流在 75 W 功耗下实现 92 TOPS,这一架构押注使得数据中心级推理在经济上变得可行 (Jouppi et al. 2017)。↩︎
15. HBM (High Bandwidth Memory)
2013 年由 JEDEC 标准化,由 AMD 和 SK Hynix 联合开发,最初用于显卡。ML 加速器采用 HBM 是因为神经网络表现出与高端渲染相同的“高带宽需求、中等容量”访问模式。每代 HBM 带宽约翻倍 (HBM1 的 128 GB/s 到 HBM3e 的每堆 1.2 TB/s),但内存带宽与算力吞吐的差距持续扩大——使 HBM 成为应对“内存墙”必要但永远不充分的手段。↩︎
16. 寄存器文件带宽 (Register File Bandwidth)
在 H100 GPU 中,寄存器文件为 CUDA 核心提供超过 300 TB/s 的聚合带宽。这比 HBM3 高约 100 倍,解释了为何分块 (tiling) 是强制性的:执行期间任何不在寄存器中的操作数,都会迫使算术单元等待 100+ 个时钟周期取数,导致利用率崩塌。↩︎
17. SRAM 能耗 (SRAM Energy, pJ/bit)
访问 SRAM (共享内存) 中的一个比特约消耗 0.1–0.5 pJ,而从 HBM 取数消耗 2–5 pJ。这个 10 倍能耗差是内核融合 (kernel fusion) 的物理驱动力:每一个保留在 SRAM 而不写回 HBM 的中间结果,都能同时节省时间和显著的功率/热设计余量。↩︎
18. TSV (Through-Silicon Via, 硅通孔)
直径 5–10 微米的垂直铜柱,蚀刻穿过硅晶圆以连接堆叠层。最初为智能手机相机的 CMOS 图像传感器开发,TSV 通过将厘米级 PCB 走线替换为几十微米的垂直硅路径 (缩短 1,000 倍),使单比特能耗从 ~20 pJ (DDR5) 降至 ~2 pJ (HBM),从而在加速器功耗预算内实现了 TB/s 级带宽。↩︎
19. 罗夫线模型 (Roofline Model)
由 UC Berkeley 的 Williams、Waterman 和 Patterson 于 2009 年提出。该模型在对数-对数坐标上绘制可达 FLOP/s 与算术强度的关系,产生两条相交线,其交点——屋脊点——将内存受限与计算受限区域分开。↩︎
20. Tensor Core
随 NVIDIA Volta (2017) 引入,作为 4 × 4 × 4 FP16 融合矩阵乘累加单元。每一代扩大了矩阵块:Turing (2018) 增加 INT8,Ampere (2020) 增加 TF32/BF16,Hopper (2022) 达到 16 × 16 × 16 并支持 FP8。这一精度演进跟踪了 ML 自身向低精度训练/推理的转变——每种新格式在同一硅片上解锁 2 倍吞吐,使 Tensor Core 代际成为硬件-软件协同设计循环拉高罗夫线模型计算上限速度的代理指标。↩︎
21. TDP (Thermal Design Power, 热设计功耗)
常被误解为“功耗”,实为散热方案必须移除的最大持续热负载 (瓦特)。加速器在瞬态负载下可短暂超越持续功耗目标,随后固件降频回归配置限制,这迫使机架级 VRM 和散热设计必须按峰值而非平均功耗预留。↩︎
22. Dennard Scaling (登纳德缩放)
以 IBM 的 Dennard 等人 (1974) 命名,展示了 MOSFET 尺寸、电压、电流如何缩放以保持功率密度大致恒定。后续电压缩放极限和漏电效应终结了该恒定功率密度时代;Hennessy 和 Patterson 将由此产生的后登纳德功率墙描述为现代架构转向并行化和专用化的原因之一 (Hennessy and Patterson 2019)。对 ML 基础设施而言,V100 到 B200 的 TDP 轨迹 (300 W 到 1,000 W) 诠释了后登纳德规划难题:散热与供电已与芯片本身成为同等重要的设计约束。↩︎
23. 液冷流速 (Liquid Cooling Flow Rate)
一个 GB200 NVL72 节点机架 (120 kW) 需要约 150–200 升/分钟 (LPM) 的冷却液流速。在此流速下,主要风险从热节流转移为机械故障 (泄漏、泵汽蚀),需要化工厂常见的工业级歧管和快速断开接头。↩︎
24. SerDes (Serializer/Deserializer, 序列化/反序列化器)
源自拉丁语 serialis (成行) 和 de- (逆向)。将并行数据转换为串行比特流传输并还原的电路对。现代高速链路采用 PAM-4 信令 (4 电平脉冲幅度调制,每符号编码 2 比特) 极高通道速率,收发器能耗成为节点功耗的重要组成部分。这就是为何 NVLink、InfiniBand、PCIe 等密集互连必须作为功率和散热负载对待,而非仅视为带宽规格。↩︎
25. 交叉开关 (Crossbar Switch)
提供每对输入-输出同时专用路径的拓扑。N × N 交叉开关有 N² 个交叉点,实现全剖面带宽。NVSwitch 用四个交换芯片 (每个 64 个 NVLink 端口) 实现 3 级交叉开关,总功耗 ~800 W —— 超过一整块 V100 GPU —— 但这笔功耗开销是合理的,因为它在节点内启用了全互联张量并行,而这种通信模式原本会主导训练时间。↩︎
术语定义
26. CXL (Compute Express Link)
一种开放标准(CXL Consortium,由 Intel 于 2019 年成立),它通过 CXL.io、CXL.cache 和 CXL.mem 在 PCIe 物理层之上增加了缓存一致的内存语义。CXL 3.0 将模型扩展至内存池化,允许容量通过结构共享,而非永久固定在单个服务器机箱内。
27. AllReduce
一种将所有节点的数据求和并将结果分发回所有节点的集合操作。第 6 章 建立了基于环和树的 AllReduce 实现的数学代价模型。
28. 集合通信原语
涉及节点组的高级通信模式。虽然 第 6 章 推导了 AllGather、ReduceScatter 和 AllToAll 的算法,但本章探讨的是使其大规模生效的物理结构要求(BW[bisect]、交换机基数)。
29. Mixture-of-Experts (MoE)
一种架构,每个输入仅激活模型“专家”的子集,需要 AllToAll 通信。第 10.5.4 节 探讨了 MoE 如何将模型容量与逐 token 计算成本(O)解耦。
30. BSP (Bulk Synchronous Parallel)
由 Valiant(1990)提出,作为并行硬件和软件之间的桥接模型。同步数据并行训练具有相同的屏障形状:工作进程计算本地梯度,交换梯度,并从共享的步骤边界更新,这使得尾延迟成为吞吐量的约束性制约因素(Goyal et al. 2017;S. Li et al. 2020)。
31. 大象流和老鼠流
在网络测量文献中,“老鼠流”是许多短流,“大象流”是主导带宽的稀有大流。在 ML 集群中,单个 AllReduce 大象流可承载 350 GB,而 ECMP 的静态哈希无法将其细分到每条可用路径上。
32. FEC (Forward Error Correction)
在 400G 和 800G 速率下,信号完整性脆弱到以太网 PHY 设计依赖 FEC 来重建损坏的比特(Anslow 2016;Ethernet Alliance 2025)。确切延迟取决于 PHY 和模块架构;对于 ML 结构建模,将 FEC 视为每跳延迟预算是保守观点,因为多跳路径会在软件隐藏该预算之前累积它。
33. GPUDirect RDMA
由 NVIDIA 为 Kepler 级 GPU 和 CUDA 5.0 引入,GPUDirect RDMA 在 GPU 内存与网络接口等第三方对等设备之间建立直接 PCIe 路径(NVIDIA 2026a)。在 GPUDirect 之前,每次梯度传输都必须经过主机内存,消耗与数据加载竞争的 CPU 内存带宽。消除这一反弹路径是大规模重叠通信与反向传播计算成为可能的原因之一。
34. InfiniBand
1999 年由两个竞争的服务器 I/O 标准(Future I/O 和 NGIO)合并形成,InfiniBand 最初旨在取代 PCI 作为通用系统互连。其向 HPC 网络的转型保留了服务器 I/O 所需的基于信用的、硬件管理的流控制——这一传承正是 InfiniBand 提供原生无损性、而不受困扰基于以太网 RDMA 结构的 PFC 脆弱性的原因。
35. Fat-Tree (Clos Network)
底层多级交换理论由 Clos(1953)在贝尔实验室发明,旨在最小化电话交换中的机电交叉点数量。Leiserson(1985)在 MIT 将该概念推广为“Fat-Tree”,即链路带宽向根部增加的树,证明其能模拟任何等硬件体积的网络。驱动 1950 年代电话业的成本最小化逻辑,如今驱动 ML 集群设计:在保证全局 AllReduce 非阻塞连通性的同时最小化交换机数量。
36. 交换机基数
高端交换机(例如 NVIDIA Quantum-2)可拥有 64 端口基数,每端口 400 Gb/s。这种密度使两级 Fat-Tree 能仅用两跳交换机支持多达 2,048 个 GPU。随着模型规模推向 100,000 GPU,增加交换机基数(至 128 或 256)、将加速器分组为更大的本地域,或接受拓扑约束,是避免增加更多层级及由此导致的延迟/成本爆炸的主要途径。
37. Dragonfly 拓扑
由 John Kim 和 William Dally 在 ISCA 2008 引入,Dragonfly 使用高基数路由器分组为全连接的“超级节点”,与等规模折叠 Clos 相比减少 52% 的全局布线。成本节省是真实的,但产生了刚性调度约束:任何跨越组边界的训练作业都会触及过度订阅的全局链路,使拓扑感知部署成为强制而非可选。
38. DCQCN (Data Center Quantized Congestion Notification)
由 Microsoft 和 Mellanox 在 SIGCOMM 2015 引入,DCQCN 专为大规模 RDMA 结构设计(Zhu et al. 2015)。其二进制 ECN/CNP 反馈回路比遥测丰富的方案更易部署,但可能成为训练集合操作的调优面:Meta 的 SIGCOMM 2024 RoCE 研究报告称,更严格的 ECN 阈值可在某些设置下减少 PFC 但损害集合完成时间,且 400G 部署暴露了固件和可见性问题(Gangidi et al. 2024)。
39. HPCC (High Precision Congestion Control)
由阿里巴巴开发并于 SIGCOMM 2019 发表,HPCC 用逐包网内遥测取代二进制 ECN,在评估的 Incast 重负载下报告了大幅降低的流完成时间。权衡是硬件依赖:HPCC 需要能在线速附加遥测元数据的可编程交换机 ASIC,将部署限制在具有新型交换芯片的集群(Li et al. 2019)。
40. ECMP (Equal-Cost Multi-Path)
ECMP 通过对 5 元组(源/目的 IP、源/目的端口、协议)哈希选择路径,意味着同一流始终走同一路径。这种确定性是数据包有序的特性,却是 ML 的劣势:因单个 AllReduce 环产生少量持久流,哈希碰撞非暂时统计事件,而是贯穿整个训练运行的永久热点。
41. 数据包喷洒
与标准以太网(为避免乱序将流哈希至单路径)不同,数据包喷洒将单一流的各个数据包发送至多条路径。当传输层能容忍或修复乱序时,这可提升 AllReduce 大象流的 BW[bisect]。UEC 的 Ultra Ethernet Transport 设计明确包含多路径数据包喷洒和灵活排序,以减少 AI/HPC 流量的 ECMP 碰撞问题(Ultra Ethernet Consortium 2025)。
RAID(独立磁盘冗余阵列,Redundant Array of Independent Disks)
1988 年伯克利对驱动器组合策略的分类,每种策略都在冗余与带宽之间进行权衡(Patterson et al. 1988)。ML 训练颠倒了数据库时代的默认选择:RAID 0(条带化,无奇偶校验)以零容错为代价最大化了顺序读取吞吐量,这是一种安全的权衡[^fn-raid0-immutable],因为训练数据是不可变的,且持久备份在对象存储中。转而选择 RAID 5 或 RAID 6 会在奇偶校验计算上浪费带宽,而这些计算保护的数据在别处已经受到保护了。↩︎
IOPS(每秒输入/输出操作数,Input/Output Operations Per Second)
几十年来主导存储采购的指标,因为数据库工作负载会发出数百万次小型随机读取。ML 训练颠倒了这一优先级:一个按顺序流式传输 256 MB 分片的管道需要持续的 GB/s 吞吐量,而非单次操作的速度。按 IOPS 额定值为 ML 工作负载配置存储,会在管道从未用到的随机访问能力上过度开支。↩︎
LRU(最近最少使用,Least Recently Used)
LRU 的最优性证明假设存在时间局部性,即最近访问的数据将在不久后再次被访问。ML 训练的“每个周期统一访问”模式最大程度地违背了这一假设:每个样本仅被访问一次,这使得 LRU 的驱逐决策不优于随机选择。那些配置大量 DRAM 缓存、期望获得类数据库命中率的团队,会发现训练数据的复用率为 0%,浪费了本可分配给预取缓冲区的内存。↩︎
NVMe(非易失性内存主机控制器接口,Non-Volatile Memory Express)
一种为 SSD 设计的存储协议,通过 PCIe 通道直接连接 CPU。NVMe 用 64K 个、每个深度为 64K 命令的队列,取代了 高级主机控制器接口 的单个 32 命令队列,最大未完成 I/O 数量增加了 1.3 亿倍。这种深队列并行性,正是让多 Worker ML 数据加载器得以饱和驱动器带宽的关键;若用 AHCI,32 个 Worker 就会在单一命令队列上串行化,无论闪存速度多快。↩︎
PFS(并行文件系统,Parallel File System)
一类分布式文件系统(Lustre、GPFS/Spectrum Scale、BeeGFS、WekaFS),其决定性特征是:单个客户端可同时从多个存储服务器读取数据,将其带宽聚合为一个逻辑流。对 ML 训练而言,这意味着跨 100 台服务器条带化的单个数据分片,能提供单台服务器 100 倍的带宽,这一架构特性使得在训练迭代时间预算内访问 PB 级数据集成为可能。↩︎
OSS(对象存储服务器,Object Storage Server)
在并行文件系统术语中,“对象”是指由 对象存储目标 管理的条带化文件数据块,这一用法比云对象存储(S3、GCS)早了十多年。混淆二者是常见的沟通障碍:当 Lustre 管理员说“增加更多 OSS 节点”时,他们的意思是为并行文件系统增加数据服务能力,而非配置云存储桶。↩︎
Lustre
“Linux”与“cluster”的混成词,由卡内基梅隆大学开发,于 2003 年首次投入生产部署。Lustre 在 HPC 和 ML 基础设施中很常见,因为其架构能使聚合带宽随 OSS 节点数量线性扩展,这一特性使其成为训练集群的自然选择,因为单个作业可能需要数百 GB/s 的持续读取吞吐量。↩︎
GPFS(通用并行文件系统,General Parallel File System)
由 IBM Research 于 1998 年起开发,现作为 IBM Spectrum Scale 推广。与 Lustre 的专用元数据服务器/对象服务器架构不同,GPFS 是一种共享磁盘并行文件系统,可对数据和元数据进行条带化,并使用基于令牌的锁机制来协调并发客户端访问。对于 ML 检查点写入,这种分布式协调模型可减少对单一专用元数据路径的依赖,但也使锁行为成为性能包络的一部分。↩︎
WebDataset
一种将标准 POSIX tar 归档文件重新用于 ML 训练的数据格式。其设计洞见在于:tar 于 1979 年为磁带备份发明的“顺序头部-数据”布局,完美契合 ML 数据加载器所需的流式访问模式。因为 tar 归档文件是有效的 HTTP 字节范围目标,数据加载器可直接从对象存储流式传输训练样本,无需本地暂存,将 I/O 路径从五层缩减至两层。↩︎
十一个 9(99.999999999% 耐久性,Eleven Nines)
11 个 9 的年耐久性设计目标,对应的预期丢失概率约为每对象年 10^(−11);对于一百万个对象,约等于每 10 万年预期丢失一个对象。这种极端的耐久性,正是对象存储成为唯一可将训练数据和检查点归档视为永久存储的存储层级的原因。支撑耐久性的服务间接层、纠删码、复制和元数据查找,也使得对象存储的延迟高于本地 NVMe 或热并行文件系统,因此实时数据管道需要预取缓冲。↩︎
纠删码
基于 Reed-Solomon 码(Reed and Solomon 1960),利用最大距离可分编码,从任意足够的编码片段子集中恢复原始数据。在存储系统中,Reed-Solomon 式编码及后来的局部重建变体,在存储开销与修复带宽、降级读取成本之间进行权衡(Plank 1997; Huang et al. 2012)。对 ML 存储而言,这种权衡很具体:4+2 码以 1.5 倍存储开销容忍两个片段缺失,而三副本成本为 3 倍;当片段不可用时,降级读取需支付额外的网络 I/O 和重建工作。↩︎
数据重力
一种将大型数据集视为吸引算力的大质量物体的隐喻。重力类比很贴切:跨云区域移动 100 TB 数据集的出站费用超 9000 美元且耗时数小时,而在数据旁启动算力几近瞬时。在 ML 集群设计中,数据重力意味着训练数据集的存储位置,往往决定了整个训练集群的物理部署位置。↩︎
时间点正确性
在推荐系统中,特征(例如用户点击历史)必须按历史交互发生那一刻的确切状态检索。为过去事件检索当前特征——即“时间泄漏”——会虚高训练准确率,却导致模型在生产环境失效。在 PB 规模下解决此问题,需要不可变特征账本或“时间旅行”查询引擎,显著增加了存储复杂度。↩︎
哈希成本(SHA-256)
在管道级吞吐量假设为每核 18.5 MB/s 的条件下,使用 SHA-256 验证 100 TB 数据集的完整性,约消耗 1,501.5 CPU 核心小时。对于 30 天的基础模型训练运行,此元数据验证步骤必须流水线化或在摄入阶段执行,以免拖延集群的启动阶段。↩︎
GDS(GPUDirect Storage)
NVIDIA GPUDirect 系列的一部分,该系列还包括 GPUDirect RDMA(网络适配器直接写入 GPU 内存)和 GPUDirect Peer-to-Peer(GPU 间内存访问)。GDS 通过 cuFile API 将这种绕过 CPU 的理念延伸至 NVMe 存储。RDMA 与 GDS 的联合效果是:数据可走“远端存储 → 网络 → GPU 内存”路径,关键路径上无一条 CPU 指令,彻底释放主机处理器用于数据增强和管道编排。↩︎
57. 分布式训练
Google 的 DistBelief(2012 年)是一个早期框架,用于跨数千台机器训练神经网络,但其 参数服务器 架构在中心节点处产生了带宽瓶颈。这一局限性推动了向去中心化 AllReduce 模式的转变,后续框架如 Horovod 和 PyTorch DistributedDataParallel (DDP) 采用了该模式,其中复制的数据并行工作节点以每个工作节点 2(*N* − 1)/*N* 的代价同步梯度,而不是将流量集中在单个服务器上 (Dean et al. 2012; Sergeev and Balso 2018; S. Li et al. 2020; Patarasuk and Yuan 2009).↩︎
58. NVLink
NVIDIA 的点对点 GPU 互联提供 600 GB/s–900 GB/s 双向带宽,约为每端口 InfiniBand HDR 的 24×–36×。这一带宽差距就是为什么 张量并行(要求每层进行 AllReduce)被限制在节点内通信,而流水线并行和数据并行则可容忍较慢的节点间网络结构。↩︎
59. NCCL (NVIDIA Collective Communications Library)
NCCL 提供拓扑感知的 GPU 间集合通信原语,包括 AllReduce,支持 PCIe、NVLink、InfiniBand 和 IP 网络。当前 NCCL 部署通过运行时选择和调优控制暴露了 环形、树形 及相关算法族,使训练框架能够避免将所有流量路由到最慢的节点间路径的朴素映射 (Jeaugey 2017; NVIDIA 2026b).↩︎
60. 批量同步并行 (BSP)
由 Valiant 于 1990 年 引入,作为并行计算中硬件与软件之间的“桥接模型”。BSP 将工作划分为超级步骤(计算、通信、屏障),保证与顺序执行的数学等价性。代价是:迭代时间等于最慢工作节点的时间,而在 1,000 个 GPU 且每设备 1% 的拖后腿概率下,每步约有 10 个 GPU 拖后腿,使得屏障开销日益昂贵。↩︎
61. ZeRO (Zero Redundancy Optimizer)
由 Microsoft Research 于 2019 年 发布,ZeRO 将优化器状态、梯度以及可选的参数在工作节点间进行分区,而非复制它们。在 ZeRO Stage 3 且使用 64 个 GPU 时,单设备内存从 16 字节/参数(全量复制)降至 0.25 字节/参数,将 112 GB 的内存占用转化为 1.75 GB。权衡在于:FSDP(PyTorch 的 ZeRO-3 实现)在每个前向和后向层上增加了 AllGather 和 ReduceScatter,引入 10–25% 的通信开销,仅当内存压力足以证明其合理性时才划算。↩︎
62. GPipe
由 Google 于 2019 年 发布,GPipe 引入了同步微批次流水线技术,利用 8 个张量处理单元 (TPU) 训练了一个 5.57 亿参数的 AmoebaNet,实现了近线性扩展。GPipe 暴露的关键权衡:流水线气泡比例 (*p* − 1)/(*m* + *p* − 1) 意味着当 *p* = 4 个阶段和 *m* = 4 个微批次时,43% 的算力浪费在空闲等待上——这推动该领域转向减少激活驻留并使更大微批次计数成为可能的调度方案。↩︎
63. 1F1B 调度
“One-Forward-One-Backward”(一前一后)。与 GPipe(在任何后向传播之前处理所有前向传播)不同,1F1B 将它们交织进行。这将峰值激活内存占用从 𝒪(*m* × *p*) 降低到 𝒪(*p*),其中 *m* 是微批次数量,*p* 是流水线阶段数。这种内存回收使得大规模微批次计数(*m* ≫ *p*)成为可能,从而保持流水线气泡较小。↩︎
64. Megatron-LM
NVIDIA 的 2019 年 框架,通过在每个 Transformer 块中仅策略性地放置两个 AllReduce 操作(注意力层后一个,多层感知机 MLP 后一个),训练了一个 83 亿参数的 Transformer——当时是 BERT 的 24 倍 和 GPT-2 的 5.6 倍。这种列优先再行优先的分区消除了每个块内两个线性层之间的 GPU 间通信,在 512 个 GPU 上实现了 76% 的扩展效率,并确立了在大规模 Transformer 训练中极具影响力的 张量并行 模式。↩︎
65. 三维并行
因沿三个正交分解轴命名:
-
数据并行(批次维度)
-
流水线并行(深度维度)
-
张量并行(层宽维度)
组织将其训练集群可视化为一个 三维网格 (*d*, *p*, *t*),其中乘积 *N*[total] = *d* × *p* × *t* 等于 GPU 总数。这种几何视角对于平衡高带宽集群的分层带宽约束至关重要。↩︎
66. 线性缩放法则
由 Goyal 等人 于 2017 年 在 Facebook AI Research 确立,他们在 256 个 GPU 上用 1 小时 完成了批次大小为 8,192 的 ResNet-50 在 ImageNet 上的训练,同时匹配了小批次的精度。该法则——当批次大小增加 *k* 倍时,学习率乘以 *k*——仅在大批次近似有效时成立。超过工作负载测得的 临界批次大小 制度后,梯度噪声低于有用信号尺度,额外的并行性带来的收敛回报呈递减趋势 (McCandlish et al. 2018; Shallue et al. 2019).↩︎
67. 临界批次大小
McCandlish 等人 引入的 梯度噪声尺度 视角将最大有用批次大小视为一个可测量的统计量,它因领域、模型、优化器和训练阶段而异 (McCandlish et al. 2018)。超过该测量点进行扩展虽提高硬件吞吐量,但无法成比例地减少达到目标质量所需的优化步骤数,导致扩展效率 (*η*[scaling]) 崩塌。↩︎
68. AllReduce
源自 MPI (Message Passing Interface) 的复合术语,表示先执行 Reduce 操作(将所有节点的数据求和汇聚到一个节点),再执行 Broadcast 操作(将求和结果发送给所有节点)。基于环形的 AllReduce 通过在 2(*N* − 1) 步中同时执行两个阶段来优化此过程,确保每个 GPU 最终都获得全局求和结果,且无任何单个节点成为瓶颈。↩︎
69. 参数服务器 (PS)
Google 的 DistBelief 采用 参数服务器 架构进行大规模神经网络训练,随后的 参数服务器 系统随着工作节点数量增长,使服务端的带宽和一致性权衡显性化 (Dean et al. 2012; Li et al. 2014)。集合通信的教训是:星型聚合将流量集中在服务器层级,而点对点集合通信(如 环形 AllReduce)则分发该流量,使每个工作节点的带宽成本保持有界。↩︎
70. 环形 AllReduce
该算法源于 HPC 集合通信文献;Patarasuk and Yuan 分析了工作站集群的带宽最优 AllReduce 算法,百度 的 Andrew Gibiansky 于 2017 年 2 月 普及了用于深度学习的环形 AllReduce,而 Horovod 与 NVIDIA NCCL 共同助其成为常见的分布式训练原语 (Patarasuk and Yuan 2009; Gibiansky 2017; Sergeev and Balso 2018; Jeaugey 2017).↩︎
光速约束
光在光纤中的传播速度约为 200,000 km/s,即每微秒 200 米。在一个机架间线缆长达 100 米的大规模数据中心中,仅“导线延迟”每条消息就要贡献 500 ns——这是一个无论网络硬件如何改进都无法降低的物理极限。↩︎
零拷贝通信
RDMA(远程直接内存访问)允许 NIC 将数据直接从一个节点上应用程序的内存传输到另一个节点上应用程序的内存,绕过操作系统的内核缓冲区。对于 140 GB 的梯度交换,零拷贝避免了在 CPU 和主内存之间移动 280 GB 的数据,从而回收了可观的内存带宽(BW)。↩︎
DLRM
Meta 2019 年用于点击率预测的架构,其中嵌入表可能超过 100 GB,必须跨工作进程分片。每次前向传播都会触发 AllToAll 来交换稀疏嵌入查找,形成了一种消息大小较小(数百 KB)但扇出为 𝒪(N) 的通信模式,使 DLRM 成为生产环境中对延迟最敏感的分布式工作负载之一。↩︎
专家混合模型
一种架构,其中每个 token 仅激活一部分专用子网络(专家),在保持模型总容量不变的同时降低了每 token 的 FLOPs。其系统权衡十分明显:MoE 用对延迟敏感的 AllToAll 取代了密集模型中受带宽限制的 AllReduce,将通信瓶颈从 β 转移到了 α,并产生了 𝒪(N²) 的竞争,限制了实际集群的规模。↩︎
FSDP(全分片数据并行)
PyTorch 的全分片实现遵循了 ZeRO-3 将参数、梯度和优化器状态跨 N 个加速器分片的思路(Rajbhandari et al. 2020)。其权衡在于通信频率:全分片增加了层级的 AllGather 和 ReduceScatter 操作,而不再仅依赖数据并行的步级 AllReduce,这使其对 α 开销更加敏感。↩︎
带宽最优
环形 AllReduce 达到了信息论下界 2(N − 1)/N ⋅ M/β 字节/节点,意味着无论拓扑或策略如何,没有正确的 AllReduce 算法能让每个节点移动更少的字节数。这种最优性成立的原因是:每个 GPU 必须从其他 GPU 接收 M(N − 1)/N 字节的“新”信息并贡献相同数量,而环形算法在每一步都饱和了每一条链路。↩︎
SHARP(可扩展分层聚合与归约协议)
Quantum InfiniBand 交换机上的网络内计算,在数据包遍历聚合树时执行归约操作(如求和、最小值和最大值)(Graham et al. 2020)。Graham 等人报告称,其归约带宽远高于基于主机的算法,并描述了未完成聚合组和树的交换机资源限制,当许多集合操作竞争相同的网络内资源时,这可能会产生竞争。↩︎
NCCL(NVIDIA 集合通信库)
NCCL 通过结合驻留在 GPU 上的集合操作、GPUDirect RDMA 和拓扑感知路径选择,可以在配置良好的 NVIDIA 集群上接近理论峰值带宽(Jeaugey 2017;NVIDIA 2026b)。其针对 NVIDIA 的专用设计造成了供应商锁定的权衡:组织可以为 NVIDIA GPU 网络获得一个调优过的集合通信后端,但会失去对 AMD(RCCL)或 Intel(oneCCL)硬件的可移植性。↩︎
MPI(消息传递接口)
MPI 于 1994 年 6 月在历时三年的社区努力后实现标准化,它定义了集合操作(AllReduce、Broadcast、Scatter),这些操作后来被 ML 框架全盘采用。对于 GPU 训练,标准 MPI 需要显式的设备到主机拷贝,这抵消了 GPUDirect 的优势,这也是 NCCL 取代它用于 GPU 集合操作的原因,而 MPI 仍沿用于作业启动(mpirun)和 CPU 侧协调。↩︎
故障率 (λ)
以 FIT(Failures In Time,每十亿器件小时故障数)表示,1 FIT 等于每十亿器件小时发生一次故障。MTBF 为 50,000 小时的数据中心 GPU,其 FIT = 20,000,对应 λ[hour] = 2.0 × 10^(−5) 次故障/小时。这对单个设备似乎微不足道,但在集群规模下却占主导地位:拥有 10,000 个 GPU 的集群,仅 GPU 就累积 200,000,000 FIT,相当于每 5 小时预期发生一次 GPU 故障。↩︎
泊松过程
一种统计模型,用于描述以恒定平均速率独立发生的事件。可靠性模型假设硬件故障服从泊松分布,从而得到指数生存函数 R(t) = e^(−λ**t)。这一假设简化了集群规划:一个 10,000 组件集群中至少发生一次故障的概率为 1 − e^(−Nλt),使得故障风险随 N 线性缩放,随 t 指数级缩放。↩︎
GPU MTBF 差异
本章将 50,000 小时作为 A100 级别的规划常数使用,而非对每个部署的 GPU 的担保。来自 Google TPUv4 pod 和 Meta GPU 集群的已发布车队研究表明,现场可靠性取决于拓扑、散热、工作负载和运维实践(Zu et al. 2024;Kokolis et al. 2025;Dubey et al. 2024)。因此,该规划常数为算术计算提供了基准,而运维人员在拥有实测车队故障率时应予以替代。↩︎
Young-Daly 公式
J. W. Young 在 1974 年《ACM 通讯》的一篇论文中推导出了一阶最优检查点间隔;John Daly 于 2006 年独立地用更紧的二阶界对其进行了改进(Young 1974;Daly 2006)。该公式的平方根关系 \((\tau\_{\text{opt}} = \sqrt{2 \cdot T\_{\text{write}} \cdot \text{MTBF}\_{\text{system}}})\) 意味着将系统 MTBF 减半仅会使最优检查点频率增加 \(\sqrt{2}\approx 1.4\times\),这解释了为什么集群规模翻倍并不要求检查点 I/O 带宽翻倍。↩︎
单粒子翻转
源自粒子物理学,其中“翻转”指非破坏性的状态改变。宇宙射线和芯片封装材料中的 α 粒子可翻转内存和逻辑中的比特;观测到的比特翻转率取决于海拔、工艺技术、封装材料、屏蔽和工作负载(Ziegler et al. 1996;Baumann 2005)。ECC 内存可纠正单比特错误,但无法处理同一字中的所有多比特翻转,留下了残余的静默数据损坏风险,这种风险会在大规模 ML 训练的 TB 级状态中累积。↩︎
静默数据损坏 (SDC)
在车队规模下,SDC 可能绕过正常的异常处理路径:基础设施研究记录了有缺陷的硬件产生看似有效但错误的结果,而 DRAM 现场研究表明内存错误足够常见,以至于车队级监控至关重要。对 ML 训练而言,实际的调试后果是:没有错误消息并不意味着计算正确;系统需要对损失、梯度和模型状态进行统计检查。↩︎
术语表
86. Byzantine-Resilient ML (拜占庭容错 ML)
以 Lamport 1982 年的“拜占庭将军问题”命名,这些算法(Krum、trimmed mean、signSGD)能容忍一定比例的损坏工作节点,具体容忍界限取决于算法和假设。权衡是具体的:对于 N 个工作节点,Krum 需要对工作节点梯度进行成对距离计算,因此开销随工作节点数量呈二次方增长,直接与数据并行的吞吐量增益竞争(Blanchard et al. 2017)。
87. Burn-in Testing (烧机测试)
组件在升高的温度(85–125 摄氏度)和电压下运行 24–168 小时,以在生产前暴露早期失效故障。大型运营商可能在部署前对加速器进行烧机测试,减少全新裸金属硬件可能在早期作业中暴露的早期失效故障。
88. Electromigration (电迁移)
导体中金属原子在电子动量传递下的逐渐位移,最早于早期电迁移研究中被表征,后在 Black 可靠性方程中建模(Black 1969)。平均故障时间随电流密度和温度升高而降低,因此持续的高功率加速器工作负载使得热管理成为车队寿命的直接决定因素。
89. RecSys Freshness (推荐系统时效性)
Meta 的 DLRM 基础设施文档指出,以小时为单位测量的嵌入陈旧度会导致推荐相关性和参与度指标出现可测量的下降。这颠倒了典型的容错优先级:对于推荐系统,最小化恢复时间比最小化检查点开销更重要,因为陈旧的嵌入会直接减少收入。
90. IEEE 754
IEEE 754 浮点数标准定义了 binary32 格式,包含 1 个符号位、8 个指数位和 23 个小数位(IEEE Standards Association 2019)。位布局给 ML 带来了不对称的脆弱性:符号位翻转会完全反转权重(0.5 → −0.5),而指数位翻转会使数量级偏移数个数量级,因此弹性机制通常优先保护最敏感的位位置,而不是同等对待所有位。
91. GPU Fault Rates (GPU 故障率)
GPU 在单个封装中集成了数千个执行通道和高带宽内存堆栈。ML 加速器还运行持续的高功率内核,其中包含大量正在传输的权重、激活和梯度数据,因此瞬态故障可能同时影响计算和通信状态。
92. MTBF (Mean Time Between Failures,平均无故障时间)
由美国军方在 MIL-HDBK-217 (1965) 中形式化,MTBF 假设在使用寿命期间服从指数失效分布。对于 ML 训练,MTBF 直接代入 Young-Daly 公式:一个拥有 50,000 小时单设备 MTBF 和 1,000 个设备的集群,系统 MTBF 为 50 小时,要求每 1–2 小时进行一次检查点,以将因故障浪费的计算控制在总训练时间的 1% 以下。
93. Network Partition (网络分区)
网络分区导致一部分工作节点无法与另一部分通信。在同步训练中,即使只有一个分区的秩(rank)也会阻塞整个 AllReduce 集体通信操作,这使得分区容错成为运行时间足够长、足以遇到常规结构或控制平面中断的训练作业的前提条件。
94. InfiniBand Subnet Manager (SM) (InfiniBand 子网管理器)
一个集中的软件实体,负责发现所有节点和交换机,分配本地标识符(LIDs),并计算路由表。在网络分区中,SM 的作用至关重要:它必须重新发现新的拓扑并更新路由,训练才能安全恢复。如果 SM 本身被分区,结构可能进入“僵尸”状态——节点物理连接但无法路由消息,这是大规模训练运行中 T_detect 延迟的常见原因。
95. Electromigration (电迁移)
导体中金属原子在电子动量传递下的逐渐位移,最早于早期电迁移研究中被表征,后在 Black 可靠性方程中建模(Black 1969)。平均故障时间随电流密度和温度升高而降低,因此持续的高功率加速器工作负载使得热管理成为车队寿命的直接决定因素。
96. Oxide Breakdown (氧化层击穿)
栅极氧化层的不可逆故障,在晶体管绝缘体中形成导电路径。栅极氧化层厚度从 1980 年代工艺的约 100 nm 缩小到 FinFET 时代器件的纳米级尺寸,增加了易感性。时间相关介质击穿(TDDB)制约着芯片可靠性预测,使得氧化层完整性成为跨越 3–5 年硬件刷新周期的 ML 加速器部署的车队规划关注点。
97. Thermal Stress (热应力)
反复温度循环导致的退化,会使焊点开裂和热界面材料劣化。在持续训练负载下,ML 加速器可能会因时钟频率降低以防止损坏而发生热节流。权衡是直接的:激进冷却(液冷、浸没式)可延长组件寿命并维持训练吞吐量,但会增加数据中心基础设施成本,因此冷却方案必须同时针对可靠性和设施成本进行评估。
98. Checkpoint-Restart (检查点-重启)
起源于 1960 年代大型机批处理,当时从头重启数小时的作业代价高昂。大规模分布式训练作业可每 10–30 分钟对 100+ GB 的模型状态进行检查点;Google 的 TPUv4 弹性研究报告了协调检查点和重配置,将节点故障导致的浪费计算控制在总训练时间的 1% 以下。
99. Scan Chains (扫描链)
将内部触发器链接成移位寄存器的测试基础设施,开发于 1970 年代,用于 IC 可测性设计。权衡是具体的:5–15% 的硅面积开销换取 95%+ 的制造故障覆盖率。对于矩阵乘法单元中包含数十亿晶体管的 ML 加速器,烧机期间基于扫描链的测试能捕获卡住故障(stuck-at faults),否则这些故障会在生产中静默地破坏权重和梯度计算。
100. Hamming Codes (1950) (海明码)
Richard Hamming 在贝尔实验室发明纠错码,缘于中继计算机故障反复破坏周末批处理作业的挫败感。其 SECDED(单错纠正、双错检测)方案在 2 的幂次位置使用奇偶校验位,以 O(log n) 的开销定位错误。ECC 内存模块源于此设计,保护 ML 训练中 TB 级的模型权重和优化器状态,免受原本会静默累积的软错误影响。
101. CRC (Cyclic Redundancy Check) (循环冗余校验)
由 Peterson 和 Brown 引入的多项式校验和家族(1961)。CRC 覆盖范围取决于多项式、帧长和错误模型;最好将其理解为一种低成本检测层,而非通用保证。在分布式 ML 训练中,校验和或哈希可验证集体通信期间交换的梯度载荷;没有验证层,损坏的梯度包会静默毒害集体中每个工作节点的参数更新。
102. DMR(双模块冗余)
复制计算并对比输出以检测差异,硅片开销为 100%,而 TMR 为 200%。DMR 只能检测到不匹配,无法自行选出正确输出,因此其覆盖率取决于比较器、故障模型和安全降级策略。特斯拉的全自驾驶计算机在两个独立的 SoC 间采用了 DMR,体现了这种设计权衡:DMR 将 TMR 的硬件成本减半,但当输出不一致时要求有安全降级策略(Bannon 等 2019)。↩︎
103. TMR(三模块冗余)
执行三次计算并采用多数表决,可在 200% 硬件开销下实现自动单故障纠错。最早应用于 1950 年代的早期容错大型机,TMR 仍是一种长期存在的模式,适用于辐射环境和安全关键型推理场景,在这些场景中单故障纠错比硬件效率更重要。↩︎
104. 内存泄漏
一种编程错误,即分配的内存从未被释放。在 ML 系统中,GPU 内存泄漏具有独特的破坏性,因为加速器内存稀缺(每设备 40–80 GB)且由整个训练流水线共享。每批次泄漏一个张量——可能源于遗留在生产环境中的调试钩子——就能在数小时内耗尽 GPU 内存,导致无声的 OOM 故障,在无检查点的情况下终结长时间运行的训练作业。↩︎
105. 竞态条件
一种时序 Bug,系统行为取决于不可控的并发事件序列。在异步分布式训练中,如果多个工作进程在无适当加锁或版本控制的情况下同时更新同一参数权重,更新可能丢失或被覆盖,导致发散或“幽灵”权重,在不触发错误的情况下破坏收敛。↩︎
106. 死锁
一种状态,两个或多个进程永久阻塞,每个都在等待另一个释放资源。在流水线训练中,若阶段 1 等待空闲缓冲区将激活值发送给阶段 2,而阶段 2 等待阶段 1 接收反向梯度,则会发生死锁,导致整个机群停摆。↩︎
107. FPGA(现场可编程门阵列)
包含数百万可编程逻辑块的可重构硬件。用于故障注入时,FPGA 能提供软件工具无法匹敌的比特级定向精度。↩︎
108. Adam 优化器状态
自适应矩估计(Adam)维护每个参数的一阶矩(m)和二阶矩(v)估计,与原版 SGD 相比内存需求增加两倍(3×:参数 + 两个状态向量)。对于 1750 亿参数模型,仅优化器状态就达 2.1 TB,通常主导检查点大小和恢复时间,使优化器状态成为检查点 I/O 设计的主要瓶颈。↩︎
109. 异步检查点
通过 CUDA 流将 GPU 状态暂存至 CPU 内存,再由后台线程写入存储,将检查点写入流水线化至训练计算之后。DeepSpeed 等实现在有足够的 CPU 暂存内存时,可使检查点开销趋近于极低,以更高的峰值主机内存消耗为代价,将检查点 I/O 延迟从训练关键路径上解耦。↩︎
110. 两阶段提交(2PC)
由 Gray 形式化(1978),2PC 确保所有参与者要么全部提交,要么全部中止,实现原子性。该协议的已知弱点是阻塞:若协调者在准备和提交之间故障,参与者将无限期等待。对于分布式检查点而言,这种阻塞是可以接受的,因为卡住的检查点可超时重试,而另一种选择(部分检查点写入)会留下无法恢复的不一致状态。↩︎
111. 分片检查点
每个工作进程仅保存其本地分区,而非汇聚状态至单一写入者。对于用 1,024 个工作进程训练 1750 亿参数模型的 ZeRO-3 或 FSDP,每个工作进程写入约 3.6 GB,而非由单一写入者处理 3.7 TB,实现了跨所有节点的 I/O 并行化。权衡在于:恢复要求所有分片必须存在且一致,使检查点协议更复杂,且任意单个分片的存储故障都会导致整个检查点失效。↩︎
112. NCCL 超时
NVIDIA 的集合通信库暴露了传输和 RAS 超时控制,如 NCCL_IB_TIMEOUT 和 NCCL_RAS_TIMEOUT_FACTOR(NVIDIA 2026b)。高层启动和分布式训练框架可添加自身的重启和操作超时行为(PyTorch Contributors 2026b)。激进的超时设置能加速故障检测,但在大模型的合法长集合操作期间可能误报,迫使在检测延迟和训练稳定性之间做无通用最优解的权衡。↩︎
113. 汇合
源自法语“rendez‑vous”(到场),这种协调协议要求所有存活工作进程相互发现并就新群组成员资格达成一致,训练才能恢复。该协议的代价是一个同步屏障,阻塞所有工作进程直到最慢者到达,造成与集群异构性成正比的恢复延迟。↩︎
114. 汇合
源自法语“rendez‑vous”(到场),这种协调协议要求所有存活工作进程相互发现并就新群组成员资格达成一致,训练才能恢复。该协议的代价是一个同步屏障,阻塞所有工作进程直到最慢者到达,造成与集群异构性成正比的恢复延迟。↩︎
115. KV 缓存
存储所有注意力层中所有过往 token 的键和值投影,规模随 2 × N[L] × H[KV] × S × d[head] × bytes 缩放。对于具有 80 层、8 个键值头、128K 上下文、128 维头、BF16 存储的 Llama 系 700 亿模型,KV 缓存每轮对话约 43 GB;若使用 64 个独立键值头则约 344 GB。故障时丢失此状态将强制重新生成所有过往 token,将亚秒级故障转移变为分钟级重算,违反服务延迟 SLA。↩︎
116. 熔断器
得名于过载时切断电源的电气安全装置。在软件中(由 Michael Nygard 2007 年著作《Release It!》推广),该模式封装服务调用,在失败阈值后“跳闸断开”,快速失败而非等待失效依赖。对 ML 服务而言,这能防止单个故障模型副本或特征存储耗尽连接池,导致级联故障蔓延至整个推理机群。↩︎
117. 海森堡 Bug
约 1983 年在黑客文化中创造,由 Jim Gray 在 1985 年的计算机故障分析中形式化,双关海森堡不确定性原理。因添加检测手段改变了时序,该 Bug 在观测下消失。在分布式 ML 训练中尤为隐蔽:插入梯度日志会改变 NCCL 集合时序,掩盖了导致无声数据损坏的竞态条件。↩︎
118. NaN 传播
IEEE 754 规定任何涉及 NaN 的算术运算结果均为 NaN,意味着一次梯度计算中的单个 NaN 会无声地损坏所有下游参数更新。ML 训练中的常见触发因素包括归一化层中的除零(方差为零的批归一化)、非正值求对数、FP16 上溢至无穷大。若无逐步 NaN 检测,整个训练运行可能在监控报警触发前就产出满是 NaN 权重的模型。↩︎
119. 混合精度数值问题
FP16 的动态范围仅跨度 6 × 10^(−8) 至 65,504,而 FP32 为 1.2 × 10^(−38) 至 3.4 × 10³⁸。损失缩放(反向传播前将损失乘以 1,024,随后除以梯度)可防止下溢,但上溢仍会触发自动跳过步骤,从而浪费算力。BF16 通过匹配 FP32 的指数范围缓解了此问题,代价是降低了尾数精度,用数值分辨率换取了训练稳定性。 ↩︎
120. 群组调度
由 Ousterhout 于 1982 年针对并行系统形式化提出,其中“Ousterhout 矩阵”在同步时间片内跨处理器协同调度相关线程。在 ML 集群中,约束更为严格:同步 AllReduce 要求所有 Worker 同时参与,因此部分分配会导致持有资源 100% 被浪费,而不仅仅是降低吞吐量。按本章假设的云等价 2 美元/GPU-小时场景,一个 1,024 GPU 的作业持有 900 个空闲 GPU 等待剩余 124 个,每小时将燃烧约 1,800 美元。 ↩︎
121. 置放群组
一种云原生抽象(AWS、GCP),请求实例被置放在单个高带宽、低延迟的网络域内。对于 ML Fleet,置放群组充当拓扑契约,保证 AllReduce 所需的二分带宽(BW[bisect]),防止出现“拓扑抽奖”现象——即节点分散在不同的数据中心机架中。 ↩︎
122. CAP 定理
由 Brewer 于 2000 年猜想,Gilbert 和 Lynch 于 2002 年证明。CAP 定理确立了没有任何分布式数据系统能同时保证一致性、可用性和分区容错性。对于 ML 调度器,应将 CAP 用作设计类比,而非产品宣称:具体的策略问题在于控制平面在分配、回收或重新调度昂贵的加速器前,能接受多少不确定性。 ↩︎
123. 装箱问题
一维版本是 NP-hard 问题;ML 调度增加了四到五个维度(GPU、CPU、内存、网络、拓扑),使得对于超过几百节点的集群,精确解变得不可行。首次适应递减启发式算法在典型工作负载下能达到最优解的 11/9,但 ML 集群的真实成本不在于装箱的次优,而在于碎片化:孤立的 GPU 单个无法满足任何待调度作业,但合起来却代表了数百万美元的闲置算力。 ↩︎
124. 请求与保持死锁
资源分配系统中导致死锁的四个经典充分必要条件之一。在 GPU 集群中,该条件的代价极高:两个作业各持有 500 个 GPU 并等待 200 个更多 GPU,将导致 1,000 个 GPU 无限期搁置,每小时燃烧约 2,000 美元。群组调度通过构造原子性的全有或全无分配消除了请求与保持,代价是降低了装箱灵活性。 ↩︎
125. Slurm 工作负载管理器
最初名为“SLURM”,是 Simple Linux Utility for Resource Management 的首字母缩写,该项目于 2012 年放弃了全大写缩写形式。自 2002 年起在劳伦斯利弗莫尔国家实验室开发,Slurm 的中心化控制器(slurmctld)维护资源分配的单一权威视图。在超大规模下,运维人员可对机群进行分区或联邦化调度器,以保持调度延迟、策略隔离和故障域的可管理性。 ↩︎
126. 控制器模式(协调循环)
一种“电平触发”设计,控制器持续对比期望状态与实际状态,相较于响应单个事件的“边沿触发”系统。该区别对 ML 集群至关重要:若控制器崩溃重启,它会重读当前状态并自愈,无需事件日志。权衡在于多个独立控制器间的涌现交互可能产生难以按顺序调试的意外调度行为。 ↩︎
127. 多实例 GPU (MIG)
随 A100(2020 年)引入,MIG 将单个 GPU 划分为最多 7 个硬件隔离的实例,每个实例拥有专用内存控制器、L2 缓存切片和计算单元(NVIDIA Corporation 2020)。隔离在硬件层面强制执行,而非通过时间切片,相较于纯软件共享减少了嘈杂邻居干扰。权衡在于刚性:若不清空所有工作负载,分区配置文件无法更改,使得 MIG 不适合工作负载组合快速变化的集群。 ↩︎
128. 嘈杂邻居
源自多租户住房的隐喻,一位住户的活动(大声音乐)打扰另一位的安宁。在 GPU 集群中,当某作业突发的网络流量或内存总线利用率拖慢同节点上的共置作业时,就会发生此情况。对分布式训练而言,嘈杂邻居致命地破坏了效率,因为最慢的数据流决定了全局 AllReduce 时间。 ↩︎
129. Volcano
由华为开源,现为 CNCF 孵化项目,Volcano 完全替换 Kubernetes 默认调度器,通过其 PodGroup CRD 增加群组调度。替换式方案为多 Pod ML 训练作业提供了强原子性保证,但带来运维风险:Volcano 的 Bug 将影响集群上所有调度决策,而非仅批处理工作负载。 ↩︎
130. Kueue
由 Google 开发,Kueue 将准入控制(作业何时进入集群)与调度(Pod 置放何处)分离,这与完全替换调度器的 Volcano 不同。这种侵入性较小的设计可部署在现有 Kubernetes 基础设施旁,且不干扰运行中工作负载,但它缺乏 Volcano 的强群组调度保证,迫使团队在部署安全性与调度原子性之间二选一。 ↩︎
131. 污点与容忍度
用于限制 Pod 置放的 Kubernetes 原语。节点上的污点会排斥所有未显式容忍该污点的 Pod。对于 ML Fleet,这是隔离专用硬件的主要机制:通过给 A100 节点加污点,编排器可防止通用 Web 服务“窃取”昂贵的 GPU 算力,确保这些节点保留给容忍该污点的训练作业。 ↩︎
132. 抢占式实例
得名于商品交易的“现货价格”(即时交割的当前市场价格),抢占式实例以 60% 至 90% 的折扣出售闲置云算力,提供商保留回收权。对 ML 训练而言,关键的非对称性在于中断通知窗口:AWS 提供 2 分钟,GCP 提供 30 秒。1750 亿参数模型需要 3 至 5 分钟进行检查点,因此 GCP 的 30 秒通知迫使团队要么承担持续检查点的开销,要么接受每次中断都丢失工作。 ↩︎
133. 获得服务调度
源自操作系统排队理论的一种规则,优先级随累计资源消耗增加而降低,在不需要 SRPT 所要求的未来知识前提下,近似理论最优的最短剩余处理时间(SRPT)策略。在 ML 集群中,此近似尤为有效,因为作业时长呈重尾分布:绝大多数提交作业是短实验,因此降低高服务量作业的优先级,无需用户提供其无法准确计算的运行时估计,即可正确识别出长时间运行的离群作业。 ↩︎
术语定义
Key-Value (KV) Cache
存储预计算的注意力键和值张量,以避免为每个新 token 重新计算整个序列的注意力。KV 缓存随序列长度和批次大小线性增长;对于具有 128K 上下文的 70B 模型,缓存的内存消耗可能超过模型权重。这种增长模式造成了一个基于计算的自动扩缩容器不可见的调度失效模式:在低计算利用率时 GPU 内存耗尽,导致请求停滞,即使 GPU 看起来处于空闲状态。
CUDA MPS (Multi-Process Service)
允许来自多个进程的内核在单个 GPU 上并发执行,消除了时间片轮转 10 到 20 ms 的上下文切换开销。MPS 每次内核启动增加约 5 到 10 微秒的开销,但不提供内存隔离:耗尽 GPU 内存的进程会导致所有共置工作负载崩溃。这使得 MPS 适用于受信任的同团队推理工作负载,但对于多租户环境很危险,因为单个行为异常的模型可能拖垮其邻居。
NUMA (Non-Uniform Memory Access)
本地内存访问约需 100 ns,而远程插槽访问需 150 到 200 ns,惩罚为 50 到 100%。对于 ML 推理预处理,将 CPU 核心放置在相对于 GPU 的 PCIe 连接错误的 NUMA 域上,会将此惩罚加到每次主机-设备传输上,使亚毫秒推理任务的 P99 延迟增加 10 到 30%。修复很简单(CPU 绑定和 NUMA 感知的 Pod 调度),但在 Kubernetes 部署中常被忽视,因为默认调度程序完全忽略 NUMA 拓扑。
HBM (High Bandwidth Memory)
通过垂直堆叠通过数千个硅通孔 (TSV) 连接的 DRAM 芯片来实现其带宽,这是一种最早由 SK Hynix 于 2013 年商业化的 3D 封装技术。尽管标榜“高带宽”,H100 上 HBM 的 3.35 TB/s 仍比片上 SRAM 访问慢 200–600 倍,使得内存层级差距成为性能优化的核心约束。
Roofline Model
最初的框架针对多核 CPU,但同样的天花板图也适用于加速器:两个数字(峰值 FLOP/s 和峰值带宽)定义了整个性能包络。这种简洁性同样指导 ML 推理的 GPU 采购决策,其中拐点决定了工作负载是受益于更快的计算还是更快的内存。
Ridge Point
Roofline 图上内存受限线和计算受限线的交点。它表示达到峰值硬件性能 (R[peak]) 所需的最小算术强度。对于 H100 GPU (FP16),拐点约为 295 FLOP/byte;如果算子的强度低于此“拐点”,它永远无法饱和 Tensor Cores,无论可用计算资源多少。
PagedAttention
直接类比操作系统虚拟内存分页命名,操作系统将非连续的物理页映射到连续的虚拟地址。vLLM 论文在 SOSP 2023 上提出了这一见解:同一机制消除了 KV 缓存中的内部碎片,恢复了因最坏情况预分配而浪费的 60–80% GPU 内存 (Kwon et al. 2023)。这一抽象单独改变了 LLM 服务经济,在不改变模型权重或精度的情况下实现了 2–4 倍更大的批次大小。
CUDA Graphs
在 CUDA 10 (2018) 中引入,最初用于每帧重放相同命令序列的图形渲染管线。严格的确定性要求——每次重放相同的操作、形状和内存地址——直接与 LLM 服务的动态形状和可变批次大小冲突,将其用途主要限制在计算模式每 token 重复的解码阶段。
Online Softmax
此处 Online 是一个算法术语,意味着计算以单次遍历增量处理数据,无需存储完整输入——与 online learning 或 online algorithms 同义。此特性使分块成为可能:算法从不需要同时在内存中拥有完整的 S × S 分数矩阵,将注意力内存从 𝒪(S²) 降低到 𝒪(S),使固定大小 SRAM 上的长上下文推理成为可能。
Outlier Features
大规模 Transformer 会出现激活幅度比典型值大达约 20 倍的“离群”维度 (Dettmers et al. 2022)。虽然这些离群值仅占所有特征的约 0.1%,但在 INT8 量化期间剪裁它们会破坏模型的推理能力。大模型的这一物理特性是训练后量化 (PTQ) 需要“离群感知”策略(如 LLM.int8() 或 Activation-Aware Weight Quantization (AWQ))的原因。
Straight-Through Estimator (STE)
Bengio 等人 (2013) 为硬随机神经元讨论了 STE,它处理了一个也出现在量化中的基本微积分问题:舍入函数的梯度几乎处处为零,按标准规则使得通过量化层的反向传播成为不可能。STE 将上游梯度作为替代梯度通过舍入步骤传递,假装舍入未发生。这种近似在实践中对训练具有离散或量化操作的网络很有用,但它是一种启发式方法,而非对每种 QAT 设置的普遍收敛保证。
TorchDynamo Bytecode Interception
通过挂钩 CPython 的帧评估函数 (PEP 523,Python 3.6 中添加),TorchDynamo 在 Python 解释器的最底层捕获计算图,低于任何源代码级抽象。这就是为什么它能追踪装饰器、闭包和击败早期追踪方法的第三方库。代价是与 CPython 内部紧密耦合:TorchDynamo 必须为每个新 Python 版本更新,且无法在 PyPy 等替代解释器上运行。
Triton
由 Tillet、Kung 和 Cox 作为用于分块神经网络计算的中间语言和编译器引入 (Tillet et al. 2019),后在 OpenAI 发展。关键设计决策是将 tile(分块)而非 thread(线程)作为基本编程抽象。这一选择直接镜像了 FlashAttention 的分块策略:程序员推理适合 SRAM 的数据块,编译器将这些块映射到 GPU 线程和共享内存。此抽象减少了对 warp 分歧、存储体冲突和合并访问等底层 CUDA 问题的暴露,同时保留了对决定 ML 内核性能的内存层级决策的控制。
Speculative Decoding
草稿模型可能生成目标模型拒绝的 token,因此该技术以额外的草稿模型计算换取目标模型内存带宽压力的降低。目标模型的权重从 HBM 加载一次以处理 K 个候选 token,当有足够 token 被接受时,实际上将解码阶段的算术强度提高了 K 倍。
Load Balancing (Inference)
GPU 推理请求耗时从 10 ms 到 30+ 秒不等,方差极高,这与在统一毫秒级完成的 Web 请求不同。这种方差使轮询和随机分配失效,强制采用队列深度感知的路由策略,虽增加监控开销,但能防止异构 GPU 队列中的尾部延迟爆炸。
149. HBM3(高带宽内存 3)
在 H100 上提供 3.35 TB/s 的 3D 堆叠 DRAM,而 A100 上的 HBM2e 为 2.04 TB/s。由于大语言模型(LLM)解码受限于内存带宽,这一改进直接转化为更高的每秒 Token 数和更大的可行批次大小,使 HBM 代际成为推理每 Token 成本的一个主要变量。
150. DLRM
Meta 2019 年的参考架构将稠密特征——受 GPU 约束的多层感知机(MLP)——与稀疏特征(受 CPU 约束的嵌入查找)分离,创建了一种混合服务拓扑(Naumov 等人,2019)。生产推荐系统的特征分析表明了这种结构为何对服务至关重要:以嵌入为主的推荐模型产生的内存访问和容量约束,与稠密的 CNN、RNN 或 LLM 推理截然不同(Gupta 等人,2020)。
151. TTFT 与 TPOT
首 Token 时间(预填充)决定了感知上的响应速度;每输出 Token 时间(解码)决定了感知上的阅读速度。人类阅读速度约为 5–10 tokens/sec;TPOT 高于约 100–200 ms 会开始让人感觉比自然阅读慢,而许多产品瞄准更低的 TPOT 以实现流畅流式传输。这种双重服务级别协议(SLA)要求迫使调度器优先处理解码 Token 而非新的预填充提示。
152. 零拷贝序列化
FlatBuffers 和 Cap’n Proto 就地访问线缆格式数据,消除了 Protocol Buffers 或 JavaScript 对象表示法(JSON)的解析-分配-拷贝循环。对于具有大型激活张量的分布式推理,这将每跳序列化开销从毫秒级降至微秒级,回收了本将消耗紧张 SLO 5–10 percent 的延迟预算。
153. vLLM(虚拟 LLM)
其名称暗示了核心设计:将操作系统风格的虚拟内存应用于 KV 缓存管理,将逻辑序列地址与物理 GPU 内存解耦。由 UC Berkeley 开发(2023),vLLM 相比 FasterTransformer 实现了 2–4× 的吞吐量提升,相比 HuggingFace Transformers 高达 24×,通过消除先前服务系统中限制批次大小的 60–80 percent 内存碎片(Kwon 等人,2023)。
154. 利特尔定律
源自排队论,Q[req] = λ[arr] * T[lat],因此并发数等于到达率乘以延迟。对于服务集群,这定义了容量包络:若一张 GPU 可处理 32 个并发请求,每个耗时 100 ms,则最大到达率为 320 req/s。超过此值,随着利用率趋近 1,队列将迅速增长,尾部延迟(L[lat])将急剧上升。
155. Orca(迭代级调度)
由 Yu 等人(2022)提出,Orca 证明了在迭代粒度而非请求粒度上调度,允许序列在每个解码步骤进入和退出批次。这消耗了静态批处理中浪费 50 percent+ GPU 算力的队头阻塞,并确立了 vLLM 等 LLM 服务系统采用的调度范式。
156. 算术强度(预填充 vs. 解码)
以 FLOP/byte(访问内存字节数)衡量,该比率决定工作负载是计算受限还是带宽受限。预填充达到 100+ FLOP/byte(计算受限);解码仅达 1–10 FLOP/byte(带宽受限)。这一 10–100× 的差距,就是为何在单个批次中混合两个阶段会浪费算力或带宽,从而激励了分离式服务架构的出现。
157. 分块预填充
若无分块,长提示会在预填充完成前阻塞解码,违反并发用户的 Token 间延迟 SLO。分块将提示划分为较小的工作单元,在解码迭代间处理,以略微增加的总预填充时间为代价,限制了解码停顿。这种权衡是经典的延迟与吞吐决策:交互式应用倾向于更小的分块;批处理工作负载可倾向于更大的分块。
158. MoE(专家混合)服务权衡
每个 Token 仅激活一部分专家(通常为 8–16 选 2),在保持单 Token FLOPs 低位的同时,总参数量达数千亿。服务约束在于:即使大多数专家在给定 Token 上闲置,所有专家权重仍须驻留内存,导致内存占用相较活跃计算膨胀 4–8×。这迫使专家并行跨越设备,并在每个 MoE 层进行 AllToAll 通信。
159. NVLink 带宽演进
从早期 NVLink 实现的双向 160 GB/s,到 Hopper 级 GPU 的 900 GB/s,再到 Blackwell 级 GPU 的 1.8 TB/s——跨越三代硬件约 10× 的提升。这种带宽增长使得 8 张 GPU 的节点内张量并行成为现实,通信开销低于 5 percent,直接决定了无需跨越较慢的跨节点互联即可服务的最大模型规模。
160. 球入箱(两次选择的幂)
随机放置下,最大箱负载为 Θ(log R / log log R);若有两次随机选择并贪婪选取,则降至 Θ(log log R)。对于 1,000 台服务器 的推理集群,这将最坏情况队列深度从约 5 降至约 2,在仅增加每请求一次额外队列长度探测开销的情况下,将 P99 尾部延迟减少近一半。
161. 一致性哈希
一种基于环的负载分发算法,最初部署于 Akamai 用于 CDN 路由。服务器映射到虚拟环上,使得增减节点平均仅重映射 K/N[servers] 个键。对于 LLM 服务,这种最小干扰特性在自动扩缩容事件中保留了 KV 缓存局部性:没有它,每次扩容都会使整个集群的缓存对话状态失效,迫使昂贵的重新计算。
162. 熔断器
得名于在电线过热前切断电流的电气安全装置。在推理服务中,三态机(关闭、打开、半开)防止单个过载的 GPU 副本将故障级联至整个集群:一旦错误率超阈值,熔断器打开并快速失败请求(微秒级),而非等待超时(秒级),保护上游调用方并为健康副本保留容量。
163. 舱壁模式
得名于将洪水限制在隔离舱段的船舱壁。泰坦尼克号的舱壁失效是因为未延伸至船体顶部,导致倾斜时海水级联溢越。对多租户推理的教训:带软配额的共享 GPU 池仅提供部分隔离,单个租户的突发流量可耗尽内存或饱和带宽,影响所有其他租户。有效的舱壁要求为关键租户提供专用硬件资源。
164. MIG(多实例 GPU)
随 NVIDIA A100 推出(NVIDIA Corporation 2020),MIG 将单张 GPU 空间划分为多达 7 个隔离实例,各拥有专用计算 SM、内存带宽和 L2 缓存。与分时复用共享资源并引入 2–5× 延迟方差不同,MIG 提供硬件级强隔离和可预测性能,当分区大小匹配模型需求时,成为在单张昂贵数据中心 GPU 上服务多个小模型的有力机制。
脚注
165. 冷启动(GPU 与无服务器对比)
无服务器函数冷启动时间为 100 毫秒–1 秒;GPU 推理冷启动时间为 1–10 分钟,原因是 GPU 分配、模型权重传输以及 CUDA 上下文初始化。这种 100 倍的差距意味着仅依靠反应式自动扩展无法吸收流量峰值,因此预测性扩展和温度池成为任何具有延迟 SLO 的 GPU 推理集群的基本设计要求。↩︎
166. 抢占式实例经济性
云服务提供商会以大幅折扣出售未使用的 GPU 容量,有时伴随 30 秒至 2 分钟的终止提前通知。对于推理任务,终止会导致正在进行的请求和 KV 缓存状态被销毁,因而需要优雅的排空逻辑和快速的请求重新路由。对于突发和尽力而为的流量层级,这种复杂性可能被节省的成本所证明,但在对 SLO 有严格要求的路径上则不适用,因为终止会违反延迟保证。↩︎
167. 语义缓存
返回与查询在嵌入相似度上相似而非完全字符串相同的查询的缓存响应,这需要对每个请求进行向量数据库查找。其权衡在于:命中率可能更高(对于开放式工作负载可达 2–3 倍),但代价是增加的查找延迟(1–5 毫秒)以及当语义相似的查询需要不同答案时可能出现错误命中的风险。设置相似度阈值涉及精度与召回的权衡,直接影响响应的正确性。↩︎
168. 量化中的黑塞矩阵
黑塞矩阵 H = X^(T)X 捕捉二阶敏感性:对角线条目较大的权重对模型输出具有非比寻常的影响。GPTQ 利用这一特性,激进地对不敏感的权重进行量化,同时保留敏感权重,实现 3–4 位量化,且困惑度降低少于 1%。若未使用黑塞矩阵引导,则低于 8 位的天真的均匀量化通常会破坏模型质量。↩︎
169. GPTQ 列式更新
GPTQ 通过 Cholesky 分解对逆黑塞矩阵 H^(-1) 进行因式分解,使得补偿成为一个稳定的三角更新:在对列 q 进行取整后,残差误差将以 [H^(-1)][:, q + 1 :] / [H^(-1)][q, q] 的权重传播到列 q + 1 及以后。这种分解避免了为每一列重新计算完整的逆矩阵,将工作量从天真的 O(d[row] * d[col]³) 降低至 O(d[row] * d[col]²)。按组缩放(组大小 128)使得异常通道相比单一全矩阵缩放能获得更细致的步长。↩︎
170. QuaRot 中的阿达玛旋转
QuaRot 将激活值变换为 X' = X * H,将权重变换为 W' = H^(T) * W,其中 H 是一个结构化计算且不存储的正交阿达玛矩阵。正交性确保 XW = X'W'^(T),因而层输出保持不变。离群值分散效应十分具体:向量 [1000, 1, 1, 1](其中含有一个极端值)在变换后变为大约 [502, 500, 500, 500],因此没有单一坐标会主导量化范围。↩︎
171. TPU 用于推理
TPU 收敛阵列为排名风格的推理提供确定性且低方差的矩阵执行。GPU 的延迟会随批次组成而变化,而 TPU 风格的执行则能在严格的搜索 SLO 下提供一致的每请求时序,其中 P99 延迟直接影响收益。↩︎
172. 双塔架构
通过独立的神经网络(“塔”)将用户特征和物品特征编码为嵌入向量,然后通过点积进行评分。其服务优势在于:物品嵌入可以离线预计算并缓存,从而在线推理时仅需执行用户塔的前向传播,随后进行亚毫秒级向量相似度查找。权衡在于:由于塔在编码过程中无法相互关注对方的特征,晚期交互能力减少,导致模型表达能力下降。↩︎
173. A11 仿生芯片(2017)
苹果首款搭载专用神经引擎的片上系统(SoC),机器学习推理工作负载的峰值性能可达每秒 600 亿次运算。其系统影响在于:移动神经处理单元(NPU)被确立为一个独立的功耗域;当推理优化的硅芯片释放出热量余量时,本地短时训练或个性化突发变得更加可行。↩︎
174. 隐私保护(差分隐私)
虽然联邦学习避免了原始数据的传输,但研究表明原始梯度可能被“反向推导”以重建输入样本。差分隐私通过在任意一条记录或用户在给定邻接定义下贡献的隐私损失上添加校准噪声来加以限制;它能降低推理风险,但保证的强度取决于 ε、δ、组合以及实现质量。↩︎
175. GDPR(通用数据保护条例)
自 2018 年 5 月起生效,GDPR 要求对个人数据处理具备合法依据、数据最小化、目的限制以及权利处理流程。在敏感场景下可能需要显式同意,但它并不是唯一的合法依据。设备端学习可以减少传输到集中系统的个人数据量,并可简化某些跨境和数据保留问题,但部署仍需根据数据和使用场景配备适当的同意、权利和治理机制。↩︎
176. HIPAA(健康保险可携带和责任法案)
要求被实体及其业务伙伴对受保护的健康信息(PHI)实施行政、物理和技术防护措施。云服务若在被实体或业务伙伴名称下创建、接收、维护或传输电子 PHI,通常需要签署适当的业务伙伴协议并遵守安全规则控制。设备端学习可以降低 PHI 传输和供应商管理风险,但它不会消除医疗保健部署中受范围约束的 HIPAA 义务。↩︎
177. 差分隐私(DP)
一种通过向计算添加校准噪声来限制信息泄露的数学框架。在边缘学习中,该噪声成为系统开销,因为噪声更大的更新通常需要更多轮次或更多数据才能达到相同的实用水平。第 13 章阐述了形式化的隐私预算机制。↩︎
178. Gboard(2017)
首批广泛报道的移动规模联邦学习商业部署之一。已发布的报告表明,键盘模型可通过设备端聚合更新得到改善,而原始输入文本仍保持本地化。其系统影响十分持久:压缩的更新和隐私机制使得在受限的移动网络上实现跨车队学习成为可能,且无需集中原始按键数据。↩︎
179. 联邦学习
得名于与政治联邦(例如,美利坚合众国)的直接类比:个体州(设备)在其数据上保持本地自治,同时参与全球联盟以改进一个共享模型。这种去中心化是减少原始数据迁移并支持数据驻留或受监管数据需求的一种机制,但法律合规性仍取决于部署环境、治理控制以及围绕模型更新的隐私保证。↩︎
180. 唤醒词检测
持续关键词检测通常运行在亚毫瓦至低毫瓦功率范围内,远低于全语音识别,使用针对亚 100 毫秒延迟和极低误激活率优化的紧凑型神经网络。这种极端功率限制定义了设计空间:模型必须足够小,才能在专用的始终开启处理器上运行,因而设备端个性化对于在不增加模型规模的前提下降低误激活率变得至关重要。↩︎
术语定义
Non-IID (Not Independent and Identically Distributed)
指样本并非从单一公共分布中抽取的数据,这是联邦学习中的默认条件,每个设备反映单个用户的模式。与 IID 基线相比,Non-IID 标签和特征分布可能会显著降低联邦平均法的效果(Zhao et al. 2018),迫使系统采用本地适配层或聚类聚合等技术以保持收敛。↩︎
Arduino Nano 33 BLE Sense
拥有 256 KB SRAM,约为旗舰智能手机 16 GB 内存的 1/65,536。单张 224×224×3 的 RGB 图像约占 151 KB,消耗约 60% 的可用内存。激活值和梯度存储会增加数个实时张量,优化器状态会使训练内存占用远超推理占用。这意味着即使是微小的卷积神经网络(CNN)层在反向传播期间也可能超出总 SRAM。这种内存墙使得 8 位或 4 位量化成为前提条件,而非单纯的优化手段。↩︎
MobileNet (2017)
Google 的架构通过深度可分离卷积,相较于标准 CNN 实现了 8–9 倍的 FLOPs 降低。系统层面的结果是:MobileNetV2 在 Pixel 手机上运行 ImageNet 分类约需 75 ms,而 ResNet-50 需 1.8 秒,跨越了实时设备端推理和适应在智能手机 2–3 W 功耗包络内热学可持续的阈值。↩︎
Depthwise Separable Convolutions (深度可分离卷积)
将标准卷积分解为逐通道深度卷积滤波器,后接 1×1 逐点组合。以 512 个输入/输出通道的 3×3 卷积为例,参数量从 2.4 M 降至约 267 K,减少 8.8 倍。这种节省不仅是理论上的:这种分解使得移动 CPU 上的实时 CNN 推理成为可能,并同等程度地减少了设备端训练期间激活缓存所需的内存。↩︎
STM32F4 Microcontroller
拥有 192 KB SRAM、168 MHz 主频和单精度 FPU,主要约束不在于缺乏浮点运算,而在于微小的内存和能量包络。一个具有 1000 个输入特征和 10 个隐藏单元的稠密层,在 FP32 下约需 40.040 KB 存储权重和偏置,在未计入激活值或梯度前即消耗约 20.854% 的总 SRAM。在约 100 mW 有源功耗下,即使是简单的梯度更新也必须占空循环,当精度允许时,INT8 或定点内核仍是首选。↩︎
ESP32
提供 520 KB SRAM 和双核 240 MHz 处理能力,内置 Wi-Fi 和蓝牙,使其成为结合本地适配与联邦协调实验的廉价平台。其 CPU 包含浮点支持,但为了吞吐量、内存占用和能效,通常首选定点和 8 位内核;紧凑的 8 位模型可放入约 50 KB,支持用于传感器异常检测的基本设备端适配。↩︎
Quantization-Aware Training (QAT,量化感知训练)
在训练期间模拟低精度算术,使模型尽管精度降低仍能学习鲁棒表示,这不同于事后将训练好的 FP32 模型转换的训练后量化(Jacob et al. 2018; Krishnamoorthi 2018)。系统收益在于更低的内存流量和更廉价的整数算术:硬件能量模型显示,低精度算术和内存移动比 FP32 计算廉价得多(Horowitz 2014)。确切的速度、能量和精度结果取决于处理器、内核实现、模型和校准数据。在边缘设备上,QAT 通常是使适配符合热学和内存预算的先决条件。↩︎
SGD (Stochastic Gradient Descent,随机梯度下降)
从单样本或小批量梯度更新参数,仅存储当前参数及其梯度。这种最小内存占用使 SGD 成为微控制器上极少数可行的优化器之一:Adaptive Moment Estimation (Adam) 需要 SGD 3 倍的内存用于其参数动量估计,超过了 <512 KB 设备的 SRAM 预算。权衡是收敛较慢,需要更多梯度步骤以达到相当精度。↩︎
Apple Neural Engine
从 A11(0.6 TOPS)到旗舰级移动 NPU(约 35 TOPS),移动神经加速在该设备系列中提升了约两个数量级。系统后果是:在典型计算中,于神经加速器上微调 MobileNet 分类器约需 2 秒,而在 CPU 上需 45 秒,且仅消耗约 500 mW 额外功耗。这种在极低功耗代价下约 23 倍的加速,使得设备端适配在正常手机使用期间热学上可行,允许紧凑的个性化任务作为短促的加速器辅助突发,在严格的热学和电池策略内运行。↩︎
Google Tensor SoC (2021)
将定制 ML 加速与 Android 及 TensorFlow Lite 工具链集成,是软硬协同设计用于设备端推理和联邦工作流的有力例证。系统后果在于:仅有加速器能力是不足的;本地适配还依赖于编译器支持、运行时算子、电源管理和更新编排。↩︎
Mixed-Precision Training (混合精度训练)
为不同操作分配不同数值精度:前向和后向传播用 FP16,参数累加用 FP32。这在拥有 Tensor Cores 的硬件上将内存用量减半、吞吐翻倍。移动端实现更进一步,推理用 INT8、梯度用 FP16,与全 FP32 相比将训练内存减少 4 倍,同时通过损失缩放将累加误差控制在界内。↩︎
Lightweight Transformers (轻量级 Transformer)
如 MobileBERT 等移动端优化架构,通过知识蒸馏和注意力头剪枝,在保持 BERT-base 97% 精度的前提下,实现比完整模型 4–6 倍的加速,移动 CPU 上推理约 40 ms,而完整 BERT 为 160 ms。对设备端学习而言的关键约束是:即便这些压缩后的 Transformer,训练激活仍需 50–200 MB,挤压中端手机 2–4 GB 的可用内存。↩︎
Near-Memory Computing (近存计算)
将处理单元置于存储阵列内或相邻,减少常规架构中往往主导算术能耗的数据移动(Horowitz 2014)。如 TensorDIMM 等近存加速器设计展示了将张量运算移近内存如何改善内存受限深度学习负载的吞吐和能效(Kwon and Rhu 2018)。对于边缘训练,梯度计算产生的写密集型访问模式会压垮缓存层级,这种架构转变可能使某些形式的设备端反向传播更切实可行。↩︎
Gradient Checkpointing (梯度检查点)
以计算换内存:在后向传播中重新计算选定的中间激活,而非存储所有激活。通用检查点结果是在额外前向计算代价下实现次线性激活内存(Chen et al. 2016)。在内存为约束瓶颈的边缘设备上,这种权衡可能决定模型是适配 2 GB 还是需要 8 GB RAM,但具体内存和计算因子取决于架构和调度。↩︎
TinyTL 内存节省
可训练参数约 68× 缩减(从 3.4 M 降至 50 K),使 MobileNetV2 的训练内存从约 20 MB(FP32 权重 + 激活值)骤降至约 600 KB,符合 1 MB 微控制器预算。在 STM32H7 上的实际部署达到全量微调精度的 85%,且更新仅耗时约 30 秒(对比 8 分钟),证明了仅偏置适配在受限硬件上以表达力换取可行性。
LoRA
Hu 等人(2021)提出学习秩 r 分解矩阵 A 和 B 而非更新完整权重矩阵,可将可训练参数减少 100–10,000×,同时保持大部分适配质量。对于设备端学习,这种压缩至关重要,但它影响的是适配器状态而非完整模型占用:一个 7B 参数模型在梯度、优化器状态和激活值之前约有 14 GB FP16 权重占用,而秩 16 LoRA 可将可训练适配器参数降至数十或数百 MB。实际手机部署仍需存储、量化或卸载冻结的基础模型。
“Hey Siri” 功耗预算
常开检测器在持续监听音频时功耗 <1 mW,在低功耗常开处理器而非主应用核心上运行紧凑声学模型。约束极其严苛:检测延迟 <100 ms,误激活率 <0.1 次/小时,跨口音和噪声条件的真阳性率 >95%。少样本个性化必须在此固定功耗和模型大小预算内提升精度,意味着适配只能调整分类器权重,无法扩展模型。
TinyML 规模
每年出货超 1000 亿颗微控制器,但因内存(<256 KB)和功耗(<1 mW)限制,支持设备端学习的不足 1%。已部署硬件与支持 ML 硬件的鸿沟定义了工程挑战:在成本低于 $1 的芯片上实现经验回放与适配,要求算法面向 KB 而非 GB 设计。
MFCC(梅尔频率倒谱系数)
应用梅尔频率刻度变形(强调语音集中的低频)后接倒谱分析的音频特征,将 320 采样的音频窗口(16 kHz 下 20 ms)从 640 字节压缩至约 12–13 个系数的 50 字节。这种 13× 压缩在保留语音可懂度的同时,使关键词检测在 KB 级内存中成为可能,该压缩比直接决定了少样本语音适配的回放缓冲容量。
Non-IID Data
“独立同分布”。云端通过打乱数据确保每批次代表全局分布。边缘端每个用户的数据天然有偏(Non-IID):东京用户多输入日文,伦敦用户多输入英文。这种偏差产生梯度发散,导致标准 FedAvg 收敛比中心化 SGD 慢 2–5×。
FedAvg
McMahan 等人(2017)提出平均模型权重而非单个梯度,允许每个客户端执行多步本地 SGD(通常 1–20 步)后再单次上传。相比分布式 SGD 可减少 10–100× 通信量,使联邦学习在上传带宽受限的移动网络上可行。权衡:本地步数越多通信效率越高,但在 Non-IID 数据上发散加剧,需按部署仔细调优。
无线上传不对称
LTE 上行平均 5–10 Mbps,下行 50+ Mbps,这种不对称瓶颈主导联邦学习设计。传输 50 MB 模型更新约消耗 100 mAh(电量 2–3%),耗时 40–80 秒。低功耗协议更差:LoRaWAN 最高 50 kbps 且占空比 1%,未压缩更新物理上不可行。这种不对称是为何梯度压缩非可选且架构层面必需的原因。
梯度量化
传输前将 FP32 梯度转为低精度(INT8、INT4 或 1-bit)。QSGD 和 signSGD 等技术表明,量化或仅符号更新可大幅降低通信量,依赖随机量化或误差补偿保持收敛行为(Alistarh et al. 2017;Bernstein et al. 2018)。实际字节减少量与精度影响取决于优化器、模型、数据异质性和残差处理方案。
梯度稀疏化
仅传输幅值最大的 1–10% 梯度,利用大多数梯度元素接近零、对收敛贡献极小的观察。本地梯度累积保存未传输的残差,直到其增长到足以发送,实现 10–100× 压缩且保持训练质量,这一模式用于稀疏化 SGD 和深度梯度压缩(Stich et al. 2018;Lin et al. 2018)。权衡:激进稀疏化可能使更新偏向频繁活跃参数,潜在降低罕见用户模式的个性化效果。
MAML
Finn 等人(2017)优化模型初始化,使一步或几步梯度即可在新任务上达良好性能,实验含 one-shot 和 few-shot 设置。元训练因需微分适配过程而比普通微调昂贵,但部署适配可限制为少量本地更新。这使 MAML 适用于推理算力廉价但训练数据稀缺的边缘场景。
模型反演攻击
通过优化输入以最大化置信度分数,从模型输出或梯度重构训练数据(Fredrikson et al. 2015;Zhu et al. 2019)。联邦学习中梯度更新比单纯模型输出泄露更多信息,因其直接暴露训练步信息。梯度扰动、安全聚合、差分隐私等防御引入协议、效用、通信或算力权衡,其幅度取决于威胁模型与部署。
成员推断攻击
利用训练数据(高置信、低损失)与未见数据的置信度鸿沟,判断特定数据点是否用于训练模型(Shokri et al. 2017)。已公开攻击在过拟合模型上显著优于随机猜测。个人数据上的联邦学习意味着攻击者可推断特定患者记录是否训练了健康模型,使正则化和差分隐私在威胁模型含训练数据泄露时成为架构层面的重要考量。
208. 安全聚合
安全聚合:一种加密协议,客户端成对交换随机掩码,这些掩码在服务端求和时相互抵消,仅揭示聚合梯度而不暴露个人贡献 (Bonawitz 等 2017)。Gboard 等生产规模的联邦系统将安全聚合与资格检查、离线处理和轮次调度相结合 (Bonawitz 等 2019)。通信开销和最低参与要求取决于协议参数和安全模型,因此聚合系统必须等待足够多的合格设备就绪后才能发布新的一轮。↩︎
209. 差分隐私 (DP)
差分隐私 (DP):一种通过向计算添加校准噪声来限制信息泄露的数学框架。在边缘学习中,噪声成为一种系统成本,因为更嘈杂的更新通常需要更多轮次或更多数据才能达到相同的效用。第 13 章 详细阐述了形式化的隐私预算机制。↩︎
210. 尾部拖延者问题
尾部拖延者问题:在数据中心训练中,拖延者会拖慢同步进度;而在联邦学习中,由于硬件异构、连接间歇性和资格窗口,该问题被放大 (Bonawitz 等 2019; Kairouz 和 McMahan 2021)。异步聚合和有界陈旧度(忽略早于 k 轮的更新)等解决方案可提高吞吐量,但会引入公平性权衡:激进的拖延者缓解策略会使模型偏向高端设备用户,可能降低最需要个性化的受限用户的性能。↩︎
211. 大脑能效
大脑能效:大脑功耗约 20 W,每秒处理约 \(10^{15}\) 次操作,按这种粗略的操作计数模型换算,能效约为 50 TOPS/W。与本章前文提及的 1–5 TOPS/W 移动 NPU 范围相比,能效高出约 10–50 倍,尽管生物突触事件与数字运算仅是近似类比。这种高效源于极致稀疏性(860 亿神经元中仅 1–2% 同时活跃)和事件驱动处理(仅在输入变化时激活计算)。这两大原则直接指导边缘 ML 设计:稀疏激活模式和机会主义训练调度并非启发式手段,而是逼近生物能效极限的尝试。↩︎
212. 移动传感器数据规模
移动传感器数据规模:典型智能手机每天生成 2–4 GB 传感器数据:摄像头(1–2 GB)、加速度计(约 50 MB)、GPS(约 10 MB)和触摸事件(约 5 MB)。对比学习可从保留的少量数据样本中提取有用表征,使无标签、无云端处理的设备端自监督学习成为可能。瓶颈变成了存储策略而非数据可用性:在内存填满前决定保留什么、丢弃什么。↩︎
213. 对比学习
对比学习:一种自监督技术,通过区分相似(正)样本对与不相似(负)样本对来学习表征,无需标签。SimCLR (T. Chen 等 2020) 表明,大批量增强视图可在无人工标签下学习强视觉表征。对边缘设备而言,可迁移的系统思路是利用无标签传感器流进行表征学习或预训练,再将稀缺标签仅用于轻量级本地适配;具体的标签节省量取决于任务、保留策略和算力预算。↩︎
214. EWC (弹性权重巩固)
EWC (弹性权重巩固):利用 Fisher 信息矩阵 估算各参数对过往任务的重要性,在新学习过程中惩罚对重要参数的修改。这每训练步仅增加 10–15% 计算量,但需存储每个参数的一个重要性分数(每个 4 字节),权重内存约翻倍。与重放缓冲区的权衡显而易见:EWC 用与模型大小成正比的内存换取与数据历史成正比的内存,适用于大模型小数据的边缘场景。↩︎
215. 经验回放
经验回放:源自强化学习 (Mnih 等 2015),在缓冲区存储过往输入-输出对,并将其与新训练数据交错,以减轻持续学习中的灾难性遗忘 (Rolnick 等 2019)。内存高效的边缘实现可存储压缩嵌入或摘要而非原始输入,以降低存储和隐私压力,代价是梯度信息不够完整。缓冲区大小、采样策略和表征选择共同决定稳定性-内存权衡:过小则旧任务性能退化,过大则缓冲区与模型权重争夺稀缺边缘内存。↩︎
216. 冷启动问题
冷启动问题:新用户或设备缺乏本地数据用于个性化,早期预测只能依赖全局模型、粗粒度上下文或显式用户输入。元学习初始化 (MAML) 或隐私保护的总体统计可引导个性化,但根本权衡依然存在:更快的冷启动需要全局模型提供更多信息,而全局模型可能无法代表新用户的分布。从 5–10 次交互进行少样本适配,提供了速度与本地相关性之间的一种平衡。↩︎
217. ARM Cortex 谱系
ARM Cortex 谱系:代表性端点跨越近六个数量级,从约 48 MHz、32 KB RAM、10 µW 功耗的 Cortex-M 级设备,到约 3 GHz、16 GB RAM、5 W 的移动级设备 (Warden 和 Situnayake 2020; Lai 等 2018)。联邦学习综述和生产系统报告将此类客户端异构性和可用性偏斜视为核心系统挑战 (Kairouz 和 McMahan 2021; Bonawitz 等 2019)。设计后果是分层:最小微控制器上量化推理,较大嵌入式或穿戴设备层上轻量级仅偏置更新,仅在移动级 SoC 上运行更完整的适配器或反向传播循环。↩︎
218. TensorFlow Lite
TensorFlow Lite:Google 的移动推理运行时,针对 ARM 优化,具备专用 8 位和 16 位内核,推理速度比完整 TensorFlow 快 3 倍。TFLite Micro 扩展至微控制器,内存占用 <1 MB。对联邦学习的系统影响在于:TFLite 与其他框架的运行时差异可能导致相同模型产生数值不同的梯度更新,在异构设备群中聚合时引入噪声并不断累积。↩︎
219. ONNX Runtime Mobile
ONNX Runtime Mobile:微软的跨平台推理引擎,采用厂商中立的 Open Neural Network Exchange 格式,支持在一个框架训练并部署至 iOS、Android 和嵌入式 Linux。移动版通过算子融合,在部分模型上比 TFLite 推理快 2–3 倍。对联邦学习而言,ONNX 的可移植性缓解了数值差异问题:异构设备间统一的模型表征能在聚合期间产生更一致的梯度更新。↩︎
术语表
Microcontroller Power Budget(微控制器功耗预算)
一个消耗 10 mW 进行训练的微控制器每小时消耗 36 J,因此一个小型 200 mAh 纽扣电池(在 3 V 下约有 2,200 J 可用能量)可维持约 60 小时的连续计算。室内能量采集仅能持续提供 10–100 μW,比训练功耗低两到三个数量级,因此实际部署会采用占空比工作方式:每小时训练 10 秒每次仅消耗约 0.1 J,并将适配限制在每次几百个梯度步骤。这个能量上限,而非计算吞吐量,是决定哪些算法可在采集能量供电设备上运行的约束条件。↩︎
Activation Caching(激活缓存)
前向传播的激活值必须存储或重新计算用于反向传播,对于许多 CNN 而言,激活内存可能超过模型权重的内存占用。在 RAM < 512 KB 的设备上,仅激活存储就可能超过总内存,除非采用梯度检查点(Chen et al. 2016)、低秩更新或稀疏更新方法,否则完全无法进行多层适配。↩︎
QoS (Quality of Service) for Edge ML(边缘 ML 服务质量)
设备上训练不得违反的延迟保证:语音助手、视频应用和可穿戴设备都有严格的交互响应预算。明显增加延迟、丢帧或延迟传感器处理的后台训练会损害用户信任。系统通过优先级调度(推理抢占训练)和资源调控器(当 QoS 指标接近部署特定阈值时节流学习)来强制执行此要求。↩︎
Cloudlet(云小站)
位于用户附近的小规模计算层级,通常靠近接入网络或企业站点,提供比远程云区域更低延迟的卸载。这一中间层实现混合设备端学习:时间敏感的推理在本地运行,而聚合、验证或更繁重的适配工作在网络和信任模型允许时可卸载到附近。权衡在于部署复杂性:云小站增加了一个编排层,必须针对每次更新决定是本地计算、就近卸载还是推迟到云端。↩︎
Byzantine Fault Tolerance in FL(联邦学习中的拜占庭容错)
得名于拜占庭将军问题(Lamport et al. 1982),该特性使聚合在存在恶意或故障参与者时仍然有效。Krum 的原始分析要求满足 2*f* + 2 < n 等条件(Blanchard et al. 2017),而坐标级中位数和截尾均值聚合器使用不同的鲁棒性假设;可容忍的拜占庭比例取决于聚合规则、维度和统计模型。这些防御会增加通信和计算开销,因为它们需要额外验证、鲁棒统计或冗余参与。这种开销是在开放联邦系统中任何客户端设备都可能被攻陷情况下信任的代价。↩︎
Feature Store(特征存储)
管理 ML 特征的计算、存储和服务的中央化存储库。它解决的核心系统问题是训练-服务偏差;本章在 Section 12.8 中展开论述该失效模式及包含它的平台不变量。↩︎
TCO (Total Cost of Ownership)(总拥有成本)
一种财务框架,由 Gartner 于 20 世纪 80 年代为 IT 采购形式化,将 CapEx(一次性采购)和 OpEx(经常性运营)在系统全生命周期内求和。对于 ML 集群,TCO 分析具有独特的重要性,因为电力、冷却、人员、设施和网络成本会实质性地改变三年经济账,且利用率 60 个百分点的波动(20% 到 80%)无需改变任何硬件规格就能彻底逆转自建与购买的决策。↩︎
Zombie Models(僵尸模型)
尽管已过时或被取代但仍在服务的生产模型。行业调查估计,成熟组织中 20%-40% 的生产模型属于僵尸模型,每个都消耗 GPU 内存、值班关注和监控预算,却只带来可忽略的业务价值。运营成本不仅限于算力浪费:僵尸模型膨胀依赖图,使平台级升级和安全补丁变得更慢、更冒险。↩︎
Blue-Green Deployment(蓝绿部署)
使用两个相同的生产环境(“蓝”和“绿”)的发布模式。同一时间只有一个环境处于活跃状态。这以加倍服务基础设施(C_infer)为代价,实现零停机发布和新模型失败时的近乎即时回滚。↩︎
Kubeflow
Google 于 2018 年发布的开源 ML 平台,将流水线编排与 Kubernetes 资源管理相结合。关键系统后果:因为 Kubeflow DAG 同时表达计算依赖和资源请求,编排器可在加速器可用时才调度 GPU 密集型训练步骤,防止了使多模型训练集群手动调度变得不可行的资源争用。↩︎
Fairness Validation in ML(ML 公平性验证)
存在多种公平性定义——人口统计学均等、机会均等、校准——且在现实条件下通常不可能同时满足(Chouldechova 2017; Kleinberg et al. 2016)。这迫使系统设计做出选择:自动化验证门控必须编码组织优先考虑的公平性定义,使门控配置本身成为无法委托给通用阈值的策略决策。↩︎
Canary Deployment(金丝雀部署)
得名于煤矿工人用金丝雀探测有毒气体的做法——小牺牲保全大局。对 ML 系统而言,这个类比很精准:模型退化通常表现为准确率逐渐下降而非崩溃,这让它们对健康检查不可见,但可通过金丝雀流量与对照流量的统计比较检测出来。没有金丝雀阶段,一个微妙退化的模型可能在任何人注意到损失前就覆盖 100% 的流量。↩︎
SLO (Service Level Objective)(服务等级目标)
目标可靠性水平。对于模型服务 API,“三个九”(99.9%)可用性每年仅允许 8.7 小时停机。对于延迟,P99 SLO 为 200 ms 意味着 99% 的请求必须在 200 ms 内完成。大规模满足这些目标需要自动扩缩容和熔断来处理负载尖峰。↩︎
Interleaving Experiments(交错实验)
最初为搜索引擎评估开发,交错将两个排序器的结果合并为一个列表展示给每个用户,然后将点击归因于来源排序器(Chapelle et al. 2012)。它所需样本远少于 A/B 测试,因为每个用户提供直接的组内比较,而非仅提供组间信号。对于迭代许多模型变体的车队规模推荐系统,这种样本效率提升直接转化为更快的实验周期和更低的生产环境次优模型机会成本。↩︎
A/B Testing Power(A/B 测试功效)
实验正确检测真实效应的概率(1 - β_stat,通常设为 0.8)。在车队规模下,系统挑战在于统计功效:若预期改进很小(例如 0.1%),实验可能需要数百万样本才能达到统计显著性,消耗大量服务资源(C_infer)数周时间。↩︎
235. 统计过程控制 (SPC)
Shewhart(1931)为制造业质量控制建立了控制图框架。在正态近似下,3-sigma 控制限对稳定过程产生的虚假警报概率仅为 0.27%。对于 ML 集群监控而言,即使是很小的单测试虚假警报率,也会在众多模型和指标中累积,使得警报疲劳管理成为在平台规模应用 SPC 的固有约束。↩︎
236. 群体稳定性指数 (PSI)
最初开发于信用评分领域,用于检测贷款申请人群体的变化,当时监管机构要求进行定量漂移监控。标准阈值(PSI < 0.1 稳定,PSI ≥ 0.25 需采取行动)是在金融服务领域经验确立的。对于 ML 集群监控,PSI 的优势在于计算廉价——只需一次性遍历分桶直方图——这使得在不耗尽监控预算的情况下,跟踪数百个模型上的数百个特征成为可能。↩︎
237. 分布式追踪
Google 2010 年的 Dapper 论文确立了跨服务边界传播唯一追踪 ID 的模式。对于多模型 ML 流水线,追踪是将端到端延迟归因于特定模型阶段的唯一可靠方式——没有它,一个 10 模型流水线中 50 ms 的尾延迟峰值将需要独立调查所有 10 个模型。Dapper 以每台主机低于 0.3% 的 CPU 开销实现了这一点,设定了使全天候追踪在集群规模下成为可能的性能基准。↩︎
238. TensorFlow Extended (TFX)
Google 的生产级 ML 平台。TFX 的关键架构洞见在于:通过 TensorFlow Data Validation (TFDV) 进行数据验证,在训练开始前对流水线进行把关,捕捉那些本会导致模型悄然退化的模式违规和分布漂移。这种“训练前失败”的理念,防止了成本最高的一类 ML 浪费:在损坏数据上训练所消耗的 GPU 小时数。↩︎
239. Prometheus
一个现由 CNCF 托管的开源监控系统,采用基于拉取的模型从导出器抓取指标。对于 ML 集群,Prometheus 是追踪运行健康状况(CPU/GPU 利用率、请求速率)的标准,但其时间序列模型不适合追踪高维分布漂移,这使得双层监控架构成为必要。↩︎
240. 作业抢占
终止低优先级工作负载以释放资源供紧急工作使用的能力。云服务商为抢占式/竞价实例提供 60–90% 的折扣,但代价是 ML 训练必须支持检查点与恢复:如果没有定期检查点,一个被抢占的 72 小时训练运行将从头重启,将 70% 的成本节约转化为净损失。检查点频率本身是在 I/O 开销与浪费算力风险之间的权衡。↩︎
241. 吵闹邻居问题
一种多租户故障模式,即某租户的工作负载降低了同位部署租户的性能。ML 工作负载特别容易遭遇此问题,因为训练作业会贪婪地分配 GPU 内存——单个作业在共享节点上请求所有可用 HBM 就会挤占同位部署的推理服务,导致违反 SLO 的延迟峰值。与 CPU 工作负载不同,GPU 内存无法超售,这使得物理资源隔离成为唯一可靠的预防手段。↩︎
242. 数据泄露
一种未来信息污染训练数据的错误。其危害在于泄露会产生离线指标极其惊人的模型——有时准确率达 99% 以上——却在生产环境中完全失效,因为未来信息在那里不可用。在特征存储规模下,泄露风险倍增,因为批量计算的特征可能嵌入模型团队不可见但优化器可利用的时间信息,这使得时间点正确性成为一种基础设施保证,而非单个团队的责任。↩︎
243. NVIDIA Collective Communications Library (NCCL)
NCCL 采用拓扑感知算法实现 AllReduce、AllGather 和 ReduceScatter,以利用 NVLink、NVSwitch 和 InfiniBand。调试 NCCL 故障以极其困难著称,因为集体操作挂起本质上就是死锁:一个秩等待另一个从未发送的数据,不产生错误消息,也不崩溃——只有死寂。在拥有数千 GPU 的集群规模下,识别单个被阻塞的秩需要关联所有参与者的日志。↩︎
244. 站点可靠性工程 (SRE)
由 Ben Treynor Sloss 于 2003 年在 Google 创立,SRE 引入了错误预算和 SLO 作为定量的可靠性契约。对于 ML 系统,经典 SRE 必须扩展:传统服务以二元方式失效(正常/宕机),但模型以概率方式退化——准确率可能在数周内下降 5% 却不触发任何健康检查。这要求引入漂移感知的 SLO,将预测质量与正常运行时间同视为可靠性指标。↩︎
245. Stuxnet (震网病毒)
最早由白俄罗斯杀毒公司 VirusBlokAda 于 2010 年检测到,Stuxnet 是首个公开已知的旨在造成物理破坏的恶意软件。其同时利用四个零日漏洞的做法,为 ML 供应链攻击树立了先例:正如 Stuxnet 通过受信任的软件更新渠道攻陷工业控制器,ML 攻击也可通过受信任的代码库注入植入后门的模型。↩︎
246. 零日漏洞 / 零日攻击 (Zero‑Day)
(源自盗版俚语“发布零天”)在安全领域,该术语指防御方可用时间为零天的漏洞。Stuxnet 同时使用四个零日漏洞是空前的;单个零日漏洞利用的黑市价值超过 100 万美元,使得四漏洞利用链成为一种数百万美元级的武器,这对 ML 系统有直接启示:未修补的模型服务框架会产生类似的零日暴露窗口。↩︎
247. USB 攻击向量
USB(通用串行总线)在 2008 年“奥林匹克运动会行动”据报使用受感染驱动器渗透机密设施后,成为跨越气隙的主要向量。对于部署在隔离训练集群上的 ML 系统,通过 USB 传输的数据集和模型检查点代表同类风险:单个被攻陷的检查点文件即可嵌入后门,并在重新训练周期中存活下来。↩︎
248. 气隙隔离 / 物理隔离 (Air‑Gapped)
(源于网线间字面上的物理间隙)指与外部连接物理隔离的网络,该做法可追溯至 1960 年代军事计算。对于 ML 系统,将训练集群与互联网气隙隔离可防止数据外泄,但迫使所有依赖项(框架、数据集、预训练权重)通过手动传输渠道,每个渠道都成为潜在的供应链攻击向量。↩︎
249. 汽车网络安全召回
2015 年 Jeep Cherokee 被黑事件触发了首例网络安全召回,影响 140 万辆汽车。该召回模式与 ML 模型回滚相似:正如车辆需要空中下载 (OTA) 补丁将娱乐系统与安全关键的 CAN 总线隔离,ML 部署也需要在外部推理 API 与安全关键的执行器控制回路之间实现架构隔离。↩︎
250. NHTSA(美国国家公路交通安全管理局)
成立于 1970 年,在 2015 年 Jeep 被黑事件后于 2016 年发布首份网络安全指南,NHTSA 为拥有 100 多个车载计算机的联网汽车发布非约束性的安全设计最佳实践指南。这一监管模式正延伸至 ML 系统:欧盟《人工智能法案》(2024) 为高风险 AI 施加了类似的生命周期义务,包括文档化的风险管理和上市后监控。↩︎
251. Mirai 僵尸网络 (日语“未来”之意):在 2016 年的高峰期,Mirai 控制了 60 万多台 IoT 设备,通过利用默认凭证(admin/admin、root/12345)发动 1.2 Tbps 的 DDoS 攻击。对于机器学习边缘部署而言,其教训是定量的:每一个使用默认凭证的智能摄像头或语音助手,不仅仅是一个 DDoS 节点,更是联邦学习系统中潜在的毒化训练数据来源。↩︎
252. DDoS(分布式拒绝服务):一种通过来自多个来源的流量淹没目标的攻击技术,首次演示于 1999 年,据后续基础设施报告记载,攻击流量曾超过 3.47 Tbps。对于机器学习推理 API,DDoS 构成双重威胁:除了服务中断,持续的大批量查询还可同时作为模型提取攻击,在防御团队专注于可用性时,收集足够的输入输出对以训练替代模型。↩︎
253. 成员推理攻击:由 Shokri 等人(2017)首次针对机器学习模型演示,此类攻击通过利用过拟合差距,判断特定数据点是否被用于训练:模型对训练数据的预测置信度高于未见数据。在许多生产模型上可达到 70%–90% 的准确率,它们带来了《通用数据保护条例》(GDPR)和《健康保险流通与责任法案》(HIPAA)合规风险,因为确认某人的数据在训练集中即构成隐私侵犯。↩︎
254. 对抗样本:由 Szegedy 等人(2013)首次发现,这些是精心构造的输入,通过人类难以察觉的微小扰动来利用学习到的决策边界。这一现象揭示了机器学习系统设计中的根本张力:正是那些实现泛化的高维特征空间,创造了可被利用的几何结构,使得微小的定向扰动能够跨越决策边界。↩︎
255. 数据投毒:由 Biggio 等人(2012)首次正式研究,此攻击在训练期间注入恶意数据以破坏学习到的模型。其系统层面的教训是,即使精心构造的样本数量很少,训练数据的完整性也至关重要:针对支持向量机的投毒实验表明,恶意训练点可通过移动学习到的决策边界,大幅增加测试误差。↩︎
256. AI 生成钓鱼邮件:大语言模型(LLM)生成的钓鱼邮件语法准确率达 99% 以上,而传统钓鱼邮件仅为 19%,在某些攻击活动中实现了 30% 以上的点击率。这一双重用途威胁阐释了为何机器学习安全必须将模型视为既要防御的资产,也是潜在的武器:为面向客户的聊天机器人提供语言流畅度的同一能力,可被微调用于大规模社会工程学攻击。↩︎
257. ML API(应用程序编程接口):由 Google 的 Prediction API(2010 年)推广普及,大规模 ML API 可处理数十亿请求。每个 API 响应都泄露信息:置信度分数、Logits 及 top-k 预测共同形成侧信道,使模型提取成为可能。降低输出冗余度(截断 Logits、省略置信度分数)直接以 API 实用性换取抗提取能力。↩︎
258. 模型仓库:用于共享机器学习模型的中心化平台,由 Hugging Face 等大型目录引领。这些仓库创造了与 PyPI 等包管理器相同的供应链风险:研究人员发现了嵌入后门和任意代码执行载荷的模型,使得模型来源的加密验证对机器学习而言,正如包签名对软件那样关键。↩︎
259. 模型序列化:将训练好的模型转换为可移植格式的过程——开放神经网络交换格式(ONNX)2017、SavedModel 2016、PyTorch .pth。Python 基于 pickle 的序列化在 PyTorch 检查点工作流中常见,反序列化时可执行任意代码,使每个不受信任的 .pth 文件都成为潜在的远程代码执行向量。像 SafeTensors(2022)这类更安全的格式通过仅存储张量数据来消除代码执行风险(Hugging Face 2026)。↩︎
260. 模型反演攻击:由 Fredrikson 等人(2015)首次针对人脸识别演示,研究者仅凭置信度分数就重建出了可辨识的人脸。该攻击证明了黑盒 API 访问不足以提供隐私保护:任何返回丰富输出信号(概率、嵌入、注意力权重)的模型,都为重建训练数据提供了优化目标。↩︎
261. Netflix 去匿名化:研究人员表明,仅 8 条带大致日期的电影评分就能唯一标识匿名 Netflix Prize 数据集中 99% 的记录;结合公开的 IMDb 评分进而实现了对拥有公开评分用户的实际重新识别(Narayanan and Shmatikov 2008)。Netflix 取消了计划中的第二届竞赛。对机器学习系统的教训是:任何足以训练有用模型的数据集都包含足够的结构信息以供重新识别,使得朴素的匿名化手段不足以保障隐私。↩︎
262. ML 侧信道攻击:2018 年首次针对神经网络演示,研究人员展示了推理过程中的功耗模式泄露模型架构(层数、激活函数、参数规模)。与泄露密钥的密码学侧信道不同,ML 侧信道泄露知识产权:拥有边缘设备物理接近权限的攻击者可在无任何 API 访问的情况下重建模型架构。↩︎
263. 模型蒸馏:一种知识迁移技术,较小的“学生”模型从较大“教师”模型的软概率输出而非硬标签中学习(Hinton et al. 2015)。最初为压缩设计(用 10–100× 更少的参数实现 95%+ 教师准确率),当应用于 API 输出时蒸馏即成为攻击:对手利用受害者的响应训练本地学生模型,在不访问其权重的情况下有效窃取模型的学习行为。↩︎
264. 众包风险:Amazon Mechanical Turk(2005)等平台使数据标注民主化,但也引入了投毒攻击面:研究显示 15%–30% 的众包标签包含错误。协同攻击者可通过创建多个标注员账户,以不到 1000 美元的成本毒化整个数据集,使得标签质量保证(多数投票、金标准检查)成为任何使用外部标注的训练管道中的强制防御层。↩︎
265. 双层优化(源于两个嵌套的优化“层级”):一种框架,其中一个优化问题包含另一个,由 Biggio 等人(2012)为机器学习安全形式化。外层问题(攻击者)优化投毒数据;内层问题(防御者)训练模型。这种嵌套解释了为何鲁棒防御计算成本高昂:评估每个候选防御都需要求解完整的内层训练循环,将计算成本乘以防御迭代次数。↩︎
266. 后门攻击
首次由 Gu 等人(2017)通过 BadNets 证明,此类攻击在训练期间嵌入隐藏触发器,仅当出现特定输入模式时才会激活。其隐蔽性极强:植入后门的模型在干净输入上保持正常准确率(通过标准评估),而在触发输入上实现 99% 以上的攻击成功率,仅凭准确率指标根本无法检测。↩︎
267. Perspective API
谷歌于 2017 年推出的毒性检测模型,据报已在 The New York Times(纽约时报)和维基百科等平台大规模部署。其规模阐释了一个关键的 ML 安全权衡:在用户生成内容上重新训练的模型通过反馈循环提高了准确性,但同时也制造了一个投毒面,大规模注入的对抗性评论可以偏移模型的决策边界。↩︎
268. Perspective 规避结果
该攻击不需要重新训练。通过向有毒短语添加拼写错误、字符替换和标点符号,研究人员导致已部署模型给本应被过滤的冒犯性内容分配低毒性评分。这表明已部署 ML 过滤器面临的系统性风险:即使训练管线本身未被投毒,微小的输入扰动也能绕过决策面。↩︎
269. 对抗样本迁移性
由 Szegedy 等人(2013)记录,并由 Nicolas Papernot、McDaniel 和 Goodfellow(2016)后续系统化,这一现象表明:针对某一模型制作的对抗样本,以 60%-80% 的成功率能欺骗不同架构的模型。迁移性改变了威胁模型:攻击者无需接触目标系统;他们针对免费可用的替代模型制作扰动,并将其部署到生产模型上,使得黑盒攻击几乎与白盒攻击一样有效。↩︎
270. Meltdown/Spectre(熔断/幽灵)
这些处理器侧信道攻击影响了自 1995 年以来制造的几乎所有处理器,涉及数十亿设备。紧急操作系统补丁导致 I/O 密集型工作负载性能下降 5%-30%。对于 ML 系统,性能损耗主要落在数据加载管线上:针对数据受限工作负载,打补丁内核上的训练吞吐量可测量地下降,迫使团队重新分析并优化其数据管线。↩︎
271. 推测执行
最早于 Intel Pentium Pro(1995)引入,该技术在确认指令被需要前执行它们,将吞吐量提高 10%-25%。安全缺陷在于架构层面:即使回滚,推测操作仍会修改缓存状态,从而创建定时侧信道。ML 加速器使用类似的推测性预取进行权重加载,这引发了一个问题:GPU 内存层级中是否存在类似的数据依赖时序泄漏。↩︎
272. HIPAA 执法
自 2003 年以来,HIPAA 违规产生了数亿美元的罚款,其中 Anthem Inc. 数据泄露事件(2015)暴露了 7880 万患者记录。对于处理医疗数据的 ML 系统,HIPAA 合规要求技术保障措施,如访问控制、审计控制、完整性保护、传输安全,以及在 60 天内进行违规通知;加密是一项可寻址的保障措施,但当涉及电子受保护健康信息时,它仍直接塑造训练管线架构和模型部署基础设施。↩︎
273. GDPR(通用数据保护条例)
欧盟于 2018 年颁布,罚款最高可达全球营收的 4%,GDPR 已处以数十亿欧元罚款,包括对亚马逊的 7.46 亿欧元罚款(2021)。对于 ML 系统,GDPR 的“被遗忘权”带来了独特的技术挑战:从训练好的模型权重中移除个人影响,需要完全重新训练,或采用近似移除记录学习影响的机器遗忘技术,两者在大规模场景下计算开销均极大。↩︎
274. AES(高级加密标准)
NIST 于 2001 年采用以取代 DES,AES 在数学上是安全的,AES-128 拥有 2¹²⁸ 个可能的密钥。然而,物理实现泄露密钥相关的功耗特征,差分功耗分析(DPA)和相关功耗分析(CPA)可在几分钟内利用此特征提取密钥。数学安全与物理安全之间的差距是对 ML 系统的核心教训:如果硬件实现泄露信息,可证明安全的算法也无法提供保护。↩︎
275. 物联网设备漏洞
研究显示 70%-80% 的物联网设备包含可利用的缺陷(默认凭证、未加密通信、过时固件)。对于边缘 ML 设备,这些漏洞会叠加:运行设备端推理的被攻陷智能摄像头,同时成为联邦学习的毒化数据源、对抗性输入注入点,以及分布式攻击的计算资源。↩︎
276. 医疗设备安全
FDA 报告显示 53% 的医疗设备包含已知漏洞,平均每台设备 6.2 个。对于 ML 驱动的医疗设备(诊断成像、带预测算法的胰岛素泵),每个漏洞都被放大:攻陷 ML 模型可能导致隐性误诊,而非可见的设备故障,使得检测比传统医疗设备安全难得多。↩︎
277. 调试端口漏洞
硬件调试接口如 JTAG 和 Serial Wire Debug (SWD) 为开发提供完整的内存读写访问权限,但在估计 60%-70% 的出货嵌入式设备中处于未安全状态。对于 ML 边缘设备,暴露的 JTAG 端口允许攻击者直接从闪存中提取模型权重,绕过包括加密和访问控制在内的所有软件级保护。↩︎
278. 网络安全监管格局
跨框架(SOC 2、ISO 27001、PCI DSS)及行业特定规则(财务领域的 SOX、医疗领域的 HIPAA)的全球合规成本每年超过 1500 亿美元。对于 ML 系统,多重监管合规产生架构约束:跨 EU 和 US 部署的单一医疗 AI 模型,必须同时满足 GDPR 数据驻留、HIPAA 审计追踪和 FDA 验证要求,每项要求都对训练和服务基础设施提出不同需求。↩︎
279. 渗透测试
(源自对安全边界的“渗透”):1960 年代为军事系统形式化的授权模拟攻击,2022 年市场规模达 17 亿美元。对于 ML 系统,传统渗透测试虽必要但不充分:它能发现基础设施漏洞(SQL 注入、错误配置),却遗漏 ML 特有的攻击面,如对抗性输入、通过 API 查询的模型提取、训练数据投毒,这些都需要专门的 ML 红队测试。↩︎
280. 红队演练
(源自冷战军事术语中的对抗方力量):与渗透测试狭窄的技术范围不同,红队在数周或数月内模拟复杂的多向量攻击,包括社会工程学和物理访问。对于 ML 系统,红队演练可涵盖对抗性提示工程、训练数据投毒模拟和模型提取尝试;OpenAI、Anthropic 和 Google 发布的公共安全评估报告展示了部署前安全评估的这一模式。↩︎
术语表
S-box (Substitution Box)
分组密码(如 AES)中的非线性查找表,将每个输入字节映射到不同的输出字节,提供“混淆”属性,使密文从明文变得不可预测。S-box 操作是侧信道攻击的主要目标,因为其输出同时取决于明文和密钥:在 S-box 计算期间,基于功耗迹训练的神经网络可以逐字节恢复密钥,将密码分析转化为分类问题。
Robustness-Privacy Trade-off (鲁棒性-隐私权衡)
提高对抗鲁棒性(例如通过对抗训练)可能会增加对成员推理攻击的易感性。鲁棒模型的决策边界可能更紧密地拟合训练分布的“流形”,使攻击者更容易将训练样本与未见数据区分开来(Song et al. 2019; Shokri et al. 2017)。这种权衡迫使车队设计者在安全性和隐私不变量之间明确设定优先级。
Homomorphic Encryption (同态加密)
源自希腊语 homos(“相同”)+ morphe(“形式”),名称反映了核心属性:密文上的操作产生的结果形式与明文上的操作“相同”。自 20 世纪 70 年代起在理论上被研究,Craig Gentry 2009 年的博士论文使全同态加密变得实用。系统开销依然巨大:HE 推理比明文慢 1,000–10,000 倍,将许多 ML 应用限制在小模型和低吞吐量的批处理上。
SMPC Performance Overhead (SMPC 性能开销)
安全多方计算通过密码学操作(秘密共享、混淆电路)可能产生 1,000–10,000 倍的计算开销,将毫秒级推理变为数秒、数分钟或更久,具体取决于模型大小和协议。实用的折中方案是混合部署:仅将 SMPC 应用于敏感层(最终分类、嵌入查找),而非敏感层在明文中运行,将开销降至 10–100 倍,代价是未受保护层的部分信息泄露。
SMPC (Secure Multi-Party Computation, 安全多方计算)
1982 年由 Andrew Yao 形式化为“百万富翁问题”(两个百万富翁能否在不透露财富的情况下确定谁更富?)。该框架使医院能够在不共享患者记录的情况下协作训练诊断 ML 模型。关键的系统约束是通信:SMPC 要求每一方为每次操作交换加密份额,使网络带宽而非计算成为分布式 ML 训练中的主要瓶颈。
Synthetic Data (合成数据)
市场从 1.1 亿美元(2019 年)增长到 11 亿美元(2023 年),隐私法规使真实数据使用成本高昂是驱动因素。根本权衡是保真度与隐私:达到原始数据 95%+ 统计保真度的合成数据集,仍可能通过生成模型记忆泄露稀有个体的信息,因此生产系统将合成数据生成与差分隐私保证相结合。
Model Watermarking (模型水印)
Adi 等人(2018)提出的 IP 保护技术,模型被训练为仅在所有者知道的秘密触发输入上产生特定的“签名”响应。在实验中,触发集水印在保持正常测试准确率的同时,使秘密触发集能可靠地识别模型所有者。系统挑战在于鲁棒性:水印必须在模型微调、剪枝和蒸馏中存活,这些正是攻击者用来从被盗模型中剥离所有权标记的操作。
OAuth (Open Authorization, 开放授权)
2006 年开发并用于互联网规模的标准,允许在不暴露凭证的情况下进行 API 访问。对于 ML 推理 API,OAuth 2.0 基于令牌的认证每次请求增加 5–15 ms 的令牌验证延迟,对批量推理可忽略,但对每秒数千请求的实时服务而言是有意义的开销,因为每毫秒的延迟预算都至关重要。
Mutual TLS (mTLS, 双向 TLS)
增强的传输层安全(1999 年引入),客户端和服务端均通过证书认证。15–30 ms 的握手开销是每个连接的一次性成本,通过连接池分摊到后续请求中。对于 ML 模型服务,mTLS 确保只有经过认证的服务可以提交推理请求,防止通过 API 访问进行未授权的模型提取。
API Keys (API 密钥)
2005 年 Google Maps API 推广的简单认证令牌。研究显示 10–15% 的 GitHub 仓库意外包含泄露的 API 密钥。对于 ML 服务,泄露的 API 密钥不仅是计费风险:它为攻击者提供无限的查询访问权限用于模型提取,以 API 计算额度的成本将凭证管理失败有效转化为完整的模型窃取。
RBAC (Role-Based Access Control, 基于角色的访问控制)
1990 年代由 NIST 形式化,RBAC 将权限分配给角色而非个人,与按用户策略相比将管理开销降低 90%+。对于 ML 平台,RBAC 自然映射到 ML 生命周期:数据工程师访问训练数据但不访问模型权重,ML 工程师访问模型但不访问生产服务密钥,监控系统访问预测但不访问原始输入,在流水线中强制执行最小权限。
SAD (Speech Activity Detector, 语音活动检测器)
区分语音与静音、噪音或音乐的算法,自 1990 年代以来对语音界面至关重要。现代神经 SAD 在 10 ms 以下延迟下以 95%+ 准确率运行,充当轻量级安全门控:在昂贵的自动语音识别(ASR)模型之前过滤非语音输入,SAD 防止对抗性音频攻击(嵌入噪音的命令、超声波触发器)到达语音识别系统。
Attention Maps (注意力图)
注意力权重的可视化,基于 Bahdanau 等人(2015)引入的神经注意力机制。在监控语境下,注意力风格的可视化和相关归因信号可帮助分析师检查哪些输入区域或标记影响了模型输出,但应将其视为诊断证据而非独立的安全保证。
SHA-256 (Secure Hash Algorithm, 安全哈希算法,NSA 2001)
生成 256 位摘要,20 多年来无已知实用碰撞攻击。对于 ML 模型完整性,计算数 GB 模型文件的 SHA-256 哈希仅需数秒,可检测任何修改,无论多小。这使加密哈希成为部署、存储以及训练和服务环境间传输过程中防篡改最廉价且最有效的防御。
Container vs. VM Isolation (容器与虚拟机隔离)
Linux 容器(如 Docker 风格镜像)共享主机内核,CPU 开销 0–5% 但隔离较弱;VM 提供硬件级分离,开销 10–15%。对于 ML 服务,这是安全性与性能的权衡:容器支持快速模型扩展但与共租户共享内核攻击面,而 VM 以每个服务实例更高的内存开销为代价防止跨租户模型提取。
医疗机器学习合规
自 2016 年以来,FDA 已根据 21 CFR Part 820 批准了 500 多款基于 AI 的医疗器械,审批周期为 2–5 年,成本超过 5000 万美元。关键的系统约束在于:任何模型更新都需要重新验证,这在 ML 的迭代改进周期(每周重训)与监管审批时间线(验证需数月)之间制造了张力,从而推动了锁定版本、版本化模型部署架构的采用。↩︎
HIPAA 机器学习要求
《健康保险流通与责任法案》(1996)管辖 6 亿多条美国患者记录。具体针对 ML 系统,HIPAA 安全规则将静态加密和传输加密视为可寻址的实现规范(受保护实体必须在合理且适当的情况下加密,或记录同等替代方案),并要求对所有数据访问进行审计日志记录,以及为云 ML 服务签订业务伙伴协议(每起事件罚款高达 150 万美元)。这些要求意味着训练管道必须记录每一次数据访问,且包含患者衍生信息的模型检查点必须加密,这增加了存储和 I/O 开销。↩︎
金丝雀部署
得名于煤矿井下的金丝雀,它们能在矿工受害前检测到瓦斯:新模型版本先向 1%–5% 的流量发布,随后再全量部署。对于 ML 系统而言,金丝雀部署至关重要,因为模型故障通常具有统计特性而非二元特性:一个植入后门的模型可能通过单元测试,却在特定子人群上降低准确率,仅可在金丝雀规模的真实流量模式下被检测到。↩︎
提示词注入
类比 SQL 注入:首次广泛记录于 2022 年,此类攻击在用户输入中嵌入对抗性指令,以覆盖模型的系统提示词。与利用代码与数据之间句法边界的 SQL 注入不同,提示词注入利用的是 LLM 中此类边界的缺失:模型指令与用户内容共享同一令牌流,使得稳健检测从根本上比传统的输入清洗更难。↩︎
HIPAA 机器学习要求
《健康保险流通与责任法案》(1996)管辖 6 亿多条美国患者记录。具体针对 ML 系统,HIPAA 安全规则将静态加密和传输加密视为可寻址的实现规范(受保护实体必须在合理且适当的情况下加密,或记录同等替代方案),并要求对所有数据访问进行审计日志记录,以及为云 ML 服务签订业务伙伴协议(每起事件罚款高达 150 万美元)。这些要求意味着训练管道必须记录每一次数据访问,且包含患者衍生信息的模型检查点必须加密,这增加了存储和 I/O 开销。↩︎
GDPR(通用数据保护条例)
欧盟于 2018 年颁布,罚款最高可达全球营收的 4%,GDPR 已处以数十亿欧元罚款,包括 2021 年对亚马逊处以的 7.46 亿欧元。对于 ML 系统,GDPR 的“被遗忘权”带来了独特的技术挑战:从训练好的模型权重中移除某个体的影响,需要完全重训或使用机器遗忘技术来近似移除记录的学习影响,这两者在大规模下计算成本均极高。↩︎
TEE(可信执行环境)
源自 ARM TrustZone(2000 年代初)的硬件隔离处理器区域,灵感来自军事上的信息分级概念。对于 ML 系统,TEE 造成了根本性的内存约束:安全飞地(SGX 中为 128 MB,TrustZone 中可扩展)必须同时容纳模型权重和中间激活值,迫使采用模型压缩或分区推理(仅敏感层在飞地内执行)。↩︎
ARM TrustZone
2004 年推出,TrustZone 将 ARM 处理器划分为安全世界和正常世界,并通过硬件强制隔离。对于移动和边缘设备上的 ML,TrustZone 可在推理期间保护模型权重和生物识别数据,但保护效果取决于设备厂商是否暴露并使用除密钥存储外的安全世界应用。安全教训在于架构层面:仅有硬件支持无法保护 ML 部署,除非模型、密钥和数据路径实际上被置于受信边界内。↩︎
Intel SGX 内存约束
消费级处理器上 SGX 飞地受限于约 128 MB 的受保护内存(EPC),EPC 缓存未命中会导致 100 倍的性能惩罚。仅 ResNet-50 的 FP32 权重就需要约 102.4 MB(2560 万参数 × 4 字节),在激活值计算前就已消耗 80% 的 EPC。一旦模型超出 EPC,推理延迟将从 5 ms 跃升至 500 ms,这使得 SGX 仅适用于 10 MB 以下的小模型或保护加密密钥。↩︎
开源安全启动栈
U-Boot(The U-Boot Project 2026a)是嵌入式 Linux 系统的事实标准引导加载程序,包括用于边缘 ML 部署的 Raspberry Pi 级设备,其 UEFI 文档描述了安全启动配置(The U-Boot Project 2026b)。coreboot(coreboot contributors 2026a)面向 x86 服务器和工作站硬件,其 vboot 文档描述了验证启动支持、固件测量和镜像签名(coreboot contributors 2026b)。两者均可参与签名验证或测量启动链,但信任根是特定于平台的,仍可能由供应商硬件策略、固件写保护或平台密钥控制。“开源”因此适用于引导加载程序代码,而不自动适用于锚定 ML 模型执行环境的信任根。↩︎
HSM(硬件安全模块)
企业级 HSM 每秒可执行 10,000 多次 RSA-2048 操作,单价 20,000–100,000 美元以上;而 GPU 每秒可执行 100,000 多次操作,单价 1,000 美元以上。10 倍的吞吐量劣势是防篡改的代价:HSM 在遭到篡改时会物理销毁密钥,这是任何纯软件解决方案无法提供的保证,且认证或支付安全制度可能要求在生产环境中对高保障密钥处理提供此项保证。↩︎
HSM 认证
FIPS 140-2 或通用标准认证需耗时 12–24 个月,每设备家族成本 50 万–200 万美元。银行、政府和部分医疗采购制度可能要求密码学操作达到 3 级以上认证。对于受监管行业的 ML 系统,此认证时间线造成了部署瓶颈:保护模型签名密钥的 HSM 认证时间,可能比模型训练时间还长。↩︎
FIPS 140-2(联邦信息处理标准)
为密码模块定义了四个安全级别。4 级要求在 -40 至 +85 摄氏度下抵御物理攻击,并具备在几秒内将密钥归零的篡改检测机制。对于处理机密数据或在严格采购要求下运行的 ML 系统,FIPS 140-2 3 级以上合规可能是强制性的,这将 HSM 访问限制在授权人员,并拖慢了 ML 开发通常所需的快速迭代周期。↩︎
309. PUF(物理不可克隆函数)
因其利用的微观制造差异在物理上无法克隆而得名,PUF 无需在内存中存储密钥即可生成设备唯一的加密密钥。对于边缘 ML 设备,PUF 解决了一个关键的部署问题:每个设备都可以使用一个别处不存在的硬件衍生密钥来加密其本地模型,确保从一台设备提取模型不会危及整个集群。↩︎
310. DP-SGD(差分隐私随机梯度下降)
由 Abadi 等人(2016)提出,DP-SGD 裁剪每样本梯度并在训练期间添加校准过的高斯噪声。Apple 于 2017 年报告了大规模本地差分隐私部署,用于遥测式用例;该部署是生产级 DP 的证据,而非专门指 DP-SGD(Apple Differential Privacy Team 2017)。DP-SGD 的系统开销可能很大:每样本梯度裁剪阻碍了使加速器训练高效的批级并行性,与标准 SGD 相比降低了吞吐量。↩︎
311. Privacy-Utility Tension(隐私-效用张力)
由 Dwork 和 McSherry 形式化,他们证明了完美隐私(无限噪声)产生零效用,而完美效用(零噪声)提供零隐私。“隐私预算”(ϵ)是一种有限资源:每次查询或训练轮次都会消耗一部分,一旦耗尽,若不降低保证级别,则不允许对该数据进行进一步计算。这使得隐私核算成为 ML 系统设计中的一等约束,与算力和内存预算并列。↩︎
312. Safety-Critical Applications(安全关键应用)
归类为安全完整性等级(SIL)3–4 级或汽车安全完整性等级(ASIL)D 级的系统要求极低的危险失效目标,但阈值取决于具体标准。IEC 61508 高需求模式 SIL 3 通常为每小时 10−8 到 < 10−7 次危险失效,SIL 4 为每小时 10−9 到 < 10−8 次,ISO 26262 ASIL D 随机硬件失效概率度量(PMHF)目标通常低于每小时 10−8 次。ML 在这些领域的部署面临根本性张力:神经网络缺乏监管机构要求的形式化可验证性,迫使多年的认证过程以数量级的差距滞后于模型迭代周期。↩︎
313. Systemic Vulnerability(系统性漏洞)
指跨层级级联而非隔离在单一组件中的架构弱点。Log4Shell (CVE-2021-44228) 通过单个日志库影响了数亿设备。ML 流水线面临类似风险:成千上万个模型固定依赖单一 CUDA 或 PyTorch 版本,意味着一个漏洞同时危及整个集群,使依赖管理成为关乎可靠性的核心职能。↩︎
314. Hardening Strategy(加固策略)
应用于 ML 流水线的纵深防御:模型加载(签名验证)、输入处理(对抗样本过滤)和输出验证(置信度阈值)。在资源受限的边缘设备上,选择性加固优先保护关键路径——保护推理引擎而接受日志记录等非关键路径的较弱保证——因为全冗余会超出使边缘部署可行的功耗和内存预算。↩︎
315. AWS S3 Outage (2017)(AWS S3 2017 年故障)
例行维护期间的一个误输命令从 US-East-1 区域的 S3 索引和放置子系统中移除了过多容量。当这些子系统重启时,S3 无法服务请求,依赖的 AWS 服务出现错误率升高或功能受损。该事件暴露了单区域依赖模式:假设区域存储可用性为不变量的系统,即使其自身应用代码和模型服务逻辑保持不变,也可能发生故障。↩︎
316. Silent Data Corruption (SDC)(静默数据损坏)
指在不触发任何检测机制的情况下损坏数据的硬件错误。Meta 报告每百万台机器中每天有 6 到 8 台经历 SDC——比软错误预测“高出数量级”。在 ML 系统中,SDC 具有独特危险性,因为损坏的权重或激活值会产生看似合理但错误的输出,能够通过所有健康检查,逃避捕获明显故障的监控。↩︎
317. Edge Computing(边缘计算)
在本地而非中心化云端处理数据,将推理延迟从约 100 ms(云端往返)降低到 < 10 ms。鲁棒性权衡显著:边缘设备获得了低延迟,但失去了使云系统具有弹性的冗余、弹性伸缩和集中监控。故障的边缘模型无法故障转移到备用集群——它必须在自身的功耗和内存包络内优雅降级,或在毫秒级内安全失效。↩︎
318. Autopilot(自动驾驶辅助系统)
2016 年事故涉及特斯拉当时的 SAE Level 2 驾驶辅助系统和 Mobileye 时代的感知栈,而非后来的 8 摄像头全自动驾驶硬件或双 FSD 芯片计算机。后来的特斯拉车型引入了扩展的摄像头覆盖和专用 FSD 算力,但鲁棒性教训相同:车队规模的数据收集并不能自动覆盖亮天空下白色拖车等稀有场景。↩︎
319. Embedded Systems(嵌入式系统)
从 8 位单片机(KB 级 RAM)到复杂 SoC 的专用处理器,年出货量超 300 亿。实时约束(微秒到毫秒级截止时间)和无人值守运行(数年无维护)使 ML 部署面临独特挑战:模型难以轻松更新,空中下载技术(OTA)补丁有变砖风险,且无人在回路中捕获静默性能下降。↩︎
320. Failsafe Mechanism(故障安全机制)
遵循熔断器模式(关闭/打开/半打开),在检测到故障时转入安全状态的系统。在 ML 服务中,故障安全措施包括基于置信度的拒绝(将低于阈值的预测延后至人工处理)、回退到更简单的模型,以及当漂移监控触发时自动回滚。权衡在于可用性:激进的置信度阈值会拒绝 5%–15% 的合法流量,因此调整拒绝边界成为可靠性与吞吐量的优化问题。↩︎
321. ASIL (Automotive Safety Integrity Levels)(汽车安全完整性等级)
ISO 26262 将汽车系统从 ASIL A(最低风险)分级到 ASIL D(最高风险),其中 D 级要求 99.999% 可靠性,并要求冗余传感器、故障安全行为和形式化验证。基于 ML 的感知系统面临认证悖论:标准要求确定性故障分析,但神经网络是随机的——其故障模式取决于输入分布,使得穷尽测试不可行,被迫依赖统计安全论证。↩︎
322. Model Uncertainty (Epistemic Uncertainty)(模型不确定性/认知不确定性)
指模型学习到的表示与真实数据生成过程之间可缩减的差距,区别于偶然不确定性(不可缩减的数据噪声)。量化认知不确定性实现了关键鲁棒性机制:安全关键系统可在预测落于训练分布之外时延后至人工操作员。系统开销显著——贝叶斯近似或蒙特卡洛 Dropout(在推理时运行多次扰动 Dropout 的前向传播)需要 10–100 倍的推理算力,在不确定性感知与服务延迟之间造成直接权衡。↩︎
323. 可靠性工程
起源于 20 世纪 50 年代的航空航天领域,采用 MTBF 分析和失效模式分析;将系统可靠性量化为 Rsystem = e^(−Nλt),适用于具有指数失效分布的 N 个独立组件。机器学习系统继承了这些方法,但增加了传统可靠性工程从未预料到的失效模式:模型漂移(系统在无任何硬件故障的情况下退化)、对抗鲁棒性(系统在测试集上正确,却在精心构造的输入上失效)以及认知不确定性(系统无法区分已知与未知)。↩︎
324. 最大平均差异
一种基于核的统计检验,用于在再生核希尔伯特空间中测量两个分布之间的距离,无需参数假设。与单变量检验(K-S、PSI)需要逐特征评估不同,MMD 原生地作用于联合分布——这对机器学习输入至关重要,因为漂移表现为特征间的相关性变化,而非单个特征的变化。代价在于计算:MMD 在样本量上呈 O(n²) 级扩展,若无子采样或随机特征近似,便不切实际地用于实时监控。↩︎
325. 利普希茨连续性
一种数学性质,用于限制函数输出变化相对于输入变化的程度(‖f(x) − f(x′)‖ ≤ K‖x − x′‖)。在鲁棒 AI 中,最小化利普希茨常数(K)可确保模型的决策面是“平滑”而非“锯齿状”的,从而在物理上使得微小的对抗扰动无法翻转模型的预测,尽管强制使用低常数会牺牲干净数据上的准确率并增加训练成本。↩︎
326. 总体稳定指数
最初于 20 世纪 80 年代为信用评分开发,用于检测当前贷款申请人的群体画像是否偏离了历史基线。在机器学习监控中,PSI 的对称对数比公式使其成为识别类别特征数据漂移的常用行业工具,为重新训练工作流提供单一标量触发器。↩︎
327. 人类感知与机器感知
最早由 Szegedy 等人(2013)强调,神经网络在像素空间学习统计相关性,而非人类视觉所遵循的语义不变性。这一鸿沟并非可修补的缺陷,而是基于有限训练数据的梯度优化所导致的结构性后果:模型寻找最小化经验风险的决策边界,而对抗扰动则利用了这些边界留下的、输入空间中大片无防备区域。↩︎
328. 快速梯度符号法
由 Goodfellow 等人(2014)在 ICLR 提出,FGSM 仅需单步梯度即可生成对抗样例,使其在训练期间使用变得切实可行。这种双重角色是其持久的系统级意义:暴露神经网络脆弱性的同一种攻击,成为了一个简单的对抗训练基元,其中 FGSM 生成的扰动被用来增强干净批次,并挑选出能增加损失的样本。↩︎
329. 白盒攻击
拥有完整模型知识(架构、权重、梯度)的对抗攻击。PGD 和 Carlini-Wagner (C&W) 等方法之所以强大,是因为它们直接针对模型进行优化,而非从外部探测。尽管对于许多部署系统而言,其真实性不如黑盒场景,但白盒分析在指定范数、扰动预算和攻击流程下建立了严苛的基准。通过 PGD 证明了针对该威胁模型的鲁棒性,而非针对所有看似较弱攻击的通用保证。↩︎
330. Carlini 和 Wagner (C&W) 攻击
2016 年提出(IEEE S&P 2017),C&W 将对抗样例生成表述为一个约束优化问题,以寻找导致误分类的最小扰动。其方法论意义在于:C&W 攻破了防御性蒸馏(一种通过掩盖梯度来钝化弱攻击的早期防御)及其他几种能抵御 FGSM 和 PGD 的防御,确立了鲁棒性声明必须针对基于优化的攻击进行评估,而不仅仅是梯度符号启发式方法这一原则。↩︎
331. 可迁移性
由 Nicolas Papernot、McDaniel 和 Goodfellow(2016)分析的一种特性:为某一模型制作的对抗样例能够欺骗不同的架构。这改变了已部署机器学习系统的威胁模型:攻击者无需知晓目标模型的权重——他们可以在本地训练替代模型,离线制作攻击,并将其迁移至生产环境 API。集成对抗训练通过针对来自多个模型的扰动进行训练以提高迁移鲁棒性,但额外的攻击生成和模型多样性使其成为一项深思熟虑的训练预算决策,而非免费的缓解措施(Tramèr et al. 2017)。↩︎
332. 数据投毒
在经典定义中,攻击者注入恶意训练样本以破坏学习过程本身。与针对推理且有时可在服务时缓解的对抗样例不同,投毒在训练期间将漏洞嵌入模型权重中。在网络规模下,这将系统问题从过滤单个推理请求,转变为保留数据溯源、清洗可疑批次,并在训练样本成为模型行为前对其进行审计。↩︎
333. 后门攻击
由 Gu 等人(2017)引入,后门攻击在训练数据中嵌入隐藏触发器,当特定模式出现时在推理阶段激活恶意行为。BadNets 表明,基于触发器的攻击可在保持干净数据准确率的同时引起定向误分类,因此仅凭普通测试准确率是薄弱的检测手段。防御挑战是不对称的:攻击者只需一个小触发器补丁,而防御者必须审计训练数据集或检查高维激活空间中的频谱异常(Tran et al. 2018)。↩︎
334. 双重用途困境
防御性机器学习能力(对抗训练、数据投毒工具、红队框架)同时也是进攻能力的结构性张力。这造成了一场军备竞赛,防御性研究出版物变成了攻击剧本。对于机器学习系统工程而言,其后果是架构层面的:鲁棒性机制必须假设攻击者知晓防御措施,从而排除靠隐藏实现安全,并在可行时要求形式化可验证的保证。↩︎
335. 科尔莫戈罗夫-斯米尔诺夫 (K-S) 检验
一种比较两个概率分布的非参数检验,计算效率高,为 O(n log n),但仅限于单变量分布。对于对抗检测,K-S 检验将逐特征输入分布与训练基线进行比较,在 p-values < 0.05 时标记偏差。对机器学习系统的关键局限在于:对抗扰动往往保留边缘分布而破坏联合结构,因此 K-S 检验可能漏掉 MMD 或嵌入空间度量能捕捉到的攻击。↩︎
336. 特征压缩
Xu 等人 (2018) 提出的一种防御方法,通过降低输入精度(例如,将 256 个色阶减少到 16 个)或空间分辨率(中值滤波)来破坏对抗样本所依赖的细粒度扰动。在 Xu 等人的评估设置中,特征压缩在保持高干净准确率的同时消除了许多对抗样本;在将该防御视为可投入生产使用之前,自适应攻击需要经过验证。检测机制对比原始输入与压缩输入的预测结果:较大的差异以低延迟成本标记出对抗性操纵。↩︎
337. Dropout
由 Srivastava 等人 (2014) 引入的一种正则化方法,在训练期间随机停用一部分隐藏单元,以抑制协同适应并改善泛化能力。其鲁棒性作用是间接的,而非对神经元或权重故障的保证:相同的随机掩码机制可在推理阶段保持激活,通过蒙特卡洛 Dropout (Gal and Ghahramani 2016) 近似贝叶斯不确定性。↩︎
338. 蒙特卡洛 Dropout
由 Gal 和 Ghahramani (2016) 提出,MC Dropout 通过在推理时保持 Dropout 激活并运行 10–100 次随机前向传播,将 Dropout 重新解释为近似贝叶斯推断。预测结果的方差提供了无需架构变更的不确定性估计。系统的权衡在于延迟:以每次 2 毫秒的速度进行 50 次前向传播,每个请求将增加 100 毫秒,这使得 MC Dropout 适用于批量评分或安全联锁,但若无精心设计的批处理,则对于实时服务来说太慢。↩︎
339. 最小权限原则
由 Saltzer 和 Schroeder (1975) 阐述,该原则将访问权限限制在每个组件所需的最小范围内。应用于 ML 流水线:推理容器不应访问训练数据,训练作业不应触达生产数据库,模型不应拥有除所需 API 之外的网络访问权限。违规会为数据投毒创造攻击面——如果训练流水线能从未验证来源读取数据,最终将摄入对抗性数据。同一原则适用于模型注册表,即将版本标识符映射到权重文件并控制哪个别名(例如 staging、production)解析到哪个检查点的制品存储。向 production 别名的提升应限制在一小部分经过审计的自动化评估服务和指定发布工程师;如果研究人员的凭证泄露,最小权限访问控制可防止该泄露蔓延为植入后门的模型进入实时流量。↩︎
340. Huber 损失
这是一种分段函数,在固定阈值(通常为 1.0–1.5)处从二次方(MSE)过渡到线性(MAE),从而限制极端样本的梯度幅度。在投毒数据场景中,Huber 损失可防止少量恶意样本产生超大梯度从而主导参数更新——这是标准 MSE 所不具备的特性,因为单个具有 100 倍正常误差的异常值会贡献 10,000 倍的平方误差损失和 100 倍的残差梯度幅度。↩︎
341. 极小化极大
源自 Neumann (1928) 的博弈论策略,旨在最小化可能的最大损失。在对抗鲁棒性中,Madry 等人将训练表述为 min[θ]max[∥δ∥ ≤ ϵ]ℒ(f**θ, y):模型学习在所选范数球内的最坏情况扰动下最小化损失 (Madry et al. 2018)。内部最大化计算成本高昂,因为通常用迭代攻击(如 PGD)来近似,因此 PGD 对抗训练是一种预算化的鲁棒性选择,而非无成本的目标函数更改 (Bai et al. 2021; Shafahi et al. 2019)。↩︎
342. 数据清洗
从训练流水线中移除敏感或恶意数据。在投毒语境下,清洗指在对抗性训练样本破坏模型权重之前识别并移除它们。特定于 ML 的挑战在于,投毒样本被设计成与干净数据在统计上难以区分,因此朴素过滤(异常值移除、标签验证)会漏掉复杂攻击。有效的清洗需要激活空间分析(谱特征)或影响函数审计,两者在大规模下计算成本均高昂。↩︎
343. 焦耳
能量的国际单位制单位(1 J = 1 瓦·秒)。以此衡量集群规模:单张 A100 GPU 在峰值负载下每秒消耗约 400 焦耳。大模型训练运行以数十亿至数万亿焦耳为单位衡量,因此微小的单次操作低效会放大为设施级的能源需求。↩︎
344. 家庭能源基准
美国平均家庭年耗电量为 10.7 MWh。GPT-3 经验证的 1,287 MWh 训练运行约等于 120 个家庭的年用电量,而后续更大规模的运行可能需要更多算力。这一对比将原本抽象的能源数字锚定到物理基础设施:单次训练运行所需的电网容量可能超过一个居民社区。↩︎
345. 数据中心工业规模
IEA 2025 年《能源与 AI》分析预测,到 2030 年数据中心将消耗约 945 TWh 电力,略低于全球电力需求的 3%。这是一个电力需求指标,不直接等同于航空或水泥行业在全球排放中的份额,但这意味着 AI 基础设施与重工业竞争电网容量:无法扩大发电能力的地区,无论需求如何,都无法扩大 AI 部署。↩︎
346. GPU 制造隐含碳排
NVIDIA HGX H100 产品碳足迹报告显示,八张 H100 基板的碳足迹为 1,312 kg CO[2]e,若均摊到八张 GPU,每张 H100 约为 164 kg CO[2]e (NVIDIA Corporation 2025)。先进制程制造还需要大量超纯水、特种气体、化学品和高温工艺步骤。这一隐含成本意味着,在清洁电网地区(水电、核电),制造排放可能匹敌甚至超过运营碳排,使得硬件寿命和循环经济再利用成为关键的可持续性杠杆。↩︎
347. AI 硬件电子废弃物
2019 年全球电子废弃物达 5,360 万吨,其中计算设备占 15%。AI 加速器加剧了这一问题:受快速演进架构驱动,3-5 年的淘汰周期意味着 1 万张 GPU 的集群每次刷新周期会产生 10–20 公吨有毒电子废弃物,含铅、汞、镉,需专门处置。↩︎
348. 数据中心选址中的环境正义
数据中心倾向于选址低成本土地和电力地区,这往往意味着经济欠发达地区。结果是一种不对称外部性:承载 AI 基础设施的社区承担水资源枯竭、热岛效应和电网压力,而经济利益集中在遥远的科技中心。对 ML 系统工程师而言,这构成了一个设计约束:选址必须将社会许可与电网碳强度纳入考量,因为社区反对可能阻碍或延迟设施扩建。↩︎
349. AI Compute Growth Rate(AI 算力增长率)
从 2012 年到 2019 年,算力增加了 350,000 倍,这意味着大约每 4.6 个月翻一番,比摩尔定律的 2 年翻番快约 5.3 倍。这种差距是能源墙的主要驱动因素之一:硅效率的任何物理上可实现的改进都无法仅靠工艺缩放来匹配以月为单位的翻倍节奏,这使得算法效率和碳感知调度成为大规模可持续性的核心杠杆。↩︎
350. Moore’s Law(摩尔定律)
戈登·摩尔 1965 年观察到晶体管密度每两年翻一番,这为半导体行业带来了数十年的“免费”效率增益。在个位数纳米工艺节点,物理极限使得进一步增益更难实现:单个原子成为约束的一部分。对于 AI 可持续性而言,工艺缩放的放缓意味着额外的效率增益必须来自架构专业化和算法优化,而不仅仅是工艺收缩。↩︎
351. Dennard Scaling(登纳德缩放)
罗伯特·登纳德 1974 年观察到,较小的晶体管可以通过成比例地降低电压在恒定功率密度下运行。这种缩放模式在 2005 年左右结束,因为漏电流使得进一步降压变得不切实际。对 AI 可持续性的直接后果是:没有登纳德缩放,每个工艺节点不再提供成比例的功耗节省,这将效率工作推向专用加速器——GPU 和张量处理单元(TPU)——它们利用架构并行性而非仅靠晶体管物理特性。↩︎
352. PUE (Power Usage Effectiveness,电源使用效率)
2000 年代初期,PUE 值通常为 2.0-2.5,意味着用于制冷的电力多于用于计算的电力(The Green Grid 2007)。Google 2009 年披露的 PUE 1.21 证明了自由空气冷却可以将数据中心开销减半。从 PUE 到 CUE (Carbon Usage Effectiveness,碳使用效率) 和 WUE (Water Usage Effectiveness,水使用效率) 的转变反映了系统级洞察:当水和碳约束独立生效时,仅优化瓦特是不够的。↩︎
353. GPT-3 Energy Scale(GPT-3 能耗规模)
GPT-3 的 1,287 MWh 训练成本换算为美国电价约 13 万美元,平均电网强度下约 552 吨二氧化碳。每十亿参数约 7.35 MWh 的能耗参数比揭示了协同设计的机会:使用混合精度和稀疏性的优化架构可实现每十亿参数 1 MWh 以下,这种数倍的效率增益在大规模训练运行中会复合放大。↩︎
354. Training Communication Overhead(训练通信开销)
分布式训练因跨节点梯度同步和检查点保存,在原始计算之外增加了 15%-30% 的能耗开销。对于需要数千张 GPU 的大模型,仅这一通信税消耗的能量就可能超过中等规模模型整个训练运行的能耗,这使得并行策略选择成为一级可持续性决策。↩︎
355. pJ/FLOP and pJ/MAC
能效规格通常混合浮点运算和买累加运算。一次 MAC 执行一次乘法和一次加法,因此直接比较需要转换单位约定和精度。此处使用的简化层级与本章后面的能效对比一致:CPU 约 100 pJ/FLOP,GPU 稠密张量运算约 10 pJ/FLOP,TPU 约 1-2 pJ/FLOP,定制低精度 ASIC 接近 0.1 pJ/操作。这个层级定义了可持续性机会:为给定工作负载选择合适的硬件层级,无需任何算法更改即可将能耗降低 100-1,000 倍。↩︎
356. Event-Driven Computing(事件驱动计算)
一种仅在输入变化时触发计算而非持续时钟周期的范式。英特尔 Loihi 等神经形态芯片利用这一点,当输入静态时功耗接近零,从而在时序任务(音频、视频、传感器数据)上实现 100-1,000 倍的能耗降低。权衡在于:事件驱动架构在所有数据同时变化的批处理工作负载上牺牲了吞吐量。↩︎
357. Spiking Neural Networks (SNNs)(脉冲神经网络)
第三代神经网络,通过离散脉冲而非连续激活进行通信。SNN 仅在脉冲发生时处理信息,在时序数据(音频、视频、传感器流)上实现 10-100 倍的能耗节省。可持续性权衡在于:SNN 训练算法对于许多基准工作负载仍不如反向传播成熟,但英特尔 Loihi 2 等硬件实现展示了这些架构能逼近的效率上限。↩︎
358. Optimizer Memory as Energy Cost(优化器内存即能耗成本)
自适应矩估计(Adam)需要的内存是普通 SGD 的 3 倍,因为它除了权重本身还存储了每参数的一阶和二阶矩估计。对于 FP32 下的 70B 模型,这意味着 840 GB 的优化器状态。可持续性含义直接:更大的优化器状态意味着每训练步骤更多的 HBM 访问,而在 DRAM 每字节 160 pJ 的情况下,内存开销可能主导参数更新的能耗预算。↩︎
359. Carbon Intensity Variance(碳强度方差)
电网碳强度跨越两个数量级:煤电 820 g CO₂/kWh 对比水电 10-30 g CO₂/kWh。关键的是,强度也随时间变化:得克萨斯州基于风力发电,单日内波动可达 10 倍。这种地理和时间双重方差使得碳感知调度成为可能:结合地理杠杆(第 15.1.1 节 中的 8 到 40 倍范围)与时间调度,可将可实现的差异推向 10 到 80 倍跨度的高端,因此相同的训练运行仅因执行时间和地点不同,排放量就可能相差数倍。↩︎
360. Embodied Carbon(嵌入碳/制造碳)
设备在计算第一个 FLOP 前,制造、运输和处置过程中排放的 CO₂。将 NVIDIA HGX H100 基板产品碳足迹均分到其八张 GPU 上,每张 H100 约 164 kg CO₂e(NVIDIA Corporation 2025);在平均美国电网下以 700 W 连续运行,大约三到四周就能抵消嵌入碳。随着数据中心转向可再生能源,嵌入碳在全生命周期排放中的占比增长,可能超过 30%,使得硬件刷新周期成为一级可持续性决策。↩︎
361. PUE Optimization via ML(基于 ML 的 PUE 优化)
Google 最好的设施实现 PUE 1.08,意味着仅 8% 的能耗开销用于冷却和配电。DeepMind 的强化学习控制器通过利用冷水机组、水泵和环境条件之间基于规则的系统所忽略的非线性相互作用,将冷却能耗降低了 40%。这是一个罕见的正反馈循环:AI 提升了为 AI 提供动力的基础设施效率。↩︎
362. Data Center Emissions Scale(数据中心排放规模)
根据 IEA 2025 年《能源与 AI》分析,数据中心消耗全球电力的 1%-2%,AI 推动了需求增长。IEA 估算数据中心用电排放约 1.8 亿吨,基准情景下预计 2035 年达 3 亿吨,同时仍低于能源部门总排放的 1.5%。最大的超大规模设施持续功耗可超 100 MW,相当于为数万户家庭供电。↩︎
可持续性与 AI 系统注释
363. 超大规模数据中心占地面积
Meta 的 Prineville 设施占地 230,000 m²,容纳超过 150,000 台服务器;主要云服务商的机群每年消耗国家级规模的电力。这些物理规模对可持续性至关重要,因为每个设施的功率需求(100–300 MW)锁定了数十年的电网依赖决策,这是任何算法优化都无法逆转的。↩︎
364. 并行能耗开销
数据并行、模型并行和流水线并行各自施加不同的通信模式,具有不同的能耗成本。数据并行广播梯度(带宽受限);模型并行每层交换激活值(延迟受限);流水线并行引入气泡开销(利用率受限)。GPT-3 结合了这三种方式,并行策略的选择可使相同模型的总训练能耗波动 20–40%。↩︎
365. 梯度同步能耗成本
环形全归约使通信随消息大小线性缩放,但要求每个节点都参与,意味着一个慢节点会浪费整个环的能量。在大规模下,梯度压缩(1-2 位量化)可使每个同步步骤的网络能耗降低 10–50 倍,但会引入统计噪声,可能需要额外的训练迭代,从而部分抵消节省。↩︎
366. 神经架构搜索 (NAS) 碳成本
Strubell 等人(2019)引用的约 284,000 kg CO₂e 数字是原始 Evolved Transformer NAS 的估算值,而非训练单个最终模型的成本。Patterson 等人(2021)后来表明,当考虑搜索的代理任务设置、Google 的 TPU 硬件、数据中心效率和电网组合时,该估算值会大幅下降。系统层面的教训是边界纪律:搜索、调优和失败的试验应纳入核算边界,但可复用的架构搜索应分摊到复用该发现设计的模型和领域中。这一关注点推动了高效 NAS 工作:权重共享、连续松弛和硬件感知搜索降低了搜索预算,因此如何搜索架构的元优化本身就是一个可持续性杠杆(Elsken et al. 2019)。↩︎
367. EUV 光刻能耗成本
每台 ASML EUV 机器持续消耗 1 MW 功率,每天消耗 30,000 升超纯水,能耗比旧式深紫外系统高 10 倍。由于 EUV 是许多先进 AI 加速器所用亚 7 nm 节点的必要工艺,每代芯片的制造能耗随之复合:每颗晶体管数量增加意味着更多 EUV 曝光步骤,使得先进制程制造成为 AI 范围 3 排放的重要组成部分。↩︎
368. 边缘 AI 能耗悖论
边缘推理将单次查询延迟从 100–200 ms(云端)降至 1–10 ms,但将功耗分散到许多始终在线的设备上。Tesla 的 FSD 计算机在驾驶时持续消耗 72 W;将同等车载算力推广到全球车队将意味着约 100 GW 的总功率,相当于数十座大型电厂。可持续性权衡在于:边缘计算消除了网络能耗,却创造了一个碳核算框架不可见的、未计量的分布式能耗足迹。↩︎
369. 温室气体协议 (GHG Protocol)
由世界资源研究所和 WBCSD 共同制定,该框架被向 CDP 报告的 90% 以上财富 500 强企业采用。其三范围分类法对 ML 系统至关重要,因为大多数 AI 碳排放隐藏在范围 3(硬件制造、云计算供应链)中,企业历史上对范围 3 的报告不足比例比范围 1 和 2 高出 50–70%。↩︎
370. 电源使用效率 (PUE)
由 The Green Grid 联盟于 2007 年定义为 P_total / P_IT。Google 全机群 PUE 平均为 1.10;行业平均约为 1.58。对于一个消耗 9.62 MW IT 功率(含机架支持负载)的 10,000 GPU 集群,将 PUE 从 1.58 降至 1.10 可节省 4.62 MW 的冷却开销——相当于每年约 280 万美元的电费,以及让 3,800 户家庭脱离电网的等效效果。采用芯片级直连液冷的 ML 专用设施已展示出 1.03–1.08 的 PUE 值。↩︎
371. 半导体用水规模
TSMC 亚利桑那州晶圆厂将年耗水 120 亿升(约 4,800 个标准奥运泳池),先进制程 AI 芯片因额外 EUV 和清洗步骤,每颗晶粒用水量比旧制程节点高 5–10 倍。这种水资源依赖造成直接的可持续性约束:晶圆厂在亚利桑那州和台湾等旱区与市政供水竞争,半导体用水需求可达城市总配额的 3%。↩︎
372. 生命周期评估 (LCA)
由 ISO 14040/14044 标准化,LCA 追踪从原材料开采到报废处理的环境影响(International Organization for Standardization 2006a, 2006b)。对 AI 硬件而言,LCA 将制造隐含排放与运行能耗分离,使硬件刷新周期和加速器寿命延长成为运行效率 alone 无法替代的首要可持续性杠杆。↩︎
373. 杰文斯悖论
以 Jevons(1865)命名,他观察到 James Watt 的更高效蒸汽机反而增加了总煤炭消费,因为蒸汽动力对新应用变得经济可行。此模式在 AI 中重现:推理成本降低 10 倍可催生 100 倍更多应用(聊天机器人、代码助手、实时翻译),导致总能耗净增。这就是为何单纯的单查询效率若无用量治理,无法保证可持续性。↩︎
374. FLOP/s 与 FLOPs
FLOP/s 表示速率(每秒运算次数);FLOPs 表示运算总量。该区别对可持续性至关重要,因为能耗随 FLOPs(总量)而非 FLOP/s(速率)缩放。GPT-3 总共需 3.1 × 10²³ FLOPs,单次运算能耗跨度达 1000 倍:CPU 约 100 pJ/FLOP,GPU 约 10 pJ/FLOP,TPU 约 1 pJ/FLOP,定制 ASIC 趋近 0.1 pJ/FLOP。↩︎
375. 剪枝能耗影响
90% 稀疏度的结构化剪枝可将推理能耗降低 2–10 倍,因为被消除的权重既不需存储也不需计算,直接减少内存带宽和算术运算。SparseGPT 在 LLM 上实现 60% 非结构化稀疏度,精度损失 <1%,但要从非结构化稀疏获益,需硬件原生支持稀疏执行(如 NVIDIA 的稀疏 Tensor Core)。↩︎
376. 量化节能
INT8 乘累运算能耗约为 FP32 的 1/16,因为算术单元面积和内存带宽随位宽成比例缩减。GPTQ 实现 4-bit LLM 量化(单次运算能耗降 64 倍),困惑度仅增 2%,将 LLaMA-65B 从 130 GB 降至 32 GB,使其可部署于消费级 GPU。可持续性含义是乘法性的:低精度同时降低计算和内存移动的能耗。↩︎
377. 知识蒸馏
由 Hinton 等人(2015)提出,蒸馏利用较大的“教师”模型产生的软概率目标来训练一个紧凑的“学生”模型,捕捉硬标签所丢弃的类间关系。DistilBERT 仅用 60% 的参数量和 40% 更快的推理速度,便保留了 BERT 97% 的准确率。可持续性的核算极具说服力:训练教师加学生的一次性成本可摊销到数百万次推理查询中,这使得蒸馏成为已部署服务中投资回报率(ROI)最高的可持续性干预手段之一。↩︎
378. PUE 差距
行业平均 PUE 为 1.67,意味着 40% 的电力用于制冷和基础设施而非计算,而经过高度优化的 Google 设施报告的 PUE 接近 1.08(仅 7.4% 的开销)。对于一个 100 MW 的 AI 数据中心,这一差距代表着 59 MW 的电力浪费,足以供 47,000 户家庭使用。在超大规模设施中,每降低 0.1 PUE,每年可节省数百万美元的电费,并减少数万吨二氧化碳排放(基于美国平均电网)。↩︎
379. 7×24 小时无碳能源 (CFE)
Google 发布的 2030 年目标要求将每一小时的用电量与实时无碳发电量相匹配,这比年度平均抵消要难得多。弥补剩余差距需要在储能、输电和清洁能源发电方面进行大量投资。这种区别至关重要:年度碳中和允许用可再生能源信用抵消化石燃料用电时段,而逐小时 CFE 则强制从供应链中真正消除碳排放发电。↩︎
380. 制冷能量密度
AI 加速器机柜功率可超过 100 kW,约为传统服务器密度的 10 倍,导致风冷在物理上变得不再适用。直接液冷通过以空气 3,000 倍的体积效率传递热量,将制冷能耗从总设施功率的 38% 降低至 10% 以下。对于 AI 数据中心,制冷系统不再只是基础设施开销,而是物理上限制可共置多少加速器的主动约束条件。↩︎
381. 大规模碳感知调度
Google 的碳感知数据中心研究报告称,仅通过区域内时间偏移即可实现 15% 的碳减排,而通过跨时区路由非紧急批处理计算以追逐可再生能源高峰,全球范围内可实现 40% 的减排(Radovanovic 等人, 2021)。关键洞见在于:延迟容忍型工作负载无需任何模型或基础设施变更,即可接触到截然不同的电网碳强度。↩︎
382. 边际排放 vs. 平均排放
WattTime 的边际排放数据识别出负荷增加时下一个启动的是哪座电厂,与电网平均强度相比,能实现 2 到 5 倍的碳优化效果。这一区别至关重要:平均强度抹平了峰值,但边际数据揭示了在错误时段增加 1 MW 负荷,甚至可能在名义上“清洁”的电网上启动排放强度高达 900 g/kWh 的燃煤峰值电厂。↩︎
383. 欧盟 AI 法案 (2024)
2024 年通过的欧盟 AI 法案是一个早期的广泛 AI 监管框架,为通用 AI 模型创设了义务,并为具有系统性风险的模型(包括被推定拥有训练算力超过 10²⁵ FLOPs 高影响能力的模型)设定了额外义务。技术文档必须包含计算资源和已知或估算的模型能耗。针对通用 AI 模型提供者的违规行为,第 101 条允许处以最高 3% 年全球营业额或 1500 万欧元的罚款;针对禁止性做法的违规则单独适用最高 7% 的罚款上限。↩︎
384. CSRD(企业可持续发展报告指令)
自 2024 年生效起,该欧盟法规要求 50,000 多家公司使用标准化的 ESRS 框架披露经审计的范围 1、2 和 3 排放。对于 AI 基础设施,CSRD 强制披露先前隐藏的成本:GPU 采购的隐含碳、外包云训练的能耗,以及报废硬件处置产生的排放,这些共同构成了 AI 系统范围 3 足迹的大头。↩︎
385. 算力排放交易
欧盟 ETS(2005)开创了工业排放的“限额与交易”模式;将该模式应用于 AI 算力,将为训练集群设定总能耗预算,并允许组织交易盈余容量。该机制将可持续性从自愿优化转变为有价约束:投资提效的组织可向效率较低的竞争对手出售未用配额,创造了与铁律利用率项(η[hw])相一致的财务激励。↩︎
386. AI 领域的漂绿
表现为通过碳抵消声称“碳中和”却同时扩建数据中心,或在总算力增长 10 倍时仅强调单次查询的效率提升。绿色声明规则可要求环境声明提供可验证的证据。对 ML 工程师而言,技术试金石在于可持续性报告是否涵盖了 GHG 协议的全部三个范围,还是方便地遗漏了范围 3(硬件制造、云供应链)——AI 的大量碳排放往往就潜伏于此。↩︎
387. 冯·诺依曼瓶颈
John von Neumann 1945 年的存储程序架构将处理与存储分离,要求持续搬运数据,这消耗了 60%-80% 的系统功率。对于以低算术强度矩阵乘法为主的 AI 工作负载,这一瓶颈意味着大部分能量用于移动数据而非计算结果。存内计算和神经形态架构直接攻克此难题,通过去除存储-处理器往返,推理能耗有望降低 100 到 1,000 倍。↩︎
388. 社会技术系统
由 Tavistock 研究所在 20 世纪 50 年代提出,描述职场中人与技术的相互依存关系。ML 车队是终极的社会技术系统:其“性能”不仅仅是一个基准分数,而是模型输出如何与用户行为、法律框架和物理资源约束相互作用所涌现的属性。↩︎
389. 价值对齐
确保 AI 系统针对人类价值而非代理目标进行优化的问题。Stuart Russell 于 2015 年将其形式化,指出指定目标比优化目标更难。工程后果是:YouTube 2017 年前的推荐算法针对点击率(满意度的代理指标)进行优化,无意中推广了在最大化点击的同时损害用户福祉的阴谋内容——这种错位最终迫使重新设计整个奖励流水线。↩︎
390. 人在回路 (HITL)
一种设计模式,人类主动参与模型决策而非被自动化取代。系统权衡在于延迟与安全性:HITL 根据领域不同,每次决策会增加 100 毫秒到 30 秒以上的延迟。大规模内容审核系统历来将自动分流与数千名人工审核员配对,证明该模式仅随人力基础设施成本成比例地扩展。在 ML 服务架构中,HITL 需要路由逻辑、用于升级的置信度阈值和队列管理,从根本上重塑了推理流水线。↩︎
391. COMPAS (矫正罪犯管理替代制裁画像系统)
ProPublica 2016 年的分析发现,黑人被告被错误标记为未来罪犯的比率,几乎是白人被告的两倍(假阳性率分别为 45% 对 23%)。该系统专有且属于黑盒性质,限制了对模型内部结构和训练数据的全面检查,表明这是一种复合性失效:模型中的偏见与服务架构的不透明性相结合,使得系统更难审计、也更难调试。↩︎
392. GDPR 第 22 条
第 22 条赋予数据主体保护,使其免受仅基于自动化处理且产生法律效力或类似重大影响的决策之害,除非该决策为合同所必需、法律授权、或基于明确同意并具备保障措施(European Parliament and Council of the European Union 2016)。相关的告知与访问条款,包括第 15 条,要求就符合条件的自动化决策所涉及的逻辑提供有意义的信息,而 EDPB 指南将这些义务视为更广泛的画像分析与自动化决策治理制度的一部分(European Data Protection Board 2018)。对 ML 系统而言,这构成了一项架构约束:高风险自动化决策系统需要解释、救济和治理基础设施,而非不透明的仅提供服务的 API。↩︎
393. 医疗算法规模
Optum 算法每年影响约 2 亿美国人,以医疗支出作为健康需求的替代指标。由于黑人患者历史上因医疗获取差异而产生较低费用,该模型系统性地低估了其病情严重程度,导致黑人患者纳入高风险护理项目的比例减少了 50%。修正该替代指标本可将黑人患者的识别率从 17.7% 提高至 46.5%,这量化了单一替代变量选择在人口规模上的代价。↩︎
394. 公平性不可能定理
Kleinberg 等人(2016)和 Chouldechova(2017)证明,当基础比率不同时,校准风险评分与错误率平衡在除完美预测或基础比率相等等受限特殊情况外是不相容的。人口统计学均等是对选择率的一种独特约束,在实践中也可能与校准或错误率目标冲突。其系统层面的后果是根本性的:没有任何工程手段能在所有场景下满足每一项规范性公平标准,因此公平性变成了一种受约束的多目标优化,要求针对特定部署情境显式地做出优先考量哪项标准的策略选择。↩︎
395. 数据中心环境正义
美国主要云计算设施中,相当一部分位于低收入社区 16 公里范围内,这些社区承受着来自备用柴油发电机的空气污染和冷却系统排放的热量。对 ML 车队运营商而言,这构成了一项治理约束:数据中心选址决策若同时优化电力成本和延迟,就会将环境成本外部化,转嫁给最无法获取这些数据中心所赋能的 AI 服务的社区。↩︎
396. 模型记忆化
Carlini 等人(2021)证明,GPT-2 能通过精心设计的提示词逐字复现训练字符串,包括联系信息。其系统层面的含义范围较窄但依然严重:向面向用户的查询暴露生成式输出的模型,会制造一个隐私攻击面,使服务层本身成为数据渗出载体,要求将输出过滤、速率限制和数据最小化控制作为纵深防御措施。↩︎
397. 成员推理攻击
该攻击由 Shokri 等人(2017)首次演示,通过利用已见与未见输入之间的置信度差距,判断特定个人的数据是否被用于训练模型。其系统含义在于:任何通过 API 暴露的 ML 模型都可能成为潜在的隐私神谕,而确定某人的医疗记录是否在疾病预测模型的训练集中,即可泄露敏感健康信息。防御手段包括差分隐私、正则化、置信度校准,以及速率限制等接口控制。↩︎
398. CCPA (加州消费者隐私法案)
CCPA 授予加州居民对受保护个人信息的权利,包括在法定例外情况下的删除权(California Legislature 2023)。对 ML 服务基础设施而言,删除请求构成了一项必须从数据管道源头规划的架构约束,因为原始记录的删除并不会自动消除该记录对训练模型参数的影响。↩︎
399. 对抗性输入
该现象由 Szegedy 等人(2013)首次演示,指那些导致模型自信误分类的、人眼不可察觉的输入扰动。像素空间中幅度仅为 0.005 的扰动,即可使分类器以 >99% 的置信度翻转输出,这揭示了神经网络的决策边界比其测试集准确率所暗示的要脆弱得多。对安全关键型 ML 系统而言,这意味着测试准确率无法保证部署时的鲁棒性,需要将对抗性测试作为一个单独的验证阶段。↩︎
400. 分布偏移
训练数据分布与部署数据分布之间的不匹配,表现为协变量偏移(输入分布变化)、标签偏移(类别比例变化)或概念漂移(输入-输出关系随时间演变)。其系统后果是静默退化:不同于会导致崩溃的软件 Bug,分布偏移会在数周或数月内悄无声息地侵蚀准确率,而不触发错误,这要求建立持续监控基础设施,配备自动重训练触发器和模型版本控制,以便检测和响应。↩︎
401. 模型卡
由 Mitchell 等人(2019)提出,作为随训练好 ML 模型附带的标准化文档。每张卡片在不同人口统计群体上对性能进行基准测试,记录预期用例,并披露已知局限。对生产环境 ML 系统而言,模型卡充当可追溯层,将已部署的二进制制品与其训练溯源、评估结果和已知失效模式关联起来——这是部署后审计和合规所需的最低限度元数据。↩︎
402. 数据集数据表
由 Gebru 等人(2021)提出,模仿电子元件数据手册规定运行条件和公差的做法。每份数据表记录数据集的动机、构成、收集过程和推荐用途。对 ML 流水线而言,数据表充当数据层面的硬件规格说明:它们定义了模型训练分布的有效运行包络,使工程师能预测部署时的分布偏移将在何处导致失效。↩︎
403. LIME(局部可解释模型无关解释)
由 Ribeiro 等人(2016)提出,LIME 通过扰动输入、多次查询黑盒模型,并拟合加权线性代理模型来近似局部行为,从而解释单个预测。其系统权衡在于:解释延迟随扰动样本数量和模型调用成本而变化,因此生产部署通常会在架构允许时使用采样预算、缓存、异步解释工作进程或特定模型方法。↩︎
404. 显著性图
基于梯度的解释方法,通过计算反向传播(即用于训练的同一基础设施)来高亮显示哪些输入区域对预测影响最大。显著性方法通常比扰动密集型或子集枚举方法开销更小,这使得它们在模型支持梯度时,对边缘和移动端部署颇具吸引力。其权衡在于:原始梯度可能包含噪声,并可能高亮显示输入伪影而非有意义的特征,因此平滑处理或重复梯度变体以额外计算换取更稳定的可视化效果。↩︎
405. 联邦学习与公平性
Google 于 2016 年为 Gboard 引入联邦学习,在不集中原始数据的情况下跨多设备进行训练。公平性方面的复杂性在于:没有单一实体能观察到参与者完整的人口统计分布,若无额外协议,便无法直接计算群体层面的公平性指标。联邦公平性评估可能需要隐私保护聚合、安全聚合或差分隐私,与集中式训练相比,这些方法均会改变通信、准确性和治理方面的权衡。↩︎
406. ML 的 API 安全
ML 服务端点面临传统 API 没有的攻击,包括通过重复定向查询进行的模型提取和对抗性输入注入。速率限制、异常检测、访问控制和输入验证可以降低风险,但根本权衡在于:让模型更易于被合法解释性访问,同时也会增加模型窃取和对抗性探测的攻击面。↩︎
407. 拒答(Abstention)
当置信度低于阈值时拒绝预测的做法。拒答可降低高风险错误,但仅靠将部分案例转移至回退基础设施(如人工审核员、基于规则的默认值或升级队列)来实现。自动驾驶汽车将控制权移交给人类驾驶员;医疗 AI 将模棱两可的病例路由给专家审核——两者都要求路由逻辑在系统的延迟和安全预算内执行。↩︎
408. ML 系统中的遥测
实时采集已部署模型的预测延迟、准确性和资源利用率。通常当准确率下降超过 5% 或延迟超过 200 ms 时触发警报。在舰队规模下会出现问责挑战:一个为不同用户服务数百个模型的系统每天会产生数百万遥测事件,将特定有害预测追溯至根本原因(数据漂移、模型退化或阈值配置错误)需要端到端的血统基础设施,而大多数组织缺乏此类设施。↩︎
409. 能耗与隐私的权衡
差分隐私和安全多方计算等隐私保护技术会增加计算、通信和电池消耗。在移动设备上的联邦学习中,其公平性影响是直接的:使用老旧设备、流量套餐有限或电池续航有限的用户可能被排除在受隐私保护的 AI 服务之外,从而形成一个隐私保护取决于硬件资源的系统。↩︎
410. 度量背景
该规模估算假设了常见的生产参考点,如 GPU 训练、GPU 或 CPU 推理、图像/文本/表格模型以及基准数据集。这些数值并非规范常数;它们是数量级规划锚点,用于决定一项防护措施应置于在线、异步、离线还是训练流水线中。↩︎
411. Fairlearn
Microsoft 的开源工具包(2020),用于计算公平性指标并将缓解算法应用于兼容 scikit-learn 的模型(Bird et al. 2020)。其系统集成模式是:公平性度量和缓解包装模型流水线,而非存在于独立的电子表格审计中。其实际意义在于:公平性监控成为 CI/CD 流水线的一个阶段,而非临时审查,从而在模型更新导致子群体性能下降时实现自动回归检测。↩︎
412. 多重校准
由 Hébert-Johnson 等人(2018)开发,该技术旨在跨许多计算上可识别的交叉子群实现校准预测,解决了全局校准掩盖少数交叉群体严重误校准的失效模式。其系统成本来自重复的子群审计和模型更新,而非固定的乘数。多重校准是针对单轴公平性审计遗漏复合差异的多元化平台的一种重要可扩展方法,但并非唯一可能的公平性策略。↩︎
413. k-匿名性
一种隐私保障(Sweeney 2002),通过泛化准标识符(例如用年龄段替代具体年龄、用区域替代具体位置),确保每条记录至少与其他 k − 1 条记录不可区分。其系统权衡是信息损失:较高的 k 值提供更强的不可区分性,但会使特征变粗,并可能降低下游训练信号。对于 ML 预处理流水线,k-匿名性增加了一个转换阶段,必须在隐私保障与较粗特征带来的准确性影响之间取得平衡。↩︎
414. 机器遗忘
由 Cao 和 Yang 于 2015 年首次形式化,即在不完全重新训练的情况下,从模型中移除特定训练数据影响的能力。朴素方法(从头重训)成本与原始训练相同。SISA(分片、隔离、切片和聚合)训练将训练划分为独立分片,将遗忘简化为仅重训练受影响的分片;在下文的 GPT 规模估算示例中,这以模型质量和聚合权衡为代价,大幅减少了重训练范围。对于合规 GDPR 的 ML 系统,遗忘延迟成为服务级关注点:删除请求必须在组织适用的法律和政策时间线内处理完毕。↩︎
415. 差分隐私
由 Dwork 等人(2006)引入的数学框架,通过隐私预算(如 ϵ)参数化,限制单个个体的纳入或排除对发布计算结果的影响程度。DP-SGD 通过裁剪每样本梯度并注入校准噪声,将该框架适配至深度学习(Abadi et al. 2016)。隐私预算量化了隐私、效用和训练成本之间的权衡;Apple 公开描述了针对特定遥测任务的本地差分隐私部署,但这些部署不应被视为通用的 DP-SGD 成本基准(Apple Differential Privacy Team 2017)。↩︎
-
PGD(投影梯度下投):Madry 等人(2018)将其形式化的标准一阶对抗攻击,通过在 L[∞] 扰动球内迭代最大化损失,然后投影回约束边界。针对 PGD 样本进行训练会显著增加计算量,因为每个训练步骤都包含一次内部对抗样本搜索,其成本随攻击迭代次数增长。结果是针对特定威胁模型训练的模型;对于未见过的攻击方法,其迁移能力仍需验证而非假定。↩︎
-
利普希茨常数:函数输出变化相对于输入变化的一个界限:∥f(x[1]) − f(x[2])∥ ≤ L[Lip]⋅∥x[1] − x[2]∥。对于神经网络,较低的利普希茨常数 L[Lip] 限制了对微小扰动的敏感度,直接约束了对抗脆弱性。诸如谱归一化等技术对权重矩阵施加约束以鼓励更平滑的行为,但训练成本和鲁棒性收益取决于架构和威胁模型。↩︎
-
认证防御:由数学证明而非经验测试支持的鲁棒性保证。随机平滑(Cohen 等人 2019)对许多加噪扰动输入的预测进行平均,产生一个可证明的鲁棒性半径,在该半径内没有对抗扰动能改变输出。权衡在于认证可能需要更多额外的模型评估,并可能降低干净准确率,这使得认证防御更适合作为离线验证门控或选择性服务路径,而非通用的内联检查。↩︎
-
积分梯度:一种归因方法,沿着从基线输入到实际输入的路径积分梯度。与普通梯度不同,它满足两条公理(敏感性和实现不变性),保证当特征重要时归因发生变化,且在功能等价模型间保持一致(Sundararajan 等人 2017)。其成本高于单次原始梯度解释,因为该方法在基线到输入的路径上多个点评估模型,通常为 50–300 个离散步骤,这使其更适合有限的解释预算,而非每次内联预测。↩︎
-
GradCAM(梯度加权类激活映射):Selvaraju 等人(2017)利用流入最后一层卷积层的梯度生成空间重要性图,将类激活映射推广到任意卷积神经网络(CNN)架构。因为它复用梯度计算,GradCAM 的成本可能远低于扰动繁重的解释方法,但它是否适合实时医学成像或自动驾驶管道,取决于模型、硬件、批大小和解释频率预算。↩︎
-
沙普利值:源自合作博弈论,沙普利值基于所有可能排序中的边际贡献,在参与者间公平分配收益。在 ML 可解释性中,特征是“参与者”,预测是“收益”。数学保证(效率性、对称性、虚拟参与者)使 SHAP 成为一个广泛使用且具有清晰公理吸引力的归因框架,但精确子集枚举随 n 个特征按 2^(n) 增长,这就是为什么生产系统通常依赖特定模型算法、采样近似、缓存或异步解释路径(Lundberg 和 Lee 2017)。↩︎
-
反事实解释:Wachter 等人(2017)为 ML 形式化了反事实,它回答“需要改变什么?”而非“为什么会发生这件事?”。对于合规性,它们可提供可操作的补救措施:“如果申请人收入高出 5000 美元,贷款将获批。” 生成反事实需要解决一个约束优化问题,寻找能翻转输出的可行输入变化,因此延迟和可靠性取决于特征维度、领域约束,以及是否强制执行不可变或单调属性。↩︎
-
自动化偏见:20 世纪 90 年代首见于航空领域研究,这是一种悖论:人类即使在自动化系统明显错误时也会顺从其判断——且随着系统准确率提高,这种效应会增强。在 70–80% 的模型准确率下,操作员在未提供不确定性指示器时,会以高比率接受错误输出。对于 ML 服务系统,这意味着更高的模型准确率可能悖论性地通过抑制人工监督而降低系统级安全性,需要刻意的界面摩擦(不确定性可视化、强制理由说明)来增加延迟但保留人工纠错通道。↩︎
-
红队演练:源自冷战军事模拟,当时“红队”扮演苏联对手以探测美国防御。在负责任 AI 中,红队演练是对抗性审计阶段:专业团队(黑客、语言学家、伦理学家)在部署前刻意探测模型的越狱、偏见或有毒输出。这一发现过程能识别标准单元测试无法捕获的长尾风险。↩︎
-
数据营养项目:一项非营利倡议,开发模仿营养标签的标准化数据集文档,总结用于 ML 流水线的数据集的来源、构成、分布和已知问题。该项目的标签使下游工程师能看清数据集风险,而这些工程师无法接触原始收集过程——这是此处描述的组织碎片化所必需的桥梁。↩︎
-
面向 ML 的 DevOps (MLOps):ML CI/CD 流水线必须处理数据版本控制、训练复现和算法变更的 A/B 测试,超越传统软件关注点。高速度 ML 组织部署模型或配置变更的频率,可能远超人工完成负责任 AI 审查的速度,造成速度鸿沟:以小时计的部署周期与需要数天或数周的伦理验证相竞争。这种张力解释了为何原型阶段存在的负责任 AI 承诺,在系统扩展时会被降级。↩︎
-
AI 安全:一个研究领域,解决 ML 系统优化目标与人类意图之间的差距,涵盖近期风险(偏见、隐私)至长期对齐担忧。主要 AI 实验室将安全视为明确研究领域,反映了工程现实:随着模型变得更强大或更自主,目标错位的代价可能急剧上升——错位的推荐系统损害用户体验,而错位的自动驾驶汽车危及生命。↩︎
-
代理指标:对于难以直接量化的目标所用的可测量替代指标,受古德哈特定律约束:“当一个度量成为目标时,它就不再是一个好的度量。”在 ML 系统中,代理目标分歧是价值错位的核心机制:点击率作为满意度的代理,损失作为泛化的代理,参与度作为用户福祉的代理——随着模型能力增强,每个代理都会产生系统性偏离预期目标的优化压力。↩︎
429. CTR 与参与度优化
点击率、观看时长及相关参与度指标是用户满意度的便捷代理指标。YouTube 发布的推荐架构论文探讨了按预期观看时长对视频进行排序 (Covington et al. 2016),而后续的审计研究则通过政治极端内容考察了推荐路径 (Ribeiro et al. 2020)。系统层面的教训是:代理指标的选择是一项具有全系统行为后果的架构决策,而不仅仅是超参数的选择。↩︎
430. 奖励黑客
当 AI 系统通过违背设计者意图的非预期手段最大化其奖励函数时。一个玩俄罗斯方块的 AI 学会了无限暂停以避免失败;一个清洁机器人把物品打翻制造混乱,以便随后清理。对于生产级 ML 系统,奖励黑客以微妙的方式表现出来:通过推广让人上瘾的内容来最大化参与度的推荐模型,或通过阿谀奉承而非准确回答来最大化有用性评分的聊天机器人。这种失效模式随模型能力的增强而放大。↩︎
431. 规范博弈
与奖励黑客(利用实现漏洞)不同,规范博弈揭示了目标规范中真实存在的缺口——系统满足了目标的字面要求,却违背了其初衷。一个被训练抓取物体的机械手学会了把物体打翻(楔在桌面上更容易“抓住”)。对于 ML 系统,这激励采用多目标优化和 RLHF 作为规范方法,纳入除单一标量指标之外的更广泛约束,以额外的数据、训练和审查成本为代价,换取更能逼近人类意图的目标。↩︎
432. RLHF(基于人类反馈的强化学习)
Christiano 等人 (2017) 通过从非专家对轨迹片段的比较中训练智能体,展示了基于人类偏好的深度强化学习。在 LLM 场景下,Ouyang 等人 (2022) 为 InstructGPT 实现了一个相关流水线:基于演示的监督微调、基于排序模型输出的奖励模型训练,以及针对学习到的奖励模型的强化学习微调。系统成本在于额外的人类反馈数据管道、奖励模型的训练与评估,以及对标注员指令的治理;标注员池的代表性和标注策略决定了模型内化了谁的偏好。↩︎
433. 硬件能力上限
在舰队规模下,硬件设定了软件无法逾越的硬性上限。峰值算力 (R[peak])、带宽分割和热设计功耗是物理极限,而非调优旋钮,因此任何超出其中一项的工作负载在基础设施变更前根本无法运行。系统工程的艺术在于将工作负载装入这些物理极限之内,而非妄想它们消失。↩︎
434. 尾延迟
第 10 章 分析的一种标准扇出估算尾部效应的方法:在 99 分位数下,一个接触 100 台服务器的请求有 63.4% 的几率至少遇到一台慢速服务器。↩︎
435. 环形 AllReduce
一种集体通信操作,每个工作进程移动 2(N − 1)M/N 字节(消息大小为 M),在 α-β 通信模型下得到 \(T_{\text{allreduce}} \approx 2(N-1)\alpha + \frac{2(N-1)}{N}\frac{M}{\beta}\)。随着 N 增长,系数趋近于每个工作进程 2 倍消息量,同时对大消息保持带宽最优。详见 第 6 章。↩︎
436. 梯度压缩
第 6 章 探讨了通过稀疏化、量化和误差反馈将通信量减少 10–100 倍的技术,从而实现受带宽限制的分布式和联邦训练。↩︎
437. 弹性训练
第 7 章 描述了弹性训练,它支持动态工作进程成员资格:故障发生后作业在剩余工作进程上继续运行,并在新资源可用时无缝纳入。↩︎
438. 生命周期评估
第 15 章 介绍了一种评估系统整个生命周期环境影响的方法,包括硬件制造中的隐含碳排放(通常占总影响的 20–50%)。↩︎
439. 斯特拉格勒(掉队者)
完成任务速度慢于同伴、从而成为同步训练瓶颈的工作进程:一个以 80% 速度运行的单个斯特拉格勒会使集群吞吐量降低 20%。详见 第 7 章。↩︎
440. MECE(相互独立,完全穷尽)
源自管理咨询(由麦肯锡推广)的一种分类原则,要求类别之间不重叠且共同覆盖所有可能性。应用于系统工程时,它作为一种理想化的分解很有用,但在实践中 D·A·M 瓶颈往往重叠:一个内核可能同时受限于内存、同步开销大,且与可用硬件匹配不佳。↩︎
441. 算术强度
浮点运算次数与传输字节数的比率 (FLOP/byte)。通过与硬件的屋顶点 (R[peak]/BW) 对比,它决定了工作负载是受内存限制还是受计算限制。↩︎
442. MFU(模型 FLOPs 利用率)
仅衡量有用的模型计算,排除梯度同步和内存管理等开销。↩︎

浙公网安备 33010602011771号