【大模型技术落地实践】3 - 构建健壮的Token服务
背景
企业级应用需要健壮的Token服务
Token 生产效率的度量与计算公式
| 指标类别 | 指标名称 | 指标说明 | 计算公式 | 优化方法 |
|---|---|---|---|---|
| Token 产能效率 | 上下文长度 (Context Window) | 上下文长度 = 大模型一次能记住和处理的最大文字总量(用 Token 计量),即:AI 一次性能看完、记住的最长聊天 / 文档字数上限。 | 上下文长度 = 模型单次推理可承载的输入上下文和输出生成总 Token、容纳上限 | 1. 采用 RoPE/ALiBi 位置编码扩容上下文。 2. 启用滑动窗口注意力、稀疏注意力。 3. 上下文分片压缩、KV Cache 复用优化。 4. 长上下文专用模型架构适配。 |
| 每秒 Token 吞吐 (Tokens/s) | 单位秒内系统处理或生成的 Token 数量,衡量 Token 生产的“瞬时速度”。 | Tokens/s = 统计周期内 Token 总数 / 统计周期时长(秒) | 1. 优化批处理调度。 2. 模型量化压缩(FP16→INT8)。 3. 预填充 - 解码分离(Prefill-Decode)分离。 |
|
| 有效 Token 产能 (eTPM) | 单位时间内满足成功率、质量约束和时延约束的有效 Token 产出量,是核心指标。 | eTPM = Output TPM × 请求成功率 × 质量达标率 × 时延达标率 | 1. 提升模型健壮性,减少失败请求。 2. 优化 TTFT 和 TPOT。 3. 通过指令微调、RLHF 提升生成质量。 |
|
| 时延与响应体验 | 首 Token 生成时延 (TTFT) | 从请求发出到首个输出 Token 返回的时间,决定交互式服务的音响速度。 | TTFT = 首个输出 Token 返回时间 - 请求发出时间 | 1. 优化 Prefill 阶段(闪存注意力 FlashAttention)。 2. 减少排队时延(智能路由、负载均衡)。 3. 启用 Prefix Cache。 |
| 逐 Token 推理时延 (TPOT/ITL) | 首 Token 返回后,相邻输出 Token 之间的平均时间间隔,决定流式输出是否顺畅。 | TPOT = (总输出时间 - TTFT) / (输出 Token 总数 - 1) | 1. 提升 HBM 带宽。 2. 优化 KV Cache(键值缓存)管理(分页注意力机制 PagedAttention)。 3. 投机解码。 |
|
| 全链路端到端时延 (E2E Latency) | 从请求发出到完整响应结束的总耗时。 | E2E Latency = 完整响应结束时间 - 请求发出时间 | 1. 全链路性能分析优化。 2. 高速网络互联(800G/1.6T 光模块)。 3. 边缘部署。 |
|
| 服务承载能力与稳定性 | 合规 SLA 达标并发数 | 在既定时延、成功率和错误率约束下,系统能够稳定承载的最大并发请求规模。 | 通过压力测试,逐步增加并发请求数,直到任一 SLA 指标不达标为止 | 1. 弹性伸缩(Kubernetes)。 2. 限流熔断策略。 3. 科学容量规划。 |
| 请求成功率与错误率 | 成功完成的请求占总请求的比例,以及失败、超时等异常请求的比例。 | 成功率 = 成功请求数 / 总请求数 × 100%; 错误率 = 失败请求数 / 总请求数 × 100% |
1. 提升模型健壮性。 2. 完善异常处理机制。 3. 建立监控告警体系。 |
|
| 可用性 | 系统在统计周期内处于可正常对外提供服务状态的时间比例。 | 可用性 = (总时间 - 不可用时间) / 总时间 × 100% | 1. 多可用区冗余部署。 2. 故障恢复机制(自动重启、主备切换)。 3. 定期故障演练。 |
|
| 长稳运行波动率 | 系统在长时间持续运行中,Token 吞吐、时延或资源利用率相对平均水平的波动程度。 | 波动率 = (指标最大值 - 指标最小值) / 指标平均值 × 100% | 1. 资源泄漏检测。 2. 性能漂移监控。 3. 定期重启策略。 |
|
| 资源利用与能效 | 异构加速器硬件利用率 | GPU/NPU 等加速器在统计周期内实际参与计算的资源利用程度。 | 加速器利用率 = 实际计算时间 / 总时间 × 100% | 1. 提升 GPU/NPU 有效计算占比。 2. KV Cache 逐级卸载缓解显存瓶颈。 3. 降低多卡、多机和跨存储访问通信等待。 |
| 显存占用率与显存 / Token | 推理服务占用显存的比例,以及单位 Token 对应的显存占用。 | 显存占用率 = 已用显存 / 总显存 × 100%; 显存 / Token = 已用显存 / Token 总数 |
1. 模型量化压缩。 2. KV Cache 优化(PagedAttention)。 3. 模型跨栈。 |
|
| Prefill 吞吐与 Decode 吞吐 | 分别衡量输入处理阶段和输出生成阶段的 Token 处理能力。 | Prefill 吞吐 = Prefill 阶段 Token 数 / Prefill 阶段时长; Decode 吞吐 = Decode 阶段 Token 数 / Decode 阶段时长 |
1. Prefill 优化(FlashAttention)。 2. Decode 优化(投机解码、KV Cache 优化)。 3. 硬件分工(GPU+LPU)。 |
|
| KV 缓存 / 前缀缓存命中率 | 缓存被复用的请求数量占查询请求的比例。 | Cache 命中率 = 缓存命中请求数 / 总查询请求数 × 100% | 1. 优化缓存淘汰策略(LRU、LFU)。 2. 共享前缀缓存。 3. 缓存预热。 |
|
| 单 Token 推理能耗与整体 Token 能效 | 产生一个有效 Token 消耗的平均能量,以及单位能量产生的有效 Token 数量。 | 单 Token 能耗 = 总能耗 / 有效 Token 总数; Token 能效 = 有效 Token 总数 / 总能耗 |
1. 采用高能效芯片。 2. 液冷散热(PUE<1.2)。 3. 算电协同。 |
|
| 单位有效 Token 成本 | 产生一定数量有效 Token 所需的平均成本。 | 单位有效 Token 成本 = (GPU 折旧 + 电费 + 运维) / 有效 Token 总数(元 / 百万有效 Token) | 1. 降低电力成本(绿电富集区选址)。 2. 提升 Token 产出。 3. 规模效应。 |
|
| 资源利用与能效 | 投资回报率 (ROI) | 投资收益与投入成本之间的比例。 | ROI = (总收入 - 总成本) / 总成本 × 100% | 1. 提升收入(吸引更多客户)。 2. 降低成本。 3. 优化定价策略。 |
| 并行扩展效率 | 系统从单卡 / 单节点扩展到多卡 / 多节点后,有效 Token 产能的线性扩展程度。 | 并行扩展效率 = (多节点 eTPM / 单节点 eTPM) / 节点数 × 100% | 1. 优化互联网络(NVLink、InfiniBand)。 2. 优化并行策略(张量并行、流水线并行)。 3. 减少同步开销。 |
优化方向
核心目标是提升 Token 生产速度、瞬时吞吐能力,重点增加有效 Token 产出,确保产能贴合实际业务需求,避免无效 Token 浪费,打造高效的 Token 生产体系。
01 上下文长度 (Context Length) 优化
上下文长度反映了大模型单次推理可承载的输入与输出生成总 Token 上限,具体优化措施如下:
- 01 采用 RoPE/ALiBI 位置编码扩容上下文:无需大幅修改模型结构,通过优化位置编码方式,有效缓解长序列位置混淆问题,实现上下文长度的高效扩容,适配中长文本处理需求。
- 02 启用滑动窗口注意力、稀疏注意力机制:减少长序列下注意力计算的冗余开销,降低显存占用,在不牺牲模型理解能力的前提下,提升长上下文处理效率。
- 03 优化上下文分片压缩与 KV Cache 复用策略:对超长上下文进行合理分片处理,同时复用已计算的 KV 缓存,减少重复计算,平衡上下文长度与推理速度。
- 04 适配长上下文专用模型架构:针对长文本场景优化模型结构,强化模型对长序列信息的捕捉与记忆能力,进一步提升上下文扩容后的实用性与稳定性。
02 每秒 Token 吞吐 (Tokens/s) 优化
重点提升 Token 生产的瞬时速度,适配高并发场景下的瞬时请求峰值,确保吞吐稳定,具体措施如下:
- 01 批处理调度优化:优化批处理策略,采用动态批处理、连续批处理等方式,合理分配计算资源,减少请求排队等待时间,提升单位时间内的 Token 处理量。
- 02 模型量化压缩:将模型从 FP16 精度压缩至 INT8 精度,在保证生成质量的前提下,减少计算量与显存占用,提升 Token 生成的瞬时速度。
- 03 阶段分离优化:实施 Prefill-Decode 分离策略,将输入处理(Prefill)与输出生成(Decode)两个阶段独立调度,提升两个阶段的并行效率,减少相互等待耗时。
- 04 注意力 - 前馈网络解耦 (AFD) 架构优化:将 LLM 推理核心的注意力(Attention)模块与前馈网络(FFN)模块解耦拆分,打破原生串行架构的计算瓶颈,实现双模块并行高效运行。同时可针对高并发场景动态调配双模块算力资源,精准适配 Prefill 与 Decode 阶段的差异化算力需求,大幅提升 Token 生成的瞬时吞吐与高并发场景下的吞吐稳定性。
03 有效 Token 产能 (eTPM) 优化
作为核心指标,重点提升单位时间内满足成功率、质量约束和时延约束的有效 Token 产出,实现“速度与质量”双提升,具体措施如下:
- 01 提升模型健壮性:通过多场景数据训练、异常样本增强等方式,减少请求失败、生成异常等情况,提升请求成功率,为有效 Token 产出奠定基础。
- 02 时延优化联动:针对性优化 TTFT(首 Token 时延)和 TPOT(逐 Token 时延),确保 Token 生成的时延满足业务约束,避免因时延不达标导致有效 Token 计数减少。
- 03 KV Cache 管理优化:采用 PagedAttention(分页注意力)技术,优化 KV Cache 的存储与访问方式,提升缓存利用率,减少缓存查找与更新耗时。
- 04 投机解码应用:引入投机解码技术,通过小模型快速生成候选 Token,再由大模型验证优化,减少大模型逐 Token 生成的耗时,提升流式输出效率。
04 时延与响应体验优化
缩短首响时间、逐 Token 间隔与端到端总耗时,提升流式输出流畅度,优化用户交互式体验,满足低时延业务场景要求(如实时对话、即时生成等)。
01 首 Token 时延 (TTFT) 优化
聚焦减少请求发出到首个输出 Token 返回的时间,提升首响体验,具体措施如下:
- 01 Prefill 阶段优化:采用 FlashAttention 技术,优化输入处理阶段的注意力计算效率,减少 Prefill 阶段耗时,加快首个 Token 的生成速度。
- 02 排队时延优化:部署智能路由与负载均衡机制,将请求合理分配至空闲计算节点,减少请求排队等待时间,提升首响效率。
- 03 缓存机制启用:启用 Prefix Cache(前缀缓存),对高频请求的前端内容进行缓存,重复请求时直接复用缓存结果,缩短首 Token 生成时间。
02 逐 Token 时延 (TPOT/ITL) 优化
重点减少首 Token 返回后,相邻输出 Token 的平均时间间隔,确保流式输出顺畅,避免卡顿,具体措施如下:
- 01 硬件带宽提升:升级 HBM 带宽,加快数据读取与传输速度,减少 Token 生成过程中的数据等待时间,缩短逐 Token 间隔。
- 02 投机解码应用:引入投机解码技术,通过小模型快速生成候选 Token,再由大模型验证优化,减少大模型逐 Token 生成的耗时,提升流式输出效率。
- 03 全链路端到端时延 (E2E Latency) 优化
- 全面缩短从请求发出到完整响应结束的总耗时,实现全链路时延优化,具体措施如下:
- 01 全链路性能分析:对 Token 生成的全链路进行性能排查,定位时延瓶颈(如网络传输、计算处理、缓存访问等),针对性进行优化。
- 02 网络互联升级:采用 800G/1.6T 光模块,提升网络传输速度,减少跨节点、跨模块的数据传输时延,保障全链路数据流畅传输。
- 03 注意力 - 前馈网络解耦 (AFD) 架构优化:通过将 LLM 推理核心的注意力(Attention)模块与前馈网络(FFN)模块解耦拆分,打破原生串行架构的核心计算瓶颈,消除模块间串行等待耗时。此架构同时兼顾中长文本、高并发场景,可有效降低端到端时延。
05 服务承载能力与稳定性优化
Token 服务承载与稳定性优化的核心目标是提升系统并发承载能力,降低请求错误率,保障系统长期稳定运行,减少不可用时间与性能波动,满足大规模、长时间的服务部署需求。
01 合规 SLA 达标并发优化
提升在既定 SLA(服务等级协议)约束下(时延、成功率、错误率),系统能够稳定承载的最大并发请求规模,具体措施如下:
- 01 弹性伸缩部署:基于 Kubernetes 技术实现计算资源的弹性伸缩,根据并发请求量动态增加或减少节点资源,确保高并发时资源充足,低并发时资源不浪费。
- 02 限流熔断策略:设置合理的限流阈值,对超出阈值的请求进行限流处理,避免系统过载;同时部署熔断机制,当某一节点或模块出现异常时,快速切断故障链路,防止故障扩散。
- 03 容量规划优化:通过压力测试、业务场景模拟等方式,精准评估系统承载能力,进行科学的容量规划,提前预留冗余资源,应对突发并发峰值。
02 请求成功率与错误率管控优化
提升成功请求占比,降低失败、超时等异常请求比例,保障服务可靠性,具体措施如下:
- 01 模型健壮性提升:加强模型的异常处理能力,针对恶意请求、异常输入等场景进行专项训练,减少模型崩坏、生成失败等情况。
- 02 异常处理完善:建立全流程异常处理机制,对请求超时、网络中断、计算错误等异常情况进行捕获与重试,降低失败请求数量;同时优化错误提示,提升问题排查效率。
- 03 监控告警体系:部署实时监控系统,对请求成功率、错误率等指标进行实时监测,设置告警阈值,当指标异常时及时触发告警,运维人员快速介入处理。
03 业务服务可用性优化
提升系统在统计周期内的可用时间比例,减少不可用时间,保障服务连续性,具体措施如下:
- 01 多可用区冗余部署:将系统部署在多个可用区,每个可用区独立运行,当某一可用区出现故障时,快速切换至其他可用区,确保服务不中断。
- 02 故障恢复机制:建立自动重启、主备切换等故障恢复机制,当节点或模块出现故障时,自动触发恢复流程,缩短故障恢复时间;同时定期备份数据,防止数据丢失。
- 03 定期故障演练:定期开展故障模拟演练,模拟网络中断、硬件故障、模型异常等场景,检验故障恢复机制的有效性,优化运维流程,提升应急处置能力。
04 集群长稳运行波动率优化
降低系统长时间运行中,Token 吞吐、时延、资源利用率等指标的波动程度,保障系统性能稳定,具体措施如下:
- 01 资源泄漏检测:部署资源泄漏检测工具,实时监测内存、显存等资源的使用情况,及时发现并清理资源泄漏问题,避免资源占用持续上升导致性能波动。
- 02 性能漂移监控:建立性能漂移监测机制,跟踪 Token 吞吐、时延等核心指标的变化趋势,当指标出现异常漂移时,及时排查原因(如硬件老化、模型退化等),进行针对性优化。
- 03 定期重启策略:制定合理的定期重启计划,对长期运行的节点或模块进行定期重启,释放冗余资源,避免性能持续下降,保障系统长期稳定运行。
06 资源利用与能效优化
本部分核心目标是提升加速器、显存等资源的利用率,优化缓存命中率,降低单 Token 能耗,实现“高效利用、绿色节能”,减少资源浪费与能耗成本。
01 异构加速器硬件利用率优化
提升 GPU/NPU 等加速器的实际计算时间占比,充分发挥硬件计算能力,通常从计算、存储和网络调度三个维度协同优化,常见的具体措施如下:
- 计算侧:按计算特征将负载拆解到不同硬件,其中 CPU 负责全局调度与动态批处理;GPU/NPU 主攻稠密矩阵与注意力计算。通过加入 LPU 专攻解码阶段低密度但高访存的生成推理,进一步释放 GPU/NPU 的矩阵算力。
- 存储侧:当 HBM 不足以承载全部 KV Cache 时,通过引入 KV Cache Offloading 和分层存储机制,将 KV Cache 逐级卸载至 CPU 内存、CXL 内存池、本地 NVMe SSD 中。英伟达以 CXL/STX 承载上下文内存存储,国内则通过 CXL 统一内存池、MemoryBox 等组合实现类似能力。
- 网络侧:Scale-Up 域依靠 NVLink 或其他互联协议提升单机 / 单柜内协同效率;Scale-out 域以 InfiniBand 或 RoCE v2 承载跨机通信;此外,通过引入 DPU / SmartNIC 将网络协议栈、存储访问、安全加密、虚拟化等任务从 CPU 中卸载出来,让 CPU 更专注于请求调度和服务编排,确保 GPU/NPU 算力聚焦模型计算。
02 显存占用及单位 Token 显存开销优化
合理控制显存占用比例,降低单位 Token 的显存消耗,避免显存不足导致的性能瓶颈,具体措施如下:
- 01 模型量化压缩:通过 INT8 量化、模型剪枝等技术,减少模型参数规模,降低模型运行时的显存占用,同时不影响生成质量。
- 02 KV Cache 优化:采用 PagedAttention 技术,对 KV Cache 进行分页管理,按需分配显存空间,减少显存浪费,提升显存利用率。
- 03 模型剪枝优化:对模型进行结构化剪枝,去除冗余的模型参数与计算链路,减少显存占用的同时,提升模型运行速度。
03 Prefill 预处理吞吐与 Decode 解码吞吐优化
分别提升输入处理(Prefill)与输出生成(Decode)阶段的 Token 处理能力,实现全阶段高效处理,具体措施如下:
- Prefill 阶段优化:采用 FlashAttention 技术,优化注意力计算流程,提升 Prefill 阶段的 Token 处理速度,减少输入处理耗时。
- Decode 阶段优化:结合投机解码、KV Cache 优化等技术,提升 Decode 阶段的 Token 生成效率,减少逐 Token 处理耗时;同时优化解码逻辑,提升并行处理能力。
- 硬件分工协作:采用“GPU+LPU”的硬件分工模式,GPU 负责复杂的计算任务,LPU 负责简单的辅助计算与数据处理,提升整体吞吐能力。
04 KV 缓存 / 前缀缓存命中率优化
可通过提升缓存复用率,减少重复计算,缩短 Token 生成时间,降低资源消耗,具体措施如下:
- 缓存淘汰策略优化:采用 LRU(最近最少使用)、LFU(最不经常使用)等优化的缓存淘汰策略,优先保留高频访问的缓存内容,提升缓存命中率。
- 共享前缀缓存:建立共享前缀缓存机制,对不同请求的相同前缀内容进行共享缓存,减少重复占用,提升缓存复用率。
- 缓存预热机制:针对高频请求场景,提前将相关前缀内容、常用模型参数等加载至缓存中,减少请求时的缓存加载时间,提升缓存命中率。
05 单 Token 推理能耗与整体算力能效优化
降低单位有效 Token 的能耗,提升单位能量下有效 Token 的产出,实现绿色节能,具体措施如下:
- 高能效芯片采用:选用高能效比的 GPU/NPU 芯片,在保证计算性能的前提下,降低单位计算任务的能耗。
- 散热系统优化:部署液冷散热系统,将电源使用效率(PUE)控制在 1.2 以下,减少散热能耗,降低整体系统能耗。
- 算电协同优化:建立算电协同机制,根据电力供应情况、能耗成本,动态调整算力任务运行时间与资源分配,提升整体算力 Token 能效。
07 经济效率优化
本部分核心目标是降低单位有效 Token 成本,提升投资回报率,优化并行扩展效率,实现“降本增效”,提升业务盈利水平与可持续发展能力。
01 单位有效 Token 成本优化
降低产生百万有效 Token 所需的平均成本,控制硬件、电力、运维等各项成本支出,具体措施如下:
- 1. 电力成本降低:将数据中心选址在绿电富集区,利用可再生电源(如风电、光伏),降低电力采购成本;同时优化能耗管理,减少无效能耗。
- 2. Token 产出提升:通过前面各项的优化措施,提升有效 Token 产能与吞吐效率,增加单位时间内的有效 Token 产出,摊薄单位 Token 的固定成本。
- 3. 规模效应发挥:扩大业务规模,提升计算资源的利用率,通过批量采购硬件、电力等资源,获得成本优势,降低单位 Token 的采购成本。
02 投资回报率 (ROI) 优化
提升投资收益与投入成本的比例,实现投资价值最大化,具体措施如下:
- 1. 收入提升:优化服务质量(低时延、高稳定性、高质量 Token),吸引更多客户合作,扩大业务收入规模,同时拓展多元化服务场景,提升单位客户的收入贡献。
- 2. 成本控制:通过资源利用率优化、能耗降低、运维效率提升等方式,控制硬件采购、电力消耗、运维人力等各项成本支出,减少无效投入。
- 3. 定价策略优化:结合市场需求、成本水平、服务质量,制定合理的定价策略,在保证竞争力的前提下,提升单位有效 Token 的收入,优化 ROI。
03 并行扩展效率优化
提升系统从单卡 / 单节点扩展到多卡 / 多节点后的线性扩展能力,避免扩展过程中出现性能瓶颈,降低扩展成本,具体措施如下:
- 1. 互联网络优化:采用 NVLink、InfiniBand 等高速互联技术,提升多节点、多卡之间的数据传输速度,减少跨节点数据同步耗时。
- 2. 并行策略优化:优化张量并行、流水线并行等并行计算策略,合理分配计算任务,减少并行过程中的冗余计算与同步开销,提升扩展效率。
- 3. 同步开销减少:通过优化同步机制、减少跨节点通信频率等方式,降低多节点并行时的同步开销,确保扩展后有效 Token 产能能够线性提升。

浙公网安备 33010602011771号