1 亿 Token 电费 8 块钱:4×4090 本地跑 Qwen3.8-27B 值不值?
消费级显卡能不能稳稳接住 27B 的生产流量?我们把升级 vLLM、开投机解码、双实例拓扑、1 亿 Token 产能全部实测了一遍。

BF16 权重 55.6GB,一张卡装不下;AWQ 量化后又担心"智力掉分"。本文在单机 4×RTX 4090 上完成了一次全维度实测:升级 vLLM 0.25→0.29、启用 MTP 投机解码、对比 TP4 与双实例拓扑、跑通 262K 长上下文、验证智力回归、测出 1 亿 Token 的真实产能。
01|测试环境消费级主机
| 项目 | 配置 |
|---|---|
| GPU | 4 × RTX 4090 24G(TP=4 用 GPU1-4,无 NVLink、无 P2P,纯 PCIe) |
| 模型 | Qwen3.8-27B-AWQ-INT4(compressed-tensors W4A16,Marlin 内核) |
| 推理引擎 | vLLM 0.25.0(基线)→ 0.29.0(升级后) |
| 上下文 | 原生 262,144 tokens,不裁剪 |
| 系统 | Ubuntu(内核 6.8) |
测:单流延迟、聚合吞吐、首字延迟(TTFT)、预填峰值、256K 长上下文、MTP 接受率、智力回归(GSM8K+MMLU 各 200 题×2 轮)、1 亿 Token 产能。所有性能数据用 vLLM 官方 vllm bench serve 同口径采集,每个配置跑全请求零失败才算数。
02|单流:MTP 是检查点里"白送"的加速器
Qwen3.8-27B 的检查点里内置了一个 MTP(多 Token 预测)草稿头——训练时就练好了,部署时只要一行参数就能启用。它让"读一遍权重只换 1 个 token"变成"换最多 2 个":

TPOT(每 token 延迟)从 9.38ms 降到 8.28ms,等效生成速度 +12%。而且投机解码经过拒绝采样校验,输出分布与不开完全一致——是真正的"免费午餐"。
免费午餐有边界,第 5 节会看到它的代价。
03|吞吐天花板:机器的极限在哪
固定 1024 输入/256 输出,把并发从 1 拉到 128:

三个结论:
- TP4 单实例的吞吐天花板是 ~840 tok/s,饱和点在并发 64 附近——从 64 拉到 128,吞吐只涨 4.8%,TPOT 却恶化 58%,纯粹是排队空转;
- 2×TP2 双实例把天花板抬到 ~1080 tok/s(+29%):两个独立引擎各管一半流量,互不排队,all-reduce 通信域减半;
- 交叉点在并发 8~16:低并发时 TP4 每卡读 1/4 权重的带宽优势占主导,高并发时"分而治之"反超。没有最好的拓扑,只有匹配流量形态的拓扑。
升级 vLLM 0.29 不涨吞吐(−3~4%,噪声级),它的价值是解锁 MTP、修 bug、以及新内核——属于"地基投资"。
04|首字延迟与 256K 长上下文

TTFT(首字延迟)随并发暴涨,本质是排队而不是 prefill 变慢——1024 输入的纯 prefill 只要 ~250ms。而 prefill 能力本身:

预填速度稳定在 4~6K tok/s,单流即饱和(并发 4 也不涨,PCIe all-reduce 是瓶颈)。换句话说:这台机器吞长文档的速度是固定的,想要更快的 TTFT 只能加机器,不能加并发。
真正让我们惊喜的是长上下文的 decode:

200K 输入的会话,decode 依然只要 7.4ms/token,比 1K 输入还快。这是 Qwen3.8 混合注意力的结构性红利——64 层里只有 16 层存 KV,其余 48 层是线性注意力(状态恒定),decode 成本对上下文长度几乎免疫。做长文档问答、长对话常驻,这代架构是真的香。
262K 满档下,KV 池能支撑 5.4~6.5 路并发(视配置),单卡剩余 13GiB 全给了 KV:

05|MTP k 值扫描:免费的"边界"在哪
投机解码的草稿长度 k 可以调。我们扫了 k=1/2/3:

规律非常清晰:k 越大接受率越低(68%→43%),单流越快,高并发越亏。
- k=1:单流 +12%,64 并发仅 −4.6% —— 全场景均衡,已上生产;
- k=3:单流 +14%,但 64 并发 −14%,且草稿头多吃 13% KV 池 —— 只适合纯单流场景。
一句话:低并发选大 k,高并发选小 k 或关掉。这才是投机解码的正确打开方式。
06|智力回归:掉了没有?
量化 + 升级 + 投机解码,三件事叠在一起,智力到底掉没掉?我们用 GSM8K(数学)和 MMLU(知识)各 200 题、每配置跑两轮:

- MMLU 完全持平(80.0~80.5 分,差异在噪声内);
- GSM8K −1.3 分:归因实验显示 v0.29 无投机也是 87.5 分——这 1 分多来自新引擎的数值噪声改变了贪心解码轨迹,与 MTP 无关(开/关投机成绩完全一致:87.5 vs 87.5);
- 另做了 30 题贪心逐字比对:开/关投机的差异率与同配置跑两遍的差异率同量级,均为批处理浮点噪声。
量化 + 升级 + MTP,智力代价约 1 分(数学类),知识类无损。对生产业务而言完全可以接受。
07|编程实测:50 题执行,MTP 提速 16%
跑分不能只有数学和知识——我们自建了 50 道编程任务评测集(算法 12、字符串 10、数据结构 10、数学 8、实用工程 10),模型生成代码后在服务器沙箱里真实执行断言,验证 pass@1:

- pass@1:92%(46/50),与不开投机的 90% 持平——1 题之差在采样噪声内,再次验证 MTP 无损;
- 平均每题生成耗时 11.7 秒,比不开投机快 16%——代码是结构化文本,草稿命中率高,MTP 接受率达到 73.7%(高于混合负载的 68.3%)。写代码多的人,开投机解码收益更大;
- 分类来看:字符串、实用工程、数学全部满分,数据结构最难(7/10),MinStack 和四则运算表达式计算是共同失分点:

08|拓扑:TP4 还是双实例 + nginx?
4 张卡还能不能更卷?我们试了 2×TP2 双实例 + nginx(least_conn)负载均衡的完整形态:

nginx 的 LB 开销几乎为零(C=64 时 1080.5 vs 直连 1082.5 tok/s),后端分配 264:262 近完美均衡。注意一个隐藏问题:多轮对话场景下轮转会打散前缀缓存(我们实测单实例前缀缓存命中率高达 93.5%),建议用一致性哈希按会话路由。
09|产能:1 亿 Token 要多久?
把吞吐换算成业务语言——稳态长窗口持续压测(每档 6~10 分钟)后的结果:

- 生产配置(TP4)日产能 3.07 亿 token(含输入的计费口径),纯输出约 1.1 亿/天;
- 1 亿 Token 最快 7.8 小时交付(TP4、并发 64);切双实例拓扑缩到 5.75 小时;
- 连续高压 40 分钟,GPU 峰温 62~68°C、频率稳定 2820MHz 无降频,920 万 token 零失败——产能数字可以放心按 7×24 折算。
10|彩蛋实验:"有意思"的补充实测
① 多轮对话为什么越聊越快? 固定 2K tokens 系统提示 + 连续 5 轮提问:第 1 轮 TTFT 1065ms,第 2 轮起因前缀缓存命中降到 ~360ms——快了 3 倍:

② 思考模式到底值不值? GSM8K-100 四档对比:思考关闭 95 分 / 3.79s,effort=medium 98 分 / 3.27s(又快又准),思考全开 xhigh 95 分 / 5.22s(最慢、思考 token 最多、无准确率增益)。medium 是甜点,盲目开最高档纯属浪费:

③ 262K 长文不是摆设:在 ~9.9 万 token 的中文长文的 10%~90% 不同深度插入"密码",8/8 全部正确召回,单次请求 11~17 秒:

④ 中文用户体感更快:引擎 tok/s 中英文接近,但中文每 token 承载 1.48 个字(英文 0.77 词)——中文 162 字/s vs 英文 73 词/s:

⑤ 电费账本:C=32 稳态负载下,GPU 4 卡实测 1040W(每卡 247~266W,decode 以显存读取为主,远低于 450W TGP),加上承载 GPU 的单路 CPU 130W,部署功率 1170W——每百万 token 约 138 Wh,1 亿 token 电费约 8 块钱,日产 3.07 亿 token 的电费约 25 元/天。4090 做推理,一天的电费还买不了一杯奶茶:

11|最终生产配置(抄作业版)
vllm serve /data1/models/Qwen3.8-27B-AWQ-INT4 \
--served-model-name Qwen3.8-27B \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--gpu-memory-utilization 0.90 \
--kv-cache-dtype fp8_e4m3 \
--enable-chunked-prefill \
--enable-prefix-caching \
--max-num-seqs 64 \
--enable-auto-tool-choice --tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"mtp","num_speculative_tokens":1}'
浙公网安备 33010602011771号