双 2080 Ti × 22GB 跑 Qwen3.8-27B:8 篇实战系列

全部基于同一台机器(2 × RTX 2080 Ti 22GB + NVLink,TP=2,vLLM-2080Ti-Definitive sm75 fork)的真实部署记录。每篇含全部命令、参数、日志锚点与实测数据,图表在各自 images/ 子文件夹内。

系列索引

类型 标题 一句话看点
[01](01-部署教程/【部署教程】双2080Ti22GB跑动27B!从零到agent可用的完整路径与避坑指南【qwen3.8 27B本地部署#01】.md) 部署教程 双 2080 Ti 22GB 跑动 27B!从零到 agent 可用的完整路径,避坑指南 8 方案全数据 + 关键参数调优依据(GPU_UTIL 0.93 边界、MTP3、KV 选型)
[02](02-GGUF踩坑/【踩坑记录】打了15处补丁还是跑不动!GGUF在Qwen混合架构上走不通的复盘【qwen3.8 27B本地部署#02】.md) 踩坑记录 打了 15 处补丁还是跑不动!GGUF 在 Qwen 混合架构上走不通的复盘 在 vLLM 上跑 GGUF,通 9 个 bug 撞上 176 参数未初始化的设计边界墙,附"要不要走 GGUF"5 问判断框架
[03](03-KV量化对比/【性能测试】拿到别人的跑分先别信!双2080Ti上KV量化三种形态全对比_INT8直接反转排名【qwen3.8 27B本地部署#03】.md) 性能测试 拿到别人的跑分先别信!双 2080 Ti 上 KV 量化三种形态全对比,INT8 直接反转排名 INT8 合成基准垫底、真实对话反超 74.8;8 方案全量 + 0.1x/0.2x 两代 vLLM 对照
[04](04-MTP排障/【问题解决】输出胡言乱语还时灵时不灵!vLLM+MTP3的CUDA graph神秘错位修复全记录【qwen3.8 27B本地部署#04】.md) 问题解决 输出胡言乱语还时灵时不灵!vLLM + MTP3 的 CUDA graph 神秘错位,一个 COMPILE 参数修复 输入"你好"回 F1 大奖赛;五步排查链 + PIECEWISE 修复公式(56.4 错乱 → 73.6 正确)
[05](05-长上下文性能/【性能测试】听说138K上下文会掉速到11toks?131K全扫描实测打脸:decode只缓降13%【qwen3.8 27B本地部署#05】.md) 性能测试 听说 138K 上下文会掉速到 11 tok/s?131K 全扫描实测打脸:decode 只缓降 13% "快满暴跌"不存在:decode 只缓降 13%,贵的是 45s 冷 prefill;前缀缓存 86% 摊薄 TTFT,附双卡散热实录
[06](06-端口回环/【踩坑记录】一个本地推理服务在局域网暴露20个端口!TP2分布式IPC泄漏的三层根因与两行修复【qwen3.8 27B本地部署#06】.md) 踩坑记录 一个本地推理服务在局域网暴露 20 个端口?!TP=2 分布式 IPC 泄漏的三层根因与两行修复 37 监听端口解剖 + setproctitle 失真陷阱 + NCCL 选网卡规则;两行 export 收口
[07](07-多模态应用/【应用案例】发第2张图就崩、发视频没反应?修掉2个vLLM bug后把图文视频装进agent【qwen3.8 27B本地部署#07】.md) 应用案例 发第 2 张图就崩、发视频没反应?修掉 2 个 vLLM 真 bug,把图文视频装进 agent 修掉 2 个多模态真 bug;视频 token ≈ 时长×fps×150;思考强度三档 × 5 档上下文稳定性矩阵
[08](08-能效散热/【经验分享】从300W压到225W,速度几乎不掉:一台双2080Ti机器的CPU降温与GPU限功耗记录【qwen3.8 27B本地部署#08】.md) 经验分享 从 300W 压到 225W,速度几乎不掉:一台双 2080 Ti 机器的 CPU 降温与 GPU 限功耗记录 朋友跑炸 2080 Ti 后我也查了自家 CPU 80°C+/GPU 300W;vLLM SpinCondition 空转旋钮 0.02 白赚 +2.3%;225W 省 25% 电、decode −0.2%(prefill 掉 6.4%);150W prefill 掉 30% 是硬伤

跨篇速查

环境快照:双 2080 Ti 22GB(水冷 GPU3 + 风冷 GPU4)+ NVLink;vLLM-2080Ti-Definitive v0.1.15(sm75);模型 Qwen3.8-27B-FP8(长文本主力)/ AWQ-MTP q4(多模态)/ GPTQ-Int4(速度对照)。

关于方案的"官方 / 自己调"要先分清:启动器 start-qwen2080ti.sh 里的 8 个方案不全是官方的——

  • 方案 1–5:官方 profiles/normal|fast/fp8|int4/*,见 profiles/README.md 的 Qwen3.x 27B 表);
  • 方案 6/7/8:我自己调的user/ 目录 + -diy 后缀),其中方案 8 的 138K 上下文是本机实测上限,官方没有这个档(官方 27B 最高只有 FP16-KV 128K / 112K)。详见第 01 篇 §4 / §5.2。

核心数字

138K 长文本方案 decode 真实 ~74 tok/s(合成最高 120.3)
131K 冷 prefill ~2914 tok/s(45s),前缀缓存命后 TTFT 摊到 ~10s
近满上下文(120K~137K)decode 80.07~80.35,无断崖
MTP3 修复后 73.6 tok/s 且正确(修复前关 MTP 仅 34.0)
首请求冷启动 prefill ~45s(131K),预热后明显下降

阅读建议:新机器部署从 01 开始;性能调优读 03、05;碰到问题查 02、04、06、07 的踩坑清单;想省电降热(CPU 高温 / GPU 功耗)读 08。

posted @ 2026-09-04 21:33  M4K0  阅读(46)  评论(0)    收藏  举报