从 Qwen3.8-27B 到 FP8、NVFP4、MoE:一次搞懂几个常见大模型概念

最近在服务器上部署 Qwen3.8-27B 时,碰到了不少容易混淆的概念,比如 FP8、NVFP4、上下文长度、激活参数、Dense、MoE 等。

其实这些概念并没有那么复杂,这篇文章结合实际部署场景,用比较通俗的方式简单梳理一下。

一、我们现在跑的是什么模型?

当前服务器使用的是:

Qwen3.8-27B-NVFP4

硬件环境:

  • 2 × NVIDIA RTX 5090
  • Tensor Parallel:2
  • 最大上下文:262144 Token

简单理解:

  • Qwen3.8-27B:约 270 亿参数的大模型
  • NVFP4:模型采用低精度 FP4 格式
  • TP=2:模型由两张 5090 一起运行
  • 262144 Token:也就是常说的 256K 上下文

二、256K 上下文是什么意思?

vLLM 启动参数中配置了:

--max-model-len 262144

262144 Token 约等于 256K Token

它表示一次请求中,模型能够处理的:

输入内容 + 输出内容

最大可以达到约 256K Token。

例如:

  • 系统提示词
  • 历史对话
  • 用户问题
  • RAG 检索内容
  • 模型最终回答

这些内容都会占用上下文。

可以把上下文理解成模型的一张“草稿纸”,草稿纸越大,一次能够看到的文档、代码和历史对话就越多。

不过上下文越长,KV Cache 占用也越大,所以长上下文和高并发之间通常需要做取舍


三、FP8 和 NVFP4 有什么区别?

服务器上同时有两个版本:

Qwen3.8-27B-FP8
Qwen3.8-27B-NVFP4

它们本质上还是同一个 27B 模型,主要区别是模型参数使用的数值精度不同。

类型 特点
FP8 精度更高,显存占用更大
NVFP4 精度更低一些,但更省显存,推理效率更高

简单理解:

FP8 相当于每个参数使用更多空间保存。

NVFP4 相当于使用更少的空间保存参数。

因此 NVFP4 最大的意义就是:

用更少的显存保存同样规模的模型。

对于 RTX 5090 这类 Blackwell 架构显卡,NVFP4 也比较适合推理部署。


四、NVFP4 会不会让 27B 变成 13B?

不会。

这是非常容易混淆的地方。

无论是:

Qwen3.8-27B-FP8

还是:

Qwen3.8-27B-NVFP4

模型仍然都是约 27B 参数。

NVFP4 改变的是:

每个参数占多少空间。

而不是:

有多少参数参与计算。

可以简单理解成:

FP8:
27B 参数,每个参数占得大一些。

NVFP4:
还是 27B 参数,只是每个参数占得更小。

五、什么叫“激活参数”?

讨论大模型时,经常会看到类似:

总参数:100B
激活参数:13B

这里的“激活参数”可以简单理解成:

模型每次推理时,真正参与计算的参数数量。

对于普通 Dense 模型,例如 Qwen3.8-27B:

总参数:约 27B
激活参数:约 27B

也就是推理时基本全部参数都会参与计算。


六、什么是 Dense?

Dense 中文一般叫:

稠密模型。

可以把它理解成一个公司有 27 个员工。

每来一个任务:

27 个人基本全部参与工作。

Qwen3.8-27B 就属于这种方式:

27B 总参数
    ↓
每次推理
    ↓
基本全部参与计算
    ↓
激活参数约 27B

七、什么是 MoE?

MoE 全称:

Mixture of Experts

中文一般叫:

混合专家模型。

MoE 和 Dense 最大的区别是:

模型虽然很大,但每次推理只让其中一部分参数参与计算。

例如一个 MoE 模型:

总参数:100B
激活参数:13B

可以把它理解成一个公司里面有很多不同领域的专家:

  • 程序专家
  • 数学专家
  • 写作专家
  • 金融专家
  • 法律专家

当用户提出一个问题后,模型内部会有一个类似“调度员”的 Router:

用户问题
    ↓
Router 判断
    ↓
选择合适的几个专家
    ↓
这些专家参与计算
    ↓
生成答案

所以整个模型虽然可能有 100B 参数,但一次推理真正参与计算的可能只有 13B。


八、Dense 和 MoE 最简单的区别

可以直接记住一句话:

Dense 是所有人一起干活,MoE 是人很多,但每次只叫几个专家干活。

例如 Dense:

27B 总参数
    ↓
约 27B 参数参与计算

而 MoE:

100B 总参数
    ↓
根据问题选择部分专家
    ↓
可能只有 13B 参数参与计算

因此 MoE 的一个重要优势就是:

可以把模型总参数做得很大,同时不用每次把所有参数都计算一遍。


九、最后简单总结

把这些概念放到一起,其实就比较清楚了。

Qwen3.8-27B

  • 27B:模型大约有 270 亿参数
  • Dense:推理时基本全部参数参与计算
  • NVFP4:降低参数存储精度,减少显存占用
  • TP=2:两张 GPU 一起运行一个模型
  • 256K Context:一次请求最多处理约 256K Token

最容易混淆的一点就是:

模型量化和激活参数是两回事。

FP8、NVFP4 解决的是:

参数怎么存。

Dense、MoE 解决的是:

推理时哪些参数参与计算。

理解了这一点,后面再看到 FP8、FP4、27B、激活参数、MoE 这些概念,就不会那么容易混在一起了。

posted @ 2026-09-03 14:22  人艰不拆_zmc  阅读(70)  评论(0)    收藏  举报