【架构层面】Dense、MoE 与预测/生成模型:一篇速览
【架构层面】Dense、MoE 与预测/生成模型:一篇速览
1. Dense:稠密模型(全激活)
定义
每个 token 输入时,全部参数都参与计算。
也就是:总参数量 = 每次推理激活参数量。
类比:公司来了任何任务,全体员工全部上岗干活,不管简单还是复杂。
代表
- Qwen2-27B
- Qwen2-37B
- Llama3-70B
- GPT-3
- Claude 系列
优点
- 行为稳定,输出一致性高,幻觉波动小;
- 训练和微调简单,LoRA / QLoRA 生态成熟;
- KV-Cache 行为稳定,vLLM / TGI 部署兼容性最好;
- 能力与参数量的关系更直观、可预期。
缺点
- 算力和显存会随参数量线性上涨;27B → 37B,显存和推理速度都会同步恶化;
- 想变强,通常必须把全部参数一起变大,硬件成本直接拉高。
2. MoE:混合专家模型(稀疏激活)
定义
MoE 会把前馈网络拆成很多个独立子网络,叫做 专家(Expert),再增加一个 路由器(Router) 调度。
每个 token 进来时,Router 只挑选少数几个专家参与计算,其余专家休眠不干活。
总参数量很大,但实际激活参数量很小。
例如:Qwen3.5-35B-A3B,总参 35B,每次只激活 3B。
类比:大公司里有很多专家组,来一个任务只叫 2~3 个对口专家干活,其他人先休息。
优点
- 总参很大,但单 token 计算量低,同等算力下能力上限更高;
- 适合做大底座,训练效率较高。
缺点(工程落地常见坑)
-
显存依然要加载全部专家权重!只是计算变少,不是显存变小。
Qwen3.5-35B-A3B 总权重 35B,BF16 大约要 70GB 显存。推理时虽然只算 3B,但全部 35B 权重必须加载进显存。很多人会在这里踩坑。
-
输出一致性不如 Dense,偶尔会出现路由波动、输出跳变;
-
微调更麻烦,LoRA 调优难度通常高于稠密模型;
-
KV-Cache 和 Dense 一样,该多大还是多大,MoE 并不优化 KV 缓存。
代表
- Mixtral-8x7B
- Qwen3.5-35B-A3B
- DeepSeek-V2 / V3
⚠️重要区分:
- Dense:权重全部计算,权重全部加载
- MoE:只计算一部分专家,但是所有权重全部加载到显存
3. 任务输出目标分类
这个分类和 Dense / MoE 架构无关。
同一个 MoE 或 Dense 大模型,既可以做生成,也可以微调后做预测任务。
3.1 预测模型(判别式模型)
输出
标签、概率、分数、数值。
问法
这个输入会是什么结果?
例子
- 风控:这笔交易是否欺诈(0/1 概率)
- 销量预测:下个月销售额
- 文本分类:情感是正面还是负面
- 异常检测、打分、排序
特点
- 输出结果是有限集合;
- 追求确定性,可打分;
- BERT 是典型的预测 / 判别底座。
3.2 生成模型(LLM 大语言模型)
输出
全新序列,例如文本、代码、图片。
问法
该生成什么内容?
例子
- 聊天
- 写报告
- 摘要
- 代码生成
- 思维链推理
LLM 底层数学上是逐 token 预测下一个词,但业务用途是生成内容,所以归类为生成模型。
容易混淆的一点:LLM 内部在“预测下一个 token”,但这不叫预测模型。预测模型特指业务目标是输出分类、分数,而不是输出长文本。
4. 表格对比
| 维度 | 预测(判别)模型 | 生成模型(LLM) |
|---|---|---|
| 输出 | 类别、概率、数字 | 文本、代码、图片长序列 |
| 典型底座 | BERT、ERNIE | Qwen2-27B/37B、Llama(MoE / Dense 都可以) |
| 目标 | 做判断打分 | 创造新内容 |
5. 小结
可以简单记成三句话:
- Dense:全量参数一起算,稳定、直接,但成本高;
- MoE:总参大、激活参少,算得省,但显存不省;
- 预测 / 生成:这是任务目标分类,和 Dense / MoE 架构不是一回事。
如果你在选型时容易混淆,先问两个问题:
- 模型结构:是 Dense 还是 MoE?
- 业务目标:是做预测,还是做生成?
这两个维度分开看,很多模型设计问题就清楚了。

浙公网安备 33010602011771号