【架构层面】Dense、MoE 与预测/生成模型:一篇速览

【架构层面】Dense、MoE 与预测/生成模型:一篇速览

1. Dense:稠密模型(全激活)

定义

每个 token 输入时,全部参数都参与计算
也就是:总参数量 = 每次推理激活参数量

类比:公司来了任何任务,全体员工全部上岗干活,不管简单还是复杂。

代表

  • Qwen2-27B
  • Qwen2-37B
  • Llama3-70B
  • GPT-3
  • Claude 系列

优点

  1. 行为稳定,输出一致性高,幻觉波动小;
  2. 训练和微调简单,LoRA / QLoRA 生态成熟;
  3. KV-Cache 行为稳定,vLLM / TGI 部署兼容性最好;
  4. 能力与参数量的关系更直观、可预期。

缺点

  1. 算力和显存会随参数量线性上涨;27B → 37B,显存和推理速度都会同步恶化;
  2. 想变强,通常必须把全部参数一起变大,硬件成本直接拉高。

2. MoE:混合专家模型(稀疏激活)

定义

MoE 会把前馈网络拆成很多个独立子网络,叫做 专家(Expert),再增加一个 路由器(Router) 调度。

每个 token 进来时,Router 只挑选少数几个专家参与计算,其余专家休眠不干活。

总参数量很大,但实际激活参数量很小

例如:Qwen3.5-35B-A3B,总参 35B,每次只激活 3B

类比:大公司里有很多专家组,来一个任务只叫 2~3 个对口专家干活,其他人先休息。

优点

  1. 总参很大,但单 token 计算量低,同等算力下能力上限更高;
  2. 适合做大底座,训练效率较高。

缺点(工程落地常见坑)

  1. 显存依然要加载全部专家权重!只是计算变少,不是显存变小。

    Qwen3.5-35B-A3B 总权重 35B,BF16 大约要 70GB 显存。推理时虽然只算 3B,但全部 35B 权重必须加载进显存。很多人会在这里踩坑。

  2. 输出一致性不如 Dense,偶尔会出现路由波动、输出跳变;

  3. 微调更麻烦,LoRA 调优难度通常高于稠密模型;

  4. KV-Cache 和 Dense 一样,该多大还是多大,MoE 并不优化 KV 缓存。

代表

  • Mixtral-8x7B
  • Qwen3.5-35B-A3B
  • DeepSeek-V2 / V3

⚠️重要区分:

  • Dense:权重全部计算,权重全部加载
  • MoE:只计算一部分专家,但是所有权重全部加载到显存

3. 任务输出目标分类

这个分类和 Dense / MoE 架构无关。

同一个 MoE 或 Dense 大模型,既可以做生成,也可以微调后做预测任务。

3.1 预测模型(判别式模型)

输出

标签、概率、分数、数值

问法

这个输入会是什么结果?

例子

  • 风控:这笔交易是否欺诈(0/1 概率)
  • 销量预测:下个月销售额
  • 文本分类:情感是正面还是负面
  • 异常检测、打分、排序

特点

  • 输出结果是有限集合;
  • 追求确定性,可打分;
  • BERT 是典型的预测 / 判别底座。

3.2 生成模型(LLM 大语言模型)

输出

全新序列,例如文本、代码、图片。

问法

该生成什么内容?

例子

  • 聊天
  • 写报告
  • 摘要
  • 代码生成
  • 思维链推理

LLM 底层数学上是逐 token 预测下一个词,但业务用途是生成内容,所以归类为生成模型。

容易混淆的一点:LLM 内部在“预测下一个 token”,但这不叫预测模型。预测模型特指业务目标是输出分类、分数,而不是输出长文本。


4. 表格对比

维度 预测(判别)模型 生成模型(LLM)
输出 类别、概率、数字 文本、代码、图片长序列
典型底座 BERT、ERNIE Qwen2-27B/37B、Llama(MoE / Dense 都可以)
目标 做判断打分 创造新内容

5. 小结

可以简单记成三句话:

  1. Dense:全量参数一起算,稳定、直接,但成本高;
  2. MoE:总参大、激活参少,算得省,但显存不省;
  3. 预测 / 生成:这是任务目标分类,和 Dense / MoE 架构不是一回事。

如果你在选型时容易混淆,先问两个问题:

  • 模型结构:是 Dense 还是 MoE?
  • 业务目标:是做预测,还是做生成?

这两个维度分开看,很多模型设计问题就清楚了。

posted @ 2026-09-06 20:22  fitch_liu  阅读(18)  评论(0)    收藏  举报