Happy-LLM 学习笔记 04:BERT、T5、GPT 到 LLaMA,预训练模型谱系怎么串起来
学完 Transformer 的基本结构后,再看预训练语言模型的发展,会发现很多模型名字并不是彼此割裂的。BERT、T5、GPT、LLaMA 看起来像不同时代的代表,底层其实都在回答同一个问题:我该使用 Transformer 的哪一部分,配什么预训练任务,才能把大量无标注文本转化成可迁移的语言能力?
这一章对我最有帮助的地方,是把模型谱系按结构分成三条线:Encoder-only、Encoder-Decoder 和 Decoder-only。先抓住这个坐标系,再看 MLM、CLM、text-to-text、SFT、RLHF,就不会觉得术语满天飞。
BERT:把 Encoder 做成理解器
BERT 选择的是 Transformer 的 Encoder。Encoder 的特点是每个位置都可以同时看到整个输入序列,因此它天然适合“理解一句话”或“判断两段文本关系”这类任务。BERT 在输入前加 <CLS>,再通过顶部分类头适配文本分类、自然语言推理、问答匹配等任务,本质上就是把通用文本表示迁移到具体标签空间里。
BERT 真正关键的创新不只是用了 Encoder,而是把预训练任务改成了 MLM。传统语言模型按从左到右预测下一个 token,学到的是单向生成关系;MLM 更像完形填空,让模型根据上下文预测被遮住的词。这样训练出来的表示更适合 NLU,因为模型必须同时利用前文和后文。
但 MLM 也带来一个工程上的不一致:预训练时有 <MASK>,实际微调和推理时通常没有。BERT 用 80% 替换为 <MASK>、10% 随机替换、10% 保持不变来缓解这个问题。这个细节说明,预训练任务会直接影响模型在真实输入上的迁移方式。
RoBERTa 和 ALBERT 可以看成沿着 BERT 路线继续打磨。RoBERTa 去掉 NSP,增加数据和训练步数;ALBERT 则从参数效率入手,通过 Embedding 分解和跨层参数共享降低规模压力。
T5:把所有任务统一成文本到文本
T5 走的是 Encoder-Decoder 路线。Encoder 负责理解输入,Decoder 负责生成输出,这和原始 Transformer 的机器翻译结构最接近。它的有趣之处不只是结构完整,而是提出了 text-to-text 的统一视角:分类、翻译、摘要、问答都可以写成“输入一段文本,输出另一段文本”。
这个思想对工程落地很重要。以前不同 NLP 任务往往要换任务头和数据格式;T5 把任务都包装成文本生成,训练与推理接口就变得统一。代价是模型要同时承担理解和生成流程,计算开销通常更高。
我理解 T5 的价值,不在于它今天一定是最常用的模型形态,而在于它把“自然语言作为统一任务接口”的方向讲清楚了。后来的 instruction tuning、prompt engineering,也都有类似的影子:尽量让任务描述本身成为模型输入的一部分。
GPT 和 LLaMA:Decoder-only 成为 LLM 主线
GPT 系列选择 Decoder-only,并坚持 CLM,也就是根据上文预测下一个 token。这个任务非常简单,却特别适合规模化:互联网上的大量文本天然就是训练样本,不需要人工标注,也不需要构造复杂的遮蔽策略。模型只要不断学习“给定上下文,下一个 token 应该是什么”,就能在规模扩大后获得越来越强的生成、理解和迁移能力。
从 GPT-1 到 GPT-3,主线不是结构花样越来越多,而是参数、数据和训练规模持续扩大。GPT-2 强调 zero-shot,GPT-3 展示 few-shot 和上下文学习,这说明大模型能力不只是来自某个任务头,而是逐渐从预训练分布里涌现出来。到了 ChatGPT 阶段,再叠加指令微调和人类反馈对齐,模型才从“续写文本”进一步变成“能按人类意图完成任务的助手”。
LLaMA 延续了 Decoder-only 的主线,但它的意义在于把高质量开源基座带给社区。对个人开发者和中小团队来说,LLaMA 系模型让本地部署、微调、蒸馏、量化和 RAG 组合变得现实。它提醒我,大模型工程不只看最大参数量,也要看模型许可证、推理成本、生态工具和可微调性。
怎么把谱系串起来
现在回头看这几类模型,我会用一句话区分它们:BERT 更像文本理解器,T5 更像通用文本转换器,GPT 和 LLaMA 更像自回归生成器。它们的差异不是简单的“谁先进谁落后”,而是架构、任务和应用场景的组合不同。
如果要做高吞吐、标签明确的分类或序列标注,BERT 系仍然有价值;如果任务天然是输入到输出的转换,Encoder-Decoder 仍然清晰;如果目标是对话、写作、代码生成、Agent 或通用问答,Decoder-only LLM 现在是主线。
这篇给我的工程启发是:选模型时不要只看榜单和热度,先问三个问题。第一,任务更偏理解、转换还是生成?第二,训练和推理时的数据形式是否一致?第三,系统约束是效果优先、成本优先还是可控性优先?把这三个问题回答清楚,BERT、T5、GPT、LLaMA 的谱系就不是历史名词,而会变成实际选型时的判断工具。

浙公网安备 33010602011771号