解码器-only 预训练语言模型
一、GPT 系列:Decoder-Only 架构的开创者与集大成者
GPT 系列是理解 Decoder-Only 模型的关键,它不仅定义了模型结构,还探索了预训练范式和规模化的路径。
1. 模型架构:Decoder Only
- 核心结构:堆叠多个 Decoder 层,摒弃了原始 Transformer Decoder 中的编码器-解码器注意力层。
- 注意力机制:仅使用掩码自注意力,确保每个 token 只能关注其之前的 token,符合文本生成的因果逻辑。
- 位置编码:沿用 Transformer 的经典 Sinusoidal(三角函数) 绝对位置编码。
- 结构演进:
- GPT-1:类似原始 Transformer,使用 Post-LN(LayerNorm 在残差之后)。
- GPT-2:为解决深层网络的梯度问题,改为 Pre-LN(LayerNorm 在残差之前),这成为后续 LLM 的主流选择。
- GPT-3:因体量巨大,引入了稀疏注意力以优化计算效率。
2. 预训练任务:因果语言模型
- 任务定义:基于序列中所有前面的 token 来预测下一个 token。这是一种自回归的生成任务。
- 核心优势:
- 直接性:与人类书写习惯和下游生成任务天然契合。
- 数据友好:可直接在任何无监督的自然语言文本上进行训练,无需像 MLM 那样构造掩码。
- 为生成而生:天然适合文本生成、对话等 NLG 任务。
3. GPT 系列发展历程与核心贡献
| 模型 | 核心特点与贡献 | 关键参数 |
|---|---|---|
| GPT-1 | 首次提出“预训练-微调”范式,但性能不及 BERT,未成主流。 | 0.12B 参数,5GB 数据 |
| GPT-2 | 提出 Zero-shot 思想,追求不微调直接解决任务。模型体量和数据量大幅增加。 | 1.5B 参数,40GB 数据 |
| GPT-3 | LLM 时代的开创者。体量巨大,展现出“涌现能力”。提出 Few-shot(上下文学习),通过在 Prompt 中提供少量示例,显著提升模型性能,成为 LLM 的核心优势。 | 175B 参数,570GB 数据 |
二、LLaMA 系列:开源 LLM 的基石与事实标准
Meta 发布的 LLaMA 系列模型,以其开源精神和卓越性能,成为了开源社区构建 LLM 的首选基座。
1. 模型架构:继承与优化
- 基础架构:完全继承 GPT 的 Decoder-Only 结构。
- 关键优化:
- LLaMA-2:引入分组查询注意力,在保持性能的同时降低了推理时的显存占用。
- LLaMA-3:采用更高效的 Tokenizer,词表大小达 128K,显著提升了多语言处理能力和编码效率。
2. LLaMA 系列发展历程
| 模型 | 核心特点与贡献 | 关键参数 |
|---|---|---|
| LLaMA-1 | 开源社区的里程碑,证明了开源大模型的可行性。 | 7B/13B/30B/65B,1T token 数据 |
| LLaMA-2 | 上下文长度翻倍至 4K,引入 GQA,性能和安全性提升。 | 7B/13B/34B/70B,2T token 数据 |
| LLaMA-3 | 上下文扩展至 8K,使用 128K 大词表和 15T 超大规模数据,性能强劲。 | 8B/70B (400B 训练中),>15T token 数据 |
三、GLM 系列:中文 LLM 的探索者与独特路径
智谱 AI 的 GLM 系列是国内中文 LLM 的重要代表,其早期架构和预训练任务具有独特的探索意义。
1. 模型架构:对 GPT 的细微修正
- 基础架构:同样是 Decoder-Only。
- 主要差异:
- 使用 Post-Norm(而非主流的 Pre-Norm),认为其能避免数值错误。
- 输出层使用单个线性层(而非 MLP),结构更简单。
- 激活函数采用 GeLU(而非 ReLU)。
2. 预训练任务:GLM(通用语言模型)
- 核心思想:尝试融合 CLM(自回归) 和 MLM(自编码) 的优点。
- 任务设计:进行自回归的空白填充。随机遮蔽一段连续的 token,模型需结合上下文以自回归方式(从左到右)预测这段被遮蔽的内容。
- 历史评价:这是一个在预训练模型时代富有创新性的尝试,旨在统一 NLU 和 NLG 任务。但在 LLM 时代,大规模的 CLM 已被证明在理解能力上同样强大,因此 ChatGLM 从第二代开始也回归了主流的 CLM 范式。
3. GLM 家族发展
- ChatGLM-6B:早期开源中文 LLM 的代表,使用了独特的 GLM 架构。
- ChatGLM2-6B:架构回归主流(类似 LLaMA),上下文扩展至 32K,性能大幅提升。
- ChatGLM3-6B:在数据、训练策略上优化,并开始支持函数调用与代码解释器,向 Agent 应用迈进。
- GLM-4:闭源旗舰模型,性能对标 GPT-4。开源其轻量版 GLM-4-9B,性能超越 Llama-3-8B,并继承了 GLM-4 的工具调用能力。
四、核心总结与启示
- 架构统一:Decoder-Only 架构凭借其简洁性、与生成任务的天然契合性以及强大的规模化潜力,已成为 LLM 时代的事实标准。
- 规模即正义:GPT 系列的成功证明,当模型参数量和预训练数据量跨越某个阈值后,模型会涌现出强大的 Zero-shot/Few-shot 能力,这是 LLM 与传统 PLM 的根本区别。
- 预训练任务的回归:尽管有过 GLM 这样融合 MLM 和 CLM 的创新尝试,但最终业界选择了更简单、更直接的 CLM 作为超大规模模型预训练的核心任务。
- 开源的力量:LLaMA 的出现极大地推动了 LLM 技术的普及和创新,形成了繁荣的开源生态。
- 应用导向的演进:模型的发展不仅追求性能提升,更注重实用性,如上下文长度的扩展(支持长文档)、工具调用能力(构建 Agent)等,这些都是 LLM 从“玩具”走向“工具”的关键。

浙公网安备 33010602011771号