解码器-only 预训练语言模型

一、GPT 系列:Decoder-Only 架构的开创者与集大成者

GPT 系列是理解 Decoder-Only 模型的关键,它不仅定义了模型结构,还探索了预训练范式和规模化的路径。

1. 模型架构:Decoder Only
  • 核心结构:堆叠多个 Decoder 层,摒弃了原始 Transformer Decoder 中的编码器-解码器注意力层。
  • 注意力机制:仅使用掩码自注意力,确保每个 token 只能关注其之前的 token,符合文本生成的因果逻辑。
  • 位置编码:沿用 Transformer 的经典 Sinusoidal(三角函数) 绝对位置编码。
  • 结构演进:
    • GPT-1:类似原始 Transformer,使用 Post-LN(LayerNorm 在残差之后)。
    • GPT-2:为解决深层网络的梯度问题,改为 Pre-LN(LayerNorm 在残差之前),这成为后续 LLM 的主流选择。
    • GPT-3:因体量巨大,引入了稀疏注意力以优化计算效率。
2. 预训练任务:因果语言模型
  • 任务定义:基于序列中所有前面的 token 来预测下一个 token。这是一种自回归的生成任务。
  • 核心优势:
    • 直接性:与人类书写习惯和下游生成任务天然契合。
    • 数据友好:可直接在任何无监督的自然语言文本上进行训练,无需像 MLM 那样构造掩码。
    • 为生成而生:天然适合文本生成、对话等 NLG 任务。
3. GPT 系列发展历程与核心贡献
模型核心特点与贡献关键参数
GPT-1 首次提出“预训练-微调”范式,但性能不及 BERT,未成主流。 0.12B 参数,5GB 数据
GPT-2 提出 Zero-shot 思想,追求不微调直接解决任务。模型体量和数据量大幅增加。 1.5B 参数,40GB 数据
GPT-3 LLM 时代的开创者。体量巨大,展现出“涌现能力”。提出 Few-shot(上下文学习),通过在 Prompt 中提供少量示例,显著提升模型性能,成为 LLM 的核心优势。 175B 参数,570GB 数据

二、LLaMA 系列:开源 LLM 的基石与事实标准

Meta 发布的 LLaMA 系列模型,以其开源精神和卓越性能,成为了开源社区构建 LLM 的首选基座。

1. 模型架构:继承与优化
  • 基础架构:完全继承 GPT 的 Decoder-Only 结构。
  • 关键优化:
    • LLaMA-2:引入分组查询注意力,在保持性能的同时降低了推理时的显存占用。
    • LLaMA-3:采用更高效的 Tokenizer,词表大小达 128K,显著提升了多语言处理能力和编码效率。
2. LLaMA 系列发展历程
模型核心特点与贡献关键参数
LLaMA-1 开源社区的里程碑,证明了开源大模型的可行性。 7B/13B/30B/65B,1T token 数据
LLaMA-2 上下文长度翻倍至 4K,引入 GQA,性能和安全性提升。 7B/13B/34B/70B,2T token 数据
LLaMA-3 上下文扩展至 8K,使用 128K 大词表和 15T 超大规模数据,性能强劲。 8B/70B (400B 训练中),>15T token 数据

三、GLM 系列:中文 LLM 的探索者与独特路径

智谱 AI 的 GLM 系列是国内中文 LLM 的重要代表,其早期架构和预训练任务具有独特的探索意义。

1. 模型架构:对 GPT 的细微修正
  • 基础架构:同样是 Decoder-Only。
  • 主要差异:
    1. 使用 Post-Norm(而非主流的 Pre-Norm),认为其能避免数值错误。
    2. 输出层使用单个线性层(而非 MLP),结构更简单。
    3. 激活函数采用 GeLU(而非 ReLU)。
2. 预训练任务:GLM(通用语言模型)
  • 核心思想:尝试融合 CLM(自回归) 和 MLM(自编码) 的优点。
  • 任务设计:进行自回归的空白填充。随机遮蔽一段连续的 token,模型需结合上下文以自回归方式(从左到右)预测这段被遮蔽的内容。
  • 历史评价:这是一个在预训练模型时代富有创新性的尝试,旨在统一 NLU 和 NLG 任务。但在 LLM 时代,大规模的 CLM 已被证明在理解能力上同样强大,因此 ChatGLM 从第二代开始也回归了主流的 CLM 范式。
3. GLM 家族发展
  • ChatGLM-6B:早期开源中文 LLM 的代表,使用了独特的 GLM 架构。
  • ChatGLM2-6B:架构回归主流(类似 LLaMA),上下文扩展至 32K,性能大幅提升。
  • ChatGLM3-6B:在数据、训练策略上优化,并开始支持函数调用与代码解释器,向 Agent 应用迈进。
  • GLM-4:闭源旗舰模型,性能对标 GPT-4。开源其轻量版 GLM-4-9B,性能超越 Llama-3-8B,并继承了 GLM-4 的工具调用能力。

四、核心总结与启示

  1. 架构统一:Decoder-Only 架构凭借其简洁性、与生成任务的天然契合性以及强大的规模化潜力,已成为 LLM 时代的事实标准。
  2. 规模即正义:GPT 系列的成功证明,当模型参数量和预训练数据量跨越某个阈值后,模型会涌现出强大的 Zero-shot/Few-shot 能力,这是 LLM 与传统 PLM 的根本区别。
  3. 预训练任务的回归:尽管有过 GLM 这样融合 MLM 和 CLM 的创新尝试,但最终业界选择了更简单、更直接的 CLM 作为超大规模模型预训练的核心任务。
  4. 开源的力量:LLaMA 的出现极大地推动了 LLM 技术的普及和创新,形成了繁荣的开源生态。
  5. 应用导向的演进:模型的发展不仅追求性能提升,更注重实用性,如上下文长度的扩展(支持长文档)、工具调用能力(构建 Agent)等,这些都是 LLM 从“玩具”走向“工具”的关键。
posted @ 2025-11-24 00:45  十一分平庸  阅读(70)  评论(0)    收藏  举报