Transformer架构学习

Transformer 知识脉络:
image

阶段一:输入与数字化(让机器认识文字)

  1. Tokenization(词元化/子词化)
  • 核心任务: 文本 $\rightarrow$ Token。
  • 脉络: 计算机无法直接处理长篇大论,所以第一步是把句子“切碎”。笔记中提到“1000 Tokens 大概是 750 个英文单词,500 个汉字”,这就是将人类语言转化为机器可识别的最小基本单元(Token)的过程。
  1. Embedding(嵌入层)
  • 核心任务: Token $\rightarrow$ 初始向量。
  • 脉络: 这是专门把文字映射到数学空间的预训练模型。Token 只是一个编号,而 Embedding 把它变成了一个高维空间中的坐标点(例如笔记中提到的 12288 维向量)。
  • 关键点: 它不仅仅是简单的映射,更重要的是它包含了语义相似度和数学逻辑计算能力。这也是为什么大模型的向量空间虽然“极其稀疏”,但却能精准表达词义。

阶段二:特征提取与大脑思考(核心处理区)

正如你在笔记中重点框出的“严重的误区”——Encoder 和 Decoder 并不是简单地负责“文字到向量”或“向量到文字”。它们的真实身份是:向量 $\rightarrow$ 更好的向量(特征提取)

  1. Attention 机制(注意力机制)
  • 核心任务: 寻找上下文关联度和权重。
  • 脉络: 这是 Transformer 的灵魂。通过 Q (Query)、K (Key)、V (Value) 矩阵计算,模型能够知道在一个句子中,当前词应该把“注意力”放在其他哪些词上。
  1. Self-Attention(自注意力机制)
  • 脉络: Q、K、V 全部来自同一个输入序列。它的核心是“自己注意自己”,从而在当前语境下完美理解一词多义或长距离指代。
  1. Multi-Head Self-Attention(多头自注意力)
  • 脉络: 把庞大的高维向量(如 12288 维)拆分成多个低维向量(如 128 维)并行计算,类似于多个人从不同的角度(语法、情感、时态等)同时去审视这句话,最后再把结果拼接起来。

阶段三:网络细化与输出生成

  1. Feed Forward(前馈神经网络)
  • 脉络: 在注意力机制看完上下文之后,前馈网络负责对每个位置的向量进行进一步的非线性变换和特征强化。
  1. Linear + Softmax(线性层与归一化)
  • 核心任务: 终极向量 $\rightarrow$ 下一个词的概率。
  • 脉络: 经过千锤百炼的“更好的向量”来到最后一步。线性层将其映射回庞大的词表空间,Softmax 则把这些数值转化为 0 到 1 之间的概率分布,概率最高的那个词,就是大模型说出的下一个字。

行业现状延伸

笔记最后总结得非常到位,指出了目前大语言模型(LLM)的演进方向:

  • Encoder-Only(如 BERT):擅长理解全文,但不擅长生成。
  • Decoder-Only(如 GPT 系列、现在的 Qwen 等主流大模型):擅长基于上下文生成文字,连接未来。现在的 LLM 几乎都是纯 Decoder 架构。

为了让你更直观地复习这条数据加工流水线,我为你提取了笔记中的核心概念,制作了一个交互式的 Transformer 数据流向探索器:

posted @ 2026-06-30 10:32  认真的刻刀  阅读(11)  评论(0)    收藏  举报