hello-agent 学习打卡 Task03 0919

阅读《大语言模型基础》
https://github.com/datawhalechina/hello-agents/blob/main/docs/chapter3/第三章 大语言模型基础.md

语言模型演化历史

根本任务是计算一个词序列(即一个句子)出现的概率

统计方法

早期是使用条件概率统计计算
image
借助马尔可夫假设,条件概率计算可以简化:一个词的出现概率只与它前面有限的n−1个词有关(N-gram
N = 2时:
image
借助最大似然估计:
image

N-gramu缺陷:
数据稀疏性 (Sparsity):如果一个词没有出现过,概率估计为0
泛化能力差:无法理解词与词之间的语义相似性

神经网络

用连续的向量表示词,引入了词嵌入解决了泛化问题,只能看到前n-1个,上下文窗口有限制。
典型:2003提出的前馈神经网络语言模型 (Feedforward Neural Network Language Model)
a. 构建一个语义空间:空间中的每一个点(称为词嵌入Word Embedding)是词向量, 语义相近的词,空间距离相近。注:这个空间是个高维空间
b. 学习从上下文到下一个词的映射:借助神经网络的拟合能力,生成一个函数,函数入参是前n-1个词的词向量,出参是所有词出现在第n个的概率分布

循环神经网络 (RNN) 与长短时记忆网络 (LSTM)

RNN:给网络增加“记忆”能力
实现:引入一个隐藏状态向量。网络读取当前输入时,会同时读取上一步的记忆,生成一个新的记忆,传递给下一步
缺陷:存在长期依赖问题,网络会根据输出的误差反向调整权重,重新生成,可能会出现梯度消失?梯度爆炸?。其中梯度消失会使得网络无法找到序列早期对后期输出的影响。
LSTM:是一种特殊的RNN,引入细胞状态和门控机制
细胞状态?:允许信息在信息步之间更顺畅的传递
门控机制:包含遗忘门(决定上一步细胞丢弃哪些信息)、输入门(将输入的哪些新信息记录到细胞)、输出门(根据当前细胞,输出哪些信息到隐藏状态)
缺陷:一定程度上解决了捕捉长距离依赖的问题,但必须按顺序处理数据,要求上一步完成才能执行下一步
无法进行大规模并行计算

Transformer 架构介绍

2017年由google提出,依赖注意力Attension机制捕捉序列内的依赖关系, 实现真正意义上的并行计算
特点:先理解,再生成

Encoder-Decoder 整体结构

编码器 (Encoder) :任务是“理解”输入的整个句子。它会读取所有输入词元,最终为每个词元生成一个富含上下文信息的向量表示。
解码器 (Decoder) :任务是“生成”目标句子。它会参考自己已经生成的前文,并“咨询”编码器的理解结果,来生成下一个词。

注意力机制

从整个序列中“动态地聚合”相关信息。
自注意力 (Self-Attention) 机制:允许模型在处理序列中的每一个词时,都能兼顾句子中的所有其他词,并为这些词分配不同的“注意力权重”。
为每个输入的词元向量引入了三个可学习的角色:Query(代表自己)、Key(可被查询的概率?)、Value(携带的信息)
image
缺陷:只学会关注一种类型的关联

多头注意力机制:将原始的 Q, K, V 向量在维度上切分成 h 份(h 就是“头”数),每一份都独立地进行一次单头注意力的计算,最终将输出向量拼接,做一个线性变换整合,得到最终输出

前馈神经网络 ?

多头注意力子层之后都跟着一个逐位置前馈网络(Position-wise Feed-Forward Network, FFN)
从注意力机制层聚合后的信息中提取更高阶的特征。
独立地作用于序列中的每一个词元向量。
image

残差连接与层归一化 ?

所有子模块(如多头注意力和前馈网络)都被一个 Add & Norm 操作包裹。这个组合是为了保证Transformer能够稳定训练。
image

位置编码Positional Encoding

自注意力机制只关心词元之间的关系,而忽略了它们的排列。
为输入序列中的每一个词元嵌入向量,都额外加上一个能代表其绝对位置和相对位置信息的“位置向量”,通过一个固定的数学公式直接计算得出
image

Decoder-Only 架构

OpenAI 在开发 GPT (Generative Pre-trained Transformer) 时,提出了一个更简单的思想:语言的核心任务,不就是预测下一个最有可能出现的词吗?
Decoder-Only 架构的工作模式被称为自回归 (Autoregressive)
image
TODO
掩码自注意力 (Masked Self-Attention) :拿到全文数据时,学习预测t+1 值时,不偷看t+1后续值
todo
image

todo 与大语言模型交互 大语言模型的缩放法则与局限性

本地部署运行
image

posted @ 2026-09-20 00:23  一灵二三  阅读(2)  评论(0)    收藏  举报