Transformer
Transformer原理
From知乎:@大师兄 详解Transformer (Attention Is All You Need)
本文为个人学习摘要,以上为原文。
RNN的局限性:1. 按照时间顺序,限制了模型的并行能力;2.对特别长期的依赖现象依然无能为力。
Transformer:1.使用self-Attention机制,将序列中的任意两个位置之间的距离是缩小为一个常量;2. 具有更好的并行性。
Transformer的本质上是一个Encoder-Decoder的结构:

其中,
Self-Attention:

Feed Forward:

Self-Attention加入了残差网络中的short-cut连接:


Multi-Head Attention: 相当于 个不同的self-attention的集成(也加入了short-cut)

在编码词向量时引入位置编码(Position Embedding)的特征:

论文给出的编码公式如下:


作者这么设计的原因是考虑到在NLP任务重,除了单词的绝对位置,单词的相对位置也非常重要。根据公式 以及
,这表明位置
的位置向量可以表示为位置
的特征向量的线性变化,这为模型捕捉单词之间的相对位置关系提供了非常大的便利。
Transformer的完整结构图

GPT-3 —— Transformer模型在2020年中的一个主要突破

浙公网安备 33010602011771号