Transformer

Transformer原理

From知乎:@大师兄  详解Transformer (Attention Is All You Need)

本文为个人学习摘要,以上为原文。

 

RNN的局限性:1. 按照时间顺序,限制了模型的并行能力;2.对特别长期的依赖现象依然无能为力。

Transformer:1.使用self-Attention机制,将序列中的任意两个位置之间的距离是缩小为一个常量;2. 具有更好的并行性。

Transformer的本质上是一个Encoder-Decoder的结构:

其中, 

Self-Attention:

 Feed Forward:

 

Self-Attention加入了残差网络中的short-cut连接:

 

 

 Multi-Head Attention: 相当于 [公式] 个不同的self-attention的集成(也加入了short-cut)

 

 

 在编码词向量时引入位置编码(Position Embedding)的特征:

 

 论文给出的编码公式如下:

 

 

 

 作者这么设计的原因是考虑到在NLP任务重,除了单词的绝对位置,单词的相对位置也非常重要。根据公式 [公式] 以及[公式] ,这表明位置 [公式] 的位置向量可以表示为位置 [公式] 的特征向量的线性变化,这为模型捕捉单词之间的相对位置关系提供了非常大的便利。

 

 Transformer的完整结构图

 

 

GPT-3 —— Transformer模型在2020年中的一个主要突破

 

 

 

Transformer在CV中的应用

posted @ 2021-01-21 15:09  petithenri  阅读(206)  评论(0)    收藏  举报