随笔分类 -  深度学习 / 动手学深度学习 / 注意力机制 / 自注意力和位置编码

摘要:CNN怎么做序列?实际上之前已经接触过了,就是把序列当成没有高只有宽的图片而已 将书上讲的复杂度汇总如下 CNN 计算复杂度:进行一次卷积计算,由于卷积层大小为\(k\),输入有\(d\)个通道,所以复杂度为\(O(kd)\);由于序列长为\(n\),所以计算完输出的一个通道的时间复杂度为\(O(k 阅读全文
posted @ 2025-03-03 15:09 最爱丁珰 阅读(134) 评论(0) 推荐(0)
摘要:Transformer之所以需要位置信息,是因为Transformer没有RNN那种循环结构,导致其无法区分每个token谁在前在后。数学上,比如Transformer的编码器,由于其是多头自注意力和逐位前馈网络,所以对于一个输入编码器的序列,将序列的顺序交换,最后得到的向量就是交换之前得到的向量也 阅读全文
posted @ 2025-02-24 14:40 最爱丁珰 阅读(36) 评论(0) 推荐(0)
摘要:首先,RNN是逐个处理词元的,这个部分应该是指传统的RNN模型,比如LSTM或GRU,它们是按时间步依次处理输入序列的,每个时间步只处理一个词元,并且当前的输出依赖于前一个时间步的隐藏状态。所以它的处理是顺序的,不能同时处理后面的词元,必须一个接着一个来。这样做的好处是能够捕捉到序列中的时间依赖关系 阅读全文
posted @ 2025-02-24 14:24 最爱丁珰 阅读(49) 评论(0) 推荐(0)