合集-机器学习

摘要:最近想学点NLP的东西,开始看BERT,看了发现transformer知识丢光了,又来看self-attention;看完self-attention发现还得再去学学word embedding... 推荐学习顺序是:word embedding、self-attention / transform 阅读全文
posted @ 2023-09-13 13:45 Aikoin 阅读(146) 评论(1) 推荐(0)
摘要:在看Transformer之前,建议先学习一下Self-attention。 同样,这边笔记是参考李宏毅老师的课程和ppt,感兴趣的可以去看原视频~ 补充了Transformer论文精读笔记,建议结合本文食用: ) Sequence-to-Sequence 没错!Transformer是一个sequ 阅读全文
posted @ 2023-09-14 15:43 Aikoin 阅读(197) 评论(0) 推荐(0)
摘要:Attention Is All You Need 摘要 针对序列转录模型,提出一个新的简单网络结构Transformer,基于纯注意力机制构造的encoder-decoder,不用卷积和RNN,并行度更高训练更快。 导言 当前(2017)主流的序列转录模型:RNN,LSTM,GRU RNN缺点:从 阅读全文
posted @ 2023-09-14 20:02 Aikoin 阅读(161) 评论(1) 推荐(0)
摘要:BERT问答 BERT分为哪两种任务,各自的作用是什么; 在计算MLM预训练任务的损失函数的时候,参与计算的Tokens有哪些?是全部的15%的词汇还是15%词汇中真正被Mask的那些tokens? 在实现损失函数的时候,怎么确保没有被 Mask 的函数不参与到损失计算中去; BERT的三个Embe 阅读全文
posted @ 2023-09-26 01:44 Aikoin 阅读(922) 评论(0) 推荐(1)