随笔分类 -  深度学习

摘要:GIOU 目标检测中IOU经常用于度量检测框的准确性,但IOU存在以下问题: 1)如果两个框没有交叉,IOU=0, 如果此时将IOU作为损失函数,梯度=0,无法优化。 2)IOU无法反映两个框的距离。不同方向上有相同交叉级别的两个框的IOU却可以完全一样。 注:IOU即 预测框与实际框的交集 除以 阅读全文
posted @ 2021-01-04 15:45 YeZzz 阅读(234) 评论(0) 推荐(0)
摘要:Sigmoid 公式: 导数: Tanh 公式: 导数: 阅读全文
posted @ 2020-07-20 11:02 YeZzz 阅读(2316) 评论(0) 推荐(0)
摘要:RNN 循环神经网络。像之前的CNN只能处理单独的输入,前一个输入与后一个输入没有关系。但例如NLP中,我们需要前后文的信息。所以RNN应运而生。 标准的RNN中,1)N input -- N output 2)权值共享,W、U、V每个都是一样的。 实际中,这一种结构无法解决所有问题。所以也有了以下 阅读全文
posted @ 2020-07-17 18:28 YeZzz 阅读(509) 评论(0) 推荐(0)
摘要:Softmax softmax可以将经交叉熵损失函数的输出都映射到 0 到 1 间,且各分类累和为 1。符合概率分布。 假设共有 n 个输出 [Z1,...,Zn],对第 i 个元素 Zi 的softmax的计算公式:Si = ezi / sum(ezn) softmax的反向传播求导过程: 博客园 阅读全文
posted @ 2020-07-16 11:47 YeZzz 阅读(731) 评论(0) 推荐(0)
摘要:Transformer seq2seq model with “self-attention” 知名代表--bert 一般处理seq2seq容易想到RNN,但RNN的问题是不容易被平行化。于是有人提出用CNN。 如下右图所示,每个黄色三角代表一个filter,每次考虑3个词,从左往右依次遍历就可以从 阅读全文
posted @ 2020-06-27 16:10 YeZzz 阅读(297) 评论(0) 推荐(0)
摘要:Word Embedding学习笔记 在NLP中,对文本的表示方法: bag-of-words:基于one-hot、tf-idf、textrank等 主题模型:LSA(SVD)、pLSA、LDA; 基于词向量的固定表征:word2vec、fastText、GloVe; 基于词向量的动态表征:elmo 阅读全文
posted @ 2020-06-18 18:25 YeZzz 阅读(938) 评论(0) 推荐(0)
摘要:Dropout 随机失活 dropout前 dropout后 Training时,加在每次update参数前。貌似一般多用在FC层,CNN层也可以用,不过也不是必须的。因为FC参数多。 网上查的说,一般都是在FC层用dropout。一般不用于卷积层,因为在卷积层中图像相邻像素共享很多相同信息,如某些 阅读全文
posted @ 2020-06-11 14:13 YeZzz 阅读(733) 评论(0) 推荐(0)
摘要:优化器 目前优化器主要分为两个方向: 1. The accelerated SGD: SGD momemtum 2. The adaptive learning rate methods: Adam SGDM:收敛慢,更好的精度,比较稳定,train和val的差距比较小 Adam:收敛快,可能不收敛 阅读全文
posted @ 2020-06-08 22:19 YeZzz 阅读(1004) 评论(0) 推荐(0)
摘要:参考博客:https://www.cnblogs.com/guoyaohua/p/8724433.html BN好处: 1)防止梯度消失,提升训练速度,收敛过程更快。因为把输入分布拉到了例如sigmoid中间区域 2)增加分类效果,类似于dropout的一种防止过拟合的正则化表达方式,不用dropo 阅读全文
posted @ 2020-06-03 18:46 YeZzz 阅读(215) 评论(0) 推荐(0)