随笔分类 - 深度学习 / 动手学深度学习 / 计算机视觉
摘要:首先介绍一下双线性插值。现在有一个三维空间,\(z=f(x,y)\),空间中已知(也就是知道\(z\)值)有四个点\(Q_{11}(x_1,y_1)\)、\(Q_{21}(x_2,y_1)\)、\(Q_{12}(x_1,y_2)\)、\(Q_{22}(x_2,y_2)\),现在给定一个点\(P(x,
阅读全文
摘要:目录P433P434P436 P433 这里锚框一共有\(hwa\)个,是因为我们不会对每一个通道的每一个像素都生成\(a\)个锚框,对于一个位置\((h,w)\),我们只生成\(a\)个锚框,而不是生成\(ac\)个锚框 P434 这里将通道维移到最后一维是为了方便之后的交叉熵和\(L_1\)损失
阅读全文
摘要:在函数display_anchors中,之所以bbox_scale是原图的尺寸而不是特征图的尺寸,是因为在我们想要得到的是原图上的锚框,而特征图的语义非常集中,其一个像素的锚框可以对应于原图的一个比较大的锚框
阅读全文
摘要:其实锚框就可以代表真实边界框,因为锚框有两个属性:类别和偏移量。这两个属性都是字面意思。我们如果知道了一个锚框的两个属性,就可以通过偏移量得到真实边界框,而这个真实边界框的类别就是锚框的类别。所以锚框就可以代表真实边界框
阅读全文
摘要:目录P4251. 上下文背景2. conf[below_min_idx] = 1 - conf[below_min_idx] 的作用 P425 def multibox_detection(cls_probs, offset_preds, anchors, nms_threshold=0.5, po
阅读全文
摘要:目录P421P422 P421 anchors_bbox_map = torch.full((num_anchors,), -1, dtype=torch.long, device=device) max_ious, indices = torch.max(jaccard, dim=1) anc_i
阅读全文
摘要:注意,K和W是一一对应的关系,于是这里就是在说\(\forall\)X,经过卷积层K和矩阵W得到的结果是一样的;\(\forall\)Y,经过转置卷积层K和矩阵W.T得到的结果是一样的 至于那个什么反向传播,应该是他没说清楚
阅读全文
摘要:然后讲多输出通道那里,注意说的是“每个”输出通道“都有”一个三维卷积核
阅读全文
摘要:补充一下代码说明 inter_upperlefts和inter_lowerrights就是交集的左上角和右上角 None的作用是添加一个大小为1的新维度用于广播 取max和min的操作都是正确的,可以想一下
阅读全文
摘要:这个写的也太不清晰了。。。 设\(h,w\)分别表示归一化高度和归一化宽度,\(H,W\)表示输入图像的原高度和原宽度,则锚框的高度和宽度分别为\(H\times h,W\times w\) 缩放比:归一化面积,即\(hw=s^2\) 宽高比:归一化宽度和归一化高度的比例,即\(\frac{Ww}{
阅读全文
摘要:normalize = torchvision.transforms.Normalize( mean=[0.485, 0.456, 0.406], # 各通道的均值 std=[0.229, 0.224, 0.225] # 各通道的标准差 ) 均值 [0.485, 0.456, 0.406] 和 标准
阅读全文
摘要:对于代码 dataset = torchvision.datasets.CIFAR10(root="../data", train=is_train, transform=augs, download=True) 传入的参数不会改变数据集的总大小,它只是会在我们读取数据的时候,对原数据进行增广,然后
阅读全文
摘要:补充一下迁移学习 迁移学习用微调比较多。比如我们按照图像分类去训练了一个神经网络,但是我们现在想要将这个神经网络运用在\(X\)光图像识别上。这就是迁移学习 方法: 我们的新数据(指的是\(X\)光图片)不多 微调(fine tuning)神经网络的最后一层即可,也就是将最后一层的参数重新初始化并训
阅读全文
摘要:这种方法的优点显而易见,就是得到新数据的开销更小,缺点也很明显,就是这种方法得到的新数据的新信息量不如完全新的数据的信息量多 下面是各个代码的解释 \(2.\) 改变颜色apply(img, torchvision.transforms.ColorJitter( brightness=0.5, #
阅读全文

浙公网安备 33010602011771号