随笔分类 -  深度学习 / 动手学深度学习 / 优化算法

摘要:在 PyTorch 中,scheduler.get_last_lr() 返回的是一个列表(list),其中包含优化器中每个参数组(parameter group)当前的学习率。例如: optimizer = torch.optim.SGD( [ {'params': model.layer1.par 阅读全文
posted @ 2025-03-28 21:32 最爱丁珰 阅读(83) 评论(0) 推荐(0)
摘要:在 PyTorch 中,trainer.param_groups 是一个列表(list),其中每个元素是一个字典(dict),表示优化器管理的参数组(parameter group)。每个参数组包含一组模型参数及其对应的超参数(如学习率、动量等)。以下是详细解释: 1. trainer.param_ 阅读全文
posted @ 2025-03-28 20:56 最爱丁珰 阅读(102) 评论(0) 推荐(0)
摘要:这段文字主要讨论 随机梯度下降(SGD)中不同的数据采样方式及其影响,具体涉及以下几点: 1. 核心问题:有替换采样 vs. 无替换采样 有替换采样:每次从数据集中随机抽取一个样本后,将其放回原数据集。这意味着同一样本可能被多次选中。 无替换采样:每次从数据集中抽取一个样本后不再放回,直到所有样本都 阅读全文
posted @ 2025-03-24 14:12 最爱丁珰 阅读(104) 评论(0) 推荐(0)
摘要:\((2)\) a.他的解答的意思没说明白,看c的代码即可 c.代码是正确的,注意\(x_1\)一定小于\(x_2\),然后去分类讨论即可。到时注意,此时区间缩小的速度是\(\frac{3}{4}\) 阅读全文
posted @ 2025-03-24 14:10 最爱丁珰 阅读(42) 评论(0) 推荐(0)
摘要:\((2)\) 证明一下为什么范数满足三角不等式: \[||x+y||_p=\sqrt[p]{\underset{i=1}{\overset{d}{\sum}}|x_i+y_i|^p}=\sqrt[p]{\underset{i=1}{\overset{d}{\sum}}2^p|\frac{1}{2} 阅读全文
posted @ 2025-03-23 10:39 最爱丁珰 阅读(78) 评论(0) 推荐(0)
摘要:式\((11.5)\)的推导过程: 令\(Z=P(X|Y)\sim P_1(Z)\),则 \[E_{Y\sim P(Y)}[-\log P(X|Y)]=E_{Z\sim P_1(Z)}[-\log Z] \]\[\geq -\log E[Z]=-\log \int P(Y)P(X|Y)dY=-\lo 阅读全文
posted @ 2025-03-23 09:06 最爱丁珰 阅读(37) 评论(0) 推荐(0)
摘要:以前我们对局部最优解的理解不是非常准确。实际上,在高维空间中的某一个点的梯度为\(0\),意味着其四面八方的极小一段区域都是平的,但是不代表其是极值点,因为要让每个极小区域都向上或者向下的概率是非常小的,我们更多遇到的应该是鞍点,如下 也就是一些方向是向上的,另一些方向是向下的 也就是局部最优点不太 阅读全文
posted @ 2025-03-10 21:56 最爱丁珰 阅读(39) 评论(0) 推荐(0)
摘要:Adam(Adaptive Moment Estimation)算法可以直观理解为“智能调整步长的动量法”,结合了动量加速和自适应学习率的优势。以下是逐步解释: 1. 核心思想:动量和自适应学习率的结合 动量(惯性):类似滚下山坡的球,利用历史梯度方向保持运动惯性,减少震荡。 自适应学习率:根据每个 阅读全文
posted @ 2025-02-17 15:16 最爱丁珰 阅读(133) 评论(0) 推荐(0)
摘要:AdaGrad的两个好处的第一个解释如下 第一个benefit的含义是: Adagrad通过自动累加历史梯度平方值来调整学习率,省去了人为设定“梯度多大才算大”的阈值(threshold)。 具体解释: 原始方法的问题:例如在某些优化算法中,可能需要手动设定一个阈值,当梯度超过该值时,才调整学习率或 阅读全文
posted @ 2025-02-17 14:57 最爱丁珰 阅读(81) 评论(0) 推荐(0)
摘要:从零开始实现中,sgd_momentum这个函数中的循环一定是要原地修改的,具体原因见这篇博客 阅读全文
posted @ 2025-02-17 09:54 最爱丁珰 阅读(36) 评论(0) 推荐(0)
摘要:动量法之所以叫动量法的原因:实际上是在维护一个动量,从而让每一次改变(由于惯性)不改变太多,减少震荡 有效样本权重那里,翻译有错误。原文说的是在(随机)梯度下降中将\(\eta\)变为\(\frac{\eta}{1-\beta}\),而不是在动量法中。这样子做相当于在(随机)梯度下降中模拟了一个近似 阅读全文
posted @ 2025-02-17 08:30 最爱丁珰 阅读(53) 评论(0) 推荐(0)
摘要:首先复习一下有放回抽样和无放回抽样的等价性。假设现在有\(n\)个不同物体,我们从中抽取\(B\)个物体。计算第\(i\)次抽到某个特定物品的概率。对于有放回抽样,概率为\(\frac{1}{n}\);对于无放回抽样,概率为\(\frac{A^{B-1}_{n-1}}{A^{B}_n}=\frac{ 阅读全文
posted @ 2025-02-16 18:58 最爱丁珰 阅读(79) 评论(0) 推荐(0)
摘要:式\((11.47)\)应该有误,不等号左边还应该有一个项\(-E[||x_T-x^{*}||^2]\),之所以没写估计是因为认为\(x_T\)非常接近\(x^{*}\),所以可以忽略;另外不等号右边的括号打错了,应该是 \[2\underset{t=1}{\overset{T}{\sum}}\et 阅读全文
posted @ 2025-02-16 10:38 最爱丁珰 阅读(92) 评论(0) 推荐(0)
摘要:式\((11.78)\)的直观理解:最开始的时候梯度很大,为了防止震荡,我们需要减小步长,这是分母的作用,但是梯度大就表示参数更新也应该大,所以需要增大步长,这是分子的作用;迭代一段时间之后,梯度就变小了,此时为了加速收敛,我们需要增大步长,这是分母的作用(注意这里跟\(\text{AdaGrad} 阅读全文
posted @ 2025-02-15 23:29 最爱丁珰 阅读(43) 评论(0) 推荐(0)
摘要:“惩罚”那里,相当于对\(L_2\)正则化换了一种理解方法,我们给定了超参数\(\lambda\)(假设\(\lambda\)是最优的),去求解\(w\),相当于在求解极大极小问题,根据对偶性,可以转成极小极大问题,于是可以转换成带有约束的最优化问题,而这个约束就是限制\(w\)的\(L_2\)范数 阅读全文
posted @ 2025-02-13 15:27 最爱丁珰 阅读(43) 评论(0) 推荐(0)
摘要:这里的\(f\)就是期望函数,而\(g\)就是在\(f\)的基础上加了噪声,所以是经验风险 阅读全文
posted @ 2025-02-13 12:40 最爱丁珰 阅读(29) 评论(0) 推荐(0)