09 2021 档案

摘要:结论先行:为什么要使用指数加权平均?因为深度学习中计算效率优先,指数加权平均不占用内存计算平均,并且一行代码搞定。 V2 = βV1+(1-β)b2 V3= βV1+(1-β)b3 不断更新迭代,这就是指数加权平均的由来。意义是指1/(1-β) 天的平均值。 修正偏差的指数加权平均,初始值太小。 阅读全文
posted @ 2021-09-30 23:46 踏浪前行 阅读(221) 评论(0) 推荐(0)
摘要:鉴于自己对minibatch一直以来的误解,说明一下minbatch的具体做法。 batch是一次运行所有数据集,只更新一次梯度下降,m过大,计算依然很慢。 minibatch是一次运行一个minibatch,更新一次梯度,整个数据集,会更新多次,通常来说,运行更快。 原因可能是w的维数小,参数数量 阅读全文
posted @ 2021-09-30 23:13 踏浪前行 阅读(5314) 评论(0) 推荐(0)
摘要:偏差和方差衡量的必要性,因为深度学习中,根据没免费午餐定理,降低了偏差一定增加了方差,降低了方差也增加了偏差。 高偏差:欠拟合,线性不能充分拟合,非线性才能充分拟合 高方差:过拟合,对部分点描述过度,泛化误差增大 偏差和方差一定程度对应着训练误差和验证误差。 基本误差为0的情况下, 1、训练误差降低 阅读全文
posted @ 2021-09-30 21:16 踏浪前行 阅读(969) 评论(0) 推荐(0)
摘要:对于nlogn的时间复杂度要求,使用归并,与数组不同的是: 1)链表找中点,通过快慢指针,找到左右的头节点即可,切断链表操作. 2)建立新的伪节点,不断比较left和right的值,进行组合。 3)这里空间复杂度还是有栈的调用,不是常数级别,后续代码太复杂,以后有时间再看 # Definition 阅读全文
posted @ 2021-09-29 17:30 踏浪前行 阅读(53) 评论(0) 推荐(0)
摘要:首先选择结构是哈希双链表,字典结构{key:node},双链表结构如图所示,(这里添加了伪头和伪尾节点,方便删除添加节点) 注:默认双链表头节点是最新使用,尾部是最久未使用 get方法:1、查询key是否在dict中,不在返回-1,在,返回node.val,同时将node移到头部 put方法:1、查 阅读全文
posted @ 2021-09-29 16:48 踏浪前行 阅读(78) 评论(0) 推荐(0)
摘要:一、提出背景 因为之前的LSTM、GRU等RNN的结构,虽然一定程度上解决了长程依赖的问题,但是还是没有根本解决超过一定范围的长程依赖问题。并且,RNN的顺序计算使得模型训练速度慢的问题。 提出Tranformer:1、并行计算,大大减少训练时间,摒弃了RNN、CNN的使用。 2、仅仅依赖多头自注意 阅读全文
posted @ 2021-09-26 20:49 踏浪前行 阅读(244) 评论(0) 推荐(0)