《深度学习的现代数学》-论文分析
这篇综述论文围绕七个核心研究问题展开,这些问题在经典学习理论框架内无法得到满意回答:
1、深度的作用:
2、维度灾难的消失:为什么深度学习在极高维输入上(比如图像)可以表现出色?
3、泛化之谜:为什么过参数化的神经网络(参数数量多于样本)仍能泛化得很好?
4、非凸优化的成功:为什么SGD能在高度非凸的损失中找到好的解?
5、特征学习:神经网络学到了什么特征?为什么是好特征?
6、架构细节的影响:哪些架构细节(卷积、残差连接、批归一化等)如何影响学习?
7、在自然科学中的有效性:为什么深度学习方法能替代高度专业化的数值算法?
🔗 与PRML的关系
Pattern+Recognition+and+Machine+Learning(Bishop, 2006) 是机器学习领域的经典教材,提供了本文所依赖的经典统计学习理论基础:
- 第1-2章:概率论基础、决策论、信息论
- 第3-4章:线性回归与分类模型
- 第5章:神经网络(前馈网络、BP算法)
- 第6-7章:核方法与稀疏核机器
- 第9章:混合模型与EM算法
浙公网安备 33010602011771号