大模型从0到1
一,大模型扫盲
https://datawhalechina.github.io/so-large-lm/#/

二,机器学习
https://developers.google.com/machine-learning/guides?hl=zh-cn
https://developers.google.com/machine-learning/crash-course/prereqs-and-prework?hl=zh-cn

三,机器学习进阶

四,决策森林
https://developers.google.com/machine-learning/decision-forests?hl=zh-cn
囫囵吞枣了,完全不理解。
有个连续应该可以帮助理解,但是我没做:https://ydf.readthedocs.io/en/latest/tutorial/getting_started/

五,神经网络
https://colah.github.io/posts/2014-03-NN-Manifolds-Topology/
太学术几乎没看,AI的解释,差不多能帮助自洽理解了。
1. 核心视角:神经网络是“空间变形器”
2. 核心约束:拓扑学限制
tanh或 sigmoid激活函数的全连接层)所进行的变换是一种同胚映射——它不会撕裂或粘合空间,只能连续地拉伸和压缩。-
解决方案:要解决这种拓扑约束,网络需要足够“宽”,即隐藏层需要有足够多的神经元(宽度)。更多的神经元意味着网络有能力将数据映射到更高维的空间,从而“解开”在低维空间中无法分离的纠缠结构(就像在三维空间中我们可以解开两个锁在一起的二维圆环)。
3. 对现实世界的启示:流形假设
-
“作弊”方式:网络可能会走“捷径”,不是真正解开流形,而是将纠缠的部分极度拉伸变薄,以实现较高的分类准确率。但这会导致不稳定的决策边界,对对抗性样本脆弱。
4. 对神经网络设计的反思
-
K近邻(k-NN)层:用 k-NN 分类器替代最后的 Softmax 层,目标不再是追求严格的线性可分,而是让同类数据点更近、不同类更远,这或许是一个更自然的目标。
总结
-
理解这一点有助于我们设计更好的网络架构和训练目标,避免网络陷入虚假的“捷径”解。
-
这意味着:神经网络无法改变数据集的拓扑性质。例如,如果一个红色数据点组成的环完全被蓝色数据点包围(就像文章中经典的“红圈被蓝环包围”的例子),那么任何仅由这类层构成的神经网络,无论多深,都无法完美地将它们分开,因为在最终的空间里,这个“红圈被蓝环包围”的拓扑结构依然存在,而一条直线是无法做到这一点的。
-
困难任务:如果数据流形在拓扑上非常复杂(如相互链接、环绕),那么对网络的宽度和结构就会提出根本性的要求。
-
基于向量场的层:学习一个希望流形移动的方向场,然后据此平滑地变形整个空间,这可能更直观地实现流形分离。
-
神经网络通过层层连续变换“扭曲”数据空间。
-
拓扑约束决定了网络能力的理论下限(例如,需要多宽才能分开特定结构的数据)。
六,自注意力机制
也是不理解。有个论文。
反正就是transformer的一个机制。见第三章先理解transformer即可。
七,transformer
TODO:https://transformers.run/c1/attention/
八,GPU编程
https://jizhuoran.github.io/intro2GPU/
CUDA by example:https://hpc.pku.edu.cn/docs/20170830181942363132.pdf
CUDA programing guide:https://docs.nvidia.com/cuda/cuda-programming-guide/
九,其他
hugging face上也有课:https://huggingface.co/learn
浙公网安备 33010602011771号