上一页 1 ··· 5 6 7 8 9 10 11 12 下一页
摘要: 经过预训练后,模型的参数有数十亿个,它们形成了一个向量: \theta_0 \in \mathbb{R}^n 它编码了模型所学到的一切关于语言的知识:结构、语义、节奏。但这些权重是通用的,而非个性化的。模型此刻知道单词的含义,但不知道如何使用它们来表达善意、安全或清晰。 然后是有监督微调: \the 阅读全文
posted @ 2025-10-16 13:45 CathyBryant 阅读(98) 评论(0) 推荐(0)
摘要: 想象一个简单的规则:取一个数,求它的平方,加上原数,重复……就是这样。 但从那颗小小的种子,生长出一个宇宙。你所看到的不仅仅是一个形状,而是一个问题。一条海岸线卷曲成螺旋状,分支成带刺的冠冕,绽放成海马的尾巴和龙焰。看得越仔细,发现的越多,它永无止境…… 它存在于秩序与混乱的边界,一个无限复杂涌现的 阅读全文
posted @ 2025-10-15 22:47 CathyBryant 阅读(134) 评论(0) 推荐(0)
摘要: 在一维中,曲率就是二阶导数 f''(x)。 如果 f''(x) > 0,则斜率随着向右移动而增加。这意味着图像向上弯曲,就像一个微笑或一个山谷,这叫做“凸”。 如果 f''(x) < 0,则斜率随着向右移动而减小。图像向下弯曲就像一个皱眉或小山,这叫做“凹“。 假设函数是一个“碗”:如果你把一颗弹珠 阅读全文
posted @ 2025-10-15 12:53 CathyBryant 阅读(147) 评论(0) 推荐(0)
摘要: Hessian 矩阵是观察性的,而非指令性的。它不控制或调整优化过程,它告诉你损失函数是如何围绕当前权重形成的,但不会主动干预。 所以,假设 Hessian 矩阵显示“哦,这部分损失函数非常陡峭,或者曲率是负的”,会发生什么? 1. 标准梯度下降无法明确地识别它 梯度下降只使用一阶导数(梯度),它只 阅读全文
posted @ 2025-10-14 22:09 CathyBryant 阅读(66) 评论(0) 推荐(0)
摘要: 1. 近似等效配置(Near-equivalent configurations) 将大型模型中的所有参数想象成控制台上的旋钮,这些旋钮的不同设置可以产生几乎相同的输出。 例如: - 如果一个神经元将其权重加倍,而下一层将其权重减半,整体计算几乎不会发生变化。 - 或者,几个注意力头可能会学习略有不 阅读全文
posted @ 2025-10-12 11:32 CathyBryant 阅读(51) 评论(0) 推荐(0)
摘要: 互信息 I(X;Y) 衡量的是,了解 X 能告诉你多少关于 Y 的信息,也就是通过学习 X 能解决多少关于 Y 的不确定性。香农将其定义为: I(X;Y) = H(Y) - H(Y|X) 其中,H(Y) 是 Y 本身的熵(不确定性),H(Y|X) 是在已知 X 的情况下 Y 的熵。两者之差就是 X 阅读全文
posted @ 2025-10-12 10:16 CathyBryant 阅读(90) 评论(0) 推荐(0)
摘要: 想象我们正站在一片风景中,不是草地和山丘,而是“损失函数风景”。每个点都是模型可能拥有的一组权重,高度代表模型在那里的“错误”程度。 低谷=好,高峰=坏。 Hessain矩阵?如果说坡度(斜率)告诉你哪条路是下坡,那么 Hessian 矩阵则告诉你坡度本身是如何变化的(曲率): - 山谷是陡峭的还是 阅读全文
posted @ 2025-10-11 22:02 CathyBryant 阅读(79) 评论(0) 推荐(0)
摘要: “球极平面投影”,这是一个能把整个地球(球面)几乎完美地压扁成一张平面地图的魔法。 它怎么工作? 1. 想象一个透明的地球仪,北极点贴着桌面。 2. 在南极点放一个点光源。 3. 光线会向上照射,将地球仪上的每一个点(比如城市、山脉)投影到桌面上,形成一张地图。 它的魔法效果(和缺陷): - 圆还是 阅读全文
posted @ 2025-10-10 23:09 CathyBryant 阅读(88) 评论(0) 推荐(0)
摘要: 事实上,信息论的美妙之处在于,它能将看似极其模糊的东西——“信息”——转化为数学上的精确信息。 香农的核心洞见是,信息其实就是“惊喜”。如果我告诉你一些你已经确定的事情,那么我给你的信息量为零。但如果我告诉你一些意料之外的事情,那就是高信息量。 他对此进行了量化:信息的衡量标准是它能解决多少不确定性 阅读全文
posted @ 2025-10-10 22:17 CathyBryant 阅读(71) 评论(0) 推荐(0)
摘要: 每个进入 Transformer 的单词(token)首先会被转换成一个向量:高维空间中的一个点。在每一层,注意力机制不会硬性地分配“这个对应那个”,而是计算所有 token 对之间的软关联。 其结构如下: \text{Attention}(Q,K,V) = \text{softmax}\!\lef 阅读全文
posted @ 2025-10-09 23:00 CathyBryant 阅读(105) 评论(0) 推荐(0)
上一页 1 ··· 5 6 7 8 9 10 11 12 下一页