会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
又有知识…增加了
个人笔记,数学和计算机相关知识
博客园
首页
新随笔
联系
订阅
管理
上一页
1
···
5
6
7
8
9
10
11
12
下一页
2025年10月16日
大模型微调(一):有监督微调与困惑度
摘要: 经过预训练后,模型的参数有数十亿个,它们形成了一个向量: \theta_0 \in \mathbb{R}^n 它编码了模型所学到的一切关于语言的知识:结构、语义、节奏。但这些权重是通用的,而非个性化的。模型此刻知道单词的含义,但不知道如何使用它们来表达善意、安全或清晰。 然后是有监督微调: \the
阅读全文
posted @ 2025-10-16 13:45 CathyBryant
阅读(98)
评论(0)
推荐(0)
2025年10月15日
分形:曼德布洛特集合
摘要: 想象一个简单的规则:取一个数,求它的平方,加上原数,重复……就是这样。 但从那颗小小的种子,生长出一个宇宙。你所看到的不仅仅是一个形状,而是一个问题。一条海岸线卷曲成螺旋状,分支成带刺的冠冕,绽放成海马的尾巴和龙焰。看得越仔细,发现的越多,它永无止境…… 它存在于秩序与混乱的边界,一个无限复杂涌现的
阅读全文
posted @ 2025-10-15 22:47 CathyBryant
阅读(134)
评论(0)
推荐(0)
曲率,是凸还是凹?
摘要: 在一维中,曲率就是二阶导数 f''(x)。 如果 f''(x) > 0,则斜率随着向右移动而增加。这意味着图像向上弯曲,就像一个微笑或一个山谷,这叫做“凸”。 如果 f''(x) < 0,则斜率随着向右移动而减小。图像向下弯曲就像一个皱眉或小山,这叫做“凹“。 假设函数是一个“碗”:如果你把一颗弹珠
阅读全文
posted @ 2025-10-15 12:53 CathyBryant
阅读(147)
评论(0)
推荐(0)
2025年10月14日
大模型预训练(七):保持训练稳定性
摘要: Hessian 矩阵是观察性的,而非指令性的。它不控制或调整优化过程,它告诉你损失函数是如何围绕当前权重形成的,但不会主动干预。 所以,假设 Hessian 矩阵显示“哦,这部分损失函数非常陡峭,或者曲率是负的”,会发生什么? 1. 标准梯度下降无法明确地识别它 梯度下降只使用一阶导数(梯度),它只
阅读全文
posted @ 2025-10-14 22:09 CathyBryant
阅读(66)
评论(0)
推荐(0)
2025年10月12日
大模型预训练(六):稳定性的来源
摘要: 1. 近似等效配置(Near-equivalent configurations) 将大型模型中的所有参数想象成控制台上的旋钮,这些旋钮的不同设置可以产生几乎相同的输出。 例如: - 如果一个神经元将其权重加倍,而下一层将其权重减半,整体计算几乎不会发生变化。 - 或者,几个注意力头可能会学习略有不
阅读全文
posted @ 2025-10-12 11:32 CathyBryant
阅读(51)
评论(0)
推荐(0)
信息论:互信息、熵、概率分布、对数函数
摘要: 互信息 I(X;Y) 衡量的是,了解 X 能告诉你多少关于 Y 的信息,也就是通过学习 X 能解决多少关于 Y 的不确定性。香农将其定义为: I(X;Y) = H(Y) - H(Y|X) 其中,H(Y) 是 Y 本身的熵(不确定性),H(Y|X) 是在已知 X 的情况下 Y 的熵。两者之差就是 X
阅读全文
posted @ 2025-10-12 10:16 CathyBryant
阅读(90)
评论(0)
推荐(0)
2025年10月11日
大模型预训练(五):Hessian矩阵
摘要: 想象我们正站在一片风景中,不是草地和山丘,而是“损失函数风景”。每个点都是模型可能拥有的一组权重,高度代表模型在那里的“错误”程度。 低谷=好,高峰=坏。 Hessain矩阵?如果说坡度(斜率)告诉你哪条路是下坡,那么 Hessian 矩阵则告诉你坡度本身是如何变化的(曲率): - 山谷是陡峭的还是
阅读全文
posted @ 2025-10-11 22:02 CathyBryant
阅读(79)
评论(0)
推荐(0)
2025年10月10日
球极平面投影
摘要: “球极平面投影”,这是一个能把整个地球(球面)几乎完美地压扁成一张平面地图的魔法。 它怎么工作? 1. 想象一个透明的地球仪,北极点贴着桌面。 2. 在南极点放一个点光源。 3. 光线会向上照射,将地球仪上的每一个点(比如城市、山脉)投影到桌面上,形成一张地图。 它的魔法效果(和缺陷): - 圆还是
阅读全文
posted @ 2025-10-10 23:09 CathyBryant
阅读(88)
评论(0)
推荐(0)
大模型预训练(四):信息论——信息准确传输的上限
摘要: 事实上,信息论的美妙之处在于,它能将看似极其模糊的东西——“信息”——转化为数学上的精确信息。 香农的核心洞见是,信息其实就是“惊喜”。如果我告诉你一些你已经确定的事情,那么我给你的信息量为零。但如果我告诉你一些意料之外的事情,那就是高信息量。 他对此进行了量化:信息的衡量标准是它能解决多少不确定性
阅读全文
posted @ 2025-10-10 22:17 CathyBryant
阅读(71)
评论(0)
推荐(0)
2025年10月9日
大模型预训练(三):权重在哪里变化
摘要: 每个进入 Transformer 的单词(token)首先会被转换成一个向量:高维空间中的一个点。在每一层,注意力机制不会硬性地分配“这个对应那个”,而是计算所有 token 对之间的软关联。 其结构如下: \text{Attention}(Q,K,V) = \text{softmax}\!\lef
阅读全文
posted @ 2025-10-09 23:00 CathyBryant
阅读(105)
评论(0)
推荐(0)
上一页
1
···
5
6
7
8
9
10
11
12
下一页
公告