会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
又有知识…增加了
个人笔记,数学和计算机相关知识
博客园
首页
新随笔
联系
订阅
管理
上一页
1
···
4
5
6
7
8
9
10
11
12
下一页
2025年10月21日
线性代数直觉(二):二次型与“正定”
摘要: 你知道一维空间的二次方程是什么样子的吗?比如ax² + bx + c,x²项使它成为二次方程。 二次型是x²项的多维版本。在二维空间中,它看起来像: ax² + bxy + cy² 注意,每个项的次数都是 2: (x², xy, y²)。没有像 x 或 y 这样的线性项,也没有常数项。 美妙之处在于
阅读全文
posted @ 2025-10-21 14:02 CathyBryant
阅读(85)
评论(0)
推荐(0)
2025年10月20日
线性代数直觉(一):矩阵乘以向量?向量乘以向量?
摘要: 这里有一个问题:v^T H v 到底是什么意思?为什么向量乘以矩阵,然后再乘以向量(的转置),就能得到方向曲率(二阶方向导数)? 好吧,我们来展开说。首先,矩阵乘以向量是什么意思? 当你进行 H·v 运算时,你实际上是对 H 的列进行线性组合,并由 v 的各个分量加权。结果是一个新向量,它告诉你 H
阅读全文
posted @ 2025-10-20 22:10 CathyBryant
阅读(82)
评论(0)
推荐(0)
二阶方向导数:凸函数来到高维空间
摘要: 想象一根碗里的筷子,两端搁在表面上,但中间浮在上面,这时的碗就是一个凸面。 好的,现在的问题是:二阶导数检验的高维版本是什么? 在一维中,f''(x) > 0 告诉我们凸性。但现在我们有一个包含两个变量的函数 f(x,y)。我们可以求偏导数,x 方向的变化率和 y 方向的变化率。 我们也可以求二阶偏
阅读全文
posted @ 2025-10-20 10:03 CathyBryant
阅读(138)
评论(0)
推荐(0)
2025年10月19日
大模型推理(九):采样温度
摘要: 舍入误差只是影响模型输出的很小的一部分,更常见的大部分变化来自于概率、随机性和上下文的相互作用。 在生成回复的最后阶段,模型不会选择一个“预先确定”的词,而是会计算词汇表的概率分布: p(w_i \mid \text{context}) = \frac{e^{z_i / T}}{\sum_j e^{
阅读全文
posted @ 2025-10-19 18:58 CathyBryant
阅读(111)
评论(0)
推荐(0)
大模型推理(八):舍入误差 rounding error
摘要: “舍入误差”(rounding error),最简单的理解是,当连续的数学量以离散的数值格式表示时,就会发生舍入误差,比如计算机中的浮点数。并非所有实数都能精确存储,因此机器会保留一个近似值。 形式上,如果真值为 x,存储值为 \hat{x},则 \hat{x} = x + \epsilon 其中
阅读全文
posted @ 2025-10-19 17:11 CathyBryant
阅读(136)
评论(0)
推荐(0)
2025年10月18日
大模型损失函数(二):KL散度(Kullback-Leibler divergence)
摘要: 想象两个世界,它们有两个不同的概率分布。其中一个概率分布 p 描述了事物的真实模式,也就是每个事件实际发生的频率。另一个概率分布 q 是你的信念或是模型认为的,这些相同事件的概率分布情况。 Kullback-Leibler 散度(KL 散度)衡量的是,如果你生活在世界 p 中,但仍然相信 q,你会经
阅读全文
posted @ 2025-10-18 20:46 CathyBryant
阅读(1292)
评论(0)
推荐(0)
2025年10月17日
大模型损失函数(一):交叉熵、联合熵、条件熵
摘要: 1. 信息熵 在信息论中,熵衡量概率分布中的不确定性。 H(p) = -\sum_x p(x) \log p(x) 如果 p(x) 出现一个尖峰,一种结果几乎是确定的,则熵较低。如果 p(x) 分布广泛,多种结果皆有可能,则熵较高。从这个意义上讲,熵是一个系统的平均意外(混乱程度)。 2. 语言模型
阅读全文
posted @ 2025-10-17 09:01 CathyBryant
阅读(250)
评论(0)
推荐(0)
大模型微调(三):预训练和微调的成本差异
摘要: 预训练和微调之间的区别不仅仅是概念上的,它在规模上是天文数字。 1. 预训练:构建宇宙 预训练是迄今为止最昂贵的阶段,模型的参数在进行特化之前,需要学习所有关于语言的知识。 对于 GPT-4 或 GPT-5 规模的模型,该过程可能涉及: - 训练tokens:数千亿到数万亿。 - 计算:大约 10^
阅读全文
posted @ 2025-10-17 07:22 CathyBryant
阅读(184)
评论(0)
推荐(0)
2025年10月16日
凸函数与二阶导数
摘要: 凸函数,二阶导数检验:f''(x) > 0 意味着凸函数。 凸函数真正美妙之处在于,如果你在凸函数上取任意两点,并在它们之间画一条直线,这条线总是在曲线上方,永远不会低于曲线。 数学上:对于 0 到 1 之间的任意 λ,f(λx + (1-λ)y) ≤ λf(x) + (1-λ)f(y)。 曲线越“
阅读全文
posted @ 2025-10-16 20:51 CathyBryant
阅读(105)
评论(0)
推荐(0)
大模型微调(二):使微调保持稳定的策略
摘要: 下面我们进入微调中最棘手、最活跃的部分之一:当模型开始出现问题迹象时,该怎么办?困惑度上升、损失函数震荡、过拟合,或者普遍感觉它“学错了东西”。 在某种程度上,这时训练不像雕塑,更像是园艺,修剪、调整、适量浇水。所有这些都不需要把植物拔掉再重新开始。 1. 学习率调整,倾听地形 最简单、最强大的杠杆
阅读全文
posted @ 2025-10-16 20:21 CathyBryant
阅读(91)
评论(0)
推荐(0)
上一页
1
···
4
5
6
7
8
9
10
11
12
下一页
公告