上一页 1 ··· 3 4 5 6 7 8 9 10 11 12 下一页
摘要: 有一个数学概念也拥有类似的静谧之美:黄金分割率,φ = 1 + √5 / 2。 它无处不在:螺旋、树叶、贝壳的卷曲、星系的展开。但最令人着迷的是,它满足了自身的反射: φ = 1 + 1 / φ 此刻,平衡以自我指涉的方式呈现。 乍一看,φ = 1 + √5/2 只是一个数字,大约是 1.618…… 阅读全文
posted @ 2025-10-30 22:20 CathyBryant 阅读(205) 评论(0) 推荐(0)
摘要: 玻尔兹曼熵公式是: S = k log W 其中 S 是熵,k 是玻尔兹曼常数(一个连接微观世界和宏观世界的微小数值),W 是微观状态数,粒子排列成相同宏观状态的不同方式的数量。所以它是可能性数量的对数,这与概率密切相关。如果所有微观状态出现的概率均等,那么 W 就与系统处于该宏观状态的概率有关。 阅读全文
posted @ 2025-10-29 19:35 CathyBryant 阅读(120) 评论(0) 推荐(0)
摘要: 奖励模型 R_\phi(x,y) 不会输出“好”或“坏”这样的标签。相反,它会生成一个连续的分数,通常是一个实数,类似于: R_\phi(x,y) \in \mathbb{R}。 该分数反映了对于给定提示 x,响应 y 的可取性或与人类价值观的契合程度。在训练过程中,模型会观察对同一提示 x 的响应 阅读全文
posted @ 2025-10-28 19:36 CathyBryant 阅读(118) 评论(0) 推荐(0)
摘要: 关于无穷大的概念,但不是那种简单的无穷大。康托尔(Cantor)发现的那些奇特而令人不安的无穷大。 大多数人认为无穷大就是……无穷无尽,是一个无限。但康托尔证明了无穷大有不同大小,而且有些无限确实比其他无限更大,而且可以证明。 比如,计数数字(1、2、3……)是无限的。但0到1之间的实数呢?也是无限 阅读全文
posted @ 2025-10-28 16:41 CathyBryant 阅读(232) 评论(0) 推荐(0)
摘要: 这里有一个营销倾向!“混合专家MoE”听起来确实比“我们有一堆前馈网络,并根据输入路由到不同的网络”酷多了。 宪法AI也有点像这样,一个更直白的花哨名字。它的基本原理是:不让模型在RLHF中评估输出,而是先让模型根据一套原则,也就是“宪法”,来批判和修改自己的回答。 比如,让模型生成一个回答,然后问 阅读全文
posted @ 2025-10-27 08:11 CathyBryant 阅读(89) 评论(0) 推荐(0)
摘要: 大语言模型在训练过程中并不与人类“对话”,首先,需要将与人类互动获得的偏好数据提炼成奖励模型。 步骤 1:收集人类偏好数据 向人类展示一个提示和几个候选答案,通常是两个,有时更多。例如: 提示:“解释熵和交叉熵的区别。” 答案 A:过于技术性的答案 答案 B:清晰准确的答案 人类注释者标记:“B 更 阅读全文
posted @ 2025-10-25 18:59 CathyBryant 阅读(147) 评论(0) 推荐(0)
摘要: 我们来思考一下 H·v 的几何意义。H 将一个向量 v 变换成一个新的向量。通常,这种变换会旋转和拉伸 v,同时改变它的方向和长度。 但对于特殊的向量——特征向量,H 只会拉伸(或收缩)它们。它根本不会旋转它们。H·v = λv 的意思是“H 只是将 v 缩放了 λ 倍。” 现在,(H - λI)v 阅读全文
posted @ 2025-10-25 10:50 CathyBryant 阅读(89) 评论(0) 推荐(0)
摘要: 想想刚才发生了什么。我们有一个优化问题:“当 v 旋转时,v^T H v 的最大值和最小值是多少?” 这似乎需要用到微积分,检查所有无穷多个方向…… 但事实证明,答案直接通过这个代数方程编码在矩阵本身中!特征值就是那些极端曲率。 更深层次的原因在于:当 v 是一个特征向量,一个特殊的方向时,H·v 阅读全文
posted @ 2025-10-24 22:10 CathyBryant 阅读(64) 评论(0) 推荐(0)
摘要: RLHF 是一种特殊的强化学习,它使用与经典强化学习相同的数学框架,但核心却截然不同。 让我们先从“奖励”的区别说起。 在普通的强化学习中:智能体与环境交互。每一步,它都会执行一个动作 a_t,获得一个奖励 r_t,并更新其策略以最大化预期的未来奖励。奖励信号内置于环境中,例如,游戏得分、机器人与目 阅读全文
posted @ 2025-10-22 22:37 CathyBryant 阅读(111) 评论(0) 推荐(0)
摘要: 还记得 f(x,y) = x² - y² 吗?它是我们的第一个鞍形曲面。它的 Hessian 矩阵很简单: H = [[2 0] [0 -2]] 漂亮且对角化,没有混合导数,因为原函数中没有 xy 项。但是,说到选择方向……你说得对,方向有无限多。但我们不需要随机地检查所有方向。我们应该有策略。我会 阅读全文
posted @ 2025-10-22 12:00 CathyBryant 阅读(113) 评论(0) 推荐(0)
上一页 1 ··· 3 4 5 6 7 8 9 10 11 12 下一页