会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
wljss
纸上得来终觉浅,绝知此事要躬行。
博客园
首页
新随笔
联系
订阅
管理
上一页
1
2
3
4
5
6
···
21
下一页
2026年5月20日
Chinchilla Scaling Law 奇努拉缩放定律
摘要: 本文结合gemini-3.1-pro-preview&豆包生成。 用一句话概括 Chinchilla 定律就是:在给定的算力预算下,要想训练出表现最好的模型,模型的“参数量(N)”和“训练数据量(D)”应该保持同等比例的增长。(通常的经验法则是:Token数大约是参数量的 20 倍)。 一、 故事背
阅读全文
posted @ 2026-05-20 18:21 wljss
阅读(123)
评论(0)
推荐(0)
2026年5月19日
从《Attention is All You Need》 到 当代大模型架构
摘要: 本文结合chatgpt生成。 原始 Transformer:2017 年的起点 《Attention is All You Need》里的 Transformer 不是今天大模型最常见的形态。它最初是一个 Encoder-Decoder 架构,主要用于机器翻译。 核心模块是: \[\text{Att
阅读全文
posted @ 2026-05-19 22:30 wljss
阅读(17)
评论(0)
推荐(0)
2026年5月15日
蔡廷常数与哥德巴赫猜想
摘要: 之前看到的,挺有意思记录一下。 蔡廷常数 蔡廷常数(Chaitin's constant,通常记为 \(\Omega\) ))是算法信息论中的一个数学常数,它代表了一个随机生成的程序在通用图灵机上能够最终停机的概率。 是一个确定的,介于0到1之间的常数。 是一个不可计算的常数。 不存在任何图灵机能输
阅读全文
posted @ 2026-05-15 00:25 wljss
阅读(40)
评论(0)
推荐(0)
2026年4月30日
一些 病态函数
摘要: 本文结合豆包AI生成。 在看一本书时作者提到他很喜欢收集一些比较奇葩的函数,这种函数叫病态函数。有一些他只提到了性质没说具体是什么函数。这里整理一下。 1. 处处连续但处处不可导的函数 代表:魏尔斯特拉斯函数(Weierstrass function) 它是1872年数学家魏尔斯特拉斯构造的里程碑式
阅读全文
posted @ 2026-04-30 18:37 wljss
阅读(60)
评论(0)
推荐(0)
2026年4月26日
时间复杂度理论中的记号
摘要: 本文结合豆包AI生成。 时间复杂度理论中的核心渐近记号 时间复杂度的记号,本质是用来描述算法运行时间(或空间开销)随输入规模n增长的渐近行为(即n→∞时的增长趋势),核心是忽略常数因子和低阶项,主要关注的是增长量级的差异。 一、核心基础记号 这5个记号是渐近分析的基石,由高德纳(Donald Knu
阅读全文
posted @ 2026-04-26 15:28 wljss
阅读(32)
评论(0)
推荐(0)
2026年4月16日
准确率陷阱 机器学习
摘要: 本文结合豆包AI生成。 想起一个段子,训练一个AI模型让他判断一个学生有没有数学天赋,AI模型全部回答“没有”就能获得超高正确率,这是因为有数学天赋的人极其的稀少。 但是这样显然不是我们需要的AI模型。怎么办呢?怎么解决? 模型躺平的根源在于用 整体准确率(Accuracy) 作为唯一评价指标。当模
阅读全文
posted @ 2026-04-16 17:33 wljss
阅读(32)
评论(0)
推荐(0)
2026年3月17日
矩阵的秩与过拟合
摘要: 改编自豆包 前置知识点1:矩阵的秩 矩阵的秩rank,就是这个矩阵里「不重复、不冗余的有效信息的数量」。 比如一个矩阵里所有行都是第一行的倍数,那所有信息都能从第一行推出来,它的秩就是1;如果有2行完全独立、没法互相推导,剩下的行都能从这2行推出来,秩就是2。 公式定义: 对任意矩阵 \(A \in
阅读全文
posted @ 2026-03-17 17:24 wljss
阅读(28)
评论(0)
推荐(0)
2026年3月14日
变分自编码器 VAE
摘要: 本文结合豆包生成 先从自编码器(AE) 说起,再讲VAE是怎么把它升级成能生成新内容的「变分自编码器」。 先搞懂基础——自编码器(AE)是什么? 大白话:AE就是一个「压缩-还原」的AI机器,分两个核心部分: 编码器:把输入的样本(比如一张人脸照片x),压缩成一个很短的特征码z(也叫隐变量,相当于这
阅读全文
posted @ 2026-03-14 16:37 wljss
阅读(88)
评论(0)
推荐(0)
KL散度
摘要: KL 散度(全称 Kullback-Leibler Divergence,也叫相对熵),本质就是衡量两个概率分布的 “不一样程度”,更准确地说:用一个近似分布去描述真实分布时,会损失 / 多浪费多少信息。 两个基础的概念: 概率分布:就是一件事所有可能结果的出现概率。比如抛正常硬币,正面 50%、反
阅读全文
posted @ 2026-03-14 13:41 wljss
阅读(170)
评论(0)
推荐(0)
2026年3月13日
信息熵
摘要: 维基百科:熵的概念最早起源于物理学,用于度量一个热力学系统的无序程度。在信息论里面,熵是对不确定性的测量。但是在信息世界,熵越高,则能传输越多的信息,熵越低,则意味着传输的信息越少。 简单来说,信息熵 = 一件事的「不确定程度」。 越猜不准、越没谱、结果越乱,熵就越高;板上钉钉、完全没悬念的事,熵就
阅读全文
posted @ 2026-03-13 16:55 wljss
阅读(110)
评论(0)
推荐(0)
上一页
1
2
3
4
5
6
···
21
下一页
公告