AI 0基础学习,数学名词解析

AI学习过程中,常见的名词解析

中位数

将数据从小到大排序,奇数列,取中间值,偶数列,中间两个值的平均,可做为销售指标

众数

一组数据中,数值出现最多的那个。反映哪款产品,销量最好

平均数

比赛中,去掉最高、最低分,然后以平均数做为选手的最终得分

损失函数(loss function)

数据集中所有样本的损失均值,能够量化目标的实际值与预测值之间的差距,最小化损失是模型的优化目标,实现损失最小化的方法称为优化算法,也称为寻解算法

多项分布(multinomial distribution)

贝叶斯定理(Bayes’ theorem)

方差

方差与数据波动情况的关系:

  • 方差越大,数据的波动越大,越不稳定
  • 方差越小,数据的波动越小,越稳定

https://www.bilibili.com/video/BV1734y1L7SW/
image

标准差的平方,方差反映的是波动平方,波动:60分->180分 波动 20,乘以3位 波动=60,方差=60**2=360
https://www.bilibili.com/video/BV1NY4y1L7rL/
\(x_1\) ~ \(x_n\)离散程度或者说稳定程序
image
image
image
image

极差

最大值与最小值 之间的波动关系(\(x_{max}\) - \(x_{min}\)),同样反映的离散程度

标准差(standard deviation)

标准差反映的是波动
方差的平方根被称为标准差(standard deviation)

线性回归(linear regression)

仿射变换(affine transformation)

梯度下降(gradient descent)

通过不断地在损失函数递减的方向上更新参数来降低误差。 最简单的用法是计算损失函数(数据集中所有样本的损失均值) 关于模型参数的导数(在这里也可以称为梯度) 算法的步骤如下: 1. 初始化模型参数的值,如随机初始化; 2. 从数据集中随机抽取小批量样本且在负梯度的方向上更新参数,并不断迭代这一步骤

正态分布(normal distribution)= 高斯分布(Gaussian distribution)

数据缩放 Feature Scaling

标准化 Standardization

image
每个学科的满分标准不一样,存在量纲问题,不能直接拿来使用,直接给到算法也是不行的
image
image

标准化经过计算后,把原始数据缩放到均值为0,标准差为1的正态颁布上,所以会看到有个名字 Zero-Score
image

归一化(规范化) Normalization

归一化是数据预处理中的一种常用技术,旨在将数据按比例缩放,使之落入一个小的特定区间,通常是[0, 1]或[-1, 1]。这个过程对于许多机器学习算法来说是非常重要的,因为它可以帮助改善算法的收敛速度和性能,特别是在处理不同量纲或量级的特征时。
归一化的作用:

  • 加速算法收敛
  • 提高模型精度
  • 防止数值问题
  • 提高算法稳定性

规范化来自英文的直接翻译,归一化来自计算的结果
image

经过归一化计算后的数据,均值、标准差不固定
Min-Max Scaling
image
image

image

image
如果不这样做,用测试数据集计算出来的数据,那么最终训练出来的模型在真实的数据环境中,表现往往差于测试集上的数据表现
假如医生问诊病人,利用训练集的均值、标准差、最小值、最大值,相当于医生凭借自己历史上的全部问诊经验,比如血压是多少才是健康的,血糖在多少比较正常。但如果用测试集自己的均值、标准差、最小值、最大值,就相当于医生问诊时,仅以当天这一天的问诊过的病人的血压和血糖值去评估哪些病人是健康的(如果全是高血压最后可能就没有一个高血压)

我们把测试集给到模型,进行测试的时候,标准化或者归一化的依据 均值、标准差、最大值、最小值一定要用训练集计算得到的结果

posted @ 2023-08-09 22:39  VipSoft  阅读(103)  评论(0)    收藏  举报