文章分类 -  机器学习

摘要:机器学习与深度学习中常见的评价指标 一、分类任务 混淆矩阵的介绍 在介绍评价指标之前,我们首先要介绍一下混淆矩阵(confusion matrix)。混淆矩阵本身是对于预测结果的一个粗略评价,可以让我们对预测结果和原始数据有一个宏观的了解。同时我们也会在计算后面的评价指标时用到混淆矩阵中的数。 TP 阅读全文
posted @ 2022-10-26 09:53 hungry_J 阅读(32) 评论(0) 推荐(0)
摘要:一、GBDT简述 GBDT:英文全称:Gradient Boosting Decision Tree 。GBDT中的树都是回归树。GBDT的主要是思想是每次把上一棵树的输出和label的残差作为下一棵树的label进行拟合,前面的树做不好的地方后面的补上,不断把拟合后的预测的残差值叠加上去,进行梯度 阅读全文
posted @ 2022-07-16 19:08 hungry_J 阅读(30) 评论(0) 推荐(0)
摘要:1.原理简介: 与K-Means算法不一样的是,Mean Shift算法可以自动决定类别的数目。与K-Means算法一样的是,两者都用集合内数据点的均值进行中心点的移动。 Mean shift算法本质是一个迭代的过程,那么这个算法的最终效果是什么呢?或者说这个算法能做什么事情?它能够在一组数据的密度 阅读全文
posted @ 2022-03-25 11:55 hungry_J 阅读(106) 评论(0) 推荐(0)
摘要:0.前提概述 线性回归的一般形式,损失函数又叫代价函数,是用来评判一个模型的好坏的。任何能够衡量模型预测出来的值 与真实值 之间的差异的函数都可以叫做代价函数。 线性回归中可能遇到的问题: 求解损失函数的最小值有两种方法:梯度下降法以及正规方程。 特征缩放:即对特征数据进行归一化操作,进行特征缩放的 阅读全文
posted @ 2022-03-24 17:52 hungry_J 阅读(39) 评论(0) 推荐(0)
摘要:SVR全称是support vector regression,是SVM(支持向量机support vector machine)对回归问题的一种运用。在之前的部分中有提到过SVM的原理及其用法,这里就不再赘述了。这里为大家提供了一张图来直观的理解SVM和SVR的区别和联系: 上图显示了SVR的基本 阅读全文
posted @ 2022-03-23 17:38 hungry_J 阅读(584) 评论(0) 推荐(0)
摘要:1.SVM基本概念 支持向量机(support vector machines,SVM)是一种二分类模型,它将实例的特征向量映射为空间中的一些点,SVM 的目的就是想要画出一条线,以 “最好地” 区分这两类点,以至如果以后有了新的点,这条线也能做出很好的分类。SVM 适合中小型数据样本、非线性、高维 阅读全文
posted @ 2022-03-23 16:28 hungry_J 阅读(17) 评论(0) 推荐(0)
摘要:随机森林 随机森林就是通过集成学习的思想将多棵树集成的一种算法,它的基本单元是决策树,而它的本质属于机器学习的一大分支——集成学习(Ensemble Learning)方法。 Bagging Bagging是一种集成学习思想,他的集合策略也比较简单:对于分类问题,通常使用简单投票法,得到票数最多的类 阅读全文
posted @ 2022-03-21 17:19 hungry_J 阅读(21) 评论(0) 推荐(0)
摘要:1.条件概率: 条件概率是指事件A在另外一个事件B已经发生条件下的发生概率,记P(A|B)。 如上图,拿到2个篮球的概率即P(AB),事件A为第一次拿到篮球的概率,这里为P(A)= 2/5;事件B为第二次拿到篮球的概率,这里为在第一次拿到篮球的条件下,第二次拿到篮球的条件概率P(B|A)。根据上边等 阅读全文
posted @ 2022-03-20 21:38 hungry_J 阅读(12) 评论(0) 推荐(0)
摘要:1.算法简介 作为无监督聚类算法中的代表——K均值聚类(Kmeans)算法,该算法的主要作用是将相似的样本自动归到一个类别中。所谓的监督算法,就是输入样本没有对应的输出或标签。聚类(clustering)试图将数据集中的样本划分为若干个通常是不相交的子集,每个子集称为一个“簇(cluster)”,聚 阅读全文
posted @ 2022-03-18 21:52 hungry_J 阅读(33) 评论(0) 推荐(0)
摘要:算法简介 决策树是一种树形结构,其中每个内部节点表示一个属性上的判断,每个分支代表一个判断结果的输出,最后每个叶节点代表一种分类结果。这是一种基于 if-then-else 规则的监督学习算法,决策树的这些规则通过训练得到,而不是人工制定的。 在分类问题中,表示基于特征对实例进行分类的过程。学习时, 阅读全文
posted @ 2022-03-17 14:57 hungry_J 阅读(18) 评论(0) 推荐(0)
摘要:一、K邻近算法概述 KNN是k nearest neighbor 的简称,即k最邻近,就是找k个最近的实例投票决定新实例的类标。 KNN是一种基于实例的学习算法,它不同于贝叶斯、决策树等算法,KNN不需要训练,当有新的实例出现时,直接在训练数据集中找k个最近的实例,把这个新的实例分配给这k个训练实例 阅读全文
posted @ 2022-03-16 23:28 hungry_J 阅读(22) 评论(0) 推荐(0)
摘要:1.背景介绍 1.1. 逻辑回归 Logistic Regression (对数几率回归 Logit Regression) 关于名字,有文献将Logistic Regression译为“逻辑回归”, 但中文“逻辑”与logitic 和 logit 的含义相去甚远,因此在《机器学习》中意译为“对数几 阅读全文
posted @ 2022-03-14 20:49 hungry_J 阅读(147) 评论(0) 推荐(0)
摘要:常见的机器学习分类: 监督学习: 在监督学习当中,每一个实例都是由一个输入对象和一个期望的输出值组成。监督学习算法是通过分析该训练数据,并产生一个推断。一个好的方案可以使得监督学习算法正确地做出决策。 在监督学习中,有两个典型的分类: 分类问题:以邮件分类过滤为例,通过一组特性,将邮件分为正常邮件以 阅读全文
posted @ 2022-03-14 14:55 hungry_J 阅读(15) 评论(0) 推荐(0)