02 2021 档案

摘要:参考原文:https://blog.csdn.net/v_july_v/article/details/81708386 阅读全文
posted @ 2021-02-28 12:26 一笑任逍遥 阅读(46) 评论(0) 推荐(0)
摘要:特征选择 从特征集合中选择出相关的特征子集的过程,称为特征选择。它是数据预处理的一个重要过程。 为什么进行特征选择? 答:由于特征过多造成维数灾难,去除不相关的特征,会降低学习任务的难度。 过滤式选择 过滤式特征选择是首先从特征中过滤重要特征,接着再训练学习器,特征选择过程与学习器训练过程无关。 R 阅读全文
posted @ 2021-02-28 10:47 一笑任逍遥 阅读(194) 评论(0) 推荐(0)
摘要:K-MEANS算法: 基本思想 无监督问题,相似的归为一类。但是很难评估和调参。 1 将数据分成K个簇, 2 质心:均值,向量各维度取平均。 3 距离度量:欧式距离和余弦相似度(先标准化) 4 优化目标:min(sumCu(sumDist(c,x)2)) 从1到K个簇进行和,每个簇中,样本点到质心的 阅读全文
posted @ 2021-02-26 16:21 一笑任逍遥 阅读(115) 评论(0) 推荐(0)
摘要:朴素贝叶斯 朴素贝叶斯:特征值相互独立 + 公式, 主要用于文本分类,单词作为特征。 联合概率:包含多个条件,且都成立的概率。 条件概率:事件A在事件B发生的情况下发生的概率。 相互独立:P(AB) = P(A)*P(B) 贝叶斯公式: P(C|W) = P(W|C)*P(C)/P(W) W:特征值 阅读全文
posted @ 2021-02-08 13:54 一笑任逍遥 阅读(88) 评论(0) 推荐(0)
摘要:K近邻法 K-近邻模型 根据一个已经分好类具有具体标签的数据集进行预测分类,不具有显示的训练过程,根据新样本与训练样本中每个样本之间的距离选择最近的K个样本预测,通过多数投票的方式预测该样本的标签。 模型由三个基本要素组成:距离度量,K值选择,分类决策规则。该模型距离度量为欧式距离,分类决策规则是多 阅读全文
posted @ 2021-02-07 23:55 一笑任逍遥 阅读(394) 评论(0) 推荐(0)
摘要:感知机 感知机模型 感知机模型是一种二分类的线性判别模型。根据数据特征分为正负两类,是神经网络与支持向量机的基础。 F(x) = sign(w*x +b) w:权值,b:偏置量 F(x) = 1 (x>=0) F(x) = -1 (x<0) 根据超平面 w*x +b=0 将数据集分为两类。 感知机学 阅读全文
posted @ 2021-02-07 19:28 一笑任逍遥 阅读(900) 评论(0) 推荐(0)