01 2019 档案

摘要:一、概念 DBSCAN是一种基于密度的聚类算法,DBSCAN需要两个参数,一个是以P为中心的邻域半径;另一个是以P为中心的邻域内的最低门限点的数量,即密度。 优点: 1、不需要提前设定分类簇数量,分类结果更合理; 2、可以有效的过滤干扰。 缺点: 1、对高维数据处理效果较差; 2、算法复杂度较高,资 阅读全文
posted @ 2019-01-17 16:52 Small_office 阅读(1156) 评论(0) 推荐(0)
摘要:一、概念 K-means是一种典型的聚类算法,它是基于距离的,是一种无监督的机器学习算法。 K-means需要提前设置聚类数量,我们称之为簇,还要为之设置初始质心。 缺点: 1、循环计算点到质心的距离,复杂度较高。 2、对噪声不敏感,即使是噪声也会被聚类。 3、质心数量及初始位置的选定对结果有一定的 阅读全文
posted @ 2019-01-14 14:48 Small_office 阅读(526) 评论(0) 推荐(0)
摘要:一、概念 随机森林(Random Forest)是一种由多个决策树组成的分类器,是一种监督学习算法,大部分时候是用bagging方法训练的。 bagging(bootstrap aggregating),训练多轮,每轮的样本由原始样本中随机可放回取出n个样本组成,最终的预测函数对分类问题采用投票方式 阅读全文
posted @ 2019-01-10 09:50 Small_office 阅读(5993) 评论(0) 推荐(0)
摘要:一、概念 逻辑回归(Logistic Regression,LR)是一种广义的线性回归分析模型,属于监督学习算法,需要打标数据,可以用在回归、二分类和多分类等问题上,最常用的是二分类。 线性回归就是通过一条曲线区分不同的数据集,在二分类问题上会有一条直线对其进行区分,如下: 逻辑回归需要每组数据都是 阅读全文
posted @ 2019-01-07 08:45 Small_office 阅读(690) 评论(0) 推荐(0)
摘要:一、概念 朴素贝叶斯模型(Naive Bayesian Model,NBM)是以条件概率为基础的分类器,是一种监督算法,常被用于文本分类和垃圾邮件过滤。贝叶斯理论解决的是逆向概率问题,即通过已经发生的已知的概率来推测未发生的事将会发生的概率。 二、计算 朴素贝叶斯各个事件发生的概率是彼此独立的,即m 阅读全文
posted @ 2019-01-02 14:21 Small_office 阅读(297) 评论(0) 推荐(0)