随笔分类 -  ML

Machine Learning.
摘要:KMeans KMeans是一种无监督学习聚类方法, 目的是发现数据中数据对象之间的关系,将数据进行分组,组内的相似性越大,组间的差别越大,则聚类效果越好。 无监督学习,也就是没有对应的标签,只有数据记录.通过KMeans聚类,可以将数据划分成一个簇,进而发现数据之间的关系. 原理 KMeans算法 阅读全文
posted @ 2018-11-26 21:59 April15 阅读(871) 评论(0) 推荐(0)
摘要:决策树 决策树是一种基本的分类和回归方法.决策树顾名思义,模型可以表示为树型结构,可以认为是if then的集合,也可以认为是定义在特征空间与类空间上的条件概率分布. [图片上传失败...(image 2e6565 1543139272117)] 决策树的中间节点可以看做是对一种特征的判断,也是符合 阅读全文
posted @ 2018-11-25 17:50 April15 阅读(1090) 评论(0) 推荐(0)
摘要:Pandas单变量画图 Bar Chat Line Chart Area Chart Histogram df.plot.bar() df.plot.line() df.plot.area() df.plot.hist() 适合定类数据和小范围取值的定序数据 适合定序数据和定距数据 适合定序数据和定 阅读全文
posted @ 2018-10-13 11:33 April15 阅读(1592) 评论(0) 推荐(0)
摘要:什么是K近邻? K近邻一种非参数学习的算法,可以用在分类问题上,也可以用在回归问题上。 什么是非参数学习? 一般而言,机器学习算法都有相应的参数要学习,比如线性回归模型中的权重参数和偏置参数,SVM的C和gamma参数,而这些参数的学习又依赖一定的学习策略。相比较而言,k近邻算法可以说是最简单,也是 阅读全文
posted @ 2018-04-06 16:37 April15 阅读(701) 评论(0) 推荐(0)
摘要:什么是Grid Search 网格搜索? Grid Search:一种调参手段; 穷举搜索 :在所有候选的参数选择中,通过循环遍历,尝试每一种可能性,表现最好的参数就是最终的结果。其原理就像是在数组里找最大值。(为什么叫网格搜索?以有两个参数的模型为例,参数a有3种可能,参数b有4种可能,把所有可能 阅读全文
posted @ 2018-04-03 21:14 April15 阅读(37234) 评论(3) 推荐(5)
摘要:模型评价的目的:通过模型评价,我们知道当前训练模型的好坏,泛化能力如何?从而知道是否可以应用在解决问题上,如果不行,那又是哪里出了问题? train_test_split 在分类问题中,我们通常通过对训练集进行train_test_split,划分成train 和test 两部分,其中train用来 阅读全文
posted @ 2018-04-03 13:05 April15 阅读(31943) 评论(2) 推荐(7)
摘要:代码多来自《Introduction to Machine Learning with Python》. 该文集主要是自己的一个阅读笔记以及一些小思考,小总结。 前言 在开始进行模型训练之前,非常有必要了解准备的数据:数据的特征,数据和目标结果之间的关系是什么? 而且这可能是机器学习过程中最重要的部 阅读全文
posted @ 2018-03-30 21:31 April15 阅读(889) 评论(0) 推荐(0)