上一页 1 ··· 208 209 210 211 212 213 214 215 216 ··· 273 下一页
摘要: Refer to the DecisionTree Python docs and DecisionTreeModel Python docs for more details on the API. from pyspark.mllib.tree import DecisionTree, Deci 阅读全文
posted @ 2017-07-11 14:47 bonelee 阅读(1494) 评论(0) 推荐(0)
摘要: 分类(Classification) 下面的例子说明了怎样导入LIBSVM 数据文件,解析成RDD[LabeledPoint],然后使用决策树进行分类。GINI不纯度作为不纯度衡量标准并且树的最大深度设置为5。最后计算了测试错误率从而评估算法的准确性。 以下代码展示了如何载入一个LIBSVM数据文件 阅读全文
posted @ 2017-07-11 11:43 bonelee 阅读(3006) 评论(0) 推荐(0)
摘要: 摘自:http://blog.csdn.net/thriving_fcl/article/details/51404655 词的向量化与word2vec简介 word2vec最初是Tomas Mikolov发表的一篇文章[1],同时开源了相应的代码,作用是将所有词语投影到K维的向量空间,每个词语都可 阅读全文
posted @ 2017-07-10 10:34 bonelee 阅读(1600) 评论(0) 推荐(0)
摘要: 遇到海关官员:白人中年女性问:你们来美国干什么?(这个问题是必问的问题)答:生宝宝顺便购物问:什么?生小孩?答:是的。(一定要微笑哦)问:你们带了多少现金?答:一共3万美金,还有visa卡,放心,我肯定会自费生孩子,不会占用美国政府的福利的。(一定要强调,这点很重要)问:你们打算住在哪里?答:我们定 阅读全文
posted @ 2017-07-08 23:44 bonelee 阅读(2178) 评论(0) 推荐(0)
摘要: 摘自:http://www.cnblogs.com/kobedeshow/p/3651833.html 本文将要讨论基于矩阵分解的推荐算法,这一类型的算法通常会有很高的预测精度,也活跃于各大推荐系统竞赛上面,前段时间的百度电影推荐最终结果的前10名貌似都是把矩阵分解作为一个单模型,最后各种ensem 阅读全文
posted @ 2017-07-06 14:23 bonelee 阅读(11215) 评论(3) 推荐(1)
摘要: Spark MLlib介绍 Spark之所以在机器学习方面具有得天独厚的优势,有以下几点原因: (1)机器学习算法一般都有很多个步骤迭代计算的过程,机器学习的计算需要在多次迭代后获得足够小的误差或者足够收敛才会停止,迭代时如果使用Hadoop的MapReduce计算框架,每次计算都要读/写磁盘以及任 阅读全文
posted @ 2017-07-06 12:11 bonelee 阅读(9263) 评论(0) 推荐(0)
摘要: Spark中常用的算法: 3.2.1 分类算法 分类算法属于监督式学习,使用类标签已知的样本建立一个分类函数或分类模型,应用分类模型,能把数据库中的类标签未知的数据进行归类。分类在数据挖掘中是一项重要的任务,目前在商业上应用最多,常见的典型应用场景有流失预测、精确营销、客户获取、个性偏好等。MLli 阅读全文
posted @ 2017-07-06 12:11 bonelee 阅读(13027) 评论(0) 推荐(0)
摘要: 为什么一些机器学习模型需要对数据进行归一化? http://www.cnblogs.com/LBSer/p/4440590.html 机器学习模型被互联网行业广泛应用,如排序(参见:排序学习实践)、推荐、反作弊、定位(参见:基于朴素贝叶斯的定位算法)等。一般做机器学习应用的时候大部分时间是花费在特征 阅读全文
posted @ 2017-07-06 09:46 bonelee 阅读(6105) 评论(0) 推荐(1)
摘要: 摘自:http://ramsey16.net/%E8%81%9A%E7%B1%BB%EF%BC%88%E4%B8%89%EF%BC%89fuzzy-c-means/ 经典k-均值聚类算法的每一步迭代中,每一个样本点都被认为是完全属于某一类别。我们可以放松这个条件,假定每个样本xjxj模糊“隶属”于某 阅读全文
posted @ 2017-07-05 15:20 bonelee 阅读(3148) 评论(0) 推荐(0)
摘要: 下面来看看groupByKey和reduceByKey的区别: 虽然两个函数都能得出正确的结果, 但reduceByKey函数更适合使用在大数据集上。 这是因为Spark知道它可以在每个分区移动数据之前将输出数据与一个共用的key结合。 借助下图可以理解在reduceByKey里发生了什么。 在数据 阅读全文
posted @ 2017-07-03 15:34 bonelee 阅读(15300) 评论(0) 推荐(0)
上一页 1 ··· 208 209 210 211 212 213 214 215 216 ··· 273 下一页