随笔分类 -  大数据

摘要:1、 查看数值数据的整体分布情况 datafram.describe() 输出: agecount 1463.000000mean 22.948052std 8.385384min 13.00000025% 17.00000050% 20.00000075% 27.000000max 64.0000 阅读全文
posted @ 2018-06-11 11:43 Earendil 阅读(322) 评论(0) 推荐(0)
摘要:有时候需要将hive库中的部分数据导入至本地,这样子做可视化和小规模的数据挖掘实验都是比较方便的。数据导入至本地的HQL语法如下: INSERT OVERWRITE [LOCAL] DIRECTORY directory1 select_statement1;但是hive对字段分隔时默认使用的分隔符 阅读全文
posted @ 2018-06-08 18:32 Earendil 阅读(3011) 评论(0) 推荐(0)
摘要:面试时被问到spark RDD的宽窄依赖,虽然问题很简单,但是答得很不好。还是应该整理一下描述,这样面试才能答得更好。 看到一篇很好的文章,转载过来了。感觉比《spark技术内幕》这本书讲的好多了。 原文链接:https://www.jianshu.com/p/5c2301dfa360 1.窄依赖 阅读全文
posted @ 2018-04-17 10:05 Earendil 阅读(3567) 评论(0) 推荐(0)
摘要:问题描述: 数据包含了一百四十万用户对80万商品的打分。要利用基于物品的协同过滤来计算。如果直接两两计算140万维的向量相似度,肯定不行啊。 问题分析: 每个物品的向量虽然是140万维的,但是其实给一个物品打分的用户其实不多,这个矩阵是非常稀疏的。而且根据长尾问题来说,大部分物品只有很少的用户有过评 阅读全文
posted @ 2018-04-04 09:07 Earendil 阅读(697) 评论(0) 推荐(0)
摘要:感谢我的同事 李震给我讲解UDAF 网上找到的大部分都只有代码,但是缺少讲解,官网的的API有讲解,但是看不太明白。我还是自己记录一下吧,或许对其他人有帮助。 接下来以一个求几何平均数的例子来说明如何实现一个自己的UDAF 首先需要导入这些包: 使用方法: 先注册 参考资料: https://doc 阅读全文
posted @ 2018-03-05 18:47 Earendil 阅读(277) 评论(0) 推荐(0)
摘要:弹性分布式数据集(Resilient Distributed Dataset,RDD) RDD是Spark一开始就提供的主要API,从根本上来说,一个RDD就是你的数据的一个不可变的分布式元素集合,在集群中跨节点分布,可以通过若干提供了转换和处理的底层API进行并行处理。每个RDD都被分为多个分区, 阅读全文
posted @ 2018-03-01 13:47 Earendil 阅读(404) 评论(0) 推荐(0)
摘要:RDD全称叫做弹性分布式数据集(Resilient Distributed Datasets),它是一种分布式的内存抽象,表示一个只读的记录分区的集合,它只能通过其他RDD转换而创建,为此,RDD支持丰富的转换操作(如map, join, filter, groupBy等),通过这种转换操作,新的R 阅读全文
posted @ 2018-01-05 16:06 Earendil 阅读(841) 评论(0) 推荐(0)