文章分类 -  Spark

摘要:https://www.zybuluo.com/jewes/note/35032RDD是什么?RDD是Spark中的抽象数据结构类型,任何数据在Spark中都被表示为RDD。从编程的角度来看,RDD可以简单看成是一个数组。和普通数组的区别是,RDD中的数据是分区存储的,这样不同分区的数据就可以分布在... 阅读全文
posted @ 2015-07-09 20:19 MERRU 阅读(167) 评论(0) 推荐(0)
摘要:http://www.ibm.com/developerworks/cn/opensource/os-cn-mapreduce-spark/index.html?ca=drs-&utm_source=tuicoolMapReduce VS Spark目前的大数据处理可以分为以下三个类型:复杂的批量数... 阅读全文
posted @ 2015-07-09 20:02 MERRU 阅读(533) 评论(0) 推荐(0)
摘要:http://rw.baidu.com/forum.php?mod=viewthread&tid=132878MapReduce从出现以来,已经成为Apache Hadoop计算范式的扛鼎之作。它对于符合其设计的各项工作堪称完美:大规模日志处理,ETL批处理操作等。 随着Hadoop使用范围的不断扩... 阅读全文
posted @ 2015-07-09 19:59 MERRU 阅读(1452) 评论(0) 推荐(0)
摘要:http://blog.csdn.net/anzhsoft/article/details/39851421RDD是Spark最基本,也是最根本的数据抽象。http://www.cs.berkeley.edu/~matei/papers/2012/nsdi_spark.pdf 是关于RDD的论文。如... 阅读全文
posted @ 2015-07-07 09:18 MERRU 阅读(208) 评论(0) 推荐(0)
摘要:http://blog.csdn.net/josephguan/article/details/25649239WordCount示例:valfile = spark.textFile("hdfs://...")valcounts = file.flatMap(line => line.split(... 阅读全文
posted @ 2015-07-07 09:17 MERRU 阅读(668) 评论(0) 推荐(0)
摘要:http://www.ylzx8.cn/gaoxingnenkaifa/cloud/1003859.html从WordCount开始分析编写一个例子程序编写一个从HDFS中读取并计算wordcount的例子程序:packageorg.apache.spark.examplesimportorg.ap... 阅读全文
posted @ 2015-07-07 09:15 MERRU 阅读(407) 评论(0) 推荐(0)
摘要:FROM :http://www.wtoutiao.com/a/717856.htmlMapReduce为大数据挖掘提供了有力的支持,但是复杂的挖掘算法往往需要多个MapReduce作业才能完成,多个作业之间存在着冗余的磁盘读写开销和多次资源申请过程,使得基于MapReduce的算法实现存在严重的性... 阅读全文
posted @ 2015-07-06 10:51 MERRU 阅读(414) 评论(0) 推荐(0)
摘要:FROM :http://www.sxt.cn/info-2730-u-756.html目录Spark开发指南简介接入SparkJava初始化SparkJava弹性分布式数据集并行集合外部数据集RDD操作基本操作传递Functions到SparkWroking with Key-Value Pair... 阅读全文
posted @ 2015-07-06 10:48 MERRU 阅读(161) 评论(0) 推荐(0)
摘要:FROM : http://stark-summer.iteye.com/blog/21732191、下载scala2.11.4版本 下载地址为:http://www.scala-lang.org/download/2.11.4.html,也可以使用wgethttp://downloads.type... 阅读全文
posted @ 2015-07-06 10:46 MERRU 阅读(138) 评论(0) 推荐(0)