摘要: 数据文件来自 :http://archive.ics.uci.edu/ml/datasets/Wholesale+customers?cm_mc_uid=21918109261714715776095&cm_mc_sid_50200000=1476090999impo... 阅读全文
posted @ 2016-10-10 17:34 yuerspring 阅读(255) 评论(0) 推荐(0)
摘要: import org.apache.spark.sql.SQLContextimport org.apache.spark.storage.StorageLevelimport org.apache.spark.{SparkContext, SparkConf}//d... 阅读全文
posted @ 2016-10-10 16:18 yuerspring 阅读(1477) 评论(0) 推荐(0)
摘要: import org.apache.spark.SparkConfimport org.apache.spark.SparkContextimport org.apache.spark.sql.SQLContextimport org.apache.spark.sql... 阅读全文
posted @ 2016-10-10 16:13 yuerspring 阅读(141) 评论(0) 推荐(0)
摘要: Spark SQL 程序开发过程中,我们有两种方式确定 schema,第一种是反射推断 schema,这种方式下,需要定义样本类 (case class) 来对应数据的列;第二种方式是通过编程方式来确定 schema,这种方式主要是通过 Spark SQL 提... 阅读全文
posted @ 2016-10-10 15:23 yuerspring 阅读(206) 评论(0) 推荐(0)
摘要: 案例介绍与编程实现1. 案例介绍该案例中,我们假设某论坛需要根据用户对站内网页的点击量,停留时间,以及是否点赞,来近实时的计算网页热度,进而动态的更新网站的今日热点模块,把最热话题的链接显示其中。2. 案例分析对于某一个访问论坛的用户,我们需要对他的行为数据做一个抽象... 阅读全文
posted @ 2016-10-10 13:45 yuerspring 阅读(238) 评论(0) 推荐(0)
摘要: 案例介绍与编程实现1. 案例介绍该案例中,我们假设某论坛需要根据用户对站内网页的点击量,停留时间,以及是否点赞,来近实时的计算网页热度,进而动态的更新网站的今日热点模块,把最热话题的链接显示其中。2. 案例分析对于某一个访问论坛的用户,我们需要对他的行为数据做一个抽象... 阅读全文
posted @ 2016-10-10 13:45 yuerspring 阅读(390) 评论(0) 推荐(0)
摘要: 利用 Spark Streaming 构建高效健壮的流数据计算系统注意事项 需要合理的设置数据处理的间隔,即需要保证每一批数据的处理时间必须小于处理间隔,保证在处理下一批数据的时候,前一批已经处理完毕。显然这需要由您的 Spark 集群的计算能力还有 input... 阅读全文
posted @ 2016-10-10 13:25 yuerspring 阅读(174) 评论(0) 推荐(0)
摘要: 利用 Spark Streaming 构建高效健壮的流数据计算系统注意事项 需要合理的设置数据处理的间隔,即需要保证每一批数据的处理时间必须小于处理间隔,保证在处理下一批数据的时候,前一批已经处理完毕。显然这需要由您的 Spark 集群的计算能力还有 input... 阅读全文
posted @ 2016-10-10 13:25 yuerspring 阅读(283) 评论(0) 推荐(0)
摘要: Kafka 集群搭建步骤1. 机器准备本文中,我们将准备三台机器搭建 Kafka 集群,IP 地址分别是 192.168.1.1,192.168.1.2,192.168.1.3,并且三台机器网络互通。2. 下载并安装 kafka_2.10-0.8.2.1下载地址: h... 阅读全文
posted @ 2016-10-10 12:58 yuerspring 阅读(291) 评论(0) 推荐(0)
摘要: Kafka 集群搭建步骤1. 机器准备本文中,我们将准备三台机器搭建 Kafka 集群,IP 地址分别是 192.168.1.1,192.168.1.2,192.168.1.3,并且三台机器网络互通。2. 下载并安装 kafka_2.10-0.8.2.1下载地址: h... 阅读全文
posted @ 2016-10-10 12:58 yuerspring 阅读(216) 评论(0) 推荐(0)
摘要: Spark Streaming 模块是对于 Spark Core 的一个扩展,目的是为了以高吞吐量,并且容错的方式处理持续性的数据流。目前 Spark Streaming 支持的外部数据源有 Flume、 Kafka、Twitter、ZeroMQ、TCP Socket... 阅读全文
posted @ 2016-10-10 12:51 yuerspring 阅读(111) 评论(0) 推荐(0)
摘要: Spark Streaming 模块是对于 Spark Core 的一个扩展,目的是为了以高吞吐量,并且容错的方式处理持续性的数据流。目前 Spark Streaming 支持的外部数据源有 Flume、 Kafka、Twitter、ZeroMQ、TCP Socket... 阅读全文
posted @ 2016-10-10 12:51 yuerspring 阅读(145) 评论(0) 推荐(0)
摘要: Kafka 是一个分布式的,高吞吐量,易于扩展地基于主题发布/订阅的消息系统,最早是由 Linkedin 开发,并于 2011 年开源并贡献给 Apache 软件基金会。一般来说,Kafka 有以下几个典型的应用场景: 作为消息队列。由于 Kafka 拥有高吞吐... 阅读全文
posted @ 2016-10-10 12:49 yuerspring 阅读(140) 评论(0) 推荐(0)
摘要: Spark 应用程序在提交执行后,控制台会打印很多日志信息,这些信息看起来是杂乱无章的,但是却在一定程度上体现了一个被提交的 Spark job 在集群中是如何被调度执行的,这里将会向大家介绍一个典型的 Spark job 是如何被调度执行的。我们先来了解以下几个概念... 阅读全文
posted @ 2016-10-10 12:39 yuerspring 阅读(406) 评论(0) 推荐(0)
摘要: SparkWordCount 类源码 standalong 模式import org.apache.spark.SparkConfimport org.apache.spark.SparkContextimport org.apache.spark.SparkCont... 阅读全文
posted @ 2016-10-10 12:38 yuerspring 阅读(298) 评论(0) 推荐(0)