随笔分类 -  spark

摘要:DStream存入MySQL 阅读全文
posted @ 2018-05-23 11:25 zzhangyuhang 阅读(1844) 评论(0) 推荐(0)
摘要:通过kafka生产数据,然后在sparkStream中消费数据 阅读全文
posted @ 2018-05-22 11:28 zzhangyuhang 阅读(2849) 评论(0) 推荐(0)
摘要:Spark Streaming 的创建 阅读全文
posted @ 2018-05-18 12:42 zzhangyuhang 阅读(3866) 评论(0) 推荐(0)
摘要:一些常用的方法介绍 阅读全文
posted @ 2018-05-18 10:19 zzhangyuhang 阅读(7474) 评论(0) 推荐(0)
摘要:DataFrame的操作 阅读全文
posted @ 2018-05-16 11:19 zzhangyuhang 阅读(2228) 评论(0) 推荐(0)
摘要:toDF()创建、createDataFrame()创建以及读取文件创建和JDBC连接 阅读全文
posted @ 2018-05-15 12:54 zzhangyuhang 阅读(5605) 评论(0) 推荐(1)
摘要:SparkSession的创建和方法的使用 阅读全文
posted @ 2018-05-15 10:39 zzhangyuhang 阅读(31150) 评论(0) 推荐(4)
摘要:join连接两个文件 阅读全文
posted @ 2018-05-14 23:12 zzhangyuhang 阅读(826) 评论(0) 推荐(0)
摘要:用自定义比较类实现键值对的比较 阅读全文
posted @ 2018-05-14 22:45 zzhangyuhang 阅读(4036) 评论(0) 推荐(2)
摘要:把每条数据设置相同key通过groupByKey把所有数据合成一个集合最后求极值 阅读全文
posted @ 2018-05-14 11:42 zzhangyuhang 阅读(824) 评论(0) 推荐(0)
摘要:把数据转化成为键值对后采用sortByKey进行排序 阅读全文
posted @ 2018-05-14 11:00 zzhangyuhang 阅读(1907) 评论(0) 推荐(0)
摘要:用maven建立spark的项目 阅读全文
posted @ 2018-05-10 11:36 zzhangyuhang 阅读(3717) 评论(0) 推荐(0)
摘要:用spark读取hbase数据 阅读全文
posted @ 2018-05-10 11:24 zzhangyuhang 阅读(7801) 评论(0) 推荐(0)
摘要:读取本地文件+spark-sumbit参数+hdfs使用 阅读全文
posted @ 2018-05-09 22:32 zzhangyuhang 阅读(2028) 评论(0) 推荐(0)
摘要:spark架构以及原理 阅读全文
posted @ 2018-05-09 10:01 zzhangyuhang 阅读(269) 评论(0) 推荐(0)
摘要:文件读写+JSON数据解析 阅读全文
posted @ 2018-05-08 10:46 zzhangyuhang 阅读(24035) 评论(0) 推荐(0)
摘要:广播变量和累加器 阅读全文
posted @ 2018-05-07 22:15 zzhangyuhang 阅读(1032) 评论(0) 推荐(0)
摘要:join内连接操作 阅读全文
posted @ 2018-05-07 11:37 zzhangyuhang 阅读(576) 评论(0) 推荐(0)
摘要:sortByKey()和sortBy()的使用 阅读全文
posted @ 2018-05-07 11:29 zzhangyuhang 阅读(1487) 评论(0) 推荐(0)
摘要:keys 、values和mapValues(func)的使用 阅读全文
posted @ 2018-05-07 11:13 zzhangyuhang 阅读(13254) 评论(0) 推荐(2)