随笔分类 -  spark

摘要:Data streaming转为DataFrame,不能直接一步转到DF,需要先转为RDD,然后再转到DF,我们用流式处理数据后,再通过spark sql实时获取我们想要的结果。 1.首先老规矩,创建spark上下文对象,spark SQL和spark Streaming,再创建个socket在Li 阅读全文
posted @ 2020-06-10 22:08 会飞的猪、li 阅读(1433) 评论(0) 推荐(0)
摘要:用spark streamming统计单词数量时,reduceBykey只会统计局部的单词数量,每个batch的每个单词的数量,而不能统计每个key所有value值。 所以想要统计全局key的value值,就必须加入有状态计算updataStatusBykey,更新每一个key的状态。 在计算单词数 阅读全文
posted @ 2020-06-09 22:15 会飞的猪、li 阅读(672) 评论(0) 推荐(0)
摘要:在Spark1.6版本中,试图为RDD,DataFrame提供一个新的实验性接口Dataset api接口,所以从范围来说,下面这张图能表明: Dataframe是Dataset的row类型。 RDD 是弹性的分布式数据集。 1.懒执行且不可变,支持lambda表达式的并行数据集合 2.面向对象的编 阅读全文
posted @ 2020-06-09 17:15 会飞的猪、li 阅读(224) 评论(0) 推荐(0)