随笔分类 - spark
摘要:Data streaming转为DataFrame,不能直接一步转到DF,需要先转为RDD,然后再转到DF,我们用流式处理数据后,再通过spark sql实时获取我们想要的结果。 1.首先老规矩,创建spark上下文对象,spark SQL和spark Streaming,再创建个socket在Li
阅读全文
摘要:用spark streamming统计单词数量时,reduceBykey只会统计局部的单词数量,每个batch的每个单词的数量,而不能统计每个key所有value值。 所以想要统计全局key的value值,就必须加入有状态计算updataStatusBykey,更新每一个key的状态。 在计算单词数
阅读全文
摘要:在Spark1.6版本中,试图为RDD,DataFrame提供一个新的实验性接口Dataset api接口,所以从范围来说,下面这张图能表明: Dataframe是Dataset的row类型。 RDD 是弹性的分布式数据集。 1.懒执行且不可变,支持lambda表达式的并行数据集合 2.面向对象的编
阅读全文
浙公网安备 33010602011771号