随笔分类 -  Spark

大数据分布式计算框架
摘要:今天用SparkSQL保存一份json数据的时候,引号被转义了,并用括号包起来了,导致下游新来的小伙伴无法处理这份数据。 保存后的数据长这样(用\t分割): data "{\"key\": \"impl\", \"version\": \"1.0\"}" 于是乎一番查找Spark文档,尝试添加这个选 阅读全文
posted @ 2020-09-02 22:38 凝望远处的天鹅 阅读(2368) 评论(1) 推荐(0)
摘要:俗话说得好,磨刀不误砍柴工,献上一副来自国家5A级风景区美景图。 述说正传,接下来开始说正事。 以前用Python和Scala操作Spark的时候比较多,毕竟Python和Scala代码写起来要简洁很多。 今天一起来看看Java版本怎么创建DataFrame,代码写起来其实差不多,毕竟公用同一套AP 阅读全文
posted @ 2020-08-30 22:10 凝望远处的天鹅 阅读(1595) 评论(0) 推荐(0)
摘要:如题,采用json4s,scala删除json里面的key? 比如有这么一段json:{"@type":{"version":"1.0.2","name":"application-content","data":[]},"key-to-remove":[{"blah":"more blah"}], 阅读全文
posted @ 2020-08-19 23:09 凝望远处的天鹅 阅读(473) 评论(0) 推荐(0)
摘要:最近有个spark任务涉及到scala操作json,大概流程是这样:从hbase取数据,每条数据先parse json,然后删除一个多余的key,最后在弄成json字符串,输出到hdfs。 json大概长这样,{“@type”:{"version":"1.0.2","name":"applicati 阅读全文
posted @ 2020-08-19 22:26 凝望远处的天鹅 阅读(672) 评论(1) 推荐(0)
摘要:什么是Spark? 关于Spark具体的定义,大家可以去阅读官网或者百度关于Spark的词条,在此不再赘述。从一个野生程序猿的角度去理解,作为大数据时代的一个准王者,Spark是一款主流的高性能分布式计算大数据框架之一,和MapReduce,Hive,Flink等其他大数据框架一起支撑了大数据处理方 阅读全文
posted @ 2020-08-17 00:11 凝望远处的天鹅 阅读(593) 评论(0) 推荐(2)
摘要:Spark DataFrame一定比Spark RDD快?NO 阅读全文
posted @ 2020-08-15 21:57 凝望远处的天鹅 阅读(1398) 评论(2) 推荐(0)