7.Spark SQL
摘要:1.请分析SparkSQL出现的原因,并简述SparkSQL的起源与发展。 SparkSQL的出现,解决了对不同数据源和不同数据的操作,例如结构化和非结构化数据。还有可以支持融合关系查询和复杂分析算法。 SparkSQL的前身是Shark,Shark中提供了类似于Hive的功能。但是Shark设计中
阅读全文
6. RDD综合练习
摘要:集合运算练习 union() intersection() subtract() cartesian() 内连接与外连接 join() leftOuterJoin() rightOuterJoin() fullOuterJoin() 三、综合练习:学生课程分数 网盘下载sc.txt文件,通过RDD操
阅读全文
RDD操作综合
摘要:一、词频统计 A. 分步骤实现 准备文件 下载小说或长篇新闻稿 上传到hdfs上 读文件创建RDD 分词 排除大小写lower(),map()标点符号re.split(pattern,str),flatMap(),停用词,可网盘下载stopwords.txt,filter(),长度小于2的词filt
阅读全文