03 2021 档案

摘要:一、filter,map,flatmap练习: 1.读文本文件生成RDD lines lines=sc.textFile("file:///usr/local/spark/mycode/rdd/word.txt") 2.将一行一行的文本分割成单词 words words = lines.flatMa 阅读全文
posted @ 2021-03-29 21:25 不喜欢穿内裤 阅读(132) 评论(22) 推荐(0)
摘要:1.准备文本文件,从文件创建RDD lines=sc.textFile(),筛选出含某个单词的行 lines.filter(),lambda 参数:条件表达式 2.生成单词的列表,从列表创建RDD words=sc.parallelize(),筛选出长度大于2 的单词 words.filter() 阅读全文
posted @ 2021-03-27 22:05 不喜欢穿内裤 阅读(48) 评论(0) 推荐(0)
摘要:1. 阐述Hadoop生态系统中,HDFS, MapReduce, Yarn, Hbase及Spark的相互关系,为什么要引入Yarn和Spark。 答: Hadoop对应于Google三驾马车:HDFS对应于GFS,即分布式文件系统,MapReduce即并行计算框架,HBase对应于BigTabl 阅读全文
posted @ 2021-03-12 15:43 不喜欢穿内裤 阅读(74) 评论(0) 推荐(0)