5 RDD编程

一、词频统计

1.读文本文件生成RDD lines

2.将一行一行的文本分割成单词 words flatmap()

3.全部转换为小写 lower()

4.去掉长度小于3的单词 filter()

5.去掉停用词

6.转换成键值对 map()

7.统计词频 reduceByKey()

8.按字母顺序排序 sortBy(f)

9.按词频排序 sortByKey()

 

 

 

 

 

 

 

 

 

posted @ 2021-04-18 20:50  兲乤  阅读(52)  评论(0编辑  收藏  举报