摘要: 09 第九次作业 没写原因 忘记提交 安装启动检查Mysql服务。netstat -tunlp (3306) spark 连接mysql驱动程序。–cp /usr/local/hive/lib/mysql-connector-java-5.1.40-bin.jar /usr/local/spark/ 阅读全文
posted @ 2021-06-07 19:53 201806120 阅读(31) 评论(0) 推荐(0) 编辑
摘要: 补交第九次作业 安装启动检查Mysql服务。netstat -tunlp (3306) spark 连接mysql驱动程序。–cp /usr/local/hive/lib/mysql-connector-java-5.1.40-bin.jar /usr/local/spark/jars 启动 Mys 阅读全文
posted @ 2021-06-07 19:51 201806120 阅读(22) 评论(0) 推荐(0) 编辑
摘要: 1.选择使用什么数据,有哪些字段,多大数据量。 数据:20年淘宝618某一时段交易量 字段:店家、交易人数、退单人数、下单人数 具体字段后续添加 数据量:215条 2.准备分析哪些问题,可视化方式?(8个以上) (1)、某一时段淘宝最高交易量店家 饼图 (2)、某一个店家、在某一时段购买相同物品人数 阅读全文
posted @ 2021-06-07 19:49 201806120 阅读(16) 评论(0) 推荐(0) 编辑
摘要: 一. 读学生课程分数文件chapter4-data01.txt,创建DataFrame。 1.生成“表头” 2.生成“表中的记录” 3.把“表头”和“表中的记录”拼装在一起 用DataFrame的操作或SQL语句完成以下数据分析要求,并和用RDD操作的实现进行对比: 每个分数+5分。 df_scs. 阅读全文
posted @ 2021-05-24 17:10 201806120 阅读(46) 评论(0) 推荐(0) 编辑
摘要: 1.Spark SQL出现的 原因是什么? Spark SQL是Spark用来处理结构化数据的一个模块,它提供了一个叫作Data Frame的编程抽象结构数据模型(即带有Schema信息的RDD),Spark SQL作为分布式SQL查询引擎,让用户可以通过SQL、DataFrame API和Data 阅读全文
posted @ 2021-05-09 21:12 201806120 阅读(28) 评论(0) 推荐(0) 编辑
摘要: 1. 用Pyspark自主实现词频统计过程。 >>> s = txt.lower().split()>>> dd = {}>>> for word in s:... if word not in dd:... dd[word] = 1... else:... dd[word] = dic[word] 阅读全文
posted @ 2021-04-23 17:18 201806120 阅读(33) 评论(0) 推荐(0) 编辑
摘要: 1. 结果 2. 并比较不同计算框架下编程的优缺点、适用的场景。 –Python –MapReduce –Hive –Spark Mapreduce,它最本质的两个过程就是Map和Reduce,Map的应用在于我们需要数据一对一的元素的映射转换,比如说进行截取,进行过滤,或者任何的转换操作,这些一对 阅读全文
posted @ 2021-04-22 20:53 201806120 阅读(30) 评论(0) 推荐(0) 编辑
摘要: 二、学生课程分数案例 总共有多少学生?map(), distinct(), count() 开设了多少门课程? 每个学生选修了多少门课?map().countByValue() //map(), countByKey() 每门课程有多少个学生选?map(), countByValue() Tom选修 阅读全文
posted @ 2021-04-12 19:15 201806120 阅读(31) 评论(0) 推荐(0) 编辑
摘要: 一、词频统计: 1.读文本文件生成RDD lines 2.将一行一行的文本分割成单词 words flatmap() 3.全部转换为小写 lower() 4.去掉长度小于3的单词 filter() 5.去掉停用词 6.转换成键值对 map() 7.统计词频 reduceByKey() 二、学生课程分 阅读全文
posted @ 2021-04-05 08:47 201806120 阅读(42) 评论(0) 推荐(0) 编辑
摘要: 一、filter,map,flatmap练习: 1.读文本文件生成RDD lines 2.将一行一行的文本分割成单词 words 3.全部转换为小写 4.去掉长度小于3的单词 5.去掉停用词 6.练习一的生成单词键值对 阅读全文
posted @ 2021-03-31 13:43 201806120 阅读(25) 评论(0) 推荐(0) 编辑