摘要: 大作业: 1.选择使用什么数据,有哪些字段,多大数据量。 数据:us-counties美新冠数据.csv 字段:日期date、县country、州state、确诊人数cases、死亡人数deaths 数据量:158982 2.准备分析哪些问题?(8个以上) (1). 统计美国截止每日的累计确诊人数和 阅读全文
posted @ 2021-06-07 19:11 小王子C 阅读(73) 评论(0) 推荐(0) 编辑
摘要: 1.安装启动检查Mysql服务。netstat -tunlp (3306) 2.spark 连接mysql驱动程序。 –cp /usr/local/hive/lib/mysql-connector-java-5.1.40-bin.jar /usr/local/spark/jars 3.启动 Mysq 阅读全文
posted @ 2021-05-29 19:47 小王子C 阅读(330) 评论(0) 推荐(0) 编辑
摘要: 读学生课程分数文件chapter4-data01.txt,创建DataFrame。 url = "file:///D:/chapter4-data01.txt" rdd = spark.sparkContext.textFile(url).map(lambda line:line.split(',' 阅读全文
posted @ 2021-05-17 20:58 小王子C 阅读(474) 评论(0) 推荐(0) 编辑
摘要: 0.前次作业:从文件创建DataFrame 1.pandas df 与 spark df的相互转换 df_s=spark.createDataFrame(df_p) df_p=df_s.toPandas() # 从数组创建pandas dataframe import pandas as pd im 阅读全文
posted @ 2021-05-10 19:31 小王子C 阅读(157) 评论(0) 推荐(0) 编辑
摘要: 1.Spark SQL出现的 原因是什么? Spark SQL是Spark用来处理结构化数据的一个模块,它提供了一个叫作Data Frame的编程抽象结构数据模型(即带有Schema信息的RDD),Spark SQL作为分布式SQL查询引擎,让用户可以通过SQL、DataFrame API和Data 阅读全文
posted @ 2021-05-09 19:47 小王子C 阅读(195) 评论(0) 推荐(0) 编辑
摘要: 一、词频统计: 1.读文本文件生成RDD lines lines = sc.textFile('file:///home/hadoop/word.txt') 2.将一行一行的文本分割成单词 words flatmap() words = lines.flatMap(lambda line:line. 阅读全文
posted @ 2021-04-18 13:43 小王子C 阅读(74) 评论(0) 推荐(0) 编辑
摘要: 一、词频统计: 1.读文本文件生成RDD lines lines=sc.textFile("file:///home/hadoop/word.txt") #读取本地文件 lines.collect() 2.将一行一行的文本分割成单词 words flatmap() words=lines.flatM 阅读全文
posted @ 2021-04-04 11:30 小王子C 阅读(224) 评论(0) 推荐(0) 编辑
摘要: 一、filter,map,flatmap练习: 1.读文本文件生成RDD lines lines=sc.textFile("file:///home/hadoop/word.txt") #读取本地文件 lines.collect() 2.将一行一行的文本分割成单词 words words=lines 阅读全文
posted @ 2021-03-30 19:31 小王子C 阅读(57) 评论(0) 推荐(0) 编辑
摘要: 1. 准备文本文件从文件创建RDD lines=sc.textFile()筛选出含某个单词的行 lines.filter()lambda 参数:条件表达式 >>>lines=sc.textFile("file:///home/hadoop/word.txt") >>>lines.foreach(pr 阅读全文
posted @ 2021-03-26 17:12 小王子C 阅读(55) 评论(0) 推荐(0) 编辑
摘要: 1. 阐述Hadoop生态系统中,HDFS, MapReduce, Yarn, Hbase及Spark的相互关系。 2. Spark已打造出结构一体化、功能多样化的大数据生态系统,请简述Spark生态系统。 3. 用图文描述你所理解的Spark运行架构,运行流程。 4. 软件平台准备:Linux-H 阅读全文
posted @ 2021-03-12 15:17 小王子C 阅读(103) 评论(0) 推荐(0) 编辑
浏览器标题切换
浏览器标题切换end