摘要: 1.请分析SparkSQL出现的原因,并简述SparkSQL的起源与发展。 Spark SQL的前身是 Shark,Shark最初是美国加州大学伯克利分校的实验室开发的Spark生态系统的组件之一,它运行在Spark系统之上,Shark重用了Hive的工作机制,并直接继承了Hive的各个组件, Sh 阅读全文
posted @ 2022-05-10 08:52 shiqiqio 阅读(43) 评论(0) 推荐(0)
摘要: 集合运算练习 union(), intersection(),subtract(), cartesian() 内连接与外连接 join(), leftOuterJoin(), rightOuterJoin(), fullOuterJoin() 多个考勤文件,签到日期汇总,出勤次数统计 三、 持久化  阅读全文
posted @ 2022-04-20 22:10 shiqiqio 阅读(26) 评论(0) 推荐(0)
摘要: 一、词频统计 1.分步骤实现 1).准备文件 1.下载小说或长篇新闻稿 2.上传到hdfs上 3.读文件创建RDD 分词 排除大小写lower(),map() 标点符号re.split(pattern,str),flatMap(), 停用词,可网盘下载stopwords.txt,filter(), 阅读全文
posted @ 2022-04-12 08:53 shiqiqio 阅读(18) 评论(0) 推荐(0)
摘要: 一、 RDD创建 从本地文件系统中加载数据创建RDD 2.从HDFS加载数据创建RDD启动hdfs上传文件查看文件加载停止hdfs 3.通过并行集合(列表)创建RDD输入列表、字符串、生成数组 二、 RDD操作 转换操作 filter(func)传入lambda匿名函数显式定义函数 2.map(fu 阅读全文
posted @ 2022-03-28 19:23 shiqiqio 阅读(76) 评论(0) 推荐(0)
摘要: 1.Spark已打造出结构一体化、功能多样化的大数据生态系统,请用图文阐述Spark生态系统的组成及各组件的功能。 目前,Spark已经发展成为包含众多子项目的大数据计算平台。BDAS是伯克利大学提出的基于Spark的数据分析栈(BDAS)。其核心框架是Spark,同时涵盖支持结构化数据SQL查询与 阅读全文
posted @ 2022-03-13 20:01 shiqiqio 阅读(94) 评论(0) 推荐(0)
摘要: 一、安装Spark 检查基础环境hadoop,jdk 2.下载spark 二、Python编程练习:英文文本的词频统计 1、准备文本(f1.txt) Please send this message to those people who mean something to you,to those 阅读全文
posted @ 2022-03-06 13:46 shiqiqio 阅读(32) 评论(0) 推荐(0)
摘要: 1.列举Hadoop生态的各个组件及其功能、以及各个组件之间的相互关系,以图呈现并加以文字描述。 hadoop生态系统的组件hdfs,mapreduce,hive,pig,zookeeper,hbase大家应该都比较熟了,这里简单总结一下其他不太常用的组件的作用。 Oozie Oozie是可扩展可伸 阅读全文
posted @ 2022-02-22 10:40 shiqiqio 阅读(160) 评论(0) 推荐(0)