3risan

2021年6月7日

摘要： https://www.cnblogs.com/qq502414581/p/14856876.html 补09 spark连接mysql数据库原因：没注意好时间，忘记提交 https://www.cnblogs.com/qq502414581/p/14494812.html 补01 大数据概述原阅读全文

posted @ 2021-06-07 00:14 3risan 阅读(41) 评论(0) 推荐(0)

2021年6月6日

09 spark连接mysql数据库

摘要： 1.安装启动检查Mysql服务。netstat -tunlp (3306) 2.spark 连接mysql驱动程序。–cp /usr/local/hive/lib/mysql-connector-java-5.1.40-bin.jar /usr/local/spark/jars 3.启动 Mysql 阅读全文

posted @ 2021-06-06 23:32 3risan 阅读(29) 评论(0) 推荐(0)

2021年5月26日

08 学生课程分数的Spark SQL分析

摘要：读学生课程分数文件chapter4-data01.txt，创建DataFrame。一、用DataFrame的操作完成以下数据分析要求每个分数+5分。总共有多少学生？总共开设了哪些课程？每个学生选修了多少门课？每门课程有多少个学生选？每门课程大于95分的学生人数？ Tom选修了几门课？每阅读全文

posted @ 2021-05-26 23:19 3risan 阅读(48) 评论(0) 推荐(0)

2021年5月10日

06 Spark SQL 及其DataFrame的基本操作

摘要： 1.Spark SQL出现的原因是什么? 随着Spark的发展，对于野心勃勃的Spark团队来说，Shark对于Hive的太多依赖（如采用Hive的语法解析器、查询优化器等等），制约了Spark的One Stack Rule Them All的既定方针，制约了Spark各个组件的相互集成，所以提出阅读全文

posted @ 2021-05-10 14:41 3risan 阅读(91) 评论(0) 推荐(0)

2021年4月12日

06 RDD编程

摘要：总共有多少学生？map(), distinct(), count() 开设了多少门课程？每个学生选修了多少门课？map().countByValue() //map(), countByKey() 每门课程有多少个学生选？map(), countByValue() Tom选修了几门课？每门课多少分阅读全文

posted @ 2021-04-12 21:23 3risan 阅读(36) 评论(0) 推荐(0)

2021年4月4日

05 RDD练习：词频统计，学习课程分数

摘要：一、词频统计： 1.读文本文件生成RDD lines 2.将一行一行的文本分割成单词 words flatmap() 3.全部转换为小写 lower() 4.去掉长度小于3的单词 filter() 5.去掉停用词 6.转换成键值对 map() 7.统计词频 reduceByKey() 二、学生课程分阅读全文

posted @ 2021-04-04 22:08 3risan 阅读(43) 评论(0) 推荐(0)

2021年3月31日

04 RDD编程练习

摘要：一、filter,map,flatmap练习： 1.读文本文件生成RDD lines 2.将一行一行的文本分割成单词 words 3.全部转换为小写 4.去掉长度小于3的单词 5.去掉停用词 6.练习一的生成单词键值对阅读全文

posted @ 2021-03-31 21:06 3risan 阅读(25) 评论(0) 推荐(0)

2021年3月28日

03 Spark RDD编程基础

摘要： 1. 准备文本文件从文件创建RDD lines=sc.textFile()筛选出含某个单词的行 lines.filter()lambda 参数：条件表达式 2. 生成单词的列表从列表创建RDD words=sc.parallelize()筛选出长度大于2 的单词 words.filter() 阅读全文

posted @ 2021-03-28 19:59 3risan 阅读(63) 评论(0) 推荐(0)

2021年3月13日

02 Spark架构与运行流程

摘要： 1. 为什么要引入Yarn和Spark。从开源角度看，YARN的提出，从一定程度上弱化了多计算框架的优劣之争。YARN是在Hadoop MapReduce基础上演化而来的，在MapReduce时代，很多人批评MapReduce不适合迭代计算和流失计算，于是出现了Spark和Storm等计算框架，而阅读全文

posted @ 2021-03-13 20:55 3risan 阅读(69) 评论(0) 推荐(0)

2021年3月7日

大数据概述

摘要： 1.用图表描述Hadoop生态系统的各个组件及其关系。 2.阐述Hadoop生态系统中，HDFS, MapReduce, Yarn, Hbase及Spark的相互关系。 HDFS（Hadoop分布式文件系统）源自于Google的GFS论文，发表于2003年10月，HDFS是GFS的实现版。HDFS是阅读全文

posted @ 2021-03-07 15:24 3risan 阅读(35) 评论(0) 推荐(1)

公告