03 2022 档案
摘要:一、 RDD创建 1.从本地文件系统中加载数据创建RDD 2.从HDFS加载数据创建RDD 启动hdfs 上传文件 查看文件 加载 停止hdfs 3.通过并行集合(列表)创建RDD 输入列表、字符串、numpy生成数组 二、 RDD操作 转换操作 1.filter(func) 显式定义函数 lamb
阅读全文
摘要:1.Spark已打造出结构一体化、功能多样化的大数据生态系统,请用图文阐述Spark生态系统的组成及各组件的功能。 通过上图可以看出,Spark生态系统主要包含Spark Core、Spark SQL、Spark Streaming、MLlib、GraphX以及独立调度器。 Spark Core:S
阅读全文
摘要:一、下载spark 1.检查基础环境hadoop,jdk 2.解压,文件夹重命名、权限 3.配置文件 4.环境变量 5.试运行python代码 二、Python编程练习:英文文本的词频统计 1.准备文档,在百度复制一篇英语文章 在wc.py中编写代码 path='/home/hadoop/wc/ff
阅读全文

浙公网安备 33010602011771号