03 2022 档案
摘要:一、 RDD创建 1.从本地文件系统中加载数据创建RDD 2.从HDFS加载数据创建RDD (1)启动hdfs (2)上传文件 (3)查看文件 (4)加载 (5)停止hdfs 3.通过并行集合(列表)创建RDD (1)输入列表、字符串、生成数组 二、 RDD操作 转换操作 1.filter(func
阅读全文
摘要:1.Spark生态系统 Spark已打造出结构一体化、功能多样化的大数据生态系统,请用图文阐述Spark生态系统的组成及各组件的功能 Spark生态圈以Spark Core为核心,从HDFS、Hive、HBase和Hadoop等s数据源读取数据,以MESOS、YARN和自身携带的Standalone
阅读全文
摘要:一、安装Spark 检查基础环境hadoop,jdk 2.下载spark 3.配置文件 配置环境 vim /usr/local/spark/conf/spark-env.sh 修改环境变量 vim ~/.bashrc 生效 source ~/.bashrc 4.试运行Python代码 二、Pytho
阅读全文

浙公网安备 33010602011771号