Spark环境搭建
一、Java安装
1、安装目录准备
在安装这些包之前在家目录下创建一个app的目录,app目录中创建一个tmp目录:
[root@hadoop-master ~]# mkdir -p app/tmp
2、解压JDK
上传JDK1.8版本 jdk-8u74-linux-x64.tar.gz到linux上,并且将其解压到app目录下:
[root@hadoop-master ~]# tar -xzvf jdk-8u74-linux-x64.tar.gz -C ~/app
3、配置全局变量
将解压后的Java路径配置到全局变量中:
vim /etc/profile
export JAVA_HOME=/root/app/jdk1.8.0_74
export PATH=$PATH:$JAVA_HOME/bin
通过source /etc/profile使文件立即生效。
4、测试
[root@hadoop-master ~]# java -version java version "1.8.0_74" Java(TM) SE Runtime Environment (build 1.8.0_74-b02) Java HotSpot(TM) 64-Bit Server VM (build 25.74-b02, mixed mode)
二、scala安装
这与上面的是一样的进行解压到app目录中、然后进行全局配置:
#解压 [root@hadoop-master software]# tar -xzvf scala-2.11.8.tgz -C ~/app #配置全局环境变量 export SCALA_HOME=/root/app/scala-2.11.8 export PATH=$PATH:$JAVA_HOME/bin:$SCALA_HOME/bin: #立即生效 source /etc/profile
三、hadoop安装
1、全局变量配置
#解压 [root@hadoop-master software]# tar -xzvf hadoop-2.6.1.tar.gz -C ~/app #全局配置变量 export HADOOP_HOME=/root/app/hadoop-2.6.1 export PATH=$PATH:$JAVA_HOME/bin:$HADOOP_HOME/bin:$SCALA_HOME/bin #立即生效 source /etc/profile
2、hadoop-env.sh
在刚解压的hadoop的如下目录:/root/app/hadoop-2.6.1/etc/hadoop
修改JAVA_HOME的目录:
# The java implementation to use. #export JAVA_HOME=${JAVA_HOME} export JAVA_HOME=/root/app/jdk1.8.0_74
3、core-site.xml
#配置namenode信息 <configuration> <property> <name>fs.default.name</name> <value>hdfs://hadoop-master:8020</value> </property> </configuration>
4、hdfs-site.xml
<configuration> <property> <name>dfs.namenode.name.dir</name> <value>/root/app/tmp/dfs/name</value> </property> <property> <name>dfs.datanode.data.dir</name> <value>/root/app/tmp/dfs/data</value> </property> <property> <name>dfs.replication</name> <value>1</value> </property> </configuration>
5、mapred-site.xml
配置yarn相关的,请通过mapred-site.xml.template自行拷贝一份mapred-site.xml。
<!-- Put site-specific property overrides in this file. --> <configuration> <property> <name>mapreduce.framework.name</name> <value>yarn</value> </property> </configuration>
6、 yarn-site.xml
<configuration> <!-- Site specific YARN configuration properties --> <property> <name>>yarn.nodemanager.aux-services</name> <value>mapreduce_shuffle</value> </property> </configuration>
7、格式化
进入到hadoop下的bin目录:
[root@hadoop-master bin]# ./hadoop namenode -format
此时可以看到配置的~/apptmp目录下已经有东西了,证明格式化成功。
8、启动dfs
进入到hadoop下的sbin目录下:
[root@hadoop-master sbin]# ./start-dfs.sh
[root@hadoop-master sbin]# jps 89493 Jps 86516 DataNode 86902 SecondaryNameNode 86217 NameNode
9、测试hadoop
(1)查看hdfs
[root@hadoop-master sbin]# hadoop fs -ls /
目前hdfs上没有任何东西,可以创建一个文件夹:
[root@hadoop-master sbin]# hadoop fs -mkdir /test [root@hadoop-master sbin]# hadoop fs -ls / Found 1 items drwxr-xr-x - root supergroup 0 2020-04-01 23:04 /test
(2)上传文件
上传一个文件到hdfs上进行测试:
[root@hadoop-master hadoop-2.6.1]# hadoop fs -put README.txt /test [root@hadoop-master hadoop-2.6.1]# hadoop fs -ls /test Found 1 items -rw-r--r-- 1 root supergroup 1366 2020-04-01 23:06 /test/README.txt
[root@hadoop-master hadoop-2.6.1]# hadoop fs -text /test/README.txt
另外可以通过浏览器来访问文件系统,访问端口50070即可。
10、启动yarn
进入hadoop中的sbin目录:
[root@hadoop-master sbin]# ./start-yarn.sh
[root@hadoop-master sbin]# jps 86516 DataNode 86902 SecondaryNameNode 117286 NodeManager 86217 NameNode #启动 117081 ResourceManager #启动 117625 Jps
通过浏览器的8088端口可进行访问。
四、Python安装
可参考:https://www.cnblogs.com/knighterrant/p/10719887.html
五、spark安装
这里使用的是已经编译好的spark,如果自己进行编译,需要安装Maven并且进行编译,详情可参考官网。
Maven是用于编译spark源码的: #解压 [root@hadoop-master software]# tar -xzvf apache-maven-3.3.9-bin.tar.gz -C ~/app #配置全局变量 export MAVEN_HOME=/root/app/apache-maven-3.3.9 export PATH=$PATH:$JAVA_HOME/bin:$HADOOP_HOME/bin:$SCALA_HOME/bin:$MAVEN_HOME/bin #立即生效 [root@hadoop-master apache-maven-3.3.9]# source /etc/profile 另外,可以修改一下maven下载包的位置: vim /root/app/apache-maven-3.3.9/conf/settings.xml ... <!-- localRepository | The path to the local repository maven will use to store artifacts. | | Default: ${user.home}/.m2/repository <localRepository>/path/to/local/repo</localRepository> --> <localRepository>/root/maven_repository</localRepository> #设置本地下载的位置 ... Maven
#解压 [root@hadoop-master software]# tar -xzvf spark-2.0.2-bin-hadoop2.6.tgz -C /root/app/ #启动spark,进入/root/app/spark-2.0.2-bin-hadoop2.6/bin [root@hadoop-master bin]# ./spark-shell ... Welcome to ____ __ / __/__ ___ _____/ /__ _\ \/ _ \/ _ `/ __/ '_/ /___/ .__/\_,_/_/ /_/\_\ version 2.0.2 /_/ Using Scala version 2.11.8 (Java HotSpot(TM) 64-Bit Server VM, Java 1.8.0_74) Type in expressions to have them evaluated. Type :help for more information. scala>
spark全局配置:
export SPARK_HOME=/root/app/spark-2.0.2-bin-hadoop2.6
export PATH=$PATH:$SPARK_HOME/bin
作者:iveBoy
本文版权归作者和博客园共有,欢迎转载,但未经作者同意必须在文章页面给出原文连接,否则保留追究法律责任的权利。


浙公网安备 33010602011771号