大数据技术--hadoop单机安装和伪分布式安装
说明:以下是大数据平台hadoop的单机安装和伪分布式安装,在我们平常的学习中,伪分布式安装已经够用了。当然,在企业中那就要构建Hadoop集群了。
实验工具 {
虚拟机:VMware workstation full 15.02
系统:ubuntu 16.04
(注:1.Ubuntu是轻量级的系统,建议使用
2.若机器比较老,内存没有达到4GB,需下载32位的系统,或可以考虑在电脑安装双系统,不使用虚拟机,那样比较顺畅)
Hadoop版本:hadoop-2.7.1.tar.gz(注:下载的时候注意它们都是以 .tar.gz 结尾的,以下不再重复说明)
Java环境:jdk-8u162-linux-x64.tar.gz
}
(注:这些软件工具都可以在Linux的火狐浏览器中下载。若下载到windows中,发现无法拖入Linux,则可输入以下两条命令解决)
sudo apt-get autoremove open-vm-tools #移除系统原来的虚拟工具条open-vm-tools
sudo apt-get install open-vm-tools-desktop #安装桌面版的虚拟工具条
实验步骤 {
1.1 创建Hadoop用户
sudo useradd -m hadoop -s /bin/bash
1.2 为Hadoop用户设置密码(输入密码时,密码的位数等任何信息都不会显示出来,别以为是卡机了!若习惯用小键盘,在设置密码的时候注意查看小键盘是否开启)
sudo passwd hadoop
1.3 为用户添加管理员权限,方便部署
sudo adduser hadoop sudo
在做完这些操作之后,就可注销现在登陆的用户,使用Hadoop新用户
2.1 更新apt (安装软件的时候我们用apt安装,若不更新可能无法下载。若更新出现一些错误,也不影响Hadoop的安装)
sudo apt-get update
2.2 用 apt 安装 vim (以后修改或者增加一些配置文件都会用到 vim)
sudo apt-get install vim
2.3 安装 SSH,配置 SSH无密登陆 (节点之间交互时,每次都输入太麻烦,SSH无密登陆可以解决这一点)
sudo apt-get install openssh-server
ssh localhost #安装完后可以使用本条命令登陆本机,随后输入yes即可
2.4 利用 ssh-keygen 生成密匙 并加入到授权中
exit # 退出刚才的 ssh localhost cd ~/.ssh/ # 若没有该目录,请先执行一次ssh localhost ssh-keygen -t rsa # 会有提示,都按回车就可以 cat ./id_rsa.pub >> ./authorized_keys # 加入授权 ssh localhost #再执行一次,就可实现免密登陆了
3.1 安装Java环境
cd /usr/lib sudo mkdir jvm #创建/usr/lib/jvm目录用来存放JDK文件 cd ~ #进入hadoop用户的主目录 cd Downloads #这里是已经把jdk软件拖到了此目录下,若无法拖动,请执行文章开始的那两条命令
sudo tar -zxvf ./jdk-8u162-linux-x64.tar.gz -C /usr/lib/jvm #把JDK文件解压到/usr/lib/jvm目录下
#下面两行代码是查看刚才减压目录
cd /usr/lib/jvm
ls
3.2 设置环境变量
cd ~ vim ~/.bashrc #这是配置环境变量的文件
#在文件中添加以下几行内容
export JAVA_HOME=/usr/lib/jvm/jdk1.8.0_162 export JRE_HOME=${JAVA_HOME}/jre export CLASSPATH=.:${JAVA_HOME}/lib:${JRE_HOME}/lib export PATH=${JAVA_HOME}/bin:$PATH
# 添加以后保存退出(esc + :wq),然后输入下面的命令使配置生
source ~/.bashrc
# 输入以下命令,查看Java是否安装成功,成功则会出现版本号
java -version
4.1 单机安装Hadoop
sudo tar -zxf ~/Downloads/hadoop-2.7.1.tar.gz -C /usr/local # 解压到/usr/local中
cd /usr/local/
sudo mv ./hadoop-2.7.1/ ./hadoop # 将文件夹名改为hadoop,方便以后使用 sudo chown -R hadoop ./hadoop # 修改文件权限
#使用下面命令可以查看Hadoop的版本
cd /usr/local/hadoop
./bin/hadoop version #这里使用到了相对路径,表示当前文件夹下的文件
以上就完成了Hadoop的单机安装,接着我们进行伪分布式安装
4.2 伪分布式安装Hadoop
伪分布式安装需要修改两个配置文件 core.site.xml 和 hdfs.site.xml (这两个配置文件都位于/usr/local/hadoop/etc/hadoop中,例如 vim /usr/local/hadoop/etc/hadoop/core.site.xml 直接修改,另一个配置文件也是一样的操作)
core.site.xml
1.<configuration> 2. <property> 3. <name>hadoop.tmp.dir</name> 4. <value>file:/usr/local/hadoop/tmp</value> 5. <description>Abase for other temporary directories.</description> 6. </property> 7. <property> 8. <name>fs.defaultFS</name> 9. <value>hdfs://localhost:9000</value> 10. </property> 11.</configuration>
hdfs.site.xml
1.<configuration> 2. <property> 3. <name>dfs.replication</name> 4. <value>1</value> 5. </property> 6. <property> 7. <name>dfs.namenode.name.dir</name> 8. <value>file:/usr/local/hadoop/tmp/dfs/name</value> 9. </property> 10. <property> 11. <name>dfs.datanode.data.dir</name> 12. <value>file:/usr/local/hadoop/tmp/dfs/data</value> 13. </property> 14.</configuration>
配置完成后则可执行namenode格式化:
cd /usr/local/hadoop
./bin/hdfs namenode -format
下面就可以开启namenode和datanode守护进程
cd /usr/local/hadoop ./sbin/start-dfs.sh
使用用命令 jps ,则可以查看到当前进程,出现NameNode,SecondaryNameNode,DataNode则表示安装成功,若无法启动,那就只有去百度了,办法总比问题多
附:若每次启动都切换到文件所在目录下,会显得有点麻烦,配置PATH后会就不用切换到文件所在目录
vim ~/.bashrc # 把下面的一行添加到环境变量中 export PATH=$PATH:/usr/local/hadoop/sbin:/usr/local/hadoop/bin # 使配置文件生效 source ~/.bashrc start-dfs.sh #这样就可不到文件所在目录下启动它了,也可以使用 start-all.sh 开启
参考资料

浙公网安备 33010602011771号