work hard work smart

专注于AI+Java后端开发。 不断总结,举一反三。
  博客园  :: 首页  :: 新随笔  :: 联系 :: 订阅 订阅  :: 管理

hadoop集群安装

Posted on 2026-03-13 15:27  work hard work smart  阅读(25)  评论(0)    收藏  举报

hadoop集群安装

官网下载地址:https://archive.apache.org/dist/hadoop/common/hadoop-3.2.0/hadoop-3.2.0.tar.gz

因为下载的速度比较慢,可以从https://mirrors.tuna.tsinghua.edu.cn/apache/hadoop/common/下载对应的版本,如果没有版本,建议还是从官网下载

一、服务器规划

准备三台linux服务器,centos 7, 安装1主2从

  IP地址 安装 hostname
服务器1 192.168.127.163 DameNode,Secondary namenode, Recource Manager bigdata1
服务器2 192.168.127.164 DataNode,  Node Manager bigdata2
服务器3 192.168.127.165 DataNode,  Node Manager bigdata3

 

 

 

 

二、环境准备

分別修改每台服务器的配置

2.1 配置hostname

hostname bigdata1

vi /etc/hostname

 2.2 关闭防火墙

service iptables stop

systemctl disable iptables

2.3 免密登录

在bigdata1上生成公钥和私钥

ssh-keygen -t rsa

一路回车

cat ~/.ssh/id_rsa.pub   >> ~/.ssh/authorized_keys

 

然后将公钥拷贝到bigdata2和bigdata3

scp ~/.ssh/authorized_keys  bigdata2:~/.ssh/

scp ~/.ssh/authorized_keys  bigdata3:~/.ssh/

 

2.4 jdk安装

jdk版本: jdk-8u211-linux-x64.tar.gz

解压到 /data/software/jdk1.8

配置环境变量

vi /etc/profile 末尾增加如下配置

export JAVA_HOME=/data/software/jdk1.8
export PATH=.:$JAVA_HOME/bin:$PATH

使配置生效

source /etc/profile

确认java版本  java -version

 

2.5 host配置

vi /etc/hosts

192.168.127.163 bigdata1
192.168.127.164 bigdata2
192.168.127.165 bigdata3

 

2.6 同步时间

yum install -y ntpdate

[root@bigdata1 network-scripts]# ntpdate
13 Mar 21:13:58 ntpdate[12255]: no servers can be used, exiting

 

同步时间的指令

ntpdate -u ntp.sjtu.edu.cn

 

定时任务 每分钟执行1次

vi /etc/crontab 

* * * * * root   /sbin/ntpdate -u ntpdate -u ntp.sjtu.edu.cn

 

 

 

 

 

 

三、hadoop安装

1、解压安装包

将hadoop安装包解压到/data/software路径下

 

2、修改hadoop-env.sh配置

/data/software/hadoop-3.2.0/etc/hadoop/hadoop-env.sh

增加配置

export JAVA_HOME=/data/software/jdk1.8

export HADOOP_LOG_DIR=/data/hadoop_repo/logs/hadoop

 

HADOOP_LOG_DIR日志文件路径

 

3、修改core-site配置

 vi /data/software/hadoop-3.2.0/etc/hadoop/core-site.xml

<configuration>
    <property>
        <name>hadoop.tmp.dir</name> #hadoop运行时产生临时数据的存储目录 
        <value>/data/hadoop_repo/tmp</value> #该目录的地址
    </property>
    <property>
        <name>fs.defaultFS</name> #默认
        <value>hdfs://bigdata1:9000</value> #hdfs的api接口,
    </property>
</configuration>

  

 

4、修改hdfs-site.xml 配置

 vi /data/software/hadoop-3.2.0/etc/hadoop/hdfs-site.xml

<configuration>
    <property>
        <name>dfs.namenode.name.secondary.http-address</name>
        <value>bigdata1:50090</value>
    </property>
    <property>
        <name>dfs.replication</name> #设置副本个数
        <value>2</value>
    </property>
</configuration>

  

5、修改mapred-site.xml 配置

vi /data/software/hadoop-3.2.0/etc/hadoop/mapred-site.xml

<configuration>
    <property>
        <name>mapreduce.framework.name</name>
        <value>yarn</value>
    </property>
</configuration>

  

6、修改yarn-site.xml配置

vi /data/software/hadoop-3.2.0/etc/hadoop/yarn-site.xml

<configuration>
  <!-- Site specific YARN configuration properties -->
      <property>
          <name>yarn.nodemanager.aux-services</name>
          <value>mapreduce_shuffle</value> #reducer获取数据的方式
      </property>
      <property>
          <name>yarn.resourcemanager.hostname</name>
          <value>bigdata1</value>#指定yarn的老大的地址
      </property>
  </configuration>

  


7、指定从节点

vi /data/software/hadoop-3.2.0/etc/hadoop/workers

bigdata2
bigdata3

 

8、修改start-dfs.sh、stop-dfs.sh配置

 

vi /data/software/hadoop-3.2.0/sbin/start-dfs.sh 

vi /data/software/hadoop-3.2.0/sbin/stop-dfs.sh

在sh脚本开始的地方

HDFS_DATANODE_USER=root
HDFS_DATANODE_SECURE_USER=hdfs
HDFS_NAMENODE_USER=root
HDFS_SECONDARYNAMENODE_USER=root

  

9、修改start-yarn.sh、stop-yarn.sh配置

 vi /data/software/hadoop-3.2.0/sbin/start-yarn.sh

 vi /data/software/hadoop-3.2.0/sbin/stop-yarn.sh

YARN_RESOURCEMANAGER_USER=root
HADOOP_SECURE_DN_USER=yarn
YARN_NODEMANAGER_USER=root

到此,所有配置都好了。

10、拷贝配置好的hadoop文件到bigdata2和bigdata3

cd /data/software
将配置完的hadoop拷贝到另外两台
scp -rq hadoop-3.2.0 bigdata2:/data/software
scp -rq hadoop-3.2.0 bigdata3:/data/software

所有三台的配置都是一样的

11、bigdata1节点格式化

cd /data/software/hadoop-3.2.0
bin/hdfs namenode -format

 

12、启动hadoop

格式化成功后,启动

sbin/start-all.sh

查看进程

 查看两个从节点

bigdata2

 bitdata3

 

这样整个集群就安装成功了

 

13、停止hadoop

sbin/stop-all.sh