Hadoop集群配置以及java maven工程搭建

Hadoop配置

1.下载hadoop2.7.3
   http://hadoop.apache.org/releases.html
2.安装jdk
   官网下载
3. 配置java和Hadoop环境变量
 
      vi /etc/profile   将一下代码追加到/etc/profile文件末尾
 
#set java environment
JAVA_HOME=/usr/local/src/java/jdk1.8.0_101
CLASSPATH=.:$JAVA_HOME/lib.tools.jar
PATH=$JAVA_HOME/bin:$PATH
export JAVA_HOME CLASSPATH PATH
 
#config hadoop
export HADOOP_HOME=/usr/local/src/hadoop/
export PATH=$HADOOP_HOME/bin:$PATH
#hadoop logs file path
export HADOOP_LOG_DIR=${HADOOP_HOME}/logs

 

 
 
4.在Hadoop-env.sh需要手动配置jdk才能生效 
 
vi hadoop-env.sh
追加或修改:
export JAVA_HOME=/usr/local/src/java/jdk1.8.0_101
 
5.配置core-site.xml 的namenode和hdfs目录
 
vi core-site.xml
 
<configuration>
  <property>
        <name>fs.defaultFS</name>
        <value>hdfs://node1:9000</value>
    </property>
  <property>
        <name>hadoop.tmp.dir</name>
        <value>/usr/local/src/hadoop/tmp</value>
   </property>
</configuration>
 
6.配置hdfs-site.xml 数据副本 namenode和datanode存放的数据文件夹
 
<configuration>
    <property>
        <name>dfs.replication</name>
        <value>2</value>
    </property>
    <property>
        <name>dfs.namenode.name.dir</name>
        <value>file:/usr/local/src/hadoop/tmp/dfs/name</value>
    </property>
    <property>
         <name>dfs.datanode.data.dir</name>
         <value>file:/usr/local/src/hadoop/tmp/dfs/data</value>
    </property>
</configuration>

 

 
7.配置 mapred-site.xml
 
mv mapred-site.xml.template  mapred-site.xml
vi mapred-site.xml
 
<configuration>
   <property>
        <name>mapreduce.framework.name</name>
        <value>yarn</value>
   </property>
</configuration>
8.配置yarn-site.xml
 
<configuration>
 
<!-- Site specific YARN configuration properties -->
 
<property>
    <name>yarn.nodemanager.aux-services</name>
    <value>mapreduce_shuffle</value>
</property>
 
<property>
    <name>yarn.resourcemanager.address</name>
    <value>node1:8032</value>
  </property>
  <property>
    <name>yarn.resourcemanager.scheduler.address</name>
    <value>node1:8030</value>
  </property>
  <property>
    <name>yarn.resourcemanager.resource-tracker.address</name>
    <value>node1:8031</value>
  </property>
 
</configuration>
 
以上所有配置完 执行namenode格式化
 
hdfs namenode -format
9.执行hadoop自带的jar
 
解除namenode 安全模式
 
hadoop dfsadmin -safemode leave

 

运行hadoop自带的jar
hadoop jar /usr/local/src/hadoop/share/hadoop/mapreduce/hadoop-mapreduce-examples-2.7.3.jar wordcount /input /output
 
//hadoop运行jar流程
http://jingyan.baidu.com/album/ce09321b7a2e052bff858fd9.html?picindex=4
 
10.ssh免密码登录
 
- ssh-keygen -t rsa
- scp id_rsa.pub weekend01:home/hadoop
- touch authorized_keys
- cat 波浪线/id_rsa.pub >> authorized_keys
- cat authorized_keys
- chmod 600 authorized_keys 权限必须是600
- ssh node1 stop-yarn.sh
- cat /home/hadoop/id_rsa.pub >> authorized_keys

 

 
11.浏览器器访问hadoop服务
 
hadoop查看地址
http://192.168.22.131:50070/dfshealth.html#tab-datanode
http://192.168.22.131:50070/dfshealth.html#tab-datanode

 

12.搭建java hadoop maven工程pom.xml的配置
 
<project xmlns="http://maven.apache.org/POM/4.0.0" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://maven.apache.org/POM/4.0.0 http://maven.apache.org/xsd/maven-4.0.0.xsd">
  <modelVersion>4.0.0</modelVersion>
  <groupId>com.xiaot</groupId>
  <artifactId>bigdata</artifactId>
  <version>0.0.1-SNAPSHOT</version>
 
  <dependencies>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-common</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-hdfs</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-mapreduce-client-core</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-mapreduce-client-jobclient</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>org.apache.hadoop</groupId>
            <artifactId>hadoop-mapreduce-client-common</artifactId>
            <version>2.7.3</version>
        </dependency>
        <dependency>
            <groupId>jdk.tools</groupId>
            <artifactId>jdk.tools</artifactId>
            <version>1.7</version>
            <scope>system</scope>
            <systemPath>${JAVA_HOME}/lib/tools.jar</systemPath>
        </dependency>
   </dependencies>
</project>

 

 
 
 
Hdfs文件上传下载java demo
package bigdata;
import java.io.BufferedInputStream;
import java.io.FileInputStream;
import java.io.IOException;
import java.io.InputStream;
import java.io.OutputStream;
import java.net.URI;
import org.apache.commons.io.IOUtils;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.FileStatus;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.util.Progressable;
/**
 * 文件管理
 * @author xiaotian
 *
 */
public class FileManager {
  
    public FileSystem getFileSystem() throws Exception{
        Configuration conf = new Configuration();
        FileSystem dfs = FileSystem.get(new URI("hdfs//:node1:9000"), conf);
        return dfs;
    }
    /**
     * 上传文件
     * @param src
     * @param dst
     * @throws Exception
     */
    public static void uploadFile(String src,String dst) throws Exception{
        InputStream in = new BufferedInputStream(new FileInputStream(src));
        Configuration conf = new Configuration();
        FileSystem fs = FileSystem.get(URI.create(dst), conf,"root");
        OutputStream os = fs.create(new Path(dst), new Progressable() {
            
            public void progress() {
                System.out.print(".");
            }
        });
        IOUtils.copy(in, os);
        System.out.println("success");
    }
    /**
     * 删除文件
     * @param dst
     * @throws Exception
     */
    public static void deleteFile(String dst) throws Exception{
        Configuration conf = new Configuration();
        FileSystem fs = FileSystem.get(URI.create(dst), conf,"root");
        if(fs.exists(new Path(dst))){
            fs.delete(new Path(dst), true);
        }
    }
    /**
     * 下载
     * @param src
     * @param dst
     * @throws Exception
     */
    public static void downloadFile(String src,String dst) throws Exception{
        Configuration conf = new Configuration();
        FileSystem fs = FileSystem.get(URI.create(src), conf,"root");
        fs.copyToLocalFile(false,new Path(src), new Path(dst));
    }
    
    /**
     * 遍历文件夹及所有文件
     * @param dst
     * @throws Exception
     */
    public static void listFiles(String dst) throws Exception{
        Configuration conf = new Configuration();
        FileSystem dfs = FileSystem.get(URI.create(dst),conf,"root");
        FileStatus[] listStatus = dfs.listStatus(new Path(dst));
        for (FileStatus fileStatus : listStatus) {
            if(fileStatus.isDirectory()){
                System.out.println("dir:"+fileStatus.getPath().getName()+" owner:"+fileStatus.getOwner()+" Permission:"+fileStatus.getPermission());
                //System.out.println(fileStatus.getPath().toString());
                listFiles(fileStatus.getPath().toString());
            }else{
                System.out.println("file:"+fileStatus.getPath().getName()+" owner:"+fileStatus.getOwner()+" Permission:"+fileStatus.getPermission());
            }
        }
        
        
    }
    
    
    public static void main(String[] args) throws Exception {
        String src = "D:\\jdk-8u101-linux-x64.tar.gz";
        String dst = "hdfs://node1:9000/jdk.tar.gz";
        //上传文件
        //uploadFile(src,dst);
        //deleteFile
        //deleteFile(dst);
         //dst = "D:\\test\\jdk-8u101-linux-x64.tar.gz";
         //src = "hdfs://node1:9000/jdk.tar.gz";
         //downloadFile(src,dst);
         dst = "hdfs://node1:9000/";
         listFiles(dst);
    }
    
}

 

下载程序会出现问题
 
 (null) entry in command string: null chmod 0644
 解决方案:
 
eclipse 中运行 Hadoop2.7.3 map reduce程序 出现错误(null) entry in command string: null chmod 0700
发表: 2016-09-27 浏览: 667
 
环境:windows
 
Hadoop版本:hadoop2.7.3
 
开发工具:eclispe-hadoop-plugin
 
运行map reduce任务报错:
 
(null) entry in command string: null chmod 0700
 
解决办法:
 
在https://github.com/SweetInk/hadoop-common-2.7.1-bin
 
中下载winutils.exe,libwinutils.lib 拷贝到%HADOOP_HOME%\bin目录 。
 
再次执行程序,报错:
 
Exception in thread "main" java.lang.UnsatisfiedLinkError: org.apache.hadoop.io.nativeio.NativeIO$Windows.access0(Ljava/lang/String;I)Z
      at org.apache.hadoop.io.nativeio.NativeIO$Windows.access0(Native Method)
    at org.apache.hadoop.io.nativeio.NativeIO$Windows.access(NativeIO.java:609)
      at org.apache.hadoop.fs.FileUtil.canRead(FileUtil.java:977)
      at org.apache.hadoop.util.DiskChecker.checkAccessByFileMethods(DiskChecker.java:187)
      at org.apache.hadoop.util.DiskChecker.checkDirAccess(DiskChecker.java:174)
        at org.apache.hadoop.util.DiskChecker.checkDir(DiskChecker.java:108)
      at org.apache.hadoop.fs.LocalDirAllocator$AllocatorPerContext.confChanged(LocalDirAllocator.java:285)
    at org.apache.hadoop.fs.LocalDirAllocator$AllocatorPerContext.getLocalPathForWrite(LocalDirAllocator.java:344)
    at org.apache.hadoop.fs.LocalDirAllocator.getLocalPathForWrite(LocalDirAllocator.java:150)
        at org.apache.hadoop.fs.LocalDirAllocator.getLocalPathForWrite(LocalDirAllocator.java:131)
        at org.apache.hadoop.fs.LocalDirAllocator.getLocalPathForWrite(LocalDirAllocator.java:115)
        at org.apache.hadoop.mapred.LocalDistributedCacheManager.setup(LocalDistributedCacheManager.java:125)
    at org.apache.hadoop.mapred.LocalJobRunner$Job.<init>(LocalJobRunner.java:163)
      at org.apache.hadoop.mapred.LocalJobRunner.submitJob(LocalJobRunner.java:731)
    at org.apache.hadoop.mapreduce.JobSubmitter.submitJobInternal(JobSubmitter.java:240)
      at org.apache.hadoop.mapreduce.Job$10.run(Job.java:1290)
        at org.apache.hadoop.mapreduce.Job$10.run(Job.java:1287)
        at java.security.AccessController.doPrivileged(Native Method)
      at javax.security.auth.Subject.doAs(Subject.java:422)
    at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1698)
  at org.apache.hadoop.mapreduce.Job.submit(Job.java:1287)
  at org.apache.hadoop.mapreduce.Job.waitForCompletion(Job.java:1308)
      at com.jack.hadoop.temperature.MinTemperature.main(MinTemperature.java:37)
 
在https://github.com/SweetInk/hadoop-common-2.7.1-bin中下载hadoop.dll,并拷贝到c:\windows\system32目录中。
 
执行map reduce程序, 正常。
 
注意:程序中的路径都要写windows文件系统中的路径了,不再是hdfs中的路径。

 

 Hadoop运行jar文件 以及查看运行结果
 
hadoop手动上传文件到指定目录
hadoop fs -put /usr/local/wc.txt /input
hadoop jar /usr/local/src/doc/wc.jar bigdata.WordCountRun /input/wc.txt /output/wc hadoop fs -cat /output/qq1/part-r-00000

 

 
 
posted @ 2016-12-01 16:50  霄九天  阅读(746)  评论(0)    收藏  举报