随笔分类 - Hadoop
hadoop学习笔记。
摘要:1、在core-site.xml中配置 <property> <name>hadoop.proxyuser.root.groups</name> <value>root</value> </property> <property> <name>hadoop.proxyuser.root.hosts<
阅读全文
摘要:1剖析MapReduce作业运行机制1.1作业的提交客户端通过JobClient.runJob()来提交一个作业到jobtracker,JobClient程序逻辑如下:a)向Jobtracker请求一个新的jobid(JobTracker.getNewJobId());b)检查作业的输出说明,如已存...
阅读全文
摘要:MapOutputBuffer顾名思义就是Map输出结果的一个Buffer,用户在编写map方法的时候有一个参数OutputCollector:1 void map(K1 key, V1 value, OutputCollector output, Reporter reporter) throw...
阅读全文
摘要:今天想linux下安装java,然后就使用wget来下载jdk1.7,结果老是报错,大概意思是cookie有问题。如下图:然后网上看了一下,下面的地址可以下载:wget --no-cookies --no-check-certificate --header "Cookie:gpw_e24=http...
阅读全文
摘要:背景随着集群规模和负载增加,MapReduce JobTracker在内存消耗,线程模型和扩展性/可靠性/性能方面暴露出了缺点,为此需要对它进行大整修。需求当我们对Hadoop MapReduce框架进行改进时,需要时刻谨记的一个重要原则是用户的需求。近几年来,从Hadoop用户那里总结出MapRe...
阅读全文
摘要:YARN/MRv2是下一代MapReduce框架(见Hadoop-0.23.0),该框架完全不同于当前的MapReduce框架,它在扩展性,容错性和通用性等方面更出色,据统计,Yarn有超过150000行代码,完全是重写编写的。本文介绍了YARN/MRv2中基本术语的含义,帮助有兴趣的程序员们对YA...
阅读全文
摘要:InputFormat 负责处理MR的输入部分。有三个作用:一、验证作业的输入是否规范.二、把输入文件切分成InputSplit.三、提供RecordReader 的实现类,把InputSplit读到Mapper中进行处理.◆ 在执行mapreduce之前,原始数据被分割成若干split,每个spl...
阅读全文
摘要:关于使用java api上传文件。 在定义一个FileSystem变量的时候伪分布式和单机版的方法是不一样的,单机版使用的是FileSystem类的静态函数FileSystem hdfs = FileSystem.get(conf)伪分布式下需要使用Path来获得Path dstDir = new ...
阅读全文

浙公网安备 33010602011771号