代码改变世界

hadoop note2 自己的一些总结

2016-05-03 11:00  Qin奋  阅读(129)  评论(0)    收藏  举报

1. Hadoop 是一个体系架构,是Lucene 项目为了解决搜索倒排算法(海量数据计算)创造的。

  架构里有:MapReduce 负责并行计算

       HDFS 负责集群的文件存储

       Hbase 负责数据存储

      ...... 等等

   在分布式计算和存储方面,都有使用主/从(Master/Slave) 架构。

   (实战hadoop p4)

   在一个配置完整的集群上要让hadoop跑起来要运行一系列后台程序:NameNode, dataNode, SecondaryNameNode(Master)| JobTracker, TaskTracker(Slave)

   配置:hadoop-env.sh,core-site.xml?.hdfs-site.xml?mapred-site.xml?

 

2.MapReduce:

  MapReduce中, 准备提交运行的应用程序叫 job, 从Job划分出去在各个节点中运行的交task

3.HDFS:

  NameNode: 管理文件系统元数据,记录数据块在dataNode上的位置和副本

    dataNode:  存储实际数据