Hadoop day1

Hadoop就是存储海量数据和分析海量数据的工具

1.概念

Hadoop是由java语言编写的,在分布式服务器集群上存储海量数据并运行分布式分析应用的开源框架,其核心部件是HDFS与MapReduce。

        HDFS是一个分布式文件系统:引入存放文件元数据信息的服务器Namenode和实际存放数据的服务器Datanode,对数据进行分布式储存和读取。

    HDFS是Master和Slave的主从结构。主要由Name-Node、Secondary NameNode、DataNode构成。

    总之:HDFS:一个分布式的,有冗余备份的,可以动态扩展的用来存储大规模数据的大硬盘

  MapReduce是一个计算框架:MapReduce的核心思想是把计算任务分配给集群内的服务器里执行。通过对计算任务的拆分(Map计算/Reduce计算)再根据任务调度器(JobTracker)对任务进行分布式计算。

            总之:MapReduce相当于一个计算引擎,按照MapReduce的规则--------编写Map计算/Reduce计算的程序,可以完成计算任务

 

2.作用

      大数据存储:分布式存储

    日志处理:擅长日志分析

    ETL:数据抽取到oracle、mysql、DB2、mongdb及主流数据库

    机器学习: 比如Apache Mahout项目

    搜索引擎:Hadoop + lucene实现

    数据挖掘:目前比较流行的广告推荐,个性化广告推荐

    Hadoop是专为离线和大规模数据分析而设计的,并不适合那种对几个记录随机读写的在线事务处理模式。

实际应用:

    1)Flume+Logstash+Kafka+Spark Streaming进行实时日志处理分析

3.优缺点

优点

1、支持超大文件。HDFS存储的文件可以支持TB和PB级别的数据。

2、检测和快速应对硬件故障。数据备份机制,NameNode通过心跳机制来检测DataNode是否还存在。

3、高扩展性。可建构在廉价机上,实现线性(横向)扩展,当集群增加新节点之后,NameNode也可以感知,将数据分发和备份到相应的节点上。

4、成熟的生态圈。借助开源的力量,围绕Hadoop衍生的一些小工具。

缺点

1、不能做到低延迟。高数据吞吐量做了优化,牺牲了获取数据的延迟。

2、不适合大量的小文件存储。

3、文件修改效率低。HDFS适合一次写入,多次读取的场景。

 

 

 

 

 

 

 

 

 



posted @ 2021-08-18 16:02  狂哲  阅读(28)  评论(0编辑  收藏  举报