2、Hadoop演进与Hadoop生态

1、

Apache

完全开源免费、社区活跃、文档资料详实

第三方发行版本(如CDH,HDP,MapR等)

比Apache Hadoop在兼容性、安全性、稳定性上有增强;运维简单

cloudera

对hadoop的升级,打包,开发了很多框架

Hortonworks

100%开 源的产品;为入门提 供了一个非常好的,易于使用的沙盒。

DKhadoop

集成了整个HADOOP生态系统的全部组件,并深度优化;极大的简化了集群的管理运维,增强了集群的高可用性、高可维护性、高稳定性。
   

2、                                                                              

                                                                                    

 

 HDFS(Hadoop分布式文件系统):是Hadoop体系中数据存储管理的基础。它是一个高度容错的系统,能检测和应对硬件故障,用于在低成本的通用硬件上运行。HDFS简化了文件的一致性模型,通过流式数据访问,提供高吞吐量应用程序数据访问功能,适合带有大型数据集的应用程序。

Mapreduce(分布式计算框架):MapReduce是一种计算模型,用以进行大数据量的计算。

Yarn(资源管理框架):在YARN中,资源管理由ResourceManager和NodeManager共同完成,其中,ResourceManager中的调度器负责资源的分配,而NodeManager则负责资源的供给和隔离。

Sqoop(数据同步工具):Sqoop是SQL-to-Hadoop的缩写,主要用于传统数据库和Hadoop之间传输数据。

Mahout(数据挖掘算法库):包含了聚类、分类、推荐引擎(协同过滤)和频繁集挖掘等广泛使用的数据挖掘方法。除了算法,Mahout还包含数据的输入/输出工具、与其他存储系统(如数据库、MongoDB 或Cassandra)集成等数据挖掘支持架构。

Hbase(分布式列存数据库):HBase是一个针对结构化数据的可伸缩、高可靠、高性能、分布式和面向列的动态模式数据库。

Zookeeper(分布式协作服务):Zookeeper是Chubby克隆版,主要解决分布式环境下的数据管理问题:统一命名,状态同步,集群管理,配置同步等。

Pig(基于Hadoop的数据流系统):将脚本转换为MapReduce任务在Hadoop上执行。通常用于进行离线分析。

Hive(基于Hadoop的数据仓库):由facebook开源,最初用于解决海量结构化的日志数据统计问题。Hive定义了一种类似SQL的查询语言(HQL),将SQL转化为MapReduce任务在Hadoop上执行。通常用于离线分析。

Flume(日志收集工具):Cloudera开源的日志收集系统,具有分布式、高可靠、高容错、易于定制和扩展的特点。

3、Hadoop的安装 https://www.cnblogs.com/Dcl-Snow/p/10825154.html

 



 

posted @ 2020-09-18 11:31  fangyujie  阅读(184)  评论(0)    收藏  举报