2、Hadoop演进与Hadoop生态
1、
Apache |
完全开源免费、社区活跃、文档资料详实 |
第三方发行版本(如CDH,HDP,MapR等) |
比Apache Hadoop在兼容性、安全性、稳定性上有增强;运维简单 |
cloudera |
对hadoop的升级,打包,开发了很多框架 |
Hortonworks |
100%开 源的产品;为入门提 供了一个非常好的,易于使用的沙盒。 |
DKhadoop |
集成了整个HADOOP生态系统的全部组件,并深度优化;极大的简化了集群的管理运维,增强了集群的高可用性、高可维护性、高稳定性。 |
2、

HDFS(Hadoop分布式文件系统):是Hadoop体系中数据存储管理的基础。它是一个高度容错的系统,能检测和应对硬件故障,用于在低成本的通用硬件上运行。HDFS简化了文件的一致性模型,通过流式数据访问,提供高吞吐量应用程序数据访问功能,适合带有大型数据集的应用程序。
Mapreduce(分布式计算框架):MapReduce是一种计算模型,用以进行大数据量的计算。
Yarn(资源管理框架):在YARN中,资源管理由ResourceManager和NodeManager共同完成,其中,ResourceManager中的调度器负责资源的分配,而NodeManager则负责资源的供给和隔离。
Sqoop(数据同步工具):Sqoop是SQL-to-Hadoop的缩写,主要用于传统数据库和Hadoop之间传输数据。
Mahout(数据挖掘算法库):包含了聚类、分类、推荐引擎(协同过滤)和频繁集挖掘等广泛使用的数据挖掘方法。除了算法,Mahout还包含数据的输入/输出工具、与其他存储系统(如数据库、MongoDB 或Cassandra)集成等数据挖掘支持架构。
Hbase(分布式列存数据库):HBase是一个针对结构化数据的可伸缩、高可靠、高性能、分布式和面向列的动态模式数据库。
Zookeeper(分布式协作服务):Zookeeper是Chubby克隆版,主要解决分布式环境下的数据管理问题:统一命名,状态同步,集群管理,配置同步等。
Pig(基于Hadoop的数据流系统):将脚本转换为MapReduce任务在Hadoop上执行。通常用于进行离线分析。
Hive(基于Hadoop的数据仓库):由facebook开源,最初用于解决海量结构化的日志数据统计问题。Hive定义了一种类似SQL的查询语言(HQL),将SQL转化为MapReduce任务在Hadoop上执行。通常用于离线分析。
Flume(日志收集工具):Cloudera开源的日志收集系统,具有分布式、高可靠、高容错、易于定制和扩展的特点。
3、Hadoop的安装 https://www.cnblogs.com/Dcl-Snow/p/10825154.html

浙公网安备 33010602011771号