大数据软件框架简介
大数据的处理方式,就是用廉价的机器组成的集群去执行大规模的计算。
hadoop的核心是HDFS和MapReduce。前者为大数据提供了存储,后者为大数据提供了计算。
Hadoop的框架包括hadoop内核,mapreduce,hdfs,hadoop yarn(集群资源管理器)等,另外还包括zoopkeeper(分布式协作服务)以及ambari(管理工具)。
随着大数据的发展,对于实时性要求越来越高,hadoop适合于离线计算,已经不能满足这项要求。因此出现了内存计算框架spark(中间结果保存在内存中),不过spark是用scala开发的。
hadoop还有一个缺点就是不能胜任复杂的任务,实时性流处理框架storm就是为了解决这个问题而诞生的。
补充一下hadoop生态圈
1 大数据库和访问:大数据库hase SQL引擎phoenix、hive、pig、elasticSearch。
2 大数据采集和导入:flume、kafka、sqoop、storm、splunk。
浙公网安备 33010602011771号