MapReduce分布式计算框架

 

 MapReduce的核心思想:分而治之

 

 

 

 

 

MapReduce实例

 

 

 

 

 

MapTask部分:

 

  “溢写”操作:读取文件分成许多MapTask进入内存缓冲区时,内存会有限制,当读取的数据达到内存限制的80%时,Map任务会启动另外一个线程,把Map任务的数据写进磁盘保存起来。

ReduceTask部分:

 

 Shuffle原理:

 

 

 Map阶段分区操作:会按Map阶段key的哈希值进行分区,然后进行排序

 

 

 

 合并与归并的区别:

合并:<a,1> <a,1>     ==>    <a,2>

归并:<a,1> <a,1>     ==>    <a,<1,1>>

 

 

 

 

posted @ 2022-05-07 17:44  去公司搞点薯条  阅读(53)  评论(0)    收藏  举报