MapReduce分布式计算框架

MapReduce的核心思想:分而治之



MapReduce实例


MapTask部分:

“溢写”操作:读取文件分成许多MapTask进入内存缓冲区时,内存会有限制,当读取的数据达到内存限制的80%时,Map任务会启动另外一个线程,把Map任务的数据写进磁盘保存起来。
ReduceTask部分:

Shuffle原理:

Map阶段分区操作:会按Map阶段key的哈希值进行分区,然后进行排序

合并与归并的区别:
合并:<a,1> <a,1> ==> <a,2>
归并:<a,1> <a,1> ==> <a,<1,1>>



浙公网安备 33010602011771号