摘要:
总体来说有两点: 1、Spark快的原因主要是源于DAG的计算模型,DAG相比Hadoop的MapReduce在大多数情况下可以减少shuffle的次数 2、Spark会将中间计算结果在内存中进行缓存。 针对于DAG(有向无环图)模型,Spark的DAG实质上就是把计算和计算之间的编排变得更为细致紧 阅读全文
posted @ 2021-01-21 15:27
白给大队队长
阅读(1407)
评论(0)
推荐(0)
摘要:
以下内容截取自:https://blog.csdn.net/zhanglh046/article/details/78360762 完整的shuffle原理及机制可看原博客。 在spark-1.6版本之前,采用HashShuffle,在spark-1.6版本之后使用Sort-Base Shuffle 阅读全文
posted @ 2021-01-21 14:24
白给大队队长
阅读(158)
评论(0)
推荐(1)

浙公网安备 33010602011771号