摘要: 总体来说有两点: 1、Spark快的原因主要是源于DAG的计算模型,DAG相比Hadoop的MapReduce在大多数情况下可以减少shuffle的次数 2、Spark会将中间计算结果在内存中进行缓存。 针对于DAG(有向无环图)模型,Spark的DAG实质上就是把计算和计算之间的编排变得更为细致紧 阅读全文
posted @ 2021-01-21 15:27 白给大队队长 阅读(1407) 评论(0) 推荐(0)
摘要: 以下内容截取自:https://blog.csdn.net/zhanglh046/article/details/78360762 完整的shuffle原理及机制可看原博客。 在spark-1.6版本之前,采用HashShuffle,在spark-1.6版本之后使用Sort-Base Shuffle 阅读全文
posted @ 2021-01-21 14:24 白给大队队长 阅读(158) 评论(0) 推荐(1)
复制代码