会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
博客园
首页
新随笔
联系
订阅
管理
上一页
1
2
3
4
5
6
7
8
9
下一页
2026年8月12日
Spark 核心之 Spark-SortShuffle 原理深度剖析
摘要: 摘要:Shuffle 是 Spark 作业中最昂贵的操作,也是性能瓶颈的高发区。Spark 2.0 起 SortShuffleManager 成为唯一的默认实现,通过 ExternalSorter 分区排序 + 溢写归并 + Index File 精确索引三大机制,彻底解决了 HashShuffle
阅读全文
posted @ 2026-08-12 09:41 starzy
阅读(14)
评论(0)
推荐(0)
2026年8月11日
Spark 核心之 MasterHA 高可用原理及配置详解
摘要: 摘要:Spark Standalone 集群的 Master 节点是资源调度的核心,一旦宕机整个集群陷入瘫痪。Master HA 通过 ZooKeeper 实现 Active-Standby 多 Master 架构,支持自动故障切换和状态恢复。本文从 ZooKeeperLeaderElectionA
阅读全文
posted @ 2026-08-11 16:23 starzy
阅读(9)
评论(0)
推荐(0)
Spark 核心之 Spark-WebUI 详解及日志查看
摘要: 摘要:Spark Web UI 是监控、调试和性能调优的核心入口。本文从架构全景出发,逐一详解 7 大核心 Tab(Jobs/Stages/Storage/Executors/Environment/SQL/Streaming)的使用方法和指标含义,深入 History Server 的 Event
阅读全文
posted @ 2026-08-11 10:14 starzy
阅读(29)
评论(0)
推荐(0)
2026年8月10日
Spark 核心之自定义累加器以及版本对比变化深度剖析
摘要: 摘要:Spark 1.x 的 Accumulator 接口存在严重设计缺陷:类型单调(IN=OUT)、无法自定义扩展、内置实现仅 4 种。Spark 2.0 引入了 AccumulatorV2[IN,OUT] 重构了整个累加器体系,通过 7 个核心抽象方法(add / merge / copy /
阅读全文
posted @ 2026-08-10 18:47 starzy
阅读(8)
评论(0)
推荐(0)
Spark 核心之广播变量、累加器原理深度剖析
摘要: 摘要:Spark 分布式计算的本质是"数据分发 + 并行处理"。但在 Executor 之间共享变量时,常规做法(如闭包引用)会导致严重的性能问题——大变量重复序列化传输、更新不可见。Spark 提供了两种分布式共享变量解决此难题:广播变量(Broadcast) 实现大对象的单向高效分发,累加器(A
阅读全文
posted @ 2026-08-10 09:45 starzy
阅读(11)
评论(0)
推荐(0)
2026年8月9日
Spark 核心之二次排序、分组取 TopN 优化分析
摘要: 摘要:为什么你的分组 TopN 任务跑了 30 分钟还 OOM?答案通常是四个字——groupByKey。本文将二次排序和分组 TopN 作为两条优化主线,从反模式剖析、三种方案对比(groupByKey / reduceByKey+mapPartitions / SQL 窗口函数)、groupBy
阅读全文
posted @ 2026-08-09 16:23 starzy
阅读(10)
评论(0)
推荐(0)
2026年8月8日
Spark 核心之 DAG 有向无环图原理分析
摘要: 摘要:你是否注意过 Spark UI 上的 "DAG Visualization" 图?那个有向无环图(DAG)不是凭空生成的——它是 Spark 从你写的每一行 RDD Transformation 中逐条构建的"血缘图谱"。本文从 RDD DAG 的构建过程、DAGScheduler 如何将 R
阅读全文
posted @ 2026-08-08 09:24 starzy
阅读(14)
评论(0)
推荐(0)
2026年8月7日
Spark 核心之资源调度以及任务调度过程详解
摘要: 摘要:从敲下 spark-submit 到第一个 Task 在 Executor 上跑起来,中间到底经历了什么?本文以"时间线"的方式,将 Spark 两大调度过程——资源调度(6 步)和任务调度(7 步)——按先后顺序完整串联。从 SparkContext 初始化、Master schedule(
阅读全文
posted @ 2026-08-07 13:35 starzy
阅读(5)
评论(0)
推荐(0)
Spark 核心之任务调度角色划分以及资源调度角色划分详解
摘要: 摘要:为什么 DAGScheduler 从不关心集群用的是 Standalone 还是 YARN?为什么 Master 从不关心 DAG 怎么切?这背后是 Spark 架构中最精妙的设计——任务调度与资源调度的完美解耦。Driver 端只管"算什么、怎么算"(DAG→Stage→Task),集群端只
阅读全文
posted @ 2026-08-07 09:42 starzy
阅读(4)
评论(0)
推荐(0)
2026年8月6日
Spark 核心之 Stage 并行度划分及优化详解
摘要: 摘要:为什么你的 Spark 任务 CPU 利用率只有 30%?为什么有些 Task 1 秒跑完有些要 10 分钟?这背后都是并行度(Partition 数 = Task 数) 的问题。本文从并行度公式推导、三条来源路径、spark.default.parallelism 与 spark.sql.s
阅读全文
posted @ 2026-08-06 12:09 starzy
阅读(10)
评论(0)
推荐(0)
上一页
1
2
3
4
5
6
7
8
9
下一页
公告