文章分类 - 大数据
摘要:HDFS 短路本地读取系列(二):你以为的「本地读」和真正的「本地读」—getLegacy vs getBlockReaderLocal 的本质差异 导语:在 HDFS 的读取路径中,BlockReaderFactory.build() 是客户端选择读取策略的总入口。在这个四级降级链路中,第二级和第
阅读全文
摘要:HDFS 短路读取:mmap 与 Unix Domain Socket 铸就的零拷贝艺术 在大数据时代,每一次数据读取都像一场隐形的马拉松。Spark 扫描百亿行 Parquet 文件、HBase 承受百万 QPS 查询、Hive 执行复杂聚合时,底层 I/O 的每一毫秒延迟、每一次 CPU 拷贝,
阅读全文
摘要:最近调研了spark-sql on yarn时UserGroupInformation初始化最早时机,将spark-sql on yarn的整个提交流程阅读了一遍,确定了SparkSubmit类范围,对SparkSubmit进行了阅读和跟进,找出了关键的代码,如下图所示,lazy val secMg
阅读全文
摘要:在阅读 SparkSubmit 源代码时,重点关注 Configuration 的资源文件的加载情况,默认通过 new Configuration() 构造方法创建时,只会加载 core-default.xml 和core-site.xml文件,但是 SparkSubmit 中打印 Configur
阅读全文

浙公网安备 33010602011771号