文章分类 - Spark
摘要:内存管理 主要说的内存管理其实是Executor 存储内存:缓存数据 & 广播变量,(总内存-300M) x 60% x 0.5 执行内存:Shuffle过程中的操作,(总内存-300M) x 60% x 0.5 其他内存:系统 & RDD元数据信息,(总内存-300M) x 40% 预留内存:30
阅读全文
摘要:应用程序的执行 1. 概述 Driver线程主要是初始化SparkContext对象,准备运行所需的上下文,然后一方面保持与ApplicationMaster的RPC连接,通过ApplicationMaster申请资源,另一方面根据用户业务逻辑开始调度任务,将任务下发到已有的空闲Executor上
阅读全文
摘要:Shuffle Shuffle过程中,会等待上游不同分区数据执行完成再进行下一步操作,但是肯定不能在内存中等待,因为数据会大量堆积,所以一定会进行落盘操作!所以提高效率的办法:1)减少落盘的数据量(预聚合)。2)减少落盘的次数 而写磁盘和读磁盘又对应shuffle write和shuffle rea
阅读全文
摘要:组件通信 使用Socket进行通信性能是很低的,因为它有阻塞的概念 Netty:通信框架,支持 AIO(异步通信) 三种IO通信方式 BIO:阻塞式IO;比如吃面时,只能坐在桌子边等,不能做别的事 NIO:非阻塞式IO;比如吃面时,可以去干别的,然后时不时回来看看面好没 AIO:异步非阻塞式IO;比
阅读全文
摘要:源码阅读目录 1)环境准备(Yarn集群) Driver, Executor 2)组件通信 Driver => Executor Executor => Driver Executor => Executor 3)应用程序的执行 RDD依赖 阶段的划分 任务的切分 任务的调度 任务的执行 4)Shu
阅读全文
摘要:1. 概述 ==Spark SQL是Spark用于结构化数据(structured data)处理的Spark模块== 1.1 历史 Hive是早期唯一运行在Hadoop上的SQL-on-Hadoop工具。但是MapReduce计算过程中大量的中间磁盘落地过程消耗了大量的I/O,降低的运行效率,为了
阅读全文
摘要:参考:【尚硅谷 Spark】 【《大数据处理框架Apache Spark设计与实现》】 【Spark官方文档】 2. 核心编程 逻辑处理流程 1)数据源 数据源表示的是原始数据,数据可以存放在本地文件系统和分布式系统中,对于流式处理,数据源还可以是网络流等 2)数据模型 我们怎么对数据源进行
阅读全文
摘要:参考:【尚硅谷 Spark】 【《大数据处理框架Apache Spark设计与实现》】 【Spark官方文档】 1. 简介 ==Spark 是一种基于内存的快速、通用、可扩展的大数据分析计算引擎== Spark or MapReduce ? Hadoop的 MR框架 和 Spark框架 都是
阅读全文

浙公网安备 33010602011771号