07 2016 档案

摘要:在spark中,原始的sortByKey是以map为操作对象,按照key进行排序,value跟随 如果我们要设置多维排序,就需要自定义这个key对象 下面以三维度为例: 该class需要 extends Ordered[T] with Serializable , 然后将这个类的对象作为sortBy 阅读全文

posted @ 2016-07-13 15:16 杰克再造 阅读(1255) 评论(0) 推荐(0)

摘要:List是长度不可变,内容也不可变的 初始化: val days = List("Sunday", "Monday", "Tuesday", "Wednesday", "Thursday", "Friday", "Saturday",1,2,3,4,5,6,7) // 通过apply创建val so 阅读全文

posted @ 2016-07-12 17:25 杰克再造 阅读(579) 评论(0) 推荐(0)

摘要:初始化: val a = Array(1,2,3,4,"5","6") // Array 是不可变长的,但是内容是可变化的 val ab = ArrayBuffer(1,2,3,"4") // ArrayBuffer可变长 def abc (array : Array[Any]){} 添加: ab 阅读全文

posted @ 2016-07-12 12:12 杰克再造 阅读(6605) 评论(0) 推荐(0)

摘要:1. 我们发现计算步骤特别耗时,就在之前进行persist 2. 如果我们的计算链条特别长,就在之前进行persist 3. 在checkpoint之前,必须进行persist checkpoint是属于transform操作,也就是说,在最后的action被触发后,计算完成,框架发现在中间有一个c 阅读全文

posted @ 2016-07-11 00:18 杰克再造 阅读(259) 评论(0) 推荐(0)

摘要:非对称性加密有RSA 点对点通信场景 如果用公开密钥对数据进行加密,只有用对应的私有密钥才能解密;如果用私有密钥对数据进行加密,那么只有用对应的公开密钥才能解密。因为加密和解密使用的是两个不同的密钥,所以这种算法叫作非对称加密算法。 在传输过程中,即使攻击者截获了传输的密文,并得到了乙的公钥,也无法 阅读全文

posted @ 2016-07-07 16:52 杰克再造 阅读(96) 评论(0) 推荐(0)

摘要:Chef 是一个面向开发dev和运维人员ops的自动化管理工具 大白话: chef就是一个针对不同系统的安装脚本代码化的管理工具。 安装脚本这个大家都知道,代码化的意思是把各式各样的脚本语言以统一的ruby语言来封装编写,代码化还有一个好处就是可以用git来管理 架构/工作流程 chef serve 阅读全文

posted @ 2016-07-07 16:52 杰克再造 阅读(711) 评论(0) 推荐(0)

摘要:一套开源软件项目,可以提供私有云的全套解决方案的接口 OPenStack主要有以下5个部分构成 Nova 负责计算 swift 负责存储 glance 负责镜像 keystone 负责认证 Horizon 负责UI Nova通过web service API对外提供处理接口, Nova负责管理整个云 阅读全文

posted @ 2016-07-07 14:53 杰克再造 阅读(158) 评论(0) 推荐(0)

摘要:docker是lxc的增强版,不是替代版,其底层也是用lxc实现的 1. 多版本混合部署 一台服务器上部署多个应用或者一个应用的多个版本非常常见。 文件路径,配置信息,端口冲突不可避免 docker的每个容器有自己的文件系统,并通过端口映射解决端口冲突的问题 2.升级回滚 升级通常还有依赖项的版本变 阅读全文

posted @ 2016-07-06 16:57 杰克再造 阅读(273) 评论(0) 推荐(0)

摘要:调度模型的好坏,是由底层的抽象模型所决定的,spark的底层抽象是RDD spark调度模型系统,分为底层调度模型(TASKscheduler)和高层调度模型(DAGscheduler) 调度过程 1. application driver发出请求,这个application首先创建sparkcon 阅读全文

posted @ 2016-07-06 10:33 杰克再造 阅读(297) 评论(0) 推荐(0)

摘要:When Scala constructs a closure, it determines which outer variables the closure will use and stores references to them in the closure object. This al 阅读全文

posted @ 2016-07-05 15:45 杰克再造 阅读(186) 评论(0) 推荐(0)

摘要:testFile可以接受一个HDFS文件,可以是一个本地系统的文件,或者是任意hadoop支持的文件系统的URI,返回一个RDD[String] 1.调用hadoopFile,生成一个HadoopRDD 2.将HadoopRdd的key省去,只留value,生成一个mapPartitionRDD 一 阅读全文

posted @ 2016-07-05 15:44 杰克再造 阅读(190) 评论(0) 推荐(0)

摘要:这个类是用于记录HDFS的Block对应的所有datanode的信息 源码如下: 不得不说在DFSInputStream.java中,叫blockSeekTo的方法 通过输入一个文件的偏移量,返回在哪个datanode上去取是最好的 内部实现有2步: 1. 首先找到根据这个偏移量,对应的block有 阅读全文

posted @ 2016-07-05 14:25 杰克再造 阅读(284) 评论(0) 推荐(0)

摘要:分布式数据并行环境下,保持数据的本地性是非常重要的内容,事关分布式系统性能高下。 概念: block : HDFS的物理空间概念,固定大小,最小是64M,可以是128,256 。。也就是说单个文件大于block的大小,肯定会被切分,被切分的数目大概是:比如文件是250M,block是64M,就会被分 阅读全文

posted @ 2016-07-05 11:46 杰克再造 阅读(2805) 评论(1) 推荐(0)

摘要:ZooKeeper。它是Apache Hadoop的一个子项目,它主要用来解决分布式集群中应用系统的一致性问题 这个一致性可以是数据,可以是程序,可以是配置文件 ZooKeeper数据节点,就是znode Zookeeper 并不是用来专门存储数据的,它的作用主要是用来维护和监控你存储的数据的状态变 阅读全文

posted @ 2016-07-05 10:48 杰克再造 阅读(330) 评论(0) 推荐(0)

导航