上一页 1 ··· 14 15 16 17 18 19 20 21 22 ··· 27 下一页

2018年8月3日

摘要: foreachPartition,在生产环境中,通常来说,都使用foreachPartition来写数据库的 使用批处理操作(一条SQL和多组参数) 发送一条SQL语句,发送一次 一下子就批量插入100万条数据。 用了foreachPartition算子之后,好处在哪里? 1、对于我们写的funct 阅读全文

posted @ 2018-08-03 16:42 打杂滴 阅读(2573) 评论(0) 推荐(0)

摘要: def ip2Long(ip: String): Long = { val fragments = ip.split("[.]") var ipNum = 0L for (i <- 0 until fragments.length){ ipNum = fragments(i).toLong | ip 阅读全文

posted @ 2018-08-03 15:57 打杂滴 阅读(272) 评论(0) 推荐(0)


2018年8月2日

摘要: Shared Variables Spark does provide two limited types of shared variables for two common usage patterns: broadcast variables and accumulators. Broadca 阅读全文

posted @ 2018-08-02 16:47 打杂滴 阅读(175) 评论(0) 推荐(0)

摘要: RDD运行原理 1.创建 RDD 对象 2.DAGScheduler模块介入运算,计算RDD之间的依赖关系。RDD之间的依赖关系就形成了DAG 3.每一个JOB被分为多个Stage,划分Stage的一个主要依据是当前计算因子的输入是否是确定的,如果是则将其分在同一个Stage,避免多个Stage之间 阅读全文

posted @ 2018-08-02 15:20 打杂滴 阅读(146) 评论(0) 推荐(0)

摘要: stage的划分是以shuffle操作作为边界的,遇到一个宽依赖就分一个stage 一个Job会被拆分为多组Task,每组任务被称为一个Stage就像Map Stage, Reduce Stage。Stage的划分在RDD的论文中有详细的介绍,简单的说是以shuffle和result这两种类型来划分 阅读全文

posted @ 2018-08-02 11:11 打杂滴 阅读(1050) 评论(0) 推荐(0)


2018年8月1日

摘要: 窄依赖:Narrow Dependency 父RDD和子RDD是一对一的依赖关系,如map,filter 宽依赖:Shuffle Dependency 本质就是shuffle。如reduceByKey,groupyByKey,父RDD一个分区数据给了子RDD的多个分区 存在shuffle就是宽依赖, 阅读全文

posted @ 2018-08-01 14:26 打杂滴 阅读(1535) 评论(0) 推荐(0)


2018年7月31日

摘要: val NONE = new StorageLevel(false, false, false, false) val DISK_ONLY = new StorageLevel(true, false, false, false) val DISK_ONLY_2 = new StorageLevel 阅读全文

posted @ 2018-07-31 14:50 打杂滴 阅读(163) 评论(0) 推荐(0)

摘要: cache只有一个默认的缓存级别MEMORY_ONLY ,而persist可以根据StorageLevel设置其它的缓存级别。 cache以及persist都不是action。 被重复使用的(但是)不能太大的RDD需要cache cache 只使用 memory,checkpoint写磁盘 rdd. 阅读全文

posted @ 2018-07-31 11:13 打杂滴 阅读(623) 评论(0) 推荐(0)


2018年7月30日

摘要: grep命令用于查找文件里符合条件的字符串。 [root@host tmpdata]# grep 'shenzhen' *.txt hivelog.txt:tianyongtao 1 50 shenzhenhivelog.txt:wangwu 1 85 shenzhenhivelog.txt:zha 阅读全文

posted @ 2018-07-30 15:06 打杂滴 阅读(129) 评论(0) 推荐(0)


2018年7月19日

摘要: GROUP_CONCAT() 函数的值等于属于一个组的指定列的所有值,以逗号隔开,并且以字符串表示 mysql> select sex,group_concat(level) from role group by sex;+ + +| sex | group_concat(level) |+ + + 阅读全文

posted @ 2018-07-19 16:53 打杂滴 阅读(126) 评论(0) 推荐(0)


上一页 1 ··· 14 15 16 17 18 19 20 21 22 ··· 27 下一页

博客园  ©  2004-2026
浙公网安备 33010602011771号 浙ICP备2021040463号-3