java/Java Pyton 大数据 Hadoop Spark

10 2018 档案

摘要:Spark中有两个类似的api,分别是reduceByKey和groupByKey。这两个的功能类似,但底层实现却有些不同,那么为什么要这样设计呢?我们来从源码的角度分析一下。 先看两者的调用顺序(都是使用默认的Partitioner,即defaultPartitioner) 所用spark版本:s 阅读全文
posted @ 2018-10-28 21:56 zzzzMing 阅读(1510) 评论(0) 推荐(0)
摘要:一. 头脑封闭和头脑开放 头脑封闭 你是否经常有这样的经历,在一次会议或者在一次小组讨论时,当你提出一个观点而被别人否定时,你非常急迫地去反驳别人,从而捍卫自己的尊严,而不是第一时间考虑别人提出这个否定观点的原因。 又或者在会议轮流发言过程中,你喜欢自己滔滔不绝得发言,沉浸在自己的观点中而对别人提出 阅读全文
posted @ 2018-10-25 20:52 zzzzMing 阅读(1396) 评论(1) 推荐(2)
摘要:Apache 首先我们要明白,Apache 是一个 http 服务器,而我们熟悉的另一种说法"Apache Hadoop"中的 Apache 则指的是 Apache 软件基金会。"Apache"是 Apache 软件基金会中的一个项目。 关于其名字,流传最广的解释是(也是最显而易见的):这个名字来自 阅读全文
posted @ 2018-10-16 21:32 zzzzMing 阅读(1304) 评论(2) 推荐(1)
摘要:这个问题我去网上搜索了一下,发现了很多的解决方案都是增加的nproc数量,即用户最大线程数的数量,但我修改了并没有解决问题,最终是通过修改hadoop集群的最大线程数解决问题的。 并且网络上的回答多数关于增加nproc的答案不完整,我这里顺便记录一下。 用户最大线程数可以通过linux下的命令 查看 阅读全文
posted @ 2018-10-11 21:57 zzzzMing 阅读(1044) 评论(0) 推荐(0)