10 2018 档案
摘要:Spark中有两个类似的api,分别是reduceByKey和groupByKey。这两个的功能类似,但底层实现却有些不同,那么为什么要这样设计呢?我们来从源码的角度分析一下。 先看两者的调用顺序(都是使用默认的Partitioner,即defaultPartitioner) 所用spark版本:s
阅读全文
摘要:一. 头脑封闭和头脑开放 头脑封闭 你是否经常有这样的经历,在一次会议或者在一次小组讨论时,当你提出一个观点而被别人否定时,你非常急迫地去反驳别人,从而捍卫自己的尊严,而不是第一时间考虑别人提出这个否定观点的原因。 又或者在会议轮流发言过程中,你喜欢自己滔滔不绝得发言,沉浸在自己的观点中而对别人提出
阅读全文
摘要:Apache 首先我们要明白,Apache 是一个 http 服务器,而我们熟悉的另一种说法"Apache Hadoop"中的 Apache 则指的是 Apache 软件基金会。"Apache"是 Apache 软件基金会中的一个项目。 关于其名字,流传最广的解释是(也是最显而易见的):这个名字来自
阅读全文
摘要:这个问题我去网上搜索了一下,发现了很多的解决方案都是增加的nproc数量,即用户最大线程数的数量,但我修改了并没有解决问题,最终是通过修改hadoop集群的最大线程数解决问题的。 并且网络上的回答多数关于增加nproc的答案不完整,我这里顺便记录一下。 用户最大线程数可以通过linux下的命令 查看
阅读全文

浙公网安备 33010602011771号