随笔分类 - Hive
摘要:1.map join无reduce操作,所以没有shuffle。这样可以减少大量的网络I/O。(如:大表文件数500、文件250M,小表20M。map join的网络I/O共50020M,Common join的网络I/O共500250M+20M),同时不需要进行map sort和shuffle s
阅读全文
摘要:TextFile: 默认格式,数据不做压缩,磁盘开销大,数据解析开销大。可结合Gzip、Bzip2使用,但使用Gzip这种方式,hive不会对数据进行切分,从而无法对数据进行并行操作。 SequenceFile: SequenceFile是Hadoop API 提供的一种二进制文件,它将数据以<ke
阅读全文
摘要:1) 过滤掉脏数据:如果大key是无意义的脏数据,直接过滤掉。本场景中大key无实际意义,为非常脏数据,直接过滤掉。 2)数据预处理:数据做一下预处理,尽量保证join的时候,同一个key对应的记录不要有太多。 3) 增加reduce个数:如果数据中出现了多个大key,增加reduce个数,可以让这
阅读全文
摘要:hive 常见调优方法: 0.11前版本开启MapJoin,之后的版本默认开启 MapJoin是Hive的一种优化操作,其适用于小表JOIN大表的场景,由于表的JOIN操作是在Map端且在内存进行的,所以其并不需要启动Reduce任务也就不需要经过shuffle阶段,从而能在一定程度上节省资源提高J
阅读全文

浙公网安备 33010602011771号