随笔分类 -  Hive

摘要:1.map join无reduce操作,所以没有shuffle。这样可以减少大量的网络I/O。(如:大表文件数500、文件250M,小表20M。map join的网络I/O共50020M,Common join的网络I/O共500250M+20M),同时不需要进行map sort和shuffle s 阅读全文
posted @ 2021-08-30 16:53 曲水修竹 阅读(322) 评论(0) 推荐(0)
摘要:TextFile: 默认格式,数据不做压缩,磁盘开销大,数据解析开销大。可结合Gzip、Bzip2使用,但使用Gzip这种方式,hive不会对数据进行切分,从而无法对数据进行并行操作。 SequenceFile: SequenceFile是Hadoop API 提供的一种二进制文件,它将数据以<ke 阅读全文
posted @ 2020-12-31 23:09 曲水修竹 阅读(1650) 评论(0) 推荐(0)
摘要:1) 过滤掉脏数据:如果大key是无意义的脏数据,直接过滤掉。本场景中大key无实际意义,为非常脏数据,直接过滤掉。 2)数据预处理:数据做一下预处理,尽量保证join的时候,同一个key对应的记录不要有太多。 3) 增加reduce个数:如果数据中出现了多个大key,增加reduce个数,可以让这 阅读全文
posted @ 2020-12-31 23:05 曲水修竹 阅读(838) 评论(0) 推荐(0)
摘要:hive 常见调优方法: 0.11前版本开启MapJoin,之后的版本默认开启 MapJoin是Hive的一种优化操作,其适用于小表JOIN大表的场景,由于表的JOIN操作是在Map端且在内存进行的,所以其并不需要启动Reduce任务也就不需要经过shuffle阶段,从而能在一定程度上节省资源提高J 阅读全文
posted @ 2020-05-26 11:55 曲水修竹 阅读(345) 评论(0) 推荐(0)