03 2021 档案

摘要:如果你经常使用Spark SQL进行数据的处理分析,那么对笛卡尔积的危害性一定不陌生,比如大量占用集群资源导致其他任务无法正常执行,甚至导致节点宕机。那么都有哪些情况会产生笛卡尔积,以及如何事前"预测"写的SQL会产生笛卡尔积从而避免呢 阅读全文
posted @ 2021-03-16 11:30 大数据学习与分享 阅读(2653) 评论(0) 推荐(1)
摘要:虽然通过改写Not in Subquery的SQL,进行低效率的SQL到高效率的SQL过渡,能够避免上面所说的问题。但是这往往建立在我们发现任务执行慢甚至失败,然后排查任务中的SQL 阅读全文
posted @ 2021-03-12 09:28 大数据学习与分享 阅读(1029) 评论(0) 推荐(0)
摘要:通常情况下,企业中会采取轮询或者随机的方式,通过Kafka的producer向Kafka集群生产数据,来尽可能保证Kafk分区之间的数据是均匀分布的。在分区数据均匀分布的前提下,如果 阅读全文
posted @ 2021-03-03 09:00 大数据学习与分享 阅读(8099) 评论(0) 推荐(0)