11 2021 档案

摘要:目前最新的 hudi 版本为 0.9,暂时还不支持 zorder 功能,但 master 分支已经合入了(RFC-28),所以可以自己编译 master 分支,提前体验下 zorder 效果。 环境 1、直接下载 master 分支进行编译,本地使用 spark3,所以使用编译命令: mvn cle 阅读全文
posted @ 2021-11-13 15:40 努力爬呀爬 阅读(855) 评论(0) 推荐(0)
摘要:小文件合并解析 执行代码: import org.apache.hudi.QuickstartUtils._ import scala.collection.JavaConversions._ import org.apache.spark.sql.SaveMode._ import org.apa 阅读全文
posted @ 2021-11-12 18:27 努力爬呀爬 阅读(814) 评论(1) 推荐(0)
摘要:概要 数据湖的业务场景主要包括对数据库、日志、文件的分析,而管理数据湖有两点比较重要:写入的吞吐量和查询性能,这里主要说明以下问题: 1、为了获得更好的写入吞吐量,通常把数据直接写入文件中,这种情况下会产生很多小的数据文件。虽然小文件的使用可以增加写入的并行度,且能够并行读取文件以提高读取速度,但会 阅读全文
posted @ 2021-11-11 09:03 努力爬呀爬 阅读(741) 评论(0) 推荐(0)
摘要:greenplum 数据分布策略 greenplum 是一个 MPP 架构的数据库,由一个 master 和多个 segment 组成(还可选配置一个 standby master),其数据会根据设置的分布策略分布到在不同的 segment 上。 在 6 版本中,gp 提供了 3 个策略:随机分布、 阅读全文
posted @ 2021-11-01 14:25 努力爬呀爬 阅读(883) 评论(0) 推荐(0)