apache paimon数据湖入门
入门:https://zhuanlan.zhihu.com/p/1941451140853135196
Apache Paimon 不是一个独立存储系统,也不是纯管理平台,而是一个数据湖存储框架(表格式)。它的存储依赖于外部分布式文件系统或对象存储(如HDFS、S3、OSS等),但自身提供了数据组织、事务管理、索引优化等核心能力。
paimon是一个开放表格式:
┌─────────────────────────────────────────────────────────────┐
│ 计算引擎层 (Compute) │
│ Spark / Flink / Trino / StarRocks / Databricks SQL │
│ (负责执行 SQL/流处理,通过表格式 API 读写数据) │
└───────────────────────────┬─────────────────────────────────┘
│ 调用 Read/Write/Merge/Scan 协议
┌───────────────────────────▼─────────────────────────────────┐
│ 开放表格式层 (Table Format) │
│ Delta / Iceberg / Hudi / Paimon │
│ (负责:元数据管理、ACID事务、版本快照、数据跳过、Compaction)│
└───────────────────────────┬─────────────────────────────────┘
│ 实际读写 Parquet/ORC 文件 + 元数据文件
┌───────────────────────────▼─────────────────────────────────┐
│ 对象存储层 (Object Storage) │
│ AWS S3 / 阿里云 OSS / Azure ADLS / GCS / HDFS │
│ (负责:海量、廉价、高持久性、无限扩展的字节存储) │
└─────────────────────────────────────────────────────────────┘

浙公网安备 33010602011771号