数据架构
解决存储、传输、管理、权限 以及语义情况
1.S3 -object 对象存储
对象存储 S3 Minio
RustFS
SeaweedFS 是一个基于 Go 语言开发的高性能分布式文件系统 SeaweedFS
2. File Format 文件存储格式
parquet
Lance
Apache Doris Segment V3
采用文本格式:如 CSV、XML、JSON yaml toml
3.内存格式 -内存交互层
Avro 行式序列化格式 采用基于JSON的模式定义,Schema与数据一同存储,保障数据自描述性;
支持高效二进制压缩 实时数据交换场景
Arrow 采用列式内存布局 schema
交换格式 : Protobuf FlatBuffers Thrift 微信私有协议传输
4.Table format
Lakehouse
Iceberg: 数据层 元数据层 目录层(Catalog
Snapshot Manifest File
Spark生态 支持厂商: Snowflake
Delta Lake: Databricks
Google BigQuery
- Catalog 服务-元数据服务
Apache iceberg rest api 规范
简化多引擎、多租户环境下的数据管理和安全治理工作
OAuth2 认证
Apache Gravitino 作为新一代统一元数据管理平台,为多云、多引擎环境下的数据治理提供了完整的解决方案。
它不仅支持多种数据源和计算引擎的统一管理,还通过凭证管理机制(Credential Vending)确保了数据访问的安全性和可控性
Apache Polaris 的核心作用是集中管理 Iceberg 表的元数据,让多个查询引擎能共享同一套数据目录
对 S3 上 Iceberg 数据的高效查询与管理
Snowflake推出开源的 Polaris Catalog 以支持对Iceberg数据的跨引擎访问
Databricks Unity Catalog
Snowflake Horizon
Lakekeeper 是一个基于 Rust 实现的开源 Apache Iceberg REST Catalog 服务
Nessie 是一个开源的数据湖事务目录,为您的数据提供类似 Git 的版本控制功能。它实现了 Iceberg REST Catalog 规范
DLF Iceberg Rest Catalog
- 数据含义-语义模型-Data Model-知识图谱
Apache Ossie 是一个协作式的开源项目,
致力于标准化和简化数据分析、人工智能和商业智能生态系统中各种工具和平台之间的语义模型交换和使用
dbt Semantic Layer做"执行引擎
dbt metrics
本地模型 -解决"对齐"问题
ontology/ontology.md
数据的含义、关系、约束都形式化
参考 :Palantir的Ontology和AIP
Palantir AIP:Ontology + Action- 计算层和调度层
计算引擎: Spark Flink
Duckdb Daft Ray Dremio
AI计算层: Pytorch
版本化部署和实时编辑 Action闭环、Human-in-the-Loop
调度层-- 分布式计算 ray- 应用层-对接客户端 推理层-决策层-执行层
1.人 + AI Agent
Agent -解决推理问题:Agent的调用要有审计、有速率限制、有权限控制
Tableau API或者数据服务
2.具身智能 网络空间到物理世界:人类如何与之相处:人机关系
技术栈
duckdb--存储和计算
dbt
浙公网安备 33010602011771号