Hive
一、Hive:从“核心引擎”到“存储底座”
1.1 核心定位:离线数仓的基石
在银行大数据平台架构中,Hive 通常作为离线数据湖/仓库的核心存储与管理组件存在。
价值权衡:银行选择 Hive,是因为它能以最低成本、最稳定方式处理最大规模数据(夜间批量 ETL、全量扫描、历史归档),同时提供统一的元数据标准。
“慢”是其设计权衡中接受的代价,而非缺陷。
1.2 “存算分离”与透明加速
引入 Doris / SelectDB / Trino 作为高性能查询引擎,弥补 Hive(MapReduce)在查询延迟和并发上的瓶颈(原生响应通常在分钟级,无法满足秒级实时要求)。
数据仍存储在 Hive(避免重复建设),查询层对接 MPP 引擎,通过 Catalog 直接读取 Hive 表,利用向量化执行和缓存技术,实现查询提速 10 倍以上。
关系比喻:Hive 是“货车”(低成本、稳定、大批量),Trino/Doris 是“跑车”(高速查询),两者协同工作。
1.3 实时化补充:Hive + Hudi
Hive 原生不支持行级更新/删除,时效性为 T+1。
引入 Hudi 在 Hive 底层构建实时数据湖,通过 Flink 消费 Kafka 实时数据写入 Hudi,实现 T+0 准实时分析。

浙公网安备 33010602011771号