摘要: 一、前言 在解决昨天的问题时,又引出了很多新的问题,如为什么要进行编码,这些编码的关系如何,如ASCII,IOS-8859-1,GB2312,GBK,Unicode之间的关系,笔者想要彻底理解字符编码背后的故事,遂进行了探索,具体笔记如下。如园友能读完本篇文章,我相信会解开很多疑惑。 二、字符编码 阅读全文
posted @ 2016-03-25 10:46 leesf 阅读(34772) 评论(12) 推荐(53) 编辑
摘要: 一、前言 相信大家平时肯定会收到朋友发来的链接,打开一看,哦,需要投票。投完票后弹出一个页面(恭喜您,您已经投票成功),再次点击的时候发现,啊哈,您的IP(***.***.***.***)已经投过票了,不能重复投票。这时候,我们可能会想,能不能突破ip地址的限制进行刷票呢?有了这样的想法,那就去做吧 阅读全文
posted @ 2016-01-30 08:49 leesf 阅读(15099) 评论(28) 推荐(28) 编辑
摘要: 个人介绍 李昂 高级数据研发工程师 Apache Doris & Hudi Contributor 业务背景 部门成立早期, 为了应对业务的快速增长, 数仓架构采用了最直接的Lambda架构 对数据新鲜度要求不高的数据, 采用离线数仓做维度建模, 采用每小时调度binlog+每日主键归并的方式实现T 阅读全文
posted @ 2024-01-14 11:44 leesf 阅读(150) 评论(0) 推荐(0) 编辑
摘要: 湖仓一体(LakeHouse)是大数据领域的重要发展方向,提供了流批一体和湖仓结合的新场景。阿里云AnalyticDB for MySQL基于 Apache Hudi 构建了新一代的湖仓平台,提供日志、CDC等多种数据源一键入湖,在离线计算引擎融合分析等能力。本文将主要介绍AnalyticDB fo 阅读全文
posted @ 2023-12-17 20:20 leesf 阅读(176) 评论(0) 推荐(0) 编辑
摘要: Apache Hudi 维护在给定表上执行的所有操作的Timeline(时间线),以支持以符合 ACID 的方式高效检索读取查询的数据。 在写入和表服务期间也会不断查阅时间线,这是表正常运行的关键。 如果任何时间线操作出现混乱(由于多写入未配置锁提供程序等),则可能导致数据一致性问题(数据丢失或数据 阅读全文
posted @ 2023-11-05 18:48 leesf 阅读(385) 评论(0) 推荐(0) 编辑
摘要: 文章贡献者 Authors 技术指导: 泰康人寿 数据架构资深专家工程师 王可 文章作者: 泰康人寿 数据研发工程师 田昕峣 摘要 Abstract 本文详细介绍了泰康人寿基于 Apache Hudi 构建湖仓一体分布式数据处理平台的技术选型方法、整体架构设计与实施、以及针对大健康领域的领域特征和公 阅读全文
posted @ 2023-10-07 11:08 leesf 阅读(419) 评论(0) 推荐(1) 编辑
摘要: Apache Hudi的DeltaStreamer是一种以近实时方式摄取数据并写入Hudi表的工具类,它简化了流式数据入湖并存储为Hudi表的操作,自 `0.10.0` 版开始,Hudi又在DeltaStreamer的基础上增加了基于Debezium的CDC数据处理能力,这使得其可以直接将Debez 阅读全文
posted @ 2023-09-03 21:17 leesf 阅读(158) 评论(0) 推荐(1) 编辑
摘要: # 表模型现状与问题 关系模型自1970年由埃德加·科德提出来以后被广泛应用于数据库和数仓等数据处理系统的数据建模。关系模型以表作为基本的数据结构来定义数据模型,表为二维数据结构,本身缺乏关系的表达能力,关系的运算通过Join关联运算来处理。表模型简单且易于理解,在关系模型中被广泛使用。 随着互联网 阅读全文
posted @ 2023-08-13 08:25 leesf 阅读(31) 评论(0) 推荐(0) 编辑
摘要: ![](https://cdn.nlark.com/yuque/0/2023/png/26993331/1688806810010-c2b1a6e2-dd6c-43c7-8030-0c48aad6cacf.png#averageHue=%23faf9f8&clientId=uf2dc49f9-f36 阅读全文
posted @ 2023-07-16 10:18 leesf 阅读(85) 评论(0) 推荐(0) 编辑
摘要: 最近一位 Hudi 用户询问他们是否可以在不需要任何锁的情况下同时从多个写入端写入单个 Hudi 表。 他们场景是一个不可变的工作负载。 一般来说对于任何多写入端功能,Hudi 建议启用锁定配置。 但这是一个有趣的问题,我们进行探索并找到了解决方案,因此与更广泛的社区分享。 # 需要并发写入的锁提供 阅读全文
posted @ 2023-07-09 16:14 leesf 阅读(202) 评论(0) 推荐(2) 编辑
摘要: # 介绍 Apache Hudi 最初由Uber于 2016 年开发,旨在实现一个交易型数据湖,该数据湖可以快速可靠地支持更新,以支持公司拼车平台的大规模增长。 Apache Hudi 现在被业内许多人广泛用于构建一些非常大规模的数据湖。 Apache Hudi 为快速变化的环境中管理数据提供了一个 阅读全文
posted @ 2023-07-01 15:54 leesf 阅读(349) 评论(0) 推荐(0) 编辑
摘要: Apache Hudi 社区正在对Apache Hudi 1.x版本功能进行讨论,欢迎感兴趣同学参与讨论,PR链接:[https://github.com/apache/hudi/pull/8679/files](https://github.com/apache/hudi/pull/8679/fi 阅读全文
posted @ 2023-06-04 10:19 leesf 阅读(280) 评论(0) 推荐(0) 编辑
摘要: Apache Hudi 社区一直在快速发展,各公司正在寻找方法来利用其强大的功能来有效地摄取和管理大规模数据集。 每周社区都会收到一些常见问题,最常见的问题与 Hudi 如何执行更新插入有关,以确保以低延迟访问最新数据。 # 选择合适的存储表类型 快速更新插入的主要考虑因素之一是选择正确的存储表类型 阅读全文
posted @ 2023-05-21 08:32 leesf 阅读(211) 评论(0) 推荐(0) 编辑
摘要: 沃尔玛系统产生了世界上最大和最多样化的数据集之一,每天数据增长超 10 PB。 来自许多不同的来源及其支持的后端系统,一系列大量的业务事件流被发送到主要由 Apache Kafka 支持的消息传递层。 沃尔玛团队强烈希望扩展近乎实时的决策制定,如事件驱动架构的显着增加、来自生产数据库的变更数据捕获 阅读全文
posted @ 2023-05-14 17:02 leesf 阅读(289) 评论(0) 推荐(1) 编辑
摘要: 概括 Onehouse 客户现在可以将他们的 Hudi 表查询为 Apache Iceberg 和/或 Delta Lake 表,享受从云上查询引擎到顶级开源项目的原生性能优化。 在数据平台需求层次结构的基础上,存在摄取、存储、管理和转换数据的基本需求。 Onehouse 提供这种基础数据基础架构作 阅读全文
posted @ 2023-04-02 16:01 leesf 阅读(287) 评论(0) 推荐(0) 编辑
摘要: Apache Hudi 0.13.0 版本引入了许多新功能,包括 Metaserver、变更数据捕获、新的 Record Merge API、Deltastreamer支持新数据源等。 虽然此版本不需要表版本升级,但希望用户在使用 0.13.0 版本之前按照下面的迁移指南采取相关重大变更和行为变更的 阅读全文
posted @ 2023-03-05 22:20 leesf 阅读(756) 评论(0) 推荐(0) 编辑
摘要: 在 Hudi 中可以根据业务场景为 Hudi 表配置负载类Payload,它用于在更新期间合并同一记录的两个版本。本文将深入了解有效负载类的用途以及可以使用的所有不同方式。 配置:hoodie.datasource.write.payload.class 注意:对于新的记录合并API ,这些可能会发 阅读全文
posted @ 2023-02-26 11:04 leesf 阅读(258) 评论(0) 推荐(0) 编辑
摘要: 背景 在某些业务场景下,我们需要一个标志来衡量hudi数据写入的进度,比如:Flink 实时向 Hudi 表写入数据,然后使用这个 Hudi 表来支持批量计算并通过一个 flag 来评估它的分区数据是否完整从而进一步写入分区数据进行分区级别的ETL,这也就是我们通常说的流转批。 EventTime计 阅读全文
posted @ 2023-02-19 09:20 leesf 阅读(299) 评论(0) 推荐(1) 编辑
摘要: NerdWallet 的使命是为生活中的所有财务决策提供清晰的信息。 这涵盖了一系列不同的主题:从选择合适的信用卡到管理您的支出,到找到最好的个人贷款,再到为您的抵押贷款再融资。 因此,NerdWallet 提供了跨越众多领域的强大功能,例如信用监控和警报、用于跟踪净值和现金流的仪表板、机器学习 ( 阅读全文
posted @ 2023-02-12 10:29 leesf 阅读(232) 评论(1) 推荐(0) 编辑
摘要: 介绍 从数据库到数据仓库,最后到数据湖,随着数据量和数据源的增加,数据格局正在迅速变化。 数据湖市场预计增长近 30%,将从 2020 年的 37.4 亿美元增长到 2026 年的 176 亿美元。 此外从 2022 年数据和人工智能峰会来看,数据湖架构显然是数据管理和治理的未来。 由于 Datab 阅读全文
posted @ 2022-12-25 20:50 leesf 阅读(375) 评论(1) 推荐(2) 编辑
摘要: Hudi索引在数据读和写的过程中都有应用。读的过程主要是查询引擎利用MetaDataTable使用索引进行Data Skipping以提高查找速度;写的过程主要应用在upsert写上,即利用索引查找该纪录是新增(I)还是更新(U),以提高写入过程中纪录的打标(tag)速度。 MetaDataTabl 阅读全文
posted @ 2022-12-18 19:27 leesf 阅读(1405) 评论(0) 推荐(0) 编辑
摘要: 背景 在 Apache Hudi支持完整的Schema演变的方案中(https://mp.weixin.qq.com/s/rSW864o2YEbHw6oQ4Lsq0Q), 读取方面,只完成了SQL on Spark的支持(Spark3以上,用于离线分析场景),Presto(用于在线OLAP场景)及A 阅读全文
posted @ 2022-12-04 18:54 leesf 阅读(383) 评论(0) 推荐(0) 编辑
摘要: 你曾经是否有构建一个开源数据湖来存储数据以进行分析需求? 数据湖包括哪些组件和功能? 不了解 Lakehouse 和 数据仓库 之间的区别? 或者只是想管理数百到数千个文件并拥有更多类似数据库的功能但不知道如何操作? 本文解释了数据湖的细节以及哪些技术可以构建一个Lakehouse,以避免创建没有结 阅读全文
posted @ 2022-11-27 11:13 leesf 阅读(337) 评论(0) 推荐(0) 编辑
摘要: 1.场景需求 在医疗场景下,涉及到的业务库有几十个,可能有上万张表要做实时入湖,其中还有某些库的表结构修改操作是通过业务人员在网页手工实现,自由度较高,导致整体上存在非常多的新增列,删除列,改列名的情况。由于Apache Hudi 0.9.0 版本到 0.11.0 版本之间只支持有限的schema变 阅读全文
posted @ 2022-11-20 11:31 leesf 阅读(638) 评论(0) 推荐(0) 编辑
摘要: 背景 湖仓一体(LakeHouse)是一种新的开放式架构,它结合了数据湖和数据仓库的最佳元素,是当下大数据领域的重要发展方向。 华为云早在2020年就开始着手相关技术的预研,并落地在华为云 FusionInsight MRS智能数据湖解决方案中。 目前主流的三大数据湖组件 Apache Hudi、I 阅读全文
posted @ 2022-11-07 09:13 leesf 阅读(670) 评论(0) 推荐(0) 编辑
摘要: 了解使用开源技术构建现代数据栈的详细指南。 在过去的几年里,数据工程领域的重要性突飞猛进,为加速创新和进步打开了大门——从今天开始,越来越多的人开始思考数据资源以及如何更好地利用它们。这一进步反过来又导致了数据技术的“第三次浪潮”。 “第一次浪潮”包括 ETL、OLAP 和关系数据仓库,它们是商业智 阅读全文
posted @ 2022-10-23 16:44 leesf 阅读(867) 评论(2) 推荐(1) 编辑
摘要: 数据是当今分析世界的宝贵资产。 在向最终用户提供数据时,跟踪数据在一段时间内的变化非常重要。 渐变维度 (SCD) 是随时间推移存储和管理当前和历史数据的维度。 在 SCD 的类型中,我们将特别关注类型 2(SCD 2),它保留了值的完整历史。 每条记录都包含有效时间和到期时间,以标识记录处于活动状 阅读全文
posted @ 2022-10-16 10:34 leesf 阅读(377) 评论(0) 推荐(0) 编辑