读数据架构知识体系指南06数据处理

1. 主数据管理
1.1. 存储数据只是解决问题的一部分
1.2. 主数据管理(MDM)可以理解为一套技术、工具和流程,使用户能够创建和维护一致且准确的主数据列表
1.3. 涉及从内部和外部数据源及应用程序中为业务中的每个人、地点或事物创建单一的主记录
1.4. 可以使用这些主记录来构建更准确的报告、仪表盘、查询和机器学习模型
1.5. 大多数MDM产品都有非常成熟的工具来清理、转换、合并和验证数据,以执行数据标准
1.6. 允许构建层次结构,可以使用这些层次结构来改进报告和仪表盘
1.7. 将要管理的数据复制到MDM产品中
1.8. MDM会清理和标准化数据,并为潜在被管理的每个实体(比如客户)创建一个主记录
- 1.8.1. 会自动删除大多数重复项,但有些工作将不得不手动完成,需要有人审查可能重复的记录
1.9. 主记录会被复制回数据湖或数据仓库
- 1.9.1. 此主记录也被称为“金源”或“可信事实的最佳版本”
1.10. 如果正在创建星型模式,经过主数据管理的记录将成为维度表,然后与未经主数据管理的事实表连接
1.11. 主数据管理是一种重要方法,专注于管理核心业务实体,以确保跨多个系统和流程的数据准确性、统一性和一致性
2. 数据虚拟化和数据联邦
2.1. 数据虚拟化又称为逻辑数据仓库、虚拟数据仓库或去中心化数据库
2.2. 一种允许通过创建数据的逻辑视图来访问和组合来自各种来源和格式的数据,而无须复制或移动实际数据的技术
2.3. 提供了所有数据的单一访问点,支持实时数据合并,并减少了传统数据合并方法所需的时间和成本
2.4. 数据联邦和数据虚拟化是非常相似的术语,经常可以互换使用,如果混淆它们也不太可能出错
- 2.4.1. 两者之间存在着细微的差异。数据联邦涉及一个由较小的、完全或部分自治的子组织组成的伞状组织,这些子组织控制其全部或部分操作
2.5. 与数据虚拟化一样,数据联邦创建了来自多个数据源的统一数据视图
2.6. 数据虚拟化是一个更宽泛的概念,包括数据联邦以及数据转换、缓存、安全性和治理
2.7. 更好的数据虚拟化工具提供了有助于提高性能的功能
2.8. 数据虚拟化可以取代数据仓库或ETL/数据移动
2.9. 数据虚拟化作为数据仓库的替代方案
-
2.9.1. 采用数据虚拟化方案,不需要将数据复制并存储在一个中心位置
-
2.9.2. 数据虚拟化解决方案的主要优势在于它能快速推向市场
-
2.9.3. 构建时间比构建数据仓库要短得多,因为不需要设计和构建数据仓库以及ETL来复制数据,也不需要花费大量时间进行测试
-
2.9.4. 复制数据(如数据仓库的做法)意味着更高的存储和管理成本、需要构建和维护更多ETL流程,以及更多的数据不一致性问题,因此使用虚拟化可以节约大量成本
-
2.9.5. 数据虚拟化支持联合查询(federated queries),可以发出单个查询来从多个数据源和多种格式数据中检索数据,并将结果合并成一个单一的结果集
2.10. 虚拟化作为ETL或数据移动的替代方案
-
2.10.1. 如果计划对数据进行聚合或转换,然后多次查询结果,或者如果经常需要连接来自多个来源的数据集,并需要高性能,那么移动数据是好的选择
-
2.10.2. 数据虚拟化提供了全面的数据沿袭,确保可以清楚地了解数据从源到表现层的路径
-
2.10.3. 可以无缝包含额外的数据源,不需要修改转换包或暂存表
-
2.10.4. 数据虚拟化软件通过统一的SQL接口呈现所有数据
2.11. 可能选择数据虚拟化的原因
-
2.11.1. 存在数据移动的法规限制
-
2.11.1.1. 中国数据主权法规规定,位于中国的数据必须留在中国,只能由当前位于中国的人查询
-
2.11.2. 公司外部的终端用户希望访问客户数据
-
2.11.2.1. 与其向公司外部的终端用户发送数据副本,不如让他们使用虚拟化软件来查询数据
-
2.11.2.2. 数据管理员能够控制谁访问哪些数据,并了解他们访问了多少数据
-
2.11.3. 数据仓库之外的数据库中存在频繁更改的参考数据
-
2.11.3.1. 与其一次又一次地将这些数据复制到数据仓库中,不如使用虚拟化,在查询外部数据库的数据时与数据仓库数据联接
-
2.11.4. 如果想要查询来自不同数据存储的数据并将其合并在一起
-
2.11.4.1. 虚拟化软件通常支持许多数据源,数据虚拟化可以处理这种情况
-
2.11.5. 希望用户通过虚拟沙盒进行自助分析
-
2.11.5.1. 虚拟沙盒是一个安全且隔离的环境,用户可以在其中探索、分析和操作数据,而不会影响底层的生产数据或系统
-
2.11.6. 想快速构建一个解决方案来迁移源数据
-
2.11.6.1. 与使用传统ETL工具将源数据复制到中央位置,然后从中创建报告不同,可以直接使用虚拟化软件创建报告
-
2.11.6.2. 虚拟化软件将针对源数据运行查询并自动完成集中化处理
-
2.11.6.3. 这意味着可以更快地构建解决方案,因为*不必使用ETL工具
3. 数据目录
3.1. 数据目录是一个集中化的存储库,通常托管在云中,用于存储和组织有关企业的所有数据源、表、模式、列和其他数据资产的元数据
3.2. 作为用户发现、理解和管理数据的单一事实来源,这些数据可能位于应用数据库、数据湖、关系数据仓库、运营数据存储、数据集市以及其他任何形式的数据存储中
3.3. 包含
-
3.3.1. 关于数据源的信息
-
3.3.2. 如果位于关系数据库(RDW)内,则包含表和模式信息以及列信息
-
3.3.3. 如果在诸如数据湖等对象存储中,则包含文件属性(存储位置、文件夹名称、文件名)
-
3.3.4. 数据沿袭(数据是如何从其源头传递过来的),包括数据经历的任何转换、聚合和合并的信息
-
3.3.5. 数据治理和合规性细节,例如数据质量、所有权和政策
-
3.3.6. 搜索和发现工具,供用户搜索、过滤和查找相关数据
3.4. 数据目录通过提供对数据环境的可见性来帮助更有效地管理数据
- 3.4.1. 反过来又促进了团队之间更好的协作和更明智的决策
3.5. 还有助于确保数据质量、安全性和合规性,因为它可以更轻松地跟踪数据沿袭、执行数据政策并保持对数据资产的清晰理解
3.6. 包括Informatica的企业数据目录(EnterpriseData Catalog)、Collibra数据目录和微软的Purview
4. 数据市场
4.1. 数据市场有时也称为数据交换平台,是一个在线平台,数据提供商和数据消费者在此买卖和交换数据集
4.2. 旨在帮助数据消费者(如企业、研究人员和开发人员)发现、评估和购买用于分析、机器学习、商业智能和决策制定等目的的数据
4.3. 提供商通常包括收集或生成有价值数据集的组织、政府和个人
4.4. 数据市场通常包括一个数据目录
4.5. 数据市场应该具备健全的安全措施,以保护用户数据、确保遵守数据保护法规,并维护敏感信息的机密性
4.6. 数据市场其他常见的功能和工具包括
-
4.6.1. 数据集的评分和评价
-
4.6.2. 推荐其他可能喜欢的数据集
-
4.6.3. 购买者个人资料,方便重新订购、收藏列表等
-
4.6.4. 协作和社区
-
4.6.5. 培训和支持
4.7. 从数据提供者的角度来看,数据市场为他们提供了一种将数据资产货币化、创造新的收入来源的方式
4.8. 对于那些收集了大量数据但缺乏分析和变现能力的组织来说,这可能特别有利
4.9. 随着对数据驱动见解的需求与日俱增,以及越来越多样化的数据集,数据市场的受欢迎程度也在不断提高
浙公网安备 33010602011771号