读数据架构知识体系指南07大数据

1. 大数据
1.1. 构建数据架构的公司数量在21世纪20年代出现了爆炸式增长
- 1.1.1. 主要原因是现在可用的数据比以往任何时候都多,数据可能来自社交媒体、物联网(IoT)设备、内部应用程序和第三方软件等
1.2. 在整个商业世界,企业都在争分夺秒地建立数据架构
- 1.2.1. 核心在于,在正确的时间以正确的格式将正确的信息传递给正确的人
1.3. “大”这个词,但它并不仅仅指数据量的大小
-
1.3.1. 六个V
-
1.3.1.1. 数据量/容量(Volume)、速度(Veracity)或多样性(Variety)如何
-
1.3.1.2. 真实性/准确性(Veracity)、易变性(Variability)和价值(Value)
-
1.3.2. 数据可以是任何形式并且可以以任何频率收集
1.4. 数据量
-
1.4.1. 数据量是生成和存储数据的*庞大数量
-
1.4.2. 数据的量级可能从TB(太字节)到PB(拍字节)不等,来源广泛,包括社交媒体、电子商务交易、科学实验以及物联网设备的传感器数据等
1.5. 多样性
-
1.5.1. 多样性指数据源和数据格式的*广泛性
-
1.5.2. 细分为结构化数据(来自关系数据库)、半结构化数据(如CSV、XML和JSON等格式的日志)、非结构化数据(如电子邮件、文档和PDF文件)以及二进制数据(图像、音频和视频)
-
1.5.2.1. 来自订单输入系统的数据属于结构化数据,因为它来自关系数据库
-
1.5.2.2. 来自物联网设备的数据可能是JSON格式
1.6. 速度
-
1.6.1. 速度是指生成和处理数据的速度
-
1.6.2. 收集频率较低的数据通常称为批量处理
-
1.6.3. 可以频繁收集数据,甚至实时收集,尤其是在数据高速生成的情况下
-
1.6.4. 数据可以分批传输,比如一小时传输一次,或者一秒多次流式传输(这称为实时流式传输)
1.7. 真实性
-
1.7.1. 真实性是指数据的*准确性和可靠性
-
1.7.2. 大数据的来源多种多样,不可靠或不完整的来源会损害数据质量
-
1.7.3. 在收到数据时需要进行
1.8. 易变性
-
1.8.1. 易变性是指数据在格式、质量和意义方面的一致性(或不一致性。
-
1.8.2. 处理和分析结构化、半结构化和非结构化数据需要*不同的工具和技术
1.9. 价值
-
1.9.1. 价值是最重要的V,与数据的可用性和相关性有关
-
1.9.2. 公司利用大数据来获得洞察力并做出决策,从而实现业务价值,如提高效率、节约成本或开辟新的收入来源
1.10. 预测分析是数据分析的一种类型,涉及使用统计算法和机器学习来分析历史数据,并对未来事件和趋势进行预测
1.11. 数据称为“新式石油”
-
1.11.1. 在当今的数字经济中,数据已成为一种极其宝贵的资源,就像工业经济时代的石油一样
-
1.11.2. 是一种原始材料,需要被提取、提炼和处理才能发挥作用
-
1.11.3. 极为宝贵
-
1.11.3.1. 通过收集、分析大量数据,公司可改进产品和服务,做出更好的商务决策,从而获取有竞争力的优势
-
1.11.4. 是一种强大的资源,对社会产生了*变革性影响
-
1.11.4.1. 石油的广泛使用推动了工业的发展,使新技术得以实现
-
1.11.4.2. 数据则促进了人工智能、机器学习和预测分析等领域的发展和进步
-
1.11.5. 大数据可成为能力和影响力的源泉
2. 数据成熟度
2.1. 公司了解自己在数据使用方面与其他公司相比处于什么阶段很重要,这称为数据成熟度
2.2. “数字化转型”是指公司如何在整个业务中嵌入数据安全技术,从根本上改变其从数据中获取价值以及运营和为客户创造价值的方式
-
2.2.1. 从传统的手工或纸质流程转向数字化流程,利用技术的力量提高效率、生产力和创新能力
-
2.2.2. 重要部分通常是利用数据来改善公司业务,这可能意味着创建全方位的客户档案以改善客户体验,或利用机器学习来提高生产线的速度和准确性
2.3. 数字化转型分为四个阶段,称为企业数据成熟度阶段
-
2.3.1. 数字化转型阶段反映了企业在管理、利用数据并从中获取价值方面所达到的发展水平和复杂程度
-
2.3.2. 第一阶段:被动反应
-
2.3.2.1. 在第一阶段,公司的大量数据散落各处,可能存在于不同文件系统上的大量Excel表格和数据库中,并通过电子邮件被发送至各处
-
2.3.2.2. 数据架构师称其为电子表格数据集市(spreadmart,spreadsheet data mart的简称):一种非正式、分散的数据集合,通常存在于组织内部,使用电子表格来存储、管理和分析数据
-
2.3.3. 第二阶段:信息化
-
2.3.3.1. 当公司开始集中管理数据,从而使分析和报告变得更加容易时,就进入了第二个阶段
-
2.3.3.2. 第一和第二阶段用于历史报告,或查看过去的趋势和模式
-
2.3.3.3. 在第二阶段,为收集数据而构建的解决方案通常*不具备很强的可扩展性
-
2.3.4. 第三阶段:*预测
-
2.3.4.1. 到了第三阶段,公司数据已经移到云上,并建立了一个可以处理量更大的、类型不同和高频(每小时或流式)导入数据的系统,并结合机器学习(高级分析)进行实时决策,从而提高了决策水平
-
2.3.5. 第四阶段:*变革
-
2.3.5.1. 在第四阶段,不管数据的大小、速度或类型情况如何,公司已经建立了一个可以处理任何数据的解决方案
3. 自助式商业智能
3.1. 终端用户自己创建报表
- 3.1.1. 自助BI
3.2. 数据架构的构建目标应该是使终端用户(无论其技术技能如何)查询数据并创建报告和仪表盘时更便捷、更轻松
- 3.2.1. 自己能按需进行,不需要IT部门参与任何任务
3.3. IT部门必须联系所有终端用户,了解他们的数据需求,然后根据他们的需求建立数据架构
3.4. 创建易于使用的数据解决方案可实现自助BI
4. 数据架构类型
4.1. 在设计和构建正确的数据架构前,投入时间对其进行研究是非常有必要的
4.2. 数据架构的选择非常具有挑战性,因为没有放之四海而皆准的架构
4.3. 数据架构指的是信息系统中数据的总体设计和组织
4.4. 使用数据架构的预定义模板似乎是快速建立新系统的一种简单方法
5. 数据架构的演进
5.1. 关系数据库以结构化方式存储数据,数据元素之间的关系由键定义
-
5.1.1. 数据通常被组织成表,每个表由行和列组成
-
5.1.2. 每行表示一个数据实例,每列表示数据的一个特定属性
-
5.1.3. 关系数据库是为处理结构化数据而设计的,它提供了一个框架,可使用一种称为结构化查询语言(SQL)的标准化语言来创建、修改和查询数据
5.2. 在关系数据库中,一致性和数据完整性是最重要的,数据通常采用一种称为“写时模式”的方法进行组织
- 5.2.1. 在“读时模式”方法中,模式是在读取或访问数据时应用,而不是在写入数据时应用
5.3. 模式是指定义表、字段、数据类型和约束的组织和关系的正式结构
- 5.3.1. 它是存储和管理数据的蓝图,可确保数据库的一致性、完整性和高效组织
5.4. 在高层次上,数据架构提供了一个框架,用于以支持组织需求的方式组织和管理数据
5.5. 常见的元素
-
5.5.1. 数据存储
-
5.5.1.1. 所有数据架构都需要说明数据的存储方式,包括物理存储介质和用于组织数据的数据结构
-
5.5.2. 数据处理
-
5.5.2.1. 数据架构需要定义数据的处理方式,包括在数据存储或分析之前对其进行的任何转换或计算
-
5.5.3. 数据访问
-
5.5.3.1. 数据架构需要提供访问数据的机制,包括用户界面和应用程序接口(API),以便查询和分析数据
-
5.5.4. 数据隐私与安全
-
5.5.4.1. 数据架构需要包含确保数据安全和隐私的机制,如访问控制、加密和数据屏蔽
-
5.5.5. 数据治理
-
5.5.5.1. 数据架构需要提供数据管理框架,包括质量标准、脉络跟踪和保留政策
5.6. 主要目标是使组织能够有效管理和利用其数据资产,以支持其业务目标和决策过程
5.7. 关系数据仓库
-
5.7.1. 第一个用于生产的关系数据仓库是Teradata系统,由Jack E.Shemer博士在斯坦福大学开发,他于1979年创建了Teradata公司
-
5.7.2. 富国银行于1983年安装了第一个Teradata系统并用它来分析财务数据
-
5.7.3. 关系数据仓库是一种特定类型的关系数据库,专为数据仓库和商业智能应用而设计,具有优化的查询性能并支持大规模数据分析
-
5.7.4. 关系数据仓库的一些最重要的功能包括事务支持(确保数据得到可靠、一致的处理)、审计跟踪(记录系统中对数据执行的所有操作)和模式执行(确保数据以预定义的方式进行组织和结构化)
-
5.7.5. CRUD操作是数据架构中数据操作和管理的基础
-
5.7.6. 对于设计和实现与数据交互的数据存储系统和用户界面至关重要
-
5.7.7. CRUD操作要求应用程序的响应速度要快,这样终端用户才不会因为更新数据的时间过长而感到沮丧
-
5.7.8. 关系数据库中的数据被复制到数据仓库中,用户可以针对数据仓库而不是关系数据库运行查询和报告
-
5.7.8.1. 就不会对容纳关系数据库的系统造成负担,也不会减慢终端用户使用应用程序的速度
-
5.7.9. 关系数据仓库还可以整合来自多个不同应用程序的数据,以优化报告
5.8. 数据湖
-
5.8.1. 数据湖是一个较新的概念,大约在2010年首次出现
-
5.8.1.1. 数据湖起初是为了解决关系数据仓库存在的问题,包括成本高、可扩展性有限、性能差、数据准备开销大以及对复杂数据类型的支持有限
-
5.8.2. 将数据湖视为一个美化的文件系统,它与笔记本计算机上的文件系统并无太大区别
-
5.8.3. 据湖只是存储,与关系数据仓库不同,它*没有相关的计算引擎
-
5.8.4. 有许多计算引擎可以与数据湖配合使用,因此数据湖的计算能力通常比关系数据仓库的低
-
5.8.5. 关系数据仓库使用关系存储,而数据湖使用对象存储,不需要将数据结构化为行和列
-
5.8.6. 数据湖存储技术始于Apache Hadoop Distributed File System(HDFS),这是一种免费的开源技术,几乎完全由企业内部托管,在21世纪10年代初非常流行
-
5.8.6.1. HDFS是一个可扩展、容错的分布式存储系统,用于在普通硬件上运行
-
5.8.6.2. 它是Apache Hadoop生态系统的核心组件
-
5.8.7. 数据湖是读时模式,这意味着将数据放入数据湖不需要做任何前期工作:只需将文件复制到数据湖中即可,就像在笔记本计算机上使用文件夹一样简单
-
5.8.8. 数据湖中的数据以自然(或原始)格式存储,这意味着数据可以从源系统进入数据湖,而无须转换成其他格式
-
5.8.9. 将数据文件复制到数据湖时,其模式可能不会随文件一起复制,或者可能在不同的文件中
-
5.8.9.1. 必须通过创建模式或从单独文件中提取模式来定义模式,因此称为“读时模式“
-
5.8.10. 查询数据湖实际上并不那么容易:它需要一些相当高级的技能
-
5.8.11. 数据湖还不具备人们喜欢的数据仓库的某些功能,如*事务支持、模式执行和审计跟踪
-
5.8.11.1. 导致三大数据湖供应商中的两家(Hortonworks和MapR)破产
-
5.8.12. 它转变为另一个不同但非常有用的技术:暂存和准备数据
-
5.8.12.1. 数据湖未能取代关系数据仓库,但在暂存和准备数据方面仍有优势
5.9. 现代数据仓库
-
5.9.1. 关系数据仓库和数据湖本身是一种简单的架构
-
5.9.1.1. 只使用一种技术来集中数据,几乎没有任何支持产品
-
5.9.2. 现代数据仓库(MDW)的数据架构
-
5.9.3. 一种“两全其美”的方法
-
5.9.3.1. 数据湖用于暂存和准备数据,数据科学家使用它来构建机器学习模型
-
5.9.3.2. 数据仓库用于服务、安全和合规性,业务用户在其中进行查询和报告
6. 数据编织
6.1. 数据编织在2016年左右开始出现
6.2. 可以将数据编织架构看作现代数据仓库架构的进化版,它增加了更多技术来获取更多数据、确保数据安全并使数据可用
7. 数据湖仓
7.1. 据湖仓是数据湖和数据仓库的混合体。数据湖仓架构在2020年左右开始流行,当时Databricks公司开始使用这一术语
7.2. 湖仓的概念是摆脱关系数据仓库,在数据架构中只使用一个存储库,即数据湖
7.3. 所有结构化、半结构化和非结构化类型的数据都被导入数据湖中,所有查询和报告都在数据湖中完成
8. 数据网格
8.1. 代数据仓库、数据编织和数据湖仓架构都涉及数据集中化:在IT控制的架构下,将运营数据复制到IT所拥有的中央位置,然后由IT创建分析数据
8.2. 每个领域都有自己的小型IT团队,负责管理自己的数据、清洗数据、创建分析数据并使其可用
8.3. 数据网格只是一个概念,而不是一种技术
浙公网安备 33010602011771号