读数据可视化09数据(中)

1. 数据组织与管理
1.1. 无关、错误的信息随之增长
1.2. 数据管理包括对数据进行有效的收集、存储、处理和应用的过程
1.3. 管理对象是数据生命周期所涉及的应用过程中描述构成应用系统构件属性的元数据
- 1.3.1. 流程、文件、数据元、代码、规则、脚本、档案、模型、指标、物理表、ETL、运行状态
1.4. 通常数据按照一定的组织形式和规则进行存储和处理,以实现有效的数据管理
1.5. 数据组织具有一个层层相连的层次体系
-
1.5.1. 位、字符、数据元、记录、文件、数据库
-
1.5.2. 记录是逻辑上相关的数据元组合
-
1.5.3. 文件是逻辑上相关的记录集合
-
1.5.4. 数据库是一种作为计算机系统资源共享的数据集合
1.6. 文件存储
-
1.6.1. 电子表单
-
1.6.1.1. Spreadsheet
-
1.6.1.2. 是多功能的数据组织形式
-
1.6.1.3. 被广泛使用于办公自动化、商业和自然科学领域的数据组织与管理中
-
1.6.1.4. 几乎所有的办公软件(如Microsoft Excel、Tableau等)都支持标准电子表单文件的导入和导出
-
1.6.1.5. 主要缺点是缺少类型和元数据
1.6.1.5.1. 在使用时需要预先给出对每个数据项的语义解释
1.7. 结构化文件格式
-
1.7.1. XML(Extensible Markup Language,可扩展标记语言)是其中的典型代表
-
1.7.2. 科学数据格式*充分考虑了实验或测量数据的性能需求,适用于高分辨率、高通量的传感器数据
-
1.7.3. VOTable
-
1.7.3.1. 一种由国际虚拟天文台联盟(IVOA)团队制定的XML数据格式
-
1.7.3.2. 统一了记录天文星表等表列数据的格式
-
1.7.4. NetCDF
-
1.7.4.1. 网络通用数据格式
-
1.7.4.2. 由美国大学大气研究协会针对科学数据的特点开发的*面向数组型并适合于网络共享的数据的描述和编码标准
-
1.7.4.3. 被广泛应用于大气科学、水文、海洋学、环境模拟、地球物理等诸多领域
-
1.7.5. HDF
-
1.7.5.1. 层次型数据结构
-
1.7.5.2. 由美国国家超级计算应用中心创建、以满足不同群体的科学家对不同工程项目领域之需的多对象文件格式
1.8. 数据库
- 1.8.1. 数据组织的高级形式是数据库,即存储在计算设备内、有组织的、共享的、统一管理的数据集合
2. 数据整合与集成
2.1. 对于来自不同数据源的数据来说,它们具有高度异构的特点
-
2.1.1. 不同的数据模型
-
2.1.2. 不同的数据类型
-
2.1.3. 不同的命名方法
-
2.1.4. 不同的数据单元等
2.2. 数据整合的常用方式
-
2.2.1. 物化式
-
2.2.1.1. 查询之前,涉及的数据块被实际交换和存储到*同一物理位置
-
2.2.1.2. 物化式数据整合需要对数据进行物理移动,即从源数据库移动到其他位置
-
2.2.2. 虚拟式
-
2.2.2.1. 数据并没有从数据源中移出,而是在不同的数据源之上增加转换策略,并构建一个虚拟层,以提供统一的数据访问接口
-
2.2.2.2. 使用中间件技术,在中间件提供的虚拟数据层之上定义数据映射关系
-
2.2.2.3. 虚拟层还负责将不同数据源的数据在语义上进行融合,即在查询时做到语义一致
2.3. 交互分析和可视数据要求数据整合采用集中式、虚拟式的模式
2.4. 更好的方式是基于计算查询理念的语义整合,利用应用领域的概念视图而不是数据源的普通描述以提供概念数据的透明性
2.5. 数据集成
- 2.5.1. 指数据库应用中结合不同资源的数据并为用户提供数据集合的统一访问,其涵盖范围要比数据整合广
2.6. 数据整合与数据联邦(Data Federation)区别
-
2.6.1. 数据整合关注对众多独立和异构的数据源提供统一和透明的访问,使得原本无法被单数据源支持的查询表达获得支持,因此需要一个实际的物理数据源作为统一数据视图的数据来源
-
2.6.2. 数据联邦则提供了一种逻辑上统一、实际物理位置分布在多个数据源中的数据的集成
3. 数据库与数据仓库
3.1. 数据库是数据的集合,并且同时包含对数据的相关组织和操作
-
3.1.1. 数据库模型设计
-
3.1.2. 数据分析支持
-
3.1.3. 并发和容错
-
3.1.4. 速度和存储容量
3.2. 数据库结构的基础是数据模型,它是数据描述、数据联系、数据域以及一致性约束的集合
3.3. 事务的ACID特性
-
3.3.1. 原子性(Atomic)
-
3.3.2. 一致性(Consistent)
-
3.3.3. 隔离性(Isolated)
-
3.3.4. 持久性(Durable)
3.4. 交互式数据可视化应用通常需要将数据存储于内存,以保证足够的性能
3.5. SQL支持的数据类型是存储导向而不是语义导向的
3.6. 关系型数据库中的事件通知通常用触发器机制实现
3.7. 分析型数据库是面向分析应用的数据库系统,主要提供数据的在线统计、在线分析、即时查询等操作
3.8. NoSQL数据库
-
3.8.1. 被认为是不同于传统关系型数据库的数据库管理系统的*总称
-
3.8.2. 能够满足对数据的高并发读写、高效存储和访问、数据库高扩展性和高可用性等需求
-
3.8.3. 为 SNS网站等规模大、并发数高的应用提供了符合其性能标准的解决方案
-
3.8.4. 文档存储(如CouchDB,MongoDB)
-
3.8.5. 面向网络的存储(如Neo4j)
-
3.8.6. 键-值存储(如Redis,Memcached)
-
3.8.7. 混合存储
3.9. 现有一些数据可视化应用开始直接针对关系型数据库进行可视化,并且拥有简单的统计、分析功能
3.10. 数据仓库
-
3.10.1. 指“面向主题的、集成的、与时间相关的、主要用于存储的数据集合
-
3.10.2. 支持管理部门的决策过程
-
3.10.3. 目的*是构建面向分析的集成化数据环境,为分析人员提供决策支持
-
3.10.4. 特点
-
3.10.4.1. 数据仓库通常围绕某个应用目标、应用领域或使用者所感兴趣的内容制定,包含了一些相关的、由外部产生的数据
-
3.10.4.2. 数据仓库可以不断更新和增长,这意味着数据可以被源源不断地积累起来,从而允许用户分析数据的趋势变化、模式和相互关系
-
3.10.4.3. 数据仓库为复杂的决策支持查询进行了大量优化
-
3.10.4.4. 数据仓库的不同目标和数据模型也同时引发了不同于传统数据库的技术、方法论和方法的各种研究
-
3.10.4.5. 对于结构化或非结构化数据,数据仓库都能有效地进行处理,并且还能够提供两种数据的整合功能
4. 数据分析与挖掘
4.1. 数据用于记录事实,是实验、测量、仿真、观察、调查等的结果
4.2. 数据分析
-
4.2.1. 指组织有目的地采集数据、详细研究和概括总结数据,从中提取有用信息并形成结论的过程
-
4.2.2. 目的是从一堆杂乱无章的数据中集中、萃取和提炼出信息,探索数据对象的内在规律
-
4.2.3. 任务分解为定位、识别、区分、分类、聚类、分布、排列、比较、内外连接比较、关联、关系等活动
-
4.2.4. 基于数据可视化的分析任务则包括*识别、决定、可视化、比较、推理、配置和定位
-
4.2.5. 基于数据的决策则可分解为*确定目标、评价可供选择方案、选择目标方案、执行方案等
-
4.2.6. 被分成描述性统计分析、探索式数据分析和验证性数据分析三类
-
4.2.6.1. 探索式数据分析主要强调从数据中寻找出之前没有发现过的特征和信息
-
4.2.6.2. 验证性数据分析则强调通过分析数据来验证或证伪已提出的假说
-
4.2.6.3. 统计分析中的传统数据分析工具包括:排列图、因果图、分层法、调查表、散布图、直方图、控制图等
-
4.2.7. 数据分析从统计学中发展而来,在各行业中体现出极大的价值
-
4.2.8. 从流程上看,数据分析以数据为输入,处理完毕后提炼出对数据的理解
-
4.2.9. 不仅有助于用户选择正确的预处理和处理工具,还可以提高用户识别复杂数据特征的能力
4.3. 面向大型或复杂的异构数据集,数据分析的挑战是结合数据组织和管理的特点,考虑数据可视化的交互性和操控性要求需求
4.4. 部分数据分析方法采取增量式的策略,但不提供给用户任何中间结果,阻碍了用户对数据分析中间结果的理解和对分析过程的干预
- 4.4.1. 解决方案之一是设计标准化协议
4.5. 可预测模型标记语言(PMML)
4.6. 数据挖掘
-
4.6.1. 数据挖掘模型(Data Mining Model)
-
4.6.2. 在没有明确假设的前提下去挖掘知识,所得到的信息具有未知、有效和实用三个特征
-
4.6.3. 数据挖掘的任务往往是预测性的而非传统的描述性任务
-
4.6.4. 数据挖掘并不能替代传统的统计分析和探索式数据分析技术
-
4.6.5. 关注模型的选择和参数的调节
-
4.6.6. 数据挖掘和联机分析处理都致力于模式发现和预测,具有一定的*互补性
4.7. 联机分析处理
-
4.7.1. OLAP
-
4.7.2. 面向分析决策的方法
-
4.7.2.1. 是交互式统计分析的高级形式
-
4.7.3. 传统的数据库查询和统计分析工具负责提供数据库中的内容信息,而联机分析处理则提供基于数据的假设验证方法
-
4.7.4. 一种交互式探索大规模多维数据集的方法
-
4.7.4.1. 发展趋势是融合数据可视化与数据挖掘方法,转变为数据的在线可视分析方法
-
4.7.5. 将表单数据转换为多维数组需要两个步骤
-
4.7.6. 数据立方
-
4.7.6.1. 是数据的一个容许各种聚合操作的多维表示
-
4.7.6.2. 数据立方可用于记录包含数十个维度、数百万数据项的数据集,并允许在其基础上构建维度的层次结构
-
4.7.7. 被广泛看成一种支持策略分析和决策制定过程的方法,与数据仓库、数据挖掘和数据可视化的目标有很强的相关性
-
4.7.8. 切片(Slicing)指从数据立方中选择在一个或多个维度上具有给定的属性值的数据项
-
4.7.9. 切块(Dicing)指从数据立方中选择属性值位于某个给定范围的数据子集
-
4.7.10. 两个操作都等价于在整个数组中选取子集
-
4.7.11. 汇总和钻取(Roll-up and Drill-down)—属性值通常具有某种层次结构
-
4.7.12. Polaris
-
4.7.12.1. 由斯坦福大学开发的用于分析多维数据立方的可视化工具
-
4.7.12.2. 针对基于表格的数据进行可视化及分析,可以认为是对表格数据(诸如电子表格数据、关系型数据库数据等)的一种可视化扩展
4.8. 探索式数据分析
-
4.8.1. 一种有别于统计分析的新思路,不等同于以统计数据可视化为主的统计图形方法
-
4.8.2. 探索式数据分析和统计分析、贝叶斯分析也有很大不同
-
4.8.3. 统计分析的流程是:问题,数据,模型,分析,结论
-
4.8.4. 贝叶斯分析的流程则是:问题,数据,模型,先验分布,分析,结论
-
4.8.5. 探索式数据分析的流程是:问题,数据,分析,模型,结论
-
4.8.6. 将聚类和异常检测看成探索式过程
浙公网安备 33010602011771号