读数据可视化10数据(下)

1. 数据挖掘
1.1. 指设计特定算法,从大量的数据集中去探索发现知识或者模式的理论和方法,是知识工程学科中知识发现的关键步骤
1.2. 直观的定义是通过自动或半自动的方法探索与分析数据,从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、潜在有用的信息和知识的过程
1.3. 数据挖掘不是数据查询或网页搜索,它融合了统计、数据库、人工智能、模式识别和机器学习理论中的思路,特别关注异常数据、高维数据、异构和异地数据的处理等挑战性问题
1.4. 任务
-
1.4.1. 基于某些变量预测其他变量的未来值,即预测性方法(例如分类、回归)
-
1.4.2. 以人类可解释的模式描述数据(如聚类、模式挖掘、关联规则发现)
1.5. 数据挖掘指从大量数据中识别有效的、新颖的、潜在有用的、最终可理解的规律和知识
1.6. 主要方法
-
1.6.1. 描述性方法
-
1.6.1.1. 聚类
1.6.1.1.1. 位于同一类的数据点彼此之间的相似度大于与其他类的数据点的相似度
1.6.1.1.2. 在划分对象时不仅要考虑对象之间的距离,还要求划分出的类具有某种内涵描述,从而避免传统技术的某些片面性
- 1.6.1.2. 概念描述
1.6.1.2.1. 指对某类数据对象的内涵进行描述,并概括这类对象的有关特征
1.6.1.2.2. 特征性描述
1.6.1.2.2.1. 描述某类对象的*共同特征
1.6.1.2.3. 区别性描述
1.6.1.2.3.1. 描述不同类对象之间的*区别
- 1.6.1.3. 关联规则挖掘
1.6.1.3.1. 关联规则描述在一个数据集中一个数据与其他数据之间的相互依存性和关联性
1.6.1.3.2. 数据关联是数据库中存在的一类重要的可被发现的知识
1.6.1.3.3. 若两个或多个变量的属性值之间存在某种规律性,就称为关联
1.6.1.3.4. 关联可分为简单关联、时序关联、因果关联
1.6.1.3.5. 关联规则挖掘则是从事务、关系数据中的项集合对象中发现频繁模式、关联规则、相关性或因果结构
- 1.6.1.4. 序列模式挖掘
1.6.1.4.1. 针对具有时间或顺序上的关联性的时序数据集,序列模式挖掘就是挖掘相对时间或其他模式出现频率高的模式
1.6.1.4.2. 主要针对符号模式,而数字曲线模式属于统计时序分析中的趋势分析和预测范畴
1.6.1.4.3. 时序模式是指通过时间序列搜索出的重复发生概率较高的模式
-
1.6.2. 预测性方法
-
1.6.2.1. 分类
1.6.2.1.1. 分类算法需要从训练集中获得一个关于类别和其他属性值之间关系的模型,继而在测试集上应用该模型,确定模型的精度
1.6.2.1.2. 一个待处理的数据集可分为训练集和测试集两个部分,前者用于构建模型,后者用于验证
- 1.6.2.2. 回归
1.6.2.2.1. 研究一个随机变量对另一组变量的相依关系的统计分析方法
1.6.2.2.2. 线性回归是利用数理统计中的回归分析,来确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法
1.6.2.2.3. 当自变量为非随机变量、因变量为随机变量时,分析它们的关系称为回归分析
1.6.2.2.4. 当两者都是随机变量时,称为相关分析
- 1.6.2.3. 偏差检测
1.6.2.3.1. 大型数据集中常有异常或离群值,统称为偏差
1.6.2.3.2. 偏差检验的基本方法就是寻找观察结果与参照值之间的差别
2. 数据科学与可视化
2.1. 数据工作流
-
2.1.1. 工作流是多个用户之间按照某种预定义的规则传递文档、信息或任务的自动过程
-
2.1.2. 工作流概念起源于生产组织和办公自动化领域,用于描述一个特定的、实际的过程步骤,在计算机应用环境下属于计算机支持的协同工作的研究范畴
-
2.1.3. 定义和遵循工作流有助于以标准化、自动化的方式实现某个预期的业务目标,便于协同、分享、发布和传播有效的工作模式
-
2.1.4. 形式
-
2.1.4.1. 面向商业流程处理和商业数据处理的商业工作流
-
2.1.4.2. 面向科学研究过程控制和数据处理流程控制的科学工作流
2.1.4.2.1. Taverna
2.1.4.2.2. Kepler Project
-
2.1.5. 数据工作流特指为数据处理和分析流程定义的自动过程,其本质是计算业务过程的部分或整体在计算机应用环境下的自动化,与自动化工程学科密切相关
-
2.1.6. VisTrails*是一个开源的面向计算机仿真、数据浏览和可视化的科学工作流管理系统
-
2.1.7. DimStiller
-
2.1.8. 随着机器学习等领域的迅猛发展,以机器学习和数据挖掘为主要数据分析方法的数据科学工作流系统也蓬勃兴起
2.2. 可视数据挖掘
-
2.2.1. 目的在于使用户能够参与对大规模数据集进行探索和分析的过程,并在参与过程中搜索感兴趣的知识
-
2.2.2. 可视化技术也被应用来呈现数据挖掘算法的输入数据和输出结果,使数据挖掘模型的可解释性得以增强,从而提高数据探索的效率
-
2.2.3. 两大类
-
2.2.3.1. 可视化增强的通用数据挖掘方法
2.2.3.1.1. 以数据挖掘算法和模型为主,并不针对具体的应用场景或数据类型
2.2.3.1.2. 可视化作为辅助手段,帮助更加直观地展示输入数据和计算结果,或者直接深入模型内部,使用户直接看到模型的核心数据和结构,并进行交互式调整
2.2.3.1.3. 基于黑盒方式的可视化增强方法
2.2.3.1.3.1. 面向输入数据的可视化方法
2.2.3.1.3.2. 面向算法结果的可视化方法
2.2.3.1.3.2.1. 数据挖掘算法的输出结果是用户最关心的内容,可视化方法通常用于结果分析、模型验证等方面
2.2.3.1.3.3. 迭代式可视化方法
2.2.3.1.4. 基于白盒方式的可视化增强方法
- 2.2.3.2. 面向应用场景的方法
2.2.3.2.1. 文本分析
2.2.3.2.1.1. 数据挖掘及可视化方法在文本分析中占有非常重要的地位
2.2.3.2.2. 图像分析
2.2.3.2.2.1. 谱聚类方法*在图像分析中有着广泛的应用
2.2.3.2.3. 用户行为分析
2.2.3.2.3.1. 用户在同一网站上的页面浏览顺序形成点击流
2.2.3.2.4. 时空数据分析
2.2.3.2.4.1. 时空数据挖掘重点关注带有时间和空间属性的数据
2.2.3.2.5. 深度学习
2.2.3.2.5.1. 随着深度学习在各个领域的爆发式增长,可视化研究者也开始着手利用自己所长,对深度学习模型开展研究和探索
2.2.3.2.5.2. 深度生成模型(DGM,Deep Generative Model)是近几年来深度学习方面最前沿的研究之一,其训练过程相对于其他模型(如CNN、RNN等)来说较为复杂,且十分依赖使用者对深度学习算法的深入理解和实践经验
2.2.3.2.6. 其他应用场景
2.2.3.2.6.1. 在高维数据分析方面,INFUSE系统借助交互式可视化方法对特征选取任务进行辅助和增强
2.2.3.2.6.2. 在回归分析方面,HyperMoVal系统和文献均提出了新的可视化设计,以展示回归分析中的数据分布和模型的训练结果
3. 数据科学的挑战
3.1. 作为数据获取和存储基础的计算机科学,由于数据成本急剧下降导致的数据量急剧增长、数据复杂程度飞速上升,如何有效地获取数据、有效地处理数据获取的不确定性、对原始数据进行清理、分析,进而高效地完成数据存储和访问,达到去重、去粗取精的目的,是急需解决的问题
3.2. 如何构建结构化数据与非结构化数据之间的有效关联及语义信息,存储异构、多元数据之间的关系并支持后续分析,并提供足够的性能保证,也是面临的挑战之一
3.3. 对于统计、分析、数据挖掘研究者,将大数据变“小”,即从大数据中获取更加有效的信息和知识,是研究重点
3.4. 可视化作为数据科学中不可或缺的重要一环,也开始高度关注大数据带来的问题,其中包括:高维数据可视化,复杂、异构数据可视化,针对海量数据的实时交互设计,分布式协同可视化,以及针对大数据的可视分析流程等
浙公网安备 33010602011771号