读数据可视化30用户实验

1. 概述
1.1. 随着可视化研究、技术和应用的发展,对可视化技术和系统进行有效的用户实验变得越来越有必要
1.2. 如果可视化方法及结果缺乏严谨的用户评测实验,就很难对该方法和相关技术的进一步应用提供有说服力的证据
1.3. 可视化研究者需要比较新技术与已有技术的优劣,了解在何种情况下新技术更好,以及新技术的优缺点体现在哪里等
1.4. 研究者更专注于研发新的可视化技术
1.5. 行严格的评测不但难度大,而且很费时间
1.6. 可视化评测所涉及的手段是人机交互(HCI)领域的专业技能,而很多可视化研究者并不具备这方面的专业训练,这也是造成评测被忽略的重要原因之一
1.7. 视化技术的评测与人机交互技术的评测有诸多相通之处,特别是在交互界面的可用性研究方面
1.8. 可视化评测的另一个关注点是视觉表达中采用的编码及其可读性
1.9. 目标是帮助用户分析和解读数据,因此其用户实验最终需要回答的问题是:可视化技术是否能够更好地帮助用户解读某些数据
1.10. 意味着要完成一个严谨有效的可视化用户实验并不是一件容易的事
2. 评测流程
2.1. 评测采用的具体方法根据不同的研究对象和目标而发生改变
2.2. 明确研究目的并定义研究问题
-
2.2.1. 在进行评测之前,研究者首先需要明确的是评测的目的
-
2.2.2. 研究者需要围绕研究目的进一步清晰地定义研究所要解决的具体问题
-
2.2.3. 研究目的通常是概括性的
-
2.2.4. 研究问题是具体和清晰的,可能包含几个方面,是对于研究目的的进一步细化和可操作化的定义
2.3. 提出研究假设
-
2.3.1. 相对更好的命题是“用户在使用可视化系统甲时,能比使用可视化系统乙时更高效地对某类特定数据进行聚类分析”
-
2.3.2. 研究假设的提出过程也是研究者回顾相关理论的一个过程,这一过程对于研究者理解为什么会出现这样或者那样的研究结果也会有所帮助
2.4. 设计研究方案和具体方法
- 2.4.1. 研究假设形成之后,研究者可以着手设计研究的具体方案并且选择合适的方法
2.5. 收集和分析数据
- 2.5.1. 在实验执行的过程中,需要避免潜在的问题,保证结果的可靠性
2.6. 验证研究假设并得出结论
- 2.6.1. 得到实验结果之后,需要判断研究假设是否成立,或者是否有足够的证据来支持或推翻研究假设,进而得到研究的主要结论
3. 评测方法
3.1. 用户实验
-
3.1.1. User Studies
-
3.1.2. 用户实验提供了一种科学可靠的方法来评估可视化的效果
-
3.1.3. 目的是为了辅助用户完成数据的理解、分析等任务
-
3.1.4. 通过收集用户使用数据来进行评估的方法被称为用户实验
3.2. 专家评估
-
3.2.1. Expert Review
-
3.2.2. Heuristic Evaluation
-
3.2.3. 专家评估通常需要符合条件的专家级用户参与,从而避免了招募大量用户参与评测的麻烦
-
3.2.4. 评估者是领域的专家,他们对所使用的数据和需要完成的目标任务非常了解,能够对可视化技术在多大程度上适用于这样的数据和任务做出比较准确的判断
-
3.2.5. 可视化技术评测的参与者也可以包含可视化专家,他们对可视化设计有丰富的知识,并具有可视化工具开发经验
-
3.2.6. 可视化专家对可视化的有效性有自己的一套评判标准,并在评测中依据这些标准做出自己的判断
-
3.2.7. NameClarifier
-
3.2.7.1. 一个可以通过交互解决出版物中作者名字歧义问题的可视分析系统
3.3. 案例研究
-
3.3.1. Case Studies and Use Cases
-
3.3.2. 试图通过描述可视化技术和系统如何帮助解决一个现实的问题并完成目标任务来证明其有效性
-
3.3.3. 共享数据可能会带来隐私泄露*,单纯的隐私保护又会破坏数据的实用性,降低其分析价值
3.4. 指标评估
-
3.4.1. Metrics
-
3.4.2. 以图的布局算法为例,算法的时间复杂度、生成结果的易读性或美观程度(节点重叠量、边交叉数、临边最小夹角等)都可以被用来检验生成的结果
-
3.4.3. 人的主观认知十分复杂,且具有多样性
-
3.4.4. 对于喜好程度等依赖认知的评估条目来说,根据经验得出的一个或一组指标无法全面地模拟出主观认知的过程,因此也不能完全取代用户实验得出的真实实验结果
-
3.4.5. 为了提高指标评估的效果,在评估时,可以通过允许用户交互地调节指标计算函数中的参数来定制精确的评估指标
3.5. 众包
- 3.5.1. Crowdsourcing
3.6. 标注
-
3.6.1. Labeling
-
3.6.2. 评估结果的准确性需要基于标准答案
-
3.6.3. 在一些情况下,标准答案来自人工标注的结果
4. 用户实验
4.1. 用户实验通过记录并分析用户在完成任务过程中的行为和感受等信息来给出有说服力的评估结果
4.2. 用户实验的流程主要涵盖4个步骤:确定实验目标、准备实验、进行实验和分析结果并讨论
4.3. 确定实验目标
-
4.3.1. 用户实验的目标是探索未知内容、验证猜想、评估对象,或者对一组对象进行比较
-
4.3.2. 探索未知内容:由于人在感知、经验等方面的差异,研究者满意的内容不一定也能被大部分用户所接受
-
4.3.3. 验证猜想
-
4.3.3.1. 凭借经验,研究者能提出一些论断,比如两个变量之间存在相关性等
-
4.3.3.2. 其正确与否需要实践,也就是需要用户实验的结果来检验
-
4.3.4. 评估对象:用户实验可以从用户的角度证明实验对象的优劣
-
4.3.5. 对比多个对象:当研究者希望从多种方案中选出最合适的方案时,可以依据用户实验的结果对它们进行比较
-
4.3.6. 研究对象
-
4.3.6.1. 实验对象不是越多越好
-
4.3.6.2. 每个对象的样本数据不应过少,这就意味着对象数量的增加会增大对样本的需求,造成一定的负担
-
4.3.6.3. 任务
4.3.6.3.1. 用户需要完成什么任务,以及如何评估任务的完成效果
4.3.6.3.2. 前提是了解可视化技术所支持的用户任务,对测试任务的选择也决定了用户实验及其结论所适用的范围
4.3.6.3.3. 鉴定(Identify):基于可视化中显示出来的特性鉴别特定物体
4.3.6.3.4. 定位(Locate):确定物体的位置
4.3.6.3.5. 区别(Distinguish):区分一个物体
4.3.6.3.6. 分类(Categorize):对物体分类
4.3.6.3.7. 聚类(Cluster):将相似的物体按照彼此关系归类
4.3.6.3.8. 相似的操作是分割(Segmentation),也就是区分不同的物体
4.3.6.3.9. 排名(Rank):将一组物体按照一定的规则排序
4.3.6.3.10. 比较(Compare):查看两个或更多物体之间的相似之处和不同之处
4.3.6.3.11. 联系(Associate):表现两个或更多物体之间的关系
4.3.6.3.12. 关联(Correlate):找到两个或更多物体之间的因果或互动关系
4.3.6.3.13. 如果测试任务的难度过大,大部分参与者无法完成,将会造成所得到的数据量过少
4.3.6.3.14. 如果测试任务的难度太小,则往往无法展示出研究成果的优势
- 4.3.6.4. 指标
4.3.6.4.1. 内部效度和外部效度是判断实证性研究有效性的基本指标
4.3.6.4.2. 内部效度指研究者实际测量的和想要测量的指标之间的贴切程度
4.3.6.4.3. 二者越接近,研究的内部效度越高
4.3.6.4.4. 二者差异越大,研究的内部效度越低
4.3.6.4.5. 内部效度越低,研究的有效性也就越低
4.3.6.4.6. 外部效度指研究结论有效范围的大小
4.3.6.4.7. 研究结论的适用范围越大,研究的外部效度越高;反之,则外部效度越低
4.4. 准备实验
-
4.4.1. 数据
-
4.4.1.1. 可视化技术通常是针对某一类或者某些类数据而设计和实现的
-
4.4.1.2. 数据类型和用于用户测试的数据大小往往会影响可视化技术的效果
-
4.4.1.3. 数据应该具有代表性并且包含不同属性的数据集
-
4.4.1.4. 数据类型(Type)
4.4.1.4.1. 一种可视化技术通常适用于一种类型的数据
- 4.4.1.5. 数据量(Size)
4.4.1.5.1. 数据量的大小也会影响可视化技术的有效性
4.4.1.5.2. 一种可视化技术能有效地展示几百个数据点并不代表它也能可视化上百万个数据点
4.4.1.5.3. 很多现有的可视化技术都不具备可扩展性
- 4.4.1.6. 数据的维度
4.4.1.6.1. Dimensionality
4.4.1.6.2. 有些可视化技术通常适用于具有固定维度的目标数据,但是对于某些可视化技术,例如多维数据可视化技术,评测中非常重要的一项是对高维度数据的可扩展性
- 4.4.1.7. 数据的多元性
4.4.1.7.1. Number of Parameters
4.4.1.7.2. 数据中变量的数目也对可视化技术的有效性提出了要求,应根据实际应用选择对一元或多元数据进行评测
- 4.4.1.8. 数据结构(Structure)
4.4.1.8.1. 数据的结构可以是简单的列表,也可以是复杂的网络结构
4.4.1.8.2. 可视化技术通常为某一种特定结构的数据而设计,但也存在为多种结构数据所设计的可视化技术
4.4.1.8.3. 数据集可能存在次级结构
- 4.4.1.9. 数据的范围(Range)
4.4.1.9.1. 数据集中的对象可能跨越很大的范围,评测中不但需要包括所有可能的数值范围,更要重点测试极值情况下可视化的性能
- 4.4.1.10. 数据的分布(Distribution)
4.4.1.10.1. 数据的分布具有两个含义:数据值和数据属性(如时间和空间属性)
4.4.1.10.2. 数据的特性很多,在评测中全面地测试各种情况需要收集或生成大量的测试数据
-
4.4.2. 用户
-
4.4.2.1. 可视化技术对用户的有效性往往是因人而异的,因此需要通过评测了解某种可视化方法或技术能否为目标用户带来更多好处
-
4.4.2.2. 对应用领域的熟悉程度
4.4.2.2.1. 对应用领域的熟悉程度指用户对于可视化技术所面向的数据和专业领域的熟悉程度
4.4.2.2.2. 经验丰富的专家和新手用户对于可视化工具会有不同的要求和期望
- 4.4.2.3. 对测试任务的熟悉程度
4.4.2.3.1. 对测试任务的熟悉程度指用户对于所要完成的任务的熟悉程度
4.4.2.3.2. 对于任务的熟悉与对领域的熟悉是相互独立的概念
4.4.2.3.3. 一个对于应用领域非常熟悉的用户有可能对要完成的任务却毫无经验
-
4.4.2.4. 对可视化技术的熟悉程度
-
4.4.2.5. 对可视化环境的熟悉程度
4.4.2.5.1. 同样的技术在不同环境下的实现对用户将造成不同的体验
-
4.4.2.6. 研究者可以选择尽量多的群体参与评测,从而更好地了解可视化技术对哪些用户更有效,以及背后的人因学(Human Factors)上的原因
-
4.4.3. 实验设计
-
4.4.3.1. 重复(Replication):实验通常会受到不确定性的影响。重复实验有利于降低不确定性
-
4.4.3.2. 随机
4.4.3.2.1. Randomization
4.4.3.2.2. 通过随机方法,如随机数表、抽签等方式,将参与用户分配到不同的组中,以随机顺序实验
4.4.3.2.3. 可以降低实验之外的因素带来的影响
-
4.4.3.3. 局部控制(Local Control):将可能影响实验的因素分开讨论
-
4.4.3.4. 当实验的对象不止一个时,为了保证每个对象的参与用户群体相同,每个参与用户需要对不同的对象分别实验
-
4.4.3.5. 拉丁方是一种常见的解决方法
4.5. 进行实验
-
4.5.1. 在正式实验开始之前,通过预先进行的小规模试点实验(Pilot Experiment)来检查实验设计、环境是否存在缺陷,了解用户在实际操作时可能会遇到的问题,及时进行实验优化,避免浪费时间和金钱
-
4.5.2. 提供一个良好的实验环境
-
4.5.3. 参与实验的感受:有助于改进实验
-
4.5.4. 完成任务时的思考:在讨论实验结果时,解释某些现象需要对这部分信息进行总结
4.6. 分析结果并讨论
-
4.6.1. 用户实验的最后一步是对收集到的数据进行分析和讨论
-
4.6.2. 包括用户的个人信息、完成任务过程中的行为数据、评价数据,以及最后的采访记录等
-
4.6.3. 具体步骤
-
4.6.3.1. 建立假设
-
4.6.3.2. 构造检验统计量
-
4.6.3.3. 确定拒绝域和接受域
-
4.6.3.4. 计算临界点
-
4.6.3.5. 给出判断
-
4.6.4. 统计检验方法
-
4.6.4.1. 卡方检验
4.6.4.1.1. Chi-squared Test
4.6.4.1.2. 用于确定在一个或多个类别中观察到的频率和期望频率之间是否有显著性差异
4.6.4.1.3. 常被用于独立性检验
-
4.6.4.2. P值(P-value):检验假设H0成立或表现更为严重的可能性
-
4.6.4.3. F检验
4.6.4.3.1. F-test
4.6.4.3.2. 联合假设检验(Joint Hypotheses Test),可以在H0下检验是否具有F分布
4.6.4.3.3. 常被用于分析多个相关因素对因变量的影响
浙公网安备 33010602011771号