数据可视化解释-第二部分--视觉变量简介
数据可视化解释(第二部分):视觉变量简介
原文:
towardsdatascience.com/data-visualization-explained-part-2-an-introduction-to-visual-variables/
因此,现在你已经了解了数据可视化背后的基础理念以及为什么它是数据科学生态系统中一个重要的组成部分。(如果你不熟悉这一点,请务必查看上面的文章。)
如前文所述,数据可视化的核心思想是找到一种有效的方式来以视觉方式表示各种类型的数据。
使这种表示方式起作用的关键基本概念被称为视觉编码通道。视觉编码通道实际上是数值、文本或其他形式的数据转换为视觉标记的有效手段。最好的理解方式是将其视为与你的数据全部或部分对应的一个视觉特征。有效的数据可视化通常使用多个视觉编码通道来表示数据的各个方面。
在这篇文章中,我们将深入探讨视觉编码通道的细节,并练习将复杂的可视化分解为其组成部分。这将为你设计自己的可视化作品做好准备。
视觉变量简介
在他的 1967 年作品《图形符号学》中,法国地图学家雅克·贝蒂恩概述了七个“视网膜”变量[1],这些变量之所以被称为“视网膜”,是因为人眼的视网膜对这些变量敏感:
-
位置(例如图上的坐标)
-
尺寸
-
形状
-
颜色色调
-
颜色值(从亮到暗)
-
方向
-
纹理
尽管贝蒂恩的工作是在几十年前发表的,但他的视觉变量仍然是现代数据可视化设计的优秀指南。在可视化开发的早期阶段,审查可用的视觉变量并确定用于数据中特定变量的视觉变量是一个好的做法。
这是一个可能令人困惑的概念,以下面的例子更容易理解。下面的图形通常被认为是可视化应用的杰作,由查尔斯·米纳德设计和绘制。它描绘了拿破仑对俄罗斯的失败入侵。

图片来源:维基媒体共享资源
这是一个简化并翻译过的版本,以方便阅读;原始版本,请见此处 [2]。
上图中使用了哪些不同的视觉变量?(提示:有很多。)作为一个练习,拿出笔和纸,尝试自己确定这一点。我们稍后会详细讲解。
最大化视觉变量的有效性
用于特定可视化的最佳视觉变量取决于数据。在这里,我们将探讨三种不同类型的数据:
-
定量: 具有自然顺序且适合进行数学运算的数值数据(即,对添加/减去/乘以/除以单个数据值是有意义的)。例如,工资和年龄是定量变量。
-
有序量: 具有自然顺序的分类数据(即,可以取固定数量值的非数值数据)。如果你曾经参加过有“强烈同意”、“同意”、“中立”、“不同意”和“强烈不同意”等答案选择的调查,那么你就已经看到了有序数据的应用。虽然对这个数据进行数学运算没有意义,但各种值仍然可以按“最好”到“最差”的顺序排列。
- 这也包括那些虽然没有“排名”但可能具有顺序的变量,例如交通信号灯模式。
-
名义量: 没有自然顺序的分类数据。一个很好的例子是颜色。虽然我们可以区分不同的颜色,但它们没有自然的顺序。(这也解释了为什么颜色通常是一个很好的名义变量的视觉编码,正如我们下面将要看到的!)
重要提示: 变量虽然是数字,但这并不意味着它自动就是定量的。例如,邮政编码是数字,但它们没有自然的顺序,也无法对它们进行数学运算。因此,邮政编码是一个名义量。
下表,是可视化专家 Jock D. Mackinlay 和 Stuart Card 设计的一个变体,概述了不同视觉变量根据数据类型的有效性[2]:
| 定量 | 有序 | 名义 |
|---|---|---|
| 位置 | 位置 | 位置 |
| 长度 | 密度 | 色调 |
| 角度 | 饱和度 | 纹理 |
| 斜率 | 色调 | 连接 |
| 面积 | 纹理 | 包含性 |
| 体积 | 连接 | 密度 |
| 密度 | 包含性 | 饱和度 |
| 饱和度 | 长度 | 形状 |
| 色调 | 角度 | 长度 |
| (删除)纹理 | 斜率 | 角度 |
| (删除)连接 | 面积 | 斜率 |
| (删除)包含性 | 体积 | 面积 |
| (删除)形状 | (删除)形状 | 体积 |
关于这些排名的一些要点:
-
位置是所有变量类型的最佳选择。例如,一个 x 轴上有名称、y 轴上有血压的条形图分别使用位置作为名义变量和定量变量。
-
在位置之后,每个变量类型的吸引力都会发生变化。这一点很重要,因为如果你正在绘制多个变量,你最终将不得不使用除了位置之外的其他方法,因为位置已经被使用了(通常是在带有两个轴的二维图表上)。
-
长度是位置的扩展,但特别适用于定量比较。
-
密度和饱和度非常适合有序变量,因为观众不需要确定确切值,他们只需要看到排名。
-
色调与形状对于名义变量来说效果很好,这使得看到类别差异变得容易。
-
-
一些选项被完全划掉,因为它们根本说不通。例如,形状不是定量或有序变量的可能编码选择,因为没有方法可以比较数量或理解顺序。
现在,让我们详细地通过一个例子来讲解如何分解视觉编码渠道。
米纳德地图:分解变量
让我们一起看看米纳德关于拿破仑入侵的地图。为了方便起见,这里再次展示。这个例子取自爱德华·图费著名的可视化书籍《定量信息的视觉展示》[3]。

图片来源:维基媒体共享资源
仔细研究这张地图,可以看出查尔斯·米纳德对视觉编码渠道的掌握堪称卓越。他的可视化展示了六个不同的变量:
-
地理位置(定量):位置用于在二维表面上显示拿破仑军队的位置(因此这实际上是两个变量)。入侵始于地图的左侧,即波兰-俄罗斯边境。我们还可以看到,有时军队的一部分会根据拿破仑的战略分支到不同的地点。
-
地理位置(定量):见上方。
-
时间(定量):仔细观察,我们可以看到在可视化底部的图表的 x 轴上列出了不同时间点。再次,位置用于显示这个变量。
-
温度(定量):温度在地图下方的图表中与时间的关系进行绘制。位置再次被使用,这次是在 y 轴上。
-
军队剩余兵力(定量):在地图上移动的形状的宽度代表拿破仑军队的兵力。很明显,随着入侵的进行,拿破仑的军队变得越来越小。他们最终只带着最初的 42.2 万名士兵中的 1 万名返回波兰。
-
军队移动方向(名义):颜色用于表示军队在不同位置移动的方向。米色/浅褐色(在我们上面的简化图像中为白色)表示军队向莫斯科移动,而黑色表示其撤退回波兰。
在他的书 [3] 中,图费将米纳德的地图称为可能是“有史以来最好的统计图形。”研究它可以激发我们想出巧妙的方式来视觉编码我们的数据。
最后的想法和展望
通过这篇第二篇文章,你已经了解了可视化设计背后的基础理念:视觉编码通道。在反思你所学的知识时,请记住以下关键点:
-
选择视觉编码通道往往可以决定一个可视化作品的成败。你可能有一个设计精美的图形,但如果视觉编码通道难以解读,观众将无法理解你想要表达的内容。
-
对于所有变量类型,位置都是至高无上的,但在二维环境中空间有限。因此,仔细考虑你用位置显示哪些变量;它们通常是最重要的变量。
-
尝试不同的设计!没有“唯一”的完美解决方案。相反,你必须修订和迭代,直到达到满意的程度。
在下一篇文章中,我们将讨论可视化设计的要点以及技术在过去几十年中的演变和扩展。在此之前。
参考文献
[1] 图形符号学,雅克·贝尔廷 (由 J. Ronald Eastman 翻译)
[2] ageofrevolution.org/200-object/flow-map-of-napoleons-invasion-of-russia/
[2] 信息可视化的阅读材料:用视觉思考 (Card, Mackinlay, 和 Shneiderman)
[3] 《定量信息的视觉展示》,爱德华·图费

浙公网安备 33010602011771号