读数据可视化22文本和文档(下)

1. 文本内容可视化
1.1. 文本内容的可视化是以文本内容作为信息对象的可视化
1.2. 文本内容的表达包括关键词、短语、句子和主题,文档集合还包括层次性文本内容,时序性文本集合还包括时序性变化的文本内容
1.3. 基于关键词的文本内容可视化
-
1.3.1. 关键词*是从文本的文字描述中提取的语义单元,可反映文本内容的侧重点
-
1.3.2. 关键词可视化指以关键词为单位可视地表达文本内容
-
1.3.3. 常见的方法是词频,即越是重要的单词,其在文档中出现的频率越高
-
1.3.4. 标签云
-
1.3.4.1. Tag Cloud
-
1.3.4.2. Text Cloud
-
1.3.4.3. Word Cloud
-
1.3.4.4. 是最简单、最常用的关键词可视化技术
-
1.3.4.5. 直接抽取文本中的关键词并将其按照一定顺序、规律和约束整齐美观地排列在屏幕上
-
1.3.4.6. 标签云利用颜色和字体大小反映关键词在文本中分布的差异
-
1.3.4.7. 用颜色或字体大小,或者它们的组合来表示重要性,越是重要的词汇,其字体越大,颜色越显著,反之亦然
-
1.3.5. Wordle
-
1.3.5.1. 另一种广泛应用的标签云衍化技术
-
1.3.5.2. 和标签云方法一样,Wordle利用颜色和字体映射关键词的重要性,但Wordle在空间利用和美学欣赏方面有所提升
-
1.3.5.3. Wordle改进了关键词的布局算法
-
1.3.5.4. Wordle定义空间填充的路径,并初始化每个单词的初始位置为路径的起点
-
1.3.5.5. 路径定义的多样性,使Wordle可以实现各种美观的布局效果图
-
1.3.6. EdWordle
-
1.3.6.1. 传统Wordle的一种拓展形式,是一种可持续编辑词云的方法
-
1.3.6.2. 核心是允许用户移动和编辑单词,同时保留其他单词的邻域
-
1.3.6.3. 通过将约束性刚体仿真与局部Wordle算法相结合,来更新词云并创建紧凑的布局
-
1.3.6.4. EdWordle的一致性和稳定性使用户能够创建新形式的词云
1.3.6.4.1. 故事云
-
1.3.7. 文档散
-
1.3.7.1. DocuBurst
-
1.3.7.2. 不仅采用关键词可视化文本的内容,还借鉴这些关键词汇在人类词汇中的关系来布局关键词
-
1.3.7.3. 在人类词汇中,单词间存在语义层级关系,即有些词是其他词元的下义词
-
1.3.7.4. 在一篇文章中,*单词和其下义词往往是并存的
-
1.3.7.5. 采用径向布局,外圈的词汇是里圈词汇的下义词,圆心处的关键词是文章所涉及内容的最上层概述
-
1.3.8. 文档卡片
-
1.3.8.1. Document Cards
-
1.3.8.2. 采用文档中的关键图片和关键词来可视地呈现文档的内容
1.4. 时序性的文本内容可视化
-
1.4.1. 对于具有时间和顺序属性的文本,文本内容具有有序演化的特点
-
1.4.2. 主题河流
-
1.4.2.1. ThemeRiver
-
1.4.2.2. 一种经典的展现文本集合中主题演化的可视化方法
-
1.4.2.3. 采用河流作为可视原语来编码文档集合中的主题信息,将主题隐喻为时间上不断延续的河流
-
1.4.3. TIARA
-
1.4.3.1. 主题流在辅助用户理解每个时间段的主题内容方面存在*局限性
1.4.3.1.1. 只能将每个主题在每个时间刻度上概括为一个简单的数值
1.4.3.1.2. 一个简单的度量数值常常不足以完整准确地描述主题所包括的细节内容
-
1.4.3.2. TIARA系统不仅使用了更为有效的文本分析技术,而且改进了布局算法,并在可视化中加入了能够帮助用户理解文本主题的关键词信息
-
1.4.3.3. 将标签云技术与主题流结合,用其来描述文本主题在内容上随时间推进而发生的变化
-
1.4.3.4. 为每个文本主题在每个时间点上提取出不同的关键词,然后将这些词排布在相应色带上的相应位置,并用词的大小表示关键词在该时刻出现的频率
-
1.4.3.5. 为了紧凑美观地排列主题支流,TIARA系统还设计了一系列自动调节支流顺序的算法
-
1.4.4. 历史流
-
1.4.4.1. History Flow
-
1.4.4.2. 除了时序性主题可视化,文本内容的文字随着时间推移而发生的变化也是用户分析所需要观察的
-
1.4.4.3. 设计初衷*是可视地表达每个版本的维护者和他们所做的修改
1.5. 文本特征的分布模式可视化
-
1.5.1. 文本可视化还可用于呈现文本特征在单个文档或文档集合中的分布模式,如关键词、句子的平均长度及词汇量等
-
1.5.2. 文本弧
-
1.5.2.1. TextArc
-
1.5.2.2. 语义单元,如单词、短语等,在文档中的分布模式也是用户关心的文本信息
-
1.5.2.3. 可用来可视化一个文档中的词频和词的分布情况
-
1.5.2.4. 单词的放置位置由单词出现的位置和频率决定,即在全文各处出现频繁的词汇靠近画布中心,而在局部频繁出现的单词靠近其相应的螺线区域
-
1.5.3. 文献指纹
-
1.5.3.1. Literature Fingerprinting
-
1.5.3.2. 帮助用户了解某一特征在全文中的分布规律
-
1.5.3.3. 将特征在整个文本中的分布用一系列像素图(Pixel Chart)表达,这些像素图称为文献特征指纹
-
1.5.3.4. 可呈现特征的全局分布情况,方便用户对比信息的分布差异
-
1.5.3.5. 句子的平均长度是文本度量特征,用于辨识作者的写作风格
-
1.5.4. 文本特征透镜
-
1.5.4.1. Feature Lens
-
1.5.4.2. 用于可视化文本特征在一个文档集合中不同粒度的分布情况,如关键词、短语和句子的频率
-
1.5.5. 平行标签云
-
1.5.5.1. Parallel Tag Clouds
-
1.5.5.2. 结合平行坐标和标签云技术可视化文本的不同层面的特征与信息
-
1.5.5.3. 平行坐标的每一列代表用户感兴趣的某一层面的文本信息,每一列的标签云可视化该层面的文本内容
-
1.5.5.4. 折线可视化用户感兴趣的关键词在不同层面的分布情况
-
1.5.6. Poemage
-
1.5.6.1. 是可视化与抒发万千情感的诗歌紧密结合的产物
-
1.5.6.2. 用如诗歌一样浪漫的表达方式来表现诗歌韵律的拓扑结构,包括诗歌的空间、韵律与韵律拓扑
-
1.5.6.3. 将每首诗歌编码为一个流,每一条代表韵律关系的线就是一个细流,其穿梭在整个流之中
1.6. 文档信息检索可视化
-
1.6.1. 在进行信息检索时,采用可视化方法辅助用户了解检索结果,并揭示结果的分布规律,可以显著提升用户的搜索体验,帮助评估搜索结果
-
1.6.2. 常用于可视化的检索细节包括检索文档、查询项的相似性和检索文档所涉及的词汇等
-
1.6.3. TileBar
-
1.6.3.1. 使用丰富的可视技术帮助用户分析检索到的每篇文档和查询项间的匹配程度的信息
-
1.6.3.2. 为用户提供了一个关于文档长度、查询项频率和查询项分布的视觉搜索反馈机制
-
1.6.4. Sparkler
-
1.6.4.1. 通过可视化提供了查询项和检索到的文档集之间匹配程度的概览,也可用于比较不同查询项的检索结果之间的差异
-
1.6.4.2. 核心原理*是采用点之间的距离代表文档和查询项的匹配程度,即距离越短,匹配度越高,反之亦然
-
1.6.4.3. 采用了径向布局方式
1.7. 软件可视化
-
1.7.1. SeeSoft
-
1.7.1.1. 着眼于可视化每行代码的信息,例如相关的程序员、修改日期和修改量等
-
1.7.2. Code_Swarm
-
1.7.2.1. 一个对软件开发过程可视化的软件
-
1.7.2.2. 主要考虑三个因素:开发和维护的文档类型、文档的提交时间和项目的参与人员
2. 文本关系可视化
2.1. 基于文本关系的可视化旨在可视表达文本或文档集合(Corpus或Document Collection)内蕴含的关系信息
2.2. 文档相似性可视化
-
2.2.1. 多个文档之间的相似和差异是人们对一个文档集合非常感兴趣的问题
-
2.2.2. 主元分析 (Principal Component Scaling,PCA)、多维尺度分析(Multidimensional Scaling,MDS)和自组织映射(Self-organizing Map,SOM)是常用的投影算法
-
2.2.3. 星系视图
-
2.2.3.1. Galaxy View
-
2.2.3.2. 采用仿生的方法可视表达文档间的相似性
-
2.2.3.3. 每个文档被看成星系中一颗星星,通过投影的方法将所有文档按照其主题的相似性投影为二维平面的点集,点之间的二维距离与其主题相似性成正比,即主题越相似的文本所对应的点位置越相近,反之亦然
-
2.2.4. 主题地貌
-
2.2.4.1. ThemeScape
-
2.2.4.2. 对星系视图方法的一种改进
-
2.2.4.3. 在其所计算的文档投影位置的基础上,采用等高线的方式可视表达文档集合中相似文档的分布情况
-
2.2.4.4. 文档位置分布的疏密程度映射为山体高度,等高线和颜色共同刻画文本分布的密度
-
2.2.4.5. 文档越相似,则点分布越密集,从而等高线越紧密,颜色越显著
-
2.2.4.6. 主题地貌方法比星系视图方法更直观地揭示了文档集合的主题分布和每个主题所涉及的文档数量的差异性对比
-
2.2.5. 基于范例的大文本集合投影
-
2.2.5.1. 常见的文本投影方法一次性将所有文本投影到二维空间中,如果数量过大,则可视化结果比较混乱
-
2.2.5.2. 先将少量样例文本投影到二维空间,再根据用户选取的样例,后续选择一些相关的文本投影在二维空间中
-
2.2.6. StarSPIRE
-
2.2.6.1. 在力引导布局的基础上,提出了多模型语义交互的流程,用户可以进行交互的空间化,将其*数据知识外化
2.3. 文本内容关联可视化
-
2.3.1. 单词树
-
2.3.1.1. Word Tree
-
2.3.1.2. 从句法层面可视表达文本词汇的前缀关系
-
2.3.1.3. 单词树方法利用树型结构来可视化文本中的句子
-
2.3.1.4. 树的根节点是用户感兴趣的一个词,子节点是原文中搭配在父节点后面的词或短语
-
2.3.2. 短语网络
-
2.3.2.1. Phrase Nets
-
2.3.2.2. 采用节点-链接图展示无结构文本中语义单元彼此间的关系,如“X is Y”
-
2.3.3. 新闻地图
-
2.3.3.1. NewsMap
-
2.3.3.2. 树图方法也可用于刻画文本间的相似性
-
2.3.3.3. 采用树图组织类型相近的新闻
2.4. 文档集合关系可视化
-
2.4.1. JigSaw
-
2.4.1.1. 为了帮助用户分析集合中的文档以及文档中存在的实体间的相互关系,JigSaw系统采用了多种可视化视图,并提供了一系列交互方法帮助用户在多个视图间切换和深入分析感兴趣的文档与实体以及它们的关系信息
-
2.4.2. ContexTour
-
2.4.2.1. ContexTour可视化文档集合所涉及的多个层面的内容和各个层面间的关系,*以学术文章为例,即会议、作者和关键词这三个层面
-
2.4.3. FacetAtlas
-
2.4.3.1. 从文本信息的内容与关系的角度出发,分析并解释多层面的文本信息
-
2.4.3.2. 从谷歌在线医疗健康文档中提取疾病名称、病因、症状、治疗方法等多个层面的信息,每个层面信息出现在不同的病例文档中
-
2.4.3.3. FacetAtlas将相关的实体信息采用圆圈可视编码实体,按其文档的归属布局在空间中,*属于同一类别的实体,位置关系相近
3. 文件情感分析可视化
3.1. 文本中往往蕴含了描述人类主观喜好、赞赏、感觉的情感信息
3.2. 情感分析(又称意见挖掘,Sentiment Analysis或Opinion Analysis)常被应用于论坛用户发言、社交网络、微博数据以及各种调研报告等文本中
3.3. 情感分析的挖掘技术可提取出文本中主观性的信息,并通常转化为一个区间分数,一端为正面、积极的倾向;另一端为负面、消极的倾向
3.4. 顾客评价可视化
-
3.4.1. Term Frequency and Inverse Class Frequency(TFICF),对用户的反馈进行量化评分
-
3.4.2. SocialBrands
-
3.4.2.1. 综合利用了市场中的品牌个性框架与社会学计算方法来计算表现品牌个性的三要素:用户印象、员工印象和官方公告,并通过构建一个证据网络,解释品牌个性与驱使因素之间的关系
-
3.4.2.2. SocialBrands使用品牌轮的隐喻,将公众对某个品牌的评价做了可视化映射
3.5. 情感变化可视化
-
3.5.1. Pearl
-
3.5.1.1. 是一个多维情感变化分析的工具
-
3.5.1.2. 对来自社交媒体的大量文本,Pearl自动检测某个个体在不同时间点表达的情绪,并基于聚类的方法对这些情绪进行总结,以揭示该个体的情感风格
3.6. 情感差异可视化
-
3.6.1. 情感地图
-
3.6.1.1. Sentiment Map
-
3.6.1.2. 结合地理信息,表达了不同来源的新闻报道情感倾向性的不同,即新闻视点的差异
浙公网安备 33010602011771号