网络舆情分析技术概述
什么是网络舆情?为什么要分析网络舆情?如果不清楚,请查阅相关文档。闲言少序,直表正题。
难点技术·信息采集
信息采集中的难点是如何在网络上准确的抽取出想要获取的信息。对于一篇互联网上的文章而言,就是要准确的抽取出文章的标题、内容、发布时间、作者、发布人所使用的IP地址等。同时,信息采集还需要考虑自动化程度和执行效率。目前,采用正则表达式来抽取是比较简单的一种,优点是能够准确抽取,缺点是不能自动化,针对不同的页面布局需要编写不同的正则表达式。高一级的采集方式是引入机器学习功能,诸如BP网络、遗传算法等,由于目前大多数互联网文章是通过软件,使用发布模板进行发布的,因此通过机器学习首先抽取出文章发布时使用的模板,然后就能够准确获取文章的相关信息。面对信息的急剧膨胀,高自动化的抽取工具成为一种必需。需要提到的博客、微博、论坛的抽取和文章类的抽取方式不同。
+
难点技术·事件检测跟踪
在网络舆情分析中通常采用事件来组织信息,如何高效的检测出事件并且能够追踪事件的演化成为舆情分析中的重点。目前主流是采用聚类方式,比较简单的算法有K近邻或K均值,基于密度的聚类算法则能够较好的实现事件的检测和追踪,而层次聚类算法则能够将事件分成不同的层级,更加方便在事件上导航。
《基于话题特征统计的互联网热点分析技术》(作者:段建国,丁国栋,程学旗)提出了一种将文本聚类问题转换为话题特征聚类问题,方法分为文本预处理和话题发现与分析两个步骤。在文本预处理阶段,对文本进行分词、建立索引,将文本存入索引库。在分词的基础上,提取文本中的关键词列表,用一定数量的关键词列表来表示文本信息。而后采用两两关键词组合的方式构建话题特征,并存入话题特征库中。话题特征库是话题特征构成的一个图,在该图中,每个话题构成一个节点,节点之间的边表示话题之间的关系,在边和节点上都有一个权重,分别表示话题特征共现的频率和话题特征出现的频率,并据此可以发现当前的热点话题特征,并且能够对话题进行跟踪。
+
难点技术·情感分析
网络舆情分析中另一个关键点就是判断分析文章的情感倾向性,即分析出文章内涵作者的态度、情绪、观点、喜好等非内容或非事实信息。目前多数情感分析主要集中在文章的正负面,较常用的技术是根据词性的正负性来判断文章的正负性,比如在一篇文章中出现的正向性词的权重大于负向性词的权重,则文章判断为负向性。关于词的正负性,则可以根据种子词来进行判断,通用的方法是根据要判断的词与种子词在语料库中的共现频率来进行判断,比如:“雷锋光荣“,如果种子词为光荣,则雷锋的词性为正向性。另一种方法是使用分类的技术对文章的正负向性进行判断,常用的分类技术有SVM等。
需要提到的是在上述方案中,是对一篇文章进行正负向性分析,而实际的文章中,可能会有多个片断,不同的片断可能具有不同的情感倾向,诸如一篇文章上半部分讲一款笔记本电脑不错,下半部分说的是笔记本电脑的缺点等,这篇文章就应该分成两个不同的情感或观点。文章所表述的不同观点也是需要分析出来的,以上例为例,两片文章针对同一款笔记本电脑作了评价,其中A篇文章上半部分描述了笔记本电脑性能较好,下半部分描述了笔记本电脑发热量较大;而B篇文章上半部分描述了笔记本电脑整体性能较好,下半部分描述了笔记本电脑过重,移动不方便;
情感分析目前主要是基于词的正负向性来判断,缺少了语法、语义和语篇上的情感倾向性分析,这也是目前舆情分析中的不足。在自然语言处理领域,较于中文分词技术日渐成熟之外,针对语法、语义、语篇上的分析目前还不够成熟。
+
难点技术·文档摘要
文档摘要在舆情分析中主要表现在完成对整个话题的概述,也就是多文档摘要。有意思的是,网络舆情中的多文档摘要是用来概述话题的,而话题又会进行动态演化,产生不同的关注点,因此和普通的静态多文档摘要不同。针对动态文档,进行时序划分,在不同的时域进行多文档摘要是比较常用的一种实现。
浙公网安备 33010602011771号