随笔分类 - NLP专栏
摘要:作者:尘心链接:https://zhuanlan.zhihu.com/p/76003775 简述 文本分类在文本处理中是很重要的一个模块,它的应用也非常广泛,比如:垃圾过滤,新闻分类,词性标注等等。它和其他的分类没有本质的区别,核心方法为首先提取分类数据的特征,然后选择最优的匹配,从而分类。但是文本
阅读全文
摘要:前言 CRF++是著名的条件随机场的开源工具,也是目前综合性能最佳的CRF工具。在这里我们简单介绍一下windows系统下CRF++的使用。 一、工具包的下载: CRF 的工具有两种,一种是支持Linux环境的,一种是支持Windows环境的,大家可以自行根据自己的系统进行下载。 (在此我下载的是C
阅读全文
摘要:Bidirectional LSTM-CRF Models for Sequence Tagging abstract: This paper systematically proposed four model, respectively named LSTM, LSTM+CRF, Bi-LSTM
阅读全文
摘要:Bert: Bidirectional Encoder Representations from Transformers. 主要创新点:Masked LM 和 Next sentence prediction。 NNLM:参考 :http://d0evi1.com/nnlm/ Bert是一个预训练
阅读全文
摘要:参考:http://www.datagrand.com/blog/knowledge-map.html 一、什么是知识图谱? 知识图谱是由 Google 公司在 2012 年提出来的一个新的概念。从学术的角度,我们可以对知识图谱给一个这样的定义:“知识图谱本质上是语义网络(Semantic Netw
阅读全文
摘要:统计语言模型就是用来算一句话出现的概率大小,换句话说就是像不像人说的话。这个概率的计算可以先将句子进行分词,然后用 各个词的(条件)概率 求和来计算。 统计语言模型的参数就是每个概率值,长度为T的词组构成的句子的参数个数就是 T个 由于词库中的词数N很大,一个由长度为T的词组构成的句子的复杂度不计重
阅读全文
摘要:恢复内容开始 1.分词: 基于规则的分词方法 1)正向最大匹配法(由左到右的方向) 2)逆向最大匹配法(由右到左的方向) 3)最少切分(使每一句中切出的词数最小) 4)双向最大匹配法(进行由左到右、由右到左两次扫描) 基于统计的分词方法中的互信息的运用:反应了字与字之间的紧密程度 深度学习下:双向L
阅读全文

浙公网安备 33010602011771号