随笔分类 -  NLP专栏

摘要:作者:尘心链接:https://zhuanlan.zhihu.com/p/76003775 简述 文本分类在文本处理中是很重要的一个模块,它的应用也非常广泛,比如:垃圾过滤,新闻分类,词性标注等等。它和其他的分类没有本质的区别,核心方法为首先提取分类数据的特征,然后选择最优的匹配,从而分类。但是文本 阅读全文
posted @ 2019-08-04 14:19 慕云深 阅读(3334) 评论(1) 推荐(1)
摘要:前言 CRF++是著名的条件随机场的开源工具,也是目前综合性能最佳的CRF工具。在这里我们简单介绍一下windows系统下CRF++的使用。 一、工具包的下载: CRF 的工具有两种,一种是支持Linux环境的,一种是支持Windows环境的,大家可以自行根据自己的系统进行下载。 (在此我下载的是C 阅读全文
posted @ 2019-07-02 08:25 慕云深 阅读(3317) 评论(0) 推荐(0)
摘要:Bidirectional LSTM-CRF Models for Sequence Tagging abstract: This paper systematically proposed four model, respectively named LSTM, LSTM+CRF, Bi-LSTM 阅读全文
posted @ 2019-07-01 18:40 慕云深 阅读(1620) 评论(0) 推荐(0)
摘要:Bert: Bidirectional Encoder Representations from Transformers. 主要创新点:Masked LM 和 Next sentence prediction。 NNLM:参考 :http://d0evi1.com/nnlm/ Bert是一个预训练 阅读全文
posted @ 2019-06-17 20:26 慕云深 阅读(586) 评论(0) 推荐(0)
摘要:参考:http://www.datagrand.com/blog/knowledge-map.html 一、什么是知识图谱? 知识图谱是由 Google 公司在 2012 年提出来的一个新的概念。从学术的角度,我们可以对知识图谱给一个这样的定义:“知识图谱本质上是语义网络(Semantic Netw 阅读全文
posted @ 2019-06-12 16:11 慕云深 阅读(13292) 评论(0) 推荐(0)
摘要:统计语言模型就是用来算一句话出现的概率大小,换句话说就是像不像人说的话。这个概率的计算可以先将句子进行分词,然后用 各个词的(条件)概率 求和来计算。 统计语言模型的参数就是每个概率值,长度为T的词组构成的句子的参数个数就是 T个 由于词库中的词数N很大,一个由长度为T的词组构成的句子的复杂度不计重 阅读全文
posted @ 2019-03-08 15:32 慕云深 阅读(706) 评论(0) 推荐(0)
摘要:恢复内容开始 1.分词: 基于规则的分词方法 1)正向最大匹配法(由左到右的方向) 2)逆向最大匹配法(由右到左的方向) 3)最少切分(使每一句中切出的词数最小) 4)双向最大匹配法(进行由左到右、由右到左两次扫描) 基于统计的分词方法中的互信息的运用:反应了字与字之间的紧密程度 深度学习下:双向L 阅读全文
posted @ 2019-03-06 10:46 慕云深 阅读(2342) 评论(0) 推荐(0)