左手中倒影

hadoop技术控 大数据解决方案 hanlp研究爱好者
  博客园  :: 首页  :: 新随笔  :: 联系 :: 订阅 订阅  :: 管理

05 2019 档案

摘要:一、中文分词工具 (1)Jieba (2)snowNLP分词工具 (3)thulac分词工具 (4)pynlpir 分词工具 (5)StanfordCoreNLP分词工具 1.from stanfordcorenlp import StanfordCoreNLP 2.with StanfordCor 阅读全文

posted @ 2019-05-31 10:14 左手中倒影 阅读(998) 评论(0) 推荐(0)

摘要:以下分词工具均能在Python环境中直接调用(排名不分先后)。 1、jieba(结巴分词) 免费使用 2、HanLP(汉语言处理包) 免费使用 3、SnowNLP(中文的类库) 免费使用 4、FoolNLTK(中文处理工具包) 免费使用 5、Jiagu(甲骨NLP) 免费使用 6、pyltp(哈工大 阅读全文

posted @ 2019-05-29 09:37 左手中倒影 阅读(503) 评论(0) 推荐(0)

摘要:在进行文本分类(非情感分类)时,我们经常只保留实词(名、动、形)等词,为了文本分类的分词方便,HanLP专门提供了实词分词器类NotionalTokenizer,同时在分类数据集加载处理时,默认使用了NotionalTokenizer分词器。 在HanLPJava版代码库中可以查看下边的文件中的函数 阅读全文

posted @ 2019-05-27 10:07 左手中倒影 阅读(908) 评论(0) 推荐(0)

摘要:一、说明 博主的配置 1:window10 2:myeclipse 3:jdk1.8 备注:文章分享自贾继康的博客,博客使用的hanlp是1.6.8的版本。大家可以去下载最新的1.7版本了,也比较推荐使用最新的这个版本! 二、资源获取 1、hanlp jar包获取:可以github上下载。本文中使用 阅读全文

posted @ 2019-05-24 09:37 左手中倒影 阅读(353) 评论(0) 推荐(0)

摘要:停用词表的修改 停用词表在“pyhanlp\static\data\dictionary”路径下的“stopwords.txt”文件中,CoreStopWordDictionary.apply方法支持去除停用词。如果需要修改停用词表,则直接编辑文件“stopwords.txt”,之后删除路径下的“s 阅读全文

posted @ 2019-05-22 09:03 左手中倒影 阅读(2651) 评论(0) 推荐(0)

摘要:作者:baiziyu 关于hanlp的文章已经分享过很多,似乎好像大部分以理论性的居多。最近有在整理一些hanlp应用项目中的文章,待整理完成后会陆续分享出来。本篇分享的依然是由baiziyu 分享的一篇文章,感兴趣的可以在知乎上关注下他的专栏,写的还是挺好的! 以下为文章的主要内容: 自定义词表的 阅读全文

posted @ 2019-05-20 09:09 左手中倒影 阅读(187) 评论(0) 推荐(0)

摘要:Pyhanlp分词与词性标注的相关内容记得此前是有分享过的。可能时间太久记不太清楚了。以下文章是分享自“baiziyu”所写(小部分内容有修改),供大家学习参考之用。 简介 pyhanlp是HanLP的Python接口。因此后续所有关于pyhanlp的文章中也会写成HanLP。HanLP是完全用Ja 阅读全文

posted @ 2019-05-18 09:50 左手中倒影 阅读(438) 评论(0) 推荐(0)

摘要:本篇给大家分享baiziyu 写的HanLP 中的N-最短路径分词。以为下分享的原文,部分地方有稍作修改,内容仅供大家学习交流! 首先说明在HanLP对外提供的接口中没有使用N-最短路径分词器的,作者在官网中写到这个分词器对于实体识别来说会比最短路径分词稍好,但是它的速度会很慢。对此我有点个人看法, 阅读全文

posted @ 2019-05-17 09:25 左手中倒影 阅读(340) 评论(0) 推荐(0)

摘要:中文分词是中文文本处理的一个基础步骤,也是中文人机自然语言交互的基础模块。不同于英文的是,中文句子中没有词的界限,因此在进行中文自然语言处理时,通常需要先进行分词,分词效果将直接影响词性、句法树等模块的效果。当然分词只是一个工具,场景不同,要求也不同。 在人机自然语言交互中,成熟的中文分词算法能够达 阅读全文

posted @ 2019-05-13 09:50 左手中倒影 阅读(832) 评论(0) 推荐(0)

摘要:HanLP 1.7.3 发布了。HanLP 是由一系列模型与算法组成的 Java 工具包,目标是普及自然语言处理在生产环境中的应用。HanLP 具备功能完善、性能高效、架构清晰、语料时新、可自定义的特点。 在提供丰富功能的同时,HanLP 内部模块坚持低耦合、模型坚持惰性加载、服务坚持静态提供、词典 阅读全文

posted @ 2019-05-10 09:24 左手中倒影 阅读(165) 评论(0) 推荐(0)

摘要:HanLP分词,如README中所说,如果没有特殊需求,可以通过maven配置,如果要添加自定义词典,需要下载“依赖jar包和用户字典". 分享某大神的示例经验: 是直接"java xf hanlp-1.6.8-sources.jar" 解压源码,把源码加入工程(依赖本地jar包,有些麻烦,有时候到 阅读全文

posted @ 2019-05-08 09:28 左手中倒影 阅读(656) 评论(0) 推荐(0)

摘要:使用 HanLP - 汉语言处理包 来处理,他能处理很多事情,如分词、调用分词器、命名实体识别、人名识别、地名识别、词性识别、篇章理解、关键词提取、简繁拼音转换、拼音转换、根据输入智能推荐、自定义分词器 使用很简单,只要引入hanlp.jar包,便可处理(新版本的hanlp安装包可以去github下 阅读全文

posted @ 2019-05-06 10:18 左手中倒影 阅读(2836) 评论(0) 推荐(0)