摘要:
一.通常关于文本聚类也都是针对已有的一堆历史数据进行聚类,比如常用的方法有kmeans,dbscan等。如果有个需求需要针对流式文本进行聚类(即来一条聚一条),那么这些方法都不太适用了,当然也有很多其它针对流式数据进行动态聚类方法,动态聚类也有很多挑战,比如聚类个数是不固定的,聚类的相似阈值也不好设 阅读全文
posted @ 2019-10-16 22:12
石头木
阅读(6176)
评论(1)
推荐(1)
摘要:
一.实体识别作为信息抽取中基础的也是重要的一步,其技术可以分为三类,分别是其于规则的方法、其于统计模型的方法以及基于深度学习的方法。 基于规则的方法,主要依靠构建大量的实体抽取规则,一般由具有一定领域知识的专家手工构建。然后将规则与文本进行匹配,识别出实体。 基于统计的方法,需要一定的标注语料进行训 阅读全文
posted @ 2019-10-16 21:55
石头木
阅读(1494)
评论(0)
推荐(0)

浙公网安备 33010602011771号