文章分类 - Natural language processing
摘要:1. Word2Vec 工具 定义: \(\mathcal{V}\) :词表(dictionary)索引集合 \(V=|\mathcal{V}|\) 表示词表数量 一般来说,语料(corpus)中在词典以外的词会被过滤掉(即删除)。一般用停词(stop word)来过滤 \(w_c\) :中心词(词
阅读全文
摘要:1. 分词 分词,英文称为 Tokenize,图片 1.1 中文分词主要工具 jieba pkuseg THULAC 1.2 中文分词工具: jieba 分词 常用函数 jieba.cut(doc, cut_all=False, HMM=False) jieba.add_word(word, fre
阅读全文
摘要:1. 词频与逆向文件频率 1.1 公式 词频 term frequency, tf :词 (term) \(t_i\) 在文件(document)\(d_j\) 中的词频 \(\mathrm{tf}_{ij}\) 定义为: \[\mathrm{tf}_{ij} = {\frac {n_{ij}}{\
阅读全文
摘要:1. 中文分词 1.1 主要工具介绍 jieba pkuseg THULAC
阅读全文

浙公网安备 33010602011771号