文章分类 -  Natural language processing

摘要:1. Word2Vec 工具 定义: \(\mathcal{V}\) :词表(dictionary)索引集合 \(V=|\mathcal{V}|\) 表示词表数量 一般来说,语料(corpus)中在词典以外的词会被过滤掉(即删除)。一般用停词(stop word)来过滤 \(w_c\) :中心词(词 阅读全文
posted @ 2024-04-02 12:21 veager 阅读(101) 评论(0) 推荐(0)
摘要:1. 分词 分词,英文称为 Tokenize,图片 1.1 中文分词主要工具 jieba pkuseg THULAC 1.2 中文分词工具: jieba 分词 常用函数 jieba.cut(doc, cut_all=False, HMM=False) jieba.add_word(word, fre 阅读全文
posted @ 2022-05-19 15:37 veager 阅读(258) 评论(0) 推荐(0)
摘要:1. 词频与逆向文件频率 1.1 公式 词频 term frequency, tf :词 (term) \(t_i\) 在文件(document)\(d_j\) 中的词频 \(\mathrm{tf}_{ij}\) 定义为: \[\mathrm{tf}_{ij} = {\frac {n_{ij}}{\ 阅读全文
posted @ 2022-05-18 17:15 veager 阅读(264) 评论(0) 推荐(0)
摘要:1. 中文分词 1.1 主要工具介绍 jieba pkuseg THULAC 阅读全文
posted @ 2022-05-18 14:45 veager 阅读(57) 评论(0) 推荐(0)