停用词
停用词是指在信息检索中,为节省存储空间和提高搜索效率,在处理自然语言数据(或文本)之前或之后会自动过滤掉某些字或词,这些字或词即被称为Stop Words(停用词)。这些停用词都是人工输入、非自动化生成的,生成后的停用词会形成一个停用词表。
简洁的来说就是机器学习中,为了使提取关键字更加简洁、高效。
我收集了一些停用词,可供使用。
https://github.com/goto456/stopwords