自然语言处理

文本预处理

  • 文本清洗-去除噪声及标准化文本
  • 分词-将文本分解成词汇、句子等
  • 去除停用词-去除频繁出现但对分析意义不大的词
  • 词干提取-找到单词的词干或根形式
  • 词形还原-词条的基本形式或词元形式
  • 词性标注-如名词、动词、形容词等
  • 命名实体识别-如人名、地点、组织

特征提取

  • 词袋模型 bag of words-忽略顺序、关注次数
  • 词嵌入 word embedding-真实意义上的相似

模型训练

  • 模型评估与应用
posted @ 2024-08-16 22:28  505donkey  阅读(23)  评论(0)    收藏  举报