《第一章 NLP 基础概念》学习笔记

NLP 是什么?

  • 定义:一门让计算机理解、解释和生成人类语言的技术,是 AI 的重要分支。
  • 目标:打破人机语言障碍,实现无缝交流。
  • 核心任务:模拟人类对语言的认知过程,处理从表层结构到深层语义(语境、情感、文化)的复杂信息。
  • 典型应用:分词、词性标注、文本分类、实体识别、机器翻译、自动问答等。

 NLP 发展的三个阶段

  • 早期探索(1940s-1960s):规则、字典、生成语法等核心技术,具有简单、依赖人工编写规则,效果差,无法处理复杂情况;
  • 符号主义与统计方法(1970s-1990s):规则系统 vs. 统计模型(HMM等)核心技术,具有统计方法开始取代复杂规则,成为主流,但仍受限于特征工程;
  • 机器学习与深度学习(2000s-至今):神经网络、RNN/LSTM、Transformer等核心技术,具有革命性突破:Word2Vec (词向量) -> BERT (预训练) -> GPT (大模型),性能逼近甚至超越人类;

NLP 核心任务详解

任务名称 核心目标 关键示例
中文分词 将连续的中文文本切分成有意义的词汇序列。 “雍和宫的荷花开的很好。” → “雍和宫 / 的 / 荷花 / 开 / 的 / 很 / 好 / 。”
子词切分 将词汇分解为更小的子词单元,解决未登录词问题。 “unhappiness” → “un”, “happi”, “ness”
词性标注 为句子中的每个词分配一个词性标签(名词、动词等)。 “She is playing.” → She(PRP), is(VBZ), playing(VBG)
文本分类 将文本自动分配到预定义的类别。 新闻分类:“NBA季后赛…” → “体育”
实体识别 识别文本中具有特定意义的实体并分类。 “李雷和韩梅梅去北京…” → [“李雷”:人名, “韩梅梅”:人名, “北京”:地名]
关系抽取 识别并抽取出实体之间的语义关系。 “比尔·盖茨是微软的创始人。” → (“比尔·盖茨”, “创始人”, “微软”)
文本摘要 生成简洁的摘要,概括原文核心内容。 抽取式:直接选取原文句子;生成式:理解后重新组织语言生成新句子。
机器翻译 将一种自然语言自动翻译成另一种。 “今天天气很好。” → “The weather is very nice today.”
自动问答 理解问题并从给定数据源中自动提供答案。 分为检索式、知识库问答、社区问答等。
 

文本表示的发展历程

技术阶段 核心思想 代表模型/方法 优点 缺点
词向量 (早期) 将文本表示为高维稀疏向量,每个维度对应一个词。 向量空间模型 / One-Hot 简单直观,易于计算相似度。 维数灾难、数据稀疏、无法表示语义关系。
语言模型 基于马尔可夫假设,用前 N-1 个词预测当前词。 N-gram 模型简单,效果好。 数据稀疏,无法捕捉长距离依赖。
词嵌入 (静态) 将词映射到低维、稠密的连续向量空间,语义相近的词距离近。 Word2Vec (CBOW/Skip-Gram) 解决稀疏问题,能捕捉语义关系。 一词一义,无法处理多义词,忽略上下文。
词嵌入 (动态) 根据上下文动态生成词的向量表示,实现“一词多义”。 ELMo (双向LSTM) 解决一词多义问题,表示更丰富准确。 模型复杂,训练计算成本高。

 

posted @ 2025-11-12 22:43  十一分平庸  阅读(30)  评论(0)    收藏  举报