《第一章 NLP 基础概念》学习笔记
NLP 是什么?
- 定义:一门让计算机理解、解释和生成人类语言的技术,是 AI 的重要分支。
- 目标:打破人机语言障碍,实现无缝交流。
- 核心任务:模拟人类对语言的认知过程,处理从表层结构到深层语义(语境、情感、文化)的复杂信息。
- 典型应用:分词、词性标注、文本分类、实体识别、机器翻译、自动问答等。
NLP 发展的三个阶段
- 早期探索(1940s-1960s):规则、字典、生成语法等核心技术,具有简单、依赖人工编写规则,效果差,无法处理复杂情况;
- 符号主义与统计方法(1970s-1990s):规则系统 vs. 统计模型(HMM等)核心技术,具有统计方法开始取代复杂规则,成为主流,但仍受限于特征工程;
- 机器学习与深度学习(2000s-至今):神经网络、RNN/LSTM、Transformer等核心技术,具有革命性突破:Word2Vec (词向量) -> BERT (预训练) -> GPT (大模型),性能逼近甚至超越人类;
NLP 核心任务详解
| 任务名称 | 核心目标 | 关键示例 |
| 中文分词 | 将连续的中文文本切分成有意义的词汇序列。 | “雍和宫的荷花开的很好。” → “雍和宫 / 的 / 荷花 / 开 / 的 / 很 / 好 / 。” |
| 子词切分 | 将词汇分解为更小的子词单元,解决未登录词问题。 | “unhappiness” → “un”, “happi”, “ness” |
| 词性标注 | 为句子中的每个词分配一个词性标签(名词、动词等)。 | “She is playing.” → She(PRP), is(VBZ), playing(VBG) |
| 文本分类 | 将文本自动分配到预定义的类别。 | 新闻分类:“NBA季后赛…” → “体育” |
| 实体识别 | 识别文本中具有特定意义的实体并分类。 | “李雷和韩梅梅去北京…” → [“李雷”:人名, “韩梅梅”:人名, “北京”:地名] |
| 关系抽取 | 识别并抽取出实体之间的语义关系。 | “比尔·盖茨是微软的创始人。” → (“比尔·盖茨”, “创始人”, “微软”) |
| 文本摘要 | 生成简洁的摘要,概括原文核心内容。 | 抽取式:直接选取原文句子;生成式:理解后重新组织语言生成新句子。 |
| 机器翻译 | 将一种自然语言自动翻译成另一种。 | “今天天气很好。” → “The weather is very nice today.” |
| 自动问答 | 理解问题并从给定数据源中自动提供答案。 | 分为检索式、知识库问答、社区问答等。 |
文本表示的发展历程
| 技术阶段 | 核心思想 | 代表模型/方法 | 优点 | 缺点 |
| 词向量 (早期) | 将文本表示为高维稀疏向量,每个维度对应一个词。 | 向量空间模型 / One-Hot | 简单直观,易于计算相似度。 | 维数灾难、数据稀疏、无法表示语义关系。 |
| 语言模型 | 基于马尔可夫假设,用前 N-1 个词预测当前词。 | N-gram | 模型简单,效果好。 | 数据稀疏,无法捕捉长距离依赖。 |
| 词嵌入 (静态) | 将词映射到低维、稠密的连续向量空间,语义相近的词距离近。 | Word2Vec (CBOW/Skip-Gram) | 解决稀疏问题,能捕捉语义关系。 | 一词一义,无法处理多义词,忽略上下文。 |
| 词嵌入 (动态) | 根据上下文动态生成词的向量表示,实现“一词多义”。 | ELMo (双向LSTM) | 解决一词多义问题,表示更丰富准确。 | 模型复杂,训练计算成本高。 |

浙公网安备 33010602011771号