Encoder-Decoder PLM 读书笔记

核心思想与背景

  • 问题背景:Encoder-Only模型(如BERT)存在MLM与下游任务不一致、无法处理超长输入等问题。Encoder-Decoder模型通过引入解码器解决这些问题,并推动NLP任务的统一化。
  • T5模型:Google提出的Text-To-Text Transfer Transformer,核心是将所有NLP任务统一为“文本到文本”的转换问题,简化模型设计并提升泛化能力。

T5模型三大核心

1. 模型结构:Encoder-Decoder
  • 整体架构:
    • 编码器:处理输入文本,捕捉全局依赖(Self-Attention)。
    • 解码器:生成输出文本,包含两种注意力机制:
      • Self-Attention:建模输出序列内部依赖。
      • Encoder-Decoder Attention:连接输入与输出序列。
    • 归一化改进:采用RMSNorm替代LayerNorm,仅保留可学习缩放参数,提升稳定性(公式:RMSNorm(x) = (x / sqrt(mean(x²) + ε)) * g)。
  • 灵活性:Block设计类似乐高,可调整层数适应任务复杂度。
2. 预训练任务
  • 核心任务:MLM(掩码语言建模),随机遮蔽15%的token并预测。
  • 输入格式:文本到文本,用占位符替换被遮蔽token。
  • 数据集:C4(Colossal Clean Crawled Corpus),750GB清洗后的英文文本。
  • 多任务预训练:混合多种任务(如翻译、分类)提升通用性。
  • 预训练到微调:统一文本格式,下游任务微调时调整解码策略。
3. 大一统思想
  • 核心理念:所有NLP任务(分类、翻译、问答等)统一为文本输入→文本输出。
  • 任务前缀:输入前添加任务描述(如classify:、translate English to French:),明确任务类型。
  • 优势:
    • 简化模型设计,共享参数和训练框架。
    • 提升多任务学习性能,减少任务特定调试。
    • 示例:
      • 分类:输入classify: 很好的产品 → 输出正面。
      • 翻译:输入translate English to French: How are you? → 输出Comment ça va?。
posted @ 2025-11-22 00:17  十一分平庸  阅读(14)  评论(0)    收藏  举报