核心思想与背景
- 问题背景:Encoder-Only模型(如BERT)存在MLM与下游任务不一致、无法处理超长输入等问题。Encoder-Decoder模型通过引入解码器解决这些问题,并推动NLP任务的统一化。
- T5模型:Google提出的Text-To-Text Transfer Transformer,核心是将所有NLP任务统一为“文本到文本”的转换问题,简化模型设计并提升泛化能力。
T5模型三大核心
1. 模型结构:Encoder-Decoder
- 整体架构:
- 编码器:处理输入文本,捕捉全局依赖(Self-Attention)。
- 解码器:生成输出文本,包含两种注意力机制:
- Self-Attention:建模输出序列内部依赖。
- Encoder-Decoder Attention:连接输入与输出序列。
- 归一化改进:采用RMSNorm替代LayerNorm,仅保留可学习缩放参数,提升稳定性(公式:
RMSNorm(x) = (x / sqrt(mean(x²) + ε)) * g)。
- 灵活性:Block设计类似乐高,可调整层数适应任务复杂度。
2. 预训练任务
- 核心任务:MLM(掩码语言建模),随机遮蔽15%的token并预测。
- 输入格式:文本到文本,用占位符替换被遮蔽token。
- 数据集:C4(Colossal Clean Crawled Corpus),750GB清洗后的英文文本。
- 多任务预训练:混合多种任务(如翻译、分类)提升通用性。
- 预训练到微调:统一文本格式,下游任务微调时调整解码策略。
3. 大一统思想
- 核心理念:所有NLP任务(分类、翻译、问答等)统一为文本输入→文本输出。
- 任务前缀:输入前添加任务描述(如
classify:、translate English to French:),明确任务类型。
- 优势:
- 简化模型设计,共享参数和训练框架。
- 提升多任务学习性能,减少任务特定调试。
- 示例:
- 分类:输入
classify: 很好的产品 → 输出正面。
- 翻译:输入
translate English to French: How are you? → 输出Comment ça va?。
posted @
2025-11-22 00:17
十一分平庸
阅读(
14)
评论()
收藏
举报