AI Infra 大厂专题【左扬精讲】—— 大模型训练的时代背景与挑战

AI Infra 大厂专题【左扬精讲】—— 大模型训练的时代背景与挑战

阅读前必读:本文数据使用与免责说明

本文涉及的行业数据(如 GPT-3 训练成本、DeepSeek 模型规模、国内芯片算力差距等)来源于 公开报告、行业分享、课程材料 等多渠道整理,仅用于说明大模型训练的时代背景与趋势脉络。

  • 数据时效性:不同来源对同一指标的统计口径可能存在差异(如参数规模含/不含 Embedding、算力换算单位不同),文中数据为课堂讲述用近似值,部分数据可能随版本迭代而变化。
  • 非财务建议:文中提到的成本、能耗、数字仅是事实陈述,不构成任何投资建议,读者请勿据此做出商业决策。
  • 非官方表述:关于"行业共识"、"拐点"、"领先"等定性词汇是对多方公开观点的综合归纳,并非某一厂商或机构的官方定论。
  • 结论可证伪:文中关于"参数边际收益递减"、"优化降本"等结论以行业普遍公开案例(如 DeepSeek 系列)为依据,随着技术演进也可能被新研究刷新。

总结一句话:本文所有数据仅供学习参考,请以一手官方资料为准;如数据有更新,以最新发布为准。

本篇聚焦大模型训练的核心议题,从 参数规模爆发算力供需矛盾完整训练流程 三大维度展开,帮助读者建立对大模型训练全貌的系统认知。

大模型完整训练流程
  |
  +-- 数据工程
  |   +-- 数据采集(Web、书籍、代码库等)
  |   +-- 数据清洗(去重、质量过滤、安全过滤)
  |   +-- 质量评估(困惑度、质量打分)
  |   +-- 分词(Tokenization)
  |
  +-- 预训练(Pretraining)
  |   +-- 无监督自回归学习
  |   +-- 算力消耗占整体 90%+
  |   +-- 分布式并行训练(DP/TP/PP/FSDP)
  |
  +-- 微调(Fine-tuning)
  |   +-- 全参数微调(Full Fine-tuning)
  |   +-- 高效微调(LoRA、Prefix Tuning)
  |
  +-- 人类对齐(RLHF)
  |   +-- 监督微调 SFT
  |   +-- 奖励模型训练 RM
  |   +-- 强化学习 PPO
  |
  +-- 部署推理
      +-- 模型压缩(量化、剪枝)
      +-- 推理优化(Triton、vLLM)
      # 大模型训练全流程核心阶段

大模型训练预训练微调RLHF分布式训练算力优化PyTorch 2.x

学习重点提示

本篇深入探讨大模型训练的时代背景、核心挑战与完整训练流程。以下是每个主题你需要掌握的深度说明:

参数规模演进与Scaling Laws(What & How & Why):

  • What大模型参数规模从 GPT-3 的 1750 亿爆发式增长到万亿级别,国内已突破 10 万亿参数规模。
  • How能说出 GPT-3、GPT-4、Llama、DeepSeek 等关键里程碑;能区分"规模竞赛"与"效率优化"两个发展阶段。
  • Why理解"规模为王"背后的幂律规律;理解 2025-2026 年行业拐点——参数超 5000 亿后能力提升不足 5%,行业转向"更聪明、更高效、更实用"。

算力供需矛盾(What & How & Why):

  • What大模型算力需求每 3-4 个月翻倍,增速是摩尔定律的 4-6 倍;硬件供给存在高端 GPU 受限、训练成本高、结构错配、国产生态不完善四大瓶颈。
  • How能列举四大硬件瓶颈的具体表现;能说出 AI Infra 优化在硬件固定前提下提升效率的核心逻辑。
  • Why理解供需错配催生训练优化领域的必然性;理解 DeepSeek 以低成本实现对标 GPT-4 效果的示范意义。

数据工程(What & How & Why):

  • What数据工程处理 PB 级多源文本,包含采集、清洗、质量评估、分词四大环节。
  • How能说出数据工程的四个核心步骤;能理解语料质量直接决定模型性能上限。
  • Why理解"Garbage In, Garbage Out"——没有高质量数据,再强大的架构也无法训练出优秀模型。

预训练核心原理(What & How & Why):

  • What预训练是无监督自回归学习,让模型习得通用语言、逻辑、常识;算力消耗占整体 90% 以上。
  • How能画出预训练的基本流程;能解释 Next Token Prediction 目标函数。
  • Why理解预训练是模型能力的基础——模型的语言理解、逻辑推理、知识储备主要在预训练阶段奠定。

微调与对齐(What & How & Why):

  • What微调基于少量标注数据适配对话、行业任务;对齐(RLHF)解决模型输出不友好、不符合人类预期的问题。
  • How能区分全参数微调与 LoRA 等高效微调方案;能说出 RLHF 三步流程(SFT -> RM -> PPO)。
  • Why理解微调和对齐是将"通才"变成"专才"的关键步骤。

阅读前提 & 建议:

  • 前置知识:建议了解深度学习基础(反向传播、梯度下降)和 Transformer 架构基本原理。
  • 不涉及的内容:具体分布式训练的代码实现、RLHF 的数学推导。
  • 深度预期:学完本篇后,你能建立大模型训练的系统认知框架,理解每个阶段的作用与价值。
  • 后续延伸:本系列后续将深入展开预训练优化、微调技术、对齐算法等专题。

一、大模型参数规模爆发:从"堆规模"到"重效率"

What — 大模型参数规模爆发是什么?

大模型的参数规模经历了爆发式增长,从 GPT-3 的 1750 亿参数,到 GPT-4 算力需求暴涨 70 倍,再到如今万亿级参数模型的普及,参数规模成为衡量模型能力的重要指标。

Why — 为什么参数规模如此重要?

问题一:幂律规律催生规模竞赛

早期研究认为,算力、数据、参数越大,模型效果越好。这一"规模定律"(Scaling Laws)催生了全球范围内的"规模军备竞赛"——谁能训练出更大的模型,谁就能在性能上占据优势。

问题二:2025-2026 年行业拐点

当参数规模超过 5000 亿后,模型能力提升不足 5%,但训练成本、能耗却指数级上涨。行业共识转变为更聪明、更高效、更实用,训练优化技术成为核心刚需。

没有规模演进会发生什么?

  • 模型能力停滞在 GPT-3 水平,无法处理复杂推理任务
  • 学术界无法验证 Scaling Laws,行业失去发展方向
  • 大模型应用场景受限,无法赋能产业升级
里程碑事件回顾

让我们梳理大模型参数规模演进的关键时间线:

2020 GPT-3           1750亿参数    训练成本500万美元
                      4000亿token数据
                            |
                            v
  2022 PaLM             5400亿参数    算力需求大幅提升
                            |
                            v
  2023 GPT-4            万亿级参数    算力需求较GPT-3暴涨70倍
                            |
                            v
  2024 Llama 3          万亿级参数    开源生态完善
  2024 DeepSeek         万亿级参数    以低成本实现对标GPT-4
  2025+  国内厂商       10万亿参数级  国产大模型突破

从 1750 亿到万亿级,参数规模增长了近 6 倍,但行业关注的重心已从"堆参数"转向"提效率"。

本节核心要点

  • 大模型参数规模从 GPT-3 的 1750 亿爆发式增长到万亿级
  • 早期"规模定律"催生军备竞赛,但存在明显瓶颈
  • 2025-2026 年行业拐点:参数超 5000 亿后边际收益递减
  • 行业共识转向"更聪明、更高效、更实用"

二、训练核心矛盾:算力需求指数暴涨与硬件供给瓶颈

What — 算力供需矛盾的本质是什么?

大模型算力需求每 3-4 个月翻倍,增速是摩尔定律(18 个月翻倍)的 4-6 倍。谷歌等企业需每半年算力翻番才能匹配需求,而硬件供给却存在多重瓶颈。

Why — 为什么算力供需错配是核心矛盾?

问题一:需求增速远超硬件迭代

大模型训练对算力的需求呈指数级增长,而硬件芯片的迭代速度受物理限制,无法跟上需求增速。这种"剪刀差"是整个行业的根本矛盾。

问题二:四大硬件供给瓶颈

高端 GPU 受限:国内特供芯片算力远低于原版高端卡,算力硬件供给不足。

训练成本高昂:国产芯片训练成本是海外高端算力集群的 2.5 倍以上,中小企业门槛极高。

算力结构错配:国内算力"一半过剩、一半短缺",传统 CPU 机房无法适配大模型训练,区域供需失衡。

国产芯片生态不完善:芯片性能、产能、配套软件存在短板,出现"有设备无芯片、有芯片难使用"问题。

没有算力保障会发生什么?

  • 模型训练周期从数周延长到数月,严重影响迭代速度
  • 中小企业被排斥在大模型竞赛之外,行业集中度提高
  • 国产大模型发展受制于人,威胁产业安全
训练优化的核心价值

供需错配催生了 AI Infra 优化领域,其核心思路是:在硬件固定的前提下,通过分布式并行、显存/通信/计算精度优化,实现更少硬件、更短时间训练更大模型

DeepSeek 的成功案例验证了这一思路的巨大价值:依靠系统与算法优化,以低成本实现了对标 GPT-4 的效果。

  传统路径:堆硬件 -> 堆算力 -> 堆规模
           (硬件成本高,效果边际递减)
  
  优化路径:算法优化 -> 系统优化 -> 高效训练
           (低成本,高效率)  DeepSeek验证

本节核心要点

  • 算力需求每 3-4 个月翻倍,增速是摩尔定律的 4-6 倍
  • 四大硬件瓶颈:高端 GPU 受限、训练成本高、结构错配、生态不完善
  • AI Infra 优化是解决供需矛盾的核心路径
  • DeepSeek 案例验证了"优化降本"模式的可行性

三、大模型完整训练全流程

What — 大模型训练包含哪些核心阶段?

大模型训练是一个完整的 pipeline,从原始海量数据到部署推理,依次经过数据工程、预训练、微调、人类对齐四个核心阶段。

训练全流程 ASCII 图解
原始海量数据
       |
       v
  +-- 数据工程 --+
  |  采集/清洗/  |
  |  评估/分词   |
  +-------+------+
          |
          v
  +-- 预训练 ----+
  |  无监督学习  |  

四、数据工程:模型能力的根基

What — 数据工程是什么?

数据工程处理 PB 级多源文本,是整个训练流程的基础底座。包含采集、清洗、质量评估、分词四大环节,语料质量直接决定模型性能上限。

Why — 为什么数据工程如此重要?

问题一:数据是模型的"燃料"

高质量数据就像优质燃料,可以让模型引擎发挥最佳性能;低质量数据则会导致模型"消化不良",产生幻觉、偏见等问题。

问题二:数据质量决定性能上限

无论模型架构多先进、训练技术多高超,数据质量永远是模型能力的上限。正如深度学习名言:"Garbage In, Garbage Out"。

没有高质量数据会发生什么?

  • 模型学习到错误模式,产生事实性错误
  • 模型输出包含偏见、歧视性内容
  • 模型在专业领域表现差,无法落地应用
数据工程四大环节
数据工程四环节
  
  1. 数据采集
     - Web 数据(Common Crawl)
     - 书籍、论文
     - 代码库(GitHub)
     - 百科、新闻
  
  2. 数据清洗
     - 去重(全局去重、段落去重)
     - 质量过滤(语言识别、长度过滤)
     - 安全过滤(色情、暴力、隐私)
  
  3. 质量评估
     - 困惑度打分
     - 质量分类器
     - 人工审核
  
  4. 分词(Tokenization)
     - BPE/WordPiece/BBPE
     - 构建词表
     - 处理 OOV

每个环节都需要精心设计,任何疏漏都会影响最终模型质量。

本节核心要点

  • 数据工程处理 PB 级多源文本,是训练流程的基础
  • 四大环节:采集、清洗、质量评估、分词
  • 语料质量直接决定模型性能上限
  • "Garbage In, Garbage Out"——数据质量是模型能力的根基

五、预训练:算力消耗的绝对主力

What — 预训练的核心原理是什么?

预训练是无监督自回归学习,让模型通过预测下一个词(Next Token Prediction)来习得通用语言、逻辑、常识。千亿模型训练周期达数周乃至数月,算力消耗占整体 90% 以上。

Why — 为什么预训练是优化主战场?

问题一:算力消耗的"黑洞"

预训练阶段消耗的算力占整体训练流程的 90% 以上。一个千亿参数的模型,训练可能需要数千张 GPU 运行数周。

问题二:模型能力的基础

模型的语言理解、逻辑推理、知识储备主要在预训练阶段奠定。预训练决定了一个模型的"天赋",后续微调只是"后天培养"。

没有预训练会发生什么?

  • 模型无法习得语言规律,变成随机输出
  • 模型缺乏基本常识,无法进行逻辑推理
  • 所有下游任务都需要从头训练,效率极低
预训练核心流程
预训练流程
  
  输入: 海量文本语料 (trillions of tokens)
         |
         v
  +------------------+
  |  Tokenization    |  # 将文本转为 token 序列
  +------------------+
         |
         v
  +------------------+
  |  Forward Pass     |  # 前向传播,计算预测概率
  |  Y = Model(X)     |
  +------------------+
         |
         v
  +------------------+
  |  Loss Computation |  # 交叉熵损失
  |  Loss = CE(pred,y) |
  +------------------+
         |
         v
  +------------------+
  |  Backward Pass    |  # 反向传播,计算梯度
  |  loss.backward()  |
  +------------------+
         |
         v
  +------------------+
  |  Optimizer Step   |  # 更新权重
  |  optimizer.step() |
  +------------------+
         |
         v
     循环迭代 (weeks ~ months)
     
  # 预训练是"一次性"的大规模计算任务

本节核心要点

  • 预训练是无监督自回归学习,通过 Next Token Prediction 习得能力
  • 算力消耗占整体 90% 以上,是优化核心场景
  • 千亿模型训练周期达数周乃至数月
  • 预训练决定模型的"天赋",是后续一切能力的基础

六、微调:场景适配的关键步骤

What — 微调的核心目标是什么?

微调(Fine-tuning)基于少量标注数据,将预训练模型适配到特定任务或领域。是将"通才"变成"专才"的关键步骤。

Why — 为什么需要微调?

问题一:预训练模型是"通才"但不是"专才"

预训练模型学习了通用语言能力,但在特定任务(如医疗问答、代码生成)上表现不够好。微调可以让模型适应特定场景。

问题二:全参数微调成本太高

千亿参数模型的全参数微调需要大量 GPU 和数据。高效微调技术(如 LoRA)将算力需求降低 90%。

没有微调会发生什么?

  • 模型无法适配特定任务,应用场景受限
  • 所有场景都需要重新训练,效率极低
  • 模型输出泛化性强但专业性差
微调技术方案对比
微调技术对比
  
  +---------------------------+------------------------+
  | 全参数微调 (Full FT)      | 高效微调 (PEFT)        |
  +---------------------------+------------------------+
  | 更新全部参数               | 只更新少量参数          |
  | 效果最好                   | 效果接近全参数          |
  | 显存需求高                 | 显存节省 90%+          |
  | 容易过拟合                 | 不易过拟合              |
  +---------------------------+------------------------+
  | 典型方案:                  | 典型方案:              |
  | - SFT (Supervised FT)     | - LoRA                 |
  |                           | - Prefix Tuning        |
  |                           | - Adapter              |
  +---------------------------+------------------------+
  | 适用场景:                  | 适用场景:               |
  | - 数据充足                 | - 数据有限              |
  | - 计算资源充足             | - 计算资源有限          |
  | - 任务与预训练差异大       | - 多任务/多场景复用     |
  +---------------------------+------------------------+
  # 选择微调方案需要权衡效果与成本

本节核心要点

  • 微调将预训练"通才"适配为特定任务"专才"
  • 全参数微调效果最好但成本高
  • LoRA 等高效微调方案节省 90% 显存
  • 微调是模型落地的必经之路

七、人类对齐 RLHF:匹配人类价值观

What — RLHF 的核心目标是什么?

RLHF(Reinforcement Learning from Human Feedback)通过人类反馈强化学习,解决模型输出"不友好"、"不符合人类预期"的问题,让模型行为与人类价值观对齐。

Why — 为什么需要对齐?

问题一:预训练目标与人类意图存在偏差

预训练的 Next Token Prediction 目标是预测"最可能"的下一个词,而不是"最符合人类期望"的输出。这导致模型可能产生有害、有偏见或无用的内容。

问题二:如何定义"好"的输出

有些任务有明确答案(代码正确性),但更多场景需要主观判断(回答是否有帮助)。RLHF 通过人类标注学习"偏好",让模型学会判断质量。

没有对齐会发生什么?

  • 模型输出包含有害、歧视性内容
  • 模型"一本正经地胡说八道"
  • 模型回答不helpful,实用性差
RLHF 三步流程
RLHF 三步流程
  
  Step 1: SFT (Supervised Fine-tuning)
           监督微调
           |
           v
      使用人工标注的"问答对"
      让模型学习"什么样的回答是好的"
           |
           v
  Step 2: RM (Reward Model)
           奖励模型训练
           |
           v
      收集人类偏好数据 (A vs B)
      训练奖励模型预测"人类会觉得哪个更好"
           |
           v
  Step 3: PPO (Proximal Policy Optimization)
           强化学习优化
           |
           v
      使用奖励模型作为信号
      通过强化学习优化 SFT 模型
      使模型输出更符合人类偏好
           |
           v
     输出对齐后的模型
  # RLHF 是让模型"听话"的关键技术

本节核心要点

  • RLHF 解决模型输出与人类价值观对齐的问题
  • 三步流程:SFT -> RM -> PPO
  • SFT 学习"什么是好答案",RM 学习"人类偏好",PPO 优化策略
  • 对齐是模型从"能说话"到"会说话"的关键一步

八、训练优化技术:AI Infra 的核心价值

What — 训练优化技术的核心目标是什么?

在硬件固定的前提下,通过分布式并行、显存优化、通信优化、计算精度优化,实现更少硬件、更短时间训练更大模型

Why — 为什么需要训练优化?

问题一:硬件成本是核心瓶颈

高端 GPU 价格高昂,且供应受限。如何在有限硬件上训练更大模型,是每个团队必须面对的问题。

问题二:效率就是竞争力

训练效率直接影响迭代速度。在 AI 领域,"快"往往意味着"赢"。DeepSeek 以低成本实现对标 GPT-4 的效果,证明了优化路线的高度可行性。

没有训练优化会发生什么?

  • 中小企业被排斥在大模型竞赛之外
  • 训练周期过长,无法快速迭代
  • 硬件利用率低,资源浪费严重
四大优化方向
训练优化四大方向
  
  1. 分布式并行
     - 数据并行 (DP): 样本分片,梯度同步
     - 张量并行 (TP): 层内权重切分
     - 流水线并行 (PP): 层间切分
     - FSDP: 全分片数据并行
  
  2. 显存优化
     - 混合精度训练 (FP16/BF16)
     - 梯度检查点 (Gradient Checkpointing)
     - ZeRO 优化器 (分片optimizer states)
  
  3. 通信优化
     - AllReduce 融合
     - 通信与计算重叠
     - 梯度压缩
  
  4. 计算优化
     - Flash Attention
     - Kernel Fusion
     - 算子优化
  # 优化是"降本增效"的核心手段

本节核心要点

  • 训练优化在硬件固定前提下提升效率
  • 四大方向:分布式并行、显存优化、通信优化、计算优化
  • DeepSeek 验证了"优化降本"模式的可行性
  • AI Infra 是大模型竞争的关键战场

常见问题解答(FAQ)

以下是关于大模型训练的 20 个核心问题,每个问题都附有简短结论和详细解释:

Q1. 为什么大模型的参数规模越来越大?

结论:大模型遵循"规模定律",更大的参数意味着更强的能力。早期研究(Kaplan 等人)发现,模型性能与参数规模、数据量、算力呈幂律关系。因此业界倾向于通过增加参数来提升模型效果。

Q2. GPT-3 的 1750 亿参数意味着什么?

结论:1750 亿参数需要约 350GB 显存(FP16),远超单卡容量。这意味着必须使用分布式训练技术,将模型切分到多张 GPU 上。

Q3. 为什么 2025-2026 年行业转向"效率优先"?

结论:参数超 5000 亿后,边际收益递减,边际成本递增。GPT-4 相比 GPT-3 算力暴涨 70 倍,但能力提升并不成比例。业界开始关注"在有限算力下训练更大模型"。

Q4. 摩尔定律是什么?为什么大模型需求增速远超摩尔定律?

结论:摩尔定律预测硬件每 18 个月性能翻倍,但大模型需求每 3-4 个月翻倍。这意味着供需差距持续扩大,硬件迭代速度无法满足需求。

Q5. 国内高端 GPU 受限对大模型训练有什么影响?

结论:国产芯片算力与海外高端卡存在差距,训练成本更高。这促使国内更加重视训练优化技术,以弥补硬件差距。

Q6. 数据工程为什么是训练流程的基础?

结论:数据质量决定模型性能上限,再好的架构也无法弥补数据缺陷。"Garbage In, Garbage Out"是深度学习的基本原则。

Q7. 为什么预训练是算力消耗最高的阶段?

结论:预训练需要处理数万亿 token,数据量和计算量远超微调阶段。一个千亿模型可能需要数周训练,而微调可能只需数小时。

Q8. 预训练阶段模型学习到了什么?

结论:通用语言能力、逻辑推理、事实知识。预训练让模型通过大量文本学习语言的统计规律,形成"语言理解"和"生成"的基础能力。

Q9. 什么是 Next Token Prediction?

结论:预测下一个词是预训练的核心任务。给定前文,模型预测下一个词的概率分布,通过最大化正确词的概率来学习语言规律。

Q10. 全参数微调和高效微调的区别是什么?

结论:全参数微调更新所有权重,高效微调只更新少量参数。LoRA 等高效微调方案可以节省 90% 显存,但效果接近全参数微调。

Q11. LoRA 的核心原理是什么?

结论:LoRA 在预训练权重旁边添加低秩矩阵,只训练低秩矩阵。原始权重冻结,高秩信息由预训练保留,低秩矩阵学习任务相关知识。

Q12. 为什么需要 RLHF 对齐?

结论:预训练目标与人类意图存在偏差,需要通过人类反馈纠正。RLHF 让模型学习"什么样的输出是人类认为好的"。

Q13. RLHF 三步流程各起什么作用?

结论:SFT 学习"什么是好答案",RM 学习"人类偏好",PPO 优化策略。三步缺一不可,共同实现模型与人类价值观的对齐。

Q14. SFT 之后为什么还需要 PPO?

结论:SFT 只能学习人工标注的模式,PPO 可以发现更优但未被标注的策略。强化学习可以探索人工标注之外的可能性。

Q15. 数据并行和模型并行的区别是什么?

结论:数据并行是每卡持有完整模型但处理不同数据,模型并行是每卡持有部分模型。数据并行适合模型能装入单卡的情况,模型并行解决单卡装不下模型的问题。

Q16. 什么是张量并行?

结论:张量并行是层内模型并行,将单层权重矩阵切分到多卡。配合集合通信(AllReduce),可以在数学上等价于单卡计算。

Q17. Flash Attention 为什么能加速训练?

结论:Flash Attention 通过 IO 优化和tiling技术,将注意力计算提速 2-4 倍。核心思想是减少 HBM 访问次数,将中间结果保留在 SRAM 中。

Q18. 混合精度训练为什么能节省显存?

结论:FP16/BF16 比 FP32 占用更少显存,但计算精度可能降低。混合精度策略:用 FP16 做前向/反向计算,用 FP32 做梯度累积和优化器状态。

Q19. DeepSeek 的成功说明了什么?

结论:DeepSeek 验证了"算法+系统优化"路线的可行性。以低成本实现了对标 GPT-4 的效果,证明不是只有"堆硬件"一条路。

Q20. 大模型训练的未来趋势是什么?

结论:从"规模为王"转向"效率优先",算法优化与硬件协同发展。未来几年,训练优化技术将成为核心竞争力。

全篇总结

本篇系统梳理了大模型训练的时代背景、核心挑战与完整流程。核心要点:

  • 参数规模爆发式增长,但 2025-2026 年行业拐点已至,边际收益递减
  • 算力供需矛盾是核心矛盾,催生 AI Infra 优化领域
  • 训练全流程:数据工程 -> 预训练 -> 微调 -> RLHF
  • 预训练消耗 90%+ 算力,是优化主战场
  • 微调和对齐将"通才"变成"专才"
  • 训练优化是"降本增效"的核心竞争力

参考资源

posted @ 2026-08-16 12:30  左扬  阅读(17)  评论(0)    收藏  举报