AI Infra 大厂专题【左扬精讲】—— 大模型训练的时代背景与挑战
AI Infra 大厂专题【左扬精讲】—— 大模型训练的时代背景与挑战
阅读前必读:本文数据使用与免责说明
本文涉及的行业数据(如 GPT-3 训练成本、DeepSeek 模型规模、国内芯片算力差距等)来源于 公开报告、行业分享、课程材料 等多渠道整理,仅用于说明大模型训练的时代背景与趋势脉络。
- 数据时效性:不同来源对同一指标的统计口径可能存在差异(如参数规模含/不含 Embedding、算力换算单位不同),文中数据为课堂讲述用近似值,部分数据可能随版本迭代而变化。
- 非财务建议:文中提到的成本、能耗、数字仅是事实陈述,不构成任何投资建议,读者请勿据此做出商业决策。
- 非官方表述:关于"行业共识"、"拐点"、"领先"等定性词汇是对多方公开观点的综合归纳,并非某一厂商或机构的官方定论。
- 结论可证伪:文中关于"参数边际收益递减"、"优化降本"等结论以行业普遍公开案例(如 DeepSeek 系列)为依据,随着技术演进也可能被新研究刷新。
总结一句话:本文所有数据仅供学习参考,请以一手官方资料为准;如数据有更新,以最新发布为准。
本篇聚焦大模型训练的核心议题,从 参数规模爆发、算力供需矛盾、完整训练流程 三大维度展开,帮助读者建立对大模型训练全貌的系统认知。
大模型完整训练流程
|
+-- 数据工程
| +-- 数据采集(Web、书籍、代码库等)
| +-- 数据清洗(去重、质量过滤、安全过滤)
| +-- 质量评估(困惑度、质量打分)
| +-- 分词(Tokenization)
|
+-- 预训练(Pretraining)
| +-- 无监督自回归学习
| +-- 算力消耗占整体 90%+
| +-- 分布式并行训练(DP/TP/PP/FSDP)
|
+-- 微调(Fine-tuning)
| +-- 全参数微调(Full Fine-tuning)
| +-- 高效微调(LoRA、Prefix Tuning)
|
+-- 人类对齐(RLHF)
| +-- 监督微调 SFT
| +-- 奖励模型训练 RM
| +-- 强化学习 PPO
|
+-- 部署推理
+-- 模型压缩(量化、剪枝)
+-- 推理优化(Triton、vLLM)
# 大模型训练全流程核心阶段
大模型训练预训练微调RLHF分布式训练算力优化PyTorch 2.x
学习重点提示
本篇深入探讨大模型训练的时代背景、核心挑战与完整训练流程。以下是每个主题你需要掌握的深度说明:
参数规模演进与Scaling Laws(What & How & Why):
- What大模型参数规模从 GPT-3 的 1750 亿爆发式增长到万亿级别,国内已突破 10 万亿参数规模。
- How能说出 GPT-3、GPT-4、Llama、DeepSeek 等关键里程碑;能区分"规模竞赛"与"效率优化"两个发展阶段。
- Why理解"规模为王"背后的幂律规律;理解 2025-2026 年行业拐点——参数超 5000 亿后能力提升不足 5%,行业转向"更聪明、更高效、更实用"。
算力供需矛盾(What & How & Why):
- What大模型算力需求每 3-4 个月翻倍,增速是摩尔定律的 4-6 倍;硬件供给存在高端 GPU 受限、训练成本高、结构错配、国产生态不完善四大瓶颈。
- How能列举四大硬件瓶颈的具体表现;能说出 AI Infra 优化在硬件固定前提下提升效率的核心逻辑。
- Why理解供需错配催生训练优化领域的必然性;理解 DeepSeek 以低成本实现对标 GPT-4 效果的示范意义。
数据工程(What & How & Why):
- What数据工程处理 PB 级多源文本,包含采集、清洗、质量评估、分词四大环节。
- How能说出数据工程的四个核心步骤;能理解语料质量直接决定模型性能上限。
- Why理解"Garbage In, Garbage Out"——没有高质量数据,再强大的架构也无法训练出优秀模型。
预训练核心原理(What & How & Why):
- What预训练是无监督自回归学习,让模型习得通用语言、逻辑、常识;算力消耗占整体 90% 以上。
- How能画出预训练的基本流程;能解释 Next Token Prediction 目标函数。
- Why理解预训练是模型能力的基础——模型的语言理解、逻辑推理、知识储备主要在预训练阶段奠定。
微调与对齐(What & How & Why):
- What微调基于少量标注数据适配对话、行业任务;对齐(RLHF)解决模型输出不友好、不符合人类预期的问题。
- How能区分全参数微调与 LoRA 等高效微调方案;能说出 RLHF 三步流程(SFT -> RM -> PPO)。
- Why理解微调和对齐是将"通才"变成"专才"的关键步骤。
阅读前提 & 建议:
- 前置知识:建议了解深度学习基础(反向传播、梯度下降)和 Transformer 架构基本原理。
- 不涉及的内容:具体分布式训练的代码实现、RLHF 的数学推导。
- 深度预期:学完本篇后,你能建立大模型训练的系统认知框架,理解每个阶段的作用与价值。
- 后续延伸:本系列后续将深入展开预训练优化、微调技术、对齐算法等专题。
目录
一、大模型参数规模爆发:从"堆规模"到"重效率"
What — 大模型参数规模爆发是什么?
大模型的参数规模经历了爆发式增长,从 GPT-3 的 1750 亿参数,到 GPT-4 算力需求暴涨 70 倍,再到如今万亿级参数模型的普及,参数规模成为衡量模型能力的重要指标。
Why — 为什么参数规模如此重要?
问题一:幂律规律催生规模竞赛
早期研究认为,算力、数据、参数越大,模型效果越好。这一"规模定律"(Scaling Laws)催生了全球范围内的"规模军备竞赛"——谁能训练出更大的模型,谁就能在性能上占据优势。
问题二:2025-2026 年行业拐点
当参数规模超过 5000 亿后,模型能力提升不足 5%,但训练成本、能耗却指数级上涨。行业共识转变为更聪明、更高效、更实用,训练优化技术成为核心刚需。
没有规模演进会发生什么?
- 模型能力停滞在 GPT-3 水平,无法处理复杂推理任务
- 学术界无法验证 Scaling Laws,行业失去发展方向
- 大模型应用场景受限,无法赋能产业升级
让我们梳理大模型参数规模演进的关键时间线:
2020 GPT-3 1750亿参数 训练成本500万美元
4000亿token数据
|
v
2022 PaLM 5400亿参数 算力需求大幅提升
|
v
2023 GPT-4 万亿级参数 算力需求较GPT-3暴涨70倍
|
v
2024 Llama 3 万亿级参数 开源生态完善
2024 DeepSeek 万亿级参数 以低成本实现对标GPT-4
2025+ 国内厂商 10万亿参数级 国产大模型突破
从 1750 亿到万亿级,参数规模增长了近 6 倍,但行业关注的重心已从"堆参数"转向"提效率"。
本节核心要点
- 大模型参数规模从 GPT-3 的 1750 亿爆发式增长到万亿级
- 早期"规模定律"催生军备竞赛,但存在明显瓶颈
- 2025-2026 年行业拐点:参数超 5000 亿后边际收益递减
- 行业共识转向"更聪明、更高效、更实用"
二、训练核心矛盾:算力需求指数暴涨与硬件供给瓶颈
What — 算力供需矛盾的本质是什么?
大模型算力需求每 3-4 个月翻倍,增速是摩尔定律(18 个月翻倍)的 4-6 倍。谷歌等企业需每半年算力翻番才能匹配需求,而硬件供给却存在多重瓶颈。
Why — 为什么算力供需错配是核心矛盾?
问题一:需求增速远超硬件迭代
大模型训练对算力的需求呈指数级增长,而硬件芯片的迭代速度受物理限制,无法跟上需求增速。这种"剪刀差"是整个行业的根本矛盾。
问题二:四大硬件供给瓶颈
① 高端 GPU 受限:国内特供芯片算力远低于原版高端卡,算力硬件供给不足。
② 训练成本高昂:国产芯片训练成本是海外高端算力集群的 2.5 倍以上,中小企业门槛极高。
③ 算力结构错配:国内算力"一半过剩、一半短缺",传统 CPU 机房无法适配大模型训练,区域供需失衡。
④ 国产芯片生态不完善:芯片性能、产能、配套软件存在短板,出现"有设备无芯片、有芯片难使用"问题。
没有算力保障会发生什么?
- 模型训练周期从数周延长到数月,严重影响迭代速度
- 中小企业被排斥在大模型竞赛之外,行业集中度提高
- 国产大模型发展受制于人,威胁产业安全
供需错配催生了 AI Infra 优化领域,其核心思路是:在硬件固定的前提下,通过分布式并行、显存/通信/计算精度优化,实现更少硬件、更短时间训练更大模型。
DeepSeek 的成功案例验证了这一思路的巨大价值:依靠系统与算法优化,以低成本实现了对标 GPT-4 的效果。
传统路径:堆硬件 -> 堆算力 -> 堆规模
(硬件成本高,效果边际递减)
优化路径:算法优化 -> 系统优化 -> 高效训练
(低成本,高效率) DeepSeek验证
本节核心要点
- 算力需求每 3-4 个月翻倍,增速是摩尔定律的 4-6 倍
- 四大硬件瓶颈:高端 GPU 受限、训练成本高、结构错配、生态不完善
- AI Infra 优化是解决供需矛盾的核心路径
- DeepSeek 案例验证了"优化降本"模式的可行性
三、大模型完整训练全流程
What — 大模型训练包含哪些核心阶段?
大模型训练是一个完整的 pipeline,从原始海量数据到部署推理,依次经过数据工程、预训练、微调、人类对齐四个核心阶段。
原始海量数据
|
v
+-- 数据工程 --+
| 采集/清洗/ |
| 评估/分词 |
+-------+------+
|
v
+-- 预训练 ----+
| 无监督学习 |
四、数据工程:模型能力的根基
What — 数据工程是什么?
数据工程处理 PB 级多源文本,是整个训练流程的基础底座。包含采集、清洗、质量评估、分词四大环节,语料质量直接决定模型性能上限。
Why — 为什么数据工程如此重要?
问题一:数据是模型的"燃料"
高质量数据就像优质燃料,可以让模型引擎发挥最佳性能;低质量数据则会导致模型"消化不良",产生幻觉、偏见等问题。
问题二:数据质量决定性能上限
无论模型架构多先进、训练技术多高超,数据质量永远是模型能力的上限。正如深度学习名言:"Garbage In, Garbage Out"。
没有高质量数据会发生什么?
- 模型学习到错误模式,产生事实性错误
- 模型输出包含偏见、歧视性内容
- 模型在专业领域表现差,无法落地应用
数据工程四环节
1. 数据采集
- Web 数据(Common Crawl)
- 书籍、论文
- 代码库(GitHub)
- 百科、新闻
2. 数据清洗
- 去重(全局去重、段落去重)
- 质量过滤(语言识别、长度过滤)
- 安全过滤(色情、暴力、隐私)
3. 质量评估
- 困惑度打分
- 质量分类器
- 人工审核
4. 分词(Tokenization)
- BPE/WordPiece/BBPE
- 构建词表
- 处理 OOV
每个环节都需要精心设计,任何疏漏都会影响最终模型质量。
本节核心要点
- 数据工程处理 PB 级多源文本,是训练流程的基础
- 四大环节:采集、清洗、质量评估、分词
- 语料质量直接决定模型性能上限
- "Garbage In, Garbage Out"——数据质量是模型能力的根基
五、预训练:算力消耗的绝对主力
What — 预训练的核心原理是什么?
预训练是无监督自回归学习,让模型通过预测下一个词(Next Token Prediction)来习得通用语言、逻辑、常识。千亿模型训练周期达数周乃至数月,算力消耗占整体 90% 以上。
Why — 为什么预训练是优化主战场?
问题一:算力消耗的"黑洞"
预训练阶段消耗的算力占整体训练流程的 90% 以上。一个千亿参数的模型,训练可能需要数千张 GPU 运行数周。
问题二:模型能力的基础
模型的语言理解、逻辑推理、知识储备主要在预训练阶段奠定。预训练决定了一个模型的"天赋",后续微调只是"后天培养"。
没有预训练会发生什么?
- 模型无法习得语言规律,变成随机输出
- 模型缺乏基本常识,无法进行逻辑推理
- 所有下游任务都需要从头训练,效率极低
预训练流程
输入: 海量文本语料 (trillions of tokens)
|
v
+------------------+
| Tokenization | # 将文本转为 token 序列
+------------------+
|
v
+------------------+
| Forward Pass | # 前向传播,计算预测概率
| Y = Model(X) |
+------------------+
|
v
+------------------+
| Loss Computation | # 交叉熵损失
| Loss = CE(pred,y) |
+------------------+
|
v
+------------------+
| Backward Pass | # 反向传播,计算梯度
| loss.backward() |
+------------------+
|
v
+------------------+
| Optimizer Step | # 更新权重
| optimizer.step() |
+------------------+
|
v
循环迭代 (weeks ~ months)
# 预训练是"一次性"的大规模计算任务
本节核心要点
- 预训练是无监督自回归学习,通过 Next Token Prediction 习得能力
- 算力消耗占整体 90% 以上,是优化核心场景
- 千亿模型训练周期达数周乃至数月
- 预训练决定模型的"天赋",是后续一切能力的基础
六、微调:场景适配的关键步骤
What — 微调的核心目标是什么?
微调(Fine-tuning)基于少量标注数据,将预训练模型适配到特定任务或领域。是将"通才"变成"专才"的关键步骤。
Why — 为什么需要微调?
问题一:预训练模型是"通才"但不是"专才"
预训练模型学习了通用语言能力,但在特定任务(如医疗问答、代码生成)上表现不够好。微调可以让模型适应特定场景。
问题二:全参数微调成本太高
千亿参数模型的全参数微调需要大量 GPU 和数据。高效微调技术(如 LoRA)将算力需求降低 90%。
没有微调会发生什么?
- 模型无法适配特定任务,应用场景受限
- 所有场景都需要重新训练,效率极低
- 模型输出泛化性强但专业性差
微调技术对比
+---------------------------+------------------------+
| 全参数微调 (Full FT) | 高效微调 (PEFT) |
+---------------------------+------------------------+
| 更新全部参数 | 只更新少量参数 |
| 效果最好 | 效果接近全参数 |
| 显存需求高 | 显存节省 90%+ |
| 容易过拟合 | 不易过拟合 |
+---------------------------+------------------------+
| 典型方案: | 典型方案: |
| - SFT (Supervised FT) | - LoRA |
| | - Prefix Tuning |
| | - Adapter |
+---------------------------+------------------------+
| 适用场景: | 适用场景: |
| - 数据充足 | - 数据有限 |
| - 计算资源充足 | - 计算资源有限 |
| - 任务与预训练差异大 | - 多任务/多场景复用 |
+---------------------------+------------------------+
# 选择微调方案需要权衡效果与成本
本节核心要点
- 微调将预训练"通才"适配为特定任务"专才"
- 全参数微调效果最好但成本高
- LoRA 等高效微调方案节省 90% 显存
- 微调是模型落地的必经之路
七、人类对齐 RLHF:匹配人类价值观
What — RLHF 的核心目标是什么?
RLHF(Reinforcement Learning from Human Feedback)通过人类反馈强化学习,解决模型输出"不友好"、"不符合人类预期"的问题,让模型行为与人类价值观对齐。
Why — 为什么需要对齐?
问题一:预训练目标与人类意图存在偏差
预训练的 Next Token Prediction 目标是预测"最可能"的下一个词,而不是"最符合人类期望"的输出。这导致模型可能产生有害、有偏见或无用的内容。
问题二:如何定义"好"的输出
有些任务有明确答案(代码正确性),但更多场景需要主观判断(回答是否有帮助)。RLHF 通过人类标注学习"偏好",让模型学会判断质量。
没有对齐会发生什么?
- 模型输出包含有害、歧视性内容
- 模型"一本正经地胡说八道"
- 模型回答不helpful,实用性差
RLHF 三步流程
Step 1: SFT (Supervised Fine-tuning)
监督微调
|
v
使用人工标注的"问答对"
让模型学习"什么样的回答是好的"
|
v
Step 2: RM (Reward Model)
奖励模型训练
|
v
收集人类偏好数据 (A vs B)
训练奖励模型预测"人类会觉得哪个更好"
|
v
Step 3: PPO (Proximal Policy Optimization)
强化学习优化
|
v
使用奖励模型作为信号
通过强化学习优化 SFT 模型
使模型输出更符合人类偏好
|
v
输出对齐后的模型
# RLHF 是让模型"听话"的关键技术
本节核心要点
- RLHF 解决模型输出与人类价值观对齐的问题
- 三步流程:SFT -> RM -> PPO
- SFT 学习"什么是好答案",RM 学习"人类偏好",PPO 优化策略
- 对齐是模型从"能说话"到"会说话"的关键一步
八、训练优化技术:AI Infra 的核心价值
What — 训练优化技术的核心目标是什么?
在硬件固定的前提下,通过分布式并行、显存优化、通信优化、计算精度优化,实现更少硬件、更短时间训练更大模型。
Why — 为什么需要训练优化?
问题一:硬件成本是核心瓶颈
高端 GPU 价格高昂,且供应受限。如何在有限硬件上训练更大模型,是每个团队必须面对的问题。
问题二:效率就是竞争力
训练效率直接影响迭代速度。在 AI 领域,"快"往往意味着"赢"。DeepSeek 以低成本实现对标 GPT-4 的效果,证明了优化路线的高度可行性。
没有训练优化会发生什么?
- 中小企业被排斥在大模型竞赛之外
- 训练周期过长,无法快速迭代
- 硬件利用率低,资源浪费严重
训练优化四大方向
1. 分布式并行
- 数据并行 (DP): 样本分片,梯度同步
- 张量并行 (TP): 层内权重切分
- 流水线并行 (PP): 层间切分
- FSDP: 全分片数据并行
2. 显存优化
- 混合精度训练 (FP16/BF16)
- 梯度检查点 (Gradient Checkpointing)
- ZeRO 优化器 (分片optimizer states)
3. 通信优化
- AllReduce 融合
- 通信与计算重叠
- 梯度压缩
4. 计算优化
- Flash Attention
- Kernel Fusion
- 算子优化
# 优化是"降本增效"的核心手段
本节核心要点
- 训练优化在硬件固定前提下提升效率
- 四大方向:分布式并行、显存优化、通信优化、计算优化
- DeepSeek 验证了"优化降本"模式的可行性
- AI Infra 是大模型竞争的关键战场
常见问题解答(FAQ)
以下是关于大模型训练的 20 个核心问题,每个问题都附有简短结论和详细解释:
Q1. 为什么大模型的参数规模越来越大?
结论:大模型遵循"规模定律",更大的参数意味着更强的能力。早期研究(Kaplan 等人)发现,模型性能与参数规模、数据量、算力呈幂律关系。因此业界倾向于通过增加参数来提升模型效果。
Q2. GPT-3 的 1750 亿参数意味着什么?
结论:1750 亿参数需要约 350GB 显存(FP16),远超单卡容量。这意味着必须使用分布式训练技术,将模型切分到多张 GPU 上。
Q3. 为什么 2025-2026 年行业转向"效率优先"?
结论:参数超 5000 亿后,边际收益递减,边际成本递增。GPT-4 相比 GPT-3 算力暴涨 70 倍,但能力提升并不成比例。业界开始关注"在有限算力下训练更大模型"。
Q4. 摩尔定律是什么?为什么大模型需求增速远超摩尔定律?
结论:摩尔定律预测硬件每 18 个月性能翻倍,但大模型需求每 3-4 个月翻倍。这意味着供需差距持续扩大,硬件迭代速度无法满足需求。
Q5. 国内高端 GPU 受限对大模型训练有什么影响?
结论:国产芯片算力与海外高端卡存在差距,训练成本更高。这促使国内更加重视训练优化技术,以弥补硬件差距。
Q6. 数据工程为什么是训练流程的基础?
结论:数据质量决定模型性能上限,再好的架构也无法弥补数据缺陷。"Garbage In, Garbage Out"是深度学习的基本原则。
Q7. 为什么预训练是算力消耗最高的阶段?
结论:预训练需要处理数万亿 token,数据量和计算量远超微调阶段。一个千亿模型可能需要数周训练,而微调可能只需数小时。
Q8. 预训练阶段模型学习到了什么?
结论:通用语言能力、逻辑推理、事实知识。预训练让模型通过大量文本学习语言的统计规律,形成"语言理解"和"生成"的基础能力。
Q9. 什么是 Next Token Prediction?
结论:预测下一个词是预训练的核心任务。给定前文,模型预测下一个词的概率分布,通过最大化正确词的概率来学习语言规律。
Q10. 全参数微调和高效微调的区别是什么?
结论:全参数微调更新所有权重,高效微调只更新少量参数。LoRA 等高效微调方案可以节省 90% 显存,但效果接近全参数微调。
Q11. LoRA 的核心原理是什么?
结论:LoRA 在预训练权重旁边添加低秩矩阵,只训练低秩矩阵。原始权重冻结,高秩信息由预训练保留,低秩矩阵学习任务相关知识。
Q12. 为什么需要 RLHF 对齐?
结论:预训练目标与人类意图存在偏差,需要通过人类反馈纠正。RLHF 让模型学习"什么样的输出是人类认为好的"。
Q13. RLHF 三步流程各起什么作用?
结论:SFT 学习"什么是好答案",RM 学习"人类偏好",PPO 优化策略。三步缺一不可,共同实现模型与人类价值观的对齐。
Q14. SFT 之后为什么还需要 PPO?
结论:SFT 只能学习人工标注的模式,PPO 可以发现更优但未被标注的策略。强化学习可以探索人工标注之外的可能性。
Q15. 数据并行和模型并行的区别是什么?
结论:数据并行是每卡持有完整模型但处理不同数据,模型并行是每卡持有部分模型。数据并行适合模型能装入单卡的情况,模型并行解决单卡装不下模型的问题。
Q16. 什么是张量并行?
结论:张量并行是层内模型并行,将单层权重矩阵切分到多卡。配合集合通信(AllReduce),可以在数学上等价于单卡计算。
Q17. Flash Attention 为什么能加速训练?
结论:Flash Attention 通过 IO 优化和tiling技术,将注意力计算提速 2-4 倍。核心思想是减少 HBM 访问次数,将中间结果保留在 SRAM 中。
Q18. 混合精度训练为什么能节省显存?
结论:FP16/BF16 比 FP32 占用更少显存,但计算精度可能降低。混合精度策略:用 FP16 做前向/反向计算,用 FP32 做梯度累积和优化器状态。
Q19. DeepSeek 的成功说明了什么?
结论:DeepSeek 验证了"算法+系统优化"路线的可行性。以低成本实现了对标 GPT-4 的效果,证明不是只有"堆硬件"一条路。
Q20. 大模型训练的未来趋势是什么?
结论:从"规模为王"转向"效率优先",算法优化与硬件协同发展。未来几年,训练优化技术将成为核心竞争力。
全篇总结
本篇系统梳理了大模型训练的时代背景、核心挑战与完整流程。核心要点:
- 参数规模爆发式增长,但 2025-2026 年行业拐点已至,边际收益递减
- 算力供需矛盾是核心矛盾,催生 AI Infra 优化领域
- 训练全流程:数据工程 -> 预训练 -> 微调 -> RLHF
- 预训练消耗 90%+ 算力,是优化主战场
- 微调和对齐将"通才"变成"专才"
- 训练优化是"降本增效"的核心竞争力
参考资源

浙公网安备 33010602011771号