AI Infra 大厂专题【左扬精讲】—— 2026 大厂 AI Infra 用户画像分析:从岗位分层、能力门槛到薪资天花板
AI Infra 大厂专题【左扬精讲】—— 2026 大厂 AI Infra 用户画像分析:从岗位分层、能力门槛到薪资天花板
阅读前必读:本文数据使用与免责说明
- 数据来源:本文薪资、岗位画像、面试考点等数据综合自 2026 年公开招聘 JD、行业调研、面经汇总,具体数字为中位数参考,不构成权威依据,实际以各公司 offer 为准
- 薪资说明:所有薪资数字均为总包(含现金 + 股票/期权 + 签字费),120w 以上总包中股票通常占大头且为 4 年分期归属,不能等同于每年现金到手
- 岗位分层:AI Infra 是涵盖核心训推优化、MLOps/调度平台、数据/存储等多个方向的统称,不同方向门槛差异巨大,请勿将单一赛道的硬性门槛套用到全部岗位
- 学习周期:本文提到的学习时长为具备相关背景的参考周期,零基础转行者需在此基础上额外补基础,万卡集群经验通常需要在工作中积累
- 作者立场:本文面向零基础到资深各阶段技术人,内容侧重技术科普与求职参考,绝对化结论已尽量避免,但仍难免有局限,请批判性阅读
2026年,AI基础设施(AI Infra)已成为技术圈最炙手可热的赛道之一。
随着大模型从实验室走向千行百业,企业对能够驾驭万卡集群、精通推理优化的工程师需求呈爆发式增长。
本文基于2026年最新大厂招聘JD与行业面经,完整梳理AI Infra岗位核心能力、面试重点、薪资与人才画像,帮助技术人先看清自己属于哪类用户画像,再决定往哪个方向投入。
AI Infra 大模型训练 推理优化 CUDA 分布式系统 2026招聘
本文目录
用户画像全景图:先看清自己属于哪一类
Why — 为什么先讲用户画像?
AI Infra 不是一个岗位,而是 一组差异巨大的岗位集合。不同方向的门槛、天花板、学习路径差异极大,把所有人装进 "AI Infra 工程师" 这一个筐里讨论薪资和能力是误导性的。本文的核心方法论是:先定位用户画像,再讨论能力与薪资。
用户画像四象限(按 "CUDA 门槛 × 业务贴近度" 划分)
| 象限 | 画像类型 | CUDA 门槛 | 典型岗位 | 主流总包区间 | 画像占比 |
|---|---|---|---|---|---|
| A · 算子架构师 | 硬核底层专家 | 硬性(手写 Kernel) | GPU/NPU 算子开发、自研推理引擎、模型编译器 | 120-220w | ~15% |
| B · 分布式/推理工程师 | 系统级主力 | 加分项(理解原理) | 万卡训练、vLLM/TensorRT-LLM 优化、推理平台 | 80-150w | ~35% |
| C · MLOps / 调度平台 | 工程化主力 | 不需要 | AI 平台、算力调度、k8s+Volcano、训练编排 | 60-110w | ~35% |
| D · AI 存储 / 数据 / 安全 | 支撑型岗位 | 不需要 | 训练 IO 优化、数据流水线、多租户隔离、AI 安全 | 50-100w | ~15% |
关键观察
-
-
- 需要 CUDA 的岗位(象限 A)占比仅 15%,但拿到的是 150w+ 顶尖包的入场券
- 不需要 CUDA 的岗位(C + D)合计占比 50%,是行业真正的招聘大头,"不会 CUDA = 没出路" 是误读
- 象限 B 是最大公约数:理解 CUDA 原理 + 不强求手写算子,覆盖了大多数大厂 AI Infra 核心团队
- 行业真相:50% 的人不需要写 CUDA,50% 的人拿的不是顶薪 —— 这才是 2026 年 AI Infra 招聘市场的真实分布
-
用户画像速查表(按背景找定位)
| 你的背景 | 对应象限 | 核心瓶颈 | 切入路径 |
|---|---|---|---|
| 应届硕士 / CS 科班 | A 或 B | CUDA + 分布式经验 | 校招直接投训推优化岗 |
| 工作 3-5 年的算法工程师 | B | C++/系统能力 | 从训练脚本优化切入推理工程 |
| 工作 3-5 年的后端开发 | C | AI 负载理解 | 从 MLOps / k8s+Volcano 切入 |
| DevOps / SRE | C 或 D | 训练框架熟悉度 | AI 算力调度、训练编排 |
| HPC / 高性能计算背景 | A(最对口) | 深度学习框架熟悉度 | 直接冲算子开发,最具竞争力 |
| 30+ 转行者 | C(最友好) | 年龄 + 转型成本 | MLOps / 调度平台方向,避免硬冲 A |
使用建议:先在速查表中找到自己的位置,再去对应章节深挖。本文后七章(一至七)按技术栈维度展开,第八章薪资区间与人才画像会按四个象限分别给出区间,第九至十章 FAQ 与 Roadmap 也会按画像差异化给出建议。
学习重点提示
本篇系统梳理 AI Infra 工程师的核心能力模型与面试考察范围。以下是每个主题你需要掌握的深度说明:
必备技能三角:定位、能力要求与价值意义
定位:Python + C++/CUDA + PyTorch 是 AI Infra 的硬性门槛,三者缺一不可
能力要求:能独立完成 PyTorch 模型训练、阅读 PyTorch 源码理解 Autograd 机制、手写 CUDA 算子实现高性能 Kernel
价值意义:
-
-
-
- Python 是 AI 领域的事实标准,是快速原型和工具链开发的主力语言
- C++/CUDA 是性能瓶颈突破的核心手段
- PyTorch 是分布式训练框架(DeepSpeed/Megatron)和推理引擎(vLLM/TensorRT-LLM)的底层依赖。
- 不会其中任何一项,都无法深入核心优化
-
-
核心业务双引擎:定位、能力要求与价值意义
定位:大模型分布式训练 + 推理优化,贯穿面试 70% 内容
能力要求:能部署 3D 并行(DP+TP+PP)训练百亿参数模型、能调优 vLLM PagedAttention 提升吞吐、能手写量化 Kernel 实现 INT4/INT8 压缩
价值意义:
-
-
-
- 2026 年大模型参数已达万亿规模,单卡无法容纳完整模型,分布式训练是工程落地的前提
- 推理优化直接决定服务成本与用户体验,是商业化落地的核心竞争力
-
-
能力深度阶梯:定位、能力要求与价值意义
定位:四个递进阶段——会用 → 能用好 → 能自研 → 能带队,对应阶段一 → 阶段二 → 阶段三 → 阶段四
能力要求:能用好(调通框架+性能调优)→ 能自研(手写算子/调度)→ 能带队(系统架构)
价值意义:
-
-
-
- "会用"只是入门,能调通 DeepSpeed/vLLM 只是基础
- 能针对业务场景手写融合算子才是稀缺能力
- 能带队设计万卡集群架构者年薪 150w+
-
-
入场路径分化:定位、能力要求与价值意义
定位:不同背景的技术人切入 AI Infra 的最优路径不同
能力要求:
-
-
-
- 后端开发:补 PyTorch 基础,重点攻 CUDA
- 算法工程师:补系统底层,重点攻推理优化
- DevOps/SRE:补 AI 负载特性,重点攻 MLOps
-
-
价值意义:每种背景都有独特优势,后端的工程能力、算法的模型理解、运维的集群经验都是差异化竞争力,关键是补齐最短板
差异化护城河:定位、能力要求与价值意义
定位:开源贡献(vLLM/PyTorch PR)+ 万卡集群生产级经验
能力要求:能向主流开源项目提交有影响力的 PR、主导过千卡以上规模的生产训练任务
价值意义:
-
-
-
- 开源贡献证明你能读懂顶级项目的代码并贡献价值,是面试官验证技术深度的有力证据
- 万卡集群经验意味着你经历过真实的生产级挑战,是筛选高级岗位候选人的核心标签
-
-
阅读前提 & 建议:
前置知识:本篇面向有 1-3 年后端/算法经验的技术人,需具备 Linux 基础、Python 编程能力、分布式系统基本概念
不涉及的内容:具体 API 编程细节(这些是实践中边做边学的)、某一框架的完整源码解读
深度预期:学完本篇后,你能理解 AI Infra 核心能力地图,能回答"为什么 CUDA 是硬门槛",能区分分布式训练与推理优化的侧重点
后续延伸方向:
-
- 分布式训练 → 深入 DeepSpeed/Megatron 源码
- 推理优化 → 深入 vLLM Scheduler/PagedAttention
- 底层系统 → 手写 CUDA 算子 / NCCL 通信优化
- 工程化 → MLOps 平台 / 调度系统设计
What — AI Infra 工程师到底是什么?
AI Infra(AI Infrastructure)工程师是深度学习算法与底层系统工程的交汇点。
他们负责构建、优化和维护支撑大模型训练与推理的基础设施,涵盖从单卡 Kernel 开发到万卡集群调度的全栈技术。
不同于纯算法工程师关注模型精度,AI Infra 工程师的核心价值是 把 AI 算法稳定、高效、可扩展地运行在生产环境中,其工作范畴远不止"让模型跑得更快",至少还包括:
-
-
- 训推性能优化:分布式并行、Kernel 调优、量化压缩、推理调度
- 集群稳定性工程:万卡集群故障容灾、Checkpoint 快速恢复、训练中断接续
- 多租户平台化:算力调度与隔离、SLO 保障、多团队资源分配
- 数据 IO 工程:训练数据流水线、Checkpoint 读写优化、存储 IO 瓶颈治理
- 异构芯片适配:昇腾、海光 DCU、壁仞等国产芯片的算子/通信适配
- MLOps 工程化交付:实验管理、模型注册、CI/CD、灰度上线、效果监控
- 安全与合规:AI 安全隔离、数据脱敏、训练过程审计
-
一、必备编程语言基础
What — 为什么语言基础是入场券?
AI Infra 岗位对编程语言的要求远高于普通算法岗位,因为工作的本质是 性能优化 而非单纯的模型实现。不同语言在不同场景下有不可替代的优势。
| 编程语言 | 定位 | 典型应用场景 | 掌握难度 |
|---|---|---|---|
| Python | 硬性必备 | 训练脚本、数据流水线、自动化工具开发 | 入门简单,精通难 |
| C++/CUDA | 核心门槛 | 算子Kernel开发、推理引擎底层调优 | 门槛极高,不可替代 |
| Go | 加分项 | 自研基础设施服务、工具链开发 | 相对简单 |
重要:AI Infra 不是单一赛道,门槛因方向不同差异巨大。把 AI Infra 等同于 "必须会 CUDA" 是一种常见误解,下面按三大方向给出真实门槛:
| 赛道方向 | 核心技能 | CUDA 要求 | 典型岗位 | 2026 主流薪资区间 |
|---|---|---|---|---|
| 核心训推优化 / 算子开发 | Python + C++/CUDA + PyTorch | 硬性门槛 | 推理引擎研发、训练框架优化、Kernel 工程师 | 80-200w(少部分顶尖可达 250w+) |
| MLOps / 算力调度 / AI 平台 | Go / Python + k8s+ 调度系统 | 不需要 | AI 平台开发、MLOps 工程、调度系统工程师 | 50-120w |
| 数据 / 存储 / 训练 IO | Python / C++ + 分布式存储 | 通常不需要 | 数据流水线、训练存储优化、Checkpoint 系统 | 50-100w |
关键提醒:
-
-
- 大厂 AI Infra 招聘中,MLOps / 调度 / 平台类岗位数量通常大于核心训推优化岗,求职空间更广
- 选择方向时,应结合自身背景(后端 / 算法 / 运维),不必盲目挤 CUDA 独木桥
- 本文讨论的"硬性门槛"主要针对核心训推优化赛道,广义 AI Infra 门槛更宽
-
语言学习优先级(核心训推优化赛道)
从实际招聘需求来看,语言学习的优先级应该是:
-
-
- 第一优先级:PyTorch 源码阅读能力(理解 Autograd、Dispatcher 机制)
- 第二优先级:CUDA C++ 编程(内存层次、线程模型、共享内存)
- 第三优先级:Python 高性能生态(asyncio、多进程、C扩展)
-
Rust 在 AI Infra 中的真实定位
重要:Rust 是 C++/CUDA 之外的第三种系统级语言选项,但不是 GPU Kernel 开发的替代方案。下表给出 Rust 在 AI Infra 各场景的真实适用边界:
| 场景 | 主流语言 | Rust 能否替代 | 代表项目 |
|---|---|---|---|
| GPU Kernel 开发 | C++/CUDA | ❌ 不能(Rust 暂无成熟 GPU Kernel 生态) | cuBLAS、Triton、Cutlass |
| 推理服务网关层 | C++ / Go | ✅ 可以 | mistral.rs、candle |
| 高并发调度器 Host 层 | Go / C++ | ✅ 可以(Tokio 异步 runtime 成熟) | Rust 重写的调度组件 |
| MLOps CLI / 工具链 | Python / Go | ✅ 可以(性能敏感场景) | cudarc、训练数据处理 CLI |
| 训练框架核心 | C++ + Python | ❌ 主流框架仍以 C++ 为主 | PyTorch、DeepSpeed 内核 |
Rust 的吸引力主要来自语言特性:基于 trait 单态化的零成本抽象、编译期阻止悬垂指针、无 GC 适合延迟敏感的推理服务、Tokio 异步 runtime 适合高并发网关。
学习建议:
-
-
- 核心训推优化岗位:优先 C++/CUDA,Rust 作为加分项
- 推理服务 / 网关层岗位:Rust 经验是 显著加分项,可与 Go 并列
- MLOps / 工具链岗位:Rust 有竞争力,但 目前岗位数量较少
-
二、大模型分布式训练优化技术栈
Why — 为什么分布式训练是核心能力?
2026年,大模型参数规模从百亿走向万亿,单卡显存已无法容纳完整模型。没有分布式训练能力,大模型就是空中楼阁。这不仅是技术问题,更是商业竞争力的核心。
没有分布式训练优化会发生什么?
-
-
- 千亿参数模型无法训练,只能做小模型实验
- 训练效率低下,10000张GPU的集群利用率可能只有30%
- 无法支撑公司AI战略,职业发展受限
-
2.1 分布式并行框架
| 框架 | 定位 | 适用场景 |
|---|---|---|
| DeepSpeed | 微软出品,MoE优化领先 | 超大规模训练、显存优化 |
| Megatron-LM | NVIDIA出品,3D并行成熟 | 万卡级别训练 |
| FSDP | PyTorch原生,张切片 | 中等规模,易用性好 |
3D并行深度解析
-
-
- 数据并行(DP):将 batch 切分,每卡处理不同数据,梯度聚合
- 张量并行(TP):将模型参数按维度切分,需要 AllReduce 通信
- 流水线并行(PP):将模型按层切分,micro-batch 流水线调度
- 三者结合:实际配比 完全取决于模型参数量、单卡显存、集群硬件拓扑,不存在通用标准。下表仅为常见量级的示意参考,实际工程中需根据具体模型(如千亿 dense / 万亿 MoE / 长文本)和拓扑(NVLink 域大小、IB 带宽)做大量调优实验
-
-
- 常见量级示意(仅为参考,不构成标准):
- 千亿 dense(如 70B):常见 TP8 + PP8 + DP=集群规模/64
- 万亿 MoE:常见 EP64 + TP8 + PP16,MoE 专家并行进一步拉大通信规模
- 长文本大模型:Sequence Parallel 与 Ring Attention 显著影响配比
-
-
2.2 训练加速技术
-
-
-
- 混合精度 BF16/FP8:利用 TensorCore 加速,降低显存
- FlashAttention:注意力机制的 IO-aware 优化,softmax 计算零重算
- 梯度重计算:用计算换显存,允许训练更大模型
- 长序列优化:Ring Attention、sequence parallel
- MoE专家并行:稀疏激活,多专家负载均衡
-
-
训练优化核心要点总结
-
- 1个核心目标:让GPU利用率达到80%+
- 3个优化维度:计算、显存、通信
- 5个必备框架:DeepSpeed / Megatron-LM / FSDP / FlashAttention / NCCL
三、大模型推理优化(2026面试第一重点)
What — 为什么推理优化成为2026面试第一重点?
2026年,大模型训练需求相对稳定,但 推理服务 成为商业化落地的核心战场。推理优化直接关系到:
-
-
- 服务成本:每降低10ms延迟,可节省百万服务器成本
- 用户体验:首Token延迟直接影响产品竞争力
- 商业价值:吞吐量提升直接转化为营收增长
-
3.1 缓存与调度优化
| 技术 | 作用 | 面试高频点 |
|---|---|---|
| PagedAttention | KV Cache 显存分页管理 | vLLM核心原理、显存碎片问题 |
| Continuous Batching | 动态 batch 调度 | 吞吐量提升、padding 浪费 |
| PD分离 | Prefill 与 Decode 分离部署 | 资源错配、负载均衡 |
PagedAttention 为什么能大幅提升吞吐?
传统KV Cache按请求预分配固定显存,导致:
-
-
- 显存碎片:短请求浪费大量显存
- 利用率低:实际使用可能只有40%
-
PagedAttention 的解决方案:
-
-
- 将KV Cache组织成固定大小的block
- 动态分配,按需申请,碎片率降至5%以下
- 支持prefix caching,复用相同prompt的KV
-
3.2 压缩加速技术
-
-
- GPTQ/AWQ:权重量化,4bit/8bit压缩
- FP8量化:H100/H200原生支持,精度损失小
- INT4量化:极致压缩,用于端侧部署
- SmoothQuant:通道级平滑,量化友好
-
3.3 解码加速技术
-
-
- 投机解码(Speculative Decoding):小模型预测,大模型验证
- Medusa:多尾解码,一次生成多个token
- Tree Attention:并行验证多个候选序列
-
3.4 部署框架选型
| 框架 | 优势 | 适用场景 |
|---|---|---|
| vLLM | PagedAttention、社区活跃 | 通用推理服务 |
| TensorRT-LLM | 性能最优、NVIDIA深度优化 | 生产环境高性能 |
| Triton | 灵活的推理服务框架 | 自定义算子优化 |
视角一:从vLLM源码理解PagedAttention
vLLM的PagedAttention核心在于 block_manager 管理KV Cacheblock:
-
-
- Block大小通常为16/32 tokens
- 通过physical block映射表实现逻辑地址到物理地址的转换
- 支持block级别的prefix caching
-
视角二:Continuous Batching的调度逻辑
调度器核心是 iteration_step() 函数:
-
-
- 每step检查完成请求,释放显存
- 尝试填充新请求,最大化GPU利用率
- 动态调整batch size避免OOM
-
四、底层系统与硬件基础设施能力
Why — 为什么底层能力决定上限?
AI Infra工程师的薪资天花板由底层能力决定。
能够手写CUDA Kernel、理解GPU架构、熟练使用 profiling 工具的人,确实比仅调框架API的人有显著的薪资溢价,同年限主流区间大约 20%-35%;但 "稳定 50% 以上" 的差距只存在于顶尖自研芯片算子专家这类稀缺岗位上,不能作为通用结论。
注意:这里的"调框架 API"指的是完全不懂底层、只能跑通现成 demo 的情况。如果一个工程师已经能熟练调优 vLLM / DeepSpeed、定位性能瓶颈,差距并没有 50%。
4.1 GPU硬件与通信
-
-
- Hopper/Blackwell架构:第四/五代TensorCore,FP8原生支持
- 昇腾架构:华为自研,NPU生态逐渐成熟
- CUDA Kernel开发:手写融合算子,突破框架限制
- NCCL通信优化:Ring/Mesh拓扑、AllReduce算法调优
- RDMA高速网络:InfiniBand/NVLink,跨节点通信加速
-
面试高频问题
请解释 CUDA 内存层次结构:Register → Shared Memory → L1 Cache → L2 Cache → Global Memory,每一层的带宽和延迟差异是多少?
4.2 集群调度系统
| 调度器 | 特点 | 适用规模 |
|---|---|---|
| k8s+ Volcano | 云原生,AI任务支持 | 通用场景 |
| Kubeflow | ML工作流完整套件 | 中大规模 |
| Slurm | HPC场景首选 | 万卡集群 |
| Ray | 弹性调度,Actor模型 | 灵活实验 |
4.3 高性能存储
-
-
- JuiceFS:云原生分布式文件系统
- Ceph:企业级存储方案
- Alluxio:数据编排层,缓存加速
- 数据格式优化:TFRecord/Parquet序列化和读取
- Checkpoint读写:万亿参数模型保存时间优化
-
4.4 性能分析与定位
常用Profiling工具与定位场景
-
-
- Nsight Systems:全系统视角,GPU/CPU协同分析
- Nsight Compute:CUDA Kernel级别分析,SM利用率、内存带宽
- PyTorch Profiler:训练过程分析,识别CPU瓶颈
- DeepSpeed Profiler:分布式训练专项分析
-
五、云原生与AI工程化
What — 为什么工程化能力不可或缺?
优秀的AI Infra工程师不仅要懂算法优化,更要能将优化成果工程化落地。
从容器化部署到CI/CD流水线,从实验管理到模型版本控制,工程化能力决定了技术能否真正产生业务价值。
5.1 容器与编排
-
-
- Docker:容器化基础,必须掌握
- Kubernetes:容器编排标准,AI平台底座
- GPU调度:时间片分享、MIG隔离
-
5.2 基础设施即代码
-
-
- Terraform:跨云基础设施编排
- Helm/Kustomize:Kubernetes应用打包
-
5.3 公有云AI平台
| 平台 | 特点 |
|---|---|
| AWS SageMaker | 生态完善,SMDistributed训练 |
| 阿里云PAI | 国内头部,液冷支持 |
| 字节火山引擎 | 豆包大模型加持 |
5.4 实验管理与MLOps
-
-
- MLflow:实验跟踪、模型注册
- TensorBoard:训练可视化
- Weights & Biases:SaaS实验平台
- MLflow + Ray:端到端MLOps
-
六、差异化加分竞争力
Why — 为什么加分项决定能否进头部?
在算法能力同质化的2026年,差异化竞争力是脱颖而出的关键。以下几项能力能让你在竞争中占据优势地位。
6.1 开源贡献
-
-
-
- 向PyTorch、vLLM、DeepSpeed提交PR
- 成为核心Contributor甚至Maintainer
- 影响力:从使用者到建设者的跨越
-
-
如何起步开源贡献
建议从good first issue开始,逐步深入:
-
-
- 修复文档错误、测试用例
- 优化已知bug、编写测试
- 实现新功能、参与code review
-
6.2 异构芯片适配
重要更新(2026):国产化适配从"加分项"变为部分业务线的硬性要求
国内大厂(阿里、字节、百度、腾讯、华为等)受国产化战略推进影响,很多业务线已将昇腾 / 自研 GPU 适配列为硬性招聘要求,而非单纯的加分项。在应聘国内大厂 AI Infra 岗位时,应充分评估业务线的国产化背景。
-
-
- 昇腾 NPU(华为):国内大厂核心业务线 硬性要求,包括 CANN 算子开发、图编译、集合通信(HCCL)适配
- 海光 DCU:基于 ROCm 生态,国产 GPU 重要选项,金融 / 政企场景需求增长
- 壁仞 / 摩尔线程:国内自研 GPU,能在某些推理场景替代英伟达卡,需适配其专有 SDK
- 字节 / 阿里 / 百度自研芯片:配套业务线优先使用,经验沉淀后市场稀缺度高
- TPU:Google 生态,学术研究常用,国内 AI Infra 岗位较少直接要求
-
6.2.1 Rust + CUDA:2026 年的一种新选项
What — Rust 是否可写 CUDA Kernel?
2026 年,Rust 在 AI Infra 领域被视为继 C++/CUDA 之后的第三种系统级语言选项。已出现的项目包括推理引擎 mistral.rs、ML 框架 candle 等。Rust 吸引 AI Infra 开发者的特性主要来自语言本身:
-
-
- 零成本抽象:基于 trait 单态化(static dispatch),高级抽象不引入运行时开销
- 所有权检查:编译期阻止悬垂指针与同一数据的可变别名
- 无 GC:适合对延迟稳定性敏感的推理服务
- tokio 异步运行时:用于实现高并发推理网关
-
6.2.1.1 Rust 调用 CUDA 的三种主流路径
| 路径 | 代表 crate | 工作方式 | 适用场景 |
|---|---|---|---|
| FFI 调用 .cu | cc + bindgen | nvcc 编译 .cu 为静态库,Rust 通过 extern "C" 链接 | 高性能手写 Kernel(最主流) |
| 纯 Rust 绑定 | cudarc | Rust 原生绑定 CUDA Driver/Runtime API | 不想碰 C++ 的纯 Rust 项目 |
| Rust ML 框架 | candle / tch-rs | 上层 ML 框架,内部封装 CUDA | 推理服务、模型部署 |
6.2.1.2 Rust vs C++ vs C 在 CUDA 编程中的对比
核心维度对比表(✓ = 支持/适用,✗ = 不支持/不适用;评级为相对参考)
| 对比维度 | C | C++ | Rust |
|---|---|---|---|
| CUDA 官方示例主流度 | 有部分 C API 示例 | 主流(绝大多数官方示例) | 无官方示例 |
| 泛型 / 模板元编程 | 无 | 支持(CUTLASS 等大量使用) | 支持(trait + 泛型) |
| 编译期内存安全 | 无 | 无 | 有(所有权 / 借用检查) |
| 运行时多线程内存安全 | 无 | 无 | 有(Send / Sync) |
| 零成本抽象 | 无抽象层 | 基本零成本(部分场景有 vtable 开销) | 零成本(trait 静态分发) |
| 学习曲线 | 中等(需手动管理资源) | 较陡(模板 / 元编程) | 陡(所有权 / 借用 / lifetime) |
| CUDA 生态成熟度 | 有(cuBLAS / cuDNN 等 C API) | 成熟(PyTorch / TensorRT / CUTLASS) | 薄弱(多数项目仍自研) |
| 构建复杂度 | 较简单 | 中等(CMake 常见) | 较复杂(cargo + cc + nvcc) |
| GPU 调试工具链 | 支持(cuda-gdb) | 支持(cuda-gdb + IDE) | 基础支持(部分链路仍待完善) |
| 部署体积 | 小 | 中(含 libc++) | 较小(默认静态链接、标准库极小) |
| 国内大厂招聘相关性 | 低(极少岗位) | 高(核心门槛) | 可见度上升(职位相对稀少) |
6.2.1.3 三大语言的优劣剖析
C 语言:CUDA C 接口的最小子集
优势:
-
-
- nvcc 原生支持,编译路径直接
- C ABI 稳定,跨编译器 / 跨平台兼容性好
- 无 C++ 模板与类机制的额外复杂度
-
劣势:
-
-
- 无 RAII,cudaMalloc / cudaFree 须成对书写
- 无泛型,同一 Kernel 需按类型展开
- 多数算子库(CUTLASS / Thrust)的现代 API 以 C++ 模板提供,纯 C 项目难以直接复用
-
结论:若非维护遗留 C 库,2026 年的新项目通常不首选纯 C。
C++:CUDA 工程的主流实现语言
优势:
-
-
- 生态覆盖广:PyTorch / TensorRT / cuDNN / CUTLASS 的核心实现均以 C++ 为主
- 模板元编程:CUTLASS 通过模板实现可组合的算子,性能可接近 cuBLAS
- 工具链完整:Nsight、cuda-gdb、IDE 调试、性能分析器支持齐全
- 招聘相关性强:多数大厂 AI Infra JD 出现"精通 C++ / CUDA"要求
-
劣势:
-
-
- 裸指针与智能指针使用不当仍可能出现内存泄漏
- 模板重项目冷启动编译时间较长(具体取决于项目规模)
- 构建系统选择多(CMake / Makefile / Bazel),配置成本不低
- 多线程数据竞争缺乏编译期保障
-
结论:2026 年仍是 AI Infra 推理与训练框架的主流实现语言。
Rust:可与 CUDA 共用的较新系统语言
优势:
-
-
- 编译期内存检查:所有权与借用检查在编译期阻止悬垂指针、同一数据的可变别名
- 零成本抽象:trait 静态分发,运行时开销与手写 C++ 相当
- 无 GC:tokio 异步运行时不引入 GC 暂停,适合延迟敏感的推理服务
- 单一二进制:默认静态链接,部署时不依赖 libc++
- Cargo:内置依赖解析与构建脚本,比手写 CMake 更易上手
-
劣势:
-
-
- CUDA 相关生态偏薄弱:尚无对标 CUTLASS 的成熟模板算子库,多数项目仍需自研
- GPU 调试链路:cuda-gdb 对 Rust 的支持不如 C / C++ 完善
- 所有权心智负担:所有权 / 借用 / lifetime 与 unsafe 边界对新手较陡
- 混合构建:需在 cargo 中调用 nvcc,CI 配置需要额外步骤
- 相关岗位较少:能同时写好 Rust 与 CUDA Kernel 的工程师在招聘市场相对稀缺
-
结论:适合新启动的推理服务项目;存量 C++/CUDA 项目的内核部分仍以 C++ 为主。
6.2.1.4 一段对比代码:三种语言实现 Vector Add
// ===== C 版本(nvcc 直接编译)=====
__global__ void vector_add(const float* a, const float* b, float* c, int n) {
int idx = blockIdx.x * blockDim.x + threadIdx.x;
if (idx < n) {
c[idx] = a[idx] + b[idx];
}
}
// 调用:vector_add<<<grid, block>>>(d_a, d_b, d_c, n);
// 必须手动 cudaMalloc / cudaFree / cudaMemcpy
// ===== C++ 版本(带模板 + RAII)=====
template<typename T>
__global__ void vector_add(const T* a, const T* b, T* c, int n) {
int idx = blockIdx.x * blockDim.x + threadIdx.x;
if (idx < n) c[idx] = a[idx] + b[idx];
}
// 用 thrust::device_vector<float> 自动管理显存
thrust::device_vector<float> d_a(a), d_b(b), d_c(n);
// RAII:出作用域自动 cudaFree
// ===== Rust 版本(cudarc crate,示意代码)=====
use cudarc::driver::{CudaDevice, LaunchAsync, LaunchConfig};
let dev = CudaDevice::new(0)?;
let a = dev.htod_copy(a_vec)?; // Host → Device 返回 Result
let b = dev.htod_copy(b_vec)?;
let mut c = dev.alloc_zeros::<f32>(n)?;
// f 为经 PtxModule 加载的 vector_add kernel
let f = dev.get_func("vector_add").unwrap();
let cfg = LaunchConfig::for_grid_num_threads((grid as u32, 1, 1), (block as u32, 1, 1));
unsafe { f.launch(cfg, (&a, &b, &mut c, n))?; }
// a / b / c 出作用域时由 Drop 触发 cudaFree
以上代码为示意,具体 API 以你所用版本的 cudarc 文档为准(配置方法、错误类型可能随版本变化)。Rust 端 Kernel 通常仍由 nvcc 预编译为 PTX / CUBIN,并通过 PtxModule::from_src 或 from_bytes 加载。
参考建议:如何选择 CUDA 编程语言?
-
-
- 维护 PyTorch / TensorRT 内核:选 C++(与既有代码一致)
- 维护既有 C 库:继续 C
- 全新推理服务项目:可考虑 Rust 外层 + C++/CUDA 内核的组合
- 对运行时内存安全要求高:在外层用 Rust,内核仍以 nvcc 编译
-
6.3 拓展方向
| 方向 | 技术要点 | 前景 |
|---|---|---|
| 多模态基建 | CLIP/BLIP架构、图文对齐、跨模态Attention | 2026最热方向 |
| Agent底层基建 | 工具调用、Memory系统、Planning优化 | Agent时代核心 |
| RLHF训练平台 | PPO实现、Reward Model、Human Feedback | 模型对齐必备 |
| 端侧推理优化 | 移动端/嵌入式部署、TensorRT Mobile | AIoT场景 |
| Rust 生态 AI Infra | cudarc / candle / mistral.rs、推理服务外层 | 可见度上升 |
七、2026面试核心考察内容
What — 大厂面试到底在考什么?
根据2026年面经汇总,AI Infra面试主要考察四个维度,每个维度有不同的准备策略。
7.1 系统设计(占比最高)
典型系统设计题目
-
-
- 高并发推理服务设计:如何设计支持10万QPS的LLM推理服务?
- 长文本训练集群架构:如何设计支持100万Token上下文的训练系统?
- 多租户推理平台:如何在保障SLO的同时最大化GPU利用率?
- 故障恢复与容灾:万卡训练中断如何快速恢复?
-
7.2 手写代码
-
-
-
- CUDA算子:矩阵乘法、Attention计算
- 分布式并行:AllReduce实现、梯度同步
- 通信逻辑:NCCL集合通信模拟
-
-
7.3 源码深挖
| 组件 | 面试高频问题 |
|---|---|
| vLLM Scheduler | 请求如何进入队列?调度算法是什么? |
| PagedAttention | Block映射如何实现?如何处理物理block冲突? |
| 量化底层 | GPTQ的权重量化流程?AWQ的activation smoothing原理? |
7.4 性能调优
-
-
-
- 给定训练日志,定位性能瓶颈
- 分析GPU利用率低的原因
- 输出具体的优化方案和预期收益
-
-
八、薪资区间与四象限人才画像
What — 2026 年 AI Infra 不同象限的薪资到底是什么水平?
2026 年,AI Infra 岗位的薪资确实高于普通后端开发,是技术圈高薪赛道之一。但网上流传的薪资区间存在 严重虚高,常被自媒体夸大宣传,求职者应以更理性的视角看待。
本文按上文划分的四个用户画像象限,分别给出真实的薪资区间。
重要前提:以下区间为"总包"(含现金 + 股票/期权 + 签字费),120w 以上总包中股票通常占大头,且多为 4 年分期归属。每年现金到手会比数字低 20%-40%,这是大厂薪酬结构的现实,不能直接等同于每年现金到手。
8.1 按用户画像象限拆分的薪资区间(2026 大厂真实参考)
关键说明:以下为"总包",含股票分期
大厂总包超过 120w 的部分,通常包含 4 年分期归属的股票/期权,首年现金到手往往会低 20%-40%。下表数字均为公开招聘信息和行业调研的中位数参考,不代表上限也不代表平均。
| 象限 | 画像类型 | 校招主流 | 3-5 年主流 | 5 年+ 主流 | 顶尖稀缺 |
|---|---|---|---|---|---|
| A · 算子架构师 | 硬核底层专家 | 55-85w | 120-180w | 180-260w | 300w+(金字塔尖) |
| B · 分布式/推理工程师 | 系统级主力 | 45-70w | 90-130w | 130-180w | 200w+(核心骨干) |
| C · MLOps / 调度平台 | 工程化主力 | 38-55w | 70-100w | 100-140w | 150w+(资深架构) |
| D · AI 存储 / 数据 / 安全 | 支撑型岗位 | 35-50w | 60-90w | 90-120w | 140w+(业务负责人) |
重要现实校准
-
-
- 网上广为流传的"5 年 + 150-300w"是象限 A 的数据,套用到 B/C/D 是严重虚高
- "三项能力齐全 150w 起步"对应的是象限 A 的稀缺溢价,不是通用区间
- 30+ 转行进入象限 A 几乎不可能,走 C/D 才是合理路径
- 象限 C/D 的天花板虽然低于 A,但需求量更大、稳定性更高,是大多数从业者的实际落脚点
-
8.2 按工作年限拆分的传统参考表
| 级别 | 工作年限 | 主流总包区间 | 稀缺岗位总包 | 备注 |
|---|---|---|---|---|
| 校招 / 初级 | 0-3 年 | 45-70w | 80-100w+(SSP 专项) | 100w+ 仅限清北/海外顶博的 SSP(字节 Top Seed、阿里星等)极少数人,绝非普遍现象 |
| 资深工程师 | 3-5 年 | 80-120w | 130-150w(顶尖骨干) | 150w 是核心骨干 / 创业公司期权打包的上限 |
| 专家 / 架构师 | 5 年 + | 150-220w | 220-300w+(金字塔尖) | 300w+ 通常为实验室负责人 / 顶尖算子架构师,不可作为通用区间参考 |
主流社招真实区间
3-5 年资深工程师在头部大厂(字节、阿里、腾讯)主流总包 80-120w;80w 以下一般是中小厂或非核心业务线。谈薪时一定要问清:
-
-
- 现金占比多少(base + 签字费)
- 股票几年归属(第几年拿多少)
- 绩效奖金是固定部分还是浮动部分
- 你所在的象限是哪个(不同象限薪资天花板差距巨大)
-
8.3 四象限差异化的人才画像
象限 A:算子架构师(CUDA 硬门槛)
代表能力组合(主流总包 150-220w,顶尖者 300w+):
-
-
- 可手写 CUDA Kernel:不依赖框架,能从零实现高性能算子
- 熟悉 GPU 架构:理解 Hopper/Ampere 微架构、内存层次、Coalesced 访存
- 模型编译器经验:TVM / Triton / XLA / MLIR 任一方向
- 推理引擎内核优化:vLLM / TensorRT-LLM 内部 Attention Kernel
-
画像特征:通常是数学/物理/CS 博士,或有 HPC / 嵌入式背景;3-5 年才能进入核心骨干梯队;供给极少,需求稳定增长。
重要提醒:象限 A 是 150w+ 顶薪的真实来源,但 门槛极高、岗位数量稀少,不要把所有 AI Infra 求职者的薪资预期都对标象限 A。
象限 B:分布式/推理工程师(CUDA 加分项)
代表能力组合(主流总包 90-150w):
-
-
- 吃透 vLLM/TensorRT-LLM 底层源码:能讲解 PagedAttention、Scheduler、量化 Kernel 实现
- 万卡规模大模型训练落地经验:不只是实验环境,是真正生产级经验
- 3D 并行调优实战:能根据模型/硬件动态选择 DP/TP/PP/EP 组合
- 理解 CUDA 原理:能读 Kernel 代码、能用 Profiler 分析瓶颈,但不要求手写
-
画像特征:多数 3-7 年经验工程师的归宿;既懂训练框架又懂推理引擎;是大厂 AI Infra 团队的核心招聘对象。
象限 C:MLOps / 调度平台工程师(不需要 CUDA)
代表能力组合(主流总包 70-110w):
-
-
- 云原生栈:k8s + Volcano/KubeRay + Docker 精通
- 调度系统:Yarn / Slurm / 自研调度器之一
- AI 负载特征:理解训练/推理的资源模型,能做 Gang Scheduling、拓扑感知调度
- Go / Python 工程能力:能开发 Operator、Controller、监控系统
- 国产化适配:昇腾/CANN、海光 DCU 适配经验是强加分项
-
画像特征:多数由后端/DevOps/SRE 转型的工程师;不需要 CUDA,但需要深度理解 AI 负载;岗位需求量大、稳定性高,是 AI Infra 招聘市场中 数量最多的方向。
关键认知:象限 C 并不是"低端替代",而是 门槛独立、需求量更大 的方向,万卡集群故障容灾、多租户算力隔离、训练 IO 优化都直接依赖这个象限的能力。
象限 D:AI 存储 / 数据 / 安全工程师(不需要 CUDA)
代表能力组合(主流总包 60-100w):
-
-
- 分布式存储:对象存储 / 并行文件系统 / 缓存加速
- 训练数据流水线:数据加载、预处理、特征工程
- AI 安全 / 合规:模型隔离、数据脱敏、推理安全
- 多租户 / 资源隔离:云厂商核心竞争力方向
-
画像特征:通常是传统存储/数据/安全背景转 AI 方向;需求稳定但增长慢于 A/B/C;是云厂商、AI 平台型公司重点招聘方向。
8.4 不同背景如何切入(按四象限差异化)
| 背景 | 对应象限 | 优势 | 转型路径 |
|---|---|---|---|
| 应届硕士 / CS 科班 | A 或 B | 基础扎实 | 校招直接投训推优化岗 |
| 传统算法工程师(3-5 年) | B | 模型理解深 | 深入底层实现,补强系统能力 |
| 传统后端开发(3-5 年) | C | 工程能力强 | 补强 PyTorch + AI 负载理解,切入 MLOps |
| DevOps / SRE | C 或 D | 集群运维经验 | 学习 AI 负载特点,转型调度 / 存储 |
| HPC / 嵌入式 / 高性能计算背景 | A(最对口) | 并行计算基础 | 直接深入 CUDA,最具竞争力 |
| 30+ 转行者 | C(最友好) | 工程经验沉淀 | MLOps / 调度平台,避免硬冲象限 A |
使用建议:本表是上文 "用户画像速查表" 的细化版本。如果你已经在第零章定位好自己的象限,可以直接对照本表决定具体的转型动作。
常见问题FAQ(20组)
Q&A 分组说明
以下是针对AI Infra学习和求职的20个高频问题,每个问题都给出简短结论+详细展开。
语言与基础
Q1. Python必须精通到什么程度?
一句话结论:达到能阅读和修改PyTorch源码的水平。不仅会用API,更要理解Python的GIL限制、多线程/多进程模型、asyncio异步编程,以及如何通过Cython/Numba提升性能。
Q2. C++/CUDA的学习路径是什么?
一句话结论:从《CUDA Programming》开始,到手写矩阵乘法算子结束。建议路径:C++基础(1月)→ CUDA编程基础(2月)→ 显存层次优化(2月)→ 手写融合算子(持续)。
Q3. 不会CUDA能进AI Infra吗?
一句话结论:可以,但天花板很低;Rust + CUDA 是新选项。纯 Python 岗位如 MLOps、数据工程也可以归入广义 AI Infra,但核心推理优化/训练加速岗位,CUDA 是硬门槛。2026 年新选项是 Rust + CUDA,比纯 C++/CUDA 更易上手,详见 6.2.1 节。
Q4. Go 与 Rust 在 AI Infra 中各自扮演什么角色?
一句话结论:Go 主导基础设施服务,Rust 主攻推理引擎与 GPU Kernel。vLLM/TensorRT-LLM 等核心框架是 C++/Python,但周围的调度系统、监控平台多用 Go 实现。Rust 则在 mistral.rs、candle 等新项目中崛起,适合无 GC + 高并发的推理网关与 GPU 算子封装。
分布式训练
Q5. DeepSpeed和Megatron-LM哪个更重要?
一句话结论:取决于场景,2026 的现实是"FSDP2 + Megatron-Core"组合更主流。DeepSpeed 的 ZeRO-3 + ZeRO-Infinity 在 MoE 训练和 NVMe Offload 场景仍有优势;Megatron-LM 的 TP/PP/SP 在 70B+ dense 模型上被广泛使用,其核心库 Megatron-Core 已嵌入 NeMo、TorchTitan 等。PyTorch 原生 FSDP2 在 dense LLM 上已成为主流选项(参考 Lightning、HuggingFace 内部基准显示部分场景比 ZeRO-3 快 2-5 倍)。建议至少熟悉其中两种,根据模型规模和集群拓扑选择。
Q6. 3D并行需要同时开启吗?
一句话结论:通常组合使用,但比例需要调优。万卡集群典型配置:DP128 + TP8 + PP4。DP过大导致梯度同步延迟,TP过大增加通信开销,PP过深导致气泡。
Q7. FlashAttention为什么能加速?
一句话结论:通过IO-aware优化,减少HBM访问次数。传统Attention需要多次访问HBM,FlashAttention将softmax计算分解,在SRAM中完成,访存减少到O(N)级别。
Q8. MoE训练的主要挑战是什么?
一句话结论:负载均衡和通信开销。有些expert被频繁激活,有些则"沉默",导致GPU利用率不均。解决方案:auxiliary loss、top-k gating、expert capacity。
推理优化
Q9. vLLM和TensorRT-LLM怎么选?
一句话结论:快速迭代用vLLM,追求极致性能用TensorRT-LLM。vLLM社区活跃、特性迭代快,Benchmark性能优秀。TensorRT-LLM经过NVIDIA深度优化,生产环境首选。
Q10. PagedAttention的核心思想是什么?
一句话结论:用操作系统的分页内存管理思想管理KV Cache。传统方式预分配固定显存,碎片严重。PagedAttention将KV Cache分成固定block,动态映射,显存利用率提升至95%+。
Q11. 量化会导致模型效果下降吗?
一句话结论:FP16/BF16基本无损,INT8有小幅损失,INT4需要特殊校准。GPTQ/AWQ等方法通过 calibration dataset校准,可以在4bit下保持90%+效果。
Q12. 投机解码的原理是什么?
一句话结论:用小模型快速生成候选,大模型验证。小模型一次生成多个token,大模型并行验证,正确的token直接接受,错误的回退。加速比取决于接受率。
Q13. Continuous Batching和Static Batching区别?
一句话结论:Static Batching静态组batch,Continuous Batching动态调整。Static会导致短请求等待长请求,GPU空转。Continuous Batching实时调度,GPU利用率提升3-5倍。
Q14. PD分离架构是什么?
一句话结论:Prefill和Decode阶段资源需求不同,拆分部署。Prefill是计算密集型(处理prompt),Decode是访存密集型(逐token生成)。拆分后可以分别优化,避免资源错配。
硬件与系统
Q15. Hopper和Ampere架构的主要区别?
一句话结论:Hopper支持FP8和Transformer Engine优化。H100的TensorCore支持FP8计算,理论上比A100的FP16快6倍。实际收益取决于模型是否使用FP8。
Q16. NCCL通信优化有哪些技巧?
一句话结论:选择合适的拓扑、使用bucketing、避免小消息。NVLink拓扑下AllReduce带宽最高,InfiniBand需要合理的partition count,避免过小的NCCL ring导致效率低。
Q17. 如何判断训练瓶颈是计算还是通信?
一句话结论:看GPU利用率和NCCL通信时间占比。Nsight Systems可以同时看到GPU计算时间和通信等待时间。计算瓶颈表现为SM利用率100%,通信瓶颈表现为大量等待。
Q18. 万卡集群的Checkpoint策略是什么?
一句话结论:异步保存 + 增量保存 + 分层存储。万亿参数模型Checkpoint达TB级别,同步保存会阻塞训练。采用异步管道,保存时继续前向计算,配合对象存储做持久化。
求职与职业
Q19. AI Infra面试和普通后端面试区别?
一句话结论:更侧重底层原理和性能思维。不仅考算法题,还会现场分析日志、设计推理系统。手写CUDA Kernel是高频考点。
Q20. 30岁转行AI Infra晚不晚?
一句话结论:可行,但需要理性评估方向,避免一刀切乐观预期。
推荐路径(按背景差异化):
- 纯后端 / DevOps 背景:MLOps / 调度平台 / AI 平台方向是最现实的选择,门槛相对低,6-12 个月可上手
- 传统算法背景:可考虑推理优化 / 训练工程方向,但需补 C++/CUDA/分布式系统
- HPC / 嵌入式 / 高性能计算背景:可直冲算子开发方向,是 30+ 转行中最具竞争力的路径
需要警惕的现实问题(不要只看乐观面):
- 30 岁零基础转算子优化 / 万卡分布式:需补 C++/CUDA/并行计算底层 2-3 年,且竞争不过应届生(年轻工程师的学习时间和可塑性优势明显)
- 大厂社招通常卡 30-35 岁红线(部分团队卡 P7 及以上职级),30+ 转行进入头部大厂核心 AI Infra 岗位的实际机会有限
- 简历需要更扎实:与应届生相比,转行者的项目经验是核心评估项,必须有可展示的成果(开源贡献、生产级项目、技术博客)
- 薪资预期应理性:转行前 1-2 年总包通常会低于同年限同事,3-5 年才可能追平或反超
总结:30 岁转 AI Infra 不是"晚不晚"的问题,而是"方向选对 + 持续投入 + 合理预期"的问题。盲目乐观不可取,理性规划才是关键。
全篇核心要点(四象限视角)
-
-
- 用户画像先行:AI Infra 不是单一岗位,而是四个差异巨大的象限(A 算子 / B 分布式推理 / C MLOps / D 存储数据);先定位画像,再谈能力与薪资
- 硬性门槛仅适用象限 A:Python + C++/CUDA + PyTorch 是象限 A 的硬门槛,但50% 的 AI Infra 岗位(C + D)不需要 CUDA
- 核心战场:分布式训练优化 + 推理优化,面试占比 70%;但象限 C/D 的面试重点是集群调度 / 工程化能力,不是同一个能力模型
- 差异化竞争力:开源贡献 + 大规模集群实战 + 源码深度 + 国产化适配经验
- 薪资真相(按象限看):象限 A 顶薪 300w+、象限 B 主流 90-150w、象限 C 主流 70-110w、象限 D 主流 60-100w;网上流传的"150w 起步"是象限 A 的稀缺溢价,套用全行业是误导
- 学习策略:以源码为师,以 profiling 为镜,以开源为跳板;路径选择 > 努力程度,选错象限再努力也难以达到画像天花板
-
学习路线Roadmap
2026 AI Infra 工程师成长路径
以下路线图基于大厂招聘需求和行业最佳实践设计,分为四个阶段,每个阶段都有明确的学习目标和检验标准。
重要前提:以下时长为"具备相关背景"(如已有 C++/算法基础)的参考周期
-
-
- 零基础转行者(如纯后端转训推优化)需在此基础上额外增加 6-12 个月补基础
- 万卡集群经验 个人很难在短期内获得——大多数从业者接触的是单机多卡或千卡实验环境,万卡生产级经验通常需要在工作中积累
- 开源 PR 合并 是长期工程,新手 1 年内很难产出有影响力的 PR,更多是 2-3 年的持续投入
- 路径选择:选择 MLOps / 调度 / 平台方向可大幅缩短学习周期(通常 6-12 个月可上手)
-
阶段一:入门(0-6个月)
| 学习内容 | 推荐资源 | 检验标准 |
|---|---|---|
| PyTorch高级用法 | 官方文档 + 源码阅读 | 能讲解Autograd机制 |
| C++基础 | 《C++ Primer》 | 能写简单的模板代码 |
| CUDA编程入门 | 《CUDA C++ Programming Guide》 | 手写矩阵乘法 |
| k8s基础 | 官方文档 + minikube实践 | 能部署简单服务 |
阶段二:进阶(6-12个月)
| 学习内容 | 推荐资源 | 检验标准 |
|---|---|---|
| 分布式训练框架 | DeepSpeed/Megatron官方教程 | 能训练百亿模型 |
| 推理优化框架 | vLLM/TensorRT-LLM | 能优化推理吞吐量 |
| 性能分析工具 | Nsight/Nsys | 能定位GPU瓶颈 |
| 量化技术 | GPTQ/AWQ论文 + 实现 | 能量化LLaMA到INT4 |
阶段三:精通(1-2年)
| 学习内容 | 推荐资源 | 检验标准 |
|---|---|---|
| 手写融合算子 | Triton/CUTLASS | 性能接近 cuBLAS |
| 集群调度 | Volcano/Slurm源码 | 能设计调度策略(说明:个人很难接触万卡环境,多在工作中积累) |
| 开源贡献 | vLLM/PyTorch Issues | 有合并的PR(说明:新手 1 年内难有影响力贡献,更多是长期投入) |
| 系统设计 | 设计推理服务架构 | 能通过大厂系统面 |
阶段四:专家(2年+)
| 学习内容 | 推荐资源 | 检验标准 |
|---|---|---|
| 前沿技术跟进 | 顶会论文 + 社区讨论 | 能快速复现新方法 |
| 团队技术管理 | 实际项目经验 | 能带团队交付项目 |
| 跨模态基建 | 多模态模型训练经验 | 有多模态优化经验 |
| 影响力建设 | 博客 + 演讲 + 开源 | 有行业知名度 |
行动建议
不要试图一口气学完所有内容。建议选择一个方向深耕(如推理优化、MLOps 平台、调度系统),逐步扩展到其他领域。AI Infra 是一个需要持续学习的领域,保持好奇心和技术敏感度比任何具体技能都重要。同时建议尽早进入工作环境积累生产级经验,这是单纯自学无法替代的。

浙公网安备 33010602011771号