Happy-LLM 学习笔记 00:为什么从 NLP 到 Transformer 再到 LLM?
最近准备按 Datawhale 的 Happy-LLM 开源教程系统补一遍大语言模型。这个系列不打算把教程内容搬运一遍,而是按自己的学习节奏记录每一章里真正需要抓住的知识点、容易混淆的地方,以及读完之后能落到工程实践里的想法。
项目地址在这里:https://github.com/datawhalechina/happy-llm
在线阅读地址:https://datawhalechina.github.io/happy-llm/
原项目采用 CC BY-NC-SA 4.0 许可,后续笔记会尽量保持引用清楚、少复制原文、多写理解。
为什么这条路线值得按顺序走
Happy-LLM 的主线很清楚:先从 NLP 基础概念开始,再进入 Transformer,然后看预训练语言模型的谱系,最后落到 LLM 的训练、微调、评测、RAG 和 Agent 应用。
我以前看大模型资料时很容易直接跳到最新模型、Prompt、RAG 框架或者 Agent 工具链。这样短期能很快做出东西,但一到排查效果问题,就会发现很多判断其实没有根:不知道 token 是怎么被切开的,不知道 mask attention 为什么会影响生成,也不清楚 Pretrain、SFT、RLHF 分别在塑造模型的哪一部分能力。
所以这次我想把学习顺序拉回去:
- NLP 基础:先理解文本如何变成模型能处理的对象,比如分词、词向量、文本分类、实体识别、摘要、问答这些任务。
- Transformer:重点不是背结构图,而是理解注意力机制、位置编码、残差连接、层归一化、mask 和多头注意力各自解决什么问题。
- 预训练语言模型:把 BERT、T5、GPT、LLaMA、GLM 放在同一张谱系图里看,比较 Encoder-only、Encoder-Decoder、Decoder-only 的训练目标和适用场景。
- LLM 训练流程:区分 Pretrain、SFT、PEFT、RLHF/偏好对齐,不把“训练大模型”笼统地当成一个黑箱。
- 应用系统:再去看评测、RAG、Agent,就更容易判断一个系统的问题到底来自模型本身、知识检索、工具调用,还是任务拆解。
第一次读下来的几个提醒
第一,LLM 不是凭空出现的新物种。它更像是语言模型、Transformer 架构、大规模数据、训练工程和对齐方法叠加后的结果。只盯着模型名字,很容易忽略背后的数据和训练流程。
第二,Transformer 也不只是 Attention。Attention 负责让 token 之间互相“看见”,但真正让深层网络稳定工作的,还有残差连接、归一化、前馈网络、位置编码等一组工程上非常朴素但关键的设计。
第三,训练流程比很多概念名词更重要。Pretrain 让模型学语言和世界知识,SFT 让模型学会按指令回答,偏好对齐让模型更接近人的期望;这三者解决的是不同问题,不能混在一起理解。
第四,应用阶段要有系统视角。RAG 不是“向量库 + 大模型”的简单拼接,Agent 也不是“给模型几个工具”就结束。评测、检索、上下文组织、工具选择、失败兜底,都会决定最终效果。
这个系列大概怎么写
我计划把 Happy-LLM 拆成 12 篇左右,按正常学习节奏一天发一篇,不晚上集中刷屏。每篇尽量保持一个主题:先记关键知识点,再写我的理解,最后补一点工程上的启发。
大概顺序是:
- 开篇和学习路线。
- NLP 基础与文本表示。
- Attention 和 Transformer 的核心机制。
- Transformer 的模块化实现。
- BERT、T5、GPT、LLaMA 等预训练模型谱系。
- LLM 的 Pretrain、SFT、RLHF/偏好对齐。
- 动手搭建小型 LLM 时应关注的模块。
- 基于 Transformers 的训练实践和 LoRA/QLoRA。
- token 生成与解码策略。
- RAG 的知识流转设计。
- 评测和 Agent。
- Extra Chapter 里的小模型微调、Thinking Budget、多模态拼接等工程启发。
下一篇先从 NLP 基础开始。我的目标不是把每个任务都背一遍,而是弄清楚这些“老概念”为什么到 LLM 时代依然有用。

浙公网安备 33010602011771号