LLM大模型技术基础知识学习
LLM大模型和Agent应用开发相关文章合集:
一、前言
当我们谈论人工智能时,大语言模型(Large Language Model,简称 LLM)无疑是当前最重要的技术之一。从 ChatGPT 到 DeepSeek,从 MiniMax 到通义千问,这些能够与人类进行流畅对话的大模型系统背后,都离不开 LLM 技术的支撑。
那么,LLM 大模型究竟是什么?它由哪些技术构成?这些技术又是如何协同工作的?本文将逐进行一下科普学习。
大语言模型通过海量数据的训练,学会了根据已有的文字内容预测接下来最可能出现的文字,从而生成连贯、有意义的文本回复。这种看似简单的预测下一个词的能力,正是 LLM 所有神奇功能的根源。
理解 LLM 的关键在于认识到它是一个概率系统,而非具有意识的存在。当模型输出“今天天气真好”时,它并不是真的“知道”天气的好坏,而是在无数训练数据的影响下,计算出在这个语境下“最可能”出现的文字组合。
这种概率本质帮助我们建立对 LLM 的准确认知:它是一个极其强大的统计预测工具。
二、技术基础
机器学习
要理解 LLM 的技术构成,我们需要从机器学习(Machine Learning)这一基础概念说起。传统的计算机程序是人类编写明确规则的逻辑系统——代码,程序员写代码告诉计算机“如果遇到这种情况,就那样处理”。而机器学习则完全不同:程序员不再编写具体的规则,而是让计算机自己从大量数据中发现规律。
举个例子,
如果我们想让计算机识别猫和狗的照片,传统方法需要程序员详细描述“猫有尖耳朵、胡须,而狗有下垂的耳朵”等规则。但机器学习的方法是给计算机展示大量标注好的猫和狗的照片,让它自己总结出区分两者的规律。这种让数据自己说话的方式,正是机器学习的核心思想。
机器学习主要分为三种类型:监督学习、无监督学习和强化学习。
-
监督学习是最常见的方式,就像老师教学生一样,给定输入和对应的正确输出,让模型学习输入与输出之间的映射关系。
-
无监督学习则没有标注好的答案,模型需要自己发现数据中的结构和模式。
-
强化学习通过奖励和惩罚机制,让模型在与环境的交互中学习最优策略。
LLM 的训练过程综合运用了这三种学习方式:在预训练阶段使用无监督学习,在微调阶段使用监督学习,在人类反馈阶段使用强化学习。
深度学习
深度学习(Deep Learning)是机器学习的一个重要分支,它的核心是神经网络(Neural Network)。
神经网络的设计灵感来源于人脑的工作方式——人脑由大量的神经元组成,每个神经元接收信号、处理信息、然后传递给其他神经元。人工神经网络正是模仿这一结构:用数学模型构建神经元,并通过大量神经元的连接来处理信息。
一个典型的神经网络包含多个层次:
输入层接收原始数据,隐藏层进行复杂的数学变换和计算,输出层给出最终结果。

(图来自 IMB 什么是神经网络)
之所以称为深度学习,是因为隐藏层的数量可以很多(从几个到几百个不等),形成了多层的网络结构。每一层都在前一层的基础上进行更高层次的特征提取,这使得深度学习能够处理非常复杂的模式。
以识别图片中的猫咪为例:
- 第一层可能识别出边缘和轮廓
- 第二层组合这些边缘形成耳朵、眼睛等部件
- 第三层进一步组合部件形成完整的猫咪面部。
网络层数越深,能够捕捉的特征就越抽象、越复杂。这就是深度学习深度的含义——它通过多层非线性变换,能够学习数据中极其复杂的特征表示。
神经网络的核心要素:
- 结构分层: 通常由输入层、隐藏层和输出层组成。输入层接收数据,隐藏层进行复杂的数学变换和计算,输出层产生结果。
- 神经元与连接: 节点之间通过权重(Weight)连接,权重代表连接强度,在训练中被不断调整,以减少预测误差。
- 学习与适应: 神经网络具有自适应性。它们通过训练过程,分析成千上万的样例数据,自动优化内部结构以自我提升。
- 工作机制: 神经元接收加权后的输入,求和后通过激活函数处理,若信号超过阈值则被激活,并传递给下一层
自然语言处理
自然语言处理(Natural Language Processing,简称 NLP)是人工智能的一个重要分支,致力于让计算机能够理解、生成和分析人类语言。
传统 NLP 面临诸多挑战:语言具有歧义性,同样的词语在不同语境下可能有不同含义;语言具有灵活性,新的词汇、表达方式不断涌现;语言还具有复杂性,语法、语义、语用等多个层面都需要处理。
在 LLM 出现之前,NLP 领域经历了多次技术变革。早期的基于规则的方法需要语言学家手工编写语法规则,这种方法难以处理语言的复杂性和灵活性。后来出现的统计学习方法通过分析大量文本数据来发现语言规律,但效果仍然有限。直到深度学习的引入,尤其是Transformer 架构的出现,NLP 领域才迎来了革命性的突破。
LLM 可以被理解为 NLP 领域的一次质的飞跃。
此前的 NLP 系统通常是针对特定任务设计的专用系统——翻译系统只能做翻译,问答系统只能回答问题。而 LLM 通过大规模预训练,学习了广泛的语言知识和世界知识,展现出了强大的通用能力:一个训练好的 LLM 可以通过简单的提示(Prompt)来完成各种不同的语言任务,真正实现了从专用人工智能向通用人工智能的跨越。
三、核心架构:Transformer的革命
从RNN到Transformer
在了解 Transformer 之前,我们首先需要知道它的前身:
循环神经网络(Recurrent Neural Network,简称 RNN)及其改进版本长短期记忆网络(Long Short-Term Memory,简称LSTM)。
早期的序列生成模型(如机器翻译、文本生成)主要使用 RNN,它能够处理序列数据——将前一个位置的输出作为下一个位置的输入,从而捕捉序列中的时序信息。
然而,RNN 存在严重的缺陷。当序列很长时,RNN 很难有效地学习远距离位置之间的依赖关系,早期的信息在经过多步传递后会逐渐稀释,难以对后面的输出产生影响。这就是所谓的“长距离依赖问题”。
虽然 LSTM 通过引入门控机制在一定程度上缓解了这个问题,但计算效率仍然很低——RNN 必须按顺序逐步处理,无法并行计算。
2017年,谷歌的研究团队发表了划时代的论文《Attention Is All You Need》,提出了 Transformer 架构。这一架构完全摒弃了循环结构,仅依靠注意力机制(Attention Mechanism)来处理序列数据。

Transformer的出现解决了 RNN 的两个核心痛点:
第一,它支持并行计算,能够同时处理序列中的所有位置,大大提高了计算效率;
第二,它通过注意力机制直接建立任意两个位置之间的联系,能够更好地捕捉长距离依赖关系。
Transformer 的革命性在于它证明了:
只需要注意力机制,就能构建出比循环神经网络更强大、更高效的序列处理模型。
这一发现开启了 NLP 领域的新纪元,后续几乎所有重要的大语言模型——包括 GPT 系列、BERT 系列、LLaMA 系列等——都以Transformer 作为基础架构。
注意力机制:理解上下文的钥匙
注意力机制(Attention Mechanism)是 Transforme r的核心创新,也是理解 LLM 工作原理的关键。
简单来说,注意力机制让模型在处理每个词时,能够关注到输入序列中其他与之相关的词,而不是盲目地处理所有信息。
让我们通过一个具体例子来理解。考虑句子:
“银行利率的调整会影响它的收益。”
这里的“它”指的是“银行”还是“利率”?人类可以轻松根据语境判断,但机器如何理解?
对于 RNN 来说,当处理到“它”这个词时,相关信息可能已经在前面的处理中稀释了。而注意力机制允许模型直接“查看”前面所有词的信息,并计算每个词与当前词的关联程度——在这个例子中,“银行”和“利率”都会获得较高的注意力权重,因为它们与“它”的语义关联最强。
从技术实现角度,注意力机制通过三个关键矩阵来完成计算:
查询矩阵(Query) 代表当前位置的“需求”。Query(查询)是一个特征向量,描述我们在序列中寻找什么,即我们可能想要注意什么。
键矩阵(Key) 代表每个位置能够提供的“信息”。每个输入元素有一个键,它也是一个特征向量。该特征向量粗略地描述了该元素“提供”什么,或者它何时可能很重要。键的设计应该使得我们可以根据 Query 来识别我们想要关注的元素。
值矩阵(Value) 则是实际的信息内容。每个输入元素,我们还有一个值向量。这个向量就是我们想要平均的向量。
还有一个关键概念:Score function 评分函数,为了对想要关注的元素进行评分,我们需要指定一个评分函数 f ,该函数将查询和键作为输入,并输出查询-键对的得分/注意力权重。它通常通过简单的相似性度量来实现。
模型通过计算 Query 与 Key 的相似度来确定注意力权重,然后用这些权重对 Value 进行加权求和,得到最终的输出。这种设计精妙地实现了按需获取信息的功能。
自注意力(Self-Attention) 是注意力机制的一种重要形式,它让输入序列中的每个词都可以与序列中的其他词进行交互。
自注意力能够捕捉句子中词语之间的各种关系:
语法关系(如主语和谓语)、语义关系(如上下义词)、指代关系(如代词与指代对象)等。正是这种强大的关系建模能力,使得 LLM 能够深入理解语言的深层含义。
编码器与解码器
Transformer架构由两部分组成:编码器(Encoder)和解码器(Decoder)。
编码器负责理解输入文本,将原始的文字序列转换为计算机可以处理的内部表示;
解码器则基于编码器的输出,逐步生成目标文本。
编码器采用双向注意力机制,这意味着它在处理每个词时能够同时看到该词左侧和右侧的上下文信息。这种设计使编码器特别擅长理解输入文本的含义——就像一个人阅读一段文字时,既能看到前面的内容,也能预见后面的发展,从而更准确地把握当前内容的含义。BERT等模型就是典型的编码器架构,它们在文本理解任务(如情感分析、问答)中表现出色。
解码器采用单向注意力机制(也称为因果注意力),它在处理每个词时只能看到该词左侧的历史信息,而无法看到右侧尚未生成的内容。这种设计符合文本生成的任务特性——我们在生成下一个词时,只能基于已经生成的词来预测,而不能作弊看到未来的内容。GPT 系列模型就是典型的解码器架构,它们在文本生成任务中展现出了强大的能力。
现代 LLM 主要有三种架构选择:纯编码器(如 BERT)、纯解码器(如 GPT)、编码器-解码器混合(如 T5)。
其中,纯解码器架构已成为主流。这是因为纯解码器在生成任务中表现优异,且随着模型规模的增大,其理解和生成能力都在不断提升,展现出了良好的缩放定律(Scaling Law)。当前最成功的 LLM,如ChatGPT、Claude 等,都基于纯解码器架构。
四、LLM的核心组件
分词Tokenization
分词(Tokenization)是 LLM处理文本的第一步,也是将人类语言转换为机器可处理形式的关键环节。由于计算机只能处理数字,无法直接理解文字,因此我们需要将文字转换为数字表示。分词就是完成这一转换的过程:将输入的文本分割成模型能够处理的最小单元——词元(Token)。
分词面临诸多挑战。
首先 是歧义性问题:同一个句子可能有多种分词方式,例如“研究生物”可以分词为“研究/生物”(研究生命的科学)或“研/究生物”(从事研究的工作人员)。
其次 是未登录词问题:训练数据中从未出现过的词(生僻字、专有名词、网络新词等)如何处理?
第三 是效率问题:分词粒度越细,序列长度越长,计算成本越高;粒度越粗,语义表示越粗糙。
常见的分词方法包括:
- 基于词的分词(将词语作为基本单元)
- 基于字符的分词(将每个汉字或英文字母作为单元)
- 基于子词的分词(如BPE、WordPiece等方法)
现代 LLM 普遍采用子词分词方法,它通过统计训练语料中词的出现频率,将高频词保持为完整单元,将低频词拆分为常见的子词单元。这种方法在词汇量和解码效率之间取得了良好平衡。
下面是分词步骤的高级概括:

(图来自 huggingface.co llm)
以 GPT-4 为例,其分词器将英文文本拆分为约等于半个单词的子词单元,中文则大约 1-2 个字符一个 Token。理解 Token 的概念对于使用 LLM 很重要:因为 API 通常按照 Token 数量计费,了解大约多少个字符对应 一个 Token 可以帮助估算成本。例如,通常4个英文字符约等于 1 个 Token,而 1-2 个中文字符约等于 1 个 Token。
嵌入向量
嵌入(Embedding)是LLM的又一核心概念,它解决了如何将文字转换为有意义的数学表示的问题。
嵌入的核心理念是:将每个词映射为一个多维向量,这个向量蕴含了词的语义信息。语义相近的词,在向量空间中的距离也应该相近。
数学中的向量(Vector,又称矢量)是指具有大小(模或长度)和方向的量。它通常表示从一个起点指向终点的有向线段,不仅可以描述空间中的位移、速度或力,在线性代数中还被抽象为由有序数值构成的有序数组(如行向量或列向量),常用于表示数学模型中的状态、数据组或空间中的点。
简单理解向量:向量主要有2个维度:大小、方向。
大小:箭头的长度表示大小
方向:箭头所指的方向表示方向
例如,经过 Tokenizer 处理的文本“我喜欢学习”可能会生成整数 ID 序列 [1, 2, 3, 4, 5]。在 Embedding 阶段,这些 ID 会被转换为稠密向量表示,如:
- “我” ->
[0.25, -0.34, 0.15, ...] - “喜欢” ->
[0.12, 0.57, -0.22, ...], [0.11, -0.09, 0.31, ...] - “学习” ->
[0.33, -0.44, 0.19, ...], [0.09, 0.23, -0.41, ...]
这些向量并不是随机生成的,它们是在模型的训练过程中被学习得到的。Embedding 向量的维度固定,但向量的数值根据模型对词语上下文的理解不断更新和优化,最终形成一个语义丰富的向量表示。
实际的 LLM 使用的嵌入维度要高得多——通常是几百维到几千维。在这个高维空间中,每个词都有一个独特的坐标。这些向量不是人工设计的,而是通过大规模数据训练得到的——模型在训练过程中自动学习到如何将词映射到合适的向量位置,使得语义相近的词在空间中自然聚集。
词嵌入是Transformer架构中不可或缺的一环。输入的Token首先被转换为嵌入向量,然后进入注意力层进行处理。高质量的嵌入能够显著提升模型的性能,这也是为什么大模型需要在海量数据上进行预训练——只有见足够多的语言现象,才能学习到丰富、准确的语义表示。
参数
参数(Parameters)是 LLM 中最核心的概念之一,它决定了模型的能力边界。我们常听到的“模型有多少亿个参数”,这里的参数指的就是神经网络中的权重(Weights)和偏置(Biases)。这些参数在训练过程中被调整优化,最终存储了模型从训练数据中学习到的知识。
可以类比理解参数的作用:
假设我们要拟合一条直线 y = wx + b,其中 w 是斜率,b 是截距——这两个就是参数。训练的过程就是找到最合适的 w 和 b,使得直线能够最好地拟合数据。对于 LLM 这样的超大模型,参数数量动辄数十亿甚至数千亿,但其基本原理相同:参数就是模型用于进行预测的旋钮,训练就是找到最佳的旋钮设置。
数据拟合(Curve Fitting)是一种通过数学模型描述离散数据点之间关系的方法,旨在找到一条最佳拟合曲线(或函数),以最小化预测值与实际观测数据之间的误差。
- 欠拟合(Underfitting):模型过于简单,无法捕获数据特点。
- 过拟合(Overfitting):模型过于复杂,将数据中的噪声当做规律,泛化能力差。
参数的价值在于其泛化能力。一个训练良好的大模型,其参数中存储的不仅是训练数据的记忆,更重要的是从数据中抽象出的知识和规律。
这使得模型能够对从未见过的问题做出合理的回答——就像人类可以从有限的学习经验中应用到无限的新场景一样。当然,参数过多也可能导致过拟合(overfitting),即模型只是机械地记忆训练数据,而无法真正理解规律,这也是大模型训练中需要克服的挑战。
大模型中的过拟合?
过拟合是指机器学习模型在训练数据上表现很好,比如准确率极高。
但在新数据(测试集或实际应用场景)上表现明显下降的现象。
参数规模与模型能力之间存在密切关系。
研究发现,随着参数规模的增大,LLM 会出现涌现能力(Emergent Abilities)——在小模型上看不到的能力突然出现。
例如,推理能力、跨语言理解、代码编写等能力,往往在模型规模超过某个阈值后才会显现。这被认为是 LLM 最神奇的现象之一,也是推动模型规模不断增大的重要原因。
五、训练流程:从数据到智能的蜕变
预训练
预训练(Pretraining)是 LLM 训练的第一个也是最关键的阶段。
想象一个孩子从出生到上学的过程:他们会无差别地接收来自世界的各种信息——听父母说话、看绘本、观察周围的一切。预训练的过程与此类似:模型在海量、多样的文本数据上进行无监督学习,学习语言的通用规律和广泛知识。
预训练通常采用自回归语言建模或掩码语言建模两种目标。
-
自回归语言建模的目标是:根据前面的文字预测下一个最可能的词。这正是LLM的核心能力——生成下一个词。
-
掩码语言建模则是随机遮挡输入中的某些词,让模型根据上下文预测被遮挡的词。BERT 采用这种方式,而 GPT 系列采用自回归方式。
预训练阶段需要消耗巨大的计算资源。以 GPT-3 为例,其预训练使用了约 570GB 的文本数据,在数千个 GPU 上训练了数周时间。这个阶段的投入决定了模型的基本素质——预训练数据越多、质量越高,模型的基础能力就越强。
预训练可以被理解为让模型博览群书,它会在这个阶段学习到词汇知识、语法规则、世界常识甚至简单的推理能力。
预训练又可以分为两个阶段:大规模预训练和继续预训练。
-
大规模预训练使用广泛的互联网文本,构建通用能力;
-
继续预训练则针对特定领域(如代码、医学、法律等)进行针对性强化,使模型在特定领域表现更出色。
监督微调:学会遵循指令
监督微调(Supervised Fine-Tuning,简称 SFT)是预训练之后的第一个微调阶段。如果说预训练让模型博览群书,那么监督微调就是教会模型理解指令——根据用户的输入给出有用、安全的回答。
监督微调使用的训练数据是指令-响应对(Instruction-Response Pairs):
每条数据包含一个用户指令(如“帮我写一首关于春天的诗”)和对应的理想回答。模型在这个数据上进行监督学习,学习将指令映射到合适的响应。这种训练方式直接影响了模型遵循指令的能力。
监督微调的关键在于数据质量。
高质量的指令-响应对应该满足:指令清晰明确、响应有帮助、格式规范、内容准确。研究表明,即使是同一基础模型,经过不同质量的微调数据训练后,能力可能会有显著差异。因此,很多机构会投入大量人力进行微调数据的筛选和编写。
经过监督微调后,模型已经具备了基本的对话能力——它能够理解用户意图并给出合理的回答。
但这个阶段的模型可能还存在一些问题:回答可能不够自然、有时会出现有害内容、可能无法很好地遵循复杂指令。这就需要后续的强化学习微调来进一步改进。
人类反馈强化学习RLHF
人类反馈强化学习(Reinforcement Learning from Human Feedback,简称RLHF)是 LLM 训练的最后关键步骤,它让模型的输出更符合人类期望、更安全、更有帮助。
RLHF 的核心思想是:
利用人类的反馈来指导模型学习,而不是简单地让模型模仿标注数据。
RLHF 的过程可以理解为三个步骤。
-
监督微调(SFT):教模型“如何说话”。在经过海量文本预训练的基础上,使用高质量的、由人类编写的“指令-回答”对(Instruction-Response)模型进行有监督的训练。将通用的预训练模型转化为能够理解人类指令、并能以对话形式回答问题的对话助手。
-
训练奖励模型(RM,Reward Model):让 SFT 模型对同一个问题生成多个不同的回答,由人类评估员对生成的多个回答按质量、准确性、安全性等维度进行排序,基于这些排序数据训练出一个奖励模型,这个模型能够评估回答的好坏。
-
策略优化:使用奖励模型作为反馈,通过强化学习算法(如PPO)进一步优化原始模型,使其生成的回答能够获得更高的奖励。
RLHF 解决了监督微调难以处理的问题。
第一,它能够处理主观评价问题——什么回答是“好的”,往往因人而异,RLHF 通过收集多样化的人类反馈来解决这一问题。
第二,它能够更好地控制输出质量——奖励模型可以捕捉到人类评判的微妙之处。
第三,它在安全性和有帮助性之间取得了更好的平衡——通过精心设计的反馈机制,可以减少有害输出同时保持有用性。
RLHF 是由 ChatGPT 引入并使其流行起来的关键技术。
它让 AI 系统的行为更符合人类价值观,这就是所谓的对齐(Alignment)问题。
RLHF 不是完美的解决方案——它也有局限性,如人类反馈可能存在偏见、奖励模型可能无法完全覆盖所有场景等——但它显著提升了LLM 的实用性和安全性。
六、总结与术语表
核心概念回顾
通过本文的介绍,我们已经对 LLM 的技术基础和技术构成有了全面的了解。回顾一下核心要点:
-
LLM 的本质是一个基于概率的文本生成系统,通过“预测下一个词”的方式来完成各种语言任务。它不是具有意识的存在,而是一个极其强大的统计预测工具。
-
技术基础包括机器学习、深度学习和自然语言处理。机器学习让计算机从数据中学习规律,深度学习通过多层神经网络实现复杂模式的学习,自然语言处理则是让计算机理解和生成人类语言的技术领域。
-
核心架构是 Transformer,它通过自注意力机制解决了长距离依赖问题,实现了并行计算,是现代LLM的基础架构。
-
技术构成包括分词(将文本转换为 Token)、嵌入(将 Token 转换为向量表示)、参数(存储模型的知识)。这三个组件共同实现了从人类语言到机器语言的转换。
-
训练流程分为预训练(学习通用语言知识)、监督微调(学习遵循指令)、RLHF(对齐人类价值观)三个阶段,每个阶段都有其独特的作用。
术语表
| 术语 | 英文 | 简单解释 |
|---|---|---|
| 大语言模型 | LLM (Large Language Model) | 参数规模大、能够处理复杂语言任务的人工智能模型 |
| 机器学习 | Machine Learning | 让计算机从数据中自动学习规律的技术 |
| 深度学习 | Deep Learning | 使用多层神经网络进行学习的人工智能分支 |
| 神经网络 | Neural Network | 模仿人脑结构的计算模型 |
| 自然语言处理 | NLP | 让计算机理解和生成人类语言的技术领域 |
| Transformer | Transformer | 2017 年提出的革命性模型架构 |
| 注意力机制 | Attention Mechanism | 让模型关注相关信息的机制 |
| 分词 | Tokenization | 将文本分割为 Token 的过程 |
| 嵌入 | Embedding | 将词语转换为向量表示 |
| 参数 | Parameters | 模型中需要学习的数值 |
| 预训练 | Pretraining | 在大规模数据上训练基础模型 |
| 微调 | Fine-tuning | 在特定数据上进一步训练模型 |
| RLHF | Reinforcement Learning from Human Feedback | 利用人类反馈进行强化学习 |
七、结语
LLM 技术的发展代表了人工智能领域的重大突破,它让机器第一次展现出如此强大的语言理解和生成能力。然而,理解 LLM 的技术基础知识和原理并不仅仅是技术人员的需求——对于每一个生活在这个 AI 时代的人来说,了解这些基础知识都有助于我们更好地使用工具、理解局限、把握机遇。
八、参考
-
https://arxiv.org/abs/1706.03762 Attention Is All You Need
-
https://blog.dailydoseofds.com/p/implement-attention-is-all-you-need Implement "Attention is all you need"
-
https://jalammar.github.io/illustrated-transformer/ The Illustrated Transformer 图解transformer 作者:Jay Alammar
-
https://www.zhihu.com/question/445556653 如何最简单、通俗地理解Transformer
-
https://cloud.tencent.com/developer/article/2416550 LLM 大模型学习必知必会系列(一):大模型基础知识篇 汀丶人工智能
-
https://zhuanlan.zhihu.com/p/638884759 【重温经典】Attention is all you need 6周年重读(上)
-
https://zhuanlan.zhihu.com/p/1955006993891828447【重温经典】Attention is all you need 6周年重读(中)
-
https://huggingface.co/learn/llm-course/chapter6/4 Normalization and pre-tokenization - huggingface.co
-
https://www.ibm.com/cn-zh/think/topics/neural-networks IBM 什么是神经网络?

浙公网安备 33010602011771号