大语言模型(LLM)的工作原理

大语言模型(LLM)的工作原理,可以用一个非常形象的比喻来理解:它本质上是一个“文字接龙”高手,而且是有史以来最聪明的一个。

它的核心任务就是:根据上文,预测下一个最可能出现的词(或Token)。

为了让你更透彻地理解,我会从“训练”和“推理”两个阶段,把它的“黑盒”拆开来看。


第一步:海量“阅读”(预训练阶段)

在成为“专家”前,LLM需要“读”完互联网上几乎所有的公开文本(书籍、网页、论文、代码等)。这个过程不是死记硬背,而是压缩知识

  • 核心机制:填空与接龙。训练时,研究员会遮住原文中的某个词,让模型根据上下文去猜。如果猜错了,就通过数学公式(损失函数)调整模型内部的参数(权重)。这个参数调整的过程就是“学习”。

  • 关键概念:Token。模型不认识“中国”这个词,它会把“中国”拆解成几个Token(词元),这是它处理信息的最小单位。所有输入输出,本质上都是一串Token。

  • 关键概念:Embedding(嵌入)。模型无法理解文字,只能计算数字。它会把每个Token转化为一串高维度的向量(比如几千个小数组成的坐标)。语义相近的词,在向量空间里的距离也相近(“国王”和“皇帝”的向量方向接近,“苹果”和“香蕉”接近)。

通过这次“阅读”,模型记住了语法、逻辑、事实和常识。此时,它拥有了一个庞大的参数矩阵(如GPT-4有万亿级参数),这个矩阵就是它的“大脑”。


第二步:关键的“涌现”能力(Transformer架构)

之所以现在的LLM这么强大,全靠2017年谷歌提出的Transformer架构,其中核心是自注意力机制(Self-Attention)

  • 并行处理:以前的模型只能从左到右顺序读,而Transformer可以同时看整句话。

  • 权重分配:当模型处理“苹果”这个词时,它会计算句子中所有其他词对“苹果”的注意力权重。比如在“我在吃红色的苹果”里,“吃”和“红色的”权重最高,“我”权重中等,“的”权重极低。

  • 多层抽象:模型有几十甚至上百层网络。浅层负责识别语法(主谓宾),中层负责识别语义(谁对谁做了什么),深层负责识别情感和复杂逻辑。每一层都在前一层的基础上进行抽象,最终生成对下一词的预测概率。


第三步:回答你的问题(推理阶段)

当你输入问题“大语言模型的工作原理是什么?”时,模型是这样工作的:

  1. 输入编码:把你这句话拆成Token,转化为向量。

  2. 上下文理解:通过注意力机制,理解“大语言模型”是主语,“工作原理”是询问对象。

  3. 逐词生成(自回归)

    • 模型计算所有可能Token的概率分布,选出最高概率的那个词,比如“它”。

    • 然后把“它”拼接到原文后面,形成新上文:“大语言模型的工作原理是什么?它”。

    • 再次预测下一个词,比如“本质”。

    • 如此循环,直到生成结束符(句号或<EOS>)。

  4. 解码策略:为了不让回答死板,工程师会加入温度(Temperature)参数。温度越高,模型越敢选“概率稍低但更有创意”的词;温度越低,回答越确定、越保守。


第四步:让它“懂规矩”(对齐与微调)

仅靠“接龙”训练的模型,可能会输出有害或虚假内容。因此,还需要微调

  • 监督微调(SFT):用大量“人类标准问答对”去训练它,教它“应该这样回答问题”。

  • 基于人类反馈的强化学习(RLHF):让模型生成多个回答,由人类(或AI)打分排序。模型学会“讨好”人类评判标准,学会拒绝危险问题,这也就是所谓的“AI伦理对齐”。


为什么它会产生“幻觉”?

现在你明白了:LLM不是在“查找”数据库,而是在“猜”下一个词

  • 当它遇到知识盲区时,它不会说“我不知道”,而是会基于向量空间的相似性,“编造”出听起来合理但实际错误的词。这就是幻觉(Hallucination)的来源。

  • 它没有真正的“逻辑推理”能力,它只是见过无数类似逻辑的文本,从而学会了“推理的模式”。所以,它在数学计算上经常出错,但在写诗或总结上却非常惊艳。


总结一句话

LLM是一个基于海量数据训练、利用注意力机制捕捉上下文关联、通过不断预测下一个词元来生成文本的巨型概率统计模型。它不懂“意义”,但它精通“模式”。

posted @ 2026-09-01 09:56  古锁阳关  阅读(15)  评论(0)    收藏  举报