开疆拓土,学习大模型
大语言模型(LLM)核心原理解析
-
核心定义与本质
大语言模型(Large Language Model, LLM)是基于Transformer架构的深度神经网络,通过在海量无标注文本语据上进行自监督学习,习得语言的统计规律、语义逻辑与世界知识。其本质是一个概率模型,目标是预测序列中下一个词(Token)的出现概率,从而实现流畅的文本生成与理解。 -
底层架构:Transformer的“注意力”机制
LLM的核心在于Transformer编码器(Decoder-only架构,如GPT系列)。其灵魂是自注意力机制(Self-Attention),它能捕捉文本中任意两个位置之间的依赖关系,无论距离远近。
- Query(查询)、Key(键)、Value(值):通过线性变换生成三个向量,计算当前词与上下文所有词的关联强度(注意力分数),并加权聚合上下文信息。
- 多头注意力(Multi-Head Attention):同时使用多组不同的参数,从不同角度捕捉语言的语法、语义和逻辑关系,最后拼接输出,提升模型表达能力。
- 关键技术:从预训练到推理
- 预训练(Pre-training):模型在庞大的通用语料库(书籍、网页、文章等)中进行“填坑”任务(Masked Language Modeling),学习通用语言规律与世界知识。
- 微调(Fine-tuning)与对齐(Alignment):
- 有监督微调(SFT):使用人工标注的指令样本对模型进行微调,让模型学会遵循指令。
- 人类反馈强化学习(RLHF):模型根据人类对生成结果的偏好进行学习,优化奖励函数,使模型输出更符合人类价值观、更安全、更有用的内容。

浙公网安备 33010602011771号