大模型权重全解析:从神经元到 2.8 万亿参数,一文讲透训练、推理、微调与量化
引言:什么是 Transformer?为什么它改变了 AI
在讲权重之前,必须先理解 Transformer——它是当前所有大语言模型(LLM)的底层架构。2017 年 Google 发表的论文《Attention Is All You Need》提出了它,彻底改变了 NLP 领域。
在 Transformer 之前:RNN 的瓶颈
早期的循环神经网络(RNN)和 LSTM 处理文本时,是逐字顺序读取的:
"我" → 计算 → "喜欢" → 计算 → "猫" → 计算 → ...
问题:
-
距离越远,信息越难传递("我"和句尾的"它"很难建立关联)
-
无法并行计算,训练极慢
-
长文本处理能力天花板明显
Transformer 的革命:自注意力机制
Transformer 的核心创新是自注意力(Self-Attention)——它让模型一次性看到整句话的所有词,然后自动计算"每个词应该关注哪些其他词"。
句子:"小明丢了钥匙,他很着急"
Transformer 会同时计算:
-
"他"和"小明"的关联度 → 高
-
"他"和"钥匙"的关联度 → 中
-
"他"和"着急"的关联度 → 低
这意味着:无论两个词相距多远,Transformer 都能直接建立关联。 彻底解决了 RNN 的"远距离遗忘"问题。
Transformer 的两大核心组件
| 组件 | 作用 | 权重角色 |
|---|---|---|
| 注意力层(Attention) | 计算词与词之间的关联强度 | Q/K/V/O 四套权重矩阵 |
| 前馈网络(FFN) | 对注意力输出做非线性变换,存储知识 | 两层(或三层)大权重矩阵 |
结果: 所有现代 LLM(GPT、Claude、Kimi、Llama、Qwen)都是 Transformer 的变体。理解 Transformer,就理解了大模型的骨架。
示例:K3 对 Transformer 的四大改进
K3(2.8 万亿参数)并非简单堆叠 Transformer,而是在标准架构上做了结构性创新:
| 改进 | 作用 | 对权重的影响 |
|---|---|---|
| Kimi Delta Attention (KDA) | 混合线性注意力机制,降低长文本处理的二次计算成本 | 注意力权重矩阵的计算方式改变,能高效处理百万 token 长文本 |
| Attention Residuals (AttnRes) | 让注意力输出可以跨层直接传递,不用经过所有中间计算 | 信息"走捷径",权重传递路径更高效,深层信息不丢失 |
| Stable LatentMoE | 896 个专家子网络,每次只激活 16 个 | 总权重 2.8 万亿,但推理时只加载约 320 亿激活权重,兼顾容量与速度 |
| Gated MLA + SiTU 激活 | 门控多头注意力增强选择性,Sigmoid Tanh Unit 优化激活控制 | 注意力权重分配更精准,FFN 权重激活更可控 |
一句话总结: K3 保留了 Transformer 的骨架,但替换了"关节"——注意力更高效、信息流动更直接、专家路由更稳定,从而支撑起 2.8 万亿参数的庞大权重体系。
一、先搞懂:权重是什么
大模型本质上是一个由海量矩阵堆叠而成的巨型数学函数,而权重(Weight)就是矩阵里的每一个数字——它是模型从海量文本中"学到的"全部知识。
-
权重是一堆浮点数(如
0.2、-1.5、0.78)。 -
训练阶段:不断调整这些数字,让模型预测更准确。
-
推理阶段(你调用 API 或本地跑模型):权重完全固定不变,只做纯粹的数学运算来生成文字。
举个极简类比
把模型当成一套超级复杂的数学公式,权重就是公式里所有的常数。
公式结构不变,但常数不同,输出就完全不一样。这些常数就是模型的记忆、逻辑、语言习惯。
二、基础单元:神经元怎么靠权重计算
单个神经元的计算逻辑
输出 = 激活函数(输入向量 × 权重矩阵 + 偏置)
| 组件 | 作用 |
|---|---|
| 输入 | 文字被转成数字向量(Embedding 词嵌入) |
| 权重 | 每个输入通道对应一个权重值,代表"这个信息有多重要" |
| 正权重 | 增强该特征 |
| 负权重 | 抑制、忽略该特征 |
| 偏置(Bias) | 微调输出基线,防止输出全为 0 |
| 激活函数 | 引入非线性,让模型能学习复杂规律(没有它,模型只能做线性拟合) |
例子:语义关联
输入句子 "猫吃鱼":
-
每个字被转换为数字向量;
-
权重矩阵中,"猫"与"鱼"之间的关联权重数值很高;
-
计算时,模型会放大两者之间的关联强度,从而理解"猫的食物是鱼"这一语义。
延伸:常被混淆的概念
-
参数 ≠ 神经元大模型说 “7B 参数、13B 参数”,参数指权重 + 偏置的总数量,是神经元之间的连接条数,不是神经元本身数量。比如一层全连接:输入 1024 维、输出 4096 维,参数数量 = 1024×4096,神经元数量 = 输出维度 4096。
神经元总结:
Transformer 内部的线性变换、前馈节点就是人工神经元(白话解释:所有可训练权重对应的计算单元,就是人工神经元)
三、Transformer 大模型:权重矩阵的分层分工
当前主流大语言模型(LLM)都是 Transformer 架构,权重按功能分成几大类,各司其职。
1. Embedding 嵌入层权重
作用:文字 token ↔ 数字向量互相转换
-
输入文字时,通过查表将每个 token 映射为多维向量;
-
模型最后输出时,用同一个(或对应的)权重矩阵将向量反向映射回词汇表中的文字。
关键特性: 这一层权重存储了词语的语义基础——近义词的向量距离近,反义词的向量距离远。
2. Attention 注意力权重(最核心)
多头注意力机制(Multi-Head Attention)包含 4 套核心权重矩阵:Q(查询)、K(键)、V(值)、O(输出投影)。
运作流程:
输入向量 ──Q 权重投影──→ Query 向量
──K 权重投影──→ Key 向量
──V 权重投影──→ Value 向量
注意力分数 = softmax(Q × K^T / √d)
注意力输出 = 注意力分数 × V
最终输出 = 注意力输出 × O 权重投影
权重数值决定注意力分配:
句子:"小明丢了钥匙,他很着急"在注意力计算中,"他"与"小明"之间的注意力权重分数很高,模型因此能正确判断"他"指代的是"小明"。
3. FFN 前馈网络权重(知识存储层)
每层 Transformer 中间包含两层大矩阵(现代架构如 LLaMA 使用 SwiGLU,实际是三层矩阵),这是模型存储事实、逻辑和常识的主要场所。
-
历史、数学、代码、行业知识——本质上都是通过调整 FFN 权重中的数字来"记住"的;
-
训练时,模型通过反复接触海量文本,将统计规律编码到这些权重中。
4. Layer Norm、输出层权重
-
Layer Norm 权重:对每层输出做归一化,稳定训练;
-
LM Head 输出层权重:将最终隐藏向量映射回词汇表,输出每个候选词的概率。
四、训练阶段:权重如何"学习知识"
循环数万亿次:
输入一段文本 → 模型预测下一个字
对比预测结果 vs 真实文字 → 计算损失误差
反向传播(Backpropagation)→ 从最后一层往回,逐层微调所有权重
权重 = 权重 - 学习率 × 梯度
训练完成后,所有权重被保存为文件(
.bin、.safetensors、.gguf),就是你下载的模型。关键点
模型不会存储任何原文。 它只是用权重数字编码了文本中的统计规律、语义关联和逻辑关系。
五、推理阶段:权重完全固定,只做计算
无论是本地跑模型还是调用 API,推理时权重不会发生任何修改。流程如下:
-
输入 prompt → 分词转为 token 向量;
-
向量逐层与每层权重矩阵做矩阵乘法;
-
Attention 权重计算上下文关联;
-
FFN 权重调取知识;
-
输出层计算所有候选词的概率,采样生成下一个字;
-
将新生成的字拼回输入,循环计算,直到生成结束。
所有生成文字的本质,都是输入向量与固定权重矩阵的连续数学运算。
六、微调与蒸馏:让模型"更听话"
训练完成后的模型是"通用"的,如何让它适应特定场景?两种核心手段:微调和蒸馏。
1. 微调(Fine-tuning):直接修改权重
| 方式 | 原理 | 对权重的影响 |
|---|---|---|
| 全量微调 | 在特定领域数据上继续训练,更新所有参数 | 全部权重被修改,算力消耗巨大 |
| LoRA | 只训练极小的附属低秩矩阵,叠加到原始权重上 | 主模型权重冻结不动,只调小矩阵,大幅节省显存与训练成本 |
2. 蒸馏(Distillation):让小模型"学大模型"
知识蒸馏是一种模型压缩技术:让一个小模型(学生)模仿一个大模型(教师)的行为,从而在不增加参数的情况下获得接近大模型的能力。
类比:一个资深教授(大模型)教学生(小模型)做题。学生不一定背得比教授多,但学会了教授的"解题思路"。
蒸馏与权重的关系: 蒸馏不直接复制大模型的权重数字,而是让小模型学习大模型的输出行为:
| 蒸馏方式 | 原理 | 对权重的影响 |
|---|---|---|
| 输出蒸馏 | 小模型学习大模型的软标签概率分布(如"猫"0.7、"狗"0.2) | 权重调整目标从"猜对答案"变为"模仿大模型的置信度" |
| 特征蒸馏 | 小模型学习大模型中间层的隐藏向量 | 迫使小模型的 Attention 和 FFN 权重产生相似的特征表示 |
| 数据蒸馏 | 用大模型生成高质量合成数据,再用这些数据训练小模型 | 小模型权重从更丰富的数据分布中学习 |
实际案例: DeepSeek-R1 → 蒸馏出 DeepSeek-R1-Distill-Qwen-32B(32B 参数接近 R1 的推理能力);Llama 3.1 405B → 蒸馏出 Llama 3.1 70B。
七、关键细节补充
1. 参数量 = 所有权重数字的总个数
| 模型 | 总参数量 | 激活参数(MoE) | FP16 显存 | 量化后(INT4) |
|---|---|---|---|---|
| 7B (Llama 2) | 70 亿 | — | ~14 GB | ~4 GB |
| 13B | 130 亿 | — | ~26 GB | ~7 GB |
| 70B (Llama 3) | 700 亿 | — | ~140 GB | ~40 GB |
| 175B (GPT-3) | 1750 亿 | — | ~350 GB | ~100 GB |
| K3 (Kimi) | 2.8 万亿 | ~320 亿 (16/896) | ~5.6 TB | ~1.4 TB |
K3 的特殊性: 它采用 MoE(混合专家)架构,总参数 2.8 万亿,但每次推理只激活 16 个专家(约 320 亿参数)。这样既拥有海量知识的"存储容量",又保持实际计算量可控。
2. 量化(Quantization):给权重"瘦身"
| 精度 | 每参数位数 | 体积 | 质量损失 |
|---|---|---|---|
| FP32 | 32 bit | 100% | 基准 |
| FP16 | 16 bit | 50% | 几乎无 |
| INT8 | 8 bit | 25% | 轻微 |
| INT4 | 4 bit | 12.5% | 可接受(需校准) |
本质:用更低精度存储权重,不改变计算逻辑。推理时反量化回浮点数进行矩阵运算。
3. 权重决定模型"性格"
相同架构,不同训练数据 → 完全不同的权重:
| 模型类型 | 权重特点 |
|---|---|
| 代码专用模型 | 代码语法、变量命名、逻辑结构的关联权重被大幅增强 |
| 对话模型 | 多轮上下文、口语化表达、礼貌用语的权重更活跃 |
| 数学模型 | 数字运算、公式推导、步骤推理的关联权重更强 |
| 多模态模型 | 额外增加图像/音频编码器的权重矩阵 |
极简总结
| 概念 | 一句话解释 |
|---|---|
| Transformer | 用自注意力并行处理整段文本的架构,解决了 RNN 远距离遗忘问题 |
| 权重 | 模型里全部数字矩阵,是模型学到的所有知识 |
| 训练 | 不断修改权重数值,拟合文本中的规律 |
| 推理 | 权重固定不变,依靠矩阵乘法逐字生成回答 |
| 微调 | 在特定数据上修改权重,让模型适应新任务 |
| 蒸馏 | 小模型模仿大模型的输出行为,权重不复制但能力接近 |
| Embedding | 管文字编码与解码 |
| Attention | 管上下文词语关联 |
| FFN | 存储常识、事实与逻辑 |
| MoE | 总参数巨大,但只激活一部分,兼顾容量与效率 |
| 量化 | 用更少位数存权重,体积小、速度快 |
| LoRA | 只调小矩阵,不动大模型权重 |
下次你下载一个.gguf或.safetensors文件时,记住:里面装的不是"程序",而是数千亿个浮点数——它们是人类语言知识的数字化压缩。

浙公网安备 33010602011771号