大模型权重全解析:从神经元到 2.8 万亿参数,一文讲透训练、推理、微调与量化

引言:什么是 Transformer?为什么它改变了 AI

在讲权重之前,必须先理解 Transformer——它是当前所有大语言模型(LLM)的底层架构。2017 年 Google 发表的论文《Attention Is All You Need》提出了它,彻底改变了 NLP 领域。

在 Transformer 之前:RNN 的瓶颈

早期的循环神经网络(RNN)和 LSTM 处理文本时,是逐字顺序读取的:
 
"我" → 计算 → "喜欢" → 计算 → "猫" → 计算 → ...

  

问题:
  • 距离越远,信息越难传递("我"和句尾的"它"很难建立关联)
  • 无法并行计算,训练极慢
  • 长文本处理能力天花板明显

Transformer 的革命:自注意力机制

Transformer 的核心创新是自注意力(Self-Attention)——它让模型一次性看到整句话的所有词,然后自动计算"每个词应该关注哪些其他词"。
句子:"小明丢了钥匙,他很着急"
Transformer 会同时计算:
  • "他"和"小明"的关联度 → 高
  • "他"和"钥匙"的关联度 → 中
  • "他"和"着急"的关联度 → 低
这意味着:无论两个词相距多远,Transformer 都能直接建立关联。 彻底解决了 RNN 的"远距离遗忘"问题。

Transformer 的两大核心组件

 
组件作用权重角色
注意力层(Attention) 计算词与词之间的关联强度 Q/K/V/O 四套权重矩阵
前馈网络(FFN) 对注意力输出做非线性变换,存储知识 两层(或三层)大权重矩阵
结果: 所有现代 LLM(GPT、Claude、Kimi、Llama、Qwen)都是 Transformer 的变体。理解 Transformer,就理解了大模型的骨架。

示例:K3 对 Transformer 的四大改进

K3(2.8 万亿参数)并非简单堆叠 Transformer,而是在标准架构上做了结构性创新:
 
改进作用对权重的影响
Kimi Delta Attention (KDA) 混合线性注意力机制,降低长文本处理的二次计算成本 注意力权重矩阵的计算方式改变,能高效处理百万 token 长文本
Attention Residuals (AttnRes) 让注意力输出可以跨层直接传递,不用经过所有中间计算 信息"走捷径",权重传递路径更高效,深层信息不丢失
Stable LatentMoE 896 个专家子网络,每次只激活 16 个 总权重 2.8 万亿,但推理时只加载约 320 亿激活权重,兼顾容量与速度
Gated MLA + SiTU 激活 门控多头注意力增强选择性,Sigmoid Tanh Unit 优化激活控制 注意力权重分配更精准,FFN 权重激活更可控
一句话总结: K3 保留了 Transformer 的骨架,但替换了"关节"——注意力更高效、信息流动更直接、专家路由更稳定,从而支撑起 2.8 万亿参数的庞大权重体系。

一、先搞懂:权重是什么

大模型本质上是一个由海量矩阵堆叠而成的巨型数学函数,而权重(Weight)就是矩阵里的每一个数字——它是模型从海量文本中"学到的"全部知识。
  • 权重是一堆浮点数(如 0.2-1.50.78)。
  • 训练阶段:不断调整这些数字,让模型预测更准确。
  • 推理阶段(你调用 API 或本地跑模型):权重完全固定不变,只做纯粹的数学运算来生成文字。

举个极简类比

把模型当成一套超级复杂的数学公式,权重就是公式里所有的常数。
公式结构不变,但常数不同,输出就完全不一样。这些常数就是模型的记忆、逻辑、语言习惯。

二、基础单元:神经元怎么靠权重计算

单个神经元的计算逻辑

输出 = 激活函数(输入向量 × 权重矩阵 + 偏置)
 
组件作用
输入 文字被转成数字向量(Embedding 词嵌入)
权重 每个输入通道对应一个权重值,代表"这个信息有多重要"
正权重 增强该特征
负权重 抑制、忽略该特征
偏置(Bias) 微调输出基线,防止输出全为 0
激活函数 引入非线性,让模型能学习复杂规律(没有它,模型只能做线性拟合)

例子:语义关联

输入句子 "猫吃鱼":
  1. 每个字被转换为数字向量;
  2. 权重矩阵中,"猫"与"鱼"之间的关联权重数值很高;
  3. 计算时,模型会放大两者之间的关联强度,从而理解"猫的食物是鱼"这一语义。

延伸:常被混淆的概念

  1. 参数 ≠ 神经元
     
    大模型说 “7B 参数、13B 参数”,参数指权重 + 偏置的总数量,是神经元之间的连接条数,不是神经元本身数量。
     
    比如一层全连接:输入 1024 维、输出 4096 维,参数数量 = 1024×4096,神经元数量 = 输出维度 4096。

神经元总结:

    Transformer 内部的线性变换、前馈节点就是人工神经元(白话解释:所有可训练权重对应的计算单元,就是人工神经元)


三、Transformer 大模型:权重矩阵的分层分工

当前主流大语言模型(LLM)都是 Transformer 架构,权重按功能分成几大类,各司其职。

1. Embedding 嵌入层权重

作用:文字 token ↔ 数字向量互相转换
  • 输入文字时,通过查表将每个 token 映射为多维向量;
  • 模型最后输出时,用同一个(或对应的)权重矩阵将向量反向映射回词汇表中的文字。
关键特性: 这一层权重存储了词语的语义基础——近义词的向量距离近,反义词的向量距离远。

2. Attention 注意力权重(最核心)

多头注意力机制(Multi-Head Attention)包含 4 套核心权重矩阵:Q(查询)、K(键)、V(值)、O(输出投影)。
运作流程:
输入向量 ──Q 权重投影──→ Query 向量
         ──K 权重投影──→ Key 向量
         ──V 权重投影──→ Value 向量

注意力分数 = softmax(Q × K^T / √d)
注意力输出 = 注意力分数 × V
最终输出   = 注意力输出 × O 权重投影

  

权重数值决定注意力分配:
句子:"小明丢了钥匙,他很着急"
在注意力计算中,"他"与"小明"之间的注意力权重分数很高,模型因此能正确判断"他"指代的是"小明"。

3. FFN 前馈网络权重(知识存储层)

每层 Transformer 中间包含两层大矩阵(现代架构如 LLaMA 使用 SwiGLU,实际是三层矩阵),这是模型存储事实、逻辑和常识的主要场所。
  • 历史、数学、代码、行业知识——本质上都是通过调整 FFN 权重中的数字来"记住"的;
  • 训练时,模型通过反复接触海量文本,将统计规律编码到这些权重中。

4. Layer Norm、输出层权重

  • Layer Norm 权重:对每层输出做归一化,稳定训练;
  • LM Head 输出层权重:将最终隐藏向量映射回词汇表,输出每个候选词的概率。

四、训练阶段:权重如何"学习知识"

循环数万亿次:
    输入一段文本 → 模型预测下一个字
    对比预测结果 vs 真实文字 → 计算损失误差
    反向传播(Backpropagation)→ 从最后一层往回,逐层微调所有权重
    权重 = 权重 - 学习率 × 梯度

  

训练完成后,所有权重被保存为文件(.bin.safetensors.gguf),就是你下载的模型。

关键点

模型不会存储任何原文。 它只是用权重数字编码了文本中的统计规律、语义关联和逻辑关系。

五、推理阶段:权重完全固定,只做计算

无论是本地跑模型还是调用 API,推理时权重不会发生任何修改。流程如下:
  1. 输入 prompt → 分词转为 token 向量;
  2. 向量逐层与每层权重矩阵做矩阵乘法;
  3. Attention 权重计算上下文关联;
  4. FFN 权重调取知识;
  5. 输出层计算所有候选词的概率,采样生成下一个字;
  6. 将新生成的字拼回输入,循环计算,直到生成结束。
所有生成文字的本质,都是输入向量与固定权重矩阵的连续数学运算。

六、微调与蒸馏:让模型"更听话"

训练完成后的模型是"通用"的,如何让它适应特定场景?两种核心手段:微调和蒸馏。

1. 微调(Fine-tuning):直接修改权重

 
方式原理对权重的影响
全量微调 在特定领域数据上继续训练,更新所有参数 全部权重被修改,算力消耗巨大
LoRA 只训练极小的附属低秩矩阵,叠加到原始权重上 主模型权重冻结不动,只调小矩阵,大幅节省显存与训练成本

2. 蒸馏(Distillation):让小模型"学大模型"

知识蒸馏是一种模型压缩技术:让一个小模型(学生)模仿一个大模型(教师)的行为,从而在不增加参数的情况下获得接近大模型的能力。
类比:一个资深教授(大模型)教学生(小模型)做题。学生不一定背得比教授多,但学会了教授的"解题思路"。
蒸馏与权重的关系: 蒸馏不直接复制大模型的权重数字,而是让小模型学习大模型的输出行为:
 
蒸馏方式原理对权重的影响
输出蒸馏 小模型学习大模型的软标签概率分布(如"猫"0.7、"狗"0.2) 权重调整目标从"猜对答案"变为"模仿大模型的置信度"
特征蒸馏 小模型学习大模型中间层的隐藏向量 迫使小模型的 Attention 和 FFN 权重产生相似的特征表示
数据蒸馏 用大模型生成高质量合成数据,再用这些数据训练小模型 小模型权重从更丰富的数据分布中学习
实际案例: DeepSeek-R1 → 蒸馏出 DeepSeek-R1-Distill-Qwen-32B(32B 参数接近 R1 的推理能力);Llama 3.1 405B → 蒸馏出 Llama 3.1 70B。

七、关键细节补充

1. 参数量 = 所有权重数字的总个数

 
模型总参数量激活参数(MoE)FP16 显存量化后(INT4)
7B (Llama 2) 70 亿 ~14 GB ~4 GB
13B 130 亿 ~26 GB ~7 GB
70B (Llama 3) 700 亿 ~140 GB ~40 GB
175B (GPT-3) 1750 亿 ~350 GB ~100 GB
K3 (Kimi) 2.8 万亿 ~320 亿 (16/896) ~5.6 TB ~1.4 TB
K3 的特殊性: 它采用 MoE(混合专家)架构,总参数 2.8 万亿,但每次推理只激活 16 个专家(约 320 亿参数)。这样既拥有海量知识的"存储容量",又保持实际计算量可控。

2. 量化(Quantization):给权重"瘦身"

 
精度每参数位数体积质量损失
FP32 32 bit 100% 基准
FP16 16 bit 50% 几乎无
INT8 8 bit 25% 轻微
INT4 4 bit 12.5% 可接受(需校准)
本质:用更低精度存储权重,不改变计算逻辑。推理时反量化回浮点数进行矩阵运算。

3. 权重决定模型"性格"

相同架构,不同训练数据 → 完全不同的权重:
 
模型类型权重特点
代码专用模型 代码语法、变量命名、逻辑结构的关联权重被大幅增强
对话模型 多轮上下文、口语化表达、礼貌用语的权重更活跃
数学模型 数字运算、公式推导、步骤推理的关联权重更强
多模态模型 额外增加图像/音频编码器的权重矩阵

极简总结

 
概念一句话解释
Transformer 用自注意力并行处理整段文本的架构,解决了 RNN 远距离遗忘问题
权重 模型里全部数字矩阵,是模型学到的所有知识
训练 不断修改权重数值,拟合文本中的规律
推理 权重固定不变,依靠矩阵乘法逐字生成回答
微调 在特定数据上修改权重,让模型适应新任务
蒸馏 小模型模仿大模型的输出行为,权重不复制但能力接近
Embedding 管文字编码与解码
Attention 管上下文词语关联
FFN 存储常识、事实与逻辑
MoE 总参数巨大,但只激活一部分,兼顾容量与效率
量化 用更少位数存权重,体积小、速度快
LoRA 只调小矩阵,不动大模型权重
下次你下载一个 .gguf.safetensors 文件时,记住:里面装的不是"程序",而是数千亿个浮点数——它们是人类语言知识的数字化压缩。
posted @ 2026-07-19 20:46  当下是吾  阅读(22)  评论(0)    收藏  举报