微调的目的是让通用大模型适应特定领域。以下罗列6种主流参数高效微调(PEFT)技术,先解释“它是什么”,再告诉你“用在哪”。
1. LoRA(低秩适应)
定义:冻结原模型权重,在每一层插入两个小矩阵(低秩分解),只训练这两个小矩阵来模拟全参数更新的效果。
举例:把Llama 3微调成医疗问诊助手。用5000组病历对话,在24G显存的显卡上训练2小时,回答准确率从78%升至91%,通用问答能力几乎不损失。
2. QLoRA(量化LoRA)
定义:先对模型做4bit量化压缩,再叠加LoRA微调。用更少显存跑更大的模型,性能略低于LoRA但成本极低。
举例:只有一张RTX 3060 (12GB),却想微调7B模型做电商客服。用QLoRA顺利训练,回答满意度比LoRA低3%,但无需购买数万元的H100显卡。
3. Prefix-Tuning(前缀微调)
定义:在每个Transformer层的注意力机制前插入一段可训练的“前缀向量”,这些向量作为额外的Key和Value参与计算,引导模型生成特定格式或风格的内容。
举例:做上市公司财报摘要生成。输入100页PDF,要求输出300字要点。Prefix-Tuning比LoRA快30%,且长文档的尾部信息丢失更少。
4. P-Tuning v2(连续提示优化)
定义:将离散的提示词替换为连续的可训练向量,并且在模型的每一层都加入这些提示向量(深层提示),专门优化自然语言理解任务。
举例:做电商评论情感分类(好评/差评/中评)。用2000条标注数据微调,F1值达到94%,比LoRA高2个百分点,尤其擅长短文本意图识别。
5. GRPO(分组相对策略优化,RLHF的改进版)
定义:一种强化学习对齐方法。不需要训练独立的Critic模型(价值网络),而是通过分组比较输出来计算优势函数,引导模型学习人类偏好。比传统PPO节省约50%显存。
举例:让模型学会数学解题步骤。输入“鸡兔同笼”问题,普通微调常直接给答案,而GRPO后模型输出“设兔x只,鸡y只…经计算得…”,完整推理链正确率从62%提升至89%。
同类技术还有 RLVR(验证奖励驱动强化学习),适合编程、数学等有明确验证标准的任务。
6. RFT(强化微调,Reinforced Fine-Tuning)
定义:OpenAI 2025年推出的方法。不用大量标注数据,而是提供一个“评分员”(可人工或模型),对模型的多个输出打分,模型依靠分数反馈自主探索更好的推理路径。几十个例子即可见效。
举例:手里只有50份法律合同样本,想微调出合同风险条款识别模型。传统微调会欠拟合,RFT训练两轮后,识别准确率从55%飙升至86%。
如何选择?看你的实际条件
|
如果你的情况是… |
推荐技术 |
理由 |
|
有几千条数据,显卡≥3090/4090 |
LoRA |
效果最均衡,时间、显存、性能三优 |
|
显卡仅2060/3060,想跑7B以上模型 |
QLoRA |
极致省显存,性能折扣可接受 |
|
任务是长文本生成(摘要、翻译、文案) |
Prefix-Tuning |
专为生成优化,处理长上下文更好 |
|
任务是分类、标注、检索等自然语言理解 |
P-Tuning v2 |
深层提示对NLU效果最佳 |
|
需要模型对齐人类偏好(如不胡说、按步骤推理) |
GRPO |
比传统RLHF省显存,对齐效果好 |
|
只有少量样本(几十到几百条),想快速出专家模型 |
RFT |
创新方法,数据饥荒的解决方案 |
普通场景下无从判断,LoRA 是最稳妥的起点。显存足够时优先 LoRA,显存紧张降级为 QLoRA,遇到特定任务再按上表专项选择。
作者:Work Hard Work Smart
出处:http://www.cnblogs.com/linlf03/
欢迎任何形式的转载,未经作者同意,请保留此段声明!
浙公网安备 33010602011771号