work hard work smart

专注于AI+Java后端开发。 不断总结,举一反三。
  博客园  :: 首页  :: 新随笔  :: 联系 :: 订阅 订阅  :: 管理

微调的目的是让通用大模型适应特定领域。以下罗列6种主流参数高效微调(PEFT)技术,先解释“它是什么”,再告诉你“用在哪”。


1. LoRA(低秩适应)

定义:冻结原模型权重,在每一层插入两个小矩阵(低秩分解),只训练这两个小矩阵来模拟全参数更新的效果。
举例:把Llama 3微调成医疗问诊助手。用5000组病历对话,在24G显存的显卡上训练2小时,回答准确率从78%升至91%,通用问答能力几乎不损失。

2. QLoRA(量化LoRA)

定义:先对模型做4bit量化压缩,再叠加LoRA微调。用更少显存跑更大的模型,性能略低于LoRA但成本极低。
举例:只有一张RTX 3060 (12GB),却想微调7B模型做电商客服。用QLoRA顺利训练,回答满意度比LoRA低3%,但无需购买数万元的H100显卡。

3. Prefix-Tuning(前缀微调)

定义:在每个Transformer层的注意力机制前插入一段可训练的“前缀向量”,这些向量作为额外的Key和Value参与计算,引导模型生成特定格式或风格的内容。
举例:做上市公司财报摘要生成。输入100页PDF,要求输出300字要点。Prefix-Tuning比LoRA快30%,且长文档的尾部信息丢失更少。

4. P-Tuning v2(连续提示优化)

定义:将离散的提示词替换为连续的可训练向量,并且在模型的每一层都加入这些提示向量(深层提示),专门优化自然语言理解任务。
举例:做电商评论情感分类(好评/差评/中评)。用2000条标注数据微调,F1值达到94%,比LoRA高2个百分点,尤其擅长短文本意图识别。

5. GRPO(分组相对策略优化,RLHF的改进版)

定义:一种强化学习对齐方法。不需要训练独立的Critic模型(价值网络),而是通过分组比较输出来计算优势函数,引导模型学习人类偏好。比传统PPO节省约50%显存。
举例:让模型学会数学解题步骤。输入“鸡兔同笼”问题,普通微调常直接给答案,而GRPO后模型输出“设兔x只,鸡y只…经计算得…”,完整推理链正确率从62%提升至89%。

同类技术还有 RLVR(验证奖励驱动强化学习),适合编程、数学等有明确验证标准的任务。

6. RFT(强化微调,Reinforced Fine-Tuning)

定义:OpenAI 2025年推出的方法。不用大量标注数据,而是提供一个“评分员”(可人工或模型),对模型的多个输出打分,模型依靠分数反馈自主探索更好的推理路径。几十个例子即可见效。
举例:手里只有50份法律合同样本,想微调出合同风险条款识别模型。传统微调会欠拟合,RFT训练两轮后,识别准确率从55%飙升至86%。


如何选择?看你的实际条件

如果你的情况是…

推荐技术

理由

有几千条数据,显卡≥3090/4090

LoRA

效果最均衡,时间、显存、性能三优

显卡仅2060/3060,想跑7B以上模型

QLoRA

极致省显存,性能折扣可接受

任务是长文本生成(摘要、翻译、文案)

Prefix-Tuning

专为生成优化,处理长上下文更好

任务是分类、标注、检索等自然语言理解

P-Tuning v2

深层提示对NLU效果最佳

需要模型对齐人类偏好(如不胡说、按步骤推理)

GRPO

比传统RLHF省显存,对齐效果好

只有少量样本(几十到几百条),想快速出专家模型

RFT

创新方法,数据饥荒的解决方案

普通场景下无从判断,LoRA 是最稳妥的起点。显存足够时优先 LoRA,显存紧张降级为 QLoRA,遇到特定任务再按上表专项选择。