SFT、RLHF、DPO原理与区别
技术原理
Supervised Fine-Tuning(SFT)
基于一个预训练模型,用人工标注的“输入-输出”对进行监督训练、本质是延续语言建模目标。

优势:训练稳定,实现简单,万级样本立即见效
劣势:无法感知人类偏好,对安全、伦理问题缺乏建模能力。
Reinforcement Learning from Human Feedback(RLHF)
- SFT初始化 使用监督模型作为策略七点
- 训练奖励模型Reward Model(RM),学习人类偏好,量化“好坏”
- PPO强化策略,在奖励信号下优化模型行为。
核心目标,将人类偏好量化为标量奖励,让模型学会拒答、承认不确定等复杂行为,提升安全性和人性化程度。
核心挑战:流程长、标注成本高、PPO超参不敏感、训练不稳定,需要大量工程经验进行调优。
Direct Preference optimization(DPO)
DPO将RLHF的两阶段压缩为一个阶段,直接利用偏好数据优化策略。
核心思想是将偏好学习转化为一个分类问题,通过损失函数直接让“优胜”回答的概率高于“失败”回答,从而绕过奖励模型和复杂的强化学习算法。
核心优势:训练速度3x,流程极简,数据需求少,算力成本大幅降低,同时保持与RLHF相当的对齐效果。

Proximal Policy Optimization(PPO)
待写

浙公网安备 33010602011771号