摘要:
可能更好的阅读体验 Jeefy's Blog: RouteLLM 在强模型和弱模型间,通过人类偏好数据对,学习一个二元路由,可以节约 2 倍以上的成本。 \[D_{pref} = \{ (q, l_{s, \omega})\} \]其中 \(l_{s, \omega}\) 表示偏好对的情况,也就是 阅读全文
posted @ 2026-09-26 20:55
jeefy
阅读(4)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: HACPO 其实就是将 GRPO & GSPO 的 GSPO 扩展到 MAS 训练。核心类似。 \[\begin{aligned} A_{t, i}^{(k)} &= \frac{R\left(y_{t, i}^{(k)}\right) - \mu_t 阅读全文
posted @ 2026-09-26 20:54
jeefy
阅读(6)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: GRPO & GSPO GRPO 为了干掉 Critic 网络,也就是 \(V\) 网络,换成直接使用 Actor 网络多次采样代替。 GRPO 采用 PPO 的变体类似的组合建模问题: \[\begin{aligned} J(\theta) &= \ 阅读全文
posted @ 2026-09-26 20:54
jeefy
阅读(6)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: TRPO ├─→ TRPO (Trust Region Policy Optimization) │ └── 约束新旧策略的 KL 散度 ≤ δ,保证更新在安全区域内 │ └── 解决:策略更新不稳定、步长难调 │ └── 问题:二阶优化(Fisher 阅读全文
posted @ 2026-09-26 20:54
jeefy
阅读(3)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: PPO \[\begin{aligned} \max_{\hat \theta} L(\hat \theta) &= {\mathbb E}_{s \sim \rho_\theta, a \sim \pi_{\theta}}\left[\min \le 阅读全文
posted @ 2026-09-26 20:54
jeefy
阅读(2)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: Actor-Critic 为了解决 High Variance 和 High bias 之间的矛盾,可以把它们结合在一起,利用value based 和 policy based 两类方法各自的优势,还顺带把它们的短板都补上了。于是就有了集大成的 Ac 阅读全文
posted @ 2026-09-26 20:53
jeefy
阅读(3)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: REINFORCE 算法 核心思想和蒙特卡洛强相关,很幸运的在 THUWC 2024 遇到了 MCTS 的工程题。 这个算法是 RL Policy Based 类的始祖,需要对大量的 Trajectory 进行采样,而每个Trajectory之间的差异 阅读全文
posted @ 2026-09-26 20:52
jeefy
阅读(1)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: DFKD 数据无关知识蒸馏(Data-Free Knowledge Distillation, DFKD),解决在没有或者少有真实数据的情况下,怎么蒸馏某个模型的问题。 KD 基于高温 Softmax 的 Logits 模拟 设计思想 DFKD将蒸馏转 阅读全文
posted @ 2026-09-26 20:50
jeefy
阅读(3)
评论(0)
推荐(0)
摘要:
可能更好的阅读体验 Jeefy's Blog: FlyLoRA 基于果蝇的生物学原理,设计出来的这样一个框架。 其核心的启发可以从两个方向展开: 生物学逻辑(这里略) 基于实验的数学逻辑 一个核心的观察是,对于微调的情况下,多 expert 是优于高 rank 的,也就是说,微调学习的信息是放在高维 阅读全文
posted @ 2026-09-26 20:44
jeefy
阅读(9)
评论(0)
推荐(0)

浙公网安备 33010602011771号