摘要: LLM后训练算法梳理(2)-GRPO算法 在上一篇 PPO 算法中(https://zhuanlan.zhihu.com/p/2076432345247245043),我们已经介绍过,PPO 在训练 LLM 时主要需要维护 actor 和 critic 两个需要训练参数的网络。其中 actor 就是 阅读全文
posted @ 2026-08-30 23:43 bradinz 阅读(49) 评论(0) 推荐(0)