会员
周边
新闻
博问
闪存
赞助商
Chat2DB
所有博客
当前博客
我的博客
我的园子
账号设置
会员中心
简洁模式
...
退出登录
注册
登录
鸭蛋仙人的博客
博客园
首页
新随笔
联系
订阅
管理
2026年8月30日
一文读懂GRPO算法&热门变体演化
摘要: LLM后训练算法梳理(2)-GRPO算法 在上一篇 PPO 算法中(https://zhuanlan.zhihu.com/p/2076432345247245043),我们已经介绍过,PPO 在训练 LLM 时主要需要维护 actor 和 critic 两个需要训练参数的网络。其中 actor 就是
阅读全文
posted @ 2026-08-30 23:43 bradinz
阅读(49)
评论(0)
推荐(0)
公告