上一页 1 2 3 4 5 6 ··· 13 下一页
摘要: 在学习了一段时间基础之后,也就想进行一些工程实践 之前一直在倒立摆这个最简单的环境中进行学习和实践 有一说一是有点太简单了 上学期还在flappy bird环境中实现了一下简单的dqn和策略梯度 这不,马上要做个项目,于是就想在稍微复杂一点的环境里实现一下强化学习,顺便试试看ppo啥的效果 于是,想 阅读全文
posted @ 2026-03-30 20:18 阿基米德的澡盆 阅读(63) 评论(0) 推荐(0)
摘要: [2503.22020] CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models 也是紧跟着师兄们的步伐,了解了一下思维链,这个最近比较火的东西 首先什么是思维链 思维链顾名思义就是思维的链(废话) 让 阅读全文
posted @ 2026-03-25 09:36 阿基米德的澡盆 阅读(88) 评论(0) 推荐(0)
摘要: 由于上学期读了pi0 pi0.5一家,所以是想了解一下流匹配如何做策略生成以及奖励函数生成 然后就偶然看到了这一篇文章 [2507.15073] Reinforcement Learning for Flow-Matching Policies 虽然不是纯血的流匹配生成,但是也了解了一些相关内容 也 阅读全文
posted @ 2026-03-18 16:23 阿基米德的澡盆 阅读(48) 评论(0) 推荐(0)
摘要: 也算是看到前段时间比较热的内容了 grpo,deepseek成功的一大利器 (感谢grpo和deepseek,没你我不知道似多少回了) 不过grpo还是比较容易理解的,有了ppo的基础理解起来并不困难。 那还是按照套路,分析一下ppo的缺陷吧 1.ppo到grpo 按照去年的报道,都在说deepse 阅读全文
posted @ 2026-03-17 17:41 阿基米德的澡盆 阅读(74) 评论(0) 推荐(0)
摘要: 在学习完了ppo-penalty之后,其实还是不够的。 它虽然足够工程化,但是不够优美。尤其是kl散度,还要一步计算 所以,更进一步,诞生了ppo-clip 那就来记录一下我的学习过程吧 很不幸,依旧得从数学入手,我尽量说人话吧 这里,ppo-clip给出了一些优美的工程近似。 出发点依旧是kl散度 阅读全文
posted @ 2026-03-17 10:36 阿基米德的澡盆 阅读(91) 评论(0) 推荐(0)
摘要: 在trpo出现后,强化学习迎来了一波热潮。 但是,trpo确实是有点复杂,而且有一些缺陷,比如: 为了保护策略的稳定性,trpo使用硬约束,只要策略超出接受范围,就直接裁断,这让策略的利用率大大降低 还有,二阶优化+线搜索确实是很难算啊。虽然从原本的二阶矩阵求逆已经简化为求解线性方程组,但是也不免让 阅读全文
posted @ 2026-03-11 17:38 阿基米德的澡盆 阅读(30) 评论(0) 推荐(0)
摘要: 说实话,本来这个大火的东西没有怎么引起我的注意,本以为又是一个大模型韭菜 自己折腾了半天,安装了一个,然后丢进去一个指令让它帮我查一下显存,花了半分钟才出结果 好像没什么大用,还花了1毛钱的deepseek tokens 然后就吃灰了两天 直到昨天,我折腾一个ai demo的时候搞不定老版本的库函数 阅读全文
posted @ 2026-03-11 11:25 阿基米德的澡盆 阅读(48) 评论(0) 推荐(0)
摘要: 再继续,actor-critic之后就是著名的trpo 这个东西熬,算是强化学习入门之后的第一个boss了 第一遍看完,只觉得它是策略梯度的pro plus版本,后续看来,它是能作为接下来好几年开山之作的存在 0.Actor-Critic算法的优劣分析 首先,还是分析一下之前Actor-Critic 阅读全文
posted @ 2026-03-05 23:44 阿基米德的澡盆 阅读(37) 评论(0) 推荐(0)
摘要: 继续,策略梯度之后就是actor-critic 策略梯度很好用,是吧? 那么就面临了一个问题 直接拟合策略,不像通过价值函数那样,可以通过简单方式来判断其优劣 直接表现在训练上就是,它比dqn要难以收敛。 虽然在倒立摆这个简单的环境上没有什么体现 但是直观理解一下: 虽然reinforce中的网络是 阅读全文
posted @ 2026-03-05 17:22 阿基米德的澡盆 阅读(21) 评论(0) 推荐(0)
摘要: 之前大概把强化学习基础看了,但是发现已经忘完了...回来补一下策略梯度trpo等等,一点一点补吧... 首先是策略梯度 之前的强化学习,是基于Q-table的,也就是基于价值函数。 决策路线大概是:策略——利用价值函数判断策略的好坏——选择较优的策略 这中间就多了一层 一个直观的想法就是:能不能直接 阅读全文
posted @ 2026-03-05 09:40 阿基米德的澡盆 阅读(21) 评论(0) 推荐(0)
上一页 1 2 3 4 5 6 ··· 13 下一页