摘要: 在强化学习(十三) 策略梯度(Policy Gradient)中,我们讲到了基于策略(Policy Based)的强化学习方法的基本思路,并讨论了蒙特卡罗策略梯度reinforce算法。但是由于该算法需要完整的状态序列,同时单独对策略函数进行迭代更新,不太容易收敛。 在本篇我们讨论策略(Policy 阅读全文
posted @ 2019-01-15 17:46 刘建平Pinard 阅读(106927) 评论(147) 推荐(9) 编辑