随笔分类 - 强化学习
摘要:输入观测的东西 经过黑盒子 输出一个概率分布 相当于也是图像识别 在Policy Gradient中,我们需要训练一个Agent。这个Agent相当于一个分类器,其输入是观测到环境的信息observation(state),输出为行为action的概率分布。我们可以用简单的多层感知机去实现这个分类器
阅读全文
摘要:策略梯度:https://blog.csdn.net/hhy_csdn/category_8657689.html https://tomaxent.com/2019/04/14/%E7%AD%96%E7%95%A5%E6%A2%AF%E5%BA%A6%E6%96%B9%E6%B3%95/ http
阅读全文

浙公网安备 33010602011771号