A toy example of Reinforcement Learning (matlab code)
摘要:如下图所示: 假设我们有一个agent,有三个状态S = {s1,s2,s3},有三个操作A = {a1,a2,a3},给定每个状态下进行不同操作的奖励 R(s,a),如何进行Q-Learning? 下面是我给出的一个matla实现:
阅读全文
posted @ 2016-05-13 13:29
posted @ 2016-05-13 13:29