随笔分类 - 强化学习
摘要:1.The simplest Actor-Critic(QAC) 2. Advantage actor-critic(A2C) 3. Off-policy actor-critic 4. Deterministic actor-critic(DPG)
阅读全文
摘要:1. Basic idea of policy gradient 之前的策略都是用表格表示的,现在改成函数的形式描述策略 2. Metric 1 - Average value 3. Metric 2 - Average reward 4. Gradients of the metrics 5. G
阅读全文
摘要:当state space太大的时候,需要用一个函数来对state value 或action value进行近似,方便处理 1. Algorithm for state value estimation 1.1 Objective function 这里\(d_{\pi}\)是权重,可以决定哪个st
阅读全文
摘要:1. TD learning of state values 公式1是用来根据\(s_t\)的state value来更新t+1的状态。 公式2是没有被访问的状态,下一刻的state value等于上一刻的。 1.1两个概念:TD target ,TD error TD target: TD err
阅读全文
摘要:6.1 motivating example : mean estimation 采样足够多进行平均 迭代求平均: \(w_{k+1} = w_k - \frac{1}{k} (w_k - x_k)\) 6.2 Robbins-Monro algorithm RM算法的优点是:不需要知道方程表达式,
阅读全文
摘要:之前的章节都是基于model base,这节是model free的方法。 1. model-base to model-free: 2. 计算\(q_{\pi k}:\) 3. MC base algorithm: step 1和model base是不一样的,后面的步骤是一样的。 4. MC e
阅读全文
摘要:1. value iteration algorithm: 值迭代上一节已经介绍过: 1.1 policy update: 1.2 Value update: 此时,\(\pi_{k+1}\)和\(v_k\)都是已知的 1.3 procedure summary: 1.4 example: 2. p
阅读全文
摘要:1. 贝尔曼最优公式: 1.1 定义: 第2课介绍了贝尔曼公式,里面的\(\pi (a|s)\)策略是固定的,这里我们想求得一个最优的策略,使得state value最好 1.2 matrix-vector form: 2. 求解贝尔曼公式: 公式中,v是一个未知量,\(\pi\)也是要求解的最优策
阅读全文
摘要:1. return和贝尔曼 上图说明从不同状态出发得到的return,依赖于从其他状态出发的return v是return,将第一张图写成矩阵的形式,r代表immediate reward,是已知的,矩阵P是策略加上state transition,也是已知的,求解v 这个公式实际上就是贝尔曼公式
阅读全文
摘要:1. state:状态,可以是机器人的位置,速度,加速度等 2. action:对于每一个状态,可能的动作 3. state transition:状态转移 3.1 state transition probability: 4. policy:告诉agent在这个状态应该采用哪个action 5.
阅读全文
摘要:  
浙公网安备 33010602011771号