随笔分类 -  强化学习

摘要:1.The simplest Actor-Critic(QAC) 2. Advantage actor-critic(A2C) 3. Off-policy actor-critic 4. Deterministic actor-critic(DPG) 阅读全文
posted @ 2025-04-10 16:56 penuel 阅读(89) 评论(0) 推荐(0)
摘要:1. Basic idea of policy gradient 之前的策略都是用表格表示的,现在改成函数的形式描述策略 2. Metric 1 - Average value 3. Metric 2 - Average reward 4. Gradients of the metrics 5. G 阅读全文
posted @ 2025-04-10 11:08 penuel 阅读(72) 评论(0) 推荐(0)
摘要:当state space太大的时候,需要用一个函数来对state value 或action value进行近似,方便处理 1. Algorithm for state value estimation 1.1 Objective function 这里\(d_{\pi}\)是权重,可以决定哪个st 阅读全文
posted @ 2025-04-01 11:45 penuel 阅读(89) 评论(0) 推荐(0)
摘要:1. TD learning of state values 公式1是用来根据\(s_t\)的state value来更新t+1的状态。 公式2是没有被访问的状态,下一刻的state value等于上一刻的。 1.1两个概念:TD target ,TD error TD target: TD err 阅读全文
posted @ 2025-03-19 11:46 penuel 阅读(100) 评论(0) 推荐(0)
摘要:6.1 motivating example : mean estimation 采样足够多进行平均 迭代求平均: \(w_{k+1} = w_k - \frac{1}{k} (w_k - x_k)\) 6.2 Robbins-Monro algorithm RM算法的优点是:不需要知道方程表达式, 阅读全文
posted @ 2024-12-05 11:20 penuel 阅读(240) 评论(0) 推荐(0)
摘要:之前的章节都是基于model base,这节是model free的方法。 1. model-base to model-free: 2. 计算\(q_{\pi k}:\) 3. MC base algorithm: step 1和model base是不一样的,后面的步骤是一样的。 4. MC e 阅读全文
posted @ 2024-11-18 13:47 penuel 阅读(238) 评论(0) 推荐(0)
摘要:1. value iteration algorithm: 值迭代上一节已经介绍过: 1.1 policy update: 1.2 Value update: 此时,\(\pi_{k+1}\)和\(v_k\)都是已知的 1.3 procedure summary: 1.4 example: 2. p 阅读全文
posted @ 2024-11-13 11:12 penuel 阅读(476) 评论(0) 推荐(0)
摘要:1. 贝尔曼最优公式: 1.1 定义: 第2课介绍了贝尔曼公式,里面的\(\pi (a|s)\)策略是固定的,这里我们想求得一个最优的策略,使得state value最好 1.2 matrix-vector form: 2. 求解贝尔曼公式: 公式中,v是一个未知量,\(\pi\)也是要求解的最优策 阅读全文
posted @ 2024-11-12 15:36 penuel 阅读(304) 评论(0) 推荐(0)
摘要:1. return和贝尔曼 上图说明从不同状态出发得到的return,依赖于从其他状态出发的return v是return,将第一张图写成矩阵的形式,r代表immediate reward,是已知的,矩阵P是策略加上state transition,也是已知的,求解v 这个公式实际上就是贝尔曼公式 阅读全文
posted @ 2024-11-09 11:20 penuel 阅读(520) 评论(0) 推荐(0)
摘要:1. state:状态,可以是机器人的位置,速度,加速度等 2. action:对于每一个状态,可能的动作 3. state transition:状态转移 3.1 state transition probability: 4. policy:告诉agent在这个状态应该采用哪个action 5. 阅读全文
posted @ 2024-11-05 09:58 penuel 阅读(123) 评论(0) 推荐(0)
摘要:![](https://img2024.cnblogs.com/blog/1746850/202411/1746850-20241105093751819-829769841.jpg) ![](https://img2024.cnblogs.com/blog/1746850/202411/1746850-20241105093753475-478576475.jpg) ![](https://im 阅读全文
posted @ 2024-11-05 09:38 penuel 阅读(35) 评论(0) 推荐(0)
摘要:Model-free: Q learning, Sarsa, Policy Gradients Model-based: 能通过想象来预判断接下来将要发生的所有情况. 然后选择这些想象情况中最好的那种 基于概率:Policy Gradients 基于价值:Q learning, Sarsa 两者融合 阅读全文
posted @ 2024-08-12 19:28 penuel 阅读(104) 评论(0) 推荐(0)