随笔分类 - 学习笔记
摘要:也算是看到前段时间比较热的内容了 grpo,deepseek成功的一大利器 (感谢grpo和deepseek,没你我不知道似多少回了) 不过grpo还是比较容易理解的,有了ppo的基础理解起来并不困难。 那还是按照套路,分析一下ppo的缺陷吧 1.ppo到grpo 按照去年的报道,都在说deepse
阅读全文
摘要:在学习完了ppo-penalty之后,其实还是不够的。 它虽然足够工程化,但是不够优美。尤其是kl散度,还要一步计算 所以,更进一步,诞生了ppo-clip 那就来记录一下我的学习过程吧 很不幸,依旧得从数学入手,我尽量说人话吧 这里,ppo-clip给出了一些优美的工程近似。 出发点依旧是kl散度
阅读全文
摘要:在trpo出现后,强化学习迎来了一波热潮。 但是,trpo确实是有点复杂,而且有一些缺陷,比如: 为了保护策略的稳定性,trpo使用硬约束,只要策略超出接受范围,就直接裁断,这让策略的利用率大大降低 还有,二阶优化+线搜索确实是很难算啊。虽然从原本的二阶矩阵求逆已经简化为求解线性方程组,但是也不免让
阅读全文
摘要:再继续,actor-critic之后就是著名的trpo 这个东西熬,算是强化学习入门之后的第一个boss了 第一遍看完,只觉得它是策略梯度的pro plus版本,后续看来,它是能作为接下来好几年开山之作的存在 0.Actor-Critic算法的优劣分析 首先,还是分析一下之前Actor-Critic
阅读全文
摘要:继续,策略梯度之后就是actor-critic 策略梯度很好用,是吧? 那么就面临了一个问题 直接拟合策略,不像通过价值函数那样,可以通过简单方式来判断其优劣 直接表现在训练上就是,它比dqn要难以收敛。 虽然在倒立摆这个简单的环境上没有什么体现 但是直观理解一下: 虽然reinforce中的网络是
阅读全文
摘要:之前大概把强化学习基础看了,但是发现已经忘完了...回来补一下策略梯度trpo等等,一点一点补吧... 首先是策略梯度 之前的强化学习,是基于Q-table的,也就是基于价值函数。 决策路线大概是:策略——利用价值函数判断策略的好坏——选择较优的策略 这中间就多了一层 一个直观的想法就是:能不能直接
阅读全文
摘要:一刻也没有为扩散模型感到悲哀,接下来赶到战场的是——流匹配! [学习笔记]DDPM图片降噪 - 阿基米德的澡盆 - 博客园 (牛马圣体是这样的0.0无聊到看代码写博客) 继续贴仓库 ajmddzp/flow-matching-ddmp 不多废话了,继续写吧 0.什么是流匹配 流匹配就是一种很牛逼的方
阅读全文
摘要:之前学习了一下流匹配的最简单的demo,前两天学长讲了一下扩散模型的简单应用,就尽快学一下然后把博客写上来。 先贴一下仓库 ajmddzp/flow-matching-ddmp 然后是学长的博客 生成扩散模型漫谈(一):DDPM = 拆楼 + 建楼 - 科学空间|Scientific Spaces
阅读全文
摘要:前段时间学习了一下强化学习入门,一直没有时间写博客 元旦放假,来补一下博客学习笔记吧。 强化学习跟着学长给的教程简单入门了一下 https://hrl.boyuai.com/chapter/intro 强化学习基础,讲得不错 学了个大概,了解了原理之后回头看框架更加清晰了。 那就从一个新手的角度出发
阅读全文
摘要:看VLA相关内容,总是在用流匹配啊扩散模型啊生成这个策略那个策略,一会又是向量场一会又是高维空间的,这下是不学不行了,那就来好好看一看这个在AI时代被广泛应用的神仙方法吧。 与强化学习学习路径一样,先直观理解一下原理,然后找一个简单的demo跑起来,对着AI一点一点看代码。通过这几步,大概就能把这个
阅读全文
摘要:一个小程序的文件结构: 一个小程序的一个页面的文件结构: 下面对各个文件进行分析: .json:配置文件, app.json,包括了小程序的所有页面路径、窗口外观、界面表现、底部tab等 sitemap.json,可以允许哪些页面被检索 project.config.json,对开发者工具的配置,类
阅读全文
摘要:同学吹水,提到了爬虫,于是金工实习回来晚上看了看爬虫 (话说为啥所有爬虫教程前面都是一大串python基础教程啊) 爬虫就是***** 就是获取网页信息的工具,开始学习的话先使用python自带的urllib库进行coding,以后再了解requests等东西 感觉爬虫入门不难,只要发挥我api小能
阅读全文
摘要:1、CMakeLists.txt作用: 生成Makefile,如下图所示 2
阅读全文
摘要:好家伙今天翻博客发现了之前的参数服务器相关的东西没有发布,今天发出来吧 ~~~~~~~~~~~~~~~~ 参数服务器,顾名思义就是参数的服务器[doge] 咳咳 参数服务器在ROS中主要用于实现不同节点之间的数据共享。参数服务器相当于是独立于所有节点的一个公共容器,可以将数据存储在该容器中,被不同的
阅读全文
摘要:好!终于来到正式的深度学习了! 经过几天的学习之后,澡盆算是写出了第一个神经网络,虽然对其中的原理,代码还不算完全了解,但是还是决定记录以下此刻的学习心得。 这里使用官方的CIFAR10数据集进行训练 代码比较长,分为几个大块。 库的引入,数据集的导入,网络设计,一些初始化,训练,保存,接下来我们一
阅读全文
摘要:目标:实现小乌龟的自动移动和位置打印 1、launch文件 launch文件就是一个联合启动的东西,可以一次运行启动多个程序(本质就是一个标志文件) <launch> <!--乌龟GUI--> <node pkg="turtlesim" type="turtlesim_node" name="tur
阅读全文
摘要:ros通讯之服务通。 早知道有这个东西我还写什么tcp通讯啊(笑) 0、自定义srv消息&&配置 与话题通信不一样的是,这个通讯需要自定义消息类型。 与话题通讯的自定义相同,要在src目录下建立一个srv文件夹,并且定义一个***.srv文件用来存储数据类型。 int32 num1 int32 nu
阅读全文
摘要:在话题通讯中,ros提供的数据类型并不足以支持我们的使用,这时就需要自定义一些消息类型了。 首先打开一个工作空间,在包内与第二个src目录同级(即工作空间下级)自己建立一个msg文件夹,里面建立一个.msg文件,在里面自定义消息类型。 需要注意的是,这里的int,float不能用普通的类型,必须用i
阅读全文
摘要:这个帖子跟之前的数据结构踩坑类似,是用来记录ros学习/使用过程中的一些坑人的地方的。 因为今天(2022.7.7)遇到了一些状况,所以想起来了这个方法来记录一下。 1、ros中,定义msg发布类体之中的成员类型,不能用int,float之类的,必须要用int32,float32这样的字段申明,不然
阅读全文
摘要:众所周知,ros自带了通讯的一系列方法,萌新最先开始学习的就是话题通讯机制。 萌新的立即就是:它就是一个封装的TCP协议,是建立好了连接之后再传输数据的一种方法,注意是建立连接的。 话不多说,直接上代码吧。 发布端: #include<ros/ros.h> #include"std_msgs/Str
阅读全文

浙公网安备 33010602011771号