摘要: 我的配置:i9-14900k+Rtx5060ti, 已经安装好了win11系统 注意!!50系列显卡win主机 若要安装双系统ubuntu,ubuntu版本只能选择ubuntu24.04 (截至本文25年7月),若想要安装ubuntu22,会出现以下报错: `What I’ve Tried: 1、a 阅读全文
posted @ 2025-07-16 11:20 霜尘FrostDust 阅读(783) 评论(1) 推荐(0)
摘要: Decision Transformret-action space In-Context Reinforcement Learning for Variable Action Spaces 来源:ICML2024 arxiv openreview Motivation: 经典ICRL架构如AD和D 阅读全文
posted @ 2025-07-03 10:25 霜尘FrostDust 阅读(102) 评论(0) 推荐(0)
摘要: 笔者的环境是win11+ubuntu24双系统 首先参考这个Ubuntu24.04双系统安装(Linux/windows共存一文打通)完成ubuntu系统的安装 安装显卡驱动环节主要参考了这篇非常详细的ubuntu24.04+5090显卡驱动安装踩坑,根据我的系统,我安装的显卡驱动版本为570.16 阅读全文
posted @ 2025-06-29 21:36 霜尘FrostDust 阅读(3370) 评论(0) 推荐(0)
摘要: =Decision Transformer paper Meta-DT: Offline Meta-RL as Conditional Sequence Modeling with World Model Disentanglement 来源:南大wangzhi团队工作(NIPS2024) arxi 阅读全文
posted @ 2025-06-06 17:34 霜尘FrostDust 阅读(163) 评论(0) 推荐(0)
摘要: 参考文章 强化学习库StableBaselines3小白教程(一)环境配置和训练 - 蓝鲸鱼BlueWhale的文章 - 知乎 训练设置 依赖:rl-baseline3-zoo、tensorboar、wandb 以ppo算法和CartPole-v1为例 env=CartPole-v1 alog=pp 阅读全文
posted @ 2025-05-28 13:40 霜尘FrostDust 阅读(404) 评论(0) 推荐(0)
摘要: ** ODT工作** Online Decision Transformer 来源ICML2022 oral arxiv Fully Online Decision Transformer for Reinforcement Learning 来源:umich pdf tlnr: 讲DT改为基于re 阅读全文
posted @ 2025-05-08 11:03 霜尘FrostDust 阅读(229) 评论(0) 推荐(0)
摘要: 待读论文不能超过2篇 Efficient Off-Policy Meta-Reinforcement Learning via Probabilistic Context Variables 来源:师弟推荐(ICML2019) bair blog Openreview keynotes:1、meta 阅读全文
posted @ 2025-04-02 16:16 霜尘FrostDust 阅读(158) 评论(0) 推荐(0)
摘要: VariBAD: Variational Bayes-Adaptive Deep RL via Meta-Learning 来源:AMAGO提到的效果好但复杂的方法(2022) VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Me 阅读全文
posted @ 2025-03-19 14:54 霜尘FrostDust 阅读(43) 评论(0) 推荐(0)
摘要: RL论文 这位大佬git上总结的很全面且新,欢迎大家多多交流! Reinforcement Learning Papers Decision Transformer论文 repo In-context RL论文 repo Atari游戏介绍 参考这篇博客 OpenAI gym 环境汇总 博客 阅读全文
posted @ 2025-03-17 21:01 霜尘FrostDust 阅读(83) 评论(0) 推荐(0)
摘要: Masked Visual-Tactile Pre-training for Robot Manipulation 来源:NESC大组会上别的同学的工作 作者:刘庆涛,叶琦 主要内容:针对机械臂操作训练难的问题,提出基于人类演示的预训练表征范式,并基于此encoder使用PPO训练下游任务。注意这篇 阅读全文
posted @ 2025-03-17 20:52 霜尘FrostDust 阅读(128) 评论(0) 推荐(0)