摘要: 本文记录此次报告的key point(个人向) llm时代的几点difficulity Inference-time computation scalling OpenAI o1 利用RL来显式整合inference期间推理的step(inference-time computation) (从pr 阅读全文
posted @ 2025-03-05 11:23 霜尘FrostDust 阅读(105) 评论(1) 推荐(0)
摘要: Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks (2017) arxiv:https://arxiv.org/abs/1703.03400 来源:MoonOut 作者:Chelsea Finn, Pieter Abb 阅读全文
posted @ 2025-03-02 21:01 霜尘FrostDust 阅读(247) 评论(0) 推荐(0)
摘要: 本文主要是对论文Decision Transformer: Reinforcement Learning via Sequence Modeling的复现记录 由于论文年代比较早(21年),主要的复现工作也是在22年之前,随着环境和包依赖的改变,实现起来比较困难。笔者作为RL小白也是在配置环境上面吃 阅读全文
posted @ 2025-02-25 23:08 霜尘FrostDust 阅读(642) 评论(0) 推荐(0)
摘要: 课题组服务器操作指南1文档 课题组服务器操作指南24 服务器管理指南21 设置内网linux服务器访问外网 ssh连接pycharm和jupyter docker容器VNC设置远程桌面 vncserver -kill :1 (结束终端) vncserver -localhost no :1 -geo 阅读全文
posted @ 2025-02-21 15:00 霜尘FrostDust 阅读(77) 评论(0) 推荐(0)
摘要: Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions 【CORL2023】 来源:别人推荐 作者:Googlle DeepMind / Servey Levine arxiv: ht 阅读全文
posted @ 2025-02-20 16:00 霜尘FrostDust 阅读(242) 评论(0) 推荐(0)
摘要: nanom:linux命令之nano vim :linux命令之vim 在 Ubuntu 中安装、切换多版本 GCC 编译器:[参考指南](https://www.sysgeek.cn/ubuntu-install-gcc-compiler/) 阅读全文
posted @ 2025-02-18 17:20 霜尘FrostDust 阅读(32) 评论(0) 推荐(0)
摘要: 文章来源 计算机学报2025年1月 比较新的一篇中文综述,值得一读 O Introduction DRL应用如AlphaGo需要与环境在线交互,并且进行大量数据采样,现实世界代价昂贵且试错风险极高 2020年Levine提出离线强化学习概念(Offline Reinforcement Learnin 阅读全文
posted @ 2025-02-14 13:28 霜尘FrostDust 阅读(2322) 评论(0) 推荐(0)
摘要: 推荐阅读Why is there a Deadly Triad issue and how to handle it ? Bootstrapping Off-policy learning Function approximations 当上述三者结合在一起时,value function 可能表示 阅读全文
posted @ 2025-02-13 18:44 霜尘FrostDust 阅读(65) 评论(0) 推荐(0)
摘要: GROOT:Learning to Follow Instructions by Watching Gameplay Viedos.作者为北京大学梁一韬所在的Team CraftJarvis,发表时间为2023 Background 在开放世界下开发类人级别的具身智能体以解决开放式任务一直是人工智能 阅读全文
posted @ 2025-01-17 11:15 霜尘FrostDust 阅读(226) 评论(0) 推荐(0)
摘要: Transformer-xl: Attentive language models beyond a fixed-length context.ACL 2019 其是对Transformer架构的改造。 Transformer-XL 使学习依赖性超过固定长度而不破坏时间连贯性(450% longer 阅读全文
posted @ 2025-01-17 10:43 霜尘FrostDust 阅读(182) 评论(0) 推荐(0)