RL | 复现 IQL 的踩坑记录


  1. 应该归一化 state 和 reward,IQL 原本实现 / 论文中就有说(?)
  2. 注意归一化 state 之后,evaluate 的时候也要归一化 state(?)
  3. 把 next_obsevation 也归一化后,iql 是 work 的
  4. PT 的神秘归一化,待 check


posted @ 2026-09-28 23:06  MoonOut  阅读(3)  评论(0)    收藏  举报