摘要: 探索与利用的平衡 \(\epsilon\) 贪心算法 在贪心采取每一时刻奖励估值最大的动作的基础上,加入了一个随机参数 \(\epsilon\) 。 每次以概率 $1-\epsilon $ 选择期望奖励最大的那个动作(利用),以概率 $\epsilon $ 来随机选取一根拉杆(探索)。 如果 $\e 阅读全文
posted @ 2026-07-02 13:03 BorisDimitri 阅读(16) 评论(0) 推荐(0)