机器学习笔记(17.7): Completed-Q 算子

可能更好的阅读体验 Jeefy's Blog: Completed-Q 算子

Completed-Q 其实就是把 MCTS 搜索后"不完整、跨节点不可比"的回溯价值 \(Q\),先做缺失补全与局部归一化,再作为 logit 奖励以乘法方式注入先验策略 \(\pi_\theta\),完成一步 soft policy improvement 的算子。

它是策略迭代定理(Policy Improvement Theorem, Sutton & Barto)在"策略网络 + MCTS"混合框架下的软化版本:用连续、满支撑、信度加权的方式,实现与贪心改进同方向的期望价值提升。


核心建模

在根节点 \(s\),网络给出所有合法着法的先验 logits \(\ell(a) = \log \pi_\theta(a|s)\);搜索分配 \(N\) 次模拟后,各着法获得访问计数 \(N(a)\) 与回溯价值 \(Q(a) \in [-1,1]\)。

  • 补全价值(Completed-Q):未访问着法按节点均值保守填补:

\[Q_{\text{completed}}(a) = \begin{cases} Q(a), & N(a) > 0 \\ v_{\text{mix}}, & N(a) = 0 \end{cases} \qquad v_{\text{mix}} = \frac{\sum_{b: N(b)>0} N(b) Q(b) + v_\theta(s)}{\sum_b N(b) + 1} \]

  • 逐节点局部量程归一化:

\[\hat{q}(a) = \frac{Q_{\text{completed}}(a) - \min_b Q_{\text{completed}}(b)}{\max_b Q_{\text{completed}}(b) - \min_b Q_{\text{completed}}(b) + \varepsilon} \in [0,1] \]

  • 单调尺度变换:把排名坐标翻译成 logit 奖励,音量随搜索深度自适应:

\[\sigma(\hat{q}) = \left(c_{\text{visit}} + \max_b N(b)\right) \cdot c_{\text{scale}} \cdot \hat{q} \qquad (c_{\text{visit}}=50,\; c_{\text{scale}}=0.1) \]

  • 指数合成——logit 空间相加,即概率空间相乘:

\[\pi'(a) = \frac{\exp\left( \ell(a) + \sigma(\hat{q}(a)) \right)}{\sum_{a'} \exp\left( \ell(a') + \sigma(\hat{q}(a')) \right)} \tag{4} \]

由 \(\ell(a) = \log\pi_\theta(a|s) + \text{const}\)(log-softmax),\((4)\) 精确地分解为:

\[\pi'(a) = \pi_\theta(a) \cdot \underbrace{\frac{e^{\sigma(\hat{q}(a))}}{Z}}_{w(a)}, \qquad Z = \sum_{a'} \pi_\theta(a')\, e^{\sigma(\hat{q}(a'))} \]

即 后验 ∝ 先验 \(\times\) 证据 的贝叶斯式合成。


为什么这样设计?

Δ \(v_{\text{mix}}\):伪计数收缩估计(经验贝叶斯)

改写成权重和的形式:

\[v_{\text{mix}} = \frac{N_{\text{used}}}{N+1}\cdot \underbrace{\frac{\sum N(b)Q(b)}{N_{\text{used}}}}_{\text{模拟经验均值 } \bar Q} + \frac{1}{N+1}\cdot v_\theta(s) \]

把 \(v_\theta(s)\) 当作价值分布上的 1 个先验观测(伪计数),后验均值即上式。极限行为:

  • \(N \to 0\):\(v_{\text{mix}} \to v_\theta(s)\),回归先验;
  • \(N \to \infty\):\(v_{\text{mix}} \to \bar Q\),一致性成立。

与 Gumbel AlphaZero 的 Completed-Q 同源(Danihelka et al. 2022),但那里用 \(\max\) 型 completion 防止未访问着法被过早判死;这里是更温和的均值型——"未被搜索"在期望意义上等价于"平均水平",而不是最好或最坏。这是一个有意识的保守性设计:不让缺失证据自动变成惩罚,也不变成奖励。

Δ min-max 归一化

\(Q \in [-1,1]\) 是绝对量程,但策略改进只需要相对排序信息。直接把原始 \(Q\) 差注入 logits,会导致数值上的不稳定。

但是就是会对节点内离群值敏感:一个异常极端的 \(Q\) 会压缩其余着法的 \(\hat{q}\) 值,导致局部敏感性损失。

Δ σ 变换:单调性 × 信度加权

核心约束只有一个:关于 \(\hat{q}\)(从而关于 \(Q\))单调不减。线性形式 \(\sigma = \lambda \hat{q}\) 是最简单的形式。系数

\[\lambda = (c_{\text{visit}} + \max_b N(b)) \cdot c_{\text{scale}} \]

承担"时机"职责:

  • 搜索越深,越该相信搜索:\(\max N(b)\) 是该节点证据强度的代理。\(N\) 小时 \(\lambda \approx c_{\text{visit}}c_{\text{scale}} = 5\),\(\pi'\) 贴近先验——承认少量模拟的 \(Q\) 噪声大;
  • \(N\) 大时 \(\lambda\) 线性增长,搜索证据逐渐接管分布。整个算子随模拟预算在"信网络"与"信搜索"之间滑动变阻。

排序完全由 \(\hat{q}\) 承载,\(\lambda\) 只调相对数值,不动排序。

Δ 指数合成:KL 约束优化的精确解

考虑优化问题:在不离先验太远的约束下最大化期望价值:

\[\max_{\pi'}\; \sum_a \pi'(a)\,Q_c(a) \quad \text{s.t.}\quad \mathrm{KL}(\pi'\,\|\,\pi_\theta) \le \eta \]

拉格朗日量(\(\tau\) 为 KL 约束的对偶系数,即温度):

\[\mathcal{L} = \sum_a \pi'(a)Q_c(a) - \tau \sum_a \pi'(a)\log\frac{\pi'(a)}{\pi_\theta(a)} \]

对 \(\pi'(a)\) 求导令零:

\[Q_c(a) - \tau\big(\log\pi'(a) - \log\pi_\theta(a)\big) - \tau - \lambda = 0 \;\Longrightarrow\; \pi'(a) \propto \pi_\theta(a)\, e^{Q_c(a)/\tau} \]

KL proximity 约束下的最优改进策略恰好就是"先验乘价值指数"。代入此处:\(\sigma(\hat{q}) = \lambda\hat{q}\) 即 \(Q_c/\tau\),温度 \(\tau = 1/\lambda\)——\(c_{\text{scale}}, c_{\text{visit}}\) 锁定的实质是一个温度调度。

另外两个等价视角:

  • 代数必然性:修正 softmax 分布且保持其在 softmax 族内,唯一方式是在 logits 上加东西;logits 相加 = 概率相乘。softmax 对加性常数免疫,只有 \(\sigma\) 的差有意义,与 \(\hat{q}\) 丢弃绝对量纲的设计自洽;
  • 贝叶斯:\(\pi' = \pi_\theta \times w / Z\),先验乘似然。乘法因子严格为正,先验的满支撑被继承——任何着法永不被彻底封死,与 Completed-Q 的保守哲学一致。

数学性质

零退化

\(\hat{q}\) 全等 ⟹ \(\sigma\) 为常数 ⟹ \(\pi' \equiv \pi\)。边界情况"搜索完全没区分出着法"时,算子诚实回退先验,不产生人为扰动。

单调改进(Chebyshev 协方差论证)

写成重要性加权形式:

\[\mathbb{E}_{\pi'}[Q] = \frac{\sum_a \pi(a)\,Q(a)\,w(a)}{\sum_a \pi(a)\,w(a)} = \mathbb{E}_\pi[Q] + \frac{\operatorname{Cov}_\pi\big(Q,\, w\big)}{\mathbb{E}_\pi[w]} \]

由于 \(w(a) = e^{\sigma(\hat{q}(a))}/Z\),且 \(\sigma \circ \hat{q}\) 是 \(Q_c\) 的严格递增函数,令 \(w = g(Q)\),由 Chebyshev 积分不等式:

\[\operatorname{Cov}_\pi\big(Q,\, g(Q)\big) \ge 0 \;\Longrightarrow\; \mathbb{E}_{a\sim\pi'}[Q(s,a)] \ge \mathbb{E}_{a\sim\pi}[Q(s,a)] \]

等号成立 \(\iff\) \(Q\) 在 \(\pi\) 上几乎处处常数。

这个证明比命题表述更强:单调改进不依赖 σ 的具体函数形式,只依赖"修正权重 \(w\) 是 \(Q\) 的递增函数"这一条。σ 的具体形式只影响改进的幅度与速度,不影响方向。

"对数几何级数强化"指:\(\hat{q}(a_*) - \hat{q}(a) = \delta\) ⟹ \(\dfrac{\pi'(a_*)}{\pi'(a)} = \dfrac{\pi(a_*)}{\pi(a)} \cdot e^{\lambda\delta}\),相对选中概率被几何倍率乘性放大。

posted @ 2026-09-27 20:24  jeefy  阅读(3)  评论(0)    收藏  举报