机器学习笔记(17.7): Completed-Q 算子
可能更好的阅读体验 Jeefy's Blog: Completed-Q 算子
Completed-Q 其实就是把 MCTS 搜索后"不完整、跨节点不可比"的回溯价值 \(Q\),先做缺失补全与局部归一化,再作为 logit 奖励以乘法方式注入先验策略 \(\pi_\theta\),完成一步 soft policy improvement 的算子。
它是策略迭代定理(Policy Improvement Theorem, Sutton & Barto)在"策略网络 + MCTS"混合框架下的软化版本:用连续、满支撑、信度加权的方式,实现与贪心改进同方向的期望价值提升。
核心建模
在根节点 \(s\),网络给出所有合法着法的先验 logits \(\ell(a) = \log \pi_\theta(a|s)\);搜索分配 \(N\) 次模拟后,各着法获得访问计数 \(N(a)\) 与回溯价值 \(Q(a) \in [-1,1]\)。
- 补全价值(Completed-Q):未访问着法按节点均值保守填补:
- 逐节点局部量程归一化:
- 单调尺度变换:把排名坐标翻译成 logit 奖励,音量随搜索深度自适应:
- 指数合成——logit 空间相加,即概率空间相乘:
由 \(\ell(a) = \log\pi_\theta(a|s) + \text{const}\)(log-softmax),\((4)\) 精确地分解为:
即 后验 ∝ 先验 \(\times\) 证据 的贝叶斯式合成。
为什么这样设计?
Δ \(v_{\text{mix}}\):伪计数收缩估计(经验贝叶斯)
改写成权重和的形式:
把 \(v_\theta(s)\) 当作价值分布上的 1 个先验观测(伪计数),后验均值即上式。极限行为:
- \(N \to 0\):\(v_{\text{mix}} \to v_\theta(s)\),回归先验;
- \(N \to \infty\):\(v_{\text{mix}} \to \bar Q\),一致性成立。
与 Gumbel AlphaZero 的 Completed-Q 同源(Danihelka et al. 2022),但那里用 \(\max\) 型 completion 防止未访问着法被过早判死;这里是更温和的均值型——"未被搜索"在期望意义上等价于"平均水平",而不是最好或最坏。这是一个有意识的保守性设计:不让缺失证据自动变成惩罚,也不变成奖励。
Δ min-max 归一化
\(Q \in [-1,1]\) 是绝对量程,但策略改进只需要相对排序信息。直接把原始 \(Q\) 差注入 logits,会导致数值上的不稳定。
但是就是会对节点内离群值敏感:一个异常极端的 \(Q\) 会压缩其余着法的 \(\hat{q}\) 值,导致局部敏感性损失。
Δ σ 变换:单调性 × 信度加权
核心约束只有一个:关于 \(\hat{q}\)(从而关于 \(Q\))单调不减。线性形式 \(\sigma = \lambda \hat{q}\) 是最简单的形式。系数
承担"时机"职责:
- 搜索越深,越该相信搜索:\(\max N(b)\) 是该节点证据强度的代理。\(N\) 小时 \(\lambda \approx c_{\text{visit}}c_{\text{scale}} = 5\),\(\pi'\) 贴近先验——承认少量模拟的 \(Q\) 噪声大;
- \(N\) 大时 \(\lambda\) 线性增长,搜索证据逐渐接管分布。整个算子随模拟预算在"信网络"与"信搜索"之间滑动变阻。
排序完全由 \(\hat{q}\) 承载,\(\lambda\) 只调相对数值,不动排序。
Δ 指数合成:KL 约束优化的精确解
考虑优化问题:在不离先验太远的约束下最大化期望价值:
拉格朗日量(\(\tau\) 为 KL 约束的对偶系数,即温度):
对 \(\pi'(a)\) 求导令零:
KL proximity 约束下的最优改进策略恰好就是"先验乘价值指数"。代入此处:\(\sigma(\hat{q}) = \lambda\hat{q}\) 即 \(Q_c/\tau\),温度 \(\tau = 1/\lambda\)——\(c_{\text{scale}}, c_{\text{visit}}\) 锁定的实质是一个温度调度。
另外两个等价视角:
- 代数必然性:修正 softmax 分布且保持其在 softmax 族内,唯一方式是在 logits 上加东西;logits 相加 = 概率相乘。softmax 对加性常数免疫,只有 \(\sigma\) 的差有意义,与 \(\hat{q}\) 丢弃绝对量纲的设计自洽;
- 贝叶斯:\(\pi' = \pi_\theta \times w / Z\),先验乘似然。乘法因子严格为正,先验的满支撑被继承——任何着法永不被彻底封死,与 Completed-Q 的保守哲学一致。
数学性质
零退化
\(\hat{q}\) 全等 ⟹ \(\sigma\) 为常数 ⟹ \(\pi' \equiv \pi\)。边界情况"搜索完全没区分出着法"时,算子诚实回退先验,不产生人为扰动。
单调改进(Chebyshev 协方差论证)
写成重要性加权形式:
由于 \(w(a) = e^{\sigma(\hat{q}(a))}/Z\),且 \(\sigma \circ \hat{q}\) 是 \(Q_c\) 的严格递增函数,令 \(w = g(Q)\),由 Chebyshev 积分不等式:
等号成立 \(\iff\) \(Q\) 在 \(\pi\) 上几乎处处常数。
这个证明比命题表述更强:单调改进不依赖 σ 的具体函数形式,只依赖"修正权重 \(w\) 是 \(Q\) 的递增函数"这一条。σ 的具体形式只影响改进的幅度与速度,不影响方向。
"对数几何级数强化"指:\(\hat{q}(a_*) - \hat{q}(a) = \delta\) ⟹ \(\dfrac{\pi'(a_*)}{\pi'(a)} = \dfrac{\pi(a_*)}{\pi(a)} \cdot e^{\lambda\delta}\),相对选中概率被几何倍率乘性放大。

浙公网安备 33010602011771号