机器学习笔记(9.2): Lyapunov

可能更好的阅读体验 Jeefy's Blog: Lyapunov

从纯数学角度,Lyapunov 优化(Lyapunov Optimization)的建模可以形式化为一个离散时间随机控制问题。以下是严格的数学框架:


1. 基本系统模型

考虑离散时间动态系统,时间索引为 \(t \in \{0, 1, 2, \ldots\}\)。

状态向量

设系统状态为向量 \(\mathbf{Q}(t) = (Q_1(t), Q_2(t), \ldots, Q_N(t)) \in \mathbb{R}^N\),通常表示队列积压(queue backlog)或约束违反的累积量。

随机事件与决策

  • \(\omega(t) \in \Omega\):时隙 \(t\) 的随机事件(外生随机变量)
  • \(\alpha(t) \in \mathcal{A}_{\omega(t)}\):时隙 \(t\) 的控制动作(决策变量),可依赖于当前状态 \(\mathbf{Q}(t)\) 和随机事件 \(\omega(t)\)

状态演化方程

状态按以下随机差分方程演化:

\[Q_n(t+1) = \max\left[Q_n(t) + A_n(\alpha(t), \omega(t)) - \mu_n(\alpha(t), \omega(t)), 0\right] \]

其中:

  • \(A_n(\cdot)\):到达/输入过程
  • \(\mu_n(\cdot)\):服务/输出过程
  • \(\max[\cdot, 0]\) 保证非负性(若状态可为负,则去掉)

2. 李雅普诺夫函数

定义二次李雅普诺夫函数(Quadratic Lyapunov Function):

\[L(\mathbf{Q}(t)) \triangleq \frac{1}{2} \sum_{n=1}^{N} Q_n(t)^2 \]

注:也可采用其他形式(如加权二次、指数型),但二次型是最标准的。


3. 李雅普诺夫漂移

定义单时隙条件李雅普诺夫漂移(Conditional Lyapunov Drift):

\[\Delta(\mathbf{Q}(t)) \triangleq \mathbb{E}\left[ L(\mathbf{Q}(t+1)) - L(\mathbf{Q}(t)) \mid \mathbf{Q}(t) \right] \]

展开计算(以 \(Q_n(t+1) = Q_n(t) + \delta_n(t)\) 为例,其中 \(\delta_n(t) = A_n - \mu_n\)):

\[\begin{aligned} L(\mathbf{Q}(t+1)) - L(\mathbf{Q}(t)) &= \frac{1}{2}\sum_{n=1}^{N}\left[(Q_n(t)+\delta_n(t))^2 - Q_n(t)^2\right] \\ &= \sum_{n=1}^{N} Q_n(t)\delta_n(t) + \frac{1}{2}\sum_{n=1}^{N}\delta_n(t)^2 \end{aligned} \]

若 \(\delta_n(t)\) 有界(即 \(|\delta_n(t)| \leq D\)),则:

\[\Delta(\mathbf{Q}(t)) \leq \sum_{n=1}^{N} Q_n(t) \mathbb{E}[\delta_n(t) \mid \mathbf{Q}(t)] + B \]

其中 \(B = \frac{N D^2}{2}\) 为常数。


4. 漂移加惩罚框架(Drift-Plus-Penalty)

设 \(p(t) = p(\alpha(t), \omega(t))\) 为时隙 \(t\) 的惩罚函数(代价/目标函数,如能耗、延迟),需最小化其时间平均:

\[\bar{p} \triangleq \limsup_{T\to\infty} \frac{1}{T}\sum_{t=0}^{T-1} \mathbb{E}[p(t)] \]

引入参数 \(V \geq 0\),定义漂移加惩罚:

\[\Delta(\mathbf{Q}(t)) + V \cdot \mathbb{E}[p(t) \mid \mathbf{Q}(t)] \]

控制策略

每个时隙 \(t\),观测当前状态 \(\mathbf{Q}(t)\) 和随机事件 \(\omega(t)\),求解:

\[\min_{\alpha \in \mathcal{A}_{\omega(t)}} \left[ \sum_{n=1}^{N} Q_n(t) \cdot \mathbb{E}[\delta_n(\alpha, \omega(t)) \mid \mathbf{Q}(t)] + V \cdot p(\alpha, \omega(t)) \right] \]

这通常分解为每个时隙的确定性或简单随机优化问题。


5. 性能定理

假设存在某个策略(可能非因果)满足斯拉特条件(Slater Condition):存在 \(\epsilon > 0\) 使得对所有 \(n\):

\[\mathbb{E}[\delta_n(\alpha^*(t), \omega(t))] \leq -\epsilon \]

则采用漂移加惩罚策略,有以下性能边界:

稳定性保证

\[\limsup_{T\to\infty} \frac{1}{T}\sum_{t=0}^{T-1} \sum_{n=1}^{N} \mathbb{E}[Q_n(t)] \leq \frac{B + V \cdot p^{\max}}{\epsilon} \]

代价最优性

\[\bar{p} \leq p^{opt} + \frac{B}{V} \]

其中 \(p^{opt}\) 为最优时间平均代价。

\([O(1/V), O(V)]\) 权衡

  • 代价偏差:\(\bar{p} - p^{opt} = O(1/V)\),随 \(V\) 增大趋近于最优
  • 平均队列长度:\(\mathbb{E}[\|\mathbf{Q}\|] = O(V)\),随 \(V\) 增大而增大

6. 带约束的推广:虚拟队列

若系统有时间平均约束:

\[\limsup_{T\to\infty} \frac{1}{T}\sum_{t=0}^{T-1} \mathbb{E}[g_k(\alpha(t), \omega(t))] \leq 0, \quad k=1,\ldots,K \]

引入虚拟队列(Virtual Queues):

\[Z_k(t+1) = \max\left[Z_k(t) + g_k(\alpha(t), \omega(t)), 0\right] \]

将 \(\mathbf{Q}(t)\) 扩展为 \((Q_1,\ldots,Q_N, Z_1,\ldots,Z_K)\),重复上述漂移加惩罚框架,即可同时保证原始队列稳定性和约束满足。


7. 数学本质

Lyapunov 优化的核心数学思想是:

  1. 将随机控制问题转化为逐时隙的确定性优化
  2. 用李雅普诺夫函数的"势能"替代长期约束
  3. 通过参数 \(V\) 在"稳定性"与"最优性"之间做帕累托权衡

其数学基础依赖于:

  • 鞅论(可选停时定理)
  • 随机逼近(Stochastic Approximation)
  • 凸优化对偶理论(与对偶次梯度方法的深刻联系)
posted @ 2026-09-26 21:05  jeefy  阅读(6)  评论(0)    收藏  举报