机器学习笔记(9.2): Lyapunov
可能更好的阅读体验 Jeefy's Blog: Lyapunov
从纯数学角度,Lyapunov 优化(Lyapunov Optimization)的建模可以形式化为一个离散时间随机控制问题。以下是严格的数学框架:
1. 基本系统模型
考虑离散时间动态系统,时间索引为 \(t \in \{0, 1, 2, \ldots\}\)。
状态向量
设系统状态为向量 \(\mathbf{Q}(t) = (Q_1(t), Q_2(t), \ldots, Q_N(t)) \in \mathbb{R}^N\),通常表示队列积压(queue backlog)或约束违反的累积量。
随机事件与决策
- \(\omega(t) \in \Omega\):时隙 \(t\) 的随机事件(外生随机变量)
- \(\alpha(t) \in \mathcal{A}_{\omega(t)}\):时隙 \(t\) 的控制动作(决策变量),可依赖于当前状态 \(\mathbf{Q}(t)\) 和随机事件 \(\omega(t)\)
状态演化方程
状态按以下随机差分方程演化:
其中:
- \(A_n(\cdot)\):到达/输入过程
- \(\mu_n(\cdot)\):服务/输出过程
- \(\max[\cdot, 0]\) 保证非负性(若状态可为负,则去掉)
2. 李雅普诺夫函数
定义二次李雅普诺夫函数(Quadratic Lyapunov Function):
注:也可采用其他形式(如加权二次、指数型),但二次型是最标准的。
3. 李雅普诺夫漂移
定义单时隙条件李雅普诺夫漂移(Conditional Lyapunov Drift):
展开计算(以 \(Q_n(t+1) = Q_n(t) + \delta_n(t)\) 为例,其中 \(\delta_n(t) = A_n - \mu_n\)):
若 \(\delta_n(t)\) 有界(即 \(|\delta_n(t)| \leq D\)),则:
其中 \(B = \frac{N D^2}{2}\) 为常数。
4. 漂移加惩罚框架(Drift-Plus-Penalty)
设 \(p(t) = p(\alpha(t), \omega(t))\) 为时隙 \(t\) 的惩罚函数(代价/目标函数,如能耗、延迟),需最小化其时间平均:
引入参数 \(V \geq 0\),定义漂移加惩罚:
控制策略
每个时隙 \(t\),观测当前状态 \(\mathbf{Q}(t)\) 和随机事件 \(\omega(t)\),求解:
这通常分解为每个时隙的确定性或简单随机优化问题。
5. 性能定理
假设存在某个策略(可能非因果)满足斯拉特条件(Slater Condition):存在 \(\epsilon > 0\) 使得对所有 \(n\):
则采用漂移加惩罚策略,有以下性能边界:
稳定性保证
代价最优性
其中 \(p^{opt}\) 为最优时间平均代价。
\([O(1/V), O(V)]\) 权衡
- 代价偏差:\(\bar{p} - p^{opt} = O(1/V)\),随 \(V\) 增大趋近于最优
- 平均队列长度:\(\mathbb{E}[\|\mathbf{Q}\|] = O(V)\),随 \(V\) 增大而增大
6. 带约束的推广:虚拟队列
若系统有时间平均约束:
引入虚拟队列(Virtual Queues):
将 \(\mathbf{Q}(t)\) 扩展为 \((Q_1,\ldots,Q_N, Z_1,\ldots,Z_K)\),重复上述漂移加惩罚框架,即可同时保证原始队列稳定性和约束满足。
7. 数学本质
Lyapunov 优化的核心数学思想是:
- 将随机控制问题转化为逐时隙的确定性优化
- 用李雅普诺夫函数的"势能"替代长期约束
- 通过参数 \(V\) 在"稳定性"与"最优性"之间做帕累托权衡
其数学基础依赖于:
- 鞅论(可选停时定理)
- 随机逼近(Stochastic Approximation)
- 凸优化对偶理论(与对偶次梯度方法的深刻联系)

浙公网安备 33010602011771号