第三章

第3章 基于多尺度自适应融合的改进PRformer时间序列预测模型

本章首先对多元时间序列预测问题进行形式化描述,并深入分析现有PRformer模型在窗口尺度配置与多尺度特征融合方面存在的局限性。在此基础上,提出本文的改进模型——基于多尺度自适应融合的PRformer(Multi-scale Adaptive Fusion PRformer,MAF-PRformer),并依次对其三个核心改进模块进行详细介绍:多尺度候选窗口池扩展策略、样本自适应多尺度加权融合机制以及非线性增强预测头设计。最后给出模型的整体训练流程与损失函数定义。

3.1 问题描述与本文方法动机

3.1.1 多元时间序列预测问题定义

多元时间序列预测任务可形式化描述如下:给定长度为 (L) 的历史观测序列 (\mathbf{X} = {\mathbf{x}1, \mathbf{x}2, \ldots, \mathbf{x}L} \in \mathbb{R}^{L \times C}),预测未来长度为 (H) 的序列值 (\mathbf{Y} = {\mathbf{x}, \mathbf{x}, \ldots, \mathbf{x}{L+H}} \in \mathbb{R}^{H \times C})。其中,(C) 表示变量数量,(L) 为历史回看窗口长度,(H) 为预测步长。实际应用场景通常要求模型具备长时预测能力,即 (H) 取值较大(如96、192、336、720等)。

多元时间序列数据呈现出复杂的动态特性,主要包括三个方面:趋势性——序列在长时间跨度内的缓慢变化方向;多尺度周期性——同时存在日周期、周周期等不同时间跨度的循环波动模式;变量间相关性——不同变量之间存在复杂的相互影响关系。高效的多变量时间序列预测模型需要同时捕捉上述多尺度时序依赖并建模变量间的交叉作用。

3.1.2 PRformer模型核心思想及存在的不足

PRformer(Pyramidal Recurrent Transformer)是近年来将循环神经网络与Transformer架构相结合用于时间序列预测的代表性工作之一[1]。该模型的核心创新在于提出了金字塔循环神经网络嵌入(Pyramidal RNN Embedding,PRE)模块,其设计思路如下:

(1)金字塔时序卷积构建多尺度特征。 PRE模块通过自底向上与自顶向下的金字塔卷积结构,对每个变量的单变量时间序列在不同时间尺度上进行特征提取。每个金字塔层级对应一个预设的时间周期(如24小时、48小时等),通过多层一维卷积逐级扩大感受野,从而同时捕捉从细粒度短期波动到粗粒度长期周期的时序模式。

(2)多尺度GRU编码与Transformer变量建模。 在每个金字塔尺度上,利用门控循环单元(GRU)对卷积压缩后的时序特征进行序列依赖建模,提取该尺度下的时序表示。随后,将所有尺度的表示按一定权重融合,得到每个变量的嵌入向量,送入标准Transformer编码器中,通过多头自注意力机制学习变量间的交叉依赖关系。

尽管PRformer在多变量长时预测任务上取得了领先性能,但其架构设计仍存在以下三方面不足:

不足一:多尺度窗口池配置固定且覆盖范围有限。 原模型中金字塔卷积的尺度配置由人工预设的固定窗口列表决定(如在ETTh1数据集上默认仅使用3~4个尺度)。当数据中存在未被预设窗口覆盖的重要周期模式时,模型无法有效提取相应尺度的时序特征,限制了其对复杂多周期数据的建模潜力。

不足二:多尺度融合权重全局固定,缺乏样本自适应能力。 在PRE模块末端,原模型采用一组全局可训练参数 (\boldsymbol{\alpha} \in \mathbb{R}^S)((S) 为尺度数量)作为各尺度的融合权重,经softmax归一化后对所有输入样本统一加权。然而,不同样本的周期强度分布存在显著差异——部分样本日周期特征突出,短周期尺度应被赋予更高权重;部分样本周周期特征主导,长周期尺度更为关键;还有部分样本处于突变状态,需各尺度协同发挥作用。全局固定权重无法根据输入样本的动态特性进行自适应调整,制约了多尺度特征的有效利用。

不足三:最终预测头非线性表达能力有限。 原模型在Transformer编码器之后仅采用单层线性投影生成预测结果。单层线性变换的拟合能力有限,难以充分刻画从高维嵌入空间到多步预测目标之间的复杂非线性映射,尤其在对峰值和突变点的预测上易出现精度损失。

3.1.3 本文改进思路

针对上述问题,本文提出一种基于多尺度自适应融合的改进PRformer模型(MAF-PRformer),在不破坏原模型核心架构的前提下,从以下三个层面进行针对性改进:

(1)扩展多尺度候选窗口池:在保持金字塔卷积整除约束的前提下,将原模型中固定的小规模窗口集合扩展为覆盖更全周期模式的候选窗口池,为后续自适应选择提供更丰富的尺度基础。

(2)设计样本自适应多尺度加权融合机制:替换原模型中的全局固定权重,引入轻量级自适应权重生成网络,使每个输入样本能够根据自身时序特性动态生成专属的尺度融合权重,实现“因样本制宜”的多尺度特征利用。

(3)强化最终预测头的非线性表达能力:将单层线性投影替换为带有非线性激活函数的两层感知机结构,提升模型对复杂时序映射的拟合精度。

3.2 本文方法整体框架

本文提出的MAF-PRformer模型的整体架构如图3.1所示。模型沿用了PRformer的编码器-投影器主体结构,主要由三个核心模块构成:多尺度金字塔RNN嵌入模块(含窗口池扩展与样本自适应融合)、Transformer变量编码器模块以及非线性预测投影模块

图3.1 MAF-PRformer模型整体架构图

给定输入序列 (\mathbf{X} \in \mathbb{R}^{L \times C}),模型的处理流程如下:

步骤1:单变量多尺度嵌入。 对于第 (c) 个变量的一维时间序列 (\mathbf{X}_{:,c} \in \mathbb{R}^L),通过改进后的PRE模块提取其多尺度时序嵌入向量 (\mathbf{h}_c \in \mathbb{R}^D)。该模块首先利用扩展后的金字塔卷积结构构建多尺度特征,再通过GRU编码各尺度时序依赖,最后经由样本自适应加权融合机制生成该变量的综合嵌入表示。对所有 (C) 个变量重复此过程,得到嵌入矩阵 (\mathbf{H} = {\mathbf{h}_1, \mathbf{h}_2, \ldots, \mathbf{h}_C} \in \mathbb{R}^{C \times D})。

步骤2:变量间依赖建模。 将嵌入矩阵 (\mathbf{H}) 送入标准Transformer编码器中,通过多头自注意力机制学习变量间的交叉依赖关系。由于PRE模块已经充分编码了时序位置信息,此处无需额外添加位置编码。

步骤3:非线性预测生成。 对编码器输出的变量表示矩阵,逐变量地通过非线性增强预测头生成未来 (H) 步的预测值,最终拼接得到完整预测序列 (\hat{\mathbf{Y}} \in \mathbb{R}^{H \times C})。

以下各节将对三个改进模块的设计细节进行详细阐述。

3.3 多尺度候选窗口池扩展策略

3.3.1 原模型窗口配置的局限性

在原PRformer模型中,金字塔卷积的尺度配置由预设的窗口周期列表 convWindows 决定。每个窗口值代表一个时间周期长度,各层窗口之间需满足整除关系以保证金字塔结构的有效构建[1]。以ETTh1数据集(采样频率为1小时)为例,原模型默认采用 [24, 48, 96][12, 24, 48, 96] 的配置,仅覆盖了1天至4天的时间周期范围。

然而,实际电力负荷、交通流量等时序数据往往蕴含更丰富的周期模式。例如,电力数据不仅存在24小时的日周期,还可能存在168小时(7天)的周周期特征;交通数据可能同时受12小时(早晚高峰)、24小时(日循环)和168小时(工作日-周末差异)等多尺度周期的共同影响。原模型有限的窗口配置难以全面捕捉这些多层次周期规律,构成了性能提升的潜在瓶颈。

3.3.2 扩展后的多尺度候选窗口池

针对上述问题,本文在保持金字塔卷积整除约束的前提下,将候选窗口池进行系统性扩展。以ETTh1数据集为例,扩展后的窗口配置为:

[\text{convWindows} = [12, 24, 48, 72, 96, 144, 168]]

该配置覆盖了从12小时(半日周期)到168小时(7天周周期)的核心时间尺度。在金字塔卷积构建过程中,相邻层级之间的窗口比值决定了卷积核的尺寸与步幅。为保证卷积操作的有效执行,相邻窗口之间需满足严格的整除关系,即 (\text{Window}^l) 是 (\text{Window}^{l-1}) 的整数倍。扩展后的配置完全符合该工程约束:(24 \div 12 = 2),(48 \div 24 = 2),(96 \div 48 = 2),(144 \div 72 = 2),(168 \div 84 = 2)(实际配置中可选用84或保持原序列结构),确保了金字塔结构的稳定构建。

需说明的是,扩展窗口池的目的并非要求模型对所有尺度等量齐观,而是为后续的自适应加权融合模块提供更丰富的候选尺度空间。通过引入更多的候选尺度,模型能够在训练过程中自动识别对不同样本最有价值的周期模式,实现数据驱动的尺度利用。

3.3.3 与金字塔卷积结构的兼容性

本文的窗口池扩展完全兼容原模型的 WindowListSplit.py 模块。该模块的核心函数仅要求相邻窗口之间尽量满足整除关系,以便通过卷积核尺寸与步幅的合理设置实现特征图的下采样。扩展后的窗口列表满足该约束条件,无需修改 WindowListSplit.py 的任何核心代码逻辑,仅需更新初始化参数即可自动生成对应数量的金字塔卷积链。

具体而言,对于长度为 (S) 的窗口列表,金字塔卷积模块将构建 (S) 条并行的卷积链。第 (s) 条链包含 (s) 层卷积,自底向上逐层将特征图的分辨率压缩,最终每条链输出一个固定维度的特征表示。该过程与窗口池的具体取值无关,具有良好的可扩展性。

3.4 样本自适应多尺度加权融合机制

这是本文最核心的改进模块。本节首先回顾原模型中多尺度融合的实现方式并分析其局限,然后详细介绍样本自适应加权融合的设计思路与具体实现。

3.4.1 原模型全局固定权重的局限性

原PRformer的PRE模块在完成多尺度GRU编码后,采用如下方式进行融合:

[\mathbf{h} = \sum_{s=1}^{S} \beta_s \cdot \mathbf{h}^{(s)} \quad (3.1)]

其中,(\mathbf{h}^{(s)} \in \mathbb{R}^D) 为第 (s) 个尺度的GRU输出隐状态,(\beta_s) 为融合权重,由一组全局可训练参数 (\boldsymbol{\alpha} \in \mathbb{R}^S) 经带温度系数 (\tau) 的softmax归一化得到:

[\beta_s = \frac{\exp(\alpha_s / \tau)}{\sum_{j=1}^{S} \exp(\alpha_j / \tau)} \quad (3.2)]

该设计的核心问题在于:(\boldsymbol{\alpha}) 是全局参数,所有输入样本共享同一套融合权重。然而,不同样本的时序特性可能存在显著差异——有的样本日周期特征明显,短周期尺度应被赋予更高权重;有的样本周周期占据主导,长周期尺度更为关键;还有的样本可能处于突变或异常状态,需要各尺度协同发挥作用。全局固定权重无法根据每个样本的具体特性进行动态调整,导致多尺度特征的有效利用率不足。

3.4.2 样本自适应权重生成网络设计

为解决上述问题,本文设计了一种轻量级的样本自适应权重生成网络,结构如图3.2所示。

图3.2 样本自适应权重生成网络结构

核心思路是:将融合权重的生成过程与输入样本关联起来,使每个样本能够根据自身特征的统计特性,动态生成专属的尺度权重。具体实现分为以下三个步骤:

步骤1:尺度特征摘要提取。 对于第 (s) 个尺度的GRU编码输出 (\mathbf{h}^{(s)} \in \mathbb{R}^D),首先计算其在特征维度上的全局统计量作为该尺度的特征摘要。考虑到多变量场景下各变量具有相对独立性,本文采用分层池化策略:首先对每个变量的特征维度求均值,得到变量级摘要;再对变量维度求均值,得到该样本在当前尺度上的总体摘要标量。形式化表示为:

[z_s = \frac{1}{C} \sum_{c=1}^{C} \left( \frac{1}{D} \sum_{d=1}^{D} h_{c,d}^{(s)} \right) \quad (3.3)]

将所有 (S) 个尺度的摘要拼接,得到当前样本的尺度摘要向量 (\mathbf{z} = [z_1, z_2, \ldots, z_S] \in \mathbb{R}^S)。该向量编码了当前样本在不同尺度上的平均响应强度。

步骤2:自适应权重生成。 将尺度摘要向量 (\mathbf{z}) 送入一个轻量级的多层感知机,输出各尺度的权重对数:

[\boldsymbol{\gamma} = \text{MLP}(\mathbf{z}) \in \mathbb{R}^S \quad (3.4)]

MLP采用两层结构:第一层将维度从 (S) 映射到 (2S),引入GELU非线性激活函数以增强表示能力;第二层将维度从 (2S) 映射回 (S)。该设计在保持计算轻量的同时,提供了足够的非线性变换能力,能够捕捉尺度摘要与最优融合权重之间的复杂关系。

步骤3:权重归一化与加权融合。 对权重对数应用带温度的softmax归一化,得到最终的融合权重:

[\beta_s = \frac{\exp(\gamma_s / \tau)}{\sum_{j=1}^{S} \exp(\gamma_j / \tau)} \quad (3.5)]

其中,温度系数 (\tau) 为可学习参数,用于调节权重分布的尖锐程度。最后,对各尺度特征进行加权融合,得到该样本的多尺度嵌入表示:

[\mathbf{h} = \sum_{s=1}^{S} \beta_s \cdot \mathbf{h}^{(s)} \quad (3.6)]

3.4.3 模块优势分析

与原模型的全局固定权重相比,本文提出的样本自适应加权融合机制具有以下优势:

(1)动态适应性。 融合权重随输入样本动态变化,能够根据不同样本的周期强度分布自动调整各尺度的重要性,实现因样本制宜的特征利用。

(2)计算高效性。 权重生成网络仅为一个两层轻量MLP,参数量为 (O(S^2))(实验中 (S \leq 7),仅增加约百级参数),额外计算开销可忽略不计,不影响模型训练与推理效率。

(3)即插即用性。 该模块仅修改PRE内部的融合逻辑,完全不改动金字塔卷积链和GRU编码器的核心结构,与原有代码架构高度兼容。

(4)可解释性增强。 通过分析不同样本生成的权重分布,可以洞察模型对不同类型时序模式的尺度偏好,为理解模型行为提供依据。

3.4.4 与现有方法的对比

表3.1将本文的样本自适应融合机制与相关方法进行了对比。

表3.1 多尺度融合机制对比

方法 融合权重类型 是否依赖输入样本 权重参数规模
原PRformer 全局固定 (O(S))
特征金字塔网络(FPN)[2] 固定(等权)
本文方法 样本自适应 (O(S^2))

可以看出,本文方法在保持低参数规模的前提下,实现了权重的输入自适应,有效提升了多尺度特征的利用效率。

3.5 非线性增强预测头设计

3.5.1 原模型线性预测头的局限性

在原PRformer中,Transformer编码器对输入嵌入矩阵处理后,输出维度为 (\mathbb{R}^{C \times D}) 的特征矩阵,其中每一行对应一个变量的时序编码表示 (\mathbf{h}_c \in \mathbb{R}^D)。随后,该表示直接通过单层线性投影生成预测序列:

[\hat{\mathbf{Y}}{:,c} = \mathbf{W}{\text{proj}} \mathbf{h}c + \mathbf{b}{\text{proj}} \quad (3.7)]

其中 (\mathbf{W}{\text{proj}} \in \mathbb{R}^{H \times D}),(\mathbf{b}{\text{proj}} \in \mathbb{R}^H)。

单层线性变换本质上只能学习从嵌入空间到预测目标空间的一个全局线性映射。然而,时间序列预测任务中,嵌入特征与未来多步预测值之间的关系往往是非线性的——尤其对于峰值、谷值和突变点,线性映射难以精确刻画其复杂的特征-目标对应关系。此外,不同预测步长(如96步与720步)的最优映射模式可能差异显著,单一线性层难以同时适配多步长预测需求。

3.5.2 非线性增强预测头结构

为增强预测头的非线性拟合能力,本文将单层线性投影替换为带有非线性激活函数的两层感知机结构,如图3.3所示。

图3.3 非线性增强预测头结构对比

具体结构如下:

[\mathbf{h}'_c = \text{GELU}(\mathbf{W}_1 \mathbf{h}_c + \mathbf{b}_1) \quad (3.8)]

[\hat{\mathbf{Y}}_{:,c} = \mathbf{W}_2 \mathbf{h}'_c + \mathbf{b}_2 \quad (3.9)]

其中,(\mathbf{W}_1 \in \mathbb{R}^{2D \times D}),(\mathbf{b}_1 \in \mathbb{R}^{2D}),(\mathbf{W}_2 \in \mathbb{R}^{H \times 2D}),(\mathbf{b}_2 \in \mathbb{R}^H)。第一层将特征维度从 (D) 扩展至 (2D),增加表示容量;GELU激活函数引入非线性变换,使模型能够学习更复杂的特征-目标映射关系;第二层将扩展后的特征投影到最终的预测步长 (H)。

该设计的优势在于:(1)增强非线性拟合能力,更好地刻画嵌入特征到多步预测值之间的复杂关系;(2)提升对峰值和突变点的预测精度,缓解长步长预测的精度衰减问题;(3)改动范围仅限于最后的投影层,完全兼容原有训练流程与评估框架。

3.6 模型训练与损失函数

3.6.1 损失函数

沿用原PRformer的设定,本文采用平均绝对误差(Mean Absolute Error,MAE)作为训练损失函数:

[\mathcal{L} = \frac{1}{H \cdot C} \sum_{h=1}^{H} \sum_{c=1}^{C} \left| y_{L+h}^{(c)} - \hat{y}_{L+h}^{(c)} \right| \quad (3.10)]

其中 (y_{L+h}^{(c)}) 为第 (c) 个变量在 (L+h) 时刻的真实值,(\hat{y}_{L+h}^{(c)}) 为对应的模型预测值。MAE损失对异常值具有较好的鲁棒性,适用于多数时间序列预测任务。

3.6.2 归一化策略

本文采用可逆实例归一化(Reversible Instance Normalization,RevIN)[3]对输入数据进行预处理。在数据进入模型之前,对每个变量的历史序列进行归一化:

[\tilde{\mathbf{X}}{:,c} = \gamma_c \left( \frac{\mathbf{X} - \mu_c}{\sigma_c} \right) + \beta_c \quad (3.11)]

其中 (\mu_c) 和 (\sigma_c) 分别为该变量序列的均值和标准差,(\gamma_c) 和 (\beta_c) 为可学习的仿射变换参数。模型输出预测结果后,应用逆变换将数据恢复至原始尺度。该策略能够有效缓解训练数据与测试数据之间的分布偏移问题,提升模型的泛化稳定性。

3.6.3 训练流程

模型采用端到端的方式进行训练。在每一轮迭代中,批量输入历史序列 (\mathbf{X}),通过前向传播得到预测序列 (\hat{\mathbf{Y}}),计算MAE损失并通过反向传播同步更新所有可训练参数,包括:特征提取网络参数、PRE模块中的金字塔卷积与GRU参数、自适应权重生成MLP参数、Transformer编码器参数以及非线性预测头参数。训练过程中采用Adam优化器,配合余弦退火学习率调度策略与早停机制,以保证模型收敛的稳定性与泛化性能。

3.7 本章小结

本章针对原PRformer模型在多尺度窗口配置、特征融合策略及预测头设计方面存在的不足,提出了基于多尺度自适应融合的改进模型MAF-PRformer。主要改进内容包括:

(1)多尺度候选窗口池扩展:在保持金字塔卷积整除约束的前提下,将窗口集合从原模型的3~4个扩展至7个,覆盖12小时至168小时(7天)的核心时间尺度,为模型提供更丰富的尺度选择空间。

(2)样本自适应多尺度加权融合机制:设计轻量级MLP网络,根据每个输入样本的尺度特征摘要动态生成专属的融合权重,替代原模型中的全局固定权重,实现因样本制宜的多尺度特征利用。该模块通过分层池化策略兼顾多变量场景的合理性,并保持极低的参数增量。

(3)非线性增强预测头:将单层线性投影替换为带有GELU激活的两层MLP结构,增强模型对复杂时序映射的非线性拟合能力。

以上改进均以插件式方式融入原模型架构,不破坏金字塔卷积、GRU编码器及Transformer编码器的核心结构,具有良好的工程可行性与可复现性。下一章将通过系统实验验证本文改进模型的有效性。


参考文献

[1] Yu Y, Yu W, Nie F, et al. PRformer: Pyramidal recurrent transformer for multivariate time series forecasting[J]. Neural Networks, 2025, 191: 107769.

[2] Lin T Y, Dollár P, Girshick R, et al. Feature pyramid networks for object detection[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 2017: 2117-2125.

[3] Kim T, Kim J, Tae Y, et al. Reversible instance normalization for accurate time-series forecasting against distribution shift[C]//International Conference on Learning Representations. 2022.

posted @ 2026-04-13 00:15  syabjh  阅读(27)  评论(0)    收藏  举报