FACT:用细粒度跨变量卷积建模动态变量交互
相关链接开源代码https://github.com/wanghq21/FACT讲解及改进思路https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要在高维多变量时间序列预测中建模变量间关系愈发重要。但现有方法大多只捕捉变量间的粗粒度coarse-grained相关忽略了一个更细、更动态的方面变量交互往往随时间推进而呈现不同。为此作者提出FACT一个面向多变量预测的细粒度跨变量卷积架构从时域与频域显式建模细粒度变量交互。技术上FACT提出DConvBlock采用带通道专属卷积核的深度可分离depth-wise卷积在每个粒度建模动态变量交互为提升效率把原本一维的变量重构到二维空间、缩短变量距离与所需层数再用膨胀率递增的多膨胀2D卷积在高效获得全局感受野的同时捕捉细粒度动态交互。在12个基准上FACT不仅取得最先进精度还相比注意力机制大幅减少训练时间与内存。Q1这篇论文试图解决什么问题核心问题是现有方法把多变量表示当作不可分割的整体、只学粗粒度变量相关但变量交互高度动态、随时间变化如相邻街道车流在工作日通勤时段强相关、周末出行更随机时相关很弱且具有局部性与周期性如何用低成本显式建模这种细粒度、随时间演化的变量交互。变量交互在时域和频域同时存在。时域中变量间存在相关、因果、协方差与时间滞后频域中则存在共振、相位同步与频率依赖耦合时域依赖表现为单个时间步上的瞬时效应频域依赖表现为特定周期成分上的共振与相移两个视角互补。作者用一个合成实验说明。图1(a)给出四个变量及其频谱变量y1–y4与y2–y3在特定频段存在强共振、并在高频区伴随明显相位延迟图1(b)给出长度100片段上的时域相关变量y1–y4、y2–y3在第30到70步之间高度相似、其他位置相关较弱反映的是瞬态依赖。这说明结合时频两域才能同时捕捉瞬态波动与周期模式。图注细粒度动态交互示意(a)每个频率Each frequency四个变量的时域波形与频谱y1-y4、y2-y3在特定频段强共振(b)每个时间步Each time step四个变量波形与逐时间步的动态相关热力图30–70步相关最强。图神经网络GNN虽能在每个时间步用邻接矩阵表示变量交互、具备捕捉动态跨变量关系的潜力但在高维数据上训练和推理都要维护大邻接矩阵计算与内存开销巨大。FACT要在不承担图结构负担的前提下提取有意义的跨变量交互。Q2有哪些相关研究论文梳理了三类捕捉变量依赖的方法1.注意力架构iTransformer、TimeXer、Crossformer等通过注意力建模变量或时间依赖能力强但成本高2.聚类架构DUET、CCM等通过变量聚类压缩变量维、分组建模3.卷积架构ModernTCN等用卷积高效建模但上述方法大多把多变量表示当作不可分割的整体忽略了个体变量之间细粒度、随时间演化的交互FACT正是针对这一缺口。Q3论文如何解决这个问题FACT先把输入投影到高维嵌入再在时域和频域分别堆叠DConvBlock建模变量交互最后融合两域并线性投影到预测长度。图注FACT整体框架输入经嵌入后频域走DFT→幅度/相位各自的DConvBlock→iDFT时域直接堆叠DConvBlock两域按权重1−α与α融合后经投影输出右侧为DConvBlock内部结构。① 时频双域建模时域多变量序列在变量间存在动态、时变的瞬时交互模型直接在嵌入上堆叠N个DConvBlock捕捉。频域先对嵌入做DFT计算每个频率的幅度与相位——幅度刻画特定频率上振荡的能量、反映变量在幅度上协同变化的强弱相位编码振荡的相对时序、反映变量间的超前-滞后或同步关系幅度与相位分别用N个DConvBlock建模后再用逆DFT转回时域。两域融合依据Parseval定理时频能量等价用权重因子α把时域与频域输出融合为Xα·Xt(1−α)·Xf再沿隐藏维线性投影到预测序列α可灵活控制两域贡献。② DConvBlock深度可分离卷积传统卷积在所有通道上计算滤波器难以建模每个粒度特有的交互。DConvBlock采用深度可分离卷积、为每个输入通道分配独立卷积核让每个核在特定粒度上独立运算实现粒度特定的变量交互学习。卷积主干可选标准2D卷积、Inception或ResNet论文采用Inception并改成深度可分离的Inception变体因表达能力更强附录显示即便用标准深度可分离2D卷积也有竞争力说明收益来自架构设计本身、而非Inception的选择。③ 一维到二维重构在卷积核参数与层数相同的情况下2D卷积比1D卷积感受野更大。把长度S的一维张量reshape成约√S×√S1D卷积需约l1D层覆盖全长、2D卷积只需约l2D层变量数S越大2D相对减少的层数越多。模型不假设变量间存在空间顺序按行优先row-major顺序padding并reshape取HW⌈√C⌉从而用更少层、2D卷积高效建模动态变量交互。④ 多膨胀卷积与前馈网络为在不增加参数、不堆叠大量层的前提下进一步扩大感受野模型并行使用多个递增的膨胀率如1、2、3不同膨胀率的卷积覆盖不同尺度残差相加后对输入空间形成更密集、灵活的覆盖与深度可分离结构共同实现细粒度建模与感受野扩展。图注多膨胀架构膨胀率dilation1、2、3三个卷积的覆盖蓝色为已覆盖位置相加得到n3的密集且全局的覆盖。卷积后再用一个沿隐藏维的前馈网络FFN做特征变换、整合跨粒度信息每个子层都带批归一化与残差连接。最后把二维表示reshape回一维、必要时沿变量维截断对齐得到该层DConvBlock输出。Q4论文做了哪些实验实验在12个数据集上进行。长期预测预测长度96/192/336/720用ECL、Traffic、Solar-Energy三个高变量数据集短期预测预测长度12/24/48/96用PEMS03、PEMS04、PEMS07、PEMS08、PEMSD7、PEMS-BAY、METR-LA、electricity、Traffic2共9个数据集所有数据集回看长度固定为96。对比12个基线涵盖TimesNet、iTransformer、TQNet、TimeXer、ModernTCN、TimePro、DUET、TSMixer、SOFTS、PatchTST、CycleNet与TimeFilter指标为MSE与MAE。短期预测主结果在6个短期数据集、两项指标共12个位置上FACT全部取得第一。以PEMS03为例FACT相比变量注意力模型iTransformer降低MSE 23.9%、相比变量卷积模型ModernTCN降低22.5%、相比图模型TimeFilter降低20.4%、相比变量独立模型CycleNet降低27.1%提升显著。图注短期数据集完整结果回看L96各预测长度平均FACT在PEMS03/04/07/08、PEMSD7、PEMS-BAY共12个位置全部第一1st12。长期预测主结果在6个长期数据集上FACT在9个位置取得第一仅METR-LA两项第二。以METR-LA为例FACT相比iTransformer降低MSE 12.8%、相比ModernTCN降低14.0%、相比TimeFilter降低5.3%、相比CycleNet降低...验证了其捕捉动态细粒度跨变量交互的鲁棒性与有效性。图注长期数据集完整结果FACT在ECL、Traffic、Solar-Energy、electricity、Traffic2上第一、METR-LA第二共9个位置第一1st9。在t3、t6、t12、t24等单一目标预测步的对比中FACT同样一致领先且随预测步增大、与基线的差距总体扩大说明在更长预测步下优势更明显。效率与注意力机制对比DConvBlock形似Transformer块但用多膨胀深度可分离卷积替换注意力。在8个变量数不同的数据集、相同超参设置下FACT精度更高且在Traffic862变量、PEMS07883变量、Traffic2963变量等大规模数据集上把计算成本最高降低50%。原因是卷积复杂度主要取决于核大小与通道维而不像注意力那样依赖输入序列长度。图注与注意力机制对比(a)精度FACT橙MSE更低(b)训练时间FACT更短(c)内存FACT占用更少大规模数据集上计算成本最高降50%。消融实验模块消融分别去掉多膨胀深度可分离Inception模块w/o MDInception与前馈网络w/o FFN两者都不可或缺、作用互补去掉Inception模块在多数数据集上性能下降更多凸显显式建模跨变量交互的关键作用。图注模块消融FACT、w/o FFN、w/o MDInception在8个数据集上的MSE去掉MDInception升高最多。时频消融分别去掉频域建模w/o Frequency与时域建模w/o Time两域提供互补信息——时域捕捉瞬态、瞬时的变量交互频域揭示周期性变量依赖结合两者才能更全面刻画跨变量依赖。图注时域与频域消融7个数据集平均结果w/o Time、w/o Frequency的MSE/MAE均高于完整FACT两域互补。Q5有什么可以进一步探索的点结合论文内容可从以下方向继续1.二维重构按行优先排布、不假设变量空间顺序能否先按变量相似性聚类再排布让相邻位置更有语义2.融合权重α目前是静态超参能否让其随样本、随时间自适应并补充其与序列特性的关系3.把DConvBlock作为通用插件接入更多主干模型附录已初步验证其增强作用并推广到分类、异常检测、缺失插补等任务4.面向超大规模变量数进一步研究该卷积架构在时间序列基础模型自监督预训练中的可扩展性。Q6总结一下论文的主要内容针对现有方法只建模粗粒度变量相关、忽略细粒度动态交互的问题论文提出FACT与DConvBlock核心是用通道专属核的深度可分离卷积、在时域和频域分别建模随时间演化的变量交互并通过一维到二维重构减少所需层数、用递增多膨胀卷积在不增参数的情况下扩大感受野。在12个数据集上FACT短期12个位置全部第一、长期9个位置第一并相比注意力机制把大规模数据的计算成本最高降低50%。它给出的核心启示是变量交互是细粒度且动态变化的卷积能用远低于注意力的成本有效刻画时频两域结合才能兼顾瞬态波动与周期模式。