相关链接代码https://github.com/ShijunChen01/L-Drive论文L-Drive: Beyond a Single Mapping—Latent Context Drives Time Series ForecastingICML 2026代码及其改进思路讲解https://space.bilibili.com/51422950?spm_id_from333.1007.0.0摘要主流多元时序预测方法大多遵循直接映射Direct-Mapping范式在观测空间学习从历史到未来的统一映射、拟合值级依赖。但真实系统经常发生分布漂移与状态切换此时统一映射会在转折点附近出现响应滞后造成切换窗口内的误差累积、降低预测可靠性。为此作者提出变化感知预测框架L-Drive引入潜在上下文L-Context显式刻画随时间演化的高层动态并用门控调制增量表示提供更及时的变化线索、增强对变化片段的适应同时引入补丁共享的相对位置基函数增强段内结构建模、减少因绝对位置记忆带来的过拟合。大量实验验证了其有效性并在精度与效率间取得更好的整体权衡。Q1这个模型试图解决什么问题核心问题是直接映射范式在分布漂移与趋势转折点响应滞后、切换窗口误差累积如何让模型快速感知并适应状态变化同时抑制差分放大的高频噪声、避免绝对位置记忆过拟合。图注合成数据对比训练阶段与测试阶段各基线直接映射在切换点Mode 1→Mode 2出现明显响应滞后Rapid Lag而L-Drive适应更快、显著减小转折点附近的滞后。1.转折点响应滞后统一映射以一套固定的“历史值→未来值”关系应对所有片段在系统进入新状态时不能及时更新预测基准误差在切换窗口内累积2.差分放大噪声一阶差分是刻画变化最直接的方式但会放大高频扰动、引入噪声需要进一步稳定3.绝对位置记忆标准绝对位置编码会让模型把变化模式与训练中出现的特定位置绑定而非学习变化本身的局部演化导致位置相关过拟合。Q2相关研究1.直接映射类线性/MLP/Transformer在观测空间学习统一的值级映射结构直观但对分布漂移与转折点响应慢2.通道策略通道混合显式建模变量依赖通道独立通过划分变量抑制过拟合但都未直接解决“变化响应滞后”3.多尺度/频域方法沿序列或时频双域刻画特征但仍可能在切换点滞后4.L-Drive不再只靠观测空间的统一映射而是显式建模“变化”用潜在上下文驱动增量、用补丁相对位置基增强段内结构。Q3模型如何解决这个问题L-Drive由两个模块组成L-Context Generator潜在上下文生成器与Struct-Aided Predictor结构辅助预测器。图注L-Drive整体架构(a)L-Context Generator依次做归一化、Conv1D对齐、一阶差分、拼接后经Sigmoid门控与逐元素乘法再由GRU递归积分得到L-Context(b)Struct-Aided Predictor把L-Context与原序列拼接、切补丁、叠加相对位置基经MLP局部映射后合并、反归一化输出。L-Context Generator为提升对分布漂移与动态转折点的响应速度作者显式建模变化把变化归结为相邻时间点之间的增量一阶差分是最直接的方式其流程为1.标准化式4对输入做零均值、单位方差归一化提供全局尺度稳定2.Conv1D对齐式考虑同一潜在变化在不同通道可能以不同延迟出现沿时间做一维卷积对齐跨通道变化卷积输出不替换原序列而以残差方式加回3.一阶差分式5Δx′D(x′)并把首步(Δx′)1置0作为自然边界保持长度对齐、不引入冗余先验4.门控调制式6把原观测与差分拼接u[x′;Δx′]∈R2V经单层Sigmoid的MLP2V→V得门m再逐元素相乘hm⊙Δx′门控同时由观测与变化驱动增强真正重要的变化、抑制不一致或弱相关增量降低差分引入的高频噪声5.GRU递归积分式7把去噪后的变化序列h送入GRU借助其门控递归单元自适应控制记忆与遗忘得到每个时间步的隐状态序列L-Context作为后续预测快速更新的基准。Struct-Aided Predictor把L-Context与预处理原序列沿新增融合维拼接得l∈RV×2×T沿时间做非重叠补丁划分补丁大小P补丁数⌈T/P⌉。补丁共享相对位置基是该模块的关键为每个变量学习K个长度为P的相对位置基它们独立于全局时间索引、在所有补丁间共享让模型学习补丁内部的局部结构偏好而非记忆特定绝对时间步从而减少位置相关过拟合并让L-Context编码的变化线索更稳定地转化为对局部动态的响应。随后对“数据补丁位置基”做MLP局部映射式8再合并所有补丁映射到最终预测、反归一化式9。相比全局映射这种“局部映射再重组”的分层结构等价于由多个分段子函数构成的复合映射能以更细粒度捕捉不同时间段的异构模式与局部形状差异。理论含义作者从预测的惯性形式出发改写为EWMA形式式10ŷt≈ρŷt−1(1−ρ)gt并迭代展开式11引入L-Context提供增量相关信号Δĝtφθ(L-Context)式12把预测写为含增量修正的形式式13。定义跟踪误差et式15可推得etρet−1ρεt式16若增量估计误差有界|εt|≤ε̄则长期残差滞后上界为lim sup|et|≤ρ/(1−ρ)·ε̄式17。即L-Context让滞后不再主要由模型惯性结构的拖尾决定而主要由L-Context的增量估计误差决定误差越小、残差滞后越小且滞后具有显式上界。Q4实验结果如何实验设置长期预测使用7个经典数据集ETTETTm1、ETTm2、ETTh1、ETTh2、ElectricityECL、Weather、Solar EnergySolar回看窗口96预测长度96、192、336、720短期预测使用EPF电价数据集回看窗口168、预测长度24。数据集基本信息来自附录Table 8ETTh1/ETTh2各17420步、7变量、1小时ETTm1/ETTm2各69680步、7变量、15分钟Weather 52696步、21变量、10分钟Solar Energy 52560步、137变量、10分钟ECL 26304步、321变量、1小时。对比9个主流基线TimeBridge、CrossLinear、FilterTS、PatchMLP、iTransformer、TimeXer、PatchTST、TimesNet、DLinear。其中CrossLinear、PatchMLP、DLinear为MLP类TimeBridge、TimeXer、iTransformer、PatchTST为Transformer类TimesNet为CNN类FilterTS为时频类。评价指标为MSE与MAE。主结果图注Table 18个数据集上的平均结果加粗最优、下划线次优。L-Drive在16个评估案例中取得12个最优、2个次优。L-Drive在全部8个数据集上表现稳定平均MSE/MAE分别为ETTh1 .424/.430、ETTh2 .366/.396、ETTm1 .371/.393、ETTm2 .273/.320、ECL .169/.266、Weather .235/.267、Solar .230/.262、EPF .168/.207。1.对比MLP类在ECL上比CrossLinear的MSE/MAE最高降低6.9%/5.3%在ETTh2上比DLinear的MSE/MAE最高降低49.3%/33.0%2.对比Transformer类在Weather上比iTransformer降低13.7%/7.0%在Solar上比PatchTST降低16.2%/16.8%3.其他在ETTm2上比FilterTS的MAE最高降低15.9%在ETTh2上比TimesNet降低17.1%/10.2%。这些增益主要来自把有效时间动态抽象为L-Context——它把与任务相关的变化显式编码为动态中间上下文使模型更快适应数据变化、缓解响应滞后、提升精度。消融实验图注Table 2平均消融结果所有消融变体相比完整L-Drive均出现性能下降。1.w/o L-Context移除上下文模块后ECL从.169升至.177、Weather从.235升至.243说明带门控调制的结构化上下文对建模关键变化片段不可或缺2.w/o Gating移除门控后ETTm1升至.378、ECL升至.176门控对增强重要变化、抑制噪声很关键3.RandContext用随机初始化可学习变量替换L-ContextETTh2升至.382各变体中最差证明增益来自上下文结构而非参数增加4.w/o RelativePos移除补丁内相对位置基后ETTm2升至.277、ECL升至.1785.GlobalPos用序列级全局绝对位置表示替换后ETTh1升至.434说明增益来自与全局时间索引解耦、补丁共享的相对结构偏置它促进段内模式学习、减少过拟合、提升训练稳定性。L-Context可移植性图注Table 3平均可移植结果把L-Context作为辅助信号注入后所有基线均获得性能提升。在保持各基线主干不变的前提下把L-Context作为额外变化线索注入线性方法DLinear与Transformer类iTransformer、PatchTST1.DLinearECL .212/.300→.198/.295Weather的MAE .317→.2882.iTransformerWeather .258/.278→.251/.276ETTm1 .407/.411→.399/.4073.PatchTSTECL .205/.290→.184/.286ETTh1 .469/.455→.447/.442。三个模型加入L-Context后误差一致下降且增益跨异构主干稳定说明L-Context不是绑定于特定架构的技巧而是一种模型无关的变化建模信号。L-Context可视化图注Figure 3ECL数据集上L-Context的可视化。左为前32个特征、前32个时间步的热力图右上为代表性序列、右下为快速变化局部放大。热力图在时间与特征两个维度都呈现非均匀、块状的响应模式在代表性序列出现快速上升、缓慢下降、快速变化等局部变化的区间附近出现高响应区域而相对平滑的区间对应较弱响应。这定性说明L-Context并非在输入窗口上均匀分布而是呈现与局部时间变化视觉相关、随阶段变化的响应模式。滞后误差分析图注Table 4滞后误差平均结果TailAUC与ExcessAUCL-Drive在所有数据集上均最低。在真值序列上取一阶差分并跨通道聚合得到变化强度以90分位阈值选取变化时刻、并设最小间隔避免重复计数在每个事件邻域窗口累积绝对误差得TailAUC再以非事件区平均误差为稳态基线、只累积超出部分得ExcessAUC刻画由变化引起的额外误差尾。1.ETTh1L-Drive 95.94/37.47TimeBridge 119.98/45.69iTransformer 110.75/43.822.EPFL-Drive 2.37/1.10TimeBridge 4.08/1.84iTransformer 9.71/4.143.WeatherL-Drive 25.20/13.34TimeBridge 26.25/14.48iTransformer 30.49/17.294.SolarL-Drive 22.69/14.86TimeBridge 23.29/15.96iTransformer 29.00/15.66。三种方法的TailAUC与ExcessAUC都随预测长度增加说明长预测在切换点附近误差尾更明显但L-Drive在所有数据集上一致最低表明其变化后对齐更快、切换窗口内的额外误差累积更少。超参数敏感性图注Figure 4不同相对位置基维度dpos2、4、6、8下的平均MSE与MAE。只改变补丁级相对位置基的维度dpos∈{2,4,6,8}各数据集误差仅小幅波动模型对该超参数表现出强鲁棒性较小维度在多数数据集取得最优或并列最优增维没有稳定增益、部分场景略有下降。这说明补丁级相对位置主要用于区分段内相对关系低维基函数已足以表达关键结构更高维可能引入冗余表示、导致轻微过拟合。计算效率图注Figure 5Weather数据集上的计算效率气泡图横轴MSE、纵轴训练时间、气泡大小为推理时间。L-Drive推理时间3.92ms/iter、训练时间12.1ms/iter气泡位于最左下与同属MLP范式的CrossLinear都处于低成本区但L-Drive误差更低、训练成本也更低TimeXer相对轻量但仍比L-Drive贵PatchTST、TimesNet训练与推理成本明显更高FilterTS推理较快但误差略高。整体上L-Drive最靠近左下角精度—效率权衡最佳。Q5还可以探索什么1.更细粒度的变化建模如显式区分水平漂移、斜率变化、状态切换并分别建模2.把变化事件检测与L-Context门控做端到端联合学习提升事件定位与增量估计精度3.让相对位置基的数量与维度按数据/补丁自适应而非固定超参数4.把L-Context与频域周期/季节信息结合同时刻画平滑周期与突发变化5.在更广泛真实场景与更强噪声下检验L-Context的鲁棒性与可移植性。Q6总结L-Drive聚焦直接映射范式在分布漂移与趋势转折点的响应滞后问题提出变化感知框架用L-Context刻画随时间演化的潜在动态并调制增量表示为预测提供更及时的变化线索再用补丁共享的相对位置基增强段内结构建模、减少绝对位置记忆过拟合。实验表明该方法有效、高效且可移植。
