尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

【ICLR 2026】MMPD:用扩散损失让时序预测学会“多种可能“

【ICLR 2026】MMPD:用扩散损失让时序预测学会“多种可能“ 【ICLR 2026】MMPD用扩散损失让时序预测学会多种可能一、论文基本信息二、核心贡献三、先看效果MSE vs MMPD四、WhyMSE的问题到底出在哪4.1 为什么MSE只能学“平均值”4.2 真实世界相同历史可以走向截然不同未来4.3 MSE的四条“出厂限制”论文总结五、HowMMPD是怎么做的5.0 整体架构总览5.1 Backbone看懂历史输出条件向量5.2 扩散损失同一个历史为什么生成多种未来5.3 扩散损失之去噪网络Patch Consistent MLP5.4 Multi‑Mode Inference提取多个可能世界六、实验结果6.1 MMPD与基线损失函数对比6.2 不同骨干网络的通用性验证七、总结一、论文基本信息标题MMPD: Diverse Time Series Forecasting via Multi‑Mode Patch Diffusion Loss作者Yunhao Zhang, Wenyao Hu, Jiale Zheng, Lujia Pan, Junchi Yan单位上海交通大学华为诺亚方舟实验室会议ICLR 2026代码https://github.com/Thinklab‑SJTU/MMPD二、核心贡献MMPD损失函数将扩散模型改造为可训练的损失函数可直接替换传统MSE。使用完全相同的Backbone骨干网络仅更换损失函数就能够输出多模态预测结果。Backbone‑Loss解耦架构骨干网络Backbone仅负责挖掘历史时序、提取特征复杂的未来分布建模交给轻量级扩散网络。现有的各类基于Patch的时序骨干网络均可直接接入使用。Patch Consistent MLP扩散去噪模块去噪时不仅使用当前Patch同时引入相邻噪声Patch作为条件约束保证时序各个片段之间不会出现断裂、不连续问题。演化式多模态推理在扩散反向采样过程中做逐步聚类从多条采样轨迹自动挖掘出多种预测模式同时输出每种模式对应的发生概率。三、先看效果MSE vs MMPD图1MSE vs MMPD结果对比左图MSEMSE输出单一预测曲线置信区间固定且对称。红色为真实曲线MSE的单点预测很难捕捉时序剧烈的突变。右图MMPD骨干网络完全不变MMPD输出3种差异化预测模式附带各自概率38.46%、24.18%、23.08%真实值曲线可以被其中某一条模式精准命中。四、WhyMSE的问题到底出在哪当下绝大多数时序预测模型训练都采用MSE均方误差。预测值与真实值差距越大损失扣分越多。但是MSE背后隐藏了很强的先验假设。Using MSE loss implicitly assumes the future follows an independent Gaussian distribution, with predicted mean and fixed constant variance.MSE损失隐式假设未来服从独立高斯分布输出均值方差固定不变。4.1 为什么MSE只能学“平均值”MSE公式M S E ( 预测值 − 真实值 ) 2 MSE (预测值 - 真实值)^2MSE(预测值−真实值)2举一个电价预测示例同样历史条件下未来存在3种现实场景场景真实电价A0 元新能源大发B300 元正常供需C800 元火电故障如果预测0元场景B、C损失很大如果预测800元场景A、B损失很大如果预测310元三者平均三个场景损失都不会特别大。MSE收敛后模型会偏向输出平均值这个平均值有可能现实世界根本不会发生是一个“平均幽灵”。数学本质MSE最优解就是目标分布的均值期望值这是最小二乘法本身的数学性质并不是骨干网络不够强。4.2 真实世界相同历史可以走向截然不同未来电力市场明天电价可能接近0也可能冲高到天价交通流量早高峰既可以一路畅通也可能发生严重拥堵金融价格相同技术指标后续可以暴涨也可以暴跌。面对这类多模态业务场景MSE只能输出折中平均值但该平均值现实中未必存在。4.3 MSE的四条“出厂限制”论文总结单峰分布只能输出单一最可能值无法描述多种未来可能性步间独立假设认为各个时间步互相独立但真实时序强相关方差固定假设全程不确定性不变现实中不确定性会随时间动态变化对称分布高斯分布强制对称而降雨量、电价这类物理量分布天然非对称。这不是模型架构缺陷是高斯分布本身带来的数学约束。五、HowMMPD是怎么做的5.0 整体架构总览MMPD整体分为两大模块Backbone骨干网络多模态Patch扩散损失。Backbone读取历史时序输出条件向量扩散损失基于条件向量利用扩散过程建模未来复杂多模态分布。5.1 Backbone看懂历史输出条件向量输入历史时间序列输出每个时序Patch对应的条件向量传统时序模型MMPD框架Backbone直接输出预测数值Backbone输出条件向量交给扩散模块生成预测✅架构优势Backbone可以自由替换扩散损失无需改动。Transformer、RNN、MaskAE等各类Patch‑based骨干网络都可以直接接入MMPD损失。5.2 扩散损失同一个历史为什么生成多种未来历史数据只提供部分信息现实中还有大量不可观测隐藏变量扩散模型的随机噪声用来模拟这些隐藏变量的不同组合。以电价预测举例历史观测负荷6000 MW新能源预测出力3000 MW火电计划出力2500 MW。MSE视角基于上面信息直接给出明天中午电价310元。MMPD视角历史信息缺失很多关键隐藏变量隐藏变量场景A噪声起点1场景B噪声起点2场景C噪声起点3风电实际出力比预测多2000MW和预测一致比预测少2000MW火电机组状态正常正常非计划故障真实电价0元300元800元历史数据完全一致隐藏变量不同最终未来完全不一样。随机噪声 模拟现实中不同隐藏变量组合噪声A → 模拟风电大发 → 生成0元场景噪声B → 模拟正常供需 → 生成300元场景噪声C → 模拟火电故障 → 生成800元场景历史条件向量的作用限定合理取值范围学习变量之间的关联规则但不会强制锁定唯一结果。随机噪声的作用扮演现实世界不可观测的隐藏变量不同噪声对应不同潜在场景由此生成多条合理未来轨迹。小结历史告诉我们未来的合理范围与关联规则随机噪声补全未知隐藏变量从而生成多种可能未来。5.3 扩散损失之去噪网络Patch Consistent MLP图2Patch Consistent MLP核心设计对某一个Patch做去噪不仅仅使用自身的噪声Patch同时引入前后相邻的噪声Patch作为条件。去噪第3个Patch示例←邻居1 ←邻居2 ←【当前Patch】→ 邻居4 → 邻居5利用相邻Patch信息做约束保证生成时序片段之间平滑连续避免各个Patch拼接后出现突变、断裂。5.4 Multi‑Mode Inference提取多个可能世界图3MMPD多模态推理过程扩散反向过程第一行k0.5K纯噪声大量采样轨迹杂乱无章k0.3K部分去噪轨迹开始逐步聚拢k0.1K接近生成结束已经显现出若干簇k0生成完成得到多条清晰预测曲线GMM变分高斯混合模型演化过程第二行初始单一模式概率92.15%随反向去噪迭代模式自动分裂、合并、调整最终输出多组预测模式 各自概率工作流程多次扩散采样论文N100得到上百条未来轨迹在反向采样过程中使用演化式变分高斯混合模型GMM持续聚类输出结果不是单一点预测而是多组模式对应概率。未来预测 ├─ 模式1低需求曲线概率35% ├─ 模式2正常曲线概率45% └─ 模式3极端高峰曲线概率20%六、实验结果6.1 MMPD与基线损失函数对比固定骨干网络在8个公开时序数据集上对比MMPD与5种基线损失。多模态指标 Top‑3 MSE / MAEMMPD全面优于基线是唯一在全部8个数据集Top‑3 MSE取得第一的方法。对比Mixture混合模型Mixture需要预先设定分量数量MMPD自动从数据挖掘模式效果更好。确定性预测指标 MSE8个数据集4个优于原生MSE其余基本持平。使用MMPD替换MSE不会牺牲单点预测性能。概率预测指标 CRPSMMPD性能和最优基线Student‑T基本相当。6.2 不同骨干网络的通用性验证在 Crossformer、SegRNN、MaskAE 3种完全不同骨干网络分别搭配 MMPD / MSE / Mix损失多模态Top‑3 MSEMMPD在全部骨干、全部数据集均排名第一确定性MSEMMPD与MSE互有胜负总体持平稳定性对比Mix损失Mix对数正态分量容易产生极端异常值SegRNN骨架下8个数据集CRPS全部Inf崩溃MMPD在所有骨干网络上均保持稳定不会出现数值爆炸。更多详细实验结果请参考原论文。七、总结MMPD跳出改进模型架构的思路从损失函数入手借助扩散过程建模时序的多模态分布。采用Backbone‑Loss解耦现有时序骨干网络可以直接复用Patch Consistent MLP保证生成时序片段之间连续性演化多模态推理自动挖掘多条未来路径输出预测与对应概率。有时候性能瓶颈不在于模型本身而在于训练时使用的损失函数。仅仅更换损失原有模型就具备输出多种合理未来的能力。inproceedings{ zhang2026mmpd, title{{MMPD}: Diverse Time Series Forecasting via Multi‑Mode Patch Diffusion Loss}, author{Yunhao Zhang and Wenyao Hu and Jiale Zheng and Lujia Pan and Junchi Yan}, booktitle{The Fourteenth International Conference on Learning Representations}, year{2026}, url{https://openreview.net/forum?idNEUgHT8dvH} }
返回列表