尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

Transformer王者归来!无需修改任何模块,时序预测全面领先

Transformer王者归来!无需修改任何模块,时序预测全面领先 前言近年来Transformer在自然语言处理以及计算机视觉任务中取得了不断突破成为深度学习领域的基础模型。受此启发众多Transformer模型变体在时间序列领域中被提出。然而最近越来越多的研究发现使用简单的基于线性层搭建的预测模型就能取得比各类魔改Transformer更好的效果。最近针对有关Transformer在时序预测领域有效性的质疑清华大学软件学院机器学习实验室和蚂蚁集团学者合作发布了一篇时间序列预测工作在Reddit等论坛上引发热烈讨论。其中作者提出的iTransformer考虑多维时间序列的数据特性未修改任何Transformer模块而是打破常规模型结构在复杂时序预测任务中取得了全面领先试图解决Transformer建模时序数据的痛点。论文地址https://arxiv.org/abs/2310.06625代码实现https://github.com/thuml/Time-Series-Library在iTransformer的加持下Transformer完成了在时序预测任务上的全面反超。问题背景现实世界的时序数据往往是多维的除了时间维之外还包括变量维度。每个变量可以代表不同的观测物理量例如气象预报中使用的多个气象指标风速温度湿度气压等也可以代表不同的观测主体例如发电厂不同设备的每小时发电量等。一般而言不同的变量具有完全不同的物理含义即使语义相同其测量单位也可能完全不同。以往基于Transformer的预测模型通常先将同一时刻下的多个变量嵌入到高维特征表示Temporal Token使用前馈网络Feed-forward Network编码每个时刻的特征并使用注意力模块Attention学习不同时刻之间的相互关联。然而这种方式可能会存在如下问题设计思路不同于自然语言中的每个词Token具有较强的独立语义信息在同为序列的时序数据上现有Transformer视角下看到的每个「词」Temporal Token往往缺乏语义性并且面临时间戳非对齐与感受野过小等问题。也就是说传统Transformer的在时间序列上的建模能力被极大程度地弱化了。为此作者提出了一种全新的倒置Inverted视角。如下图通过倒置Transformer原本的模块iTransformer先将同一变量的整条序列映射成高维特征表示Variate Token得到的特征向量以变量为描述的主体独立地刻画了其反映的历史过程。此后注意力模块可天然地建模变量之间的相关性Mulitivariate Correlation前馈网络则在时间维上逐层编码历史观测的特征并且将学到的特征映射为未来的预测结果。相比之下以往没有在时序数据上深入探究的层归一化LayerNorm也将在消除变量之间分布差异上发挥至关重要的作用。iTransformer整体结构不同于以往Transformer预测模型使用的较为复杂的编码器-解码器结构iTransformer仅包含编码器包括嵌入层Embedding投影层Projector和L个可堆叠的Transformer模块TrmBlock。建模变量的特征表示对于一个时间长度为 T 、变量数为 N 的多维时间序列文章使用表示同一时刻的所有变量以及表示同一变量的整条历史观测序列。考虑到比具有更强的语义以及相对一致的测量单位不同于以往对进行特征嵌入的方式该方法使用嵌入层对每个独立地进行特征映射获得 N 个变量的特征表示其中蕴含了变量在过去时间内的时序变化。该特征表示将在各层Transformer模块中首先通过自注意力机制进行变量之间的信息交互使用层归一化统一不同变量的特征分布以及在前馈网络中进行全连接式的特征编码。最终通过投影层映射为预测结果。基于上述流程整个模型的实现方式非常简单计算过程可表示为:其中即为每个变量对应的预测结果嵌入层和投影层均基于多层感知机MLP实现。值得注意的是因为时间点之间的顺序已经隐含在神经元的排列顺序中模型不需要引入Transformer中的位置编码Position Embedding。模块分析调转了Transformer模块处理时序数据的维度后这篇工作重新审视了各模块在iTransformer中的职责。**层归一化**层归一化的提出最初是为了提高深度网络的训练的稳定性与收敛性。在以往Transformer中该模块将同一时刻的的多个变量进行归一化使每个变量杂糅无法区分。一旦收集到的数据没有按时间对齐该操作还将引入非因果或延迟过程之间的交互噪声。而在倒置版本中公式如上层归一化应用于每个变量的特征表示Variate Token让所有变量的特征通道都处于相对统一的分布下。这种归一化的思想在处理时间序列非平稳问题时已经被广泛证明是有效的只是在iTransformer中可以自然而然的通过层归一化实现。此外由于所有变量的特征表示都被归一化到正态分布由变量取值范围不同造成的差异可以减弱。相反在此前的结构中所有时间戳的特征表示Temporal Token将被统一标准化导致模型实际看到的是过平滑的时间序列。**前馈网络**Transformer利用前馈网络编码词向量。此前模型中形成「词」向量的是同一时间采集的多个变量他们的生成时间可能并不一致并且反映一个时间步的「词」很难提供足够的语义。在倒置版本中形成「词」向量的是同一变量的整条序列基于多层感知机的万能表示定理其具备足够大的模型容量来提取在历史观测和未来预测中共享的时间特征并使用特征外推为预测结果。另一个使用前馈网络建模时间维的依据来自最近的研究研究发现线性层擅长学习任何时间序列都具备的时间特征。对此作者提出了一种合理的解释线性层的神经元可以学习到如何提取任意时间序列的内在属性如幅值周期性甚至频率谱傅立叶变换实质是在原始序列上的全连接映射。因此相较以往Transformer使用注意力机制建模时序依赖的做法使用前馈网络更有可能完成在未见过的序列上的泛化。**自注意力**自注意力模块在该模型中用于建模不同变量的相关性这种相关性在有物理知识驱动的复杂预测场景中例如气象预报是极其重要的。作者发现自注意力图Attention Map的每个位置满足如下公式其中对应任意两个变量的Query和Key向量作者认为整个注意力图可以在一定程度上揭示变量的相关性并且在后续基于注意力图的加权操作中高度相关的变量将在与其Value向量的交互中获得更大的权重因此这种设计对多维时序数据建模更为自然和可解释。综上所述在iTransformer中层归一化前馈网络以及自注意力模块考虑了多维时序数据本身的特点三者系统性互相配合适应不同维度的建模需求起到111 3的效果。实验分析作者在六大多维时序预测基准上进行了广泛的实验同时在支付宝交易平台的线上服务负载预测任务场景的数据Market中进行了预测。实验部分对比了10种不同的预测模型包含领域代表性Transformer模型PatchTST2023、Crossformer2023、FEDformer2022、Stationary2022、Autoformer2021、Informer2021线性预测模型TiDE2023、DLinear2023TCN系模型TimesNet2023、SCINet2022。此外文章分析了模块倒置给众多Transformer变体带来的增益包括通用的效果提升泛化到未知变量以及更加充分地利用历史观测等。时序预测如开篇雷达图所示iTransformer在六大测试基准中均达到了SOTA并在Market数据的28/30个场景取得最优效果详见论文附录。在长时预测以及多维时间预测这一充满挑战的场景中iTransformer全面地超过了近几年的预测模型。iTransformer框架的通用性在取得最佳效果的同时作者在Reformer、Informer、Flowformer、Flashformer等Transformer变体模型上进行了倒置前后的对比实验证明了倒置是更加符合时序数据特点的结构框架。提升预测效果通过引入所提出的框架这些模型在预测效果上均取得了大幅度的提升证明了iTransformer核心思想的通用性以及受益于高效注意力研究进展的可行性。泛化到未知变量通过倒置模型在推理时可以输入不同于训练时的变量数文中将其与一种泛化策略——通道独立Channel Independence进行了对比结果表明该框架在仅使用20%的变量时依然能够尽可能减少泛化误差。使用更长历史观测以往Transformer系模型的预测效果不一定随着历史观测的变长而提升作者发现使用该框架后模型在历史观测增加的情况下展现出了惊人的预测误差减小趋势在一定程度上验证了模块倒置的合理性。模型分析模型消融实验作者进行了消融实验验证iTransformer模块排布的合理性。结果表明在变量维使用自注意力在时间维上使用线性层的建模方式在绝大部分数据集上都取得了最优效果。特征表示分析为了验证前馈网络能够更好地提取序列特征的观点作者基于CKACentered Kernel Alignment相似度进行特征表示分析。CKA相似度越低代表模型底层-顶层之间的特征差异越大。值得注意的是此前研究表明时序预测作为一种细粒度特征学习任务往往偏好更高的CKA相似度。作者对倒置前后的模型分别计算底层-顶层CKA得到了如下的结果印证了iTransformer学习到了更好的序列特征从而达到了更好的预测效果。变量相关性分析如上图所示作用在变量维的注意力机制在学习到的注意力图中展现出更加强的可解释性。通过对Solar-Energy数据集的样例进行了可视化有如下观察在浅层注意模块学习到的注意力图与历史序列的变量相关性更加相似。当深层注意模块学习到的注意力图与待预测序列的变量相关性更加相似。这说明注意力模块学到了更加可解释的变量相关性并且在前馈网络中进行了对历史观测的时序特征编码并能够逐渐解码为待预测序列。总结作者受多维时间序列的本身的数据特性启发反思了现有Transformer在建模时序数据的问题提出了一个通用的时序预测框架iTransformer。iTransformer框架创新地引入倒置的视角观察时间序列使得Transformer模块各司其职针对性完成时序数据两个维度的建模难题展现出优秀的性能和通用性。面对Transformer在时序预测领域是否有效的质疑作者的这一发现可能启发后续相关研究使Transformer重新回到时间序列预测的主流位置为时序数据领域的基础模型研究提供新的思路。最后的最后感谢你们的阅读和喜欢我收藏了很多技术干货可以共享给喜欢我文章的朋友们如果你肯花时间沉下心去学习它们一定能帮到你。因为这个行业不同于其他行业知识体系实在是过于庞大知识更新也非常快。作为一个普通人无法全部学完所以我们在提升技术的时候首先需要明确一个目标然后制定好完整的计划同时找到好的学习方法这样才能更快的提升自己。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表