这篇论文最有意思的地方,不是"再套一层状态空间模型"这么简单,而是把 LRU 这种本来只适合序列任务的"线性极简主义"塞进了图像超分辨率——用一句"语义调制"把静态复现变成了动态感知,还省了计算。论文标题:Linear Recurrent Unit with Semantic Modulation for Image Super-Resolution发表日期:CVPR 2026发表单位:Korea University DGIST原文链接:OpenCVF开源代码:GitHub: MingyuChoi-run/LSM痛点:SSM 越来越强,但也越来越"贵"超分辨率(SR)这件事,表面上是"把模糊图变清晰",实际上是一个经典的病态逆问题——你要从有限的低频信息里把高频细节"猜"回来。过去十年,这条路大概走过了 CNN → Transformer → Diffusion → 状态空间模型(SSM)四个阶段,每一次都在试图同时解决"全局感受野"和"计算效率"这两个矛盾需求。Transformer 系(SwinIR、HAT、DAT 等)把全局交互做透了,但自注意力的复杂度随图像尺寸平方增长,大分辨率输入时资源消耗爆炸。于是 Mamba 系的状态空间模型(MambaIR、MambaIRv2)开始大杀四方——它用线性复杂度换取全局感受野,看起来两全其美。但问题来了:SSM 为了做到这个"线性复杂度",内部引入了动态参数化和复杂的离散化过程,还要配专门的初始化策略,整个模型变得又黑又重。换句话说,Mamba 系虽然计算上宣称高效,但实际实现里有一层"隐性开销"——动态扫描、特殊初始化、参数离散化,每一层都在偷走效率。有没有可能,回到更简单的"线性复现",但用别的手段弥补它的静态弱点?这就是这篇论文切入的点。核心创新:静态扫描 + 语义调制,用"字典"给每个像素派活论文提出的 LSM(Linear recurrent unit with Semantic Modulation)核心思路可以用一句话概括:让 LRU 做"稳定的信息搬运工",让 SMU(语义调制单元)做"现场调度的工头"。什么是 LRU?为什么选它?LRU(Linear Recurrent Unit)是 Orvieto 等人 2023 年提出的,可以理解为"去掉了非线性激活的 RNN"。传统 RNN 因为激活函数的非线性导致梯度不稳定、难以并行化,LRU 通过复数对角化、指数特征值参数化和归一化,得到了一套纯线性的复现方程:h ˉ k = diag ⁡ ( λ ) h ˉ k − 1 + γ ⊙ ( B ˉ u k ) , y ˉ k = C ˉ h ˉ k + D u k , \begin{split} \bar{h}_k = \operatorname{diag}(\lambda) \bar{h}_{k-1} + \gamma \odot (\bar{B} u_k), \\ \bar{y}_k = \bar{C} \bar{h}_k + D u_k, \end{split}hˉk​yˉ​k​​=diag(λ)hˉk−1​+γ⊙(Bˉuk​),=Cˉhˉk​+Duk​,​其中