尧图建网站 尧图建网站 YAOTU WEB BUILD 免费咨询
ARTICLE DETAIL

资讯详情

深耕网站建设与建站编程的一线实战洞察。

UMFNet:不确定性感知隐式对齐,未对齐RGB-T显著性检测8数据集SOTA

UMFNet:不确定性感知隐式对齐,未对齐RGB-T显著性检测8数据集SOTA 核心痛点未对齐RGB-T显著性检测(SOD)中RGB和热红外存在严重的空间错位——传统方法要么假设完美对齐实际不成立要么用可变形对齐计算量大且对跨模态不一致敏感无法可靠融合。核心方法UMFNet天津理工大学CVPR 2026将RGB-T SOD重新定义为不确定性感知表示学习——不确定性对齐模块(UAM)将像素特征建模为高斯分布隐式识别跨模态一致性区域无需显式配准→置信度引导全局调制(CGM)用置信度图自适应调节融合权重。核心结论5个未对齐3个对齐基准全面SOTA。UVT20K Fβw达0.8901.9% vs PCNetun-VT5000达0.8828.3% vs SACNetun-VT1000达0.9255.1% vs SACNet。对齐数据集上也保持最佳证明方法的泛化能力。 UMFNet不确定性高斯隐式对齐RGB-T SOD未对齐场景新标杆前言RGB-T显著性检测SOD通过融合可见光和热红外两种模态来精确定位显著目标。但实际应用中RGB和热红外图像往往存在空间错位——双相机的视角差异、标定误差、运动模糊等导致同一目标在两个模态中的位置不完全一致。现有方法对未对齐问题的处理策略假设完美对齐大多数方法直接拼接或注意力融合不处理空间错位。在对齐数据集上效果好但遇到未对齐场景性能急剧下降。显式几何配准用可变形卷积或光流做预对齐。问题计算量大O(N²)复杂度且跨模态的外观差异让配准本身就不可靠RGB和热红外的纹理差异太大传统配准算法难以找到准确对应关系。TPS薄板样条对齐如TPS-SCL用可学习的TPS变换做非刚性配准。效果好但对极端错位仍有限制。UMFNet的创新思路是不做显式配准而是让网络自己学会哪里可以信任。将每个像素的特征建模为高斯分布而非单值向量分布的方差就是不确定性估计——不确定性高的像素说明跨模态不一致可能是错位区域不确定性低的像素说明跨模态一致可以安全融合。本文三大核心问题如何不配准就实现对齐UAM将RGB和IR的像素特征各建模为高斯分布μσ²→KL散度约束两个分布的重叠区域→重叠区域即跨模态一致性区域隐式实现了对齐。如何利用不确定性指导融合CGM从高斯分布的方差σ²推导置信度图→置信度高的区域不确定性低权重放大置信度低的区域不确定性高/错位权重抑制。对齐和未对齐场景能否统一处理UMFNet在5个未对齐3个对齐基准上均取得SOTA证明不确定性建模不是过拟合未对齐场景的技巧而是具有普适性的融合策略。一、整体架构双流编码 不确定性对齐 置信度融合UMFNet采用编码器-解码器架构RGB和IR各自独立编码后通过UAM和CGM融合编码阶段RGB EncoderSwin-T→ 多尺度特征 {F_vis^l}IR EncoderSwin-T→ 多尺度特征 {F_ir^l}融合阶段每层独立执行UAM不确定性对齐模块F_vis → 高斯编码器 → (μ_vis, σ²_vis)F_ir → 高斯编码器 → (μ_ir, σ²_ir)KL散度约束让两个分布在一致区域重叠对齐特征融合高斯分布的均值CGM置信度引导全局调制从σ²推导置信度图 C 1/(1σ²)通道注意力全局池化→MLP→通道权重空间注意力置信度图调制空间权重自适应融合增强可靠区域抑制不一致区域解码阶段逐层上采样跳跃连接→显著图预测数据流 RGB → [Swin-T Encoder] → {F_vis^l} ┐ ├→ [UAM] → 高斯对齐 → [CGM] → 置信度融合 → 解码器 → 显著图 IR → [Swin-T Encoder] → {F_ir^l} ┘二、核心模块深度拆解2.1 UAM不确定性对齐模块高斯分布隐式对齐核心思想不配准像素位置而是配准特征分布。将每个像素的特征向量建模为一个高斯分布 N(μ, σ²)其中μ是特征均值σ²是不确定性方差。高斯编码μ_vis MLP(F_vis) # RGB特征→均值 logσ²_vis MLP(F_vis) # RGB特征→对数方差保证正值 μ_ir, logσ²_ir 同理KL散度约束让RGB和IR的高斯分布在跨模态一致的区域重叠KL(N(μ_vis, σ²_vis) || N(μ_ir, σ²_ir)) log(σ_ir/σ_vis) (σ²_vis (μ_vis-μ_ir)²)/(2σ²_ir) - 0.5KL散度最小化的效果在两个模态都看到相同目标的区域两个分布会趋于一致μ接近、σ²减小在错位区域两个分布保持差异σ²增大不确定性高。对齐特征融合μ_fused (σ²_ir · μ_vis σ²_vis · μ_ir) / (σ²_vis σ²_ir ε)这是一个精度加权融合——不确定性小σ²小精度高的模态获得更大权重。如果IR在某区域更可靠σ²_ir小融合结果偏向IR反之偏向RGB。关键点这种融合是软对齐——不需要找到精确的像素对应关系而是通过分布重叠自动发现一致区域。即使空间错位达几个像素只要特征分布有重叠就能正确融合。2.2 CGM置信度引导全局调制不确定性驱动的自适应融合UAM输出的对齐特征虽然已经隐式处理了错位但仍需要进一步的置信度引导来增强可靠区域、抑制噪声置信度图推导C_vis 1 / (1 σ²_vis) # RGB置信度不确定性越小置信度越高 C_ir 1 / (1 σ²_ir) # IR置信度通道注意力全局平均池化→两层MLP→Sigmoid→通道权重w_ch σ(MLP(GAP(F_fused)))空间注意力置信度图调制空间权重w_sp σ(Conv(C_vis ⊙ C_ir)) # 两个模态置信度的交集最终融合F_out w_ch ⊙ w_sp ⊙ F_fused关键点CGM不是简单的哪个模态整体更可靠就选哪个而是逐像素、逐通道地判断可靠性。即使IR整体更可靠但在某些区域RGB可能更清晰如纹理丰富的前景CGM能捕获这种局部差异。2.3 为什么不确定性建模比显式配准更好维度显式配准可变形对齐不确定性隐式对齐计算复杂度O(N²) 采样插值O(N) 逐像素高斯编码对极端错位配准失败时传播错误高σ²自动抑制不可靠区域跨模态外观差异难以找到对应点不依赖外观相似性可解释性偏移量可视化不确定性热力图可视化2.4 高斯编码的工程细节为什么用对数方差logσ²而非直接回归σ²因为σ²必须为正值直接回归可能输出负值导致训练不稳定。logσ²取值范围是(-∞, ∞)通过exp得到正值σ²数值更稳定。KL散度的权重调节训练初期KL权重小让网络先学好各自的特征表示后期逐渐增大强制两个分布对齐。这种curriculum策略避免了KL散度过早主导训练导致的模式崩塌。三、PyTorch代码实现3.1 环境配置pipinstalltorch torchvision timm# Python 3.8, PyTorch 1.123.2 UAM模块importtorchimporttorch.nnasnnimporttorch.nn.functionalasFclassUncertaintyAlignmentModule(nn.Module): 不确定性对齐模块高斯分布隐式对齐 核心创新 1. 像素特征建模为高斯分布N(μ, σ²) 2. KL散度约束跨模态分布重叠 3. 精度加权融合σ²小的模态权重更大 def__init__(self,in_channels256,latent_dim128):super().__init__()# RGB高斯编码器self.vis_munn.Conv2d(in_channels,latent_dim,1)self.vis_logvarnn.Conv2d(in_channels,latent_dim,1)# IR高斯编码器self.ir_munn.Conv2d(in_channels,latent_dim,1)self.ir_logvarnn.Conv2d(in_channels,latent_dim,1)# 融合投影self.fuse_projnn.Conv2d(latent_dim,in_channels,1)defreparameterize(self,mu,logvar):重参数化技巧训练时ifself.training:stdtorch.exp(0.5*logvar)epstorch.randn_like(std)returnmueps*stdreturnmudefforward(self,F_vis,F_ir): Args: F_vis: (B, C, H, W) RGB特征 F_ir: (B, C, H, W) IR特征 # 高斯编码mu_visself.vis_mu(F_vis)logvar_visself.vis_logvar(F_vis)mu_irself.ir_mu(F_ir)logvar_irself.ir_logvar(F_ir)var_vistorch.exp(logvar_vis)var_irtorch.exp(logvar_ir)# 精度加权融合mu_fused(var_ir*mu_visvar_vis*mu_ir)/(var_visvar_ir1e-8)# 融合投影F_fusedself.fuse_proj(mu_fused)# 计算KL散度损失训练时kl_lossself._kl_divergence(mu_vis,var_vis,mu_ir,var_ir)# 推导置信度图C_vis1.0/(1.0var_vis.mean(dim1,keepdimTrue))C_ir1.0/(1.0var_ir.mean(dim1,keepdimTrue))returnF_fused,kl_loss,C_vis,C_irdef_kl_divergence(self,mu1,var1,mu2,var2):KL(N1 || N2)kltorch.log(var2/(var11e-8)1e-8)\(var1(mu1-mu2)**2)/(2*var21e-8)-0.5returnkl.mean()3.3 CGM模块classConfidenceGuidedModulation(nn.Module): 置信度引导全局调制不确定性驱动的自适应融合 核心创新 1. 从σ²推导置信度图C1/(1σ²) 2. 通道注意力空间注意力双重调制 3. 逐像素判断可靠性 def__init__(self,channels256,reduction16):super().__init__()# 通道注意力self.channel_attnnn.Sequential(nn.AdaptiveAvgPool2d(1),nn.Flatten(),nn.Linear(channels,channels//reduction),nn.ReLU(),nn.Linear(channels//reduction,channels),nn.Sigmoid())# 空间注意力基于置信度交集self.spatial_convnn.Sequential(nn.Conv2d(2,1,7,padding3),nn.Sigmoid())defforward(self,F_fused,C_vis,C_ir): Args: F_fused: UAM输出的融合特征 C_vis, C_ir: 两个模态的置信度图 B,C,H,WF_fused.shape# 通道注意力w_chself.channel_attn(F_fused).view(B,C,1,1)# 空间注意力置信度交集C_intersecttorch.cat([C_vis,C_ir],dim1)# (B, 2, H, W)w_spself.spatial_conv(C_intersect)# (B, 1, H, W)# 双重调制F_outw_ch*w_sp*F_fusedreturnF_out3.4 完整UMFNetclassUMFNet(nn.Module): 完整UMFNet不确定性感知RGB-T SODdef__init__(self,num_classes1):super().__init__()# 双流Swin-T编码器self.vis_encoderself._build_swin_t()self.ir_encoderself._build_swin_t()# 逐层UAMCGM融合self.uam_layersnn.ModuleList([UncertaintyAlignmentModule(256)for_inrange(4)])self.cgm_layersnn.ModuleList([ConfidenceGuidedModulation(256)for_inrange(4)])# 解码器self.decodernn.ModuleList([nn.Conv2d(256,128,3,padding1),nn.Conv2d(128,64,3,padding1),nn.Conv2d(64,num_classes,1)])defforward(self,rgb,ir):# 双流编码vis_featsself.vis_encoder(rgb)ir_featsself.ir_encoder(ir)total_kl0foriinrange(4):# UAM不确定性对齐F_fused,kl,C_vis,C_irself.uam_layers[i](vis_feats[i],ir_feats[i])total_klkl# CGM置信度调制F_fusedself.cgm_layers[i](F_fused,C_vis,C_ir)# 解码outF_fusedfordecinself.decoder:outF.interpolate(out,scale_factor2,modebilinear)outdec(out)returntorch.sigmoid(out),total_kldef_build_swin_t(self):importtorchvision.modelsasmodelsreturnmodels.swin_t(pretrainedTrue)四、YOLO迁移3 StepsStep 1在YOLO的FPN中插入UAM不确定性对齐classYOLO_UAM_FPN(nn.Module):def__init__(self,channels256):super().__init__()self.uamUncertaintyAlignmentModule(channels)defforward(self,rgb_feat,ir_feat):fused,kl,C_vis,C_irself.uam(rgb_feat,ir_feat)returnfused,kl,C_vis,C_irStep 2添加CGM置信度调制classYOLO_CGM(nn.Module):def__init__(self,channels256):super().__init__()self.cgmConfidenceGuidedModulation(channels)defforward(self,fused_feat,C_vis,C_ir):returnself.cgm(fused_feat,C_vis,C_ir)Step 3KL散度正则化训练# 总损失 检测损失 λ_kl × KL散度total_lossdet_loss0.01*kl_loss五、实验结果5.1 未对齐数据集SOTA方法UVT20K FβwUVT2000 Fβwun-VT5000 Fβwun-VT1000 FβwSACNet0.8410.8730.8140.880PCNet0.8710.911--TPS-SCL0.8600.900--UMFNet0.8900.9180.8820.925✅亮点UMFNet在所有未对齐基准上均取得最佳。un-VT5000提升最大8.3% vs SACNet说明不确定性建模在严重未对齐场景中价值最大。5.2 对齐数据集泛化方法VT1000 FβwVT5000 FβwPVT FβwCGFNet0.9300.9080.864MIDD0.9310.9120.852UMFNet0.9430.9240.878✅亮点在对齐数据集上UMFNet也取得最佳证明不确定性建模不是过拟合未对齐场景——它在对齐场景中同样有效因为对齐区域的σ²自然小置信度高。5.3 消融实验配置UVT20K Fβw提升Baseline直接拼接0.854-UAM0.8760.022UAMCGM0.8900.036✅亮点UAM贡献2.2%CGM在此基础上再贡献1.4%。去掉KL散度正则化后UAM效果下降说明KL约束对分布对齐至关重要。六、总结UMFNet的核心贡献和启发不确定性即对齐不配准像素位置而是配准特征分布。高斯分布的方差自然反映了跨模态一致性——一致性高的区域σ²小可以融合错位区域σ²大应该抑制。这种软对齐比显式几何配准更鲁棒、更高效。精度加权融合的物理直觉μ_fused (σ²_ir·μ_vis σ²_vis·μ_ir)/(σ²_visσ²_ir)——这是贝叶斯最优融合公式。不确定性小精度高的模态自动获得更大权重无需人工设计权重。对齐与未对齐的统一处理UMFNet在5个未对齐3个对齐基准上均取得SOTA。在对齐场景中两个分布天然一致σ²小UAM退化为简单的均值融合在未对齐场景中UAM自动识别不一致区域并抑制。这种自适应性是其泛化能力的核心。即插即用的模块化设计UAM和CGM可以插入任意编码器-解码器架构的融合层不改变训练流程。KL散度作为辅助损失权重可调不影响主任务优化。
返回列表