昊梵体育网

WACV 2025 即插即用 | 特征高效提取D2Net [一]模块介绍:D2N

WACV 2025 即插即用 | 特征高效提取D2Net
[一]模块介绍:D2Net架构(图2)以及各模块组件(图3):特征提取模块为U型结构基本块,其中包含两个核心模块FGFE和MLFE。跳连融合模块为AFMM。
[二]核心创新点:
[心]FGFE:将特征拆分为小补丁后进行 FFT,大幅降低频域变换的计算成本,同时保证全局依赖捕捉能力,比全特征频域变换更高效。用频域元素乘法替代传统自注意力的时域矩阵乘法,计算复杂度从 O (N²) 降至 O (NlogN),适配高分辨率特征。
[心]MLFE:4 个分支并行处理,分别捕捉恒等特征、方形局部、水平长距离局部、垂直长距离局部依赖,多尺度覆盖更全面。结合方形核与长条核,既捕捉常规局部细节,又适配细长目标(如文字、血管)的局部依赖,比单一核尺寸更灵活。深度卷积进一步降低计算成本,比普通多分支卷积更高效。
[心]AFMM:像素级自适应权重,基于双输入特征动态生成像素级融合权重,而非固定比例,更能适配局部区域的特征互补需求。双输入先经卷积 + 激活增强,再生成权重,提升权重生成的准确性,避免原始特征噪声干扰。仅通过 3 个 1×1 卷积实现融合,计算成本低,适配高分辨率特征融合。
[三]提出动机:高速率下采样会导致显著的信息丢失,而基于补丁的方法不可避免地会引入边界伪影。在本文中,我们提出了一种新的设计范式来解决UHD图像恢复问题,称为D2Net。D2Net能够对UHD图像进行直接全分辨率推断,而不需要高速率下采样或将图像划分为几个补丁。具体来说,我们巧妙地利用频域的特征来建立特征的长期依赖关系。考虑到UHD图像中更丰富的局部模式,我们还设计了一个多尺度卷积组来捕获局部特征。此外,在解码过程中,我们从编码阶段动态合并特征以减少不相关信息的流动。基于补丁的方法在后续拼接过程中引入边界伪影,而基于下采样的方法会导致显著的信息丢失,这两者都会影响图像增强的质量(图4)。
[四]模块适用范围:适用于通用视觉领域,特别是全局-局部-频域兼顾的视觉任务。
[五]模块缝合位置:FGFE替代传统ViT自注意力;MLFE替代传统CNN块;AFMM替换传统的特征融合块。
[六]模块效果:消融实验说明了三个核心模块的有效性(图56)。
[七]模块代码:图7,代码获取见评论区置顶👇,详细注释。

计算机视觉 科研 注意力机制 提供思路和创新点 深度学习 创新点实现 Transformer 即插即用模块 人工智能