RDANet:抗混叠下采样与原型记忆如何稳住红外小目标的尺度和场景变化

RDANet:抗混叠下采样与原型记忆如何稳住红外小目标的尺度和场景变化

RDANet 用 MSAD 保护下采样中的目标结构,再用 PGSM 稳定 skip 特征的局部对比度,并在三套红外基准上拆解尺度与背景鲁棒性。

RDANet 把红外小目标的两种退化放到 encoder–decoder 的两个位置处理:MSAD 在每次 stride-2 分辨率转换前控制混叠并保留局部结构,PGSM 在 skip connection 上检索场景更稳定的 patch 原型。IRSTD-1k 上,完整模型的 IoU/Pd/Fa 为 73.82/93.60/7.67;去掉 MSAD 后 IoU 降到 69.32,去掉 PGSM 后降到 71.32。1

退化发生在两处

红外小目标通常只有少量像素,局部对比度又容易被杂波和成像噪声淹没。论文进一步观察到,模型的波动与两个变量有关:目标尺度离开训练数据的主分布后,目标形状在反复下采样中更容易变形;同一目标换到不同背景后,浅层 skip 特征会随背景纹理漂移。于是,单纯提高主干容量并不能直接回答两个问题:采样时怎样保住目标形状,解码时怎样保持目标—背景对比度。1
RDANet 保留简单的 encoder–decoder。编码器的每次 stride-2 操作替换成 MSAD,解码器接收 skip 特征前先经过 PGSM。前者作用于信息被压缩的时刻,后者作用于细节被送回解码器的时刻。
RDANet 在编码器中插入 MSAD,在 skip 路径中插入 PGSM
论文 Fig. 3 展示整体信息流:橙色 MSAD 负责下采样,绿色 PGSM 负责 skip refinement。1

MSAD:先滤波,再把局部像素折进通道

MSAD 的第一步是三条固定二项低通路径,核大小分别为 3、5、7。每条路径使用 depthwise convolution,得到 Y₃、Y₅、Y₇;通道注意力通过 softmax 预测每个通道的融合权重:
小核保留更细的目标证据,大核压制更宽范围的高频杂波。通道级权重让不同特征选择不同平滑范围,避免所有通道使用同一强度。
随后,PixelUnshuffle 把每个 2×2 邻域重排到通道维,特征尺寸从 C×H×W 变为 4C×H/2×W/2。固定权重为 1/4 的分组卷积把四个折叠子通道平均回 C 个通道,再接 3×3 depthwise 和 1×1 pointwise 卷积做局部细化。输入经过 AvgPool 的残差分支与主分支相加,最后由 SE 块重新标定通道。
这条链有清晰的先后关系:低通先控制采样前的混叠,PixelUnshuffle 再减少直接抽样造成的局部信息丢失,残差维持特征分布,SE 压低残余背景激活。它把“滤掉不稳定频率”和“保留局部结构”放在同一个下采样单元里。
下采样替代实验支持这条解释。Pooling 的 IoU/Pd/Fa 为 66.93/91.56/20.14,stride convolution 为 67.10/91.58/23.22,SPDConv 为 67.87/92.25/15.63;MSAD 为 69.32/92.59/12.56。SPDConv 的 FLOPs 为 29.41G,MSAD 为 24.58G。1
三种核也不能简单理解成“核越多越好”。在 IRSTD-1k 上,K={3,5,7} 的自适应融合为 73.82 IoU、93.60 Pd、7.67 Fa;同样三种核使用固定平均时为 72.47/91.58/11.10。不同平滑范围之间的选择,才是组合产生收益的原因。1

PGSM:从共享记忆库取回稳定的局部参照

skip 特征保留空间细节,也会携带当前场景的背景纹理。PGSM 先用 1×1 卷积降低通道,再把特征展开成 patch token。每个 token 与全局可学习记忆库中的 patch 原型进行匹配。
匹配在频域完成:token 重塑为 C'×P×P,经过 Hann 窗和二维 FFT,取低频裁剪后的 log 幅度谱,再计算余弦相似度。幅度谱对小范围位移更稳定,适合寻找结构相近的局部 patch。模块检索 Top-K 原型,再用相位相关估计亚像素位移,双线性 warp 完成对齐,最后按注意力权重聚合:
聚合后的 patch 折回空间域,与原始 skip 特征拼接,经 1×1 卷积、BatchNorm 和 ReLU 融合。原 skip 仍然提供目标细节,记忆原型提供对背景变化更稳定的结构参照。
Fig. 3 上方展示 PGSM 从 patch token 到频域匹配、相位对齐和 skip 融合的流程;架构图在正文只承担信息流解释,定性结果另见论文 Fig. 4。1
PGSM 的收益来自“检索 + 对齐”的组合。直接 skip 的 IoU/Pd/Fa 为 71.32/92.86/11.26;空间 prototype memory 为 70.64/93.27/24.50;频率检索但去掉 shift 对齐为 72.60/92.93/11.86;完整 PGSM 为 73.82/93.60/7.67。单独增加 memory 并不够,频域结构匹配和相位位移补偿共同减少了背景漂移与边界错位。1
RDANet 与多种方法在红外杂波场景中的检测结果
论文 Fig. 4 用红框表示正确检测、蓝框表示漏检、黄框表示虚警;右侧 RDANet 在部分纹理背景中保留了更完整的目标形状。定性图不能替代表格指标。1

两条路径的独立收益

变体IoUPdFaParamsFLOPs
完整 RDANet73.8293.607.674.17M25.24G 1
去掉 PGSM71.3292.8611.264.13M25.12G 1
去掉 MSAD69.3292.5912.564.10M24.58G 1
两者都去掉66.9391.5620.144.07M24.46G 1
去掉 MSAD 的损失更大,说明采样阶段对结构保留承担了更重的责任;去掉 PGSM 后 Fa 从 7.67 升到 11.26,说明 skip 路径的稳定局部对比度更直接关系到虚警控制。两者串联后,编码器保留下来的结构才更容易被解码器稳定利用。

尺度与背景分组给出的证据

IRSTD-1k 按目标 mask 面积分成六个区间 [1,15][16,31][32,63][64,127][128,255][256,∞)。RDANet 各区间 IoU 为 56.05、66.76、66.08、75.78、80.04、84.91,SB-IoU 为 71.60,平均排名为 1.67。它在不同尺度上都保持在可比较水平,收益落在分组稳定性而非单个尺寸区间。1
背景复杂度由环形邻域的灰度方差与梯度均值计算,再按分位点分成低、中、高三组。RDANet 三组 IoU 为 75.92、74.27、71.96,均值 73.82,BG-Gap 为 3.97。对比 MSHNet 的 70.87、69.79、64.44 和 6.43 gap,RDANet 的响应随背景复杂度变化更小。1
三套基准的总体结果为:IRSTD-1k 的 IoU/Pd/Fa 为 73.82/93.60/7.67,NUDT-SIRST 为 95.43/99.47/2.90,NUAA-SIRST 为 79.33/100.00/1.91。NUAA-SIRST 上 IoU 略低于 MSDANet,但 Pd 达到 100%,Fa 最低。1

复现与边界

论文使用单张 RTX 3090、AdamW、初始学习率 1×10⁻³、batch size 4、1,000 epochs 和 cosine annealing,全部图像调整为 512×512。官方仓库已标注论文被 IEEE TGRS 接收,提供 IRSTD-1kNUDT-SIRSTNUAA-SIRST 的目录规范、训练测试命令和预训练权重入口;仓库页面显示 2026 年 8 月 20 日有两次提交,暂无 Release。12
研究者复现时可以先做三步:固定 baseline,只替换下采样并复现 Table IV;固定 MSAD,比较直接 skip、频率检索和完整 PGSM;最后再做六个尺度区间与三组背景复杂度。这样得到的判断比直接引用 73.82% 更具体:MSAD 负责跨分辨率保结构,PGSM 负责跨场景稳对比度。论文的跨数据集转移表提供了额外线索,真实传感器和视频时序场景仍需单独验证。

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel