
RDANet:抗混叠下采样与原型记忆如何稳住红外小目标的尺度和场景变化
RDANet 用 MSAD 保护下采样中的目标结构,再用 PGSM 稳定 skip 特征的局部对比度,并在三套红外基准上拆解尺度与背景鲁棒性。
RDANet 把红外小目标的两种退化放到 encoder–decoder 的两个位置处理:MSAD 在每次 stride-2 分辨率转换前控制混叠并保留局部结构,PGSM 在 skip connection 上检索场景更稳定的 patch 原型。IRSTD-1k 上,完整模型的 IoU/Pd/Fa 为 73.82/93.60/7.67;去掉 MSAD 后 IoU 降到 69.32,去掉 PGSM 后降到 71.32。1
退化发生在两处
红外小目标通常只有少量像素,局部对比度又容易被杂波和成像噪声淹没。论文进一步观察到,模型的波动与两个变量有关:目标尺度离开训练数据的主分布后,目标形状在反复下采样中更容易变形;同一目标换到不同背景后,浅层 skip 特征会随背景纹理漂移。于是,单纯提高主干容量并不能直接回答两个问题:采样时怎样保住目标形状,解码时怎样保持目标—背景对比度。1
RDANet 保留简单的 encoder–decoder。编码器的每次 stride-2 操作替换成 MSAD,解码器接收 skip 特征前先经过 PGSM。前者作用于信息被压缩的时刻,后者作用于细节被送回解码器的时刻。

MSAD:先滤波,再把局部像素折进通道
MSAD 的第一步是三条固定二项低通路径,核大小分别为 3、5、7。每条路径使用 depthwise convolution,得到
Y₃、Y₅、Y₇;通道注意力通过 softmax 预测每个通道的融合权重:小核保留更细的目标证据,大核压制更宽范围的高频杂波。通道级权重让不同特征选择不同平滑范围,避免所有通道使用同一强度。
随后,PixelUnshuffle 把每个
2×2 邻域重排到通道维,特征尺寸从 C×H×W 变为 4C×H/2×W/2。固定权重为 1/4 的分组卷积把四个折叠子通道平均回 C 个通道,再接 3×3 depthwise 和 1×1 pointwise 卷积做局部细化。输入经过 AvgPool 的残差分支与主分支相加,最后由 SE 块重新标定通道。这条链有清晰的先后关系:低通先控制采样前的混叠,PixelUnshuffle 再减少直接抽样造成的局部信息丢失,残差维持特征分布,SE 压低残余背景激活。它把“滤掉不稳定频率”和“保留局部结构”放在同一个下采样单元里。
下采样替代实验支持这条解释。Pooling 的 IoU/Pd/Fa 为 66.93/91.56/20.14,stride convolution 为 67.10/91.58/23.22,SPDConv 为 67.87/92.25/15.63;MSAD 为 69.32/92.59/12.56。SPDConv 的 FLOPs 为 29.41G,MSAD 为 24.58G。1
三种核也不能简单理解成“核越多越好”。在 IRSTD-1k 上,
K={3,5,7} 的自适应融合为 73.82 IoU、93.60 Pd、7.67 Fa;同样三种核使用固定平均时为 72.47/91.58/11.10。不同平滑范围之间的选择,才是组合产生收益的原因。1PGSM:从共享记忆库取回稳定的局部参照
skip 特征保留空间细节,也会携带当前场景的背景纹理。PGSM 先用
1×1 卷积降低通道,再把特征展开成 patch token。每个 token 与全局可学习记忆库中的 patch 原型进行匹配。匹配在频域完成:token 重塑为
C'×P×P,经过 Hann 窗和二维 FFT,取低频裁剪后的 log 幅度谱,再计算余弦相似度。幅度谱对小范围位移更稳定,适合寻找结构相近的局部 patch。模块检索 Top-K 原型,再用相位相关估计亚像素位移,双线性 warp 完成对齐,最后按注意力权重聚合:聚合后的 patch 折回空间域,与原始 skip 特征拼接,经
1×1 卷积、BatchNorm 和 ReLU 融合。原 skip 仍然提供目标细节,记忆原型提供对背景变化更稳定的结构参照。Fig. 3 上方展示 PGSM 从 patch token 到频域匹配、相位对齐和 skip 融合的流程;架构图在正文只承担信息流解释,定性结果另见论文 Fig. 4。1
PGSM 的收益来自“检索 + 对齐”的组合。直接 skip 的 IoU/Pd/Fa 为 71.32/92.86/11.26;空间 prototype memory 为 70.64/93.27/24.50;频率检索但去掉 shift 对齐为 72.60/92.93/11.86;完整 PGSM 为 73.82/93.60/7.67。单独增加 memory 并不够,频域结构匹配和相位位移补偿共同减少了背景漂移与边界错位。1

两条路径的独立收益
| 变体 | IoU | Pd | Fa | Params | FLOPs |
|---|---|---|---|---|---|
| 完整 RDANet | 73.82 | 93.60 | 7.67 | 4.17M | 25.24G 1 |
| 去掉 PGSM | 71.32 | 92.86 | 11.26 | 4.13M | 25.12G 1 |
| 去掉 MSAD | 69.32 | 92.59 | 12.56 | 4.10M | 24.58G 1 |
| 两者都去掉 | 66.93 | 91.56 | 20.14 | 4.07M | 24.46G 1 |
去掉 MSAD 的损失更大,说明采样阶段对结构保留承担了更重的责任;去掉 PGSM 后 Fa 从 7.67 升到 11.26,说明 skip 路径的稳定局部对比度更直接关系到虚警控制。两者串联后,编码器保留下来的结构才更容易被解码器稳定利用。
尺度与背景分组给出的证据
IRSTD-1k 按目标 mask 面积分成六个区间
[1,15]、[16,31]、[32,63]、[64,127]、[128,255] 和 [256,∞)。RDANet 各区间 IoU 为 56.05、66.76、66.08、75.78、80.04、84.91,SB-IoU 为 71.60,平均排名为 1.67。它在不同尺度上都保持在可比较水平,收益落在分组稳定性而非单个尺寸区间。1背景复杂度由环形邻域的灰度方差与梯度均值计算,再按分位点分成低、中、高三组。RDANet 三组 IoU 为 75.92、74.27、71.96,均值 73.82,BG-Gap 为 3.97。对比 MSHNet 的 70.87、69.79、64.44 和 6.43 gap,RDANet 的响应随背景复杂度变化更小。1
三套基准的总体结果为:IRSTD-1k 的 IoU/Pd/Fa 为 73.82/93.60/7.67,NUDT-SIRST 为 95.43/99.47/2.90,NUAA-SIRST 为 79.33/100.00/1.91。NUAA-SIRST 上 IoU 略低于 MSDANet,但 Pd 达到 100%,Fa 最低。1
复现与边界
论文使用单张 RTX 3090、AdamW、初始学习率
1×10⁻³、batch size 4、1,000 epochs 和 cosine annealing,全部图像调整为 512×512。官方仓库已标注论文被 IEEE TGRS 接收,提供 IRSTD-1k、NUDT-SIRST、NUAA-SIRST 的目录规范、训练测试命令和预训练权重入口;仓库页面显示 2026 年 8 月 20 日有两次提交,暂无 Release。12研究者复现时可以先做三步:固定 baseline,只替换下采样并复现 Table IV;固定 MSAD,比较直接 skip、频率检索和完整 PGSM;最后再做六个尺度区间与三组背景复杂度。这样得到的判断比直接引用 73.82% 更具体:MSAD 负责跨分辨率保结构,PGSM 负责跨场景稳对比度。论文的跨数据集转移表提供了额外线索,真实传感器和视频时序场景仍需单独验证。
References
- 1RDANet arXiv HTML 全文
arxiv.org
- 2RDANet 官方 GitHub 仓库
github.com
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
