DHiF 解读:把红外小目标检测的虚警问题改写成高频分量判别

DHiF 解读:把红外小目标检测的虚警问题改写成高频分量判别

TCSVT 2026 论文 DHiF 把红外小目标和背景杂波都视为高频成分,提出动态高频卷积,在局部窗口内生成区域特定滤波器,用更细粒度的高频判别降低虚警并增强多种 SIRST 网络。

先把问题换一种说法:虚警也是高频分量

DHiF 这篇 TCSVT 2026 论文的切入点很直接:红外小目标是局部显著的高频成分,亮角、断云、建筑边缘和碎片化杂波同样也是高频成分。小目标检测的难点不只是「把高频增强出来」,而是把目标型高频和背景型高频分开。论文把这种区分称为对不同高频成分的判别性表示学习。1
作者 Ruojing Li、Chao Xiao、Qian Yin、Wei An、Nuo Chen、Xinyi Ying、Miao Li、Yingqian Wang 来自国防科技大学电子科学学院,通讯作者为 Wei An 和 Miao Li。arXiv 页面显示该文初版提交于 2026 年 2 月 3 日,v2 修订于 2026 年 6 月 29 日,并给出期刊信息:IEEE Transactions on Circuits and Systems for Video Technology, vol. 36, no. 6, pp. 7676-7680, 2026。1
这篇文章和上一期 NS-FPN 的问题意识有交集,都是在处理红外小目标里的虚警。但 DHiF 的位置更底层:它不是另做一套检测网络,而是把标准卷积替换成一个动态高频卷积算子,插进现有 SIRST 网络的 encoder 里。

方法核心:让卷积先生成一组局部高频滤波器

DHiF 的主模块可以拆成两段。第一段是动态滤波器生成器,第二段是标准卷积整合。
对一个滑动窗口内的局部输入特征,DHiF 先做 normalization 和 flattening,再通过线性投影得到一组向量,并用 tanh 把滤波器参数约束到 [-1, 1]。论文给出的动机来自傅里叶变换的微分性质和线性性质:要增强高频响应,滤波器应包含类似空间微分的正负变化;要减少低频直流响应,滤波器参数不应退化成常量核,最好围绕 0 对称。2
随后,这组区域特定的滤波器作用在原始局部特征上,生成 filtered features。DHiF 并不把原始信息丢掉,而是把 filtered features 与原始局部输入相加,再交给标准卷积输出中心特征。这个设计有两个好处:
  • 滤波器是局部生成的,同一张图里目标点、亮角、云边缘可以得到不同的滤波响应。
  • 标准卷积仍然保留在最后,因此 DHiF 更像「卷积前的高频判别增强」,不是彻底替换网络骨架。
论文还把 DHiF 封装成 DHiF-Res block,用来替换 encoder 隐层里的残差块。这里的「即插即用」并不等于随便插,后面的消融恰好说明了插入位置很关键。

为什么它不是普通高频卷积

对比 CDC、WTConv、PConv 这些已有卷积变体,DHiF 的不同点在于它不只强调高频,也强调「不同高频的区别」。
CDC 关注中心差分,WTConv 利用小波扩展感受野,PConv 适配小目标像素分布。它们都有明确先验,但先验本身相对固定。DHiF 则把局部输入特征变成滤波器参数,让每个局部区域生成自己的滤波器组。换句话说,它不是拿一个固定高频算子扫全图,而是在每个窗口内临时生成一把小刀,再判断这里该切目标还是切杂波。
论文用 attribution 可视化先证明了一件事:DNANet、ILNet、SCTransNet 等网络做目标预测时,目标附近和背景纹理区域都会影响输出。这说明红外小目标网络已经在利用高频区域,只是没有显式区分目标高频和背景高频。DHiF 的设计正是把这件事从隐式拟合改成显式建模。2

实验:强项是跨网络泛化,不是单点刷榜

实验使用 IRSTD-1k 和 NUAA-SIRST 两个真实场景数据集,指标包括 IoU、nIoU、Pd、Fa、FPS 和参数量。论文说明 IoU、nIoU、Pd 以 10^-2 为单位,Fa 以 10^-5 为单位。2
主表把 DHiF、CDC、WTConv、PConv 分别替换到 7 个 SIRST 网络 encoder 中,覆盖 FC3Net、DNANet、ISNet、MSHNet、MTU-Net、SCTransNet、APTNet。几个代表性结果能看出它的优势和边界:
基础网络数据集标准卷积DHiF读法
DNANetIRSTD-1k IoU / nIoU63.27 / 63.5669.42 / 65.68DHiF 在 DNANet 上提升明显
DNANetNUAA-SIRST IoU / Fa71.97 / 6.3177.68 / 1.53IoU 提升,同时虚警率下降
ISNetNUAA-SIRST IoU / nIoU71.10 / 72.8872.57 / 75.27分割质量提升,但 Pd 从 95.04 降到 93.13
MSHNetNUAA-SIRST IoU / Fa76.98 / 1.9777.07 / 1.08IoU 小幅提升,虚警率下降
SCTransNetNUAA-SIRST IoU / nIoU77.97 / 79.3978.83 / 79.40CNN-Transformer 混合网络也能受益
这组结果不该读成「DHiF 在所有指标上碾压」。例如 ISNet 在 NUAA-SIRST 上的 Pd 下降,MSHNet 在 NUAA-SIRST 上的 nIoU 从 77.04 降到 76.13。更稳妥的结论是:DHiF 在多数网络上提高 IoU 或降低 Fa,尤其在 DNANet、ISNet 等 CNN 网络中收益更清楚;但它仍然是一个算子级模块,效果受基础网络结构和插入位置影响。

消融:不要把 DHiF 放在输入层

最有价值的消融来自 DNANet 在 NUAA-SIRST 上的不同层替换实验。原始 DNANet 是 IoU 71.97、nIoU 78.66、Pd 95.04、Fa 6.31、FPS 8.53、参数 18346K。把 DHiF-Res 放到第二层时,IoU 达到 78.37,nIoU 79.29,Pd 96.18,Fa 降到 3.32,FPS 为 8.05,参数 18352K。第三层替换时,IoU 为 77.02,Fa 降到 2.57,FPS 8.42。2
输入层替换反而不稳:第一层替换后 IoU 是 72.95,nIoU 77.77,Pd 94.66。论文解释是,直接在原始红外图像上使用自适应局部滤波器可能破坏输入分布,影响后续特征提取。这个结论对复现很有用:DHiF 适合放在 encoder 隐层,尤其是第二到第五层,而不是在最前面粗暴替换第一层卷积。
论文还给出可视化解释:没有 DHiF 的 DNANet 会对目标、建筑边缘、亮杂波都产生较一致的正响应;加入 DHiF 后,亮杂波区域大部分像素转为强负响应,只有靠边的窄区域保留正激活。这说明它确实在学习不同 HFC 的差异,而不只是把高频整体放大。2

对研究者的启发

DHiF 的价值不在于提出一个新的全网架构,而在于把红外小目标检测的一个老问题重新落到算子层:背景杂波和目标都在高频里,网络需要学习「同频不同义」。
这给后续工作留下三个方向。
第一,DHiF 可以作为现有 SIRST 网络的替换模块,用来做小规模复现实验。论文公开了 GitHub 仓库,当前仓库包含 model、train.py、test.py、evaluate.py、metrics.py 等文件,但 README 只有标题级说明,复现仍需要读代码和论文细节。3
第二,它适合和虚警抑制类方法组合。NS-FPN 从频域噪声抑制角度处理虚警,DHiF 从局部动态滤波角度处理高频判别,两者不是同一层面的替代关系。
第三,DHiF 的局限也清楚:它目前主要验证在 SIRST 分割式检测网络上,数据集集中在 IRSTD-1k 和 NUAA-SIRST;对于多帧运动小目标、遥感大幅面 tiny object detection、通用检测框架中的小目标,还不能直接外推。最值得复现实验的是把 DHiF 插入自己已有 baseline 的 encoder 隐层,观察 Fa 和 nIoU 是否同步改善。

Related content

  • Sign in to comment.
More from this channel