ECFNet 解读:ECCV 2026 如何用粗到细框架减少高分辨率红外检测冗余

ECFNet 解读:ECCV 2026 如何用粗到细框架减少高分辨率红外检测冗余

ECCV 2026 论文 ECFNet 先用 RBCN 筛出含目标候选区域,再用 DAT 去噪训练和 APKD 注意力蒸馏提升精检效果,在 UAV、Car、IRSTD-1k 三个真实红外数据集上同时报告目标级和像素级优势。

它不是再堆一个更大的检测器,而是先把背景算力砍掉

ECFNet 的出发点是高分辨率红外图像里的一个实际问题:小目标只占极少区域,但单阶段检测器会在整张图上做密集预测,很多计算花在没有目标的背景上。论文把这个问题拆成两步:先粗略识别哪些区域可能包含目标,再只对这些区域做精细定位。1
这篇论文题为 Denoising-Enhanced Coarse-to-Fine Infrared Small Target Detection with Attention Prior-Guided Knowledge Distillation,arXiv 页面显示初版提交于 2026 年 6 月 20 日,v2 修订于 2026 年 6 月 27 日,并标注 Accepted by ECCV 2026。作者为 Houzhang Fang、Ruixuan Huang、Qiuhuan Chen、Xiaolin Wang、Yi Chang、Luxin Yan,机构包括西安电子科技大学和华中科技大学,通讯作者为 Ruixuan Huang。1
这篇文章的关键不在「粗到细」四个字本身。更值得看的是它怎么让粗阶段不只是裁 patch,而是学会保留目标上下文;又怎么让细阶段的轻量模型继承强教师的目标注意力。

粗阶段:RBCN 先做网格级二分类

ECFNet 的第一阶段叫 Region Binary Classification Network,简称 RBCN。它不直接输出像素级 mask,而是把输入图像划成 N×N 的非重叠网格,并预测每个网格是否包含目标。论文设置阈值 0.5,高于阈值的网格进入后续候选区域。粗阶段损失由 BCE 和 IoU loss 组成。2
这个设计的直觉很清楚:如果一张高分辨率红外图像里只有很少几个疑似目标区域,先做网格级筛选可以避免在大面积背景上重复计算。代价是粗阶段必须有足够高的召回率,否则后面再强的精检测器也救不回来。
为了解决「网格切碎目标」的问题,ECFNet 又引入 ExpSlicer。它从 RBCN 输出的多尺度金字塔区域特征图里聚合候选 patch,尽量保证目标被完整包含,同时保留周围上下文。这里的上下文很重要:红外小目标本身弱,离开周边背景后,很容易和噪声点、鸟、云边等干扰混在一起。

DAT:让粗阶段见过「像目标的假噪声」

RBCN 的难点是背景里有很多目标状干扰。ECFNet 的 DAT,也就是 Denoising-Assisted Training,专门处理这个问题。
DAT 用二维高斯函数合成 target-like noise,把噪声和 GT mask 加到 RBCN feature space 里,再让辅助分支重建原始 GT mask。损失同样由 BCE 和 IoU loss 组成,且在 3 个尺度上计算。论文的说法是,这会迫使网络利用目标周围上下文,而不是只盯着孤立亮点。2
这个模块是 ECFNet 的主要收益来源。主消融表显示,自建 baseline 的 P/R/AP50 为 88.23/87.32/87.26;只加 APKD 时变为 89.17/89.56/89.30,AP50 增加 2.10;只加 DAT 时变为 93.45/90.32/92.71,AP50 增加 5.45;DAT 和 APKD 同时加入后达到 95.96/91.63/95.87,AP50 总增益 8.61。2
这组数值说明,ECFNet 的胜负手在粗阶段。APKD 很有用,但如果 RBCN 给出的候选区域质量不够,后面的蒸馏很难弥补。

细阶段:轻量检测器加上注意力先验蒸馏

在 fine stage,ECFNet 对粗阶段切出的局部区域做目标级或像素级检测。论文说它定制了轻量检测器,用 channel-adaptive scaling 和更少的 detection heads 来平衡精度与效率,并采用 YOLOv12 作为教师模型。2
APKD 的思路是把教师模型的空间注意力传给学生。普通注意力蒸馏常把特征图展平成 1D tokens,容易丢掉红外小目标的空间局部性;APKD 直接在多维空间特征上做 teacher-student cross-attention。学生特征作为 query,教师特征作为 key,得到的注意力权重再调制学生特征,使轻量 detector 更关注教师认为关键的目标区域。2
论文还报告,不同教师模型复杂度相差可达 7 倍时,APKD 仍能带来超过 2.15 的 AP50 提升;在蒸馏策略对比中,APKD 的 AP50 最多领先第二名 4.72,R 最多领先 1.31。2

实验:三数据集同时看目标级和像素级

实验在 UAV、Car、IRSTD-1k 三个真实红外小目标数据集上做。UAV 和 Car 是作者自建数据集,分别包含 98,420 和 18,230 张 640×512 红外图像,按 7:2:1 划分训练、验证、测试集。目标级指标为 P、R、AP50;像素级指标为 Pd、Fa、nIoU;效率指标为 FLOPs、Params、FPS,FPS 在 batch size 1 下统计。2
目标级主表里,ECFNet 在三套数据上都排第一:
方法UAV P/R/AP50Car P/R/AP50IRSTD-1k P/R/AP50FLOPs / Params / FPS
ESOD-L86.28 / 83.05 / 85.6394.75 / 91.73 / 93.3278.59 / 76.37 / 78.3338.1 / 72.8 / 86
YOLOv12-L95.92 / 87.91 / 93.1296.09 / 82.87 / 91.9487.26 / 72.78 / 81.6188.9 / 26.4 / 76
D-FINE-L95.27 / 91.32 / 93.1894.38 / 91.63 / 93.6885.67 / 81.56 / 83.5390.7 / 30.6 / 40
ECFNet95.96 / 91.63 / 95.8796.55 / 92.16 / 96.0690.18 / 84.71 / 89.2331.7 / 22.7 / 90
像素级结果也比较强。ECFNet 在 UAV 上达到 Pd 83.56、Fa 11.69、nIoU 56.11;在 Car 上达到 85.45、10.52、58.21;在 IRSTD-1k 上达到 94.91、9.94、69.67。对应效率为 34.3 GFLOPs、24.1M 参数、85 FPS。2
这里有个值得注意的细节:ECFNet 的目标级计算量比 D-FINE-L、DINO、QueryDet 低很多,FPS 也更高;但它并不是参数量最小的模型。它的优势来自先筛区域再局部精检,而不是单纯把网络做小。

网格大小:20×20 是这篇论文选出的折中点

RBCN 的网格分辨率不是越细越好。消融显示,10×10 网格的 CRP/CRR/AP50 为 93.42/95.57/93.84,20×20 达到 94.13/95.69/95.70,40×40 则降到 82.64/79.43/81.62。2
这组结果很好理解。10×10 patch 更大,能保留上下文,但会把更多背景杂波带进 fine detector;40×40 patch 更细,目标周边上下文不够,预测复杂度也上升。20×20 对 640×512 输入约等于每个网格覆盖一个较合适的局部区域,因此在召回、精度和计算之间更平衡。
DAT 的细消融也支持这个判断。没有 DAT 时 CRP/CRR 为 89.38/93.45;只加 feature map loss 是 92.80/94.35;直接拼 GT mask 是 92.62/94.11;加入噪声后的 DAT 达到 94.13/95.69。也就是说,DAT 的有效点不只是「多一个辅助 loss」,而是让粗阶段见过目标状干扰,并学会从上下文里排除它。2

复现价值与缺口

ECFNet 对红外弱小目标方向有两个明确价值。
第一,它把「先粗后细」做成了可量化的候选区域学习问题。CRP 和 CRR 分别衡量粗阶段候选区域的精确度与召回覆盖,阈值设置为 0.9。对研究者来说,这比只看最终 AP 更容易定位错误来自粗筛还是精检。2
第二,它证明粗阶段上下文建模会直接影响最终 AP50。DAT 单独带来的 AP50 增益高于 APKD,说明高分辨率 IRSTD 里,候选区域质量可能比精检测器本身更先决定上限。
当前缺口也要说清楚:本轮没有找到 ECFNet 的官方公开代码仓库,arXiv 摘要页也没有附代码链接。论文使用的 UAV 和 Car 数据集为作者自建,虽然给出规模和划分比例,但正文说明更多数据源、目标尺度分布、背景特征在补充材料中。对外部复现者来说,最快的验证路径不是完整复刻 ECFNet,而是先复现 RBCN + DAT 的粗阶段,看 20×20 网格下 CRP/CRR 是否能接近论文报告的 94.13/95.69。

Related content

  • Sign in to comment.
More from this channel