Gaze-DETR 解读:用优先级图把红外弱小无人机的「先看哪里」显式建模

Gaze-DETR 解读:用优先级图把红外弱小无人机的「先看哪里」显式建模

arXiv 论文 Gaze-DETR 在 DINO-DETR 前加入空间 priority map,并用 RPFM 与 PAQI 连接特征调制和 query 初始化;实验显示收益主要来自精度与 F1 提升,低成本 box-derived 监督已能获得大部分效果。

Gaze-DETR 的核心改变:把「定位前看哪里」单独建模

Gaze-DETR 针对红外弱小无人机检测补上了 DETR 类方法里一个容易被忽略的环节:边界框告诉模型目标最终在哪里,却没有明确告诉模型,在完成定位之前应该优先检查哪些候选区域。论文让网络先预测一张空间 priority map,再用这张图同时调制多尺度特征和初始化 decoder query。这个设计带来的收益主要表现为更高的精度和 F1,而不是单纯提高召回率;代价是推理速度从 25.80 FPS 降到约 21 FPS。12
论文题目为「Gaze-DETR: Top-Down Guidance Through Priority Maps for Infrared Weak-Small UAV Detection with DETR」,提交于 2026 年 7 月 21 日,是一篇 arXiv 预印本。作者包括 Nian Liu、Yuxin Yang、Shubo Lin、Sikui Zhang、Liang Li、Boyu Cai、Yizheng Wang、Weiming Hu 和 Jin Gao;通讯作者为 Jin Gao,来自中国科学院自动化研究所多模态人工智能系统国家重点实验室。12

边界框监督缺少哪一步

远距离 UAV 在热红外图像里往往只剩很少像素,低对比度、杂波、遮挡和目标暂时消失会让真正的目标响应弱于背景中的亮斑。现有 DETR 检测器仍然主要靠分类和框回归损失学习候选选择:训练信号直接约束最终框,但候选区域之间的相对优先级只能从最终损失中间接形成。Gaze-DETR 的问题设定很具体:能不能增加一个密集的空间信号,让模型在「定位」之前先知道哪里更值得搜索?2
这里的 priority map 不是目标存在概率图。它被归一化到 64×64 网格,整张图的数值和为 1;某个位置数值更大,只表示它在当前搜索任务中的相对优先级更高。这样一来,图像中的强杂波可以很显眼,却不一定拥有高 priority;一个低对比度 UAV 也可以因为与搜索任务相关而得到更高权重。2

一张图如何穿过三个环节

Gaze-DETR 建在 DINO-DETR 上,保留原有的多尺度 backbone、encoder、decoder、去噪训练和匈牙利匹配。新增部分可以按「预测、调制、注入」理解。
  1. Priority head 预测空间分布。 最高分辨率的投影特征先经过 3×3 卷积、GroupNorm、ReLU 和 1×1 卷积,输出 priority logits,再双线性缩放到 64×64,最后用 spatial softmax 得到归一化 priority map。训练时,priority loss 由 KL divergence 和 histogram-intersection similarity 组成,分别约束分布差异和两张图共享的概率质量。2
  2. RPFM 调制多尺度特征。 Residual Priority-Guided Feature Modulation 会把 priority map 缩放到每个特征层,与特征逐点相乘后以残差形式加回原特征。调制系数从 0 初始化,因此训练开始时等价于原始 DINO 特征;训练过程中模型再逐渐学会让高优先级区域产生更强的特征变化。它不做硬掩码,不会直接丢掉低优先级位置的上下文。2
  3. PAQI 改变 query 初始化。 Priority-Guided Anchor Query Injection 从 priority map 中挑选空间上分离的峰值,再结合弱小目标尺寸先验生成额外 anchor queries。主配置保留原有 900 个 DINO query,最多增加 6 个 priority-guided query;PAQI 在 4 个 epoch 的 warm-up 后启用,并用两个空间峰值和三个训练集尺寸先验构造候选。2
因此,priority supervision 并非只是在总损失里多加一项。priority loss 先训练出空间表示,RPFM 把它送进 feature processing,PAQI 再把它送进 decoder 的候选初始化。三者对应的是同一信号在不同阶段的使用方式。

三种监督来源,回答的是不同的标注预算问题

Gaze-DETR 的网络结构不随监督来源改变,改变的只是训练用的 priority-supervision map。
  • Box-derived Gaussian:直接从训练框中心生成大小自适应的各向异性 Gaussian,不需要眼动标注,是最低成本方案。
  • Real gaze:把任务驱动眼动得到的 fixation-density map 变换、缩放并归一化,用来描述人搜索弱小 UAV 时把注意力分配到哪里。它不替代边界框,边界框仍负责最终定位。
  • Transferred pseudo-gaze:TIR-UAV120-Gaze 同时有框和 gaze,论文先按目标尺寸统计 gaze 相对框中心的偏移与可靠性,再把这组统计关系转移到没有真实 gaze 的 Anti-UAV410 训练框上,并在视频内做时间平滑。推理阶段三种方案都只输入红外图像,既不读取 gaze,也不读取 priority-supervision map。2
Gaze-DETR 的 priority supervision、RPFM 与 PAQI 的实验增益对比
图 1:论文对不同 priority-supervision 设置的增益比较。2

实验收益主要来自精度端

TIR-UAV120-Gaze 是论文新构建的热红外眼动数据集,包含 120 段视频、30,362 帧,分辨率为 640×480;按视频划分后,90 段视频的 20,635 帧用于训练,30 段视频的 9,727 帧用于测试。测试集中 91.36% 的有目标帧,其目标框面积小于 400 px²。Anti-UAV410 沿用官方 200/90/120 训练、验证、测试序列划分。2
论文统一报告 mAP50、P、R 和 F1。下面的数字都来自 DINO-DETR 及其 Gaze-DETR 变体的同协议比较:2
数据集与设置mAP50PRF1
TIR-UAV120-Gaze:DINO-DETR84.3488.1985.6586.90
TIR-UAV120-Gaze:box-derived85.7694.1284.0088.77
TIR-UAV120-Gaze:real-gaze86.1894.6484.0089.00
Anti-UAV410:DINO-DETR83.3793.7279.0085.73
Anti-UAV410:box-derived87.0696.3886.0090.90
Anti-UAV410:transferred pseudo-gaze87.0898.3283.7190.43
最值得注意的不是「所有数字都一起上升」,而是收益的组成。在 TIR-UAV120-Gaze 上,real-gaze 把 mAP50 从 84.34 提到 86.18,F1 从 86.90 提到 89.00,但召回从 85.65 降到 84.00,精度从 88.19 升到 94.64。也就是说,主要变化是减少错误候选,而不是让模型覆盖更多目标。
监督来源也没有普遍的胜负关系。Anti-UAV410 上,pseudo-gaze 的 mAP50 仅比 box-derived 高 0.02,但 F1 低 0.47;box-derived 的召回和 F1 更高。论文的属性级分析也显示,real-gaze 在遮挡子集上的 mAP50 增益为 1.94 个百分点,box-derived 为 1.00 个百分点;在相机运动和干扰物子集上,real-gaze 的提升却很小。gaze 提供的是任务相关空间信息,不是对所有场景都更好的替代监督。2

消融说明了三部分各自做了什么

在 TIR-UAV120-Gaze 的 real-gaze 设置下,只加入 priority loss,mAP50 比 DINO-DETR 增加 0.91,F1 增加 1.50;再加入 RPFM,增益变为 1.44 和 1.84;再加入 PAQI,完整模型达到 86.18 mAP50 和 89.00 F1。box-derived 设置也呈现相同的递进关系。这个结果把「额外监督有效」和「额外模块有效」区分开了:提升并不只来自多一个 loss,也不只来自多几个 query。2
代价同样明确。相对 DINO-DETR,完整 Gaze-DETR 增加约 4.84–5.04 GFLOPs 和 0.60–0.61M 参数,FPS 从 25.80 降为 21.01–21.48。PAQI 目前依赖固定的弱小目标尺寸先验,峰值选择也不可微;当 priority 分布较为弥散,或者测试目标尺度偏离训练先验时,这两个设计可能限制泛化。论文还指出,priority map 只是相对空间排序,在无目标帧上并不等于「没有高优先级区域」,最终仍要依靠检测分类器把 query 判为 no-object。2

代码与数据可用性

论文摘要页给出了官方 Gaze-DETR 代码仓库。仓库页面当前可见为公开仓库,显示 MIT license 和 1 次提交;但页面抓取时 README 内容未能正常展开,也没有在本轮证据中确认已发布权重、训练命令或 TIR-UAV120-Gaze 下载入口。因此,代码入口是明确的,数据集和 checkpoint 的可直接获取性仍需研究者进入仓库核对。13

结论:低成本监督已经能拿到大部分方法收益

Gaze-DETR 真正改写的是候选排序的学习方式:它把边界框负责的最终定位,与 priority map 负责的前置搜索分开,再把同一张预测图接到特征调制和 query 初始化两个位置。论文的消融支持这条机制链条。
但「gaze」本身不是论文最稳的结论。box-derived 监督不需要眼动数据,在 Anti-UAV410 上反而拿到更高 F1;real-gaze 的优势更集中在 TIR-UAV120-Gaze 和遮挡等部分条件。对复现者而言,第一步更适合从 box-derived priority head + RPFM + PAQI 开始,先检验显式优先级是否能稳定减少误报,再判断真实 gaze 标注是否值得投入。2

Related content

  • Sign in to comment.
More from this channel