
CLSC DETR:跨层几何支持把 UAV 小目标的候选排序拉回定位质量
CLSC DETR 在 MI-DETR 上加入跨层局部几何支持与分类—定位一致性校准,并用两套 UAV 基准验证候选排序收益。
单个 query 给出的定位质量,往往不足以支撑 UAV 小目标的可靠排序。CLSC DETR 把最终层候选放回中间编码层的局部邻域寻找几何支持,再让分类可靠性决定几何质量应当施加多大惩罚。论文在 VisDrone 上相对 MI-DETR 将 AP/AP75 提高 1.5/2.0 个百分点,在 UAVDT 上提高 3.0/3.8 个百分点;增益的落点是候选排序,而非新增候选。1
先把问题放在排序环节
DETR 类检测器需要从一组 query 预测中排出更值得保留的候选。DINO、Rank-DETR、Align-DETR 和 MI-DETR 已经把定位质量纳入候选分数,但单个 query 面对几像素目标、遮挡和弱边界时,框的几何证据可能本身就不稳定。分类分数又回答的是“像不像目标”,两者发生偏离后,语义上可信但框偏移的候选,或框看似准确但类别不稳的候选,都可能获得不合适的排名。1
CLSC DETR 基于 MI-DETR 和 ResNet-50。网络仍然先生成多尺度特征,再经过编码器和解码器输出候选;新增部分集中在共享预测头之后:CLS-Module 汇聚跨层几何证据,CLC-Module 校准分类分数。这个位置很重要,因为它把“候选集合怎么产生”和“候选怎么排序”分开了。

CLS:几何支持来自哪里
共享预测头同时作用于中间编码层和最终层。对最终层的第 i 个候选,模块在每个中间层对应位置周围半径为 ρ 的局部邻域内收集辅助候选。辅助候选 j 在第 ℓ 层提供的几何证据为
这里的两项各自承担一个筛选条件:预测框需要和最终框有空间重叠,中间层候选自身还要有较高定位质量。模块从所有辅助候选中只保留 Top-K 条证据,求平均得到
Gᵢ,再计算最终层自身的质量只有在跨层支持也成立时才会被放大。这个设计把一次预测变成了多层候选之间的局部一致性判断。
Top-K 的消融给出了它的边界。VisDrone 上 K=1、2、4、8 时 AP 分别为 35.1、35.2、35.0、34.8。K=2 最好,继续扩大聚合范围反而把错误对应带回质量估计。固定局部半径和固定 K 也意味着,尺度变化更大时,邻域未必仍然合适;论文把可学习邻域和自适应跨层聚合作为后续方向。1
CLC:分类可靠时,几何惩罚要让一步
CLS 得到
Qᵢᵍᵉᵒ 后,CLC 不直接使用一个全局固定指数。模块先从候选的最高类别概率 sᵢ、前两类概率间隔 mᵢ 和分类熵置信度 hᵢ 得到图像内归一化的分类可靠性 Rᵢᶜˡˢ。当分类证据强于几何证据时,保护因子会增大,最终类别分数写成
因此,CLC 的作用可以具体地说成:分类很可靠的候选,几何质量下降时少受一些压制;分类本身摇摆的候选,则继续接受几何质量约束。它校准的是排序分数,候选数量和候选位置保持不变。
固定指数和线性融合在同一设置下的 AP 都为 34.8,本文自适应策略为 35.2;对应 AP50/AP75 分别是 57.2/35.4、57.3/35.4 和 57.9/35.9。增益只有 0.4 个百分点,却直接落在“候选之间怎样分配几何惩罚”这个设计点上。1
两个模块怎样分工
| 设置 | AP | AP50 | AP75 |
|---|---|---|---|
| MI-DETR 基线 | 33.7 | 56.3 | 33.9 1 |
| 只加入 CLS | 34.7 | 57.2 | 35.5 1 |
| 只加入 CLC | 34.6 | 57.7 | 35.0 1 |
| CLS + CLC | 35.2 | 57.9 | 35.9 1 |
CLS 单独加入后 AP75 提高 1.6 个百分点,说明它对高 IoU 定位更敏感;CLC 单独加入后 AP50 提高 1.4 个百分点,说明分数保护先改善了较宽松匹配下的候选排序。两者合用后,AP 比基线高 1.5 个百分点,AP75 高 2.0 个百分点。这个交叉结果支持两条路径互补:CLS 稳定质量估计,CLC 处理质量与分类之间的尺度关系。
两套 UAV 基准上的数字
VisDrone2019-DET 使用官方训练集 6,471 张图像和验证集 548 张图像。CLSC DETR 的 AP/AP50/AP75/APS 为 35.2/57.9/35.9/26.6,MI-DETR 为 33.7/56.4/33.9/25.5。1
UAVDT-5.3K 从 30 个训练序列构造,24 个序列按每 4 帧采样训练,6 个序列按每 10 帧采样验证,得到 4,793 和 503 张图像,序列之间没有重叠。CLSC DETR 的 AP/AP50/AP75/APS 为 37.0/62.9/40.2/26.6;MI-DETR 为 34.0/59.1/36.4/22.7。UAVDT 的四项提升为 3.0/3.8/3.8/3.9 个百分点。论文把更大增益归因于车辆主导、类别分布集中、目标密集且尺度变化明显,使定位质量更容易影响排序。1
这组结果能支持“跨层支持在两套 UAV 协议中有效”。它还没有覆盖跨数据集迁移、不同 backbone、推理延迟或参数增量,因此研究者应把 CLSC DETR 看成一个候选排序增强模块,先在同一 MI-DETR 训练设置中验证模块消融,再测不同尺度下固定邻域和 Top-K 的稳定性。
复现判断
论文采用 90,000 次迭代、AdamW、检测器学习率
1×10⁻⁴、主干学习率 1×10⁻⁵、权重衰减 1×10⁻⁴,在 2 张 RTX 5090 上以 batch size 4 训练;82,500 次迭代后将学习率降到 1×10⁻⁵。原始论文页面没有提供官方代码仓库链接。12对研究选题而言,最可检验的增量有两个。第一,跨层候选的
IoU×q 是否比单层质量更稳定;第二,分类可靠性条件化的指数是否在不同目标密度下仍优于固定融合。论文已经给出 K、α、β、γ 的敏感性和 Mean IoU@K 可视化,下一步实验应补上排序相关指标与跨尺度邻域分析。References
- 1CLSC DETR arXiv HTML 全文
arxiv.org
- 2CLSC DETR arXiv 摘要页
arxiv.org
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
More from this channel›
- PICANet:物理先验解耦与级联非对称注意力如何重构红外弱小目标分割
- CQTR:冻结的检测器真不懂小目标吗?反事实尺度干预与解码器轨迹可靠性诊断
- SPARK-SAM:把 SAM 的提示—响应鸿沟改成可学习的图像到掩码闭环
- RDANet:抗混叠下采样与原型记忆如何稳住红外小目标的尺度和场景变化
- DyFrDet 把频域干扰与模糊框标注分开处理,动态频带抑制能带来多少定位收益?
- LCMamNet 解读:把跨尺度特征放进 latent space,再把层级语义找回来
- FOCUS 解读:告别 deep unfolding,紧邻红外小目标解混如何做到约 60× 加速
- Gaze-DETR 解读:用优先级图把红外弱小无人机的「先看哪里」显式建模
