
FOCUS 解读:告别 deep unfolding,紧邻红外小目标解混如何做到约 60× 加速
arXiv 论文 FOCUS 将 CSIST 解混改写成一次前向的粗到细恢复,用 DMM、SMM、ISGU 以及稀疏与通量约束替代反复展开;在合成 CSIST-100K 上获得 122,522 FPS,但真实传感器泛化仍待验证。
FOCUS 为什么能把 CSIST 解混做成一次前向
紧邻红外小目标在成像后可能只剩一个无法分辨的能量 blob:多个亚像素点源叠在一起,传统检测所依赖的一对一「目标—框」映射就失效了。FOCUS 的结论是,CSIST Unmixing 不必依赖 deep unfolding 的反复迭代;只要同时改写输出标签、网络结构和损失约束,一次前向也能恢复离散点源。论文在 CSIST-100K 上把标准模型的吞吐做到 122,522 FPS,ISTANet 为 2,127 FPS,速度比值约 57.6 倍,论文将其概括为 60×。不过,速度优势和精度优势必须分开看:标准 FOCUS 的 mAP 为 45.50,DISTA-Net 为 46.47;FOCUS+ 的 46.53 则来自另一种增强配置,吞吐只有 11,003 FPS。12
论文题目为「Beyond Unfolding: 60× Faster One-Stage Unmixing for Closely-Spaced Infrared Small Targets」,提交于 2026 年 7 月 17 日,是一篇 arXiv 预印本。作者包括 Ximeng Zhai、Zheng Wang、Yaohong Chen、Hao Wang、Ming-Ming Cheng 和 Yimian Dai;通讯作者为 Yimian Dai,来自南开大学计算机学院 VCIP,另与深圳 NKIARI 关联。12
先把任务从「检测」改写成「解混」
CSIST 的困难不是目标太小这一句概括,而是光学衍射和长距离成像让邻近点源的能量扩散、重叠,再经过传感器积分和后处理,最终图像里只剩一个混合 blob。输出不再是一个框,而是高分辨率空间中的稀疏点源分布。此时,模型需要同时回答两个问题:点源的拓扑位置在哪里,每个点源应该恢复多少能量。2
FOCUS 的范式迁移来自一个建模观察:图像超分辨率和 CSIST 解混都可以写成从低分辨率观测 Y 恢复高分辨率信号 X 的退化逆问题,前向过程都包含能量扩散/模糊、空间量化和后处理。两者真正不同的是输出先验:SR 追求连续纹理,CSIST 追求离散亚像素点源。因此,论文不是把一个普通 SR 网络直接搬过来,而是重新定义标签空间、损失函数和评测标准,把「视觉上平滑」换成「位置和能量都对」。2
DRR:一次前向里仍然保留粗到细顺序
FOCUS 用 Decoupled Reconstruction-Rectification 把几何恢复和伪影修正拆开,但不再把它们展开成多个迭代阶段。
- DMM 建立空间拓扑。 Digital Microscope Module 把 11×11 的低分辨率输入投影到 33×33 的高分辨率空间,先给出粗几何估计。它解决的是「点源应该落在哪些高分辨率位置」。
- SMM 做物理保真修正。 Spatial Modulator Module 在固定的高分辨率空间内以 scale=1 做残差学习,重点抑制上采样带来的 ringing 等伪影,并把结果往稀疏点源先验推近。
- ISGU 在两个阶段复用。 Isomorphic Source-Generation Unit 把特征分成 Intensity Path 和 Mask Path:前者估计潜在辐射能量,后者估计空间存在概率;两条路径分别上采样后逐点相乘。Mask 对 intensity 的门控让输出在结构上更稀疏,而不是等网络在最后一层自己把背景压成零。2
这个结构解释了「一阶段」和「一层网络」的区别。FOCUS 只有一次从输入到输出的前向映射,但内部仍有明确的 coarse-to-fine flow;它只是把几何恢复与伪影修正放在同一条可训练的 feed-forward 路径中,而不是像 ISTANet 那样重复执行求解单元。

损失函数里有一场真实的拉扯
FOCUS 没有把三个约束简单解释成「越多越好」。它们之间存在明确冲突。
- Focal MSE 负责空间锚定。 重建损失约束预测和真值的强度差异,使预测中心对齐目标位置;但 MSE 对轻微错位更宽容,容易偏向平滑的 Gaussian 响应。
- SSE 负责压背景。 Structural Sparsity Enforcement 使用输出的 L1 范数,把低强度背景和伪影推向零。但它对目标强度也施加向下压力,可能把有效信号一起压低。
- PGFC 补回通量。 Physics-Guided Flux Calibration 约束预测总能量与参考洁净观测的总能量一致。由于 MSE 已经把空间位置锁在目标附近,SSE 又压住了背景,减少的能量更可能回到目标中心,而不是重新泄漏到背景。
总损失可以理解为「位置对齐 + 稀疏抑制 + 能量校准」的平衡,而不是普通 SR 的单一重建目标。论文把这组约束称为 competitive equilibrium,真正可核对的证据在消融表里:基础一阶段网络 mAP 为 42.61,加 SSE 后为 43.74,再加 PGFC 为 44.10,完整 coarse-to-fine 结构达到 45.50。2
CSIST-100K 上的速度收益很大,精度收益要分开解读
论文在合成的 CSIST-100K 上训练和测试:80,000 个训练样本、10,000 个验证样本和 10,000 个测试样本;输入是 11×11 低分辨率观测,真值是 33×33 高分辨率稀疏源图,Gaussian PSF 的 σ=0.5。2–4 个目标的样本占 86.7%,因此它覆盖了典型的近邻目标场景,但不是现实传感器数据。2
| 方法 | mAP | AP05 | AP10 | AP20 | AP25 | FPS | FLOPs |
|---|---|---|---|---|---|---|---|
| ISTANet | 44.99 | 0.40 | 7.10 | 82.60 | 94.80 | 2,127 | 11.37G |
| DISTA-Net | 46.47 | 0.30 | 6.70 | 86.40 | 97.60 | 10,992 | 35.10G |
| CAMixerSR | 44.87 | 0.40 | 7.20 | 82.30 | 94.40 | 1,138 | 20.42G |
| FOCUS | 45.50 | 0.40 | 7.30 | 83.20 | 95.50 | 122,522 | 1.63G |
| FOCUS+ | 46.53 | 0.40 | 7.40 | 85.60 | 97.00 | 11,003 | 41.49G |
表中数值来自论文在 CSIST-100K 上的主比较表;FPS 在单张 NVIDIA RTX 4090、batch size 1 下统计。2
标准 FOCUS 相比 ISTANet 的核心收益是吞吐:122,522 对 2,127 FPS,约 57.6×;FLOPs 也从 11.37G 降到 1.63G。它的 mAP 比 ISTANet 高 0.51 个百分点,但低于 DISTA-Net 的 46.47。FOCUS+ 达到 46.53,却不应被用来证明「一次前向同时达到最高精度和最高速度」,因为它的吞吐已经降到 11,003 FPS。
与修改后的 SR 方法相比,FOCUS 的优势来自任务先验而不只是轻量化。CAMixerSR 的 mAP 为 44.87,计算量为 20.42G;普通重建模型倾向于恢复连续的视觉结构,缺少显式稀疏约束时,多个点源更容易变成一团平滑能量。ISGU 的 mask gating、SSE 和 PGFC 共同改变了这个偏置。2
噪声、密度和放大倍率下的边界
FOCUS 在合成噪声测试中表现出较慢的退化。Gaussian noise σ=1.0 时,FOCUS 的 mAP 为 37.12,ISTANet 为 34.89,CGA 为 14.98;Poisson peak=255 时,FOCUS 为 23.58,ISTANet 为 23.02,CAMixer 为 23.17。目标数从 1 增到 5 时,mAP 从 51.10 降到 38.10,但 5 目标场景的 AP25 仍为 86.20。2
放大倍率实验也支持 coarse-to-fine 结构的可扩展性:倍率 c=5 时,FOCUS mAP 为 64.61,ISTANet+ 为 63.45,FLOPs 为 4.26G 对 39.54G;c=7 时,FOCUS 为 73.28,ISTANet+ 为 71.09,FLOPs 为 8.19G 对 103.00G。2
这些结果能证明的是,在论文设定的合成退化模型和噪声扰动下,一阶段结构保持了较好的点源恢复能力。它们不能直接证明真实红外系统上的泛化,因为真实系统的 PSF、量化误差、热噪声和后处理链并不一定与 CSIST-100K 的 Gaussian PSF 相同。
代码和数据集:代码有,FOCUS 专用权重仍要核对
论文给出官方 GrokCV/GrokCSO 仓库。仓库 README 提供了 CSIST-100K 的 Baidu Pan 下载入口、CSIST-100K 的 OneDrive 下载入口 和 SeqCSIST 的 Baidu Pan 下载入口。当前 README 展示的训练、测试和 checkpoint 示例主要使用 DISTA 配置,尚未确认 FOCUS 专用的公开 checkpoint 或单独命令;复现时要先检查仓库当前分支。13
结论:60× 来自删掉循环,可靠性来自重新约束输出
FOCUS 的速度故事很清楚:它移除了 deep unfolding 的重复迭代,因此在标准配置下获得约 60× 的吞吐提升。方法故事更具体:DMM 先恢复空间拓扑,SMM 再修正伪影,ISGU 用 mask 门控建立结构稀疏,SSE 和 PGFC 处理「压背景会伤害目标能量」这一冲突。
当前证据更适合支持一个收窄的判断:在 CSIST-100K 这类合成解混任务上,物理约束充分写进一阶段网络后,迭代循环并不是获得高质量点源恢复的唯一方式。真实传感器上的 PSF、噪声和域偏移是否仍能保持同样的速度—精度折中,还需要独立数据验证。2
References
Related content
- Sign in to comment.
