PICANet:物理先验解耦与级联非对称注意力如何重构红外弱小目标分割

PICANet:物理先验解耦与级联非对称注意力如何重构红外弱小目标分割

PICANet 利用 24 方向多尺度非可训练深度卷积解耦红外弱小目标的高斯向心物理先验,并通过双向门控融合与级联非对称交叉注意力阻断跳连杂波,在三套公开基准上显著超越现有 SOTA 模型。

红外弱小目标分割(ISTD)在遥感监测、防空预警和智能交通等任务中扮演着重要角色。由于红外成像距离远且信噪比低,目标往往仅占据数个像素,缺乏纹理与清晰边缘,容易被复杂的地面或云层热杂波淹没。现有的技术路线普遍面临两难困境:以低秩稀疏分解或局部对比度为代表的模型驱动方法具备明确的物理可解释性,但在多尺度目标与复杂场景下参数敏感且虚警偏高;以深度卷积和 Transformer 为代表的数据驱动方法虽然拟合能力较强,但多次空间下采样会侵蚀微弱目标的结构,常规跳跃连接又容易将低层的背景噪声直接传播至解码器。2026 年 9 月,上海大学与中山大学等机构的研究团队提出了即插即用的物理启发级联非对称网络 PICANet,尝试将各向同性高斯形态的先验约束与深层特征提取深度结合。1
PICANet 设计了分层先验解耦模块(HPDM)、双先验交互融合模块(DPIFM)以及多层跨特征注意力模块(MCFAM)。该架构不仅能无缝嵌入到 U-Net 与 ResNet-FPN 等主流骨干网络中,还在 NUDT-SIRST、IRSTD-1k 与 SIRST-Aug 三套基准数据集上显著刷新了目标检测率 与分割交并比 ,同时大幅降低了虚警率 。目前,作者团队已经在 GitHub 上公开了完整的源代码与预训练模型。2
PICANet 整体网络架构与核心数据流
论文 Fig. 1:PICANet 整体网络架构由三大核心组件构成:HPDM 提取几何与语义物理先验,DPIFM 通过双向门控将先验注入多尺度主干特征,MCFAM 通过级联非对称机制对齐多层跳连特征。1

HPDM:24 方向离散算子解耦物理先验

传统物理方法主要依据红外小目标在局部空间呈现中心对称高斯斑点的形态特征。然而,若直接利用可学习的常规卷积层捕捉该特征,训练初期的随机梯度更新容易打乱明确的方向几何结构,使物理属性退化为模糊的一般语义。
PICANet 构建了分层先验解耦模块(HPDM)。该模块内部的多方向特征聚合计算块(MFACBs)固定了非可训练的深度卷积核参数,在 24 个离散方向()上密集计算结构响应:
为了同时覆盖单像素点目标和具有微弱结构的延展目标,MFACBs 采用 三种不同的卷积核尺度并行提取特征,随后通过 逐点卷积学习 24 个方向响应的最佳线性组合,并通过残差连接与输入融合。
HPDM 模块结构与双先验解耦路径
论文 Fig. 2:HPDM 模块架构包含多尺度非可训练 MFACBs 块以及双流先验头,分别生成用于目标定位的低级几何先验 与用于特征嵌入的高级轮廓先验 1
聚合后的多尺度特征被输送至两个相互解耦的先验头:
  1. 低级几何先验(:通过包含 卷积与 Sigmoid 激活的锚框保留分支生成单通道空间显著性图,提供稳定的目标中心定位引导,不受随机训练噪声干扰。
  2. 高级轮廓先验(:通过包含最大池化与多层 卷积的拓扑感知分支生成多尺度分层先验图集,保留目标的能量分布轮廓,用于后续深层特征嵌入。1

DPIFM:双向先验引导特征增强

将手工先验直接拼接到神经网络深层的做法,容易因为深浅层感受野失配而引发语义冲突。PICANet 设计了双先验交互融合模块(DPIFM),其核心机制是双向先验引导特征增强单元(BPGFE)。
该单元在上采样对齐分辨率后,执行双向注意力门控: 首先,利用深层语义校准物理先验。深层特征 蕴含全局上下文,单元利用 卷积计算特征驱动注意力图 ,在空间上门控原始物理先验
这一步能够滤除物理先验图中缺少语义支持的背景伪杂波,得到兼具物理特性与语义一致性的精炼先验
随后,利用精炼先验加权主干特征。单元从 的向心梯度几何中提取结构注意力图 ,反向重加权主干特征
这一过程将红外小目标的几何中心重新定位到深层特征图中,避免了常规网络在多轮下采样后对小目标特征的抹除。最后,加权特征与精炼先验拼接并通过卷积融合,实现了物理约束向深度表征的主动注入。1

MCFAM 与 ISC-A:级联非对称注意力

在编码器-解码器架构中,跳跃连接常将编码器浅层特征直接传递给解码器。对于红外弱小目标,这种无条件连接会把浅层包含的大量背景高频噪声同步注入解码器。若采用对称的并行注意力机制,自顶向下与自底向上的分支各自独立运算,依然无法在空间交互前有效净化噪声。
PICANet 在 MCFAM 中提出了交互式空间-通道注意力机制(ISC-A),通过级联非对称形式串联通道校准与空间蒸馏。
ISC-A 级联非对称注意力单元结构
论文 Fig. 4:ISC-A 单元的结构流程。自顶向下路径首先完成通道级噪声过滤,随后在净化后的特征上执行双重池化与空间上下文蒸馏,再调制解码器深层特征。1
该单元的具体处理包含两步:
  1. 全局到局部通道校准:对编码器特征进行全局平均池化生成通道描述子,经过两层瓶颈比 的逐点卷积生成通道注意力向量 ,直接对浅层特征加权以静音不含目标的背景通道,得到过滤特征
  2. 空间上下文蒸馏:对净化后的 同时施加平均池化与最大池化,捕获局部的能量峰值与统计特性,经 卷积生成空间注意力图 ,再去调制解码器深层特征
这种“先在通道维度切断背景杂波、再在空间维度蒸馏目标峰值”的非对称交互,从结构上杜绝了跳连特征对解码器的杂波污染。在最终预测阶段,网络采用多阶段协作预测机制,将解码器各层产生的多尺度局部估计 上采样并累加聚合,兼顾了深层的高置信度判断与浅层的精确空间边缘。1

三大基准量化实验与消融分析

实验在三套主流红外公开基准上展开:NUDT-SIRST(256×256 分辨率)、IRSTD-1k(512×512 分辨率)以及 SIRST-Aug(256×256 分辨率)。论文将 PICANet 分别实例化为基于 U-Net 的 PICANet (U) 与基于 ResNet-FPN 的 PICANet (F),并与 19 种具有代表性的基线方法展开了横向评测,涵盖传统模型驱动算法、经典深度学习网络以及算法展开网络。

与主流 SOTA 方法的定量对比

方法类型NUDT-SIRST mIoU / FaIRSTD-1k mIoU / FaSIRST-Aug mIoU / Fa参数量 (M)FLOPs (G)GPU 耗时 (s)
Top-hat模型驱动22.36 / 771.205.59 / 102.3016.39 / 166.300.0018 (CPU) 1
IPI模型驱动34.83 / 106.9018.67 / 93.3721.90 / 93.173.0972 (CPU) 1
MPCM模型驱动25.96 / 316.5014.81 / 64.2419.49 / 304.800.0624 (CPU) 1
ISNet数据驱动87.77 / 9.4264.73 / 15.0370.12 / 21.570.9730.620.0173 1
UIUNet数据驱动88.71 / 8.9163.06 / 20.5771.80 / 28.2950.5454.420.0317 1
SCTransNet数据驱动91.06 / 11.1964.38 / 27.4672.98 / 38.755.7420.240.0213 1
L²SKNet数据驱动93.26 / 5.1967.81 / 27.4673.97 / 55.101.076.010.0122 1
RPCANet算法展开89.31 / 28.7263.21 / 43.9072.54 / 34.140.6827.480.0096 1
DRPCANet算法展开93.12 / 19.5063.93 / 49.2073.93 / 30.451.1791.050.0101 1
CTVNet算法展开92.05 / 8.9766.35 / 20.4772.96 / 38.7914.9085.740.0195 1
L-RPCANet算法展开94.39 / 1.3967.44 / 43.9075.35 / 26.430.228.590.0029 1
PICANet (U)物理启发95.19 / 1.2870.31 / 23.3875.48 / 28.566.338.530.0129 1
PICANet (F)物理启发94.69 / 1.3469.35 / 29.4375.58 / 25.952.744.270.0089 1
在 NUDT-SIRST 上,PICANet (U) 取得了 95.19% 的 mIoU,同时将虚警率 压缩至 1.28,在全部对比模型中位列第一;在具有高分辨率复杂真实地物背景的 IRSTD-1k 上,PICANet (U) 的 mIoU 突破至 70.31%,相较此前最强的 L-RPCANet(67.44%)提升了 2.87 个百分点;在 SIRST-Aug 上,参数量仅 2.74M 的 PICANet (F) 取得了 75.58% 的最高 mIoU 与 25.95 的最低虚警率,单张图 GPU 推理时间仅需 8.9 毫秒。
多模型在三套红外数据集上的可视化分割结果
论文 Fig. 5:在三套数据集上的典型定性结果对比。蓝色、橙色和红色方框分别指示真阳性(TP)、假阳性(FP)与假阴性(FN)。PICANet 在建筑物边缘、强点光源与云层杂波下保持了更完整的轮廓提取与更低的虚警。1

先验模块与注意力结构的消融验证

论文在两种骨干网络下分别对先验解耦(、BPGFE)与注意力结构(ISC-A 的自顶向下 TD、自底向上 BU、级联非对称 CA)开展了剥离实验:
骨干配置物理先验组合NUDT mIoU / FaIRSTD-1k mIoU / FaSIRST-Aug mIoU / Fa
U-Net 基线无先验86.32 / 18.6559.12 / 60.3863.41 / 83.36 1
U-Net+ PCP189.29 / 8.4163.66 / 48.5666.83 / 48.89 1
U-Net+ PCP289.52 / 9.5264.11 / 50.1967.22 / 50.08 1
U-Net+ PCP1 & PCP2 (简单拼接)90.78 / 10.5664.78 / 40.8169.54 / 40.65 1
U-Net+ PCPs & BPGFE (完整融合)95.19 / 1.2870.31 / 23.3875.48 / 28.56 1
ResNet-FPN 基线无先验85.16 / 28.3358.52 / 62.4561.78 / 81.97 1
ResNet-FPN+ PCPs & BPGFE (完整融合)94.69 / 1.3469.35 / 29.4375.58 / 25.95 1
消融数据表明,仅把先验图直接输入或简单拼接,mIoU 的提升相对有限(U-Net 从 86.32% 到 90.78%);一旦启用 BPGFE 的双向门控重定位机制,NUDT-SIRST 上的 mIoU 进一步跃升 4.41 个百分点达到 95.19%,虚警率从 10.56 骤降至 1.28。在注意力机制消融中,开启级联非对称交互(CA)相比平行独立运算,在 IRSTD-1k 上的虚警率从 38.94 降至 23.38,证实了通道先验过滤对阻断跳连噪声传播的关键作用。

官方开源代码与复现指南

PICANet 的官方代码仓库结构完整,为后续课题组的实验复现与工程改造提供了成熟的基础:
  1. 环境依赖与安装: 官方仓库基于 Python 3.10 与 PyTorch 框架构建。推荐通过 Conda 创建虚拟环境:
    conda create -n picanet python=3.10 -y
    conda activate picanet
    pip install -r requirements.txt
  2. 数据集组织结构: 实验数据支持从各大公开基准直接下载,在工程根目录建立统一的 data/ 结构:
    data/
    ├── NUDT-SIRST/
    ├── IRSTD-1k/
    └── SIRST-Aug/
  3. 训练入口与动态损失: 论文实验采用 Adam 优化器,初始学习率设为 ,配合多项式衰减策略(polynomial decay),总训练轮数为 400 epochs,批处理大小设为 8。仓库提供了两套骨干网络的训练脚本:
    • 训练 U-Net 骨干变体:python train_UNet.py
    • 训练 ResNet-FPN 骨干变体:python train_FPN.py 训练损失函数结合了多尺度二值交叉熵 、平滑交并比 与目标邻域掩码均方误差 。其中 BCE 权重 随训练进程由大变小,聚焦初始定位;IoU 权重 随进度增大,在后期强化精准分割;先验约束权重 全程固定为 1.0。1
  4. 评估入口与硬件条件: 模型测试通过执行 python t_models.py 得到 mIoU、F1、Pd 与 Fa 指标。所有训练与评估在一台配置 Intel Xeon Gold 6526Y CPU 与 NVIDIA RTX 4090 GPU 的工作站上完成。
  5. 部署边界与未竟问题: 定性分析显示,当目标信噪比极低且处于强烈高亮热斑或结构性亮斑交界处时,模型仍存在小概率假阳性或边缘弥散。此外,当前实验主要针对单帧静态图像,在多帧连续红外视频流中的时序致密对齐与运动引导,将是该技术进一步向车载或机载实装迁移时的重要探索方向。2

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel