
LCMamNet 解读:把跨尺度特征放进 latent space,再把层级语义找回来
arXiv 预印本 LCMamNet 用 CDBR 保护局部结构、用双向 Mamba 做潜空间跨尺度融合,并通过语义重组与选择性解码取得轻量分割性能;Jetson TensorRT FP16 的 102.60 FPS 与精度下降则揭示了部署边界。
LCMamNet 的主要贡献不是「给 U-Net 加一个 Mamba 模块」,而是把红外小目标分割里的三条信息流拆开安排:CDBR 在编码早期保护方向敏感的局部结构,LDCF 在统一潜空间里做跨尺度关联,渐进式解码器最后才选择性引入浅层细节。四组消融实验都指向同一个结论:单个模块并不自动带来最高精度,收益来自这三条路径的配合。1
论文题为 LCMamNet: A Lightweight Cross-scale Mamba Network for Infrared Small Target Detection,作者为 Yuhao Fan、Le Hui 和 Yuchao Dai,通讯作者为 Le Hui、Yuchao Dai,来自西北工业大学电子信息学院。它是 arXiv cs.CV 预印本,v1 提交于 2026 年 7 月 27 日,不是已经录用的会议或期刊论文。论文的任务形式也需要先说清:这里的 IRSTD 主要是单帧红外小目标分割,输出目标 mask,核心指标是 mIoU、Pd 和 Fa,而不是常见自然图像检测里的 bounding box mAP。2
先看清它要解决的三个冲突
红外小目标往往只有几个像素,响应弱、对比度低、边界模糊,云层、地面纹理、强边缘和亮噪声却可能产生更强的局部响应。编码阶段如果过早下采样,目标结构会丢失;融合阶段如果把不同层级反复混在一起,尺度归属和局部细节又会变得不稳定;解码阶段直接拼接浅层 skip,则可能把背景纹理一起送回预测头。1
LCMamNet 的处理顺序可以压缩成一条信息流:
- stem 生成最高分辨率的浅层特征 x0;
- 四阶段 CDBR 编码器生成 x1 到 x4,重点保护局部方向结构;
- x1 到 x4 投影到同一个 latent space,交给 LDCF 做双向 Mamba 跨尺度交互;
- 交互结果按原尺度拆回,并做层级语义重组;
- 解码末端才引入 x0,用 SBA 对浅层 skip 做通道门控,再生成预测 mask。1
这条路径解释了它和「在 backbone 任意位置插入 Mamba」的不同:Bi-Mamba 被放在更深层的跨尺度融合位置,浅层高分辨率特征不进入长序列;局部结构、长程关联和细节恢复各自有明确的职责。
CDBR:用四个方向分支守住弱目标的局部形状
CDBR(Cross-shaped Directional Bottleneck Residual)的起点是一个很实际的判断:小目标的有效证据集中在很小的邻域内,局部方向响应不能等到深层再补。它先用 1×1 卷积把通道压到 bottleneck 空间,再用四个方向分支做空间建模:左、右分支使用 1×3 卷积,上、下分支使用 3×1 卷积。四路结果拼接后经过 BatchNorm、激活和 1×1 channel fuse,最后再扩展回目标通道,与 shortcut 残差相加。1

这里的 bottleneck 不是单纯为了省参数。CDResBlock 只是在 CDConv 后接残差;CDBR 进一步压缩和扩展中间通道,把方向建模限制在更紧凑的表示空间里。对红外小目标来说,这等于把有限的特征容量优先留给局部目标结构,而不是让每个方向分支都携带大量背景纹理。
但消融数据也提醒我们不要夸大 CDBR 的单独贡献。在移除 LDCF 和 SBA 的隔离实验中,CDRes 的 mIoU 是 66.20%,标准 ResBlock 是 66.01%,CDBR 是 65.61%;CDBR 的参数量和 FLOPs 则最低,分别为 1.45M 和 10.40G。换句话说,CDBR 的证据是「用较低成本提供一个方向感知的编码基础」,不是「脱离后续模块后仍然最高精度」。1
LDCF:跨尺度交互之后,不能丢掉尺度身份
统一成一条 latent sequence
LDCF(Latent Dense Cross-scale Fusion)只接收 x1 到 x4,不把最高分辨率的 x0 拉成长序列。每一层先经过 point-wise projection 和 depth-wise convolution,映射到共享的 latent dimension;随后展平为空间 token,沿序列长度拼接成一条统一序列 T。
Bi-Mamba 在 T 上做两次状态空间建模:一次从前向扫描,一次将反转后的序列反向扫描回来。两路隐藏状态取平均,再通过可学习缩放系数 γ 加回原序列。它建立跨层依赖的方式不是给每两个尺度显式连一条桥,而是让不同尺度的 token 在同一个序列里共享前向和后向状态传播。1
交互后再把层级语义重组
如果只把四层 token 混在一起,decoder 得到的是一个有上下文、但尺度身份不够清楚的混合表示。LCMamNet 因此按原来的序列长度把结果 split 回四层,reshape 成二维特征图,再经过 Local Context Restorer 和输出投影,与对应输入层做残差连接。高层 y2 到 y4 还会再次进入一个新的 latent space,做一轮高层语义精炼。

这一步是 LDCF 最值得关注的地方。消融中,固定 CDBR 和普通 U-Net 解码器时:不做跨尺度关联的 mIoU 为 65.61%,加入 latent association 后升到 67.36%;直接 bridge 得到 67.70%,改成 hierarchy-aware reorganization 后达到 68.59%。从 67.70% 到 68.59% 的增量说明,跨尺度信息本身不够,交互后还要把语义重新挂回各自层级。1
Bi-Mamba 的优势是这组实验中的折中
在相同 LDCF 外部结构下,作者替换 token mixer:
| Mixer | mIoU (%) | 参数量 (M) | FLOPs (G) |
|---|---|---|---|
| Efficient Self-Attn | 69.47 | 1.09 | 7.88 |
| Bi-GRU | 70.47 | 1.15 | 9.92 |
| Bi-Mamba | 71.25 | 1.18 | 6.91 |
数据来自论文 Table V。Bi-Mamba 比 Bi-GRU 高 0.78 个百分点,同时少 3.01G FLOPs;比 Efficient Self-Attn 多 0.09M 参数,却高 1.78 个百分点并少 0.97G FLOPs。这个结果支持「Bi-Mamba 在 LCMamNet 的长 latent sequence 上取得了更好的精度—计算折中」,不支持把它外推成所有视觉序列任务的通用最优解。1
解码:浅层细节要晚一点、少一点进入
x0 不参与 LDCF,而是被保留为最后的浅层细节锚点。论文给出的理由有两层:它的空间分辨率最高,直接 token 化会拉长序列;它同时包含边缘和局部对比度,也携带高频背景纹理,过早混入 latent interaction 容易把杂波带进语义融合。
渐进式解码器在逐级恢复空间分辨率时,使用 SBA(Synergistic Bottleneck Attention)调节 skip。SBA 对 skip 和上采样 decoder 特征分别做全局平均池化,经轻量变换后相加并通过 sigmoid 生成通道门;门控后的 skip 才与 decoder 特征拼接。这个设计让深层语义先决定哪些浅层通道值得恢复,而不是无条件复制整张高分辨率特征图。1
完整框架消融更能说明这条路径的作用:CDBR + Reorg. + U-Net 的 mIoU 是 68.59%,把普通 U-Net 换成 SBA 解码器后变成 71.25%;把 Reorg. 换成 Direct bridge,则只有 68.71%。编码器、融合桥接和解码器的改动是相互耦合的,不能只拿其中一个表格来证明整套架构有效。1
三套基准上的数字:强的是平衡,不是每列都第一
论文使用 IRSTD-1k、NUAA-SIRST 和 NUDT-SIRST。数据集分别包含 1001、427 和 1327 张红外图像;前两者的测试划分为 201 张和 86 张,NUDT-SIRST 采用均分训练/测试。训练与测试输入统一调整为 256×256,损失是 0.3×BCE + 0.7×Soft-IoU。1
主表中的关键结果如下。Fa 按论文表格写作 10^-6 量级,数值越低越好;Pd 和 mIoU 越高越好。为避免把「强表现」写成无条件 SOTA,表中保留了每个数据集的几种代表性强基线。
| 数据集 | 方法 | mIoU (%) | Pd (%) | Fa (10^-6) |
|---|---|---|---|---|
| IRSTD-1k | HDNet | 70.26 | 94.56 | 4.33 |
| IRSTD-1k | HSTNet | 69.79 | 91.16 | 10.70 |
| IRSTD-1k | FGARNet | 69.31 | 92.18 | 4.75 |
| IRSTD-1k | LCMamNet | 71.25 | 93.20 | 11.31 |
| NUAA-SIRST | HDNet | 79.17 | 100.00 | 0.53 |
| NUAA-SIRST | FGARNet | 79.76 | 100.00 | 1.66 |
| NUAA-SIRST | HSTNet | 78.14 | 100.00 | 14.72 |
| NUAA-SIRST | LCMamNet | 79.60 | 100.00 | 0.71 |
| NUDT-SIRST | DATransNet | 94.93 | 99.04 | 2.00 |
| NUDT-SIRST | PQGNet | 95.27 | 98.31 | 2.60 |
| NUDT-SIRST | FLINet | 95.52 | 99.15 | 4.23 |
| NUDT-SIRST | LCMamNet | 95.58 | 99.47 | 3.38 |
表中各行来自论文 Table I。LCMamNet 在 IRSTD-1k 的 mIoU 比 HDNet 高 0.99 个百分点,但 HDNet 的 Pd 高 1.36 个百分点、Fa 低 6.98;在 NUAA-SIRST,FGARNet 的 mIoU 还高 0.16,HDNet 的 Fa 低 0.18;在 NUDT-SIRST,LCMamNet 的 mIoU 和 Pd 最高,但 DATransNet 的 Fa 更低。更准确的结论是:它在三套数据上都给出了很有竞争力的区域分割和目标检出结果,同时把模型压到了很小的计算预算,而不是三个指标全部压过所有基线。1

轻量性确实是论文的主线
LCMamNet 的参数量为 1.175M,论文 Table I 四舍五入显示为 1.18M;FLOPs 为 6.91G,RTX 4090 上的平均前向延迟为 6.62ms。这个数字与架构安排是对应的:局部方向卷积放在 bottleneck,中高层跨尺度交互使用线性状态空间扫描,最高分辨率的 x0 不进入长序列。1
但参数量小不等于推理链路天然适合所有设备。论文在 NVIDIA Jetson Orin NX 16G SUPER、MAXN 模式下报告:
| 后端 | 精度 | mIoU (%) | 延迟 (ms) | FPS |
|---|---|---|---|---|
| PyTorch | FP32 | 71.27 | 49.86 | 20.06 |
| PyTorch | FP16 | 71.18 | 47.05 | 21.25 |
| TensorRT | FP16 | 65.96 | 9.75 | 102.60 |
论文 Table II 的数据表明,TensorRT FP16 将延迟降到 9.75ms,却比 Jetson 上 PyTorch FP32 的 mIoU 低 5.31 个百分点。论文将这一下降与低精度推理、CDBR 编码器和 Mamba 融合模块的算子转换联系起来。对于部署者,正确的结论是「有实时边缘推理潜力,但 TensorRT 加速和精度保持尚未同时解决」,而不是直接把 102.60 FPS 当成无损实时结果。1
消融表真正告诉了什么
把几组消融放在同一条逻辑线上,会得到比「每个模块都有效」更具体的判断:
| 被检验的设计 | 变体 | mIoU (%) | 参数量 (M) | FLOPs (G) |
|---|---|---|---|---|
| 编码器替换 | ResBlock | 66.01 | 3.39 | 15.86 |
| 编码器替换 | CDRes | 66.20 | 2.14 | 12.21 |
| 编码器替换 | CDBR | 65.61 | 1.45 | 10.40 |
| 融合/重组 | 无 Assoc. | 65.61 | 1.45 | 10.40 |
| 融合/重组 | Assoc. + Direct | 67.70 | 1.59 | 11.84 |
| 融合/重组 | Assoc. + Reorg. | 68.59 | 1.73 | 12.26 |
| 完整框架 | CDRes + Reorg. + SBA | 70.13 | 1.86 | 8.72 |
| 完整框架 | CDBR + Direct + SBA | 68.71 | 0.93 | 6.48 |
| 完整框架 | CDBR + Reorg. + SBA | 71.25 | 1.18 | 6.91 |
各行来自论文 Tables III、IV、VI;编码器和融合实验的控制条件不同,不能把所有行视作同一条单变量曲线。最有用的三点是:方向卷积在 CDRes 中带来小幅精度收益;bottleneck 让 CDBR 变轻,但单独 mIoU 略降;完整模型中 Reorg. 和 SBA 同时存在时,才达到 71.25%。1
训练配置也影响复现判断:论文用单张 RTX 4090 24GB,AdamW,初始学习率 1e-3,最小学习率 1e-5,weight decay 5e-2,训练 800 epochs,early-stopping patience 240,batch size 12,采用 5 epochs warmup 加 cosine annealing。读者复现实验时,至少应保持这些设置和数据划分一致,再讨论模块差异。1
代码、权重与数据:公开,但不是开箱即用
论文给出的官方 GitHub 仓库目前公开可访问,包含模型实现、
train.py、test.py、损失与指标代码,以及 weights/ 下的 IRSTD-1k、NUAA-SIRST、NUDT-SIRST 三个预训练 checkpoint。README 还给出与论文一致的三套基准结果和 Jetson 部署表。3数据部分需要区分「索引可复现」和「原始数据已随仓库提供」:仓库只附每个数据集两组 image/mask 样例和完整的 train/test split 列表,完整图像与掩膜需要按 datasets/README.md 的说明另行下载。该页列出的来源是 IRSTD-1k / ISNet、NUAA-SIRST / sirst 和 NUDT-SIRST。4
环境也有前置条件:仓库依赖 Mamba 的 selective-scan CUDA kernels,README 明确写明 CPU 不支持;Jetson 还需要匹配 aarch64 的 Mamba 与 causal-conv1d 环境。官方代码和权重已经足够让研究者开始复现,但「公开」并不意味着普通 CPU 环境可以直接跑通。3
结论:LCMamNet 的价值在于信息流的分工
LCMamNet 值得关注的地方可以落到三个可检验的动作上:
- CDBR 用四方向局部卷积和 bottleneck 把弱目标结构保护放在编码早期;
- LDCF 把 x1 到 x4 变成统一 latent sequence,用双向 Mamba 建立跨尺度状态传播,再通过 Reorg. 把尺度语义找回来;
- SBA 把 x0 留到解码末端,用深层语义筛选浅层细节,减少背景纹理直接泄漏。
消融支持这条解释,但部署实验给它加了边界:在论文的三个公开分割基准和给定测试设置下,LCMamNet 实现了 1.175M 参数、6.91G FLOPs 和很强的 mIoU/Pd 组合;在 Jetson 上,TensorRT FP16 的 102.60 FPS 同时伴随 mIoU 降至 65.96%。对于后续研究,最值得复现的不是只替换 Bi-Mamba,而是分别核对「latent association + semantic reorganization」和「选择性 skip 恢复」是否仍然成立,再把后端精度损失纳入部署结论。1
论文自己也承认,训练与评估仍以分割目标和分割指标为主,对极小、边界模糊目标的轮廓保真不足,后续计划引入 shape-aware metrics。这个限制决定了当前证据更适合支持「轻量红外小目标分割的精度—效率协同设计」,还不足以替代对真实传感器域、跨数据集泛化和边界质量的独立验证。1
Related content
- Sign in to comment.
