UltraLight VM-UNet阅读

这篇论文选择 Mamba 而不是纯卷积,核心原因不是“卷积不能做分割”,而是作者要解决一个更具体的问题:

在移动医疗/轻量化场景下,如何同时做到极低参数、低算力开销、又保留较强的远程依赖建模能力。 论文认为,Mamba 比卷积更适合作为这个目标下的“轻量主干单元”。

一、论文的核心目标是什么

作者一开始就把目标说得很明确:
传统方法为了提升分割精度,往往不断堆复杂模块,但这不适合移动医疗设备,因为真实临床环境有明显的计算和内存限制。作者希望做一个参数极低、GFLOPs 极低、同时性能仍有竞争力的皮肤病灶分割模型。

他们最终给出的 UltraLight VM-UNet 做到:

  • 0.049M 参数量
  • 0.060 GFLOPs
  • 在 ISIC2017 / ISIC2018 / PH2 三个数据集上仍保持有竞争力的分割结果。

二、为什么不用卷积,而要用 Mamba

1)作者认为卷积的天然短板是“远距离依赖”

论文在引言里直接指出,卷积擅长局部特征提取,但在建立远距离信息关联方面存在不足。虽然可以用大卷积核缓解,但这通常会继续增加复杂度。

对皮肤病灶分割来说,这一点很关键,因为病灶区域的判断不仅靠局部纹理,还常常依赖:

  • 病灶整体形状
  • 长距离的边界一致性
  • 大范围上下文和背景关系

而这些都不是标准卷积最擅长的部分。作者把 Mamba 视为一种既能建模长程依赖、又比注意力更省资源的替代方案。

2)相比 Transformer,Mamba 更适合轻量化

论文没有简单拿卷积和 Mamba 对比,而是放在三者框架里看:

  • 卷积:局部建模强,但长程依赖弱
  • Transformer:长程依赖强,但自注意力复杂度高,图像越大越贵
  • Mamba/SSM:对输入大小呈线性复杂度,还能较好捕获远程依赖

所以作者的逻辑是:
如果想在轻量模型里同时保留“全局/远程建模能力”,Mamba 比卷积更有潜力;如果还要控制计算复杂度,Mamba 又比 Transformer 更现实。

3)实验上,卷积轻量模型的“性能-复杂度平衡”不如 Mamba

论文专门提到一个对比:MALUNet 是基于卷积的轻量模型,参数和计算量已经很低,但其性能仍低于文中的 Mamba 方案。作者据此得出一个判断:
卷积式轻量模型更难同时兼顾性能和计算复杂度。

这是这篇论文“为什么不用卷积”的最直接实验依据之一。


三、但这里不是“完全不用卷积”,而是“深层特征不用卷积主导”

这一点很重要。

从结构上看,这篇模型并不是彻底抛弃卷积,而是采用了浅层卷积 + 深层 Mamba 的混合设计:

  • 前 3 层浅层特征提取:Conv Block
  • 后 3 层深层特征提取:PVM Layer(并行 Vision Mamba)

也就是说,作者承认卷积在浅层局部纹理提取上仍然高效;但在深层语义和远距离关系建模上,作者更相信 Mamba。

所以更准确地说,这篇论文不是“卷积没用”,而是:

卷积适合浅层局部特征,Mamba 更适合深层全局建模;如果目标是极致轻量化下保持性能,深层主干更值得换成 Mamba。


四、作者为什么觉得 Mamba 特别适合做“超轻量”

这篇论文真正的创新点,不只是“用了 Mamba”,而是作者发现了一个非常关键的现象:

Mamba 的参数量对通道数极其敏感

作者详细拆解了 Mamba 内部的参数来源,指出:

  • 内部扩张通道 d_inner = expand * d_model
  • 输入/输出投影层参数都直接受 d_model 控制
  • SSM 中间线性层、步长投影、内部卷积、状态矩阵参数,也都高度依赖通道数

结论就是:
Mamba 的参数爆炸,最主要的触发因素是通道数。

作者甚至给了一个具体例子:
当通道数从 1024 降到 256(变为四分之一)时,Mamba 参数从 23,435,264 降到 1,484,288,降幅 93.7%

这就给了作者一个设计启发:

既然 Mamba 在“低通道”下特别省参数,那就把特征通道切分后并行送进多个 Mamba。

于是他们提出了 PVM Layer


五、为什么是 Mamba + 并行,而不是直接换成卷积

PVM Layer 的做法是:

  1. 把输入特征按通道切成 4 份,每份是 C/4
  2. 每份分别走一个 Mamba
  3. 再拼接回来,保持总通道数不变

这样做的本质是:

  • 保留 Mamba 的远程依赖建模能力
  • 同时利用 Mamba 对通道数敏感这一点,把参数大幅压低

论文说得很明确:单个处理 C/4 通道的 Vision Mamba,参数只有原来的 6.3%;四个并起来,总体仍能比原始方案减少 74.8% 参数。

这就是作者不用卷积替换深层模块的关键逻辑:

卷积虽然简单,但无法自然补上长程依赖;Mamba 虽然原版也不够轻,但通过通道并行切分,可以同时保留长程建模和轻量化。


六、论文有没有直接证明“换回卷积会更差”?

有,而且证据挺直接。

在附录的消融实验里,作者把 UltraLight VM-UNet 中的 PVM Layer 分别替换成标准卷积,结果是:

  • 替换编码器 PVM:参数从 0.049M 增到 0.080M,性能下降
  • 替换解码器 PVM:参数从 0.049M 增到 0.080M,性能下降
  • 编码器和解码器都替换成卷积:参数增到 0.123M,GFLOPs 也上升,性能仍不如原模型

作者的总结是:
替换掉 PVM Layer 后,参数和计算量上升,同时性能下降。

这基本就是论文对“为什么不使用卷积”的最强实证回答。


七、把作者的理由概括成一句话

论文选择 Mamba 而非卷积,是因为作者认为:

在轻量医学分割里,卷积更擅长局部建模,但难以低成本建模长程依赖;而 Mamba 既能建模远距离关系,又比 Transformer 更省复杂度。再结合通道切分并行后,Mamba 还能把参数量压到比卷积轻量模型更低,同时性能更强。


八、我的评价:这篇论文的“为什么用 Mamba”有说服力吗?

有说服力的地方

  1. 问题定义很清楚:不是追求绝对最高精度,而是追求“极轻量 + 仍有竞争力”

  2. 理论分析和结构设计是连上的:先分析 Mamba 参数为什么大,再提出并行切分

  3. 实验支持比较充分

    • 和轻量卷积模型比
    • 和其他 Mamba 模型比
    • 自己再做卷积替换消融

也要保留一点审慎

  1. 这篇论文的结论主要是在皮肤病灶分割这个任务上成立
  2. “Mamba 一定比卷积更适合所有轻量视觉任务”这个结论,论文还没有完全证明
  3. 它的优势很大程度上依赖于 PVM 这种并行切分设计,不是说“原始 Mamba 天生就全面优于卷积”

所以更严谨的表述是:

这篇论文证明的不是“卷积不如 Mamba”,而是“在作者设计的轻量分割框架里,经过并行切分优化后的 Mamba,比卷积更适合作为深层主干模块”。


九、最终结论

这篇论文之所以使用 Mamba 而不主要使用 卷积,原因可以压缩成三点:

  1. 卷积偏局部,难处理长距离依赖,而病灶分割需要更强的全局关系建模。
  2. Mamba 兼顾长程建模和线性复杂度,比 Transformer 更适合做轻量模型。
  3. 作者发现 Mamba 对通道数极敏感,于是用并行切分的 PVM Layer,把参数压到极低,同时性能还优于卷积替代方案。
posted @ 2026-03-31 11:40  九叶草  阅读(53)  评论(0)    收藏  举报