UltraLight VM-UNet阅读
这篇论文选择 Mamba 而不是纯卷积,核心原因不是“卷积不能做分割”,而是作者要解决一个更具体的问题:
在移动医疗/轻量化场景下,如何同时做到极低参数、低算力开销、又保留较强的远程依赖建模能力。 论文认为,Mamba 比卷积更适合作为这个目标下的“轻量主干单元”。
一、论文的核心目标是什么
作者一开始就把目标说得很明确:
传统方法为了提升分割精度,往往不断堆复杂模块,但这不适合移动医疗设备,因为真实临床环境有明显的计算和内存限制。作者希望做一个参数极低、GFLOPs 极低、同时性能仍有竞争力的皮肤病灶分割模型。
他们最终给出的 UltraLight VM-UNet 做到:
- 0.049M 参数量
- 0.060 GFLOPs
- 在 ISIC2017 / ISIC2018 / PH2 三个数据集上仍保持有竞争力的分割结果。
二、为什么不用卷积,而要用 Mamba
1)作者认为卷积的天然短板是“远距离依赖”
论文在引言里直接指出,卷积擅长局部特征提取,但在建立远距离信息关联方面存在不足。虽然可以用大卷积核缓解,但这通常会继续增加复杂度。
对皮肤病灶分割来说,这一点很关键,因为病灶区域的判断不仅靠局部纹理,还常常依赖:
- 病灶整体形状
- 长距离的边界一致性
- 大范围上下文和背景关系
而这些都不是标准卷积最擅长的部分。作者把 Mamba 视为一种既能建模长程依赖、又比注意力更省资源的替代方案。
2)相比 Transformer,Mamba 更适合轻量化
论文没有简单拿卷积和 Mamba 对比,而是放在三者框架里看:
- 卷积:局部建模强,但长程依赖弱
- Transformer:长程依赖强,但自注意力复杂度高,图像越大越贵
- Mamba/SSM:对输入大小呈线性复杂度,还能较好捕获远程依赖
所以作者的逻辑是:
如果想在轻量模型里同时保留“全局/远程建模能力”,Mamba 比卷积更有潜力;如果还要控制计算复杂度,Mamba 又比 Transformer 更现实。
3)实验上,卷积轻量模型的“性能-复杂度平衡”不如 Mamba
论文专门提到一个对比:MALUNet 是基于卷积的轻量模型,参数和计算量已经很低,但其性能仍低于文中的 Mamba 方案。作者据此得出一个判断:
卷积式轻量模型更难同时兼顾性能和计算复杂度。
这是这篇论文“为什么不用卷积”的最直接实验依据之一。
三、但这里不是“完全不用卷积”,而是“深层特征不用卷积主导”
这一点很重要。
从结构上看,这篇模型并不是彻底抛弃卷积,而是采用了浅层卷积 + 深层 Mamba 的混合设计:
- 前 3 层浅层特征提取:Conv Block
- 后 3 层深层特征提取:PVM Layer(并行 Vision Mamba)
也就是说,作者承认卷积在浅层局部纹理提取上仍然高效;但在深层语义和远距离关系建模上,作者更相信 Mamba。
所以更准确地说,这篇论文不是“卷积没用”,而是:
卷积适合浅层局部特征,Mamba 更适合深层全局建模;如果目标是极致轻量化下保持性能,深层主干更值得换成 Mamba。
四、作者为什么觉得 Mamba 特别适合做“超轻量”
这篇论文真正的创新点,不只是“用了 Mamba”,而是作者发现了一个非常关键的现象:
Mamba 的参数量对通道数极其敏感
作者详细拆解了 Mamba 内部的参数来源,指出:
- 内部扩张通道
d_inner = expand * d_model - 输入/输出投影层参数都直接受
d_model控制 - SSM 中间线性层、步长投影、内部卷积、状态矩阵参数,也都高度依赖通道数
结论就是:
Mamba 的参数爆炸,最主要的触发因素是通道数。
作者甚至给了一个具体例子:
当通道数从 1024 降到 256(变为四分之一)时,Mamba 参数从 23,435,264 降到 1,484,288,降幅 93.7%。
这就给了作者一个设计启发:
既然 Mamba 在“低通道”下特别省参数,那就把特征通道切分后并行送进多个 Mamba。
于是他们提出了 PVM Layer。
五、为什么是 Mamba + 并行,而不是直接换成卷积
PVM Layer 的做法是:
- 把输入特征按通道切成 4 份,每份是
C/4 - 每份分别走一个 Mamba
- 再拼接回来,保持总通道数不变
这样做的本质是:
- 保留 Mamba 的远程依赖建模能力
- 同时利用 Mamba 对通道数敏感这一点,把参数大幅压低
论文说得很明确:单个处理 C/4 通道的 Vision Mamba,参数只有原来的 6.3%;四个并起来,总体仍能比原始方案减少 74.8% 参数。
这就是作者不用卷积替换深层模块的关键逻辑:
卷积虽然简单,但无法自然补上长程依赖;Mamba 虽然原版也不够轻,但通过通道并行切分,可以同时保留长程建模和轻量化。
六、论文有没有直接证明“换回卷积会更差”?
有,而且证据挺直接。
在附录的消融实验里,作者把 UltraLight VM-UNet 中的 PVM Layer 分别替换成标准卷积,结果是:
- 替换编码器 PVM:参数从 0.049M 增到 0.080M,性能下降
- 替换解码器 PVM:参数从 0.049M 增到 0.080M,性能下降
- 编码器和解码器都替换成卷积:参数增到 0.123M,GFLOPs 也上升,性能仍不如原模型
作者的总结是:
替换掉 PVM Layer 后,参数和计算量上升,同时性能下降。
这基本就是论文对“为什么不使用卷积”的最强实证回答。
七、把作者的理由概括成一句话
论文选择 Mamba 而非卷积,是因为作者认为:
在轻量医学分割里,卷积更擅长局部建模,但难以低成本建模长程依赖;而 Mamba 既能建模远距离关系,又比 Transformer 更省复杂度。再结合通道切分并行后,Mamba 还能把参数量压到比卷积轻量模型更低,同时性能更强。
八、我的评价:这篇论文的“为什么用 Mamba”有说服力吗?
有说服力的地方
-
问题定义很清楚:不是追求绝对最高精度,而是追求“极轻量 + 仍有竞争力”
-
理论分析和结构设计是连上的:先分析 Mamba 参数为什么大,再提出并行切分
-
实验支持比较充分:
- 和轻量卷积模型比
- 和其他 Mamba 模型比
- 自己再做卷积替换消融
也要保留一点审慎
- 这篇论文的结论主要是在皮肤病灶分割这个任务上成立
- “Mamba 一定比卷积更适合所有轻量视觉任务”这个结论,论文还没有完全证明
- 它的优势很大程度上依赖于 PVM 这种并行切分设计,不是说“原始 Mamba 天生就全面优于卷积”
所以更严谨的表述是:
这篇论文证明的不是“卷积不如 Mamba”,而是“在作者设计的轻量分割框架里,经过并行切分优化后的 Mamba,比卷积更适合作为深层主干模块”。
九、最终结论
这篇论文之所以使用 Mamba 而不主要使用 卷积,原因可以压缩成三点:
- 卷积偏局部,难处理长距离依赖,而病灶分割需要更强的全局关系建模。
- Mamba 兼顾长程建模和线性复杂度,比 Transformer 更适合做轻量模型。
- 作者发现 Mamba 对通道数极敏感,于是用并行切分的 PVM Layer,把参数压到极低,同时性能还优于卷积替代方案。

浙公网安备 33010602011771号