Segment Anything

Segment Anything

SAM:将位置信息等作为提示词输入模型辅助分割。
代码仓库
注:笔者对相关领域的工作并不了解,仅记录个人理解

动机

img

基于大量数据,训练一个可通过提示词操作的分割模型。

方法

img

模型

主要分为三个模块:

  • 图像编码器:提取图像特征
  • 提示词编码器:将输入的提示词转化为特征
  • 掩码编码器:输出预测的掩码

训练

参照已有工作,使用了focal loss和dice loss。

实验

img

能够实现一种交互式、类似超像素分割的效果。

总结

所谓“大模型”风潮下又一“力大砖飞”的经典工作。虽然将位置信息等作为提示词输入网络实现“交互式”是一个有趣的框架,但也就不太适用于需要完全自动化批量处理的场景。

在不输入额外提示词时,其输出的结果类似智能化的超像素分割。而在提示词辅助下则是进一步明确了部分目标的边界,某种程度上与Graph-Cut有些相似。

不过显然其效果很大程度上依赖于训练数据集。一些非自然图像场景(如MedSAM)上的尝试证明,面向特定的场景往往需要收集相应的数据进行训练。

posted @ 2025-09-29 10:44  Bcai  阅读(27)  评论(0)    收藏  举报