Segment Anything
Segment Anything
SAM:将位置信息等作为提示词输入模型辅助分割。
代码仓库
注:笔者对相关领域的工作并不了解,仅记录个人理解
动机

基于大量数据,训练一个可通过提示词操作的分割模型。
方法

模型
主要分为三个模块:
- 图像编码器:提取图像特征
- 提示词编码器:将输入的提示词转化为特征
- 掩码编码器:输出预测的掩码
训练
参照已有工作,使用了focal loss和dice loss。
实验

能够实现一种交互式、类似超像素分割的效果。
总结
所谓“大模型”风潮下又一“力大砖飞”的经典工作。虽然将位置信息等作为提示词输入网络实现“交互式”是一个有趣的框架,但也就不太适用于需要完全自动化批量处理的场景。
在不输入额外提示词时,其输出的结果类似智能化的超像素分割。而在提示词辅助下则是进一步明确了部分目标的边界,某种程度上与Graph-Cut有些相似。
不过显然其效果很大程度上依赖于训练数据集。一些非自然图像场景(如MedSAM)上的尝试证明,面向特定的场景往往需要收集相应的数据进行训练。

浙公网安备 33010602011771号