Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning
Ophiuchus 论文完整解读
一、论文核心背景与要解决的痛点
现有医学多模态大模型(GPT-5、通用医疗 MLLM)采用纯文本思维链(Text-only CoT),整张医学图像一次性输入模型,只做全局粗判,存在三大致命缺陷:
- 忽略病灶、细胞、器官等细粒度局部视觉细节,极易漏诊微小病变;
- 频繁产生模型幻觉、假阳性 / 假阴性诊断,影像边界判断不准;
- 分割、计数、影像问答三类任务割裂,无法同时完成「病灶分割 + 图像理解 + 临床推理」联合任务。
简单说:模型只会 “扫一眼整张图”,不会像放射科医生一样放大可疑区域、分割病灶、逐层细看再下诊断。
二、核心创新:Ophiuchus 工具增强「Think with Images(带着图像思考)」框架
Ophiuchus 是一套医疗多模态智能体框架,把 MLLM 大模型 + 专业医学视觉工具深度融合,让 AI 推理过程模仿医生阅片流程,完整实现三步自主决策逻辑arXiv:
- 自主判断何时调用工具:推理到模糊、存疑的环节,主动判定需要更精细视觉证据;
- 自主定位图像观测区域:自动框选 CT/MRI/ 病理切片里可疑病灶坐标,决定 “看哪里”;
- 工具结果回流融入多模态思维链:调用工具返回的分割图、放大细节、细胞标注,直接插入推理链路,用视觉证据修正判断,形成图文交错的链式推理。
配套三大专用视觉工具(和你图片里完全对应)
- Zoom-In 区域放大:对可疑 ROI 局部放大,看清微小病灶、细胞纹理;
- SAM2 Segment Anything 医学分割:精准勾勒病灶、器官、细胞轮廓;
- BiomedParse 医学解析工具:自动识别器官、炎症细胞、病变类型并标注。
关键创新点:不止简单调用工具
过往工作只是 “模型一次性调用工具拿结果”,Ophiuchus 把工具交互嵌入完整推理循环:思考→调用工具观察→拿到新图像证据→继续推理,循环迭代直到证据充足再给出最终诊断,真正做到 “边看图像边思考”。
三、支持的三大联合医疗任务(对应图中三个演示模块)
- 医学 VQA(影像问答,CT 肾脏判读)
针对 CT/MRI 问答,先分割目标器官,放大局部细节,再结合图像证据回答有无病变;
- Lesion Segmentation(病灶分割,脑部 MRI FLAIR 病灶)
自动框选可疑区域放大,用 SAM2 精准分割病灶边界,依靠分割掩码确认病变存在;
- Object Counting(病理细胞计数,乳腺病理切片)
调用 BiomedParse 识别炎症细胞,分割细胞区域,精准统计切片内目标细胞数量。
框架可以同时完成分割、理解、临床推理多任务,而不是分开单独做。
四、训练方案:激励式工具增强学习(论文标题 “Incentivizing” 核心含义)
论文设计专属监督 / 奖励机制,引导模型学会合理调用工具,避免两种极端:
- 不滥用工具:没必要放大、分割时不重复调用,减少计算开销;
- 不吝啬工具:遇到模糊病灶主动调用,靠精细视觉证据降低误诊;
通过轨迹监督、多轮交互奖励,让 7B 轻量化医疗模型掌握自主阅片策略。
五、实验核心结果
- 同等 7B 小参数量模型,在 8 个医疗影像评测集平均得分 68.0,超越 GPT-5、OpenAI o3、Gemini 2.5 Pro;
- 工具调用准确率 97.9%,能精准判断何时、在哪调用分割 / 放大工具;
- 幻觉、假阳性诊断大幅下降,病灶分割精度、病理计数准确率显著高于纯文本 CoT 基线(就是图左侧对比的 GPT-5/Lingshu 方案)。
六、论文价值总结
- 范式创新:首次在医学领域提出「Think with Images」交互推理范式,打破 “一次性看图” 的传统多模态模型逻辑;
- 落地价值:轻量化 7B 模型就能实现高精度阅片,适合医院 AI 辅助诊断、医疗大模型商业化落地;
- 学术适配:完美匹配你研究的医学影像 AI、OCT 多模态、医疗智能体、RAG + 影像方向,论文工具链、推理范式可以直接用到你的博士课题里。
https://www.modelscope.cn/papers/2512.14157
本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/22038470
浙公网安备 33010602011771号