Agentic Vision
两项代表性的研究
Gemini 3: 显式视觉规划
「思考-行动-观察」(Think-Act-Observe)的闭环,利用代码执行作为视觉推理的工具,将被动的视觉理解转化为主动的智能体过程。
- 思考(Think):模型分析用户查询和初始图像,制定多步计划。
- 行动(Act):模型生成并执行Python代码来主动操纵图像(如裁剪、旋转、标注)或分析图像(如运行计算、计数边界框等)。
- 观察(Observe):变换后的图像被追加到模型的上下文窗口中。这允许模型在生成最终响应之前,以更好的上下文检查新数据。
response = client.models.generate_content(
model="gemini-3-flash-preview",
contents=[image, "Zoom into the expression pedals and tell me how many pedals are there?"],
config=types.GenerateContentConfig(
tools=[types.Tool(code_execution=types.ToolCodeExecution)]
)
DeepSeek-OCR:隐式视觉规划
现有方法几乎都采用 固定的 raster scan(从左到右、从上到下) + 位置编码,先把图像进行patch化,拉成1D的序列形式,然后加入各种位置编码,最后塞入到LLM模型中进行解读。
不使用CLIP ViT而是直接使用 Decoder-only LLM 架构,然后通过 Attention Mask 设计,在同一个 Transformer 里实现两种 token:

DeepSeek-OCR 2 中最核心的设计之一,是引入了 Causal Flow Query(视觉因果流)。可以把这些 query 理解为一组“阅读指针”或“视觉注意力轨迹 token”:每一个 query 都能够访问整张图像对应的全部视觉 token,但在 query 之间又严格遵循因果约束——只能关注自己之前出现的 query。
DeepEncoder V2 的优势在于,可以模仿人类的阅读习惯,由 causal query 根据图像语义动态决定。这直接解决了复杂版面 OCR 的根因问题,而不是靠规则或后处理修补。
具身视觉
如何让工厂视觉检测,从“被动执行预设规则的设备”,变成“能够自主感知、决策、协同和持续学习的智能体系统”。
传统视觉检测的典型痛点
- 检测策略刚性:
- 相机安装位置、角度、曝光、光源、检测区域等,靠一次性工程调试;
- 一旦工艺、物料或环境轻微变化,就需要重新调参/改程序。
- 对变化极度不敏感:
- 型号切换、多品种小批量生产时,规则和模型切换非常依赖人工;
- 新缺陷、新工艺初期,基本只能“先大量出废品,再补规则”。
- 与产线的联动很弱:
- 多数视觉系统只给出“OK/NG/缺陷类型”,不参与“如何调整工艺、如何调整节拍和检验策略”的决策;
- 质量工程、工艺优化与现场视觉检测是割裂的。
- 闭环极长:
- 发现问题 → QA/工艺工程师分析 → 改参数/改程序 → 验证 → 上线,可能是几天甚至几周。
引入 agentic 思想的价值,就是用“会观察、会规划、会试错、会自我改进”的智能体去替代“只能跑固定脚本的程序”。
从 “视觉系统” 到 “视觉智能体” 要具备的核心能力
在工厂语境下,一个 agentic 视觉系统大致要具备:
- 感知增强
- 不只是“拍照+识别缺陷”,而是能主动调节拍摄方式、选择拍谁、从什么角度拍。
- 推理与规划
- 看到缺陷时,不只给出标签,还能推理“可能的原因”和“下一步行动”:
- 要不要复检?
- 要不要通知某个上游工位?
- 要不要临时加严某一批次检测?
- 行动与协同
- 能驱动相机、光源、机械臂、输送线做动作;
- 能与其他工位/系统(MES/APS/设备控制)协同调整策略。
- 持续学习与自我优化
- 能从误检/漏检、返工记录、客诉案例中持续修正自己的判断与策略;
- 模型更新与策略改进尽量少依赖人工大规模介入。
关键技术探索方向
方向 1:自适应视觉检测智能体(Adaptive Vision Agent)
目标:让每个相机/工位,从“被动执行固定参数”变成“会自己调参数、调策略的本地智能体”。
可探索能力:
- 在线自适应成像控制
- 强化学习或策略搜索:根据实时图像质量和检测表现,自动调节:
- 曝光、增益、白平衡;
- 光源亮度、闪光节奏;
- ROI 区域、分辨率。
- 使用数字孪生(虚拟产线+虚拟相机)先离线训练,再上线微调,可大幅降低试错成本。
- 自适应检测策略
- 智能体记录每一段时间的:
- 漏检、误检率;
- 缺陷分布(位置、类型、批次相关性)。
- 利用这些统计和反馈:
- 动态调整阈值;
- 动态调整需要重点关注的区域(例如某批次只在边缘出问题,就加密边缘检测)。
方向 2:零样本 / 少样本缺陷检测智能体
目标:解决新缺陷、新产品上线时“样本极少、规则难写”的老大难问题。
可探索能力:
- 利用大模型的跨类泛化能力
- 使用通用视觉/多模态模型(如 CLIP 类、Diffusion Backbone)作为基础特征抽取器;
- 通过自然语言描述或少量典型样本,让智能体快速理解“这是哪一类缺陷,关注哪个区域”。
- 主动学习与人机协同标注
- 智能体自动挑选“高不确定性样本”,推送给质检工程师确认;
- 工程师只需标注这少数难样本,绝大部分样本由模型自标或弱监督即可。
- 生成式数据增强
- 智能体在本地使用生成模型合成多种形态的缺陷图(不同位置、不同光照、不同严重程度),
- 迅速扩充样本空间,加速新缺陷检测能力的收敛。
方向 3:具身智能视觉检测(Embodied Vision Agent)
目标:让视觉检测不再依赖固定相机,而是和机械臂、AGV 等实体执行器结合,形成“会走、会看、会动手”的检测 Agent。
典型探索方向:
- 机动复检 / 抽检智能体
- 在固定工位视觉检测基础上,引入一个具身智能体:
- 由移动平台或机械臂+相机构成;
- 负责对“边界样本”或“高价值样本”做更高精度复检。
- 复杂大件的多角度检测
- 对于体积大、结构复杂的零件(如车身、机加件、大型板材),
- 具身视觉 Agent 可自己规划多视角拍摄路径;
- 根据实时检测结果动态补拍缺陷区域。
- 视觉 + 操作闭环
- 检测到缺陷后,机械臂自动打标、分拣或进行简单返修预处理(如清理毛刺、擦拭污渍)。
Agentic OCR
把“agentic”理解为:系统具备目标驱动、可分解任务、自主决策、能调用工具并进行自我修正的“智能体式”能力,而不是单次前向的被动 OCR 模型。
一、从“字符识别”到“Agentic Document Extraction(智能体式文档抽取)”
1. 端到端、布局感知的文档解析 Agent
研究核心:
不再把“OCR → 布局分析 → 字段抽取”当作刚性流水线,而是让一个 VLM/LLM agent 根据目标任务,自选和组合这几个子步骤,必要时反复回看页面、调整布局假设。
可研究的子课题:
- 文档任务规划:
给定“提取合同中的付款条款”这类高层指令,agent 自动规划为:
1)检测并理解目录/标题结构
2)定位与“支付”“费用”“账期”等语义相关段落
3)在段落内做精细 OCR + span 抽取
- 布局驱动的视觉回访:
对表格、脚注、跨栏等复杂结构,agent 在初次提取后,若发现语义不完整或不一致,主动回到页面图像再看一次具体区域,而不是只依赖一次性 OCR 结果。
- 输出结构学习:
不止是“文本框+坐标”,而是直接输出 JSON、Markdown、HTML 等结构化结果,并用 agent 对输出进行一致性和完整性自检。
2. 从“OCR+LLM 串联”到“有决策能力的组合系统”
常见做法是“先 OCR,结果丢给 LLM 读”。agentic 方式为:
- LLM 根据问题,动态决定:
- 是否需要高精度 OCR(贵)还是轻量 OCR(便宜)
- 是整页识别,还是只识别某个感兴趣区域(ROI)
- 根据任务难度和成本约束,自动在“端到端 VLM OCR(直接从图像生成 Markdown/HTML)”与“传统 OCR+后处理”之间切换和混合使用。
二、带有自我监控与纠错能力的 OCR Agent
1. 不确定性感知与主动修正
传统 OCR 输出结果和置信度,后处理比较机械。agentic 思路下:
- 置信度与语义约束联合建模
- 字符级/词级置信度 + 语言模型先验(拼写、语法)
- 业务约束(如发票金额必须为正数、日期必须在合理区间)
- 根据这些信号,agent 触发:
- 再识别(如放大局部区域、图像增强后重跑 OCR)
- 语义猜测 + 标记不确定字段
- 主动询问用户或其他 agent(如“该字段更可能是 3 还是 8?”)
2. 多轮 refinement 的迭代式识别
研究思路:
- 第一次识别得到一个“粗糙版本”
- LLM/VLM 基于全文语义和业务规则,对可疑区域生成“纠错候选+理由”;
- 再次调用视觉模型只针对这些区域进行二次识别;
- 循环几轮,直到满足“全局一致性 + 局部置信度”的停止条件。
三、面向“理解”和“问答”的文档智能体
把 OCR 看成一个子能力,真正的目标是:围绕文档完成复杂任务。
1. 文档问答与信息寻址 Agent
研究点:
- 布局感知的索引构建:
将 OCR 结果 + 版面信息 + 段落/表格/图注等结构组织成一个可检索的“文档图谱”。
- 问答时,agent 负责:
- 解析问题 → 决定哪些页面/区域可能相关
- 根据需要触发(重新)局部 OCR 或图像放大
- 从文本+视觉线索一起推断答案(例如:表格中用红色/加粗来表达含义)
- 针对多页长文档的跨页推理:条款引用、公式编号、附录引用等。
2. 面向任务的复合推理
在垂直领域,把“识别 → 理解 → 计算/判断”打通:
- 财务:
- Agent 自动识别资产负债表、利润表、现金流量表
- 抽取关键科目数值
- 计算指标(如资产负债率),识别异常
- 医疗:
- 从多种报告(检查报告、出院小结、处方笺)抽取诊断信息
- 做合规检查(比如药物剂量是否在规范区间)
- 法律:
- 合同条款抽取 + 风险点标注(赔偿责任、违约金、排他条款等)
四、智能体驱动的布局与结构理解
1. 智能体参与的布局解析与阅读顺序推断
复杂版面的关键问题往往不在字符识别,而在:
- 什么是“一个自然段”?
- “阅读顺序”是什么?
- 这张大表格是几维的?合并单元格如何还原?
agentic 研究点:
- 把布局分析当成一个交互式决策过程而不是一次性预测:
agent 先粗分块 → 针对模糊区域(如跨栏文字、环绕图片文字)发起局部检查 → 决定最终块结构和阅读顺序;
- 引入任务依赖的布局理解:
为“信息抽取”“问答”“检索”分别优化不同的阅读顺序,而不是单一的“线性顺序”。
2. 表格与图文混排的结构重建
- 让 agent 反复“看-想-改”:
- 初次将表格解析为 Markdown/HTML
- 用 LLM 检查是否列数、标题、合计行等逻辑自洽
- 若不自洽,回到局部图像重新识别,或调整结构假设;
- 对图文混排页(比如技术规格书、设备铭牌照片),agent 把视觉对象与文字标签匹配成结构化对象(entity),形成 JSON schema。
Octopus案例解析
Octopus论文撰写的一篇agentic AI论文:https://arxiv.org/pdf/2511.15351
该论文与之前相关研究的差异见下图:

- Direct Inference by Multimodal/Vision LLMs:一次性推理和分析、分析的颗粒度比较大
- Tool-Driven Visual Exploration:工具比如detectors, segmenters, OCR systems, zooming, cropping, or search等,比较大的问题是工具组织不系统、单轮调用等
- Programmatic Visual Manipulation:通过生成代码来做细粒度操作,如:cropping, annotation, and geometric computation等;生成代码的错误很难纠正。
- Intrinsic Visual Imagination:

本文来自博客园,作者:limingqi,转载请注明原文链接:https://www.cnblogs.com/limingqi/p/19564785
浙公网安备 33010602011771号