Agentic Vision

两项代表性的研究

Gemini 3: 显式视觉规划

「思考-行动-观察」(Think-Act-Observe)的闭环,利用代码执行作为视觉推理的工具,将被动的视觉理解转化为主动的智能体过程。

  • 思考(Think):模型分析用户查询和初始图像,制定多步计划。
  • 行动(Act):模型生成并执行Python代码来主动操纵图像(如裁剪、旋转、标注)或分析图像(如运行计算、计数边界框等)。
  • 观察(Observe):变换后的图像被追加到模型的上下文窗口中。这允许模型在生成最终响应之前,以更好的上下文检查新数据。
response = client.models.generate_content(
    model="gemini-3-flash-preview",
    contents=[image, "Zoom into the expression pedals and tell me how many pedals are there?"],
    config=types.GenerateContentConfig(
        tools=[types.Tool(code_execution=types.ToolCodeExecution)]
    )

DeepSeek-OCR:隐式视觉规划

现有方法几乎都采用 固定的 raster scan(从左到右、从上到下) + 位置编码,先把图像进行patch化,拉成1D的序列形式,然后加入各种位置编码,最后塞入到LLM模型中进行解读。

不使用CLIP ViT而是直接使用 Decoder-only LLM 架构,然后通过 Attention Mask 设计,在同一个 Transformer 里实现两种 token:

image

DeepSeek-OCR 2 中最核心的设计之一,是引入了 Causal Flow Query(视觉因果流)。可以把这些 query 理解为一组“阅读指针”或“视觉注意力轨迹 token”:每一个 query 都能够访问整张图像对应的全部视觉 token,但在 query 之间又严格遵循因果约束——只能关注自己之前出现的 query。

DeepEncoder V2 的优势在于,可以模仿人类的阅读习惯,由 causal query 根据图像语义动态决定。这直接解决了复杂版面 OCR 的根因问题,而不是靠规则或后处理修补。

具身视觉

如何让工厂视觉检测,从“被动执行预设规则的设备”,变成“能够自主感知、决策、协同和持续学习的智能体系统”。

传统视觉检测的典型痛点

  • 检测策略刚性
    • 相机安装位置、角度、曝光、光源、检测区域等,靠一次性工程调试;
    • 一旦工艺、物料或环境轻微变化,就需要重新调参/改程序。
  • 对变化极度不敏感
    • 型号切换、多品种小批量生产时,规则和模型切换非常依赖人工;
    • 新缺陷、新工艺初期,基本只能“先大量出废品,再补规则”。
  • 与产线的联动很弱
    • 多数视觉系统只给出“OK/NG/缺陷类型”,不参与“如何调整工艺、如何调整节拍和检验策略”的决策;
    • 质量工程、工艺优化与现场视觉检测是割裂的。
  • 闭环极长
    • 发现问题 → QA/工艺工程师分析 → 改参数/改程序 → 验证 → 上线,可能是几天甚至几周。

引入 agentic 思想的价值,就是用“会观察、会规划、会试错、会自我改进”的智能体去替代“只能跑固定脚本的程序”。

从 “视觉系统” 到 “视觉智能体” 要具备的核心能力

在工厂语境下,一个 agentic 视觉系统大致要具备:

  1. 感知增强
    • 不只是“拍照+识别缺陷”,而是能主动调节拍摄方式、选择拍谁、从什么角度拍。
  2. 推理与规划
    • 看到缺陷时,不只给出标签,还能推理“可能的原因”和“下一步行动”:
      • 要不要复检?
      • 要不要通知某个上游工位?
      • 要不要临时加严某一批次检测?
  3. 行动与协同
    • 能驱动相机、光源、机械臂、输送线做动作;
    • 能与其他工位/系统(MES/APS/设备控制)协同调整策略。
  4. 持续学习与自我优化
    • 能从误检/漏检、返工记录、客诉案例中持续修正自己的判断与策略;
    • 模型更新与策略改进尽量少依赖人工大规模介入。

关键技术探索方向

方向 1:自适应视觉检测智能体(Adaptive Vision Agent)

目标:让每个相机/工位,从“被动执行固定参数”变成“会自己调参数、调策略的本地智能体”。

可探索能力:

  1. 在线自适应成像控制
    • 强化学习或策略搜索:根据实时图像质量和检测表现,自动调节:
      • 曝光、增益、白平衡;
      • 光源亮度、闪光节奏;
      • ROI 区域、分辨率。
    • 使用数字孪生(虚拟产线+虚拟相机)先离线训练,再上线微调,可大幅降低试错成本。
  2. 自适应检测策略
    • 智能体记录每一段时间的:
      • 漏检、误检率;
      • 缺陷分布(位置、类型、批次相关性)。
    • 利用这些统计和反馈:
      • 动态调整阈值;
      • 动态调整需要重点关注的区域(例如某批次只在边缘出问题,就加密边缘检测)。
方向 2:零样本 / 少样本缺陷检测智能体

目标:解决新缺陷、新产品上线时“样本极少、规则难写”的老大难问题。

可探索能力:

  1. 利用大模型的跨类泛化能力
    • 使用通用视觉/多模态模型(如 CLIP 类、Diffusion Backbone)作为基础特征抽取器;
    • 通过自然语言描述或少量典型样本,让智能体快速理解“这是哪一类缺陷,关注哪个区域”。
  2. 主动学习与人机协同标注
    • 智能体自动挑选“高不确定性样本”,推送给质检工程师确认;
    • 工程师只需标注这少数难样本,绝大部分样本由模型自标或弱监督即可。
  3. 生成式数据增强
    • 智能体在本地使用生成模型合成多种形态的缺陷图(不同位置、不同光照、不同严重程度),
    • 迅速扩充样本空间,加速新缺陷检测能力的收敛。
方向 3:具身智能视觉检测(Embodied Vision Agent)

目标:让视觉检测不再依赖固定相机,而是和机械臂、AGV 等实体执行器结合,形成“会走、会看、会动手”的检测 Agent。

典型探索方向:

  1. 机动复检 / 抽检智能体
    • 在固定工位视觉检测基础上,引入一个具身智能体:
      • 由移动平台或机械臂+相机构成;
      • 负责对“边界样本”或“高价值样本”做更高精度复检。
  2. 复杂大件的多角度检测
    • 对于体积大、结构复杂的零件(如车身、机加件、大型板材),
      • 具身视觉 Agent 可自己规划多视角拍摄路径;
      • 根据实时检测结果动态补拍缺陷区域。
  3. 视觉 + 操作闭环
    • 检测到缺陷后,机械臂自动打标、分拣或进行简单返修预处理(如清理毛刺、擦拭污渍)。

Agentic OCR

把“agentic”理解为:系统具备目标驱动、可分解任务、自主决策、能调用工具并进行自我修正的“智能体式”能力,而不是单次前向的被动 OCR 模型。

一、从“字符识别”到“Agentic Document Extraction(智能体式文档抽取)”

1. 端到端、布局感知的文档解析 Agent

研究核心

不再把“OCR → 布局分析 → 字段抽取”当作刚性流水线,而是让一个 VLM/LLM agent 根据目标任务,自选和组合这几个子步骤,必要时反复回看页面、调整布局假设。

可研究的子课题:

  • 文档任务规划:

给定“提取合同中的付款条款”这类高层指令,agent 自动规划为:

1)检测并理解目录/标题结构

2)定位与“支付”“费用”“账期”等语义相关段落

3)在段落内做精细 OCR + span 抽取

  • 布局驱动的视觉回访:

对表格、脚注、跨栏等复杂结构,agent 在初次提取后,若发现语义不完整或不一致,主动回到页面图像再看一次具体区域,而不是只依赖一次性 OCR 结果。

  • 输出结构学习:

不止是“文本框+坐标”,而是直接输出 JSON、Markdown、HTML 等结构化结果,并用 agent 对输出进行一致性和完整性自检。

2. 从“OCR+LLM 串联”到“有决策能力的组合系统”

常见做法是“先 OCR,结果丢给 LLM 读”。agentic 方式为:

  • LLM 根据问题,动态决定:
    • 是否需要高精度 OCR(贵)还是轻量 OCR(便宜)
    • 是整页识别,还是只识别某个感兴趣区域(ROI)
  • 根据任务难度和成本约束,自动在“端到端 VLM OCR(直接从图像生成 Markdown/HTML)”与“传统 OCR+后处理”之间切换和混合使用。

二、带有自我监控与纠错能力的 OCR Agent

1. 不确定性感知与主动修正

传统 OCR 输出结果和置信度,后处理比较机械。agentic 思路下:

  • 置信度与语义约束联合建模
    • 字符级/词级置信度 + 语言模型先验(拼写、语法)
    • 业务约束(如发票金额必须为正数、日期必须在合理区间)
  • 根据这些信号,agent 触发
    • 再识别(如放大局部区域、图像增强后重跑 OCR)
    • 语义猜测 + 标记不确定字段
    • 主动询问用户或其他 agent(如“该字段更可能是 3 还是 8?”)
2. 多轮 refinement 的迭代式识别

研究思路:

  • 第一次识别得到一个“粗糙版本”
  • LLM/VLM 基于全文语义和业务规则,对可疑区域生成“纠错候选+理由”;
  • 再次调用视觉模型只针对这些区域进行二次识别;
  • 循环几轮,直到满足“全局一致性 + 局部置信度”的停止条件。

三、面向“理解”和“问答”的文档智能体

把 OCR 看成一个子能力,真正的目标是:围绕文档完成复杂任务。

1. 文档问答与信息寻址 Agent

研究点:

  • 布局感知的索引构建

将 OCR 结果 + 版面信息 + 段落/表格/图注等结构组织成一个可检索的“文档图谱”。

  • 问答时,agent 负责:
    • 解析问题 → 决定哪些页面/区域可能相关
    • 根据需要触发(重新)局部 OCR 或图像放大
    • 从文本+视觉线索一起推断答案(例如:表格中用红色/加粗来表达含义)
  • 针对多页长文档的跨页推理:条款引用、公式编号、附录引用等。
2. 面向任务的复合推理

在垂直领域,把“识别 → 理解 → 计算/判断”打通:

  • 财务:
    • Agent 自动识别资产负债表、利润表、现金流量表
    • 抽取关键科目数值
    • 计算指标(如资产负债率),识别异常
  • 医疗:
    • 从多种报告(检查报告、出院小结、处方笺)抽取诊断信息
    • 做合规检查(比如药物剂量是否在规范区间)
  • 法律:
    • 合同条款抽取 + 风险点标注(赔偿责任、违约金、排他条款等)

四、智能体驱动的布局与结构理解

1. 智能体参与的布局解析与阅读顺序推断

复杂版面的关键问题往往不在字符识别,而在:

  • 什么是“一个自然段”?
  • “阅读顺序”是什么?
  • 这张大表格是几维的?合并单元格如何还原?

agentic 研究点:

  • 把布局分析当成一个交互式决策过程而不是一次性预测:

agent 先粗分块 → 针对模糊区域(如跨栏文字、环绕图片文字)发起局部检查 → 决定最终块结构和阅读顺序;

  • 引入任务依赖的布局理解

为“信息抽取”“问答”“检索”分别优化不同的阅读顺序,而不是单一的“线性顺序”。

2. 表格与图文混排的结构重建
  • 让 agent 反复“看-想-改”:
    • 初次将表格解析为 Markdown/HTML
    • 用 LLM 检查是否列数、标题、合计行等逻辑自洽
    • 若不自洽,回到局部图像重新识别,或调整结构假设;
  • 对图文混排页(比如技术规格书、设备铭牌照片),agent 把视觉对象与文字标签匹配成结构化对象(entity),形成 JSON schema。

 

Octopus案例解析

Octopus论文撰写的一篇agentic AI论文:https://arxiv.org/pdf/2511.15351

该论文与之前相关研究的差异见下图:

image

  • Direct Inference by Multimodal/Vision LLMs:一次性推理和分析、分析的颗粒度比较大
  • Tool-Driven Visual Exploration:工具比如detectors, segmenters, OCR systems, zooming, cropping, or search等,比较大的问题是工具组织不系统、单轮调用等
  • Programmatic Visual Manipulation:通过生成代码来做细粒度操作,如:cropping, annotation, and geometric computation等;生成代码的错误很难纠正。
  • Intrinsic Visual Imagination:

image

 

 

posted on 2026-02-02 15:33  limingqi  阅读(115)  评论(0)    收藏  举报

导航