一、PageEyes Agent 简介
PageEyes Agent 是一个自动化 Agent 框架,可以实现用自然语言完成跨平台 UI 自动化测试、巡检和业务验证。
特点:
- PageEyes Agent 以 自然语言指令 颠覆传统 UI 自动化:无需编写脚本,也能实现复杂的跨平台测试与巡检。
- 基于 Pydantic AI 框架开发
- 其中元素信息感知能力依靠 OmniParserV2 模型,不依赖视觉语言大模型, 即使小参数的 LLM 也能胜任路径规划能力
- 支持多平台(Web、Android、HarmonyOS、iOS)
一、相关框架介绍
1.1、OmniParserV2
OmniParser V2 是由微软开发的、一个能够将任何大模型(如GPT-4o、DeepSeek等)转变为计算机操作智能体的视觉解析工具。它的核心功能是将屏幕截图转化为大模型能够理解的结构化信息,让AI真正“看懂”并操作你的电脑界面。
OmniParser是如何工作的?
OmniParser之所以能“看懂”屏幕,是因为它内部集成了几个协同工作的模型,就像一个高效的视觉信息处理流水线 :
- 可交互区域检测:首先,一个经过微调的YOLOv8模型(一种前沿的目标检测算法)会扫描整个截图,找出所有用户可以点击或交互的区域,比如按钮、图标、输入框等,并用边界框将它们一一框出 。
- 元素语义理解:光知道位置还不够,还得知道它们是干什么的。这一步,一个微调的Florence模型(一种视觉语言模型)会分析每个图标或区域,生成功能性的文字描述(例如,将一个齿轮图标描述为“设置”);同时,OCR(光学字符识别)模块会识别出截图中的所有文字,比如按钮上的“登录”或输入框旁边的“用户名” 。
- 生成结构化地图:最后,OmniParser会把前面两步得到的信息整合起来,形成一份结构化的“屏幕地图”。这份地图包含了每个元素的边界框坐标、唯一ID、功能描述以及识别出的文字,并将这些信息连同标注好的截图一起,交给上层的大模型(如PageEyes Agent)去决策 。
为什么OmniParser很重要?
在没有OmniParser这类工具之前,让AI操作屏幕通常有两种笨办法:
- 依赖底层数据:比如操作网页时依赖HTML代码,但很多应用(如桌面软件、手机App)无法获取这些信息 。
- 让大模型硬猜:直接把截图扔给GPT-4V这类模型,让它“猜”应该点哪里。这在面对复杂或没见过界面时,效果很差 。
OmniParser通过将截图结构化和标准化,带来了的几个关键提升:
- 提升准确性:为大模型提供了精准的“地图”,避免了模型因“幻觉”而点错位置。在微软的测试中,结合OmniParser后,GPT-4V在屏幕操作任务上的准确率从70.5%大幅提升至93.8% 。
- 降低大模型负担:让通用大模型无需再费力去理解像素级的图像细节,可以更专注于核心的推理和任务规划 。
- 跨平台通用:它是一个纯视觉的解决方案,不依赖于任何特定的操作系统、应用或底层框架,无论是Windows、Android还是Web界面,都能处理 。
OmniParser v2版本在性能上也有显著提升,推理延迟比上一版本降低了60%,并且能够检测到更小的屏幕元素 。目前,该项目已在GitHub上开源,受到广泛关注 。
1.2、Pydantic AI
Pydantic AI 是一个由 Pydantic 团队官方出品的 Python 框架,专门用于构建生产级的生成式 AI 智能体(Agent)。它的核心理念是将 Pydantic 强大的数据验证能力和 Python 类型提示引入 AI 应用开发中,旨在提供类似 FastAPI 那样简洁、可靠且符合工程化的开发体验 。
简单来说,如果说你之前了解的 OmniParserV2 是让 AI 能“看懂”屏幕的眼睛,那么 Pydantic AI 就是为 AI 设计和构建可靠“大脑”与“身体”的工程框架。它专注于解决大语言模型输出不可控、数据格式混乱的问题,让开发者能够信心十足地构建稳定、可维护的 AI 应用 。
核心特性
- 类型安全与结构化输出:这是 Pydantic AI 最核心的优势。它强制要求 LLM 的输出必须符合你用 Pydantic 模型预定义的格式,将不可预测的文本或 JSON 直接转换为经过验证的 Python 对象 。这彻底解决了字段缺失、类型错误等“差不多但不对”的生产环境顽疾 。
- 模型无关性:框架支持几乎所有主流 LLM 提供商和模型,包括 OpenAI、Anthropic、Google Gemini、DeepSeek、Hugging Face Inference、Ollama 等 。你可以轻松切换底层模型,而无需改动核心业务代码。
- 一流的可观测性:与 Pydantic 团队推出的可观测性平台 Pydantic Logfire 无缝集成 。你可以通过 Logfire 实时追踪 Agent 的运行轨迹、查看工具调用详情、监控成本和进行性能评估,这对于调试和优化复杂 Agent 至关重要 。
- 强大的工具调用与依赖注入:可以轻松地将任何 Python 函数注册为 AI 可调用的工具(Tool)。同时,它内置了优雅的依赖注入系统,可以安全、便捷地将数据库连接、API 客户端等外部资源传递给工具函数,使代码更清晰、更易测试 。
- 生产级功能:框架提供了构建可靠应用所需的一系列高级功能,如持久化执行(Agent 可在崩溃后恢复)、人在回路(人工审批敏感操作)、支持 MCP (Model Context Protocol) 和 A2A 等开放标准
参考文档:

浙公网安备 33010602011771号