midscene使用简介~UI自动化测试首选工具

Midscene 是一个由字节跳动 Web Infra 团队开源、基于纯视觉(Vision-Driven)技术的下一代 UI 自动化工具。它旨在通过 AI 的强大能力,彻底改变用户与界面交互、以及进行自动化测试的方式。它的核心亮点是,能让用户用最自然的方式——自然语言——来驱动复杂的界面操作,从而将自动化流程的门槛降到最低。

自 2024 年开源以来,Midscene 项目已在 GitHub 上获得超过 1.2万个星标,并在 2025 年底正式发布了 v1.0 版本。

官网说明:https://midscenejs.com/zh/introduction.html

 

🚀 核心特性与优势

Midscene 提供了几个核心方法,来满足不同的自动化需求:

  • .aiAction / .ai (交互): 输入一句话指令,让 AI 自动规划并执行一系列操作。例如:agent.ai('登录网站,然后点击个人头像')

  • .aiQuery (数据提取): 像与人对话一样,用自然语言描述你想从页面上提取的数据,AI 会理解并以你指定的 JSON 格式返回。

  • .aiAssert (断言): 用自然语言描述一个页面上应该满足的条件,AI 会自动判断并给出结果。例如:agent.aiAssert('购物车图标旁显示数字 "1"')

除了核心方法,Midscene 还拥有一系列特色功能:

  • 视觉驱动,不依赖代码定位: 这是 Midscene 最核心的突破。传统自动化工具依赖脆弱且维护成本高昂的 CSS 选择器或 XPath。而 Midscene 的 v1.0 版本全面转向纯视觉模型方案,AI 直接“观看”屏幕截图来理解界面,完全不依赖 DOM 结构,这使得自动化脚本在界面发生变化时依然稳健。

  • 跨平台统一体验: Midscene 提供统一的 API 设计和操作体验,支持 Web、Android、iOS、HarmonyOS 以及桌面应用(Linux、macOS、Windows)等多种平台。

  • 操作模式灵活可控: 除了“一句话”搞定一切的 .aiAction 模式,Midscene 也提供更可控的 即时操作(Instant Actions) 模式。通过 .aiTap().aiInput() 等原子操作接口,你可以实现更快、更可靠的操作执行。

  • 模型选择丰富: 除了通用的 GPT-4o、Claude 等模型,Midscene 还特别适配了 专为 UI 自动化设计的开源模型,如 UI-TARS 和 Qwen3-VL,这些模型不仅识别准确率高,还支持私有化部署,能更好地保障数据安全。

  • 强大的调试工具: Midscene 提供可视化报告和回放功能,每一步操作都有截图记录,并清晰展示 AI 的思考和规划过程,极大地提升了脚本的编写和调试效率。

  • 零门槛的Chrome插件: 提供一个免费的 Chrome 浏览器插件,用户无需编写任何代码,即可在任意网页上直接体验 AI 驱动的自动化能力。

🛠️ 技术原理

Midscene 的核心技术原理是“纯视觉驱动”。其工作流程大致如下:

  1. 接收用户的自然语言指令(如“点击搜索按钮”)。

  2. 在后台,AI 模型(特别是视觉语言模型 VLM)会分析当前界面的截图,并理解指令的意图。

  3. 模型会规划出执行步骤,并直接通过坐标或语义定位需要交互的界面元素。

  4. 通过即时操作(Instant Actions) 等原子化 API 完成最终的交互,整个过程完全绕过了对底层代码(如 DOM 树)的依赖,从而获得了极高的稳定性和跨平台能力。

🧩 应用场景与落地案例

凭借其强大的视觉驱动能力和跨平台特性,Midscene 在多个领域都有广泛的应用:

  • 行业落地: 已在互联网、金融、政企、汽车等大量应用场景下落地。

  • 网页自动化测试 (E2E测试): 开发者可以用自然语言编写测试用例,替代传统复杂、脆弱的测试脚本,大幅提升测试编写和维护效率。

  • 移动应用 (App) 自动化: 适用于 Android 和 iOS 应用。例如,在 v0.29 版本中展示了用 AI 驱动 iOS 应用自动为 Twitter 点赞的功能。

  • 数据抓取与监控: 可以轻松地从网页中提取数据,并对页面进行持续的性能监控和界面一致性检查。

  • 创新硬件集成: 在社区案例中,有开发者基于 Midscene 与任意界面集成的特性,扩展了机械臂 + 视觉模型 + 语音模型等模块,运用于车机大屏测试场景,展现了其广阔的想象空间。

🛠️ 使用探索

1、前往 Chrome 扩展商店安装 Midscene 扩展:https://chromewebstore.google.com/detail/midscene/gbldofcpkknbggpkmbdaefngejllnief;

2、配置 AI 模型服务,注意此处需使用视觉模型,官网推荐如下,其中UI-TARS即将下架,不推荐使用:

       image

    将你的模型配置写入环境变量,可参考 模型策略 了解更多细节。

export MIDSCENE_MODEL_BASE_URL="https://替换为你的模型服务地址/v1"
export MIDSCENE_MODEL_API_KEY="替换为你的 API Key"
export MIDSCENE_MODEL_NAME="替换为你的模型名称"
export MIDSCENE_MODEL_FAMILY="替换为你的模型系列"

3、开启浏览器插件,快速体验。例如,打开百度页面,插件页面中输入搜索midsence,浏览器即自动执行;
4、更丰富的应用:
1)根据需求生成功能测试用例;
2)根据功能测试用例+页面元素截图,转化为可执行的playwright或yaml测试脚本;
3)midscene打开浏览器,执行测试脚本;
特点:跟模型能力关系比较大。比较慢,耗token,连接偶尔不稳定。处理图形验证码时,可能出错或者超时。如果长期使用,token消耗量要计入成本。

52d9802e90648326318d81cd8e402bcb

 


 

posted @ 2026-04-07 14:44  青域  阅读(3138)  评论(1)    收藏  举报