AI 到底能不能做自动化测试?聊聊 AI 自动化测试的能力边界与最佳实践
本期敖行客研发实战日记,跟着技术总监,从工程实践的角度聊聊 AI 自动化测试。

AI 的加入,让自动化测试迎来了新的可能:测试用例自动生成、脚本辅助编写、日志智能分析……不少过去依赖人工完成的工作,如今都可以借助大模型大幅提升效率。
与此同时,各种宣传也层出不穷:
AI 全自动测试
一键生成测试用例
零脚本自动化
AI 替代测试工程师
目前 AI并没有宣传中的那么"万能",而是更适合作为自动化测试能力的增强工具。
本文结合目前主流 AI 能力,聊聊 AI 在自动化测试中的真实能力边界。
一、为什么 AI 能做自动化测试?
先理解一个问题:自动化测试,本质上是在做什么?
其实就是三个步骤:
生成测试数据
↓
执行测试流程
↓
校验执行结果
传统自动化测试依赖的是:
- 测试人员设计用例
- 编写脚本
- 配置测试数据
- 执行测试
- 分析结果
而 AI 最擅长的事情恰恰是:
- 理解自然语言
- 总结规则
- 生成内容
- 分析文本
- 识别模式
所以,两者天然存在结合点。但是需要注意一点:
AI 擅长的是"生成"和"辅助分析",并不是"绝对准确地判断结果"。
因此,它更适合提升效率,而不是替代测试。
二、AI 在自动化测试中真正成熟的应用场景
1. 自动生成测试用例
这是目前落地最成熟的能力之一。
传统写测试用例通常需要:
- 阅读需求文档
- 理解业务流程
- 分析边界条件
- 补充异常场景
整个过程比较耗时。
而现在,大模型可以直接根据:
- PRD
- API 文档
- Swagger
- 页面流程
- 用户故事(User Story)
快速生成第一版测试用例,例如:
登录功能
✓ 正常账号登录
✓ 密码错误
✓ 空密码
✓ SQL 注入输入
✓ 超长输入
✓ 特殊字符
✓ Token 失效
AI 最大的价值不是一次生成 100 分的用例,而是:
快速生成 70%~80% 的基础内容,再由测试工程师补充业务细节。
相比完全人工编写,效率会高很多。
2. 自动生成自动化测试脚本
AI 在代码生成方面已经比较成熟。
例如输入:
使用 Playwright 编写一个登录测试。
AI 基本都可以生成完整代码。
包括:
- Selenium
- Playwright
- Cypress
- Appium
- Pytest
- JUnit
都已经有不错的生成效果。
例如:
page.goto("/login")
page.fill("#username","admin")
page.fill("#password","123456")
page.click("登录")
expect(page).to_have_url("/home")
对于经验不足的测试工程师来说,可以明显降低自动化门槛。
3. 自动修复测试脚本
传统 UI 自动化最大的痛点就是:
页面一改,脚本全部失效。
以前定位:
id="login-btn"
后来改成:
id="submit-btn"
整个自动化脚本都会失败。
AI 可以通过:
- DOM 分析
- 页面结构理解
- 相似元素匹配
自动推荐新的定位方式。
虽然目前还不能做到百分百修复,但已经可以减少大量维护工作。
4. 日志分析与缺陷定位
自动化测试结束后,经常会产生几百 MB 的日志。
TimeoutException
Connection Reset
HTTP 502
Element Not Found
NullPointerException
过去需要人工逐条查看。
现在 AI 可以:
- 自动聚类错误
- 合并相同异常
- 判断是否属于环境问题
- 总结 Root Cause
- 输出分析报告
本次失败 86 次
72 次属于数据库连接异常
9 次属于接口超时
5 次属于真实 Bug
对于 CI/CD 流水线来说,非常实用。
5. 探索性测试
传统自动化:
点击 A
↓
点击 B
↓
点击 C
AI 可以尝试更多随机路径:
例如:
- 连续点击
- 快速切换页面
- 重复提交
- 特殊字符输入
- 随机输入组合
甚至可以模拟用户的一些异常行为。
因此,它能够发现很多预设脚本覆盖不到的问题。
三、为什么 AI 无法替代自动化测试?
虽然 AI 很强,但目前仍然存在几个明显短板。
1. 无法精准做断言
自动化测试最重要的是:结果必须完全正确。
例如:
订单金额:
100.00 元
AI 可能认为:
99.99≈100
对于自然语言来说问题不大。
但对于自动化测试来说:
错 0.01 都属于失败。
因此:金额、权限、库存、状态、数据库数据等,这些都必须依赖固定断言,AI 无法替代。
2. 无法真正理解复杂业务
例如:
一个订单流程:
创建订单->库存扣减->优惠券计算->支付->物流->积分->消息通知
这里可能涉及:
- 十几个微服务
- 上百条业务规则
- 多角色权限
- 各种异常流程
AI 可以理解文字,但理解不了真正复杂的业务约束。
因此:越核心的业务,越需要人工设计测试。
3. 无法替代性能测试
性能测试关注的是:TPS、QPS、RT、CPU、Memory、GC
这些都需要:
- JMeter
- Gatling
- LoadRunner
等专业工具完成。
AI 最多只能:分析压测报告,总结性能瓶颈,生成优化建议,不能真正完成压测。
4. 无法判断用户体验
例如:AI 产品需要测试:
回答是否自然?
是否符合用户习惯?
表达是否流畅?
是否真正解决问题?
这些没有标准答案,AI 自己也无法评价自己。
因此:最终仍然需要人工体验。
四、目前比较合理的 AI 自动化测试工作流
目前比较推荐的工作方式是:
需求文档->AI 生成测试用例->测试工程师审核补充->AI 生成自动化脚本->CI/CD 自动执行->AI 分析日志->人工确认 Bug
整个过程中:AI 负责提高效率;自动化框架负责稳定执行;测试工程师负责质量决策。
三者结合,才是目前最成熟的方案。
敖行客介绍:
敖行客(Allthinker)聚焦服务企业研发团队及开发者,以搭载自研企业级智能体引擎的 AT Work-Agent 研发工作台为核心支撑,打造 AI 原生一体化研发协同体系,依托企业智能体重构研发协作范式,致力于赋能各类研发团队轻量化完成智能化升级。
AT Work介绍
AT Work-Agent 研发工作台是国内首个分钟级部署、AI 原生全链路研发协同平台,依托企业级智能体赋能研发全流程,零门槛打造专属 AI 研发团队,实现研发效率与数据安全的双重飞跃。
官网:www.allthinker.com
本文探讨了AI在自动化测试中的应用现状与能力边界。文章指出,AI可通过生成测试用例、辅助编写脚本、智能分析日志等功能提升测试效率,尤其在用例生成、脚本修复和错误分析方面表现突出。然而,AI目前仍存在精准断言不足、复杂业务理解有限、无法替代性能测试和用户体验评估等短板。由AI负责效率提升,测试工程师把控质量决策。敖行客的ATWork-Agent平台正致力于通过智能体技术推动这种新型研发协同模式。
浙公网安备 33010602011771号