DeepSeek Harness 能替测试开发干多少活?
实测结论是:它能省下一半重复劳动,但拍板还得靠人。
这次实测用了一个库存管理 API 项目,把日常工作拆成五个环节挨个打分:
需求解析(可用偏上):文档里白纸黑字的规则它能抓全。但没写进文档的隐性规则,它照样不知道。
用例设计(最强项):边界值、异常场景都能主动想到,给的具体用例直接就能执行。
脚本编写(可用偏上):生成的代码结构不错,断言也清楚。就是偶尔会凭空捏造接口,必须人工过一遍。
执行调度(短板):任务一长就容易卡壳打转,响应慢还费钱。建议拆成小段下发,人在旁边盯着。
缺陷定位(可用):能帮你从日志里圈出可疑点并排序。但到底是不是真 bug,还得靠你复现验证。
最后算总账,扣掉评审时间,AI 大概能替代一半到三分之二的活儿。说白了,它替的是重复劳动,不是判断力。
本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。



浙公网安备 33010602011771号