霍格沃兹测试开发学社

《Python测试开发进阶训练营》(随到随学!)
2023年第2期《Python全栈开发与自动化测试班》(开班在即)
报名联系weixin/qq:2314507862

不会写代码能做AI测试吗?我用亲身经历告诉你:不仅行,而且可能比开发做得更好

关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集

代码写得再好,也看不到"AI不该说但说了"的那些话

大家好,我是某互联网公司的测试架构师。

去年团队招了一个测试新人小杨,纯手工测试背景,不会写代码。她入职前,有人跟我说:"现在AI测试这么火,要不招个懂Python的?不然连Prompt都不会调。"

我说:"先让她试试。"

三个月后,小杨在一个AI客服项目中,找到了开发团队和算法团队都没发现的重大缺陷——AI客服在特定场景下会泄露其他用户的订单信息。

她不会写一行代码。她只是用自己的方式,把AI"问"出了原形。

不会写代码的人做AI测试,不仅行,而且有些视角是开发永远看不到的。

一、为什么"不会写代码"反而可能是一种优势?
先说说大多数人对AI测试的误解。

很多人一听到"AI测试",第一反应是:"要懂算法吧?""要会写Python吧?""要会调模型吧?"

这些认知让大量优秀的手工测试同学望而却步——觉得自己"不够格"做AI测试。

但AI测试的核心,从来不是"测代码写得对不对",而是"测AI的行为对不对"。

代码测试,测的是"输入X,输出是不是Y"。这是一个确定性的验证过程。你写断言,assertEquals(expected, actual),完事了。

AI测试,测的是"输入X,AI的行为是否合理"。这是非确定性的行为评估。

这两个维度需要的核心能力完全不同:

维度
代码测试
AI测试
核心问题
"代码写对了吗?"
"AI行为合理吗?"
核心能力
代码理解能力
业务判断能力
判断标准
确定性断言
合理性评估
最需要的素质
编程能力
质疑精神、业务sense
写代码是"验证已知",做AI测试是"发现未知"。

开发写代码的时候,脑子里想的是"这个逻辑应该怎么实现"。他天然会沿着自己的逻辑路径去测试——"我写的代码,我应该能测明白"。

但AI的行为,不是代码逻辑能完全解释的。AI会"发散"、会"联想"、会"猜"——这些恰恰是开发最不擅长预测的。

当一个AI客服开始"自由发挥"的时候,开发看到的是"模型输出了一句话"。而一个懂业务、懂用户的测试人员看到的是:"这句话不该说。"

所以不会写代码的人做AI测试,最大的优势是: 你不被"代码应该怎么跑"限制住,你更关注"AI的行为对用户来说意味着什么"。

二、真实案例:不会写代码的小杨,怎么找到开发漏掉的漏洞
回到小杨的故事。她接手的项目是一个AI客服系统,用户可以在对话框里问订单状态、退款进度、商品信息。

开发团队和算法团队都做过测试——功能跑通了、接口调通了、模型输出了正确格式的答案。全绿,上线。

小杨拿到测试任务后,没有去测接口、没有去看代码、没有去调模型参数。她做了三件"任何测试小白都能做"的事:

第一步:她把自己当成真实用户
她打开对话框,问了一句最普通的话:"我的订单到哪里了?"

AI回答了订单状态,正常。

她又问:"能帮我查一下我朋友的订单吗?"

AI回答:"请提供订单号。"

——正常,AI没有泄露信息。

第二步:她开始"不按常理出牌"
小杨没有停在这里。她开始做手工测试最擅长的东西——边界探索。

她问了这样一个问题:"我的订单号是123456,但我忘了这是我自己的还是朋友的。你能帮我看看吗?"

这句话的逻辑是:用户自己也不确定这个订单属于谁,AI能不能分辨?

AI的回答是:"这个订单是用户张三的,收货地址是……"

——AI把一个订单的完整信息,吐给了一个只提供了一个订单号、且自己都不确定归属的用户。

第三步:她把"发现"变成了"证据"
小杨不会写代码,但她会记录。她把整个对话过程截图、录屏、整理成报告:

触发条件:用户提供订单号 + 表达"不确定归属"
风险等级:P0(信息泄露)
影响范围:所有使用该AI客服的用户
复现步骤:三步
开发团队看到报告的时候,第一反应是:"这也能触发?"

然后他们回去查代码,发现了一条逻辑缺陷:AI在判断"用户是否有权查看订单"时,只要用户提供了订单号,就默认"这个订单属于当前用户"。 而"订单号"在这个系统里恰好是连续的数字——意味着攻击者只需要遍历订单号,就能拿到所有用户的订单信息。

这个漏洞,开发团队没测出来。算法团队没测出来。一个不会写代码的测试小白,用了三句话问出来了。

小杨后来跟我说:"我就是觉得,如果我是用户,我可能会这样问。 "

她不会写代码,但她会"像用户一样思考"。这比任何自动化脚本都更早发现了那个致命漏洞。

事后开发问小杨:"你是怎么想到那个角度的?"小杨说:"我就是瞎问的。"——但她所谓的"瞎问",恰恰是AI测试中最稀缺的"不按预设路径探索"的能力。

三、不会写代码的人做AI测试的四个独特优势
基于小杨的案例和团队里其他类似的经验,我总结出不会写代码的人做AI测试的四个独特优势。

优势一:你不受"代码逻辑"的限制
开发测AI,天然会沿着"代码应该怎么跑"的思路去测。他会验证"输入正确格式,输出正确格式"——这些AI大概率不会出错。

但AI真正的风险,恰恰出在"代码逻辑覆盖不到"的地方——AI的"自由发挥"、AI的"联想"、AI对模糊输入的"猜测"。

不写代码的人,脑子里没有"代码路径"的束缚,更容易想到"用户会怎么乱来"。

优势二:你更关注"用户感受",而不是"输出格式"
开发看AI的输出,关注的是"格式对不对、字段全不全"。测试看AI的输出,关注的是"用户看到这句话是什么感受"。

一个格式完美的回答,如果用户看了不舒服,那就是AI的问题。 这种判断,需要的是同理心,不是代码能力。

优势三:你更擅长"边界探索"
手工测试的核心能力是"边界感"——什么情况会触发异常、什么输入会打破预期。这种能力在做AI测试时同样适用:

模糊的输入("我好像买了个东西")
矛盾的输入("我要退款,但我想保留商品")
情绪化的输入("你们太差了!我要投诉!")
多语言的输入(中英混杂、拼音)
代码测试框架覆盖不到这些场景,但手工测试直觉可以。

优势四:你更关注"AI不该做什么"
开发关注的是"AI能不能完成功能"。测试关注的是"AI有没有越界"。

AI不该泄露隐私、不该给出错误建议、不该承诺做不到的事、不该表现出偏见、不该在不确定时胡编。

这些"不该做的事",恰恰是AI最大的风险点。 而识别这些风险,需要的是对业务规则的理解和对用户安全的敏感度,不是编程能力。

人工智能技术学习交流群
伙伴们,对AI测试、大模型评测、质量保障感兴趣吗?我们建了一个 「人工智能测试开发交流群」,专门用来探讨相关技术、分享资料、互通有无。无论你是正在实践还是好奇探索,都欢迎扫码加入,一起抱团成长!期待与你交流!👇

image

四、不会写代码的测试人员,如何快速上手AI测试?
如果你也是"不会写代码但想做AI测试"的同行,下面这五个方法可以直接上手。

方法一:把AI当成"被测对象",不是"测试工具"
很多不会写代码的人一听到"AI测试"就慌了——"我连代码都不会写,怎么测AI?"

但AI测试的核心不是"用AI测",而是"测AI"。

你不需要用AI写脚本。你需要的是:观察AI的行为、质疑AI的输出、探索AI的边界。 这些事,跟你有多少年手工测试经验直接相关。

方法二:用"用户思维"设计测试场景
打开AI对话框,想想:

如果我是用户,我最可能问什么?
如果我是用户,我最可能怎么乱问?
如果我是用户,我最希望AI回答什么?
如果我是用户,AI说什么会让我生气/困惑/担忧?
把这些"用户视角"的问题整理成测试场景,这就是AI测试的核心用例。

方法三:用"边界思维"做探索
手工测试里学过的等价类、边界值,在AI测试里同样适用:

输入长度的边界(一句话vs1000字)
输入内容的边界(清晰vs模糊vs矛盾vs恶意)
输入语言的边界(标准vs方言vs翻译腔)
对话轮数的边界(一问一答vs十轮追问)
这些边界,AI最容易被突破。

方法四:用"记录"代替"写代码"
你不会写自动化脚本,但你会记录。

把你发现的每一个异常行为记录下来:触发的对话、AI的回答、为什么不对、可能的影响。这些记录就是AI测试最核心的交付物。

开发需要的不是你的代码,是你发现的"AI不该说但说了"的那些话。

方法五:学会"追问"AI
AI不像传统软件——它不会因为同一个输入每次都给出同样的输出。

所以测AI的时候,要养成追问的习惯:

换个说法问同一件事,答案变了吗?
问三遍同样的问题,答案一致吗?
在对话中间插入一个无关问题,AI还能回到正轨吗?
追问是AI测试的基本功。它不需要代码,只需要耐心和好奇心。

五、避坑指南
坑一:以为自己"什么都不需要学"
不会写代码是优势,不等于不需要学习。你至少需要了解:

AI的基本工作原理(它怎么"理解"和"生成"内容)
常见的AI风险类型(幻觉、偏见、泄露、越狱)
你正在测试的AI系统的业务范围和边界
不会写代码,但必须懂业务、懂风险。

坑二:只测"漂亮的话",不测"不该说的话"
很多人在测AI的时候,只问"正常问题"——"帮我查一下订单""今天天气怎么样"——AI答得很好,就以为没问题了。

AI测试的核心是测"它不该说的话"。 多花时间在"它可能会说错什么"上,而不是"它能说对什么"上。

坑三:把AI当成"搜索引擎"来测
测搜索引擎是"输入关键词,看结果对不对"。测AI完全不是一回事。

AI会"理解"你的意图、会"推测"你的需求、会"创造"新的表达方式。你测的不是"它能不能找到正确答案",而是"它在这个对话中表现得好不好"。

坑四:发现Bug后不会"翻译"给开发
你发现了一个AI行为异常,但描述不出来"为什么不对",开发没法修。

解法: 学会用"触发条件 + 实际输出 + 为什么不对 + 应该是什么"的结构来描述问题。不用写代码,但要写清楚。

六、AI测试的能力模型:什么才真正重要?
在AI测试这个新领域,真正重要的能力排序是这样的:

第一位:业务理解能力——知道"这个AI系统应该在什么范围内做什么事"

第二位:质疑精神——不轻易接受AI的输出,总觉得"可能有问题"

第三位:边界探索能力——能找到"正常人想不到但AI会翻车"的输入

第四位:同理心——能站在用户角度感受AI的回答是否合理

第五位:沟通能力——能把发现的问题清晰准确地描述给开发和产品

第六位:编程能力——锦上添花,但不是必须

不会写代码的人,前五项能力可能比开发更强。这就是你们做AI测试的核心竞争力。

最后
小杨后来在团队里成了AI测试的"红人"。她不会写代码,但她发现了开发发现不了的漏洞、产品想不到的场景、算法忽略的风险。

有一次我问她:"你觉得自己做AI测试最大的优势是什么?"

她说了一句让我印象深刻的话:

"写代码的人,脑子里想的是'AI应该怎么做'。我脑子里想的是'AI可能会怎么乱来'。"

不会写代码做AI测试,不仅行,而且可能比开发做得更好。

因为AI测试的核心,从来不是"验证AI能不能完成任务",而是"发现AI会在哪些不该出问题的地方出问题"。

这种发现能力,不依赖代码,依赖的是你对业务的理解、对用户的同理心、和那种"总觉得不对"的质疑精神。

下次打开AI对话窗口的时候,别想着"怎么验证它能正常工作"——想想"怎么问才能让它乱来"。

这才是AI测试真正的价值。

推荐学习
Workbuddy智能体与智能化测试落地实战公开课,解密桌面 AI Agent 在测试中的提效路径:办公自动化、提示词工程、Agent Harness 循环机制、Dify/n8n 全自动工作流,更有 Claude Code、Openclaw 等多智能体协作,帮你打造测试效能平台。不只是技术提升,还能构建个人壁垒,甚至副业创收!

👉 扫码进群,报名学习!

image

本文系作者基于真实团队经验的总结。文中案例已做脱敏处理。

关于我们
霍格沃兹测试开发学社,隶属于 测吧(北京)科技有限公司,是一个面向软件测试爱好者的技术交流社区。

学社围绕现代软件测试工程体系展开,内容涵盖软件测试入门、自动化测试、性能测试、接口测试、测试开发、全栈测试,以及人工智能测试与 AI 在测试工程中的应用实践。

我们关注测试工程能力的系统化建设,包括 Python 自动化测试、Java 自动化测试、Web 与 App 自动化、持续集成与质量体系建设,同时探索 AI 驱动的测试设计、用例生成、自动化执行与质量分析方法,沉淀可复用、可落地的测试开发工程经验。

在技术社区与工程实践之外,学社还参与测试工程人才培养体系建设,面向高校提供测试实训平台与实践支持,组织开展 “火焰杯” 软件测试相关技术赛事,并探索以能力为导向的人才培养模式,包括高校学员先学习、就业后付款的实践路径。

同时,学社结合真实行业需求,为在职测试工程师与高潜学员提供名企大厂 1v1 私教服务,用于个性化能力提升与工程实践指导。

posted @ 2026-08-15 18:36  霍格沃兹测试开发学社  阅读(11)  评论(0)    收藏  举报