AI理论知识7
AI 软件测试
一、什么是AI软件测试
1、定义:AI 软件测试是针对产品的全流程,多维度的测试活动
2、核心测试对象:ai的大模型、数据、功能,最终的米的验证ai产品的准确性,稳当型、安全和合规性,确保ai产品能稳定,可靠,合规的落地使用
3、ai测试内容:
(1)功能能力测试
(2)幻觉专项测试
(3)鲁棒性测试
(4)安全测试
(5)性能测试
(6)多模态转向测试
(7)rag知识库测试
(8)合规和隐私测试
4、ai测试标准流程:
需求评审测试计划编写测试用例编写设计数据集用例搭建环境执行测试用例(
功能、幻觉、鲁棒、偏见)有bug提交给开发直到用例100%执行,0bug输出测试报告封装版本上线线上测试上线成功
5、ai 在测试领域两个方向
(1)测试ai软件或者ai智能
(2)测试人员通过ai提效(如:通过ai写用例,vscode写代码)
二、ai软件测试核心价值?
1、保障ai产品的输出和输入的准确性
2、避免ai出现幻觉、偏见等
3、提升用户体验
如:答非所问、ai文档逻辑混乱
4、符合行业合规标准
如:ai不能泄露隐私、个人金额、存款
三、传统测试和ai测试差异
(1)测试对象
ai测试:模型、数据、功能
测试:功能、代码、逻辑
(2)测试方法
ai测试:统计分析发、多轮测试方法、对照组测试、数据排查方法(核心验证:输出正确性,一致性、无偏见、符合逻辑)
测试:黑盒测试(等价类、边界值、场景法、状态迁移法、判定表),白盒测试(语句覆盖、条件覆盖、判断覆盖等)
(3)测试难点
ai测试:数据质量层次不齐,幻觉难以预判,偏见难以量化,ai输出的是动态,无法提前预判
测试:代码逻辑复杂,bug难以排查
四、ai测试难点:
(1)数据质量层次不齐
ai学习依赖数据,数据就像是ai教材,教材有误,有缺失,格式不完整,ai就会学错,输出结果也是错的;
(2)幻觉难以预判
ai很容易出现虚假信息,也叫幻觉
(3)偏见难以量化
ai偏见:性别偏见,地域偏见
五、ai模型完整流程?
数据采集(源头)数据预处理(基础)模型训练(核心)模型部署(桥梁)产品应用(目的)
(1)数据采集
ai模型的源头,核心作用:收集ai学习所需要的原始数据;
ai数据根据ai产品的需求,来提供
比如:ai文档产生,采集海量文案教程
(2)数据预处理
ai模型的数据筛选与优化环节
核心作用:对数据的原始数据进行清洗、整理、标准化
比如:整理教材、删除无效的数据,标注重点数据
a、清洗:删除数据,错误数据、重复数据
b、标准化:统一数据格式,比如:省、市、县、镇、村
c、筛选:删除无关数据,整理成规范的数据
(3)模型训练
ai模型学习环节
核心作用:让模型通过学习预处理的优质数据,总结规律,提升能力
(4)模型部署
ai模型从”实验室“走向实际应用的关键环节
核心作用:将训练好的数据,部署到具ai产品中,让模拟能接受用户需求,输出正确的数据结果
(5)产品的应用
ai 产品的使用
核心作用:让部署后的模型,通过ai产品为用户提供服务,收集用户反馈,为模型优化提供依据
六、ai模型中三类数据:
(1)训练数据
用于ai模型训练优质数据,是一个模型,是一个学习知识的教材
(2)测试数据
用于测试ai模型的问题,排查模型中的问题的数据
(3)标准数据
对原始数据进行标记,说明修改后的数据,相对于给ai模型的教材标注了重点
七、ai大模型有哪些?
国外:
(1)gpt 系列:gpt4,gtp-5 综合能力
(2)claude 系列: claude opus/sonnet 长文档
(3)gemini系列: genmin pro 图文,视频
国内:
1、豆包
2、kimi
3、文心一言
4、通义千问
5、智谱清言
6、腾讯元宝
7、deepseek
八、ai岗位
七、ai岗位
- AI 软件测试工程师
岗位职责:负责 AI 软件功能测试、AI 工具落地与测试提效、AI 测试数据质量验证与评估。
核心技能:软件测试基础、AI 工具使用、数据质量测试、自动化测试。
薪资范围:10k–25k - 大模型算法工程师
岗位职责:负责 AI 模型研发、AI 工具开发与优化、大模型算法落地。
核心技能:大模型原理、深度学习框架、算法设计与调优。
薪资范围:20k–35k - AIGC 应用工程师(AIGC 岗位)
岗位职责:负责 AI 生成内容相关产品落地、AIGC 工具应用与场景落地。
核心技能:AIGC 产品使用、提示词工程、内容生成与优化。
薪资范围:8k–13k - AI 产品经理
岗位职责:负责 AI 产品需求梳理、功能规划、大模型产品设计、项目推进。
核心技能:产品设计、需求分析、AI 产品逻辑、项目管理。
薪资范围:可根据经验补充,常见区间:15k–35k - AI 大模型测试开发工程师
岗位职责:负责大模型测试体系搭建、自动化测试开发、模型效果评测、测试工具研发。
核心技能:测试开发、大模型评测、自动化框架、数据评测。
薪资范围:可根据经验补充,常见区间:18k–35k
浙公网安备 33010602011771号