计算机科学 —— 人工智能 —— 机器学习 : 如何判断针对同一个学习任务的两种算法模型哪个更好(要求具有统计学特性)?—— 95%的置信区间
相关:
1. 计算机科学:95%的置信区间的临界值为什么是1.96?
2. 机器学习中验证两个算法之间是否存在显著差距的t-test检验
问题:
如何判断针对同一个学习任务的两种算法模型哪个更好(要求具有统计学特性)?—— 95%的置信区间
对于本文的这个问题,一般采用的假设统计模型是正太分布,但是如果考虑到测试样本数据量较小的问题可以适应t检验。
举例:
对于一个图像分类任务,模型1进行10次的重复实验,同理,模型2也进行10次重复实验。
最简单的方法就是假设样本方差与总体方差差异不显著,然后使用下面公式:

可以计算出这两个模型分别进行10次重复实验后在95%的置信度下(正太分布假设或t分布假设均可),计算出的该置信度下整体均值的上下限,如果A模型的整体均值的下限高于B模型的整体均值的上限,那么我们可以说在95%的置信度下A模型的性能优于B模型。
本博客是博主个人学习时的一些记录,不保证是为原创,个别文章加入了转载的源地址,还有个别文章是汇总网上多份资料所成,在这之中也必有疏漏未加标注处,如有侵权请与博主联系。
如果未特殊标注则为原创,遵循 CC 4.0 BY-SA 版权协议。
posted on 2026-02-14 12:50 Angry_Panda 阅读(17) 评论(0) 收藏 举报
浙公网安备 33010602011771号