计算机科学 —— 人工智能 —— 机器学习 : 如何判断针对同一个学习任务的两种算法模型哪个更好(要求具有统计学特性)?—— 95%的置信区间

相关:

1. 计算机科学:95%的置信区间的临界值为什么是1.96?

2. 机器学习中验证两个算法之间是否存在显著差距的t-test检验







问题:



如何判断针对同一个学习任务的两种算法模型哪个更好(要求具有统计学特性)?—— 95%的置信区间




对于本文的这个问题,一般采用的假设统计模型是正太分布,但是如果考虑到测试样本数据量较小的问题可以适应t检验。


举例:

对于一个图像分类任务,模型1进行10次的重复实验,同理,模型2也进行10次重复实验。


最简单的方法就是假设样本方差与总体方差差异不显著,然后使用下面公式:


image


可以计算出这两个模型分别进行10次重复实验后在95%的置信度下(正太分布假设或t分布假设均可),计算出的该置信度下整体均值的上下限,如果A模型的整体均值的下限高于B模型的整体均值的上限,那么我们可以说在95%的置信度下A模型的性能优于B模型。





posted on 2026-02-14 12:50  Angry_Panda  阅读(17)  评论(0)    收藏  举报

导航