掌握模型不确定性-深度学习中的阈值技术

掌握模型不确定性:深度学习中的阈值技术

原文:towardsdatascience.com/mastering-model-uncertainty-thresholding-techniques-in-deep-learning-1f1ab3912fd1/

在许多现实世界应用中,机器学习模型并非设计为全有或全无的方式做出决策。相反,存在一些情况,模型标记某些预测供人工审查更有益,这个过程被称为人工在环。这种方法在风险较高的场景中特别有价值,如欺诈检测,其中假阴性的成本很高。通过允许在模型不确定或遇到复杂案例时人工介入,企业可以确保更细致和准确的决策。

在本文中,我们将探讨如何实现阈值技术,这是一种用于管理模型不确定性的技术,如何在深度学习环境中实施。阈值有助于确定模型何时有足够的信心自主做出决策,何时应该推迟到人工判断。这将通过一个现实世界的例子来说明其潜力。

到本文结束时,希望为技术团队和商业利益相关者提供一些关于建模、阈值策略以及自动化与人工监督之间平衡的决策建议和灵感。

商业案例:自信地检测欺诈交易

为了说明阈值在现实世界情况中的价值,让我们考虑一个金融机构的任务,即检测欺诈交易。我们将使用Kaggle 欺诈检测数据集(DbCL 许可证),其中包含带有欺诈活动标签的匿名交易数据。这些机构处理大量交易,手动审查每一笔交易变得困难。我们希望开发一个系统,能够准确标记可疑交易,同时最大限度地减少不必要的干预。

挑战在于平衡精确性和效率。阈值策略是一种用于引入这种权衡的策略。使用这种策略,我们在样本空间中添加了一个额外的标签——未知。当模型对特定预测不确定时,这个标签作为模型发出的信号,有效地将决策推迟到人工审查。在模型缺乏足够信心做出可靠预测的情况下,将交易标记为未知确保只有最自信的预测被采取行动。

此外,阈值还可能带来另一个积极的影响。它有助于克服潜在的技术怀疑。当模型表示不确定并需要在需要时推迟到人工判断时,它可以培养对系统的更大信任。在以前的项目中,这有助于在各个组织中推出项目。

技术和分析方面。

我们将在深度学习环境中探讨阈值的概念。然而,需要注意的是,阈值是一个与模型无关的技术,它适用于各种类型的场景,而不仅仅是深度学习。

在神经网络中实现阈值步骤时,并不明显应该在哪一层放置它。在分类设置中,可以实现输出转换。sigmoid 函数是一个选择,但 softmax 函数也是一个选择。softmax 提供了一个非常实用的转换,使对数几率遵循某些良好的统计特性。这些特性是,我们保证对数几率之和为 1,并且它们都在 0 和 1 之间。

Softmax 函数。图片由作者提供。

Softmax 函数。图片由作者提供。

然而,在这个过程中,一些信息丢失了。softmax 只捕捉标签之间的相对确定性。它不提供任何单个标签的确定性的绝对度量,这反过来可能导致在真实的不确定性分布更为复杂的情况下过度自信。这种限制在需要精确决策阈值的实际应用中变得至关重要。

本文将不会深入探讨模型架构的细节,因为这些将在即将发布的文章中介绍,供感兴趣的人士参考。模型所使用的只有 softmax 转换后的输出,作为最后一层。这里展示了输出样本。

应用 softmax 后的二十个预测样本。

应用 softmax 后的二十个预测样本。

如所见,输出相当均匀。而且不知道 softmax 的机制,看起来模型对分类相当有信心。但正如文章后面将要看到的,我们在这里捕捉到的强烈关系并不是标签的真实确定性。相反,这应该被解释为与另一个标签的预测相比的一个标签的预测。在我们的案例中,这意味着模型可能捕捉到一些标签比其他标签更有可能,但这并不反映模型的总体确定性。

在理解了输出的解释之后,让我们探讨模型在实际中的表现。查看混淆矩阵。

整个未设置阈值的测试数据集的混淆矩阵。

整个未设置阈值的测试数据集的混淆矩阵。

模型表现并不糟糕,尽管它远非完美。有了这些基础结果,我们将探讨实现一个阈值。

我们将从网络中的一层开始——检查最终激活函数之前的值。这产生了以下的对数几率。

在应用 softmax 转换之前,二十个预测样本

在应用 softmax 转换之前,二十个预测样本。

在这里,我们看到更多的值。这一层提供了模型预测不确定性的更详细视图,并且在这里插入阈值层。

通过引入上下置信度阈值,模型仅对大约 34%的数据集进行标记,专注于最确定的预测。但反过来,结果更加确定,如下面的混淆矩阵所示。需要注意的是,阈值化不必是均匀的。例如,某些标签可能比其他标签更难预测,标签不平衡也可能影响阈值化策略。

应用阈值后的混淆矩阵

应用阈值后的混淆矩阵。

指标

在这种情况下,我们只触及了阈值化的两个边缘情况;那些让所有预测通过(基本案例)和那些移除所有错误预测的情况。

根据实践经验,决定是否用高置信度标记较少的数据点(这可能会减少标记的交易总数)或用较低置信度标记更多数据点是一个相当复杂的权衡。这个决定可能会影响运营效率,并且可能由业务优先事项,如风险容忍度或运营限制来指导。与主题专家一起讨论这是确定阈值的一种完全可行的方法。另一种方法是,如果您能够与已知或近似的指标相结合来优化这一点。这可以通过将阈值与特定的业务指标对齐来实现,例如每假阴性成本或运营能力。

总结

总之,目标不是丢弃 softmax 转换,因为它提供了有价值的统计属性。相反,我们建议引入一个中间阈值层来过滤掉不确定的预测,并在必要时为未知标签留出空间。

实施这一点的确切方式,我认为取决于手头的项目。欺诈示例也强调了理解旨在解决的问题的业务需求的重要性。在这里,我们展示了这样一个例子,我们通过阈值化去除了所有错误的预测,但这在所有用例中都不是必要的。在许多情况下,最佳解决方案在于在准确性和覆盖率之间找到平衡。

感谢您花时间探索这个主题

希望您觉得这篇文章有用或鼓舞人心。如果您有任何评论或问题,请与我联系。您也可以在LinkedIn上与我联系。

posted @ 2026-03-29 09:48  布客飞龙III  阅读(25)  评论(0)    收藏  举报