探索替代指标以获得更深入的见解

你好!
今天,我们将深入探讨用于评估模型性能的特定指标——AUC分数。但在深入讨论细节之前,你是否曾想过为什么有时需要使用不直观的分数来评估我们模型的性能呢?
无论我们的模型处理单一类别还是多个类别,其基本目标始终不变:优化准确预测同时最小化错误预测。为了探索这个基本目标,让我们首先看一下包含真正例、假正例、真反例和假反例的必要混淆矩阵。

对于任何分类或预测问题,只有两种结果:真或假。
因此,用于衡量预测或分类算法性能的每个指标都是基于这两个度量。最简单的指标是准确率。
准确率
在分类和预测的上下文中,准确率表示正确预测实例在总数中的比例。它是一个非常直观和简单的模型预测性能度量。
然而,准确率是否真的足够?
尽管准确率是衡量模型性能的一个很好的常规指标,但当我们查看下面的表格时,会发现它的不足之处。在本文中,我们经常会引用这个表格。该表格显示了四个模型的性能指标,每个模型的结果都有些次优,但所有这些模型都具有较高的准确率。例如,在第一和第二个案例中,明显存在对一类的偏见,导致较不常见类别的分类结果很差,但准确率却达到了90%,这是非常具有误导性的。
