Press "Enter" to skip to content

整理数据集变化的框架:示例

条件概率如何随三个概率要素的变化而变化

作者提供的图像

我最近谈到了模型性能下降的原因,这意味着当我们训练和部署模型的那一刻,它们的预测质量下降。在这篇其他的文章中,我提出了一种关于模型下降原因的新的思考方式。在该框架中,所谓的条件概率成为了全局原因。

根据定义,条件概率由三个概率组成,我称之为具体原因。这个概念重构的最重要学习是,协变量转移和条件转移不是两个独立或平行的概念。作为协变量转移的函数,条件转移可能会发生。

通过这种重构,我相信我们可以更容易地思考原因,并更合理地解释我们在应用程序中观察到的转变。

这是机器学习模型的原因和模型性能的方案:

作者提供的图像。改编自https://towardsdatascience.com/tidying-up-the-framework-of-dataset-shifts-cd9f922637b7

在这个方案中,我们可以看到将原因与我们估计模型的预测性能连接起来的明确路径。在统计学习中,我们需要做出一个基本假设,即我们的模型是真实模型(真实决策边界,真实回归函数等)的“好”估计器。 “好”可以有不同的含义,比如无偏估计器,精确估计器,完全估计器,充分估计器等。但是,为了简单起见和即将进行的讨论,我们假设它们在预测误差较小方面是好的。换句话说,我们假设它们代表了真实模型。

基于这个假设,我们能够在概率P(X),P(Y),P(X|Y)P(Y|X)中寻找估计模型的性能下降的原因。

那么,今天我们要做的是通过使用二维空间中的一些样本点来示例和分析不同的场景,看看P(Y|X)如何随着三个概率P(X|Y)P(X)P(Y)的变化而变化。我们将使用拉普拉斯的方式从这些样本点计算概率。目的是理解模型性能下降的原因层次结构,以P(Y|X)作为全局原因,其他三个概率作为具体原因。通过这种方式,我们可以理解,例如,潜在的协变量转移有时可以成为条件转移的论据,而不是独立的转移。

示例

今天我们要讲解的案例非常简单。我们有两个协变量X1X2,输出Y是一个二元变量。这就是我们的模型空间的样子:

作者提供的图像

你可以看到,空间被组织成4个象限,决策边界在这个空间中是十字形。这意味着如果样本位于第1和第3象限,则模型将将其分类为类别1,否则分类为类别0。为了简化练习,我们将通过比较P(Y=1|X1>a)来讨论不同的情况。关于为什么不考虑X2,这只是为了练习的简单性。它不会影响我们想要理解的内容。

如果你仍然有一种苦乐参半的感觉,那么取P(Y=1|X1>a)等于P(Y=1|X1>a, -inf <X2 < inf),因此理论上,我们仍然考虑了X2

作者提供的图片

参考模型

首先,我们计算展示概率并获得1/2。在这里,我们的样本组在整个空间中非常均匀,先验概率也是均匀的:

作者提供的图片

变化即将到来

  1. 底部右侧象限出现了一个额外的样本。所以我们首先要问的是:我们在讨论协变量偏移吗?

是的,因为X1>a的采样比之前更多。那么,这只是一个协变量偏移而不是条件偏移吗?让我们看看。这里是使用更新后的点集计算的所有相同概率的计算(改变的概率用橙色表示):

作者提供的图片

我们在这里看到了什么?事实上,我们不仅得到了一个协变量偏移,而且所有的概率都发生了变化。先验概率也发生了变化,因为协变量偏移带来了一个新的1类点,使得该类的发生率大于2类。然后,逆概率P(X1>a|Y=1)也发生了变化,这正是由于先验偏移。所有这些都导致了一个条件偏移,因此我们现在得到了P(Y=1|X1>a)=2/3,而不是1/2

这是一个思考泡泡。实际上是非常重要的一个思考泡泡。

通过这种采样分布的变化,我们得到了在我们模型整个方案中起作用的所有概率的变化。然而,基于初始采样的决策边界仍然有效。

这意味着什么?

尽管我们得到了一个条件偏移,但决策边界并没有必然退化。因为决策边界来自于期望值,如果我们基于当前的偏移计算这个值,边界可能保持不变,但条件概率会有所不同。

2. 第一象限中的样本不再存在。

所以,对于X1>a,事情保持不变。让我们看看我们正在展示的条件概率及其元素发生了什么变化。

作者提供的图片

直观地说,因为X1>a内部保持不变,条件概率保持不变。然而,当我们看到P(X1>a)时,与训练采样相比,我们得到的是2/3而不是1/2。因此,这里发生了一个没有条件偏移的协变量偏移。

从数学的角度来看,协变量概率如何在不改变条件概率的情况下发生变化?这是因为P(Y=1)P(X1>a|Y=1)根据协变量概率进行了相应的调整。因此,补偿使得条件概率保持不变。

通过这些变化,和之前一样,决策边界仍然有效。

3. 在决策边界保持有效的情况下,投放一些样本到不同象限。

我们这里有2个额外的组合。在一个案例中,先验保持不变,而另外两个概率发生了变化,但仍未改变条件概率。在第二个案例中,只有逆概率与条件偏移相关联。请在下面检查这些偏移。后者是非常重要的,所以不要错过!

作者提供的图片

通过这个,我们现在对条件概率如何随其他三个概率的变化而变化有了一个相当坚实的看法。但更重要的是,我们也知道并非所有条件偏移都会使现有的决策边界无效。那么这是怎么回事呢?

概念漂移

在之前的帖子中,我还提出了一种更具体的定义概念漂移(或概念偏移)的方式。提议如下:

当决策边界或回归函数在概率变化时变得无效时,我们将其称为概念的变化。

因此,关键点在于如果决策边界变得无效,那么肯定存在条件偏移。反之,正如我们在之前的帖子中讨论过的,并且正如我们在上面的例子中看到的那样,并不一定成立。

从实际角度来看,这可能并不是太好,因为这意味着为了真正知道是否存在概念漂移,我们可能被迫重新估计边界或函数。但至少对于我们的理论理解来说,这同样是令人着迷的。

这是一个例子,我们在这个例子中有一个概念漂移,自然而然地伴随着条件偏移,但实际上没有协变量或先验偏移。

作者提供的图片

这种分离组件是多么酷?这里唯一改变的元素是逆概率,但与我们上面研究的先前偏移相反,逆概率的这种变化与决策边界的变化相关联。现在,一个有效的决策边界仅仅是根据X1>a来分离,忽略了由X2所决定的边界。

我们学到了什么?

我们非常缓慢地走过了模型退化原因的分解过程。我们研究了概率元素的不同偏移方式以及它们与我们的机器学习模型预测性能退化之间的关系。最重要的见解是:

  • 条件偏移是机器学习模型预测退化的全局原因
  • 具体的原因是协变量偏移、先验偏移和逆概率偏移
  • 在决策边界保持有效的情况下,我们可以有许多不同的概率偏移情况
  • 决策边界的变化会导致条件偏移,但反过来并不一定成立!
  • 概念漂移可能更具体地与决策边界相关,而不是整体条件概率分布

从这里我们可以得出什么结论?根据这些定义重新组织我们的实际解决方案是我提出的最大邀请。我们可能会找到对我们当前关于如何监控我们的模型的问题的许多期望答案。

如果您目前正在使用这些定义进行模型性能监控的工作,请毫不犹豫地分享您对此框架的看法。

祝大家思考愉快!

Leave a Reply

Your email address will not be published. Required fields are marked *