Press "Enter" to skip to content

机器学习中线性回归的几何解释与经典统计学的对比

用直观和分析的方式揭开线性回归的困惑

图像:线性回归示意图,由Stpasha通过Wikimedia Commons(公有领域)提供。原始图像链接:https://upload.wikimedia.org/wikipedia/commons/8/87/OLS_geometric_interpretation.svg

上面的图像代表了最小二乘法(OLS)或线性回归(在经典统计中可以互换使用的词)的几何解释。让我们以一种直观的方式来解释一下:

  • 变量(X1和X2):想象一下你拥有两个变量,X1和X2。它们可以代表任何东西,比如你学习的时间和你参加的模拟考试的次数。
  • 数据点(y):现在,你有了你的结果,或者你想要预测的东西,我们称之为’y’。在我们的例子中,它可以代表你在实际考试中的得分。
  • 平面(colX):该平面代表通过组合不同数量的变量X1和X2可以得到的所有可能的预测值。在我们的例子中,它可以代表基于不同的学习时间和模拟考试次数预测到的所有可能的考试得分。
  • 估计系数(Beta1和Beta2):这些是OLS方法对每个变量对你的得分产生的影响的最佳猜测。因此,Beta 1可能告诉你每多学习一小时,你的得分预测会增加多少,而Beta 2可能告诉你每多参加一次模拟考试,你的得分会增加多少。
  • 预测点(XB^):这是基于估计系数得到的预测得分。它位于平面上,因为它是使用OLS估计值对变量X1和X2的组合。
  • 实际点(y):这是你的实际考试得分。
  • 误差(ε):这是你的实际得分与预测得分之间的差异。换句话说,它表示预测与实际结果的偏差。

现在,OLS如何在所有这些情况下工作?

OLS试图找到Beta1和Beta 2的值,以便当你使用X1和X2(学习时间和模拟考试)预测’y’(考试得分)时,对于所有数据点,误差(ε)尽可能小。在图形中,就像调整平面,直到垂直点线(代表误差)总体上尽可能短。从实际数据点(y)到平面(colX)的最短距离始终是垂直于平面的直线。OLS找到这个特定的平面,其中这些垂直距离对于所有点来说都是最小的。

换句话说,OLS试图将平面“最好地”贴近你的实际得分,同时也意识到它通常不会通过所有实际点,因为现实生活很少是那么完美。

就像将一张最合适的纸张放在一堆铅笔点附近,使得纸张尽可能接近所有点。

让我们回顾一下OLS的主要假设,并将其与上述图示联系起来:

1. 线性性

假设:自变量(X1,X2)和因变量(y)之间的关系是线性的。

图像解释:在图像中,这就是为什么我们使用平面(colX)来表示X1和X2的组合。如果关系不是线性的,我们就无法使用平面来表示它;它将是曲线状或其他形状。

2. 独立性

假设:观测之间相互独立。

视觉解释:每个数据点(代表一个观测值)独立绘制。如果存在相关性,我们会在误差(ε)中看到系统性的模式,比如它们都位于平面的一侧,这将表明一个数据点的位置可以预测另一个数据点,从而违反了这个假设。

3. 同方差性

假设:误差项(ε)的方差在所有自变量的水平上是恒定的。

视觉解释:理想情况下,实际数据点(y)到预测平面(colX)的垂直距离应该均匀散布。这些距离不应该呈漏斗形状或者出现任何模式;它们应该看起来是随机的。如果误差在X1或X2增加时变得更大或更小,就会违反同方差性。

4. 无完全多重共线性

假设:自变量之间没有完全相关。

视觉解释:在图表中,X1和X2由两个箭头表示,指向不同的方向。如果它们完全相关,它们将指向完全相同的方向,我们将不会得到一个平面,而是一条直线。这将使我们无法估计X1和X2对y的独特效应。

5. 无自相关性

假设:误差项之间没有相关性。

视觉解释:这个假设涉及到误差项,尽管它们在图像中没有明确显示,但我们可以推断每个误差项(ε)是随机的,并且不受前后误差项的影响。如果存在模式(比如一个误差总是跟随着一个相似大小的误差),我们会怀疑自相关性。

6. 外生性

假设:误差项的期望值为零。

视觉解释:这意味着平面应该被定位在这样一个位置,使得误差平均抵消。一些数据点会在平面上方,一些在下方,但没有系统性的偏差使它们全部位于上方或下方。

7. 误差的正态性(通常是假设进行假设检验的前提)

假设:误差项服从正态分布。

视觉解释:虽然正态性的假设在数据和模型的三维图中无法可视化,但如果我们查看误差项的直方图,我们期望看到正态分布的钟形曲线。

机器学习中的线性回归与经典统计学中的普通最小二乘线性回归有何区别?

在经典统计学中,普通最小二乘(OLS)可以通过最大似然估计(MLE)的视角来处理。MLE和OLS都旨在找到模型的最佳参数,但它们来自不同的哲学观点,并使用不同的方法来实现。

最大似然估计(MLE)方法:MLE基于概率。它提出了一个问题:“给定一组数据点,生成这些数据的最可能的模型参数是什么?”MLE假设误差(通常是正态分布)的某种概率分布,然后找到最大化观察到的实际数据的概率的参数值。在几何可视化中,这就像是调整平面(colX)的角度和位置,使得观察到的实际数据点(y)的概率最高。似然函数不仅包括点到平面的距离(误差),还包括误差分布的形状。

机器学习中的目标函数最小化:另一方面,机器学习方法通常将回归框架视为一个优化问题。目标是找到最小化某个目标函数的参数,通常是平方误差和(SSE)的和。这更直接,不会对误差的潜在概率分布做太多假设。它只是试图以平方的方式使得数据点到预测平面的距离尽可能小,以更严重地惩罚较大的误差。几何解释是,你通过倾斜和移动平面(colX),以最小化实际点(y)到平面的垂直距离(虚线)的平方和。

比较两者:虽然这两种方法不同——一种是基于概率的方法,另一种是优化技术,但在OLS的情况下,它们通常会产生相同的结果。这是因为当误差服从正态分布时,线性模型系数的最大似然估计会得到与最小化平方和误差相同的方程。在可视化中,这两种方法都试图在变量X1和X2的空间中定位相同的平面,以最佳地表示与y的关系。

主要的区别在于解释和潜在的泛化。最大似然估计的框架允许更灵活地建模误差结构,并且可以扩展到误差不被假设为正态分布的模型。最小化似然方法通常更直接,计算上更直接,仅关注平方差的减少,而不考虑潜在的概率分布。

总之,虽然MLE和ML最小化方法可能会得到OLS回归的相同系数,但它们在概念上是不同的。MLE是基于概率的,基于在给定模型下观察数据的可能性,而最小化最小二乘是算法的,专注于直接减小误差。几何可视化对于两者都是相同的,但平面位置背后的原理是不同的。

额外内容:当在上述解释中引入正则化时会发生什么?

正则化是一种用于防止模型过拟合的技术,当模型过于复杂,并开始捕捉数据中的噪声而不仅仅是真实的潜在模式时,会发生过拟合。有不同类型的正则化,但最常见的两种是:

  • Lasso回归(L1正则化):这会添加一个与系数大小的绝对值相等的惩罚项。它可以将某些系数缩减为零,实际上进行特征选择。
  • 岭回归(L2正则化):这会添加与系数大小的平方相等的惩罚项。所有系数都会被同一个因子缩小,而不会变为零。

让我们以将覆盖物(代表我们的回归模型)套到床上(代表我们的数据)的例子来说明。在没有正则化的OLS中,我们试图使覆盖物尽可能接触到床上的点(数据点),从而最小化覆盖物与床面(误差)之间的距离。

现在,想象一下床很崎岖而我们的覆盖物非常灵活。如果没有正则化,我们可能会将覆盖物安得非常紧凑,以适应每一个凹坑,甚至是那些只是由于某人没有抚平床单而产生的小凹陷——这就是过拟合。

引入正则化:

  • 使用Lasso(L1):就好像在说:“我希望覆盖物适合得很好,但我也希望它尽量平滑,减少褶皱的数量。”每个褶皱代表我们模型中的一个特征,L1正则化试图最小化褶皱的数量。最后,你将得到一张很好适合床的覆盖物,但可能不能到达每个角落,特别是那些只是噪声的地方。在几何可视化中,Lasso将尽量保持平面(colX)与点的适配性,但可能会在不重要变量的方向上变得平坦(将系数缩小为零)。
  • 使用Ridge(L2):这就像希望紧密地套上覆盖物,但也希望覆盖物均匀铺展,不让任何部分离床太远。因此,即使覆盖物仍然紧密地贴合床,它也不会过分弯曲以适应次要的凹坑。在几何可视化中,岭回归增加了一个用于约束系数的惩罚项,将它们缩小到零附近。这使平面保持靠近点,但不会过于陡峭地贴合任何特定的点,从而保持一定的距离(偏差),以防止对噪声过度拟合。

应用正则化的几何可视化解释:

  • 平面(colX)可能不再与每个单独的数据点(y)那么接近了。正则化有意地引入了一些偏差。
  • 为了避免太大的系数,平面倾向于更稳定,不会向任何单个异常值点倾斜,因为系数过大的惩罚意味着模型对任何单个数据点或特征都不能过于敏感。
  • 向量的长度(Beta1X1和Beta2X2)可能会变短,反映出对每个变量对预测的影响被有意地限制。

从根本上说,正则化在一定程度上在模型完美拟合训练数据的能力和提高模型泛化能力之间进行权衡,这意味着它将在未见数据上表现更好,而不仅仅是在训练数据上。这就好像选择一个稍微松一点的毯子,适用于所有实际需求,而不是一个对每个曲线都完美贴合但可能不实用或过于特定于某一张床的毯子。

结论

总而言之,线性回归的几何解释弥合了经典统计学和机器学习之间的差距,提供了对这种基本技术的直观理解。经典统计学通过最小二乘法来处理线性回归,而机器学习通常使用最大似然估计或目标函数最小化来处理线性回归,但这两种方法最终都是为了以一种直观理解的方式最小化预测误差。

Lasso 和 Ridge 等正则化技术的引入进一步丰富了这种解释,突出了模型准确性和可泛化性之间的平衡。这些方法可以防止过拟合,确保模型对新的未见数据保持稳健和有效。

总体而言,这种几何视角不仅揭示了线性回归的神秘,也强调了在数据分析和机器学习不断发展的环境中基础概念的重要性。它强力地提醒我们复杂的算法可以根植于简单而又深远的几何原理。

Leave a Reply

Your email address will not be published. Required fields are marked *