该方法使模型能够确定其对预测的信心水平,在使用比其他方法少得多的计算资源并且不需要额外数据的情况下

强大的机器学习模型正在被用于帮助人们解决一些艰难的问题,例如在医学影像中识别疾病或为自动驾驶车辆检测道路障碍。但是机器学习模型可能会犯错,因此在高风险环境下,人类知道何时信任模型的预测是至关重要的。
不确定性量化是一种提高模型可靠性的工具;模型会随着预测一起生成一个分数,表达预测正确的置信水平。虽然不确定性量化可能很有用,但现有的方法通常需要重新训练整个模型以赋予其该能力。训练涉及展示模型数百万个示例,以便它可以学习一个任务。然后重新训练需要数百万个新数据输入,这可能是昂贵且难以获得的,并且还需要大量的计算资源。
麻省理工学院和MIT-IBM沃森人工智能实验室的研究人员现已开发了一种技术,使模型能够执行更有效的不确定性量化,同时使用比其他方法更少的计算资源,而且不需要额外的数据。他们的技术不需要用户重新训练或修改模型,足够灵活,适用于许多应用场景。
该技术涉及创建一个简单的伴随模型,它有助于原始机器学习模型估计不确定性。这个较小的模型被设计用于识别不同类型的不确定性,这有助于研究人员深入挖掘预测不准确的根本原因。
“不确定性量化对机器学习模型的开发人员和用户都至关重要。开发人员可以利用不确定性测量来帮助开发更强大的模型,而对于用户来说,在实际世界中部署模型时,它可以增加另一层信任和可靠性。我们的工作为不确定性量化提供了更灵活和实用的解决方案,”该技术论文的作者之一、电气工程和计算机科学研究生Maohao Shen说。
Shen与麻省理工学院电子研究实验室(RLE)的前博士后、现任佛罗里达大学助理教授Yuheng Bu、MIT-IBM沃森人工智能实验室的研究员Prasanna Sattigeri、Soumya Ghosh和Subhro Das,以及资深作者Gregory Wornell共同撰写了这篇论文。Wornell是麻省理工学院RLE的Sumitomo教授,领导信号、信息和算法实验室,并是MIT-IBM Watson人工智能实验室的成员。该研究将在人工智能协会的人工智能会议上展示。
量化不确定性
在不确定性量化中,机器学习模型为每个输出生成一个数字分数,反映其对该预测准确性的信心水平。通过从头开始构建一个新模型或重新训练现有模型来融入不确定性量化通常需要大量数据和昂贵的计算,这通常是不实际的。此外,现有的方法有时会意外降低模型预测的质量。
因此,麻省理工学院和MIT-IBM沃森人工智能实验室的研究人员聚焦于以下问题:给定一个预训练模型,他们如何使其能够执行有效的不确定性量化?
他们通过创建一个较小且简单的模型,称为元模型,来解决这个问题,该模型附加到较大的预训练模型上,并使用较大模型已经学习的特征来帮助进行不确定性量化评估。
“元模型可以应用于任何预训练模型。最好能够访问模型的内部,因为我们可以获得更多关于基础模型的信息,但是如果您只有最终输出,它也可以工作。它仍然可以预测置信度分数,”Sattigeri说。
他们设计元模型使用一种技术来生成不确定性量化输出,该技术包括两种不确定性类型:数据不确定性和模型不确定性。数据不确定性是由损坏的数据或不准确的标签引起的,只能通过修复数据集或收集新数据来减少。在模型不确定性中,模型不确定如何解释新观察到的数据,可能会做出不正确的预测,最可能是因为它没有看到足够相似的训练示例。当模型被部署时,这个问题是一个特别具有挑战性但常见的问题。在实际环境中,它们经常遇到与训练数据集不同的数据。
“在您在新环境中使用模型时,您的决策的可靠性是否发生了变化?您希望有一种方法来对其是否在这个新环境中正常工作或是否需要收集该特定新环境的训练数据有信心,”Wornell说。
验证量化结果
一旦模型产生了不确定性量化得分,用户仍然需要一些保证该得分本身的准确性。研究人员经常通过创建一个较小的数据集,从原始训练数据中保留出来,然后在保留数据上测试模型来验证准确性。然而,这种技术在测量不确定性量化方面并不有效,因为模型可以在仍然过于自信的情况下获得良好的预测准确性,Shen说。
他们通过向验证集中的数据添加噪声来创建一种新的验证技术,这些嘈杂的数据更像是可以引起模型不确定性的分布之外的数据。研究人员使用这个嘈杂的数据集来评估不确定性量化。
他们通过观察元模型如何捕捉各种下游任务的不同类型的不确定性,包括分布之外的检测和错误分类的检测,来测试他们的方法。他们的方法不仅在每个下游任务中优于所有基线方法,而且需要更少的训练时间才能达到这些结果。
这种技术可以帮助研究人员使更多的机器学习模型有效地执行不确定性量化,最终帮助用户在何时信任预测方面做出更好的决策。
未来,研究人员希望将他们的技术适应于较新的模型类别,例如具有与传统神经网络不同结构的大型语言模型,Shen说。
该工作部分资助来自MIT-IBM Watson AI实验室和美国国家科学基金会。