Press "Enter" to skip to content

如何人力助推机器学习

技术和人类活动之间的许多分歧是人为的 — 人们如何使我们的工作成为可能?

照片由Dominik Scythe在Unsplash上

我们不够讨论我们在推动机器学习方面所依赖的大量人工劳动。事实上,技术和人类活动之间的分割是人为的。构建模型所需的所有输入都是人类努力的结果,而所有输出在某种程度上都存在影响人类的目的。今天的专栏文章将讨论一些我们忽视了人在我们所做的工作中的重要性的具体领域 —— 而不仅仅是编写代码的数据科学家。

技术与人类活动之间的分割是人为的,因为构建模型所需的所有输入都是人类努力的结果,而所有输出在某种程度上都存在影响人类的目的。

生成数据

你几乎肯定已经了解到这一点 — 大型语言模型需要大量的文本数据进行训练。我们通常将其量化为硬盘上数百或数千千兆字节的数据,但这是相对抽象的。一些报告显示,GPT-4 在其训练数据中拥有大约1万亿个单词。其中每一个单词都是由人类创造,凭借自己的创造能力编写而成的。为了提供背景,权力的游戏系列中的第一本书包含约29.3万字。因此,GPT-4 的训练数据大约相当于该书的341.6万份副本长度。这只是文本建模的一个例子 —— 其他类型的模型,如生成或分类多媒体的模型,也使用类似规模的这类数据。

在处理这些数据时,有几个要考虑的因素。首先,所有这些数据都是由人类生成的,它们并不是以魔法般的方式出现在我们的硬盘上。尊重和认可创建我们数据的人们的重要性从伦理的角度看是很重要的,因为他们为我们获得了价值和利益。但我们还有更自私的理由来了解我们的数据来自何处。作为数据科学家,我们有责任了解我们给我们的模型提供了哪些材料作为范例,并对其进行深入的理解。如果我们忽略数据的来源,当我们的模型面对真实世界时,我们会被它们的行为所惊讶。例如,将大型语言模型训练在互联网论坛或社交媒体数据上会导致这些模型重复复制那些最糟糕的空间,包括种族主义、仇恨语言等。在稍微不那么极端的例子中,我们知道模型的特点与其所接受的训练数据有关

如果我们忽略数据的来源,当我们的模型面对真实世界时,我们会被它们的行为所惊讶。

标记数据

标记数据需要人类的帮助。但标记究竟是什么?在本质上,标记数据意味着使用人类的辨识能力为我们在数据中发现的内容赋予价值或判断。无论数据如何收集或创建,许多机器学习用例都需要某种形式的标记。

这可能意味着简单地决定一个数据点是好还是坏,确定单词是积极的还是消极的,创建衍生的值,将记录分成不同类别,确定哪些标签适用于图像或视频,或者其他无尽的可能。一个常见的例子是识别图像或其他多媒体中的文本,以改进字符识别模型。如果你曾经使用过验证码,我敢打赌,你做过数据标记的工作。

从理论上讲,大型语言模型本身不需要标记,因为我们通过事实上这些文本已经由真实人类生成来推断文本与人类之间的质量相似性。基本上,因为是人类写的,所以根据定义,它是模型尝试学习和模仿的可接受范例。这就是为什么我们使用语义嵌入等技术 —— 模型学习如何工作于人类生成的文本中的语言模式,并将其量化为数学表示。但我们仍然在选择哪些文本输入模型的过程中,正如我之前所描述的,我们有责任了解和评估该文本。

教学模型

强化学习在调整模型响应提示的任务中使用人工干预,意思是一旦模型基本掌握了返回连贯答案的技巧,无论是文本、图像、视频还是其他内容,我们会稍微调整它的反应。在某些主要自动化的预训练或基础训练之后,许多模型由人类进行微调,有时微妙地决定模型是否满足预期的要求。这是一项非常困难的任务,因为我们对模型的实际要求可能非常复杂。这基本上是以按通过或不通过的方式对LLM进行副本编辑,涉及的规模极大。

正如我之前讨论过的那样,许多现代模型都希望生成对人类用户最令人满意、看起来正确和吸引人的内容。训练这种模型的最好方法何在于让人类评估中间训练阶段的结果,并决定这些结果是否符合该描述,然后告知模型以便它可以做出更合适的选择?这不仅是最有效的方法,也可能是唯一的可行方法。

这基本上是按通过或不通过的方式对LLM进行副本编辑。

为什么这很重要

好吧,那有什么关系呢?仅仅对于真正的人们为使我们的模型变得可能而付出了很多辛勤工作心存感激就足够了吗?向他们表示感谢?不,不完全是这样,因为我们需要审视人类影响对我们生成的结果意味着什么。作为数据科学家,我们需要对我们所构建的内容与其所存在的世界之间的相互作用感到好奇。

由于所有这些影响领域,人的选择塑造了模型的能力和判断。因为人类创造、控制和评判所有涉及的材料,所以我们将人类偏见嵌入到模型中。我们决定将这段文本提供给模型进行训练,或者决定这个特定的模型回应比其他回应更糟糕,而模型将我们的这些选择固化为它可以重复使用和复制的数学表示。

这种偏见是不可避免的,但不一定是坏事。试图创造一个摆脱了人类影响的东西表明人类影响和人类本身是需要避免的问题,这我认为是不公平的评价。同时,我们应该对人类偏见存在于我们的模型中保持实际的看法,抵制将模型视为我们人类过失之外的东西的诱惑。例如,我们如何给予标签等因素会导致有意识或潜意识地将意义灌输到数据中。无论是原创的创意内容、数据标签还是对模型输出的评判,我们都在我们创建的数据中留下了我们的思维过程和历史的痕迹。

试图创造一个摆脱了人类影响的东西表明人类影响和人类本身是需要避免的问题,这我认为是不公平的评价。

此外,在机器学习领域,人力工作往往被视为“真正”工作的一部分,而不是意义重大的工作本身。那些创作原创作品的人不再被视为独创的个体,而只是成为服务模型的“内容生成器”。我们忽视了这些内容存在的人性和真正的原因,那就是为了为人类服务和赋予人类力量。与前面的观点类似,我们最终将人类贬值为偶像化技术,我认为这是愚蠢的。这些模型是人类的产物,存在的目的是为了服务人类,它们不是独立的终点。如果你构建一个从不使用、从不运行的模型,那还有什么意义?

数据是否可再生资源?

还有另一个有趣的问题:干净的人类生成内容的匮乏作为限制模型能力的风险。也就是说,当我们的社会开始使用LLMs来生成我们的数据,使用Dall-E来生成我们的图像,并且停止鼓励真实的人们在没有这些技术的情况下创造,那么我们需要用于训练这些模型的无数单词和大量图像将被人工生成的内容污染。当然,这些内容是源自人类内容的,但并非完全相同。我们尚没有非常好的方法来区分由没有模型的人生成的内容,因此我们将很难知道我们用于未来模型的训练数据是否存在这种污染,以及有多少。

有些人争论说这其实不是个大问题,而且在一定程度上训练模型使用一些人造内容不会成为问题,但还有人推测当我们以这种方式开始吞并人为生成的内容时,训练的基本过程将发生根本变化,形成所谓的模型崩溃。这在某种程度上就是一个问题的本质,你的模型会影响到它所依赖的世界,因此模型自身的行为就会发生变化。这不仅仅适用于LLM,数据科学家们都知道这一点。任何模型都有可能通过影响人们的行为而失去工作,导致由于底层数据关系变化而出现性能漂移。

你的模型会影响到它所依赖的世界,因此模型自身的行为就会发生变化。

即使我们不是在训练实际的人造数据,也有很多学者在考虑我们的人类构成和创造过程是否会因为暴露于人造内容而发生变化。如果你大量阅读LLM生成的文本,不管是在写作时寻求模型建议还是在互联网上一般地阅读,那会不会微妙地改变你的写作方式?从社区层面来看,现在还为时过早,但这是一个严重的关注点。

人类的影响是机器学习的事实,这是一个哲学问题。我们认为机器学习是一门纯粹的科学事业,一种对我们产生作用的力量,这也是为什么有些人感到害怕的原因之一。但实际上,这些正在被创建的系统是人类干预和创造的产物。创建和筛选数据使得机器学习的其他一切成为可能。在某种程度上,这应该让我们感到安心,因为我们对机器学习的运用和方式具有控制力。机器学习的过程是将数据之间的关系计算并转化为数学表达,而这些数据则是由人类产生并受到我们的控制。机器学习和人工智能不是某种外来的、抽象的力量,它们只是我们自己。

查看更多我写的文章,请访问www.stephaniekirmer.com

上述的文章和引用链接如下:

Leave a Reply

Your email address will not be published. Required fields are marked *