引入模型中其他错误的风险
“我们在亚马逊机械土耳其重新运行了一项来自文献的摘要概括任务,并通过按键检测和合成文本分类的组合,估计完成任务时有33-46%的众包工人使用了LLMs。虽然对于其他不太适合LLM的任务的泛化不明确,但我们的结果呼吁平台、研究人员和众包工人寻找确保人类数据保持人类性的新方法,也许可以使用这里提出的方法作为一个跳板。” 来自Veselovsky、Ribeiro和West的研究
最近,瑞士联邦理工学院(EPFL)的一项研究发现,有33%至46%的为训练AI模型而付费的零工工人可能将他们的工作外包给了AI。
《麻省理工科技评论》对这篇研究论文进行了讨论,并解释了被付费训练AI的人确实将他们的工作外包给了AI。它解释了AI现在可以用来创建数据集和标签,这些任务通常由人类完成。它还讨论了这一趋势的影响,例如AI可能从其他AI中学习,进一步整合偏见。

我们如何训练AI系统?
AI系统可以被看作是机器学习模型。在有监督的设置中,这些系统需要黄金标准标签来构建定性的训练数据。这可以在内部完成,尤其是在像Microsoft或Google这样的大型科技公司。然后,对于涉及大规模数据集的复杂任务,数据标注也可以外包给通常被期望是专业人士的供应商。
然而,它们也可以是在线零工工人,对所讨论的主题没有特别的专业知识。实际上,你可以在Mechanical Turk等平台上找到零工工人来完成通常难以自动化的任务。
“亚马逊机械土耳其(MTurk)是一个众包市场,使个人和企业更容易将他们的流程和工作外包给分布式劳动力来执行…