尽管被广泛赞誉为能够生成自然语言文本的能力,但大型语言模型(LLMs)存在数据记忆、偏见和不适当语言等潜在负面影响,这引起了人们对其潜在负面影响的担忧。由于LLMs的复杂性和不断发展的能力,验证和纠正这些担忧是具有挑战性的。在这项研究中,作者提出了ReLM,这是一个通过传统的正则表达式检查和查询LLMs的系统。通过ReLM,许多语言模型评估可以通过将复杂的评估方法简化为正则表达式查询来形式化和实现。 通过对记忆、性别偏见、毒性和语言理解的查询结果,ReLM可以将统计和快速调整覆盖范围扩展到比最先进的即席搜索多达15倍。对于日益增长的LLM验证挑战,ReLM提供了一个有竞争力和广义的起点。 ReLM是第一个允许从整体上描述测试模式集合以直接测量LLM行为的解决方案。ReLM的成功源于使用解空间的紧凑图形表示,该解空间是从正则表达式导出的,然后在执行之前被编译成LLM特定的表示。因此,用户不需要熟悉LLM的内部工作方式;测试产生的结果与如果所有可能的字符串存在于现实世界中一样。除了建立ReLM之外,作者还展示了如何在各种LLM评估任务中使用字符串模式。 Python用户程序可以使用ReLM框架;ReLM公开了这些程序可以使用的特定API。要使用ReLM,软件需要发送一个查询对象和在第三方库(如Hugging Face Transformers(Wolf等,2020))中定义的LLM。正则表达式、LLM决策规则和遍历算法都存储在查询对象中。 在编写代码的同时,ReLM的用户可以将验证任务分为两个部分: 使用正则表达式正式描述一组字符串的子集。 引导引擎通过字符串枚举和评估的过程。 研究人员表明,ReLM可以快速、表达地执行常见查询,从而显著减少LLMs所需的验证工作量。最重要的是: 形式上概述了将正则表达式应用于LLM预测。与可数的多项选择问题不同,正则表达式可以描述具有不确定大小的集合。与有时会产生模糊响应的开放式问题相比,ReLM的结果始终是清晰的。 识别和构建了LLM推理查询的条件和无条件类别。许多令牌序列可以表示一个固定的查询字符串,这激发了一种压缩表示的方法,因为学者在研究无条件生成时已经证明了这一点。他们是第一组使用自动机来容纳这些变体编码的人。 设计和实现了一个有效将正则表达式转换为有限自动机的正则表达式推理引擎。研究人员使用了最短路径和随机图遍历,实现了具有竞争力的GPU利用率和运行时间(几秒钟)。 作者使用GPT-2模型说明了在LLM验证的上下文中,ReLM在评估记忆、性别偏见、毒性和语言理解任务方面的价值。 更多细节可在https://github.com/mkuchnik/relm中找到。 最后 由于自然语言的复杂性和LLMs的不断增长,验证大型语言模型(LLMs)的抽象性变得越来越必要。为了使用LLMs执行验证任务,研究人员提出了ReLM,这是第一个可编程框架。使用ReLM,您可以在正则表达式中编写逻辑查询,然后将其转换为LLM语言中的可执行形式。ReLM可以以比以前的方法节省2.5倍的数据,或以比以前的方法快15倍,或以提供额外见解的方式运行记忆、性别偏见、毒性和语言理解任务。虽然ReLM的结果强烈反对依赖即席LLM验证,但系统地解决这些问题引入了其他困难(例如,从左到右的自回归解码有利于后缀完成)。我们的长期目标包括提高ReLM的查询优化能力并将其带到更多模型系列中。
Leave a CommentTag: Tech News
GPT模型是OpenAI开发的ChatGPT聊天机器人背后的变压器架构,它基于通过仅几个例子学习任务的概念。这种称为上下文学习的方法,使模型避免了使用数千个输入文本进行微调,只使用特定于任务的示例作为输入就能学习在不同任务上表现良好。针对特定任务微调模型可能非常昂贵,因为GPT是一个具有数十亿参数的“大”语言模型,由于在微调期间需要更新所有模型参数,因此相对而言成本较高。 上下文学习在代码生成、问答、机器翻译等方面得到了有效应用,但在图机器学习任务中仍然存在局限性和挑战。一些图机器学习任务包括识别在社交网络上传播半真半假或虚假新闻的传播者和跨电子商务网站的产品推荐。上下文学习在制定和建模这些任务的过程中面临局限性,无法形成和建模统一的任务表示,使模型能够处理各种任务而无需重新训练或参数调整。 最近,一组研究人员在其研究论文中介绍了PRODIGY,这是一个预训练框架,可实现在图形上下文中学习。PRODIGY(Pretraining Over Diverse In-Context Graph Systems)使用提示图表示形式来制定上下文学习。提示图作为上下文图任务表示,集成了节点、边缘和图级机器学习任务的建模。提示网络将输入节点或边缘与其他标签节点连接,并对提示示例和查询进行上下文化。这种互连表示允许指定各种图形机器学习任务到同一模型中,而不受图形大小的限制。 由斯坦福大学和卢布尔雅那大学的研究人员提出,团队设计了一种图形神经网络架构,专门用于处理提示图,并有效地对图结构化数据进行建模和学习。所提出的设计利用GNN教授提示图的节点和边缘的表示。此外,还引入了一系列上下文预训练目标,以指导学习过程,提供监督信号,使模型能够捕获相关的图形模式并在不同的任务中进行推广。 为了评估PRODIGY的性能和有效性,作者在涉及引文网络和知识图的任务上进行了实验。引文网络代表科学论文之间的关系,而知识图则捕获有关不同领域的结构化信息。使用上下文学习对预训练模型进行了测试,并将结果与硬编码适应性的对比预训练基线和使用有限数据的标准微调进行了比较。PRODIGY在准确性方面平均优于对比预训练基线的硬编码适应性18%。当应用上下文学习时,与标准微调相比,平均提高了33%。 总之,PRODIGY在基于图形的场景中似乎很有前途,如图机器学习应用中的上下文学习。它甚至可以在以前未见过的图形上执行下游分类任务,使其更加有效和有益。
Leave a Comment