LLM幻觉是指大型语言模型(如聊天机器人或计算机视觉系统)产生的不合乎实际模式或对象的荒谬或不准确输出的现象。这些虚假的人工智能输出来源于各种因素。过拟合于有限或有偏向性的训练数据是主要因素。高模型复杂度也是原因之一,使得人工智能能够感知不存在的相关性。
发展生成式人工智能系统的主要公司正在采取措施来解决人工智能幻觉问题,尽管一些专家认为完全消除虚假输出可能是不可能的。
谷歌将其模型与互联网连接,以基于训练数据和网络信息的响应。OpenAI使用人类反馈和强化学习来改进ChatGPT的输出。他们提出了“过程监督”,为模型正确的推理步骤而不仅仅是最终答案给予奖励。这可以提高解释性,尽管有人怀疑其对抗捏造的效力。
尽管如此,公司和用户可以采取措施来对抗和限制人工智能幻觉可能带来的潜在危害。需要持续努力来最大限度地保证真实性和实用性,同时最大程度地减小风险。有一些有希望的方法,但是随着技术的发展,减轻幻觉的问题仍然是一个活跃的挑战。
减少LLM幻觉的方法
1. 使用高质量的训练数据
因为生成式人工智能模型根据其训练数据生成输出,所以使用高质量、相关的数据集对于最小化幻觉非常重要。在多样化、平衡、结构良好的数据上训练的模型更有能力理解任务并产生无偏向、准确的输出。
优质的训练数据使模型能够学习微妙的模式和相关性,也可以防止模型学习到不准确的关联。
2. 明确用途
明确定义人工智能系统的具体目的和可允许的用途有助于避免幻觉内容的生成。建立模型角色的责任和限制,使其专注于有用的、相关的回应。
当开发人员和用户明确指出预期的应用时,人工智能有一个用于判断其生成是否符合预期的基准。这阻止了其荒谬推测的出现,因为这些推测在训练过程中没有根据。明确定义的目标为人工智能自我评估其回应提供了上下文。
明确期望的功能和用途,以便生成模型能够始终以实际现实为基础,而不是生成与其目的无关的幻觉内容。明确“为什么”来引导它们朝着真实价值的方向发展。
3. 利用数据模板来指导人工智能输出
使用结构化的数据模板来限制人工智能幻觉。模板为输入模型的数据提供了一致的格式。这有助于与预期的输出指南保持一致。通过预定义的模板来指导数据的组织和内容,模型学会生成符合预期模式的输出。这些格式塑造了模型的推理,使其始终保持与结构化现实相连接,而不是制造幻想内容。
依赖整洁、统一的数据模板可以减少模型在解释方面的不确定性。它必须与可接受的示例保持一致。这种一致性限定了模型可以展开的预测空间。
4. 限制回应
为模型输出设置约束和限制,以减少无控制的猜测。明确定义概率阈值并使用过滤工具来约束可能的回应,并使生成保持稳定和准确。
5. 持续测试和改进系统
在部署之前进行彻底的测试,并持续监控以改进性能。通过评估输出结果,可以确定需要调整的领域,同时可以使用新数据来重新训练模型并更新其知识。这种持续的改进可以对抗过时或倾斜的推理。
6. 依赖人类监督
引入人类监督作为一项关键保障。当人类专家审查输出时,他们可以通过背景知识做出判断,并纠正任何幻觉内容,而机器则欠缺这种能力。结合人工智能和人类智慧,可以得到最佳效果。
7. 连贯的思维引导
大型语言模型(LLM)在多步骤推理(如数学)方面有一个已知的弱点,尽管在生成任务(如模仿莎士比亚散文)方面表现出色。最近的研究表明,当模型通过几个例子进行提示,将问题分解为连续的步骤时,其推理任务的性能得到改善,形成了一个逻辑的思维链。
简单地提示模型“逐步思考”会产生类似的结果,而无需手工创建示例。只需轻轻引导LLM(语言模型)逐步详细地走过其推理过程,而不是创建自由形式的文本,可以更好地集中其在需要结构化分析的任务上的能力。这表明提示工程可以有意义地增强LLM在逻辑问题上的处理能力,并补充其在语言生成方面的流畅性。对有序思维的微小提示有助于抵消它们倾向于美丽但目标不明确地漫谈的倾向。
8. 任务分解和Agent
最近的研究探索使用多个AI“代理”来提高处理复杂提示时的性能。这种方法使用初始路由器代理将提示分解为特定的子任务。每个子任务由一个专门的专家代理处理,而所有代理都是大型语言模型(LLM)。
路由器代理将整体提示分解为与可用专家代理能力相匹配的逻辑片段。这些代理可能会重组接收到的提示片段,以充分利用其专门技能。通过将多个LLM链接在一起,每个LLM专注于特定类型的推理,整体系统可以解决超越任何单个组件的挑战。
例如,一个询问一个公众人物的信息的问题可以被路由到搜索代理,该搜索代理将检索有关总结代理可压缩为答案的相关数据。对于关于安排会议的查询,日历和天气代理可以向总结代理提供必要的详细信息。
这种方法旨在协调不同LLM的优势,以改进逐步推理。与单一的综合模型不同,专门的代理处理最适合他们的子任务。路由器代理使模块化的协调能够以结构化的方式处理复杂提示。
总结
减轻幻觉需要持续的努力,因为LLM中可能不可避免地存在虚构。高品质的训练数据、清晰的用例、模板、严格的测试和人工监督有助于最大程度地提高真实性。虽然风险仍然存在,但负责任的开发和合作可以培养AI的益处。如果我们以道德为基础来慎重引导这些强大的工具,将会面临挑战,但也会有可能性。