

最近引入的大型语言模型(LLMs)已经在人工智能(AI)社区中引起了轰动。这些模型通过使用超强的自然语言处理(NLP)、自然语言生成(NLG)和自然语言理解(NLU)成功地模仿了人类。LLMs因为能够模仿人类进行真实对话而变得著名,它们能够回答简单和复杂的问题,生成内容,代码补全,机器翻译和文本摘要。NLP的目标是使计算机系统能够理解和响应以自然语言给出的命令,使人们能够以更自然和灵活的方式与它们互动,最好的例子就是指令跟随模型。
这些模型是使用LLMs、有监督的例子或其他类型的监督进行训练,并暴露在成千上万个以自然语言指令编写的任务中。在最近的研究中,来自麦吉尔大学Mila Quebec AI研究所、麦吉尔大学和Facebook CIFAR AI Chair的团队研究了评估指令跟随模型在给定一组文本段落上执行问答(QA)任务的性能。这些模型可以在提供描述任务、问题和由检索器检索到的相关文本段落的提示时回答问题,这些模型产生的响应被认为是自然和信息丰富的,有助于建立用户的信任和参与度。
这些模型可以通过仅向其输入添加检索到的文档和指令来自然而流畅地回答用户的查询。然而,这种额外的冗长使得传统的QA评估指标如完全匹配(EM)和F1分数难以有效地量化模型的性能。这是因为模型的响应可能包含更多细节,而参考答案忽略了这些细节,但仍然准确。为了解决这个问题,团队提供了两个评估指标衡量检索增强的质量保证(QA)中的指令跟随模型。
- 关于信息必要性、准确性:这个维度评估模型满足用户信息需求的能力。它关注的是生成的响应是否包含相关信息,即使它超出了直接在参考答案中提及的内容。
- 与所提供的信息的一致性:这个维度评估模型在所提供的知识中是否正确回答问题。一个真实的模型应该避免在呈现无关信息时回答问题,并在有关信息可用时给出准确的答案。
作者在三个不同的QA数据集上评估了几个最近的指令跟随模型:用于开放域QA的自然问题,用于多跳QA的HotpotQA,以及用于对话QA的TopiOCQA。他们手动分析了900个模型的响应,并将结果与不同的自动评估指标进行了比较,以评估准确性和忠实度。他们的研究表明,召回率(衡量参考答案中的标记在模型响应中的占比)与正确性的相关性比EM或F1分数等词汇重叠度量更强。与其他用于忠实度的标记重叠度量相比,K-Precision(模型答案标记在知识片段中存在的百分比)与人类判断更强相关。
总之,本研究旨在更全面地评估指令跟随模型在QA任务中的优势和劣势。该团队通过在GitHub存储库上提供他们的代码和数据,进一步推动了该领域的进展。