

创建和制定一个能够处理各种用户定义任务的全面模型一直是人工智能(AI)研究领域的一个关注点。这在自然语言处理(NLP)中尤为突出,通过“指令调整”来实现。这种方法通过让大型语言模型(LLM)接触广泛的活动并通过自然语言指令来表达,使模型能够胜任任意指令。
其中一个例子是使用视觉语言模型。”视觉语言模型”(VLM)是一种能够理解文本和图像作为输入的人工智能类型。它们可以执行涉及视觉和文本数据相互作用的各种任务。它们用于图像字幕、视觉问答和创建视觉场景的文本描述,或者在语言和视觉表示之间进行翻译。
最近,Stability AI的研究人员宣布发布其首个日语视觉语言模型——Japanese InstructBLIP Alpha。虽然已经有很多视觉语言模型,但这是第一个生成日语文本描述的模型。这个新算法旨在为传入的照片生成日语文本描述和对与图像相关的查询的文本响应。
研究人员强调,该模型可以识别特定的日本地标。对于从机器人技术到旅游的各种用途来说,这种能力提供了一个重要的本地化意识层。此外,该模型可以处理文本和图像,从而能够基于视觉输入进行更复杂的查询。
研究人员进行了深入的研究,开发了这个模型,并使用多样化的指令数据对该模型进行了训练。为了将两者连接起来,他们使用了图像编码器、LLM和查询变换器(Q-Former)对模型进行了训练。此外,他们通过指令调整对Q-Former进行了微调,同时保持了图像编码器和LLM的冻结状态。
此外,研究人员收集了26个公开可用的数据集,涵盖了广泛的功能和职责,并将它们转换为指令调整格式。该模型在13个数据集上进行了训练,并在所有13个保留数据集上展示了最先进的零样本性能。研究人员进一步强调,当在各个下游任务上进行微调时,该模型显示出最先进的性能。他们还设计了一种指令感知的查询变换器,可以提取特定指令的信息元素。
他们提出了“指令感知视觉特征提取”的思想,介绍了一种根据给定指令灵活提取信息且具有信息性的特征的方法。为了让Q-Former从冻结的图像编码器中检索指令感知的视觉特征,文本指令被发送给冻结的LLM和Q-Former。他们还使用了平衡采样技术来同步数据集之间的学习进度。
尽管该模型具有实用性和有效性,但研究人员警告用户要注意当前潜在的偏见和限制。他们提醒用户,像任何其他AI系统一样,必须通过人为判断来评估响应的准确性和适当性。通过持续的研究和开发,该模型在日语视觉语言任务中的性能必须得到提高。