

大型语言模型(LLMs)在自然语言处理(NLP)领域取得了显著进展。将多模态引入LLMs并将其转化为多模态大型语言模型(MLLMs),可以进行多模态感知和解释,这是一个合乎逻辑的步骤。作为人工通用智能(AGI)的可能步骤,MLLMs在感知(如存在、计数、位置、OCR)、常识推理和代码推理等各种多模态任务中展示出了令人惊讶的新技能。与LLMs和其他任务特定模型相比,MLLMs能够以更类似人类的视角看待环境,提供用户友好的交互界面,并具备更广泛的任务解决能力。
现有的以视觉为中心的MLLMs使用Q-former或基本投影层、预训练的LLMs、视觉编码器和额外的可学习模块。另一种范式是通过API将当前的视觉感知工具(如跟踪和分类)与LLMs相结合,构建一个无需训练的系统。早期在视频领域的一些研究使用了这种范式开发了视频MLLMs。然而,以往从未对基于长时间电影(持续时间超过一分钟)的模型或系统进行过任何研究,并且也没有设定衡量这些系统有效性的标准。
在这项研究中,浙江大学、华盛顿大学、微软亚洲研究院和香港大学的研究人员介绍了一种名为MovieChat的独特框架,用于解决长时间视频解释挑战,将视觉模型与LLMs结合起来。根据他们的说法,扩展视频理解的剩余困难包括计算困难、内存开销和长期时间关联。为了解决这个问题,他们提出了一种基于阿特金森-希夫林(Atkinson-Shiffrin)记忆模型的记忆系统,其中包括快速更新的短期记忆和紧凑持久的长期记忆。
这个独特的框架将视觉模型与LLMs结合起来,是第一个能够进行扩展视频理解任务的框架。该研究通过进行严格的定量评估和案例研究,评估了理解能力和推理成本的性能,并提出了一种记忆机制,以降低计算复杂性和内存成本,同时改善长期时间关联。该研究通过将巨大的语言模型与视频基础模型相结合,提出了一种新颖的理解视频的方法。
该系统通过包含一个受阿特金森-希夫林模型启发的记忆过程来解决分析长电影的困难,其中包括由Transformers中的令牌表示的短期和长期记忆。所提出的系统MovieChat在扩展视频理解方面表现优于之前只能处理几帧电影的算法,并达到了最先进的性能。这种方法解决了长期时间关联问题,同时降低了内存使用和计算复杂性。该研究凸显了记忆过程在视频理解中的作用,使模型能够存储和检索相关信息长时间。MovieChat的普及对包括内容分析、视频推荐系统和视频监控在内的行业具有实际影响。未来的研究可能会探索如何加强记忆系统,并使用其他模态(包括音频)来提高视频理解能力。这项研究为需要全面理解视觉数据的应用创造了可能性。他们的网站上有多个演示。