大型语言模型(LLMs)彻底改变了自然语言生成领域。传统的微调方法用于响应下游任务需要访问LLMs的参数,这限制了它们在强大的黑匣子LLMs(如ChatGPT)上的使用,这些LLMs仅提供API。因此,最近的研究重点关注提示技术,通过提供许多任务特定的指示和演示来指导生成结果,证明提示可以显著影响结果,因此需要仔细设计。 虽然提示原则上是一种灵活的方法,但它今天通常使用的方式有些严格。但是在语言学习中并非如此;人们可以通过接受和回应积极和消极的反馈来提高语言技能。 中国东北大学、微软亚洲研究院、微软Azure翻译和NiuTrans研究的一项新研究邀请LLMs重新考虑并学习如何发现其输出中的任何缺陷,以确定决策容量的演变方式。为了在生成之前促进错误识别,他们设计了一种名为“Deliberate then Generate(DTG)”的新提示模板,其中包括指示和可能的输出。 确定候选人是DTG设计的重要部分。使用第二个基准系统的数据是一个简单的选择,因为它的输出通常具有良好的质量,只需要进行小的调整即可有效使用。因此,它无法促进有效的决策。研究人员建议使用与源材料无关的文本,例如随机文本选择或空字符串。由于这种方法成功地触发了LLMs的决策能力,因此DTG可以轻松适应各种文本生产工作,只需要对提示进行轻微修改。从心理学的角度来看,这项工作受到了语言习得的典型案例的启发,该案例在发展语言能力时考虑了负面证据。 团队进行了大量实验,以显示所提出的DTG提示相对于传统提示可靠地增强了GPT3.5(text-DaVinci-003)和GPT4的模型性能。这在七个文本生成任务和20多个数据集中都成立。机器翻译、简化和常识创造只是一些文本生成任务,其中由DTG提示的GPT实现了各种数据集的最先进性能。建议的DTG提示确实允许在生成之前进行决策和错误避免,这一点通过广泛的消融研究和统计误差分析得到证明。 研究人员计划在未来的工作中利用任务特定的领域知识来进一步提高DTG提示的效果。
Leave a CommentCategory: 机器学习
通过使用户连接工具和服务,能够遵循图形用户界面(GUI)指令的系统可以自动化繁琐的工作,增加可访问性,并增加数字助手的实用性。 许多基于GUI的数字代理实现都依赖于HTML衍生的文本表示,这些表示并不总是容易获取。人们通过感知视觉输入并使用标准的鼠标和键盘快捷键来使用GUI;他们不需要查看应用程序的源代码来弄清楚程序的工作原理。无论底层技术如何,他们都可以通过直观的图形用户界面快速掌握新的程序。 雅达利游戏系统只是一个例子,说明了一个从仅像素输入中学习的系统可以表现得多么出色。然而,在尝试基于GUI的指令跟随任务时,从仅像素输入中学习时会面临许多障碍,这与通用的低级动作相结合。要对GUI进行视觉解释,必须熟悉界面的结构,能够识别和解释视觉定位的自然语言,识别和识别视觉元素,并预测这些元素的功能和交互方法。 谷歌DeepMind和谷歌介绍了PIX2ACT,这是一个模型,它以基于像素的截屏作为输入,并选择与基本鼠标和键盘控件匹配的操作。研究小组首次证明,一个只有像素输入和通用操作空间的代理可以超过人类众包工作者,并达到使用DOM信息和相当数量的人类演示的最先进代理的性能。 为此,研究人员扩展了PIX2STRUCT。这个基于Transformer的图像到文本模型已经通过大规模在线数据进行了训练,将截图转换为基于HTML的结构化表示。PIX2ACT应用树搜索来反复构建新的专家轨迹进行训练,采用人类演示和与环境的交互的组合。 团队在这里的努力包括创建一个通用的基于浏览器的环境框架,并使用标准的跨域观察和操作格式调整了两个基准数据集MiniWob++和WebShop,以在其环境中使用。使用他们提出的选项(不带DOM的CC-Net),PIX2ACT在MiniWob++上的表现比人类众包工作者高出约四倍。削减实验表明,PIX2STRUCT的基于像素的预训练对PIX2ACT的性能至关重要。 对于基于GUI的指令跟随像素输入,研究结果表明PIX2STRUCT通过屏幕截图解析的预训练的有效性。在行为克隆环境中进行预训练将MiniWob++和WebShop任务得分分别提高了17.1和46.7。尽管与使用基于HTML的输入和任务特定操作的较大语言模型相比仍存在性能劣势,但这项工作为这个环境设置了第一个基准。
Leave a Comment谷歌的一组研究人员最近与 Muse 的快速文本到图像模型合作开发了创新的神经网络 StyleDrop。这项开创性的技术允许用户生成忠实地体现特定视觉风格的图像,捕捉细微的差别和复杂性。通过选择具有所需风格的原始图像,用户可以将其无缝地转移到新图像,同时保留所选择的风格的所有独特特征。StyleDrop 的多功能性还可用于与完全不同的图像一起使用,使用户能够将儿童绘画转换成风格化的标志或角色。 StyleDrop 由 Muse 先进的生成视觉转换器驱动,使用用户反馈、生成图像和 Clip 分数的组合进行训练。神经网络是通过最小的可训练参数进行微调的,仅占总模型参数的不到 1%。通过迭代训练,StyleDrop 不断提高生成图像的质量,确保在短短几分钟内获得令人印象深刻的结果。 这个创新工具对于寻求开发其独特视觉风格的品牌来说是非常宝贵的。有了 StyleDrop,创意团队和设计师可以高效地以其所偏爱的方式原型设计想法,使其成为不可或缺的资产。对 StyleDrop 的性能进行了广泛的研究,将其与其他方法(如 DreamBooth、Imagen 上的文本反转和 Stable Diffusion)进行了比较。结果一致展示了 StyleDrop 的卓越性,提供了高质量的图像,紧密地符合用户指定的风格。 StyleDrop 的图像生成过程依赖于用户提供的基于文本的提示。StyleDrop…
Leave a Comment尽管被广泛赞誉为能够生成自然语言文本的能力,但大型语言模型(LLMs)存在数据记忆、偏见和不适当语言等潜在负面影响,这引起了人们对其潜在负面影响的担忧。由于LLMs的复杂性和不断发展的能力,验证和纠正这些担忧是具有挑战性的。在这项研究中,作者提出了ReLM,这是一个通过传统的正则表达式检查和查询LLMs的系统。通过ReLM,许多语言模型评估可以通过将复杂的评估方法简化为正则表达式查询来形式化和实现。 通过对记忆、性别偏见、毒性和语言理解的查询结果,ReLM可以将统计和快速调整覆盖范围扩展到比最先进的即席搜索多达15倍。对于日益增长的LLM验证挑战,ReLM提供了一个有竞争力和广义的起点。 ReLM是第一个允许从整体上描述测试模式集合以直接测量LLM行为的解决方案。ReLM的成功源于使用解空间的紧凑图形表示,该解空间是从正则表达式导出的,然后在执行之前被编译成LLM特定的表示。因此,用户不需要熟悉LLM的内部工作方式;测试产生的结果与如果所有可能的字符串存在于现实世界中一样。除了建立ReLM之外,作者还展示了如何在各种LLM评估任务中使用字符串模式。 Python用户程序可以使用ReLM框架;ReLM公开了这些程序可以使用的特定API。要使用ReLM,软件需要发送一个查询对象和在第三方库(如Hugging Face Transformers(Wolf等,2020))中定义的LLM。正则表达式、LLM决策规则和遍历算法都存储在查询对象中。 在编写代码的同时,ReLM的用户可以将验证任务分为两个部分: 使用正则表达式正式描述一组字符串的子集。 引导引擎通过字符串枚举和评估的过程。 研究人员表明,ReLM可以快速、表达地执行常见查询,从而显著减少LLMs所需的验证工作量。最重要的是: 形式上概述了将正则表达式应用于LLM预测。与可数的多项选择问题不同,正则表达式可以描述具有不确定大小的集合。与有时会产生模糊响应的开放式问题相比,ReLM的结果始终是清晰的。 识别和构建了LLM推理查询的条件和无条件类别。许多令牌序列可以表示一个固定的查询字符串,这激发了一种压缩表示的方法,因为学者在研究无条件生成时已经证明了这一点。他们是第一组使用自动机来容纳这些变体编码的人。 设计和实现了一个有效将正则表达式转换为有限自动机的正则表达式推理引擎。研究人员使用了最短路径和随机图遍历,实现了具有竞争力的GPU利用率和运行时间(几秒钟)。 作者使用GPT-2模型说明了在LLM验证的上下文中,ReLM在评估记忆、性别偏见、毒性和语言理解任务方面的价值。 更多细节可在https://github.com/mkuchnik/relm中找到。 最后 由于自然语言的复杂性和LLMs的不断增长,验证大型语言模型(LLMs)的抽象性变得越来越必要。为了使用LLMs执行验证任务,研究人员提出了ReLM,这是第一个可编程框架。使用ReLM,您可以在正则表达式中编写逻辑查询,然后将其转换为LLM语言中的可执行形式。ReLM可以以比以前的方法节省2.5倍的数据,或以比以前的方法快15倍,或以提供额外见解的方式运行记忆、性别偏见、毒性和语言理解任务。虽然ReLM的结果强烈反对依赖即席LLM验证,但系统地解决这些问题引入了其他困难(例如,从左到右的自回归解码有利于后缀完成)。我们的长期目标包括提高ReLM的查询优化能力并将其带到更多模型系列中。
Leave a CommentGPT模型是OpenAI开发的ChatGPT聊天机器人背后的变压器架构,它基于通过仅几个例子学习任务的概念。这种称为上下文学习的方法,使模型避免了使用数千个输入文本进行微调,只使用特定于任务的示例作为输入就能学习在不同任务上表现良好。针对特定任务微调模型可能非常昂贵,因为GPT是一个具有数十亿参数的“大”语言模型,由于在微调期间需要更新所有模型参数,因此相对而言成本较高。 上下文学习在代码生成、问答、机器翻译等方面得到了有效应用,但在图机器学习任务中仍然存在局限性和挑战。一些图机器学习任务包括识别在社交网络上传播半真半假或虚假新闻的传播者和跨电子商务网站的产品推荐。上下文学习在制定和建模这些任务的过程中面临局限性,无法形成和建模统一的任务表示,使模型能够处理各种任务而无需重新训练或参数调整。 最近,一组研究人员在其研究论文中介绍了PRODIGY,这是一个预训练框架,可实现在图形上下文中学习。PRODIGY(Pretraining Over Diverse In-Context Graph Systems)使用提示图表示形式来制定上下文学习。提示图作为上下文图任务表示,集成了节点、边缘和图级机器学习任务的建模。提示网络将输入节点或边缘与其他标签节点连接,并对提示示例和查询进行上下文化。这种互连表示允许指定各种图形机器学习任务到同一模型中,而不受图形大小的限制。 由斯坦福大学和卢布尔雅那大学的研究人员提出,团队设计了一种图形神经网络架构,专门用于处理提示图,并有效地对图结构化数据进行建模和学习。所提出的设计利用GNN教授提示图的节点和边缘的表示。此外,还引入了一系列上下文预训练目标,以指导学习过程,提供监督信号,使模型能够捕获相关的图形模式并在不同的任务中进行推广。 为了评估PRODIGY的性能和有效性,作者在涉及引文网络和知识图的任务上进行了实验。引文网络代表科学论文之间的关系,而知识图则捕获有关不同领域的结构化信息。使用上下文学习对预训练模型进行了测试,并将结果与硬编码适应性的对比预训练基线和使用有限数据的标准微调进行了比较。PRODIGY在准确性方面平均优于对比预训练基线的硬编码适应性18%。当应用上下文学习时,与标准微调相比,平均提高了33%。 总之,PRODIGY在基于图形的场景中似乎很有前途,如图机器学习应用中的上下文学习。它甚至可以在以前未见过的图形上执行下游分类任务,使其更加有效和有益。
Leave a Comment机器学习系统设计:端到端实例指南是一个实用指南,用于规划和设计成功的机器学习应用程序它提供了一个清晰、可重复的框架,用于构建、维护和改进任何规模的系统
Leave a Comment基础模型是人工智能领域的一个重大进展,可以创建多功能和高性能的模型,可应用于各种领域,如自然语言处理、计算机视觉和多模态任务
Leave a Comment该博客专注于GPT模型,提供深入的理解和分析它解释了GPT模型的三个主要组成部分:生成、预训练和变压器
Leave a CommentAmazon Textract是一种机器学习(ML)服务,可以自动从任何文档或图像中提取文本、手写和数据Amazon Textract在AnalyzeDocument API中具有表格功能,可以自动从任何文档中提取表格结构在本文中,我们将讨论对表格功能进行的改进以及[…]
Leave a Comment训练拥有数十亿个参数的大型语言模型(LLM)可能会具有挑战性除了设计模型架构外,研究人员还需要设置先进的分布式训练技术,如混合精度支持、梯度累积和检查点对于大型模型,训练设置更加具有挑战性,因为在单个…中可用的内存有限
Leave a Comment由亚历山大·弗瑞姆根 (Alexander Frömmgen),高级软件工程师莱拉·卡拉提扬 (Lera Kharatyan) 发布 代码更改审查是规模化软件开发过程中至关重要的一部分,占用了代码作者和代码审查人员相当数量的时间。作为这个过程的一部分,审查人员检查建议的代码,并通过自然语言编写的评论要求作者进行代码更改。在 Google,我们每年看到数百万个审查人员的评论,作者需要平均 ~60 分钟的积极引导时间,在发送更改进行审查和最终提交更改之间。在我们的测量中,代码作者必须做出的为了应对审查人员的评论所需的积极工作时间几乎是随着评论数量线性增长的。然而,通过机器学习 (ML),我们有机会自动化和简化代码审查过程,例如,根据评论的文本提出代码更改。 今天,我们描述了我们在 Google 的日常开发工作流程中应用最新的大型序列模型 (使用 DIDACT 方法论) 的应用,自动解决代码审查评论。截至今天,Google 的代码更改作者通过应用 ML 建议的编辑,处理了大量的审查人员评论。我们预计,在 Google 的规模下,这将每年减少数十万小时的代码审查时间。非请求的非常积极的反馈表明,ML 建议的代码编辑的影响增加了 Google…
Leave a Comment由Google研究科学家Petros Maniatis和Daniel Tarlow发布 软件并非一步到位创造出来的,它是逐步改进的,一点一点地改进——编辑、运行单元测试、修复构建错误、处理代码审查、再次编辑、满足linter的要求,修复更多错误——直到最终变得足够好并合并到代码仓库中。软件工程不是孤立的过程,而是人类开发人员、代码审查人员、错误报告人员、软件架构师和工具(如编译器、单元测试、linter和静态分析器)之间的对话。 今天,我们介绍DIDACT(Dynamic Integrated Developer ACTivity),这是一种用于培训大型机器学习(ML)模型进行软件开发的方法。 DIDACT的新颖之处在于,它使用软件开发过程作为模型的训练数据源,而不仅仅是该过程的精细终态——完成的代码。通过向模型展示开发人员在工作时看到的上下文以及他们采取的行动,模型学习软件开发的动态,更符合开发人员花费时间的方式。我们利用Google软件开发的工具来扩大开发人员活动数据的数量和多样性,超越了以前的工作。结果在两个方面非常有前途:对专业软件开发人员的有用性,以及作为植入ML模型的一般软件开发技能的潜在基础。 DIDACT是一个多任务模型,训练开发活动,包括编辑、调试、修复和代码审查。 我们构建并内部部署了三个DIDACT工具,评论解决(我们最近宣布)、构建修复和提示预测,每个工具都集成在开发工作流程的不同阶段。所有这三个工具都得到了数千名内部开发人员的热烈反馈。我们认为这是有用性的终极测试:专业开发人员是否利用这些工具来提高生产力? 最令人兴奋的是,我们展示了DIDACT是通向一种通用开发者辅助代理的第一步。我们展示了经过训练的模型可以通过提示开发人员活动的前缀以各种令人惊讶的方式使用,并通过链接多个预测来展开更长的活动轨迹。我们相信DIDACT为开发能够在软件开发过程中通用辅助的代理铺平了一个有前途的道路。 软件工程过程中的数据宝库 Google的软件工程工具链将与代码相关的每个操作存储为工具和开发人员之间交互的日志,并已经这样做了几十年。原则上,人们可以使用这个记录来详细重现“软件工程视频”中Google代码库的关键情节,一步一步地——一次代码编辑、编译、评论、变量重命名等等。 Google的代码位于monorepo中,一个包含所有工具和系统的代码单一存储库。软件开发人员通常会在由名为“Clients in the Cloud(CitC)”的系统管理的本地写时复制工作区中尝试代码更改。当开发人员准备将一组代码更改打包到特定目的(例如修复错误)时,它们会在Critique中创建一个变更列表(CL),这是Google的代码审查系统。与其他类型的代码审查系统一样,开发人员与同行审查人员就功能和样式进行对话。随着对话的进行,开发人员编辑他们的CL以解决审查人员的意见。最终,审查人员宣布“LGTM!”(“看起来不错”),CL被合并到代码库中。 当然,除了与代码审查人员的对话之外,开发人员还与其他大量软件工程工具进行“对话”,例如编译器、测试框架、linter、静态分析器、fuzzer等。 开发软件所涉及到的复杂活动的插图:开发人员的小动作,与代码审查人员的互动以及使用编译器等工具。 软件工程的多任务模型 DIDACT利用工程师和工具之间的交互来支持ML模型,从而协助Google开发人员在追求其软件工程任务时,建议或增强开发人员在上下文中采取的行动。为此,我们定义了许多有关单个开发人员活动的任务:修复破碎的构建、预测代码审查评论、处理代码审查评论、重命名变量、编辑文件等。我们对每个活动使用一个共同的形式化:它需要一些状态(代码文件),一些意图(特定于活动的注释,例如代码审查评论或编译器错误),并产生一个操作(执行任务所需的操作)。这个操作就像一个小型编程语言,可以扩展到新添加的活动中。它涵盖了编辑、添加注释、重命名变量、标记带有错误的代码等内容。我们将这种语言称为DevScript。 DIDACT模型受到任务、代码片段以及与该任务相关的注释的促进,并产生开发操作(例如编辑或评论)。 这种状态-意图-操作形式使我们能够以一般方式捕获许多不同的任务。更重要的是,DevScript是一种简洁的表达复杂操作的方式,无需输出整个状态(原始代码),因为它在动作发生之后就会变得如此;这使得模型更加高效和可解释。例如,重命名可能会触及文件中的数十个地方,但是模型可以预测单个重命名操作。 ML同行程序员…
Leave a Comment由Google Research的研究科学家Arsha Nagrani和Paul Hongsuck Seo发布 自动语音识别(ASR)是一项成熟的技术,广泛用于各种应用,例如电话会议、流媒体视频转录和语音命令。尽管该技术的挑战集中在嘈杂的音频输入方面,但多模式视频(例如电视,在线编辑视频)中的视觉流可以为提高ASR系统的鲁棒性提供有力的线索,这就是所谓的视听ASR(AV-ASR)。 尽管唇部运动可以为语音识别提供强烈信号并且是AV-ASR最常关注的领域,但是在野外视频中口部通常不直接可见(例如由于自我中心的视角,面部覆盖和低分辨率),因此,一种新兴的研究领域是不受限制的AV-ASR(例如AVATAR),它调查整个视觉框架的贡献,而不仅仅是口部区域。 然而,为训练AV-ASR模型构建视听数据集是具有挑战性的。虽然已经从在线教学视频中创建了How2和VisSpeech等数据集,但它们的规模很小。相比之下,模型本身通常是大型的,包含视觉和音频编码器,因此它们往往会在这些小型数据集上过度拟合。尽管如此,最近发布了许多经过大规模培训的仅音频模型,这些模型通过从类似于LibriLight和LibriSpeech的有声书籍中获得的大规模音频数据进行大规模培训而被大量优化。这些模型包含数十亿个参数,易于获得,并在跨域方面显示出强大的泛化能力。 考虑到以上挑战,“AVFormer: Injecting Vision into Frozen Speech Models for Zero-Shot AV-ASR”中,我们提出了一种简单的方法,可在现有的大型仅音频模型中注入视觉信息,同时进行轻量级域适应。AVFormer使用轻量级可训练的适配器将视觉嵌入注入到冻结的ASR模型中(类似于Flamingo将视觉信息注入大型语言模型以进行视觉文本任务),这些适配器可以在少量弱标记的视频数据上进行训练,最小化额外的训练时间和参数。我们还介绍了一个简单的培训课程方案,我们证明它对于使模型有效地联合处理音频和视觉信息至关重要。由此产生的AVFormer模型在三个不同的AV-ASR基准测试(How2,VisSpeech和Ego4D)上实现了最先进的零样本性能,同时关键保持传统仅音频语音识别基准测试的良好性能(即,LibriSpeech)。 无限制的视听语音识别。我们通过轻量级模块将视觉注入冻结的语音模型(BEST-RQ,灰色)中,以实现零样本视听ASR,创建一个参数和数据效率模型,称为AVFormer(蓝色)。当音频信号嘈杂时,视觉背景可以为稳健的语音识别提供有帮助的线索(视觉面包帮助将“丁香”这个音频错误更正为“面包”在生成的转录文本中)。 使用轻量级模块注入视觉信息 我们的目标是在现有的仅音频ASR模型中添加视觉理解能力,同时保持其对各种领域(AV和仅音频领域)的泛化性能。 为此,我们使用以下两个组件增强现有的最先进的ASR模型(Best-RQ):(i)线性视觉投影仪和(ii)轻量级适配器。前者将视觉特征投射到音频标记嵌入空间中。此过程允许模型正确连接分别预训练的视觉特征和音频输入标记表示。然后,后者最小化修改模型以增加对来自视频的多模态输入的理解。然后,我们使用HowTo100M数据集中未标记的Web视频以及ASR模型的输出作为伪地面真实性对这些附加模块进行培训,同时保持Best-RQ模型的冻结状态。这样的轻量级模块使数据效率和性能强的泛化成为可能。 我们在零-shot的情况下对AV-ASR基准模型进行了扩展模型的评估,其中该模型从未在手动标注的AV-ASR数据集上进行过训练。 用于视觉注入的课程学习 在初始评估之后,我们经过实验证明,采用单一的联合训练轮次,模型难以同时学习适配器和视觉投影器。为了缓解这个问题,我们引入了一种分阶段课程学习策略,将这两个因素——领域自适应和视觉特征集成——解耦,并按顺序训练网络。在第一阶段,适配器参数在不提供视觉令牌的情况下进行优化。一旦适配器训练完成,我们加入视觉令牌,并在第二阶段中仅训练可视化投影层,同时保持训练好的适配器冻结。…
Leave a CommentGoogle增强现实的研究科学家Ruofei Du和高级研究科学家Alex Olwal在博客中指出,最近视频会议的进步极大地改进了远程视频通信,通过实时字幕和降噪等功能。然而,在各种情况下,动态视觉增强将有助于更好地传达复杂和微妙的信息。例如,在讨论在日本餐厅点什么菜时,你的朋友可以分享视觉图像,帮助你更自信地点“Sukiyaki”。或者当谈论你最近的旧金山家庭旅行时,你可能想展示你个人相册中的照片。 在ACM CHI 2023上介绍了我们的“视觉字幕:通过即时视觉增强语言交流”系统,我们引入了一个系统,使用口头提示来增强同步视频通信的实时视觉效果。我们使用我们为此目的策划的数据集,对大型语言模型进行了微调,以在开放词汇对话中主动建议相关的视觉效果。作为ARChat项目的一部分,我们开源了Visual Captions,该项目旨在快速原型开发具有实时转录的增强通信。 Visual Captions通过实时视觉效果促进口头交流。该系统甚至对实时语音转文字记录中经常出现的典型错误也非常稳健。例如,在上下文之外,转录模型误解了“pier”一词,将其误认为是“pair”,但Visual Captions仍建议使用Santa Monica Pier的图像。 通过动态视觉增强语言交流的设计空间 我们邀请了10个内部参与者,他们各自具有不同的技术和非技术背景,包括软件工程师、研究人员、UX设计师、视觉艺术家、学生等等,讨论他们对潜在实时视觉增强服务的特定需求和愿望。在两个会议中,我们介绍了设想系统的低保真原型,随后展示了现有文本到图像系统的视频演示。这些讨论形成了一个视觉增强实时对话的设计空间,如下图所示,标记为D1到D8。 视觉增强可以与对话同步或异步(D1:时间),可以用于表达和理解语音内容(D2:主题),可以使用各种不同的视觉内容、视觉类型和视觉来源进行应用(D3:视觉)。这种视觉增强可能会因会议规模(D4:规模)和会议是否处于同地或远程设置(D5:空间)而有所不同。这些因素还影响视觉效果是应该私下显示、在参与者之间共享还是公开对所有人显示(D6:隐私)。参与者还确定了他们在进行对话时想与系统交互的不同方式(D7:启动)。例如,人们提出了不同程度的“主动性”,这表示用户希望模型采取主动的程度。最后,参与者设想了不同的交互方式,例如使用语音或手势进行输入。(D8:交互)。 通过动态视觉增强语言交流的设计空间。 在初步反馈的基础上,我们设计了Visual Captions,专注于生成语义相关的视觉内容、类型和来源的同步视觉。虽然参与者在这些初步的探索性会话中参与的是一对一的远程对话,但在野外部署Visual Captions通常会是一对多(例如,一个人向观众进行演示)和多对多的情况(例如,多人在会议中进行讨论)。 因为最适合补充对话的视觉内容强烈依赖于讨论的上下文,我们需要一个特定于此用途的训练集。因此,我们收集了1595个语言(1)、视觉内容(2)、类型(3)和来源(4)的四元组数据集,涵盖了各种情境,包括日常对话、讲座和旅游指南。例如,“我很想看看它!”对应于“面孔微笑”的视觉内容,一个“emoji”的视觉类型和“公共搜索”的视觉来源。 “她有没有告诉你我们去墨西哥的旅行?”对应于“墨西哥旅行的一张照片”的视觉内容,一个“照片”的视觉类型和“个人相册”的视觉来源。我们为研究社区公开发布了该VC1.5K数据集。 视觉意图预测模型 为了预测哪些视觉内容可以补充对话,我们使用VC1.5K数据集基于大型语言模型训练了一个视觉意图预测模型。为了进行训练,我们将每个视觉意图解析成“ <Visual Type>…
Leave a Comment