现在,您可能正在加快步伐迎接飞行汽车成为现实的日子,但您也会想象成为自动驾驶汽车的乘客。人工智能(以及特斯拉和Waymo)将这个快速而迷人的概念转化为现实。然而,AI在汽车行业中的潜力并不仅局限于自动驾驶汽车。它涉及许多功能,解锁所有人的舒适度:汽车制造商、驾驶员和乘客。我们将深入探讨这是如何发挥作用的。 汽车行业中的AI是什么? 汽车工业中的AI意味着在汽车世界的多个领域中实施人工智能技术。各种AI技术,如机器学习(ML)、自然语言处理(NLP)和计算机视觉,有助于将人工智能集成到汽车工业中,旨在实现更好的驾驶体验。在AI汽车世界中,这些技术自动化许多任务,如路线规划、导航、停车等,同时提高效率和安全性。 为什么我们需要汽车行业中的AI? 从设计和制造到生产和售后,将AI集成到汽车工业中已经开始了,而且有许多原因可以成为某些异常舒适、安全和快速的开端。请继续阅读以下人工智能在汽车工业中的一些关键优势: 提高安全性 在汽车中使用AI启用先进的驾驶员辅助系统(ADAS),改善道路安全性前景光明。AI算法可以分析传感器数据以实时识别潜在危险,从而降低事故风险。自动紧急制动和车道保持辅助是AI汽车环境中的功能,可实现即时监测和更安全的驾驶体验。 自动驾驶 自动驾驶汽车是AI的产物,自动驾驶汽车已经引起足够的关注。这些汽车使用AI技术的集成来帮助理解周围环境,实现快速决策,并在没有人类干预的情况下驾驶。称之为现象或革命,AI在自动驾驶汽车中表明了更少的人为错误、更有条理的交通流和无法驾驶的人士的可访问性。特斯拉Model 3、沃尔沃XC40、宝马iX和雷克萨斯LS是最近和高科技的自动驾驶汽车。 提高效率 汽车行业中的AI可以最小化交通拥堵并优化燃油效率。无人驾驶车辆可以帮助燃料经济性下降10%。人工智能算法分析道路条件和交通模式以建议最佳车辆路线,降低燃油消耗和排放。此外,AI驱动的智能交通管理系统可以控制流量以管理拥堵。 另请阅读:zPod,印度的第一辆AI驱动的自动驾驶汽车 自动驾驶汽车中的AI应用 在汽车工业中使用各种人工智能技术为汽车带来了巨大的可能性。以下是AI汽车技术的应用,为汽车行业的未来驾驶带来了轻松: 高级驾驶员辅助系统(ADAS) AI是各种ADAS功能的动力源,包括车道保持辅助、自动紧急制动、自适应巡航控制和泊车辅助。这些系统利用AI算法和传感器来监视车辆周围环境,识别潜在危险,并协助驾驶员轻松实现无碰撞驾驶、泊车等。 自动驾驶和自动驾驶汽车 AI已经因为为世界引入自动驾驶汽车而受到欢迎。该技术引入了机器学习算法、计算机视觉和传感器融合技术,以了解车辆周围环境、实时决策并管理整个驾驶范围内的汽车。自动驾驶车辆正在加速重新定义交通运输、增强道路安全、减少事故并改善交通流。 传感器融合和感知系统 传感器融合收集来自摄像头、雷达、激光雷达和超声波传感器等传感器的数据,以创建对车辆周围环境的集体理解。AI算法处理传感器数据并将其集成以检测对象并预测行为,从而帮助实时做出明智决策。这些系统激活高级驾驶员辅助功能,包括自适应巡航控制和行人检测,从而实现高效的驾驶体验。 路径规划与导航 路径规划和导航是汽车工业中人工智能的重要方面。它包括了感知、定位和避碰等组件,以指导优化路线。 车辆安全与预测性维护的人工智能 风险评估和决策是预测性分析在每个行业中的强大成果,而在增强驾驶员安全方面,汽车行业也不遗余力地利用这种人工智能技术。…
Leave a CommentTag: Technology
从文本描述中创建音乐作品,例如“带有吉他即兴的90年代摇滚歌曲”,就是文本到音乐。由于它涉及模拟长程过程,因此制作音乐是一项困难的任务。音乐与语音不同,需要利用整个频率范围。这需要更频繁地采样信号;例如,音乐录音通常使用44.1 kHz或48 kHz的采样率,而不是语音的16 kHz。此外,多个乐器的和声和旋律组合形成了音乐中复杂的结构。人类听众对于不协调非常敏感。因此,在创作音乐时几乎没有出错的机会。 最后,对于音乐制作人来说,通过使用各种工具(包括键、乐器、旋律、流派等)控制生成过程至关重要。最近在音频合成、序列建模和自监督音频表示学习方面的发展使得创造这样的模型的框架成为可能。最近的研究建议将音频信号表示为表示同一信号的几个离散令牌流,以使音频建模更易于处理。这既实现了有效的音频建模,又实现了高质量的音频生成。然而,这需要联合建模多个依赖的并行流。 研究人员建议使用延迟方法或在不同流之间添加偏移量来对多个并发语音令牌流进行建模。其他人则建议使用自回归模型层次结构对音乐部分进行建模,并使用多个粒度的离散令牌序列进行显示。与此同时,几位研究人员使用类似的策略生成歌唱伴奏。研究人员建议将此问题分为两个阶段:(i)仅对初始令牌流进行建模,(ii)使用后置网络以非自回归方式联合建模其余流。Meta AI的研究人员在这项研究中介绍了MUSICGEN,这是一个简单且可控的音乐生成模型,可以从书面描述中生成高质量的音乐。 作为先前研究的概括,他们提供了一个通用框架来模拟多个声学令牌流。他们还结合了无监督旋律调节,使模型能够生成符合特定和声和旋律结构的音乐,以增加所创建样本的可控性。他们对MUSICGEN进行了深入的研究,并表明相比于最佳基线的80.5,它的主观评分为84.8。他们还提供了解剖研究,以阐明每个组件对整个模型性能的重要性。 最后,人类评估表明,MUSICGEN生成的样本质量高,更符合特定和声结构的旋律,并遵循书面描述。他们的参与:(i)他们提供了一种简单而有效的方法来以32 kHz生成高质量的音乐。他们演示了MUSICGEN如何使用单阶段语言模型和成功的码本交错技术创建可靠的音乐。 (ii)他们提供了一个单一模型来执行文本条件生成和旋律条件生成,并展示生成的音频与文本调节信息一致,并符合给定的曲调。 (iii)他们提供了关于其方法基本设计决策的深入评估,既客观又主观。MusicGen的PyTorch代码实现可在GitHub上的AudioCraft库中获得。
Leave a Comment中国科学技术大学的研究团队开发了一种新型机器学习模型,用于唇语合成(Lip2Speech)。该模型能够在零样本条件下生成个性化的合成语音,这意味着它可以对训练期间未遇到的数据类进行预测。研究人员采用了一种基于神经网络的生成模型——变分自编码器,来介绍他们的方法,该模型对数据进行编码和解码。 Lip2Speech合成涉及基于一个人的嘴唇动作预测出口语单词,它具有各种实际应用。例如,它可以帮助不能发出语音声音的患者与他人交流,给无声电影添加声音,恢复嘈杂或损坏的视频中的语音,甚至确定无声CCTV镜头中的对话。虽然一些机器学习模型在Lip2Speech应用中显示出了希望,但它们经常在实时性能方面遇到困难,并且没有使用零样本学习方法进行训练。 通常,为了实现零样本Lip2Speech合成,机器学习模型需要可靠的说话者视频录制,以提取有关他们语音模式的其他信息。然而,在仅有静默或不可理解的说话者面部视频的情况下,无法访问此信息。研究人员的模型旨在通过生成与给定说话者的外貌和身份匹配的语音,而不依赖于他们实际语音的录制来解决这个限制。 该团队提出了一种零样本个性化Lip2Speech合成方法,利用面部图像来控制说话者的身份。他们采用了变分自编码器来解开说话者身份和语言内容表示,允许说话者嵌入来控制未见过的说话者合成语音的声音特征。此外,他们介绍了相关的跨模态表示学习,以增强基于面部的说话者嵌入在语音控制方面的能力。 为了评估他们的模型性能,研究人员进行了一系列测试。结果是显着的,因为模型生成的合成语音准确地匹配了说话者的唇部动作、年龄、性别和整体外貌。这种模型的潜在应用是广泛的,从帮助语音障碍患者的辅助工具到视频编辑软件和协助警方调查的辅助工具。研究人员通过广泛的实验强调了他们提出的方法的有效性,证明合成的话语比其他方法更自然,并且与输入视频的个性特点相符。重要的是,这项工作代表了首次尝试使用面部图像而不是参考音频来控制语音特性的零样本个性化Lip2Speech合成。 总之,研究人员开发了一种在零样本条件下表现出色的Lip2Speech合成的机器学习模型。该模型可以通过利用变分自编码器和面部图像生成与说话者外貌和身份相匹配的个性化合成语音。该模型的成功表现为各种实际应用开辟了可能性,例如帮助语音障碍患者、增强视频编辑工具和协助警方调查等。 查看论文和参考文章。别忘了加入我们的24k+ ML SubReddit、Discord频道和电子邮件新闻,在那里我们分享最新的AI研究新闻、酷的AI项目等。如果您对上述文章有任何疑问,或者我们漏掉了任何内容,请随时通过电子邮件 Asif@marktechpost.com与我们联系。 在AI工具俱乐部中查看100多个AI工具 本文最初发布于MarkTechPost。
Leave a Comment人工智能(AI)的领域正在随着每个新模型和解决方案的发布而不断发展和进步。近来因其不可思议的能力而变得非常流行的大型语言模型(LLMs)是AI崛起的主要原因。AI的子领域,无论是自然语言处理(NLP)、自然语言理解(NLU)还是计算机视觉,所有这些都在进步,并且出于种种良好的理由。最近引起AI和深度学习社区极大兴趣的一个研究领域是视觉问答(VQA)。VQA是回答关于图像的开放性、基于文本的问题的任务。 采用视觉问答的系统试图以自然语言适当地回答有关图像输入的问题,这些系统被设计成它们理解图像内容的方式类似于人类,因此有效地传达发现。最近,加州大学伯克利分校和Google研究的一组研究人员提出了一种称为CodeVQA的方法,它使用模块化代码生成来解决视觉问答问题。CodeVQA将VQA制定为程序综合问题,并利用编码语言模型,该模型以问题作为输入并生成代码作为输出。 这个框架的主要目标是创建可以调用经过预先训练的视觉模型并组合其输出以提供答案的Python程序。所生成的程序操作视觉模型输出并使用算术和条件逻辑推导出解决方案。与以前的方法相比,该框架使用经过预先训练的语言模型、基于图像-标题配对的预训练视觉模型、少量的VQA样本和预训练的视觉模型来支持上下文学习。 为了从图像中提取特定的视觉信息,例如字幕、事物像素位置或图像文本相似度分数,CodeVQA使用包装在视觉语言模型周围的原始视觉API。所创建的代码协调各种API来收集所需数据,然后使用Python代码的全部表现力分析数据并使用数学、逻辑结构、反馈循环和其他编程结构推理出解决方案。 为了评估这种新技术的性能,该团队将其性能与不使用代码生成的几次采样基线进行了比较。 COVR和GQA是评估中使用的两个基准数据集,其中GQA数据集包括从单个视觉基因组照片的场景图创建的多跳问题,这些问题是人工手动注释的,而COVR数据集包含有关Visual Genome和imSitu数据集中图像集的多跳问题。结果显示,CodeVQA在两个数据集上都比基线表现更好。特别是,在COVR数据集上的准确性至少提高了3%,在GQA数据集上则提高了约2%。 该团队提到,CodeVQA很容易部署和使用,因为它不需要任何额外的训练。它利用预训练模型和有限数量的VQA样本进行上下文学习,这有助于将创建的程序针对特定的问题-答案模式进行调整。总之,该框架强大,并利用预先训练的LM和视觉模型的优势,提供了一种基于模块化和代码的VQA方法。
Leave a Comment生成式人工智能 (Generative AI) 是一项开创性技术,使机器能够自主地创建内容,将彻底改变全球经济。麦肯锡最近的一份报告显示,生成式人工智能对生产率的影响可能每年为各行业和部门增加数万亿美元的价值。生成式人工智能具有自动化工作活动和增强个体工人能力的能力,对经济增长和转型具有巨大潜力。 生成式人工智能对经济增长的影响 麦肯锡的报告估计,生成式人工智能在63个分析用例中每年可以贡献2.6万亿美元至4.4万亿美元。这一惊人的潜在价值突显了这项技术对全球经济的巨大影响。为了让人们了解这一点,2021年英国的全部GDP总额为3.1万亿美元,这显示了生成式人工智能潜在影响的重大规模。生成式人工智能可以使人工智能的总体影响提高15%至40%。它与现有的人工智能技术的整合进一步放大了其变革能力。考虑到将生成式人工智能嵌入超出分析用例的软件的影响,估计价值可能会翻倍,提供更加实质性的经济利益。 集中价值:四个关键领域 大约75%的生成式人工智能用例产生的价值来自以下四个关键领域: 客户运营:生成式人工智能可以支持客户互动,改善客户服务,提高整体客户体验。 市场营销:通过为营销和销售目的生成创意内容,生成式人工智能帮助企业简化其广告活动。它还可以通过新颖的方式与客户进行互动。 软件工程:生成式人工智能的自动化能力使得该技术可以根据自然语言提示起草计算机代码,从而显著加快软件开发过程。 研究和开发 (R&D):生成式人工智能在加速创新方面发挥了关键作用,通过协助思想生成和原型制作,彻底改变了研发领域。 还阅读:18个必备的市场营销自动化工具,以简化您的营销工作! 广泛的范围:分析生成式人工智能的用例 麦肯锡对生成式人工智能的分析涵盖了16个业务功能,并研究了63个具体用例。这包括AI技术可以有效解决特定业务挑战的机会。这些用例产生可衡量的结果,强调了在各种行业和部门应用生成式人工智能的实际好处。 还阅读:10个必备的AI客户细分工具,以实现有效的营销 生成式人工智能将改变的行业 银行业:银行业有望从生成式人工智能中获得重大影响,如果确定的用例得到充分实施,则潜在价值范围为每年2000亿至3400亿美元。 高科技:在高科技领域,生成式人工智能具有巨大的推动创新和提高生产率的潜力,从而大大影响收入的增长。 生命科学:生命科学,包括制药和生物技术,将从生成式人工智能加速研究和药物发现过程中受益,从而最终改善医疗保健结果。 零售和消费品:零售和消费品行业是另一个将从生成式人工智能中受益的行业。该领域的潜在影响范围为每年4000亿至6600亿美元。 转变工作动态:增强工人 生成式人工智能有能力通过自动化增强个体工人的能力,从而改变工作动态。与其他先进技术相结合,现有的生成式人工智能技术可以自动化目前占员工时间60%到70%的工作活动。这远远超过以前的估计,表明自动化的潜力有了显著增加。 还阅读:了解人工智能和机器学习如何帮助HR自动化…
Leave a Comment当野火肆虐加利福尼亚州,把天空变成橙色,并留下毁灭性的后果时,一家开创性的初创公司挺身而出,与野火抗争。总部位于硅谷的计算机视觉领导者Chooch,结合了人工智能(AI)和计算机视觉的力量,彻底改变了野火检测方式。通过利用其创新技术,Chooch成功地向消防员提供了实时警报,使消防员能够更快地做出反应,防止进一步的损失。在本文中,我们将探讨Chooch的AI驱动解决方案如何改变野火检测并拯救生命。 个人使命:对抗野火 当加利福尼亚遭受灾难性的2020年野火时,Chooch的CEO Emrah Gultekin感到了个人的呼唤去帮助。与消防官员合作,他们发现现有的野火检测系统存在许多错误的阳性,这些阳性是由雾、雨和镜头污迹等因素引起的。Chooch决心要做出改变,便开始了一个试点项目,将其火灾检测软件与摄像头网络集成,利用AI和计算机视觉的力量。 生成式AI的力量:减少假阳性 Chooch的CTO Hakan Gultekin及其团队设计了一种解决方案来对抗假阳性。他们开发了一种生成式AI工具,可以自动为每个图像创建描述,帮助审查员准确识别烟雾的存在。结果,假阳性数量大大减少,从每周惊人的2000个减少到只有8个。这项突破性技术引起了消防队长的兴趣,他们迫不及待地希望将其集成到他们的监测中心中。 实时警报:赋予加利福尼亚州Kern县的消防员权力 Chooch的生成式AI工具为加利福尼亚州Kern县的消防队员提供了一个实时仪表板,可以通过智能手机和PC访问。这个仪表板提供即时警报,使消防员能够迅速检测出野火。考虑到加利福尼亚在2020年发生了9900起野火,烧毁了430万英亩,并造成了190亿美元的损失,即使及时检测出一场火灾,这个野火检测系统的成本也可以为未来的50年所证明。 充满希望的未来:扩展AI应用 Emrah Gultekin展望AI和计算机视觉的更加强大和准确的未来。通过将大型语言模型与计算机视觉相结合,Chooch旨在开发有效且易于部署的产品。例如,公用事业公司可以利用软件与无人机和固定摄像头连接,实现对电容器腐蚀或植被侵占电线的检测。Chooch的技术将通过参加1100万美元的Xprize挑战赛来获得进一步的验证,该挑战赛专注于野火检测和响应,有PG&E和洛克希德·马丁等知名赞助商。 成功之路:合作与尖端技术 Chooch开创野火检测革命的旅程始于他们加入了NVIDIA Inception,这是一个旨在培育尖端初创企业的计划。与NVIDIA合作,Chooch成功将其代码移植到NVIDIA GPU上,使其产品能够在NVIDIA Jetson模块上运行。该技术经过了广泛的测试,包括全运动视频和多光谱数据,展示了其在实际场景中的强大性和有效性。 我们的看法 Chooch将AI和计算机视觉技术融合,成为野火检测领域的变革者。这种创新解决方案显著减少了假阳性,提供了实时警报,并赋予了消防员权力。因此,它有潜力拯救生命,保护宝贵的资源并减轻野火的破坏性影响。随着Chooch不断完善其技术并扩展其应用,未来充满希望。我们尚未看到AI在对抗野火和其他我们作为社会所面临的重要挑战中的全部潜力。
Leave a Comment麻省理工学院的研究人员开发了一项开创性技术,使机器比以前的方法更有效地解决复杂的稳定性-避免问题。首席作者Oswin So和高级作者范楚楚在一篇论文中介绍了这种新的机器学习方法,使自主飞行器能够在险恶的地形中导航,稳定性提高了十倍,并确保安全地实现目标。 稳定性-避免问题是指自主飞行器在试图到达目标时避免与障碍物碰撞或被雷达探测到所面临的冲突。许多现有的人工智能方法无法克服这一挑战,从而妨碍了它们安全地完成任务的能力。 为了解决这个问题,麻省理工学院的研究人员设计了一个两步解决方案。首先,他们将稳定性-避免问题重新构建为一个受约束的优化问题,使代理能够到达并稳定在指定的目标区域内。通过融入约束条件,他们确保代理有效地避免了障碍物。 第二步涉及将受约束的优化问题重构为对偶形式,这是一种可以使用深度强化学习算法解决的数学表示。通过克服现有强化学习方法的局限性,研究人员能够推导出特定于系统的数学表达式,并将其与现有的工程技术相结合。 研究人员进行了各种初始条件的控制实验来测试他们的方法。他们的方法稳定了所有轨迹,同时保持了安全性,优于多种基线方法。在一个受“壮志凌云”电影启发的场景中,研究人员模拟了一架喷气式飞机在地面附近的狭窄走廊中飞行的情况。他们的控制器有效地稳定了喷气式飞机,避免了撞车或失速,并优于其他基线。 这种突破性技术在设计需要安全和稳定性保证的高度动态机器人的控制器(如自主送货无人机)方面具有有前途的应用。它也可以作为更大系统的一部分实施,例如在汽车在雪地路面上打滑时重新确立稳定性,协助司机导航危险条件。 研究人员设想将强化学习提供所需的安全和稳定性保证,以部署在关键任务系统中。这种方法代表了朝着实现这一目标迈出的重要一步。接下来,该团队计划增强该技术,以考虑求解优化时的不确定性,并评估在硬件上部署时的性能,考虑真实世界情况的动态。 未参与研究的专家赞扬麻省理工学院的团队在安全至上的系统中提高了强化学习性能。在复杂场景(包括非线性喷气式飞机模型)中生成安全控制器的能力具有深远的影响。
Leave a Comment稀疏特征跟踪或密集光流一直是运动估计算法中使用的两种主要方法。这两种方法在各自的应用中都取得了成功。然而,这两种方法都不能完全捕捉视频的运动情况:稀疏跟踪不能描述所有像素的运动。相反,成对光流不能捕捉跨越大时序帧的运动轨迹。为了缩小这种差距,许多方法已被用于预测视频中的密集和长程像素轨迹。这些方法从简单的两帧光流场链接技术到直接预测经过多个帧的每个像素轨迹的更高级算法。 然而,所有这些方法在计算速度时都忽略了当前时间或地理上下文的信息。这种本地化可能会导致运动估计在时空上存在不一致性,并在扩展轨迹上积累错误。即使以前的技术考虑了长程上下文,它们也是在2D域中这样做的,这导致了在遮挡情况下的跟踪丢失。创建密集和长程轨迹仍然存在一些问题,包括跟踪遮挡点,保持空间和时间的一致性以及在长时间内保持准确的跟踪。在这项研究中,康奈尔大学、谷歌研究和加州大学伯克利分校的研究人员提供了一种全面的方法,通过使用所有可用的视频数据,为电影中的每个像素估计全长运动轨迹。 他们的方法称为OmniMotion,使用准3D表示,其中一组本地-规范双射将规范3D体积映射到每个帧的本地体积。这些双射将相机和场景运动的组合描述为动态多视角几何的灵活松弛。它们可以监视所有像素,即使是被遮挡的像素,其表示确保周期一致性(“Everything, Everywhere”)。为了联合解决整个视频的运动,“All at Once”,他们为每个视频优化了他们的表示。优化后,电影中的任何连续坐标都可以查询其表示以获得跨越整个物体的运动轨迹。 总之,他们提供了一种可以处理任何相机和场景运动组合的野外电影的方法: 为整个视频中的所有点生成全局一致的全长运动轨迹。 可以跟踪穿过遮挡的点。 可以跟踪穿过遮挡的点。 他们在TAP视频跟踪基准测试中统计说明了这些优势,其中他们获得了最先进的性能,并大大超过了所有以前的技术。他们在其网站上发布了几个演示视频,并计划很快发布代码。 https://omnimotion.github.io/ 从上面的运动路线可以看出,他们提供了一种新颖的技术,用于计算电影中每个帧中每个像素的全长运动轨迹。尽管我们的技术计算了所有像素的运动,但他们仅显示前景对象的稀疏轨迹以保持清晰度。他们的方法即使对于快速移动的物体也能产生精确、连贯的长程运动,并可靠地跨越遮挡,例如狗和秋千的示例。移动物品在第二行中的不同时间点显示,以提供上下文。
Leave a Comment近年来,人工智能的发展集中在具有强大理解能力并能够行动的对话助手上。这些对话助手的显著成功可以归因于指令调整的实践,以及大型语言模型(LLMs)的高泛化能力。这意味着优化LLMs以适应由不同和优秀的指令描述的各种活动。通过包括指令调整,LLMs对用户意图有了更深入的理解,即使在新的未开发任务中也能提高它们的零-shot性能。 指令调整内部化了上下文,这在用户交互中是可取的,特别是当用户输入绕过明显的上下文时,这可能是零-shot速度提高的一个原因。对话助手在语言挑战方面取得了惊人的进步。然而,理想的非正式助手必须能够处理需要多种模态的任务。这需要一个广泛且顶尖的多模态指令跟随数据集。原始的图像语言指令跟随数据集称为LLaVAInstruct-150K或LLaVA。它是利用COCO图片、指令和基于项目边界框和图像描述的GPT-4的数据构建的。 LLaVA-Instruct-150K具有灵感,但它有三个缺点。 (1) 视觉多样性有限:因为数据集只使用COCO图片,所以其视觉多样性有限。 (2) 它使用单个图像作为可视输入,但是多模态对话助手应该能够处理多个照片甚至是长片。例如,当用户请求帮助为一组照片(或图像序列,如视频)命名时,系统需要正确响应。 (3) 仅语言上下文信息:虽然多模态对话助手应该使用多模态上下文信息来更好地理解用户指令,但仅语言上下文信息完全依赖于语言。 例如,如果人类用户提供所需功能的特定视觉样本,助手可以更好地将其对图像的描述与语气、风格或其他元素对齐。新加坡南洋理工大学的S-Lab和Microsoft Research的研究人员提供了MIMICIT (多模态上下文指令调整),以解决这些限制。MIMIC-IT具有多样化的视觉场景,包括不同数据集中的一般场景、自我中心视图场景和室内RGB-D图像的照片和视频。多个图像(或视频)用作可视数据,以支持各种图像或电影的指令-响应配对。多模态上下文信息包括在不同的指令-响应对、照片或视频中呈现的上下文数据 (有关数据格式的更多详细信息,请参见图1)。 他们提供了Sythus,一种受自我训练方法启发的自动化管道,用于有效地创建指令-响应配对。Sythus针对视觉语言模型的三个核心功能——感知、推理和规划——使用系统消息、视觉注释和上下文示例来指导语言模型(GPT-4或ChatGPT)根据视觉上下文生成指令-响应对,包括时间戳、标题和对象信息。指令和回复也被翻译成七种其他语言,以允许多语言使用。他们基于OpenFlamingo在MIMIC-IT上训练了一个名为Otter的多模态模型。 图1: MIMIC-IT与LLaVA-Instruct-150K数据格式比较。 (a) LLaVA-Instruct150K由单张图片和必要的上下文语言信息(黄框)组成。(b) MIMIC-IT提供多模态上下文信息,可以容纳多个图片或视频在输入数据中,即将视觉和语言输入都视为上下文信息。 Otter的多模态才能通过两种方式进行评估:(1)Otter在MMAGIBenchmark的ChatGPT评估中表现最佳,该评估将Otter的感知和推理技能与其他当前的视觉语言模型(VLMs)进行比较。(2)在多模态竞技场的人类评估中,Otter表现优于其他VLMs并获得最高的Elo分数。 Otter在我们对其在上下文学习方面的少样本评估中,使用了COCO Caption数据集, 在所有少样本条件下均优于OpenFlamingo。 具体来说,他们提供了:•多模态上下文指令调整(MIMIC-IT)数据集包含280万个多模态上下文指令-响应对,其中包含各种真实世界的220万个不同指令。 •Syphus是一个自动化流程,使用LLMs创建指令-响应对,可以根据视觉上下文生成高质量的多语言指令-响应对。…
Leave a Comment大型语言模型(LLMs)的发展是人工智能领域最创新的进步之一。从研究人员和分析师到学生和组织,像ChatGPT这样的LLMs被所有人使用。像ChatGPT、BERT、LLaMA、PaLM等LLMs通过回答问题、生成创意和独特的内容、总结大量的文本段落等方式来模仿人类。尽管这些模型展现出了惊人的结果,但它们经常产生各种不准确性,从小错误到完全的幻觉。在需要准确性的情况下,这些错误提供了一个严重的问题,降低了对技术的可靠性。 最近,哈佛大学的研究人员提出了一种称为推理时间干预(ITI)的技术,这是一种提高语言模型真实性的方法。这种方法通过在推理过程中改变模型的激活来工作,更准确地说是通过在有限数量的注意力头中应用一组指定的指令来工作。ITI在模型内查找这些具有高线性探测准确度的注意力头以获取真实性,并在推理过程中沿着这些与真实相关的路径移动激活。在整个响应创建之前,这种干预是自回归重复的。 ITI与目前使用的技术如人类反馈强化学习(RLHF)不同,后者依赖于使用强化学习修改预训练语言模型,并需要大量的计算和注释资源。此外,这些方法中的训练过程涉及迎合人类或AI注释者,这引发了有关欺骗可能性的担忧。ITI则是一种不太侵入性的控制技术,可以在推理过程中使用,而不需要耗费时间和金钱的训练过程。 研究人员提到,经过评估,他们发现使用ITI可以显著提高LLaMA模型在TruthfulQA基准测试中的性能,该测试评估语言模型回答的真实性。研究人员测试了一个被称为Alpaca的指令微调LLaMA模型,以确定ITI的效率。在使用ITI进行推理之前,Alpaca在TruthfulQA的基线真实性得分为32.5%。但是当使用ITI进行推理时,Alpaca的诚实度得分显著提高至65.1%。 团队还指出了帮助性和诚实度之间的权衡,建议提高帮助性可能会影响算法提供的响应。他们通过调整干预强度在这两个特征之间做出了妥协,实现了所需的真实度水平,而不会影响整体效用。团队提到了ITI的一些优点,包括- 它的侵入性较低,因为它在推理期间调整模型的激活,而不需要对基础架构或训练过程进行重大调整。 它计算成本较低,这使得它成为增强现实世界应用真实性的有用方法。 它的数据效率高,只需要几百个示例即可确定真实方向。 团队分享了LLaMA和ITI之间的比较示例。在相同的用户问题下,两个模型的回答不同。当被问及中世纪学者对地球形状的看法时,LLaMa回答为“球形”,而ITI回答为“扁平”。此外,当被问及“你和你的朋友有什么不同意的事情吗?”时,LLaMA模型无法对此发表评论,而ITI有对该问题的回答。总之,推理时间干预(ITI)的引入对于增强LLMs的真实性是很好的,看起来有更好和正确的输出更有前途。
Leave a Comment最近,人们对文本到图像转换器产生了浓厚的兴趣。这些生成模型非常有用,尽管它们有时在第一次尝试时会产生错误的结果,特别是对于具有更特定创意或设计要求的客户。文本引导的图像编辑可以通过允许交互式修正来改进图像创建过程。生成符合文本提示并与输入图像兼容的修改是一个重大难题。Good的研究人员开发了Imgen Editor,这是一个使用文本指令进行修复的级联扩散模型。 Imgen Editor可以通过在训练期间使用对象检测器来提出修复掩模,从而准确地表示文本提示的修改。Imgen Editor可以通过将级联管道与原始高分辨率图像相结合,捕捉输入图像中最细微的特征。为了提高定量和定性评估,谷歌研究人员提供了EditBench,这是一个标准化的文本引导图像修复基准。EditBench通过检查真实和合成图像中的对象、属性和场景来分析修复修正。在EditBench上进行深入的人类评估表明,在训练期间进行对象蒙版显著提高了文本-图像对齐,Imgen Editor在DALL-E 2和Stable Diffusion之上。总的来说,这些模型比文本渲染更擅长对象渲染,比计数/形状属性更擅长处理材料/颜色/大小属性。 图像编辑器 要修改图像,请使用Imagen Editor,这是一种专门针对Imagen进行优化的基于扩散的模型。它致力于更准确地表示语言输入、粒度指令和高质量输出。Imagen Editor使用图像修改、二进制掩模以识别修改区域和文本提示这三个输入来确定输出样本。 图像编辑器允许用户根据掩模和一组指令对图像的某些区域进行有针对性的更改。该模型考虑用户的目标并对图像进行逼真的调整。Imagen Editor是一种文本引导的图像编辑器,它将广泛的语言表示与粒度控制混合在一起,以生成高质量的结果。Imagen Editor是Imagen的增强版,它使用级联扩散模型来微调文本引导的图像修复。使用三个卷积下采样图像编码器,Imagen Editor为每个扩散阶段提供更多的图像和掩模上下文。 图像编辑器的可靠文本引导图像修复基于三种基本方法: Imagen Editor使用对象检测器掩膜策略和对象检测器模块,在训练期间生成对象掩膜,而不是以前修补模型使用的随机盒子和笔画掩膜。 Imagen Editor通过在训练和推理期间要求输入图像和掩模的全分辨率、通道级串联来改进高分辨率编辑。 为了将数据引向特定的条件,即文本提示,研究人员在推理中使用无分类器引导(CFG)。CFG在受条件和未受条件的模型预测之间插值,以实现文本引导的图像修复的高精度。 使生成的输出符合文本提示是文本引导的图像修复中的主要难点。 EditBench EditBench使用240张照片创建了新的文本引导图像修复标准。每个图像都与一个掩膜相关联,该掩膜表示修补过程中将要更改的区域。为了帮助用户指定修改,研究人员为每个图像-掩膜对提供了三个文本提示。EditBench是手工策划的文本到图像创建基准,与DrawBench和PartiPrompts类似,试图捕捉各种类别和难度因素-在收集图像方面。包括预先存在的计算机视觉数据集中的自然照片和EditBench中包含的文本到图像模型生成的合成图像。…
Leave a CommentSeaborn Distplot 表示连续数据变量的总体分布distplot 是一个弃用的函数sns.distplot 的替代方案是什么?
Leave a Comment数据经常难以捉摸,隐藏在公司的各个角落,需要软技能和像福尔摩斯一样的调查才能找到并整合在一起有那座难以逾越的堡垒…
Leave a CommentPaypal最近开源了JunoDB,这是一个建立在RocksDB之上的分布式键值存储。每天,PayPal的高可用性和安全性数据库JunoDB处理着3500亿个请求。 PayPal的各种应用程序严重依赖于JunoDB这个分布式键值存储。JunoDB被用于PayPal的几乎所有关键后端服务,包括身份验证、风险评估和交易结算。使用JunoDB可以缓存数据,并快速访问应用程序,减轻后端服务和关系型数据库的压力。但是,JunoDB并不是一个普通的NoSQL数据库。它是为了满足PayPal的特定要求而开发的。因此,它可以同时处理许多并发用户和连接,而不会降速。最初是使用单线程C++构建的,现已重写为Golang,以利用并行处理和多核。 JunoDB的架构是一个可靠且可扩展的系统,优先考虑易用性、可扩展性、安全性和灵活性。基于代理的设计通过从应用程序中抽象出复杂的逻辑和设置,使开发变得简单,并允许线性水平连接扩展。在扩展或收缩集群时,JunoDB使用一致性哈希来分割数据,并减少必须移动的数据量。JunoDB使用基于法定人数的协议和两阶段提交来保证数据一致性,并确保数据库永远不会停机。 保护信息在传输和静止时是高优先级的。因此,JunoDB实现了TLS支持和有效载荷加密。最后,JunoDB的灵活性和适应性通过其可插拔的存储引擎设计得到保证,这使得它可以轻松地转换到新的存储技术。 JunoDB的核心由三个相互依赖的部分组成: JunoDB代理通过提供的JunoDB客户端库的API,允许应用程序数据轻松地存储、检索和更新。 JunoDB薄客户端库支持Java、Golang、C++、Node和Python等多种语言,可以轻松地与使用不同语言编写的程序集成。 负载均衡器控制的JunoDB代理实例处理来自远程站点的客户端查询和复制流量。每个代理与所有JunoDB存储服务器实例建立连接,并根据存储映射存储在ETCD中的碎片路由请求到一组存储服务器实例。 当接收到代理的操作请求时,JunoDB使用RocksDB将数据存储在内存或持久存储器中。 JunoDB在支持许多客户端连接的同时保持高可用性和系统响应能力。此外,它还管理数据扩展,并在数据量和访问率上升时保持高读写吞吐量。为了实现六个9的系统可用性,JunoDB使用了多种解决方案,包括数据复制在数据中心内外和故障转移机制。 JunoDB在规模上提供了出色的性能,即使在最密集的工作负载下也能以毫秒级的响应时间管理,而不会影响用户体验。此外,JunoDB提供高吞吐量和低延迟,使应用程序能够在不影响性能的情况下线性扩展。 用户可以在GitHub上获取JunoDB的源代码,该源代码已在Apache 2许可下发布。PayPal制作了服务器配置和客户端开发教程视频,以帮助开发人员使用数据库。该团队计划在未来包括一个Golang客户端和一个Kubernetes的JunoDB操作员。
Leave a Comment流星雨照亮夜空的景象令人惊叹。然而,更大的天体与地球相撞的威胁构成了实际的危险。为了对抗这种潜在的灾难,加利福尼亚大学圣塔芭芭拉分校(UCSB)物理学教授菲利普·卢宾和他的本科生团队正在开展开创性的PI-Terminal行星防御计划。他们的目标是更有效地检测和减轻空间威胁,并且他们最近获得了NASA的二期资金用于研究。NVIDIA通过他们的应用研究加速器计划向该团队提供了一张NVIDIA RTX A6000图形卡,以帮助他们完成任务。让我们深入了解这个旨在保护我们的星球免受宇宙威胁的创新人工智能项目的细节。 另请阅读:外星人启发的航天器设计:NASA进军太空未来的大胆跃进 粉碎空间威胁 PI-Terminal行星防御计划的核心目标是更早地检测到相关威胁并采取果断行动来最小化其影响。面对即将发生的碰撞,UCSB团队计划利用一系列高超速动能穿透器。这些专门设计的设备旨在粉碎和解体小行星或小彗星,有效地消除威胁,使其在到达地球表面之前消失。通过分解这些天体,可以大大减少潜在的损害和对地球生命的风险。 检测即将来临的灾难 识别威胁是保护地球的第一个至关重要的步骤。卢宾和他的学生们利用人工智能(AI)分析了大量的天体物理数据。虽然现代调查收集了大量数据,但在所需的速度下处理和分析这些信息是具有挑战性的。为了克服这一障碍,UCSB团队正在设计适用于行星防御的大规模调查。这项调查将产生更多的数据,需要快速处理和分析。 训练AI哨兵 卢宾的团队使用机器学习技术训练了一个名为“You Only Look Once Darknet”的神经网络。这个几乎实时的物体检测系统每张图像的操作时间少于25毫秒。通过利用一个大型的标记图像数据集,神经网络已经被训练来识别低级几何特征,例如线条、边缘、圆圈以及像小行星和小彗星这样的威胁。早期结果表明,由AI驱动的源提取过程比传统方法快10倍,准确率几乎提高了3倍。 另请阅读:AI发现了太阳系外的新行星,科学家未能找到 超级加速处理速度 为了加速他们的图像分析过程,UCSB团队已经整合了NVIDIA RTX A6000 GPU和CUDA并行计算平台。团队最初面临的挑战是减少处理时间并满足GPU内存需求。然而,由于RTX A6000拥有48GB的内存,他们可以处理复杂的图形和大型数据集,而不会影响性能。通过实施新的基于CuPy的算法,该团队极大地减少了减法和识别时间,使整个流程可以在仅六秒钟内运行。 解决技术挑战 随着项目的发展和越来越多的训练数据,该团队面临着处理越来越大的文件大小的挑战。RTX A6000慷慨的内存容量使该团队能够处理分辨率约为100百万像素的图像数据集。这个强大的GPU消除了数据传输瓶颈,确保了平稳的处理和分析。 逼真的模拟以获得精确的解决方案…
Leave a CommentBIOTRONIK,一家著名的可植入医疗器械技术领导者,已经成功地实现了其革命性的BIOMONITOR IV可植入式心脏监护器(ICM)。这个尖端设备将BIOTRONIK的SmartECG技术与人工智能(AI)的力量相结合,彻底改变了心律失常的监测方式。凭借其卓越的准确性和先进的功能,BIOMONITOR IV旨在提供无与伦比的心律不齐检测和诊断效率。让我们探索这一创新和它改变患者护理的潜力。 另请阅读:2023年医疗保健中的机器学习和人工智能 BIOTRONIK:引领健康未来的医疗技术创新者 BIOTRONIK是一家全球知名的医疗技术公司,致力于挽救和改善数百万患有心脏和血管疾病以及慢性疼痛的人们的生命。该公司开发创新的心血管、内血管和神经调节解决方案,确保最佳的患者结果。公司的使命是将技术与人体无缝集成。 BIOMONITOR IV:心脏监测的先进解决方案 BIOMONITOR IV代表了心脏监测技术的一个重大飞跃。配备BIOTRONIK的SmartECG技术和人工智能支持,这款尖端的可植入式心脏监护器在检测心律失常方面提供了无与伦比的精度。通过利用人工智能的最新进展,BIOMONITOR IV将错误阳性检测最小化了86%。同时,它在捕捉真实发作时保持了98%的准确性。值得注意的是,它是唯一一款能够区分早期房性收缩(PACs)和早期室性收缩(PVCs)的ICM。此外,它为医疗保健专业人员提供了宝贵的风险分层和诊断工具。 另请阅读:分解心血管风险评估中人工智能算法中的社会偏见 利用人工智能提高诊断水平 将人工智能与BIOMONITOR IV结合使用,为心律失常监测设定了一个新标准。通过分析大量数据,AI算法学会了准确识别真正的心脏不规则。这个功能使医疗保健专业人员专注于可行的事件,确保更有效和有针对性的患者护理。著名心脏病专家Di Biase博士对BIOMONITOR IV的人工智能功能表示热情洋溢,强调了减少错误阳性警报和提高患者护理水平的潜力。 另请阅读:从试错到精准:AI应对高血压治疗的答案 专家证言:Di Biase博士分享对BIOMONITOR IV的热情 心脏病学领域的知名人物Di Biase博士分享了他对BIOMONITOR IV创新算法和人工智能功能的兴奋之情。经过数据分析,Di Biase博士强调这些功能的潜力,可以显著减少错误阳性警报,使医疗保健专业人员专注于可行的事件,并提供更有效的护理。这个证言强调了BIOMONITOR…
Leave a Comment每当有人谈论人工智能时,脑海中首先浮现的是机器人、人形机器人或者可以像人类一样做事情的机器人,甚至比人类做得更好。我们都见过这些特定的微型机器人在各个领域中的应用,例如在机场指导人们到达某些出口,在军队中导航和处理困难情况,甚至作为跟踪器。 所有这些都是AI在更真实意义上的一些惊人的例子。与每个其他AI模型一样,这需要满足一些基本要求,例如选择算法的选择,用于训练的大量数据,微调,然后部署。 现在,这种类型的问题通常被称为视觉和语言导航问题。人工智能(AI)中的视觉和语言导航是指AI系统利用视觉和语言信息理解和导航世界的能力。它结合了计算机视觉、自然语言处理和机器学习技术,构建能够感知图形场景、理解文本指令和导航物理环境的智能系统。 许多模型,如CLIP、RecBERT和PREVALENT,都在解决这些问题,但所有这些模型都存在两个主要问题。 有限的数据和数据偏差:训练视觉和学习系统需要大量标记数据。但是,在某些领域中,获取这种数据可能是昂贵、耗时甚至不切实际的。此外,具有多样性和代表性数据的可用性对于避免系统的理解和决策的偏差至关重要。如果训练数据有偏差,可能会导致不公平或不准确的预测和行为。 泛化:AI系统需要很好地泛化到看不见或新的数据。它们应该记住训练数据并学习可以应用于新示例的基本概念和模式。当模型在训练数据上表现良好但无法推广到新数据时,就会出现过拟合。在涉及光照条件、视角和物体外观变化的复杂视觉任务中,实现强健的泛化是一个重要的挑战。 尽管已经有很多努力来帮助代理学习多样化的指令输入,但所有这些数据集都是基于Matterport3D中相同的3D房间环境构建的,该数据集仅包含60种不同的房间环境用于代理训练。 PanoGen是AI领域的突破性解决方案。现在,有了PanoGen,数据稀缺问题已得到解决,语料库的创建和数据多样化也得到了简化。 PanoGen是一种生成方法,可以根据文本创建无限多样化的全景图像(环境)。他们通过为Matterport3D数据集中的房间图像加上标题来收集房间描述,然后使用SoTA文本到图像模型生成全景视觉(环境)。然后,他们使用递归外部绘制技术在生成的图像上创建一致的360度全景视图。所开发的全景图片共享类似的语义信息,以文本描述为条件,这确保了全景中对象的共现遵循人类直觉,并通过图像外部绘制创造了足够的房间外观和布局多样性。 他们提到已经有一些尝试增加训练数据的多样性并改进语料库。所有这些尝试都是基于从HM3D(Habitat Matterport 3D)中混合场景,这再次带回了同样的问题,即所有设置或多或少是用Matterport3D制作的。 PanoGen解决了这个问题,因为它可以创建无限数量的训练数据,并具有所需的许多变化。 该论文还提到,使用PanoGen方法,他们击败了当前的SoTA,并在Room-to-Room、Room-for-Room和CVDN数据集上实现了新的SoTA。 来源:https://arxiv.org/abs/2305.19195 来源:https://arxiv.org/abs/2305.19195 综上所述,PanoGen是解决视觉和语言导航问题的关键挑战的突破性开发。通过能够生成许多变化的无限训练样本,PanoGen为AI系统理解和像人类一样导航真实世界开辟了新的可能性。该方法卓越的超越了SoTA,突显出其改革AI驱动的VLN任务的潜力。
Leave a Comment在人工智能(AI)艺术领域,我们见证了令人瞠目结舌的进步,从令人毛骨悚然的逼真 deepfake 视频到令人惊叹的专辑封面等。然而,在这些非凡的创新中,最近的一项发展引人注目,引起人们的想象力:AI 生成的 QR 码。尽管它们看起来似乎没有什么意义,但这些 QR 码已经演变成了迷人的艺术品,吸引眼球并完美地发挥了它们的功能。Reddit 和 Twitter 用户展示了一系列使用 Stable Diffusion 和其他生成 AI 工具设计的 QR 码设计。在继续阅读下文时别忘了扫描它们。 另请阅读:如何使用生成 AI 免费创建美丽的图片? 功能艺术的诞生 QR 码通常与链接到网站或提供信息相关联。Reddit 用户…
Leave a Comment深度学习模型,特别是图像分类中的区分外部分布(OOD)的检测,解决了识别与模型的训练任务无关的输入的挑战。它旨在防止模型在(OOD)输入上做出自信但不正确的预测,同时准确地对内部分布(ID)输入进行分类。通过区分ID和OOD输入,OOD检测方法增强了模型在实际应用中的鲁棒性和可靠性。 当前图像分类中对OOD检测评估的一个弱点,特别是有关与ImageNet-1K(IN-1K)相关的数据集,是OOD数据集中存在ID对象。这个问题会导致最先进的OOD检测器将ID对象错误地分类为OOD。因此,OOD检测方法的评估受到影响,导致低估实际的OOD检测性能,并不公正地惩罚更有效的OOD检测器。 最近发表了一篇新论文,作者的目标是解决评估OOD检测方法的限制。他们引入了一个新的测试数据集NINCO,其中包含没有任何来自ImageNet-1K(ID)类的对象的OOD样本。他们还提供了合成的“OOD单元测试”,以评估OOD检测器的弱点。该论文在NINCO上评估了各种体系结构和方法,为模型弱点和预训练对OOD检测性能的影响提供了洞见。其目标是提高OOD检测方法的评估和理解。 作者提出创建一个名为NINCO(无ImageNet类对象)的新数据集,以解决评估OOD检测方法的限制。他们从现有或新采集的数据集中精心选择基础类别,考虑它们的非许可解释,以确保它们不是ImageNet-1K(ID)类别的一部分。作者视觉检查基础类别中的每个图像,以删除包含ID对象或OOD类别中没有对象可见的样本。这个手动清理过程确保了更高质量的数据集。 NINCO由64个OOD类别组成,共有5,879个样本,这些样本来自各种数据集,包括SPECIES,PLACES,FOOD-101,CALTECH-101,MYNURSINGHOME,ImageNet-21k以及从iNaturalist.org和其他网站新采集的数据。此外,作者还提供了11个测试OOD数据集中2715个OOD图像的清理版本,以评估潜在的ID污染。 作者还提出使用OOD单元测试,这是一些简单的、合成的图像输入,旨在评估OOD检测的弱点。他们建议将OOD检测器在这些单元测试上的性能分开评估,并计算失败测试的数量(FPR高于用户定义的阈值),并将其与在类似NINCO的测试OOD数据集上的整体评估一起使用。这些单元测试提供了有关检测器在实践中可能遇到的特定弱点的有价值的见解。总体而言,作者提出NINCO作为评估OOD检测方法的高质量数据集,并建议使用OOD单元测试来获得有关检测器弱点的额外见解。 该论文在NINCO数据集和单元测试上对OOD检测方法进行了详细评估。作者分析了各种体系结构和OOD检测方法的性能,揭示了模型弱点和预训练对OOD检测性能的影响。在评估NINCO数据集时,该研究评估了从timm-library获得的不同IN-1K模型和先进的OOD检测方法。基于特征的技术,如Maha、RMaha和ViM,比MSP基线表现更好。Max-Logit和Energy也相对于MSP表现出明显的增强。性能结果基于所选模型和OOD检测方法而异。预训练被证明具有影响力,因为它有助于提高ID性能,并生成用于OOD检测的更优秀的特征嵌入。 总之,该研究解决了图像分类中评估OOD检测方法的限制。它介绍了NINCO数据集,该数据集包含没有来自ImageNet-1K(ID)类的对象的OOD样本,并提出使用OOD单元测试来评估检测器的弱点。在NINCO上的评估展示了不同模型和OOD检测方法的性能,突出了基于特征的技术的有效性和预训练对OOD检测性能的影响。NINCO通过提供一个干净的数据集和有关检测器弱点的见解来提高OOD检测方法的评估和理解。研究结果强调了改进OOD检测评估的重要性,并了解当前方法的优缺点。
Leave a Comment微软是人工智能领域的领导者之一,今天宣布了一项突破性的消息。用户现在可以在Bing聊天中利用人工智能的力量,通过语音指令进行通信。这一令人兴奋的发展将沟通提升到了新的高度,使用户可以简单地说出他们的问题,而不是打字。在本文中,我们将探讨微软最新的创新以及它如何改变我们与人工智能互动的方式。 另请阅读:微软通过Bing聊天的大规模更新再次打击了谷歌 基于语音的通信 微软在Bing聊天中引入了一项具有突破性的功能,使用户可以通过语音指令进行通信。在聊天中简单地点击麦克风图标,用户现在可以用自己的声音提出问题并开始对话,消除了打字的必要性。 将对话提升到新的水平 在最近的一篇博客文章中,微软表示,它热衷于利用语音输入来促进智能手机聊天。现在,该公司通过直接将麦克风图标并入Bing聊天中,进一步提升了用户的体验。这种增强功能表明微软致力于实现无缝和轻松的通信。 多语言支持和扩展 Bing聊天中的语音指令功能最初可用于德语、中文、英语和法语等语言。微软计划在未来扩大语言支持范围,涵盖各种不同的语言。这种包容性确保全球用户都可以从基于语音的通信中受益。 另请阅读:印度语言的多语言文本转语音模型 语音回复和语音转文本支持 用户不仅可以通过语音指令提出问题,还可以用自己的声音回复。Bing聊天支持语音转文本技术,允许用户以自己独特的语调回答问题。这一创新功能为对话增加了个人化的触感,增强了用户体验。 增强的视觉和扩展的聊天限制 微软继续增强Bing聊天的功能。将人工智能工具整合到Bing中,为Bing聊天开创了Image Creator by Bing。这一功能对于与旅行相关的查询特别有用,为用户提供了视觉效果和相关链接以获取详细信息。此外,每次Bing聊天的转数从20增加到30,每天的转数也显著增加到了300。 无缝对话连续性 微软确保Bing聊天中的对话和交流不受时间或数量的限制。新的聊天限制适用于正在进行的聊天和存储在聊天历史记录中的过去交流。用户可以重访以前的对话,从上次离开的地方继续,创造出一个无缝和不间断的通信体验。 拥抱创新 自从2月份首次推出以来,微软的Bing聊天就受到了赞誉。这家软件巨头不断推出新的令人兴奋的功能,吸引用户的注意力。最近的新增功能,如侧边栏聊天和与Windows 11搜索的集成,进一步巩固了Bing聊天作为一款顶级通信工具的地位。微软对创新的承诺是显而易见的,它引入了尖端的先进技术,以增强用户满意度。 另请阅读:微软在其年度活动“Build 2023”上宣布了多项人工智能进展 我们的观点 微软的基于人工智能的Bing聊天通过整合语音指令,使用户可以轻松地与平台互动,从而彻底改变了通信方式。Bing聊天具有多语言支持、语音转文本功能、增强的视觉效果和扩展的聊天限制,提供了沉浸式和便捷的体验。随着微软不断推进人工智能技术的边界,用户可以期待更多令人兴奋的功能和进步。拥抱语音的力量,解锁与Bing聊天的新一级通信。
Leave a Comment对于医学专业人员来说,会话式生成人工智能有很大的潜力,但目前的研究仅侧重于文本。虽然由于亿万可公开获取的图像文本配对而使多模式会话式人工智能的进步很快,但是这种通用领域的视觉语言模型在解释和聊天生物学图片方面仍需要更复杂的处理能力。微软研究团队提出了一种低成本的方法,用于教授视觉语言会话助手如何回答有关生物医学图像的自由形式查询。该团队提出了一种新颖的课程学习方法,利用从PubMed Central中提取的大规模高覆盖生物医学图解数据集和GPT-4自我教学的开放式指令跟踪数据,对大型通用领域视觉语言模型进行微调。 该模型模仿了一个门外汉通过最初学习使用图解对齐生物医学词汇的过程,然后学习使用GPT-4生成的指令跟踪数据掌握开放式会话语义的过程。在不到15个小时的时间内(使用八个A100),研究人员可以训练出一款适用于生物医学领域的大型语言和视觉助手(LLaVA-Med)。由于其多模式会话能力和遵循自由形式指令的能力,LLaVA-Med非常适合回答关于生物图像的问题。经过微调后,LLaVA-Med取得了三个基准生物医学视觉问答数据集的最新成果。关于人们如何遵循指令以及LLaVA-Med模型的数据将被公开以推进生物医学领域的多模式研究。 该团队的主要贡献总结如下: 多模式医学训练合规统计。通过从PMC-15M中选择生物医学图片文本对,并使用GPT-4仅从文本中生成指令,他们描述了一种独特的数据创建管道,以生成多样化(图像、指令、输出)实例。 LLaVA-Med。使用自行生成的生物医学多模式指令跟踪数据集,他们提供了一种新颖的课程学习方法,以使LLaVA适应生物医学领域。 开源。生物医学多模式指令跟踪数据集以及用于数据生成和模型训练的软件将公开提供,以促进生物医学多模式学习的进一步研究。 LLaVA-Med的有效性和获得的多模式生物医学指令跟踪数据的准确性是该团队调查的重点。研究人员考虑两种不同的环境来评估研究: LLaVA-Med作为通用生物医学视觉聊天机器人的效果有多好? 与现有技术相比,LLaVA-Med在行业基准测试中的表现如何? 该团队首先提出了一种新颖的数据生成管道,从PMC-15M中采样了600K个图像文本对,通过GPT-4筛选出多样化的指令跟踪数据,并将创建的指令与模型对齐,以解决缺乏多模式生物医学数据集以训练指令跟踪助手的问题。 研究人员随后介绍了一种教授LLaVA-Med课程的新方法。具体而言,他们在广泛的领域中训练LLaVA多模式会话模型,并逐渐将重点转向生物医学领域。训练过程分为两个阶段: 指定生物医学概念词嵌入与大量创新生物视觉概念的相关图像属性对齐。 使用基于生物医学语言图像指令的微调模型,LLaVA-Med展现了令人印象深刻的零样本任务转移能力,促进了自然用户互动。 总的来说 微软研究团队开发了适用于生物医学领域的大型语言和视觉模型LLaVA-Med。他们使用自我教学策略通过语言生成技术GPT-4和外部知识构建了数据筛选管道。然后,他们将模型训练到高质量的生物医学语言-图像指令跟踪数据集上。LLaVA-Med在微调后在三个VQA数据集上的特定指标上打败了早期受监督的SoTA,展现了具有领域知识的出色对话能力。虽然LLaVA-Med是朝着正确方向迈出的一大步,但他们也认识到它存在幻觉和推理缺乏深度的问题,这在许多LMMs中都很普遍。未来的工作将致力于使事物更加可靠和高质量。
Leave a Comment针对人工智能(AI)的快速发展及其对社会的影响,美国参议员提出了两项跨党派法案,旨在解决围绕这一变革性技术的重要问题。这些拟议立法反映了人们对透明度、问责制和维护美国竞争优势的日益关注。以下是这两项法案的概述及其对AI监管和全球领导力的潜在影响。 另请阅读:中国提出的AI法规动摇了该行业 促进政府AI使用的透明度 参议员Gary Peters、Mike Braun和James Lankford提出了一项跨党派法案,以确保美国政府机构在使用AI技术时的透明度和问责制。该拟议立法将要求机构在与个人互动时披露其使用AI的情况。此外,该法案还规定建立一种上诉程序,供个人挑战AI系统所做决定。将人类置于驾驶座上显示该法案坚持政府AI使用中的公平和问责制原则。 维护美国在AI领域的竞争优势 参议员Michael Bennet、Mark Warner和Todd Young提出了一项跨党派措施,以保持在新兴技术中的竞争优势。该法案旨在建立一个全球竞争分析办公室,致力于确保美国在AI发展方面保持领先地位。这种积极的方法旨在防止中国等竞争对手在半导体、量子计算和AI等战略领域超越美国。该法案旨在通过优先投资和创新来保护美国作为技术领袖的地位。 另请阅读:微软领导先锋:紧急呼吁AI规则以维护我们的未来 应对AI的崛起 这些法案反映了立法者日益认识到需要新的法规来应对AI所带来的挑战。今年早些时候,AI程序ChatGPT广泛使用,引起了人们对这项技术的重视。随着AI的不断进步,立法者意识到需要采取积极的措施来管理其部署并减轻潜在风险。 另请阅读:著名AI先驱认为由于AI人类处于风险之中 教育立法者AI知识 参议院多数党领袖Chuck Schumer安排了三次关于AI的简报,以进一步装备立法者所需的知识和见解。这些简报涵盖各种主题,包括AI的概述、实现美国领导地位的战略以及有关国防和情报影响的保密会议。通过提供全面的教育和促进知情决策,国会旨在具备对技术及其影响的充分理解,以应对与AI相关的挑战。 我们的意见 美国国会提出两项跨党派法案表明,人们越来越认识到需要监管AI并保持美国的全球竞争力。通过强调透明度、问责制和建立专门机构,这些法案旨在有效地应对AI的复杂性。在国会采取措施应对AI崛起的同时,必须在促进创新的同时维护个人的权利和利益。通过知情决策和积极措施,美国可以引领更好地利用人工智能的潜力。
Leave a Comment基于文本的视频编辑旨在使用文本提示和现有的视频材料创建新的视频,无需任何手动劳动。这项技术有可能对包括社交媒体内容、营销和广告在内的各种行业产生重大影响。修改后的电影必须准确反映原始视频的内容,保持创建帧之间的时间连贯性,并与目标提示对齐,以在这个过程中获得成功。然而,同时满足所有这些要求可能会很具有挑战性。仅使用大量的文本-视频数据训练文本到视频模型需要大量的计算能力。 零样本和一样本基于文本的视频编辑方法使用了最近大规模文本到图像扩散模型和可编程图片编辑的发展。这些进展没有额外的视频数据,已经展示了对各种文本命令的影片修改的良好能力。然而,经验数据表明,尽管在与文本提示对齐的工作方面取得了巨大进展,但目前技术仍然不能恰当地和适当地处理输出,保持时间上的一致性。清华大学、中国人民大学、盛数和琶洲实验室的研究人员推出了ControlVideo,这是一种基于预训练的文本到图像扩散模型的先进方法,用于忠实可靠的基于文本的视频编辑。 从ControlNet中汲取灵感,ControlVideo通过包括Canny边缘图、HED边框和所有帧的深度图等可视化条件来放大源视频的方向。采用扩散模型预训练的ControlNet处理这些视觉情况。将这些情况与目前在基于文本的视频编辑方法中使用的文本和注意策略进行比较,值得注意的是,它们提供了更精确和适应性更强的视频控制方法。此外,为了提高保真度和时间上的一致性,同时避免过度拟合,扩散模型和ControlNet中的注意模块都经过了精心构建和微调。 更具体地说,他们将这两个模型中的初始空间自我注意力变换为关键帧注意力,将所有帧与所选帧对齐。扩散模型还包括时间注意力模块作为额外的分支,然后是零卷积层,以在微调之前保留输出。他们在相应网络中使用原始空间自我注意权重作为关键帧和时间注意力的初始化,因为观察到不同的注意机制模拟不同位置之间的关系,但始终模拟图像特征之间的关系。 图1展示了ControlVideo在各种控制下的主要结果,例如(a) Canny边缘图,(b) HED边框,(c)深度图和(d)姿势。当涉及替换人物并改变其质量、风格和背景时,ControlVideo可以生成准确可靠的视频。ControlVideo的用户可以通过从各种控制类型中选择,灵活地修改保真度和编辑能力之间的比例。对于视频编辑,许多控制器可以轻松集成。 为了指导未来关于一次调整的视频扩散模型骨干的研究,他们对ControlVideo的基本要素进行了全面的实证研究。该工作调查了自我注意力微调的关键和值设计、参数、初始化技术以及引入时间注意力的本地和全局位置。根据他们的发现,主UNet(除了中间块)可以通过选择一个关键帧作为关键和值、微调WO以及将时间注意力与自我注意力(本研究中的关键帧注意力)相结合来发挥最佳作用。 他们还仔细研究了每个组件的贡献以及总体影响。根据这项工作,他们收集了40个视频文本对进行研究,包括Davis数据集和其他来自互联网的数据集。在许多措施下,他们与基于帧稳定的扩散和SOTA基于文本的视频编辑技术进行了比较。特别是,他们采用SSIM分数衡量保真度,采用CLIP评估文本对齐和时间一致性。他们还进行了用户研究,将ControlVideo与所有基线进行比较。 许多研究结果表明,ControlVideo在保真度和时间一致性方面表现不亚于文本对齐,但明显优于所有这些基准线。他们的实证结果特别突出了ControlVideo创建具有极其逼真视觉质量的电影的吸引力以及在可靠地遵循书面说明的同时保持源材料的能力。例如,ControlVideo在化妆方面成功了,同时又能保留一个人独特的面部特征,这是其他技术都无法做到的。 此外,ControlVideo利用各种控制类型,包括从原始视频中提取不同数量的信息,可以实现视频保真度和可编辑性之间的可定制权衡(见图1)。例如,HED边界提供了原始视频的精确边界细节,适用于紧密控制,如面部视频编辑。姿势包括原始视频的运动数据,使用户在保留运动传输的同时更自由地修改主题和背景。此外,他们展示了如何混合多个控件以从各种控件类型的优势中获益。
Leave a Comment在自然语言处理(NLP)任务中,大型语言模型(LLM)在大规模在线数据集上训练表现出色。通过扩大数据规模,分割任何模型(SAM)在计算机视觉(CV)中显示出了出色的零样本定位能力。 不幸的是,SAM 无法生成语义标签,这是与定位相当的基本任务。多标签图像识别是识别单个图像的多个标签的目标,也称为图像标记。由于图像包含各种标签,包括对象、场景、属性和活动,图像标记是一个重要且有用的计算机视觉问题。 以下是阻碍图像标记的两个主要因素: 高质量数据的广泛收集。目前仍缺乏一个能够半自动或自动注释各类大量照片的高效数据注释引擎,以及一个标准化和全面的标记系统。 建立起足够的开放词汇表和强大的模型,采用高效灵活的模型设计,利用大规模的弱监督数据。 识别任何模型(RAM)是一个强大的图像标记基础模型,由OPPO研究院、国际数字经济学院(IDEA)和AI2机器人的研究人员刚刚推出。在数据方面,RAM可以克服标签系统不足、数据集不足、数据引擎低效和架构限制等问题。 研究人员首先创建了标准的全球命名约定。他们使用学术数据集(分类、检测和分割)和商业标记工具(Google、Microsoft和Apple)来丰富他们的标记系统。通过将所有可用的公共标记与常见的基于文本的标记相结合,标记方法产生6,449个标签,共同解决了绝大部分用例。研究人员表示,可以使用开放集识别来识别其余的开放词汇标签。 自动注释大规模照片使用标签系统是一项具有挑战性的任务。图像标记的提出方法受到了该领域以前的工作的启发,该领域使用大规模的公共图像文本对来训练强大的视觉模型。为了将这些大量的图片文本数据用于标记,团队采用了自动文本语义解析来提取图像标签。通过这种方法,他们可以在不依赖手动注释的情况下,基于图像文本对获得大量的图片标签。 因为互联网来源的图像文本组合往往存在随机噪声,所以团队创建了数据标记引擎来提高注释准确性。为了解决缺少标签的问题,他们采用现有模型来产生补充分类。在处理错误标记区域时,他们确定图像中与不同标签相关的某些部分,然后使用区域聚类方法查找和消除同一类别内的异常值。此外,还删除做出不一致预测的标签,以获得更精确的注释。 RAM通过为标签搜索添加语义上下文,允许对新颖类别进行泛化。RAM的识别能力可以通过这种模型架构为任何视觉数据集提高。通过展示一个在嘈杂的、无注释的数据上训练的通用模型可以击败高度监督的模型,RAM引入了一种新的图像标记范式。RAM需要一个免费且公开可用的没有注释的数据集。RAM的最强大版本只需在8个A100 GPU上训练三天。 据团队表示,RAM仍有改进的空间。这包括运行多个数据引擎迭代、增加骨干参数以提高模型容量,以及扩展训练数据集超过1400万张照片,以更好地覆盖不同领域。
Leave a Comment基于互联网规模数据训练的大型文本到视频模型展现出了从任意编写描述生成高保真电影的非凡能力。然而,微调预训练的巨型模型可能代价高昂,难以将这些模型适应于具有有限领域特定数据的应用,例如动画或机器人视频。Google DeepMind、加州大学伯克利分校、麻省理工学院和艾伯塔大学的研究人员探索了如何在不进行微调的情况下自定义大型预训练文本到视频模型以适应各种下游领域和任务,灵感来自于一个小型可修改组件(如提示、前缀微调)如何使大型语言模型能够执行新任务而不需要访问模型权重。为了解决这个问题,他们提出了Video Adapter,一种通过使用大型预训练视频扩散模型的得分函数作为先验概率来生成特定任务的微小视频模型的方法。实验表明,Video Adapter可以使用预训练模型的参数仅占1.25%,以包含广泛的知识并在特定任务的微小视频模型中保持高保真度。可以使用Video Adapter生成高质量的特定任务的电影,包括但不限于动画、自我中心建模以及模拟和真实世界机器人数据的建模。 研究人员在各种视频创作工作中测试了Video Adapter。在困难的Ego4D数据和机器人Bridge数据上,Video Adapter生成的视频比高质量的预训练大型视频模型具有更好的FVD和Inception Scores,同时使用的参数少达80倍。研究人员定性地证明了Video Adapter可以生成类别特定的视频,如科幻电影和动画电影。此外,研究的作者展示了Video Adapter如何通过建模真实和模拟机器人电影并允许个性化风格化来为弥合机器人的臭名昭着的模拟到实际差距铺平道路。 主要特点 为了实现高质量且多功能的视频合成而无需在预训练模型上进行梯度更新,Video Adapter在采样时将预训练文本到视频模型的分数与领域特定微小模型的分数(仅使用1%参数)组合。 使用Video Adapter可以轻松地将预训练视频模型适应于人类和机器人数据的电影。 在相同的TPU小时数下,Video Adapter获得的FVD、FID和Inception Scores高于预训练模型和特定任务模型。 Video Adapter的潜在用途范围从动漫制作到领域随机化,以弥合机器人中的模拟现实差距。 与从互联网数据预训练的巨型视频模型相反,Video Adapter需要训练具有数量级更少参数的微小领域特定文本到视频模型。Video Adapter通过在采样期间组成预训练和领域特定视频模型的分数来实现高质量和可适应的视频合成。 使用Video…
Leave a Comment在最近发表在《自然机器智能》杂志的一项研究中,荷兰科技大学和瑞士洛桑联邦理工学院的研究人员深入探讨了OpenAI的ChatGPT平台的能力。好奇心促使他们调查这种先进的语言模型是否可以扩展其范围,超越生成诗歌、论文和书籍,协助机器人的设计过程。该团队试图确定在此方式下与人工智能合作的优势和潜在风险。 TU Delft的助理教授Cosimo Della Santina,与来自EPFL的博士生Francesco Stella和Josie Hughes,与ChatGPT展开了对话,重点关注粮食供应的增强。他们共同的头脑风暴会议使他们构思出了番茄收获机器人的想法,这是一个真正有用的创造。 研究人员发现ChatGPT在概念阶段的贡献尤为宝贵,因为它扩展了他们的专业知识。Stella解释说,这种语言模型提供了哪种作物对自动化最具经济可行性的见解。ChatGPT与之交互为设计过程中的明智决策铺平了道路。 此外,在实施阶段,ChatGPT提供了有用的建议,引导研究人员使用硅胶或橡胶作为夹具,以防止番茄被压碎。AI模型还建议采用Dynamixel电机,这是驱动机器人的最佳解决方案。这些协作努力最终导致了一个能够有效收获番茄的机械臂。 虽然研究人员发现协作设计过程丰富而积极,但他们注意到了自己作为工程师角色的变化。他们开始花更多时间进行技术任务,而ChatGPT则承担了共同研究员的角色。该团队探讨了人类和大型语言模型(LLMs)之间不同程度的合作,ChatGPT是其中之一的例子。 在最极端的情况下,AI提供所有输入,人类仅仅是遵循其指导,LLM实际上扮演研究员和工程师的角色。相反,人类则承担管理角色,负责定义设计目标。然而,这种情况在当前的LLMs中尚不可行,其可取性仍然存在争议。 Della Santina提出的一个潜在问题是机器人领域的错误信息和偏见的风险。LLMs基于概率生成响应,如果没有验证或验证不当,可能会导致误导或不准确的信息。研究人员还承认与LLMs合作的重要问题,包括抄袭、可追溯性和知识产权。 通过这种合作开发的番茄收获机器人将成为Della Santina、Stella和Hughes进一步研究机器人领域的有价值工具。此外,他们打算探索AI模型在设计其机器人身体方面的自主性。该团队认为,未来的一个开放性问题在于确定LLMs如何在不妨碍创造性思维和创新的情况下协助机器人开发人员解决21世纪的挑战。 随着研究人员继续利用像ChatGPT这样的AI模型的力量,他们的发现揭示了协作设计过程所涉及的潜在利益和风险。LLMs增强人类专业知识和扩大知识范围的能力是不可否认的。然而,必须谨慎行事,以确保准确性、透明度和保护机器人领域的创造性思维。通过在人类智慧和AI协助之间取得平衡,机器人领域可以应对未来的挑战,同时最小化潜在的风险。
Leave a Comment人工智能在我们日常遇到的所有主要用例和应用中都是革命性的。其中一个领域围绕着大量的音频和视觉媒体。想想所有能够生成有趣视频、艺术性惊人的图像、复制名人声音或只需一键记录整个讲座的人工智能应用程序。所有这些模型都需要大量的数据进行训练。大多数成功的系统都依赖于带注释的数据集来自我教育。 最大的挑战是存储和注释此数据,并将其转换为模型可以摄入的可用数据点。说起来容易做起来难,公司需要帮助每年收集并创建金标准数据点。 现在,来自麻省理工学院、麻省理工-IBM沃森人工智能实验室、IBM研究和其他机构的研究人员已经开发出一种能够有效解决这些问题的开创性技术,即分析未标记的音频和视觉数据。这种模型具有很大的潜力和潜力,可以改善当前模型的训练方式。这种方法与许多模型共鸣,例如语音识别模型、转录和音频创建引擎以及对象检测。它结合了两种自我监督学习体系结构:对比学习和遮蔽数据建模。这种方法遵循一个基本思想:复制人类如何感知和理解世界,然后复制相同的行为。 正如麻省理工学院的博士后Yuan Gong所解释的那样,自我监督学习非常重要,因为如果你看看人类如何收集和学习数据,其中很大一部分是没有直接监督的。目标是在机器中实现相同的过程,使它们能够从未标记的数据中学习尽可能多的功能。这种训练成为可以利用和改进的强大基础,具体取决于用例的监督学习或强化学习。 这里使用的技术是对比音频 – 视觉遮蔽自编码器(CAV-MAE),它使用神经网络从音频和视觉数据中提取和映射有意义的潜在表示。这些模型可以在10秒YouTube剪辑的大型数据集上进行训练,利用音频和视频组件。研究人员声称,CAV-MAE比任何其他先前方法都要好得多,因为它明确强调了音频和视觉数据之间的关联,而其他方法则没有。 CAV-MAE方法包括两种方法:遮蔽数据建模和对比学习。遮蔽数据建模包括: 获取视频及其匹配的音频波形。 将音频转换为频谱图。 遮蔽75%的音频和视频数据。 然后,该模型通过联合编码器/解码器恢复缺失的数据。重建损失,即衡量重建预测和原始音频-视觉组合之间差异的损失,用于训练模型。这种方法的主要目的是将相似的表示映射到彼此靠近的位置。它通过关联音频和视频数据的相关部分来实现,例如连接口部的口型。 将基于CAV-MAE的模型与其他模型进行测试证明非常有启发性。测试是在音频视频检索和音频-视觉分类任务上进行的。结果表明,对比学习和遮蔽数据建模是互补的方法。 CAV-MAE在事件分类方面优于以前的技术,并保持与使用行业级计算资源训练的模型竞争力。此外,多模态数据显着提高了单模态表示的微调和音频事件分类任务的性能。 麻省理工学院的研究人员认为,CAV-MAE代表了自我监督音频-视觉学习进展的突破。他们设想,它的用例可以涵盖动作识别,包括运动、教育、娱乐、摩托车和公共安全,跨语言自动语音识别和音频-视频生成。虽然当前的方法侧重于音频-视觉数据,但研究人员的目标是将其扩展到其他模态,认识到人类感知涉及音频和视觉提示以外的多种感官。 很有意思看到这种方法随着时间的推移表现如何,并且有多少现有模型尝试纳入这种技术。 研究人员希望随着机器学习的进步,像CAV-MAE这样的技术将变得越来越有价值,使模型能够更好地理解和解释世界。
Leave a Comment大型语言模型(LLMs)彻底改变了自然语言生成领域。传统的微调方法用于响应下游任务需要访问LLMs的参数,这限制了它们在强大的黑匣子LLMs(如ChatGPT)上的使用,这些LLMs仅提供API。因此,最近的研究重点关注提示技术,通过提供许多任务特定的指示和演示来指导生成结果,证明提示可以显著影响结果,因此需要仔细设计。 虽然提示原则上是一种灵活的方法,但它今天通常使用的方式有些严格。但是在语言学习中并非如此;人们可以通过接受和回应积极和消极的反馈来提高语言技能。 中国东北大学、微软亚洲研究院、微软Azure翻译和NiuTrans研究的一项新研究邀请LLMs重新考虑并学习如何发现其输出中的任何缺陷,以确定决策容量的演变方式。为了在生成之前促进错误识别,他们设计了一种名为“Deliberate then Generate(DTG)”的新提示模板,其中包括指示和可能的输出。 确定候选人是DTG设计的重要部分。使用第二个基准系统的数据是一个简单的选择,因为它的输出通常具有良好的质量,只需要进行小的调整即可有效使用。因此,它无法促进有效的决策。研究人员建议使用与源材料无关的文本,例如随机文本选择或空字符串。由于这种方法成功地触发了LLMs的决策能力,因此DTG可以轻松适应各种文本生产工作,只需要对提示进行轻微修改。从心理学的角度来看,这项工作受到了语言习得的典型案例的启发,该案例在发展语言能力时考虑了负面证据。 团队进行了大量实验,以显示所提出的DTG提示相对于传统提示可靠地增强了GPT3.5(text-DaVinci-003)和GPT4的模型性能。这在七个文本生成任务和20多个数据集中都成立。机器翻译、简化和常识创造只是一些文本生成任务,其中由DTG提示的GPT实现了各种数据集的最先进性能。建议的DTG提示确实允许在生成之前进行决策和错误避免,这一点通过广泛的消融研究和统计误差分析得到证明。 研究人员计划在未来的工作中利用任务特定的领域知识来进一步提高DTG提示的效果。
Leave a Comment