Press "Enter" to skip to content

Tag: Technology

“人工智能和脑植入装置恢复了瘫痪者的运动和感觉”

在一项开创性的医学壮举中,美国的医生们利用人工智能(AI)和脑植入物为一个四肢瘫痪的男子带来了希望。因潜水事故而从胸部以下瘫痪的Keith Thomas,如今能够再次移动和感觉,得益于Northwell Health’s Feinstein Institutes for Medical Research进行的一项新型临床试验。这一令人难以置信的成就,由一支熟练的研究人员和外科医生团队领导,为数以百万计的瘫痪和神经病患者带来了希望。让我们深入探讨这项开创性技术及其在面对类似挑战的个人生活中的潜力。 还可阅读:亚马逊对决谷歌对决微软:AI革命医疗的竞赛 Keith Thomas:一个希望和坚韧之旅 Keith Thomas的故事,一个失去运动和感觉能力的人,引起了Northwell Health’s Feinstein Institutes医生们的关注。研究人员、工程师和外科医生团队开始了一项任务,利用创新的脑植入物和AI算法恢复他的触觉和运动能力。 还可阅读:世界首个AI动力臂:你需要了解的一切 脑植入物和AI算法的力量 通过几个月的精确脑部功能磁共振成像,医生们确定了负责Thomas手臂运动和触觉感受的特定脑区。在Thomas实时反馈的指导下,经过15小时的开颅手术,将微芯片植入到确定的脑区。 还可阅读:联合国教科文组织对AI芯片植入提出隐私担忧 思维驱动疗法:一种令人难以置信的联系 这项开创性的思维驱动疗法涉及解读Thomas的意图,比如思考握紧他的手。来自脑植入物的电信号传输到计算机,使用非侵入性电极贴片刺激他的前臂和手部肌肉。此外,他的指尖和手掌的微小传感器将触觉和压力信息发送回大脑,恢复触觉感受。 还可阅读:能够将脑活动翻译为文本的AI模型 早期康复迹象 这项开创性研究的结果令人惊叹。在实验室中,Thomas现在可以自由地移动他的手臂并感受到他妹妹握住他手的触感。这种显着的进展增强了他的手臂力量,并触发了自然伤害康复。这种新颖的双重神经旁路方法有可能逆转一些损伤,为未来提供了新的可能性。…

Leave a Comment

2023年最佳40个生成式人工智能工具

ChatGPT – GPT-4 GPT-4 是 OpenAI 的最新 LLM,比其前身更具创造性、准确性和安全性。它还具备多模态能力,即能够处理图像、PDF、CSV等文件。通过引入代码解释器,GPT-4 现在可以运行自己的代码,避免产生幻觉并提供准确的答案。 Bing AI Bing AI 使用 OpenAI 的 GPT-4 模型,能够遍历网络提供准确的回答。它还具有根据用户提示生成图像的能力。 GitHub Copilot GitHub Copilot 是一种 AI 代码补全工具,可以分析代码并提供即时反馈和相关的代码建议。…

Leave a Comment

基于HADAR的新型成像工具让您在黑暗中清晰看见

想象一个世界,在这个世界里,机器人和自动驾驶车辆可以毫不费力地在最黑暗的夜晚中穿行,完全依靠先进的人工智能相机来感知热能特征。这个未来洞察力正在逐渐成为现实,归功于一种创新技术,叫做HADAR(热辅助探测与测距)。HADAR由普渡大学和密歇根州立大学的研究团队开发,有潜力彻底改变机器感知周围环境的方式,为各个行业带来令人兴奋的可能性。让我们深入了解HADAR的世界,探索它重塑我们与人工智能系统互动的能力。 还可以阅读:Red Cat和Athena AI用夜视技术制造智能军用无人机 热能视觉的挑战 热能视觉作为科幻电影的必备元素,一直面临着由于热辐射在环境中的扩散而带来的限制。这种现象导致图像模糊、无纹理,被称为“幽灵影像”。然而,研究团队通过采用机器学习算法来解决这个持久的问题,取得了显著的突破。 利用人工智能解码热能特征 利用人工智能的力量,研究人员训练HADAR来解释商用红外摄像头捕捉到的数据。HADAR现在可以准确地确定物体的物理特性和周围环境,穿透雾霾、烟雾和黑暗等视觉障碍。通过识别温度、物质组成和热辐射模式,HADAR可以创建出详细清晰的图像,无论环境条件如何。 填补鸿沟:夜间的白天清晰度 HADAR的独特方法使其与声纳、雷达和激光雷达等主动模态有所不同,这些模态发送信号并检测反射来推测物体的存在和距离。与这些方法不同,HADAR使用不可见的红外辐射来重建夜间场景,具有与白天相同的清晰度。这一突破可能彻底改变各个行业,从自动驾驶车辆到非接触式安全检查。 还可以阅读:Jeep的下一代人工智能和自动越野驾驶技术 前方道路:克服挑战 尽管HADAR具有巨大的潜力,但它并非没有挑战。这项技术昂贵,需要实时校准,仍然容易受到影响其准确性的环境障碍。然而,研究人员对未来充满乐观,相信这些障碍可以在不久的将来克服,使HADAR进入日常使用。 还可以阅读:人工智能如何改变汽车行业? HADAR带来更美好的未来 HADAR的潜在应用广泛且令人兴奋。随着这项技术的发展,它可能成为自动驾驶汽车、自主机器人和安全检查的人工智能系统中不可或缺的组成部分。通过使机器在最黑暗的夜晚“清晰地”看到,HADAR可以改变行业,提高安全性,为一个更加连接和智能的世界铺平道路。 还可以阅读:滴滴Neuron:未来派无人驾驶机器人出租车 我们的观点 HADAR从科幻世界走向现实,证明了创新和以人工智能为驱动的突破的力量。能够在最黑暗的夜晚看得像白天一样明亮,HADAR已经成为各个领域的改变者。虽然仍然存在挑战,但研究人员对技术的潜力充满决心和信心,为机器能够以无与伦比的准确性感知周围环境的未来铺平了道路,使我们的世界更安全、更高效。随着HADAR朝着广泛应用迈出第一步,我们热切期待夜与日之间的界限变得模糊、人工智能感知无限扩展的那一天到来。

Leave a Comment

这篇来自中国的AI论文提出了HQTrack:一个用于在视频中高质量追踪任何物体的AI框架

视觉目标跟踪是计算机视觉中许多子领域的基础,包括机器人视觉和自动驾驶。该任务旨在可靠地识别视频序列中的目标对象。许多最先进的算法在视觉目标跟踪(VOT)挑战中竞争,因为它是跟踪领域中最重要的比赛之一。 视觉目标跟踪和分割竞赛(VOTS2023)取消了以往VOT挑战所施加的一些限制,使参与者可以更广泛地思考目标跟踪。因此,VOTS2023结合了对单个目标的短期和长期监控以及对多个目标的跟踪,仅使用目标分割作为位置指定。这引入了新的困难,例如精确的掩模估计、多目标轨迹跟踪和对象之间的关系识别。 中国大连理工大学和阿里巴巴达摩院的一项新研究提出了一个名为HQTrack的系统,它代表高质量跟踪。它主要包括一个视频多目标分割器(VMOS)和一个掩模优化器(MR)。为了感知复杂设置中的微小对象,研究人员采用了VMOS,这是DeAOT的增强版本,并在1/8比例上级联了一个门控传播模块(GPM)。此外,他们使用Intern-T作为特征提取器,以提高区分不同类型对象的能力。在VMOS中,研究人员仅保留最近使用的帧在长期记忆中,舍弃旧帧以腾出空间。然而,应用大型分割模型来改进跟踪掩模可能是有用的。复杂结构的对象对SAM的预测尤其具有挑战性,并且在VOTS挑战中经常出现。 使用已经预训练的HQ-SAM模型,团队可以进一步提高跟踪掩模的质量。最终的跟踪结果是从VMOS和MR中选择的,并且使用预测掩模的外包围框作为盒子提示,与原始图像一起输入HQ-SAM以获得优化后的掩模。HQTrack在VOTS2023比赛中以0.615的质量得分获得第二名。

Leave a Comment

Stack Overflow 发布 Overflow 开发者社区与人工智能的融合

Stack Overflow,这个为开发者提供答案和知识的知名平台,迈出了具有重大意义的一步,宣布了其新的路线图,开启了一个全新的时代,以生成式人工智能的整合为标志。这一富有远见的倡议名为OverflowAI,承诺提升平台的能力,改进搜索功能,并为全球的开发者提供无缝体验。 这一变革性计划的核心是引入语义搜索,这是传统词汇搜索方法的强大升级。通过利用向量数据库的潜力,Stack Overflow旨在向用户查询提供更加智能的响应,与他们的研究主题精确对齐。目标是创建一个真正的对话式、以人为本的搜索体验,开发者可以即时访问由GenAI驱动的可靠和准确的解决方案。这种方法的独特之处在于始终专注于信任和归属,确保贡献者的努力得到认可和回报。 OverflowAI的好处不仅限于公共平台,因为这些增强的搜索功能也将集成到Stack Overflow for Teams中。这意味着客户可以快速找到相关的答案,同时利用可信赖的来源,包括Stack Overflow for Teams、公共平台和其他知识库,如Confluence和GitHub。 OverflowAI最令人兴奋的一个方面是为Stack Overflow for Teams引入了“企业知识摄取”。这一突破性功能使用户能够利用现有的、准确和可信赖的内容,在几分钟内建立一个全面的知识库。利用人工智能和机器学习算法,系统将创建初始的标记结构,并根据团队最频繁的查询领域推荐相关的问题和答案。这个由AI驱动的过程高效地启动了一个Stack Overflow社区,使开发者能够专注于策划和完善内容,以确保准确性和相关性。通过投票、编辑、评论和浏览等质量和准确性的指标,所有的知识都可以在内部社区中被发现和重复使用,创建了一个有价值的信息枢纽。 为了进一步提高可访问性,Stack Overflow将Stack Overflow for Teams的知识库与他们的新聊天机器人StackPlusOne无缝集成到了Slack中。这个巧妙的整合允许即时访问最具技术挑战的解决方案,从Teams的实例和Stack Overflow公共平台的经过验证的来源中获取。GenAI以对话形式提供响应,确保组织中非技术性成员也可以轻松理解这些信息。 Stack Overflow不仅将AI整合到平台中,而且还积极培育以AI为中心的知识共享社区。GenAI Stack…

Leave a Comment

纽约大学和Meta AI研究人员通过学习用户和已部署模型之间的自然对话,改进社交对话代理,无需额外注释

人类输入是改善社交对话模型的关键策略。在带有人类反馈的强化学习中,当需要许多人类注释来保证令人满意的奖励函数时,学习从反馈中取得了巨大的改进。反馈的来源包括用户对对话转折或对话情节的数字分数、排名或自然语言评论,以及对机器人转折的二元评估。大多数工作有意利用众包工人收集这些信号,因为自然用户可能不愿意被打扰或者如果他们这样做可能提供不准确的信息。 在这项研究中,来自纽约大学和Meta AI的研究人员考虑到他们有很多部署时的对话情节,这些情节展示了模型与真实用户之间的真实讨论。他们试图确定是否可以从这些自然用户讨论中获取任何隐含的指示,并利用这些信号来增强对话模型。这样做有两个原因。首先,尽管他们可能不提供明确的注释,但自然用户最接近未来部署的数据分布。其次,使用先前对话情节中的隐含信号可以节省用于众包的金钱。 图1:方法的总体概述。从人类和机器人之间的对话中获取隐含信号,例如下一个人类转折是否会很长或很短、快乐或不快乐。 更准确地说,他们研究了是否可以调整聊天机器人以使用最佳的隐含反馈信号,如即将到来的人类答案的数量、长度、情感或响应性。他们使用来自BlenderBot在线部署的公开可用的去标识化数据来研究这个问题。使用这些数据,他们训练样本和重新排序模型,比较各种隐含反馈信号。通过自动化和人工判断,他们发现他们的新模型优于基线回复。此外,他们还询问是否支持这些措施会导致不良行为,因为他们的隐含反馈信号是两个生成质量的粗略代理指标。 是的,这取决于使用的信号。特别是,优化更长的讨论长度可能导致模型提出有争议的观点或以敌对或争斗的方式回复。另一方面,优化积极的回应或情绪相对于基线减少了这些行为。他们得出结论,来自人类的隐含反馈是一种有益的训练信号,可以提高整体性能,但所采用的具体动作具有重要的行为影响。

Leave a Comment

预测高风险妇女的癌前变化:一种突破性的基于乳腺X光摄影的深度学习方法

人工智能和深度学习的进步为改善医学诊断和患者护理开辟了新的途径。《放射学:人工智能》杂志上最近发表的一项研究表明,一种基于乳腺摄影的深度学习(DL)模型在检测高风险乳腺癌女性的癌前变化方面具有潜力。这项研究对于提高乳腺癌检测和风险分层的前景具有重要意义,特别是对于易感人群。 该研究侧重于利用一个DL模型,该模型是在大量筛查乳腺摄影图像的数据集上进行训练的。 使用接收者操作特征曲线下面积(AUC)来评估DL模型的性能,以衡量其预测准确性。结果显示出令人期待的结果,DL模型在一年的AUC方面达到了71%,在五年的AUC方面达到了65%,用于预测乳腺癌。尽管传统的乳腺影像报告和数据系统(BI-RADS)系统在一年的AUC方面稍高达到了73%,但DL模型在长期乳腺癌预测方面表现更好,其五年AUC为63%,而BI-RADS为54%。 该研究还深入探讨了影像在预测未来癌症发展方面的作用,进行了镜像实验,评估DL模型在检测早期或癌前变化方面的准确性,这些变化在标准乳腺摄影图像中可能不明显。结果表明,对于影像中存在未来癌症的情况,正向镜像产生了62%的AUC,而负向镜像则显示了51%的AUC,突显了DL模型在检测癌前或早期恶性变化方面的潜力。 一个特别有前景的发现是DL模型在短期风险分层中作为BI-RADS系统的补充。将DL模型的结果与BI-RADS评分结合起来,可以改善区分度,表明DL工具可以增强筛查乳腺摄影图像的评估,并提供更准确的近期风险评估预测。 研究人员还强调了DL模型的训练数据集侧重于低风险高风险女性,警告不要直接将研究结果推广到乳腺癌平均风险的女性。需要进一步研究探索DL模型在不同人群中的适用性以及其在更广泛的患者群体中辅助乳腺癌检测和风险评估的潜力。 总的来说,该研究强调了DL模型在乳腺癌检测和风险分层方面的巨大潜力,特别是对于高风险个体。它为未来的研究提供了铺路,以改进DL模型,拓展其在不同人群中的应用,最终促进乳腺癌诊断和患者预后的改善。随着技术的进步,基于人工智能的解决方案可以革新乳腺癌筛查和管理,实现早期发现和改善患者护理。

Leave a Comment

麻省理工学院和斯坦福大学的研究人员开发出一种机器学习技术,可以高效地学习控制机器人,从而在使用更少数据的情况下实现更好的性能

来自麻省理工学院和斯坦福大学的研究人员引入了一种新颖的机器学习技术,有潜力在动态环境和快速变化条件下彻底改变机器人(如无人机和自动驾驶车辆)的控制。 这种创新的方法将控制理论原则纳入机器学习过程中,从而可以创建更高效和有效的控制器。研究人员的目标是学习系统动力学内在结构,以设计出更优秀的稳定控制器。 该技术的核心是将控制导向结构整合到模型学习过程中。通过从数据中联合学习系统动力学和这些独特的控制导向结构,研究人员能够生成在真实场景中表现出色的控制器。 与传统的机器学习方法需要单独的步骤来推导或学习控制器不同,这种新方法可以直接从学习到的模型中提取出有效的控制器。此外,由于包含了这些控制导向结构,该技术在少量数据的情况下实现更好的性能,因此在快速变化的环境中特别有价值。 这种方法的灵感来自机器人学家如何利用物理学来推导简化的机器人模型。这些手动推导的模型基于系统的物理特性捕捉了基本的结构关系。然而,在复杂的系统中,手动建模变得不可行,研究人员通常使用机器学习来将模型拟合到数据上。现有方法的挑战在于它们忽视了基于控制的结构,而这对于优化控制器性能至关重要。 麻省理工学院和斯坦福大学团队的技术通过在机器学习过程中引入控制导向结构来解决这个限制。通过这样做,他们可以直接从学习到的动力学模型中提取控制器,有效地将基于物理学的方法与数据驱动的学习相结合。 在测试中,新的控制器紧密地跟随期望的轨迹,并优于各种基准方法。值得注意的是,从学习到的模型中派生的控制器几乎与使用精确系统动力学构建的基准控制器的性能相匹配。 该技术还具有数据效率高的特点,在最少的数据点上取得了出色的性能。相比之下,使用多个学习组件的其他方法在数据集较小时性能迅速下降。 这种数据效率对于机器人或无人机需要快速适应快速变化条件的场景尤其有希望,非常适合实际应用。 研究的一个值得注意的方面是其普适性。该方法可以应用于各种动力系统,包括机器人手臂和在低重力环境中运行的自由飞行航天器。 展望未来,研究人员有兴趣开发更可解释的模型,以便识别动力系统的特定信息。这可能会导致性能更好的控制器,进一步推动非线性反馈控制领域的发展。 该研究的专家们赞扬了将控制导向结构作为学习过程中的归纳偏见的贡献。这种概念创新导致了高效的学习过程,产生了具有有效、稳定和强大控制能力的动态模型。 通过在学习过程中引入控制导向结构,这种技术为更高效和有效的控制器打开了令人兴奋的可能性,使我们离机器人在复杂场景中具有出色的技能和适应性的未来更近了一步。

Leave a Comment

中国的一项新的人工智能研究提出了SHIP:一种即插即用的生成式人工智能方法,用于改进现有的微调方法

本文介绍了一种名为合成提示(SHIP)的新方法,用于改进现有的微调方法。 微调:在预训练之后,模型会在一个较小的、特定任务的数据集上进行微调。这涉及到在新数据上继续训练过程,通常使用较小的学习率。其思想是调整模型从预训练中获得的泛化知识,使其更适用于特定任务。 研究人员要解决的问题是某些类别缺乏数据的情况。他们的目标是训练一个生成模型,可以通过提供类别名称合成特征,从而能够为没有数据的类别生成特征。 为没有数据的类别生成特征是指为训练数据集中不存在的类别或类别合成表示的过程。这在收集某些类别的真实数据可能具有挑战性或不可能的情况下特别有用。 研究人员随后使用现成的方法对CLIP进行了原始标记和新合成特征的微调。然而,一个重要障碍是生成模型通常需要大量数据进行训练,这与他们的数据效率目标相矛盾。他们提出利用变分自编码器(VAE)作为框架,相比于需要对抗训练的模型,在低数据场景中更易于训练且更有效。 尽管GAN和VAE都是能够创建新数据样本的生成模型,但它们在架构、目标和训练方法上存在显著差异。GAN以生成高质量、逼真样本而闻名,但训练难度较大。而VAE提供了一个概率框架,在有限数据的情况下更易于处理,但可能不如GAN产生锐利或逼真的样本。 CLIP(对比式语言-图像预训练)是OpenAI开发的一种模型,可以从文本描述中学习理解和生成图像,反之亦然。它已经在大规模数据集上进行了预训练,并具有对齐的视觉和语言表示。预训练的语言编码器有助于生成更逼真的特征。本文旨在通过利用合成数据来增强CLIP微调方法的性能。研究人员在基于新的泛化、跨数据集迁移学习和广义零样本学习的综合实验中进行了全面的实验,取得了最先进的性能。 所提出的模型架构利用VAE框架对特征进行编码和生成,与CLIP集成以提取图像特征并重构它们。在训练过程中,模型学习将特征编码为潜在空间,然后重构它们。在生成阶段,它使用这个学到的编码为新类别合成特征,允许在某些类别没有数据的情况下对CLIP进行微调。基于CLIP的新颖生成器由轻量级MLP和冻结的CLIP文本编码器组成,在转换潜在代码和构建最终提示符进行特征重构方面起到关键作用。 研究人员观察的实验结果: 基于新的泛化:实验在11个不同的图像分类数据集上进行,包括ImageNet、Caltech101、OxfordPets、StanfordCars、Flowers102、Food101、FGVCAircraft、SUN397、DTD、EuroSAT和UCF101。数据集被分为基类和新类,每个基类以16个样本进行训练。评估同时针对基类和新类进行。 广义零样本设置:本文还在更现实的广义零样本设置下评估了基于新的泛化,其中基类和新类的数据混合在测试数据集中。结果表明,以前的方法在新类别中的性能显著下降,但提出的SHIP方法在新类别中的性能继续提高。 与其他方法的比较:结果与其他方法进行了比较,包括CLIP、CoOp、CLIP-Adapter和Tip-Adapter。提出的SHIP方法在各个数据集中的新类别中表现出了改进的性能。 结论: 本文提出了一种新颖的SyntHesIzed Prompts (SHIP)方法,旨在改进现有的微调方法,特别是在某些类别没有数据的情况下。该方法通过为没有数据的类别合成特征,并使用原始标记和新合成特征对CLIP进行微调,实现了各种任务的最先进性能。本文指出了额外的训练成本作为一种限制,并表达了在未来研究中探索SHIP在密集预测任务中的适用性的意愿。 总体而言,本文通过解决某些类别数据稀缺的挑战,并利用合成数据提高CLIP微调方法的性能,在该领域提出了重要贡献。

Leave a Comment

“认识高级推理基准(ARB):一个评估大型语言模型的新基准”

自然语言处理在最近几年取得了显著进展,特别是创建了复杂的语言模型。几乎所有的自然语言任务,包括翻译和推理,在像GPT 3.5、GPT 4、BERT、PaLM等著名模型的性能方面都取得了显著进步。一些基准用于评估和评估人工智能领域中这些发展。基准基本上是一组标准化任务的集合,用于测试语言模型的能力。 考虑到GLUE和SuperGLUE基准,它们是最早的几个语言理解基准,像BERT和GPT-2这样的模型更具挑战性,因为语言模型一直在击败这些基准,引发了模型开发和基准难度之间的竞争。通过使模型变得更大并在更大的数据集上进行训练,可以提高性能。LLMs在各种基准测试中展示了出色的表现,评估了它们的知识和数量推理能力,但是当这些模型在当前标准上得分更高时,很明显这些基准已不再适用于评估模型的能力。 为了解决这些限制,一组研究人员提出了一个新的独特基准,称为ARB(高级推理基准)。ARB旨在传达各种学科领域(如数学、物理、生物学、化学和法律)中更困难的问题。与早期的基准相比,ARB侧重于复杂的推理问题,以提高LLM的性能。该团队还引入了一组数学和物理问题,作为ARB的子集,需要复杂的符号思维和深入的学科知识。这些问题非常困难,超出了当前LLMs的范围。 该团队对ARB基准进行了评估,包括GPT-4和Claude。这些模型在处理这些困难的复杂性方面遇到了困难,这些发现表明它们在ARB中更困难的任务上的表现得分明显低于50%。该团队还演示了一种基于评分表的评估方法,以改进评估过程。通过使用这种策略,GPT-4可以评估自己的中间推理过程,试图解决ARB问题。这扩大了审查过程的范围,并揭示了模型的问题解决策略。 ARB的符号子集也经过了人工审查。人工注释员被要求解决问题并提供自己的评估。人类评估者和GPT-4的基于评分表的评估分数之间存在有希望的一致性,表明模型的自我评估与人类判断相当一致。在需要专业推理的数量领域中,新数据集明显优于以前的基准,其中有数百个问题。 与过去基准中的多项选择题不同,大部分问题由简答和开放式回答组成,这使得LLMs更难进行评估。通过专家级推理任务和更现实的问题格式的结合,可以更准确地评估模型处理复杂的现实问题的能力。

Leave a Comment

遇见FACTOOL:一种用于检测大型语言模型(例如ChatGPT)生成的文本中事实错误的任务和领域无关框架

GPT-4是生成式人工智能(AI)技术的一个例子,它将自然语言处理中的多个任务结合成一个单一的序列生成问题。这种统一的架构具有卓越的效率和交互性,使用户能够使用自然语言界面执行各种活动(包括代码生成、数学问题解决和科学出版物的创建)。然而,这种生成式范式也带来了一些特定的困难。由于大型语言模型(LLMs)的限制,自动生成的文本经常显示错误或偏离事实。 LLMs往往会创建出令人信服的信息,但可能需要在事实上更准确或精确。这种限制限制了生成式AI在医疗、金融和法律等高风险行业的使用。因此,必须通过系统地识别这些错误来改进所创建材料的实用性和可靠性。例如,用于质量保证的检索增强验证模型、用于文本摘要的幻觉检测模型以及用于代码的执行评估模型等都是当前文献中关注的检测和减轻机器学习模型产生的事实错误的单一特定任务的例子。 鉴于LLMs处理的活动和领域的非凡灵活性,这些方法已经在各自的领域取得了成功。然而,拥有一个更全面的事实性检测和验证框架同样重要。此外,事实性检测的问题在当前文献中通常被概括为:(i)在给定一个主张的情况下评估一个主张是否事实准确,或者(ii)检测生成的主张是否得到给定证据的支持。 在用户与生成模型(如ChatGPT)进行交互时,他们经常需要评估长篇生成的事实准确性,而不是明确的主张和证据,因此需要更好地匹配这个任务定义。在这项研究中,来自上海交通大学、卡内基梅隆大学、香港城市大学、纽约大学、Meta AI、香港科技大学和上海人工智能实验室的研究人员提供了FACTOOL,这是一个任务和领域无关的框架,用于查找LLM生成的文档中的事实错误。在图1中,他们将“工具使用”和“事实性检测”的概念联系起来,并解释了他们的方法。 图1:带有工具增强的事实性检测框架。 为了获得所创建信息的事实性证据,FACTOOL专门使用多种资源,如Google搜索、Google学术、代码解释器、Python甚至LLMs。此外,他们的方法利用LLMs的批判性思维能力,根据可用数据评估内容的事实性。他们创建了一个基准,并对四个任务进行了实验: 基于知识的质量保证 代码生成 解决数学问题 撰写科学文献综述 他们解决了事实性识别的工作,并扩展了它以实现对最新生成式AI模型的更全面审计。根据他们对使用FACTOOL的现代聊天机器人的事实性分析,GPT-4在几乎所有情况下都具有最高的事实性。基于知识的质量保证测试显示,经过精心调整的聊天机器人(Vicuna-13B)具有可观的事实性。然而,它们在撰写科学文献综述和解答算术问题等更困难的任务上还存在困难。

Leave a Comment

谷歌DeepMind与东京大学研究人员推出WebAgent:一种由LLM驱动的代理,可以根据自然语言指令在真实网站上完成任务

通过利用大型语言模型(LLM)的HTML理解和多步推理能力,可以解决一些自然语言任务,包括算术、常识、逻辑推理、问答任务、文本生成,甚至是交互式决策任务。在自主网页导航方面,LLM最近在满足给定的自然语言指令时通过一系列计算机动作控制计算机或浏览互联网展现出了出色的成功。然而,预先定义的动作空间的缺失、与模拟器相比更长的HTML观察以及LLM缺乏HTML领域知识都对实际网站上的网页导航产生了负面影响(图1)。 图1:实际网页导航的困难。现代语言模型代理可以探索虚拟网站,在那里他们控制预定义的操作并接收经过简化且易于理解的HTML文本。然而,在导航实际网站时,代理必须处理开放性任务和包含多个与任务无关的组件的较长HTML文本,因此语言模型代理仍然面临困难。 由于指令的复杂性和开放性的实际网站,预先选择正确的动作空间并不容易。尽管有各种研究表明指令微调或从人类输入中进行强化学习可以提高HTML理解和在线导航的准确性,但目前的LLM只有在处理HTML文本方面偶尔具有最佳性能设计。大多数LLM都优先考虑广泛的任务泛化和模型大小可扩展性,通过优先选择较短的上下文持续时间而不是真实网页中的典型HTML令牌,并且不采用过去用于结构化文档的方法,包括文本-XPath对齐和文本-HTML令牌分离。 即使对这样的长文本应用令牌级别的对齐,成本也相对较低。通过在程序空间中对规范的Web操作进行分组,他们提供了WebAgent,这是一个由LLM驱动的自主代理,可以在实际网站上执行导航任务并遵循人类命令。通过将自然语言指令分解为更小的步骤,WebAgent实现了以下功能: 为每个步骤规划子指令。 基于子指令将较长的HTML页面压缩为与任务相关的片段。 在实际网站上执行子指令和HTML片段。 在这项研究中,来自Google DeepMind和东京大学的研究人员结合了两个LLM,创建了WebAgent:最近创建的HTML-T5是一个专业领域的预训练语言模型,用于工作规划和条件HTML摘要生成。Flan-U-PaLM用于基于代码的生成。通过在编码器中包含本地和全局注意力方法,HTML-T5专门用于更好地捕获较长HTML页面的结构语法和语义。它是自我监督的,使用CommonCrawl1创建的大型HTML语料库进行预训练,并结合了长跨度去噪目标。现有的LLM驱动代理通常使用单个LLM完成决策任务,并为每个任务提示各种示例。然而,对于现实世界的任务来说,这是不够的,因为其复杂性超过了模拟器的复杂性。 通过全面的评估,他们的集成策略与插件语言模型相结合,可以提高HTML理解和连接性,并提供更好的泛化能力。全面的研究表明,将任务规划与HTML摘要结合在专门的语言模型中对于任务性能至关重要,可以使实际在线导航的成功率提高50%以上。与声音基准相比,WebAgent在静态网站理解任务中的问答准确性表现优异,并且具有可比较的性能。此外,HTML-T5还作为WebAgent的关键插件,可以独立地在基于Web的任务上产生尖端结果。在MiniWoB++测试中,HTML-T5比天真的局部-全局注意模型及其指令微调变体表现更好,比以前最佳技术提高了14.9%的成功率。 他们主要做出了以下贡献: • 他们提供了WebAgent,该代理结合了两个LLM,用于实际的网络导航。通用语言模型生成可执行程序,而领域专家语言模型处理规划和HTML摘要。 • 通过采用局部-全局注意力和在大规模HTML语料库上进行长跨度去噪预训练的组合,他们提供了HTML-T5,一种新的HTML特定语言模型。 • 在真实的网站中,HTML-T5的成功率显著提高了50%以上,在MiniWoB++中,它超过了之前的LLM代理14.9%。

Leave a Comment

MLOps覆盖整个机器学习生命周期:论文摘要

这篇AI论文对MLOps领域进行了广泛的研究。 MLOps是一门新兴的学科,专注于自动化整个机器学习生命周期。调查涵盖了广泛的主题,包括MLOps流水线、挑战和最佳实践。它深入探讨了机器学习过程的各个阶段,从模型需求分析、数据收集、数据准备、特征工程、模型训练、评估、系统部署和模型监控等开始。此外,它还讨论了整个生命周期中的业务价值、质量、人类价值和伦理等重要考虑因素。 该论文旨在全面调查MLOps,并强调其在自动化机器学习生命周期中的重要性。调查涵盖了多个主题,包括MLOps流水线、挑战、最佳实践以及机器学习过程的各个阶段。 本文在下图中提供了一个概览: https://arxiv.org/abs/2304.07296:机器学习流程 模型需求分析 为了启动一个机器学习项目,利益相关者必须分析和确定模型需求。本节概述了四个考虑因素:业务价值、模型质量、人类价值(隐私、公平性、安全性和问责制)以及伦理。鼓励利益相关者定义目标,评估用于识别价值和问题的工具,优先考虑需求,涉及相关利益相关者,并确定必要的功能。 数据收集和准备 数据准备阶段在确保机器学习任务的高质量数据方面起着至关重要的作用。本节介绍了数据收集、数据发现、数据增强、数据生成和ETL(提取、转换、加载)过程。强调了数据质量检查、数据清洗、数据合并、数据匹配以及进行探索性数据分析(EDA)以获得数据集洞察的重要性。 特征工程 特征工程对于提高预测建模性能至关重要。本节重点介绍了特征选择和提取、特征构建、特征缩放、数据标记和特征填充等技术。提到了与每种技术相关的具体算法和方法,包括主成分分析(PCA)、独立成分分析(ICA)以及标准化和归一化。 模型训练 模型训练阶段涵盖了不同类型的机器学习模型,包括有监督学习、无监督学习、半监督学习和强化学习。本节讨论了模型选择,包括为特定问题选择适当模型的过程。还探讨了模型选择的方法,如交叉验证、自助法和随机拆分。还讨论了超参数调优,即优化模型参数的过程。 模型评估 模型评估侧重于使用各种指标评估模型的性能。本节介绍了常见的评估指标,如准确率、精确率、召回率、F值和ROC曲线下的面积(AUC)。强调同时考虑模型性能和业务价值的重要性。 系统部署 系统部署涉及选择适当的ML模型操作平台,集成系统,进行系统集成测试,并将系统发布给最终用户。解释了部署策略,包括金丝雀部署和蓝绿部署。还讨论了部署ML系统所面临的挑战,以及实现顺畅部署过程的提示。 模型监控 本文强调在ML系统中进行模型监控的重要性。强调开发人员在ML模型监控和维护方面缺乏知识和经验。本节探讨了模型监控的各个方面,包括漂移检测、模型监控质量、合规性、系统日志记录和模型解释(XAI)。提供了监控数据分布变化、确保模型性能、符合行业特定标准和法规、用于ML流水线的系统日志记录以及实现模型透明度的洞察。 结论 本文通过讨论MLOps的未来以及需要解决的可扩展性和可靠性挑战来总结。它强调了对机器学习模型进行持续监控和维护的重要性,以实现长期成功。 总之,这份综合调研涵盖了MLOps领域内整个机器学习生命周期。它为MLOps管道、挑战、最佳实践、模型需求分析、数据准备、特征工程、模型训练、评估、系统部署和模型监控提供了宝贵的见解。通过详细研究这些主题,本调研旨在帮助研究人员和从业者全面了解MLOps及其实际意义。

Leave a Comment

认识Mentat:一种AI工具,它可以在命令行中协助您完成任何编码任务,并允许它在多个文件中进行编辑协调

术语“Mentat”源于著名作家弗兰克·赫伯特(Frank Herbert)在他的《沙丘》系列科幻书籍中创造的概念。Mentat是经过培训的人类或机器人,类似于人工智能,能够执行复杂的任务,如机器学习和数据分析。他们在执行这些任务时不使用计算机。他们通过大量的训练数据集来增强这些能力。Mentat的角色类似于顾问和分析师。 Mentat是一种能够从命令行协调多个文件的任何编码任务的AI工具。研究人员仍在开发Mentat,因为存在一些问题。最主要的错误是当用户从GitHub账户安装时,总是会出现无效语法的错误。但是,这些问题已经在Python的高级版本中得到解决。第二个错误是由于SSL证书导致的。研究人员表示,SSL证书错误可能是由于证书过期、域名不匹配、自签名证书、不完整的证书链、证书被吊销和弱密码协议等引起的。为了解决这些错误,研究人员建议确保我们在正确的网站上。他们还告诉我清除浏览器中的缓存和Cookie。如果问题仍然存在,他们还提到可以尝试从不同的浏览器访问网站。 Mentat的代码库非常庞大。因此,研究人员建议只检索代码库的一小部分,这样有助于将所有代码库整合到发送给LLM的提示中。提示是与人工智能进行对话的工具。另一个问题涉及使用的API。根据研究团队的说法,用户还可以使用本地llama模型代替OpenAI API。随着问题的解决,Mentat在后期也有所发展。如前所述,Mentat是进化而来的人类机器人,能够执行复杂的数据分析和机器学习任务。 研究人员还提到Mentat在各种领域都有应用。它们也用于处理大型项目。借助Mentat的帮助,可以轻松处理大型项目,因为它们为其提供指导。它们还修复测试错误和清理测试。Mentat还在金融分析和预测、网络安全和威胁分析、医疗保健、自然语言处理、研究、优化、自动驾驶车辆、游戏和欺诈检测等各个领域中找到应用。这些是Mentat应用的一些重要领域。

Leave a Comment

在无源领域适应中突破障碍:NOTELA对生物声学和视觉领域的影响

深度学习在各种应用领域取得了重要的进展。一个重要的贡献因素是越来越大型的数据集和模型的可用性。然而,这一趋势的一个缺点是,训练最先进的模型也变得越来越昂贵,这引起了环境问题,并对一些从业者的可访问性造成了困扰。此外,在部署过程中,直接重用预训练模型可能会导致性能下降,因为面对分布转移。研究人员已经探索了无源域自适应(SFDA)来解决这些挑战。这种技术在没有访问原始训练数据的情况下,将预训练模型适应到新的目标域。本文重点介绍了SFDA问题,并介绍了一种名为NOTELA的新方法,旨在解决音频领域(特别是生物声学)中的分布转移问题。 广泛用于鸟类物种分类的生物声学数据集(XC)包括: 聚焦录音。 在自然条件下针对个体鸟类。 通过全向麦克风获取的声景录音。 它存在独特的挑战,声景录音具有较低的信噪比,同时多只鸟类同时发声,以及环境噪音等显著的干扰因素。此外,声景录音是从不同地理位置收集的,导致标签出现极端转移,因为XC中的物种只有一小部分可能出现在特定区域。此外,源域和目标域都存在类别不平衡问题,并且由于每个录音中存在多个鸟类物种,该问题是一个多标签分类任务。 在这项研究中,Google研究人员首先评估了生物声学数据集上的几种现有SFDA方法,包括熵最小化、伪标注、降噪师生和流形正则化。评估结果显示,虽然这些方法在传统视觉任务中取得了成功,但在生物声学中的表现差异显著。在某些情况下,它们的性能甚至不如没有自适应。这个结果凸显了需要专门的方法来处理生物声学领域的独特挑战。 为了解决这个局限性,研究人员提出了一种名为NOisy student TEacher with Laplacian Adjustment(NOTELA)的新颖方法。这种新方法结合了降噪师生(DTS)方法和流形正则化(MR)技术的原则。NOTELA引入了一种向学生模型添加噪声的机制(受DTS启发),同时在特征空间中强制实施簇假设(类似于MR)。这种组合有助于稳定适应过程,并增强模型在不同领域的泛化能力。该方法将模型的特征空间作为额外的真实信息源,使其能够在具有挑战性的生物声学数据集中取得成功,并实现最先进的性能。 在生物声学领域,NOTELA在源模型之上展现出了显著的改进,并在多个测试目标域中优于其他SFDA方法。它在多标签分类的标准指标——平均精度(mAP)和类别平均精度(cmAP)方面表现出色。它在不同目标域上的显著表现,如S. Nevada(mAP 66.0,cmAP 40.0)、Powdermill(mAP 62.0,cmAP 34.7)和SSW(mAP 67.1,cmAP 42.7),突显了其在处理生物声学数据集的挑战方面的有效性。 在视觉任务的背景下,NOTELA始终展现出强大的性能,优于其他SFDA基线。它在各种视觉数据集上都取得了显著的Top-1准确率结果,包括CIFAR-10(90.5%)和S. Nevada(73.5%)。尽管在ImageNet-Sketch(29.1%)和VisDA-C(43.9%)上的表现略低,但NOTELA在处理生物声学和视觉领域的SFDA问题方面的整体有效性和稳定性是显而易见的。 https://arxiv.org/abs/2302.06658 上图显示了六个声景数据集上多标签分类测试平均精度(mAP)的演变。它将NOTELA和Dropout…

Leave a Comment

KAIST研究人员引入FaceCLIPNeRF:使用可变形NeRF的文本驱动的3D人脸操作流程

3D数字人类内容改进的关键组成部分是能够轻松操纵3D面部表达。虽然神经辐射场(NeRF)在重建3D场景方面取得了重大进展,但其许多操纵技术都集中在刚性几何或颜色操纵上,这需要改进以满足对面部表情具有细粒度控制的工作的需求。尽管最近的一项研究提出了一种区域控制的面部编辑方法,但它需要从选定的训练帧中收集用户注释的面部不同部分的蒙版,然后进行人工属性控制以实现所需的改变。 面部特定的隐式表示技术使用可变形面部模型的参数作为先验,以高保真度地编码观察到的面部表情。然而,它们的手动操作需要涵盖一系列面部表情并且大约包含6000帧的大型训练集。这使得数据收集和操作过程都变得艰巨。与此不同,KAIST和Scatter Lab的研究人员开发了一种方法,该方法通过包含几种不同类型的面部变形实例的动态肖像视频进行训练,从而允许基于文本的修改,如图1所示。 图1 他们的方法在控制面部变形之前使用HyperNeRF从一个规范空间学习并隔离观察到的变形。特别地,通过训练帧间共享的常见潜在代码条件隐式场网络和逐帧变形潜在代码进行教学。他们的基本发现是使用多个空间可变的潜在代码来表示操纵任务的场景变形。这个顿悟是从朴素地将HyperNeRF公式应用于操纵问题的缺点中产生的,即寻找一个编码所需面部扭曲的单个潜在代码。 例如,单个潜在代码无法传达需要许多情况下所见的局部变形混合的面部表情。在他们的研究中,他们将这个问题称为“链接的局部属性问题”,并通过提供具有空间可变潜在代码的修改场景来解决它。为了做到这一点,他们首先将所有观察到的变形编译成一组锚定代码,然后教导多层感知机(MLP)将它们组合起来生成多个位置条件潜在代码。然后,通过将潜在代码的生成图像与CLIP嵌入空间中的目标文本接近,实现了潜在代码对目标文本的视觉特征的反映。总之,他们的工作对以下方面做出了贡献: • 设计一种学习使用具有空间可变潜在代码表示场景的操纵网络 • 提出了基于文本驱动的使用NeRF重建的面部的操纵流程 • 据他们所知,第一个能够操纵使用NeRF重建的面部的文本。

Leave a Comment

在虚拟现实中推进人体动作识别:这篇人工智能论文介绍了具有骨骼大内核注意力的LKA-GCN,以实现无与伦比的性能

基于骨架的人体动作识别是一种计算机视觉领域,通过分析视频数据中的骨骼关节位置来识别人体动作。它使用机器学习模型来理解时间动态和空间配置,从而在监控、医疗、体育分析等领域应用。 自从这个研究领域出现以来,科学家们遵循了两种主要策略。第一种策略是手工制作的方法:这些早期技术应用3D几何操作来创建输入经典分类器的动作表示。然而,它们需要人工辅助来学习高级动作线索,导致性能过时。第二种策略是深度学习方法:深度学习的最新进展已经改变了动作识别的方式。最先进的方法专注于设计能够捕捉空间拓扑和时间运动相关性的特征表示。更准确地说,图卷积网络(GCNs)已经成为基于骨架的动作识别的强大解决方案,在各种研究中取得了令人印象深刻的结果。 在这个背景下,最近发表了一篇新文章,提出了一种名为“骨架大核关注图卷积网络”(LKA-GCN)的新方法。它解决了基于骨架的动作识别中的两个主要挑战: 长程依赖性:LKA-GCN引入了骨架大核关注(SLKA)算子,以有效捕捉关节之间的长程相关性,克服了现有方法中的过度平滑问题。 有价值的时间信息:LKA-GCN采用手工制作的关节运动建模(JMM)策略,专注于具有显著关节运动的帧,增强了时间特征,提高了识别准确性。 该方法将骨架数据作为图形进行时空图建模,其中空间图形捕捉人体关节的自然拓扑,而时间图形编码相邻帧中相同关节之间的相关性。图形表示是从骨架数据生成的,它是表示随时间变化的人体关节的一系列三维坐标。作者引入了SLKA算子,将自注意机制与大核卷积相结合,以高效地捕捉人体关节之间的长程依赖关系。它通过更大的感受野聚合间接依赖关系,同时最小化计算开销。此外,LKA-GCN还包括JMM策略,通过计算反映局部范围内平均关节运动的基准帧,专注于信息丰富的时间特征。LKA-GCN由时空SLKA模块和识别头组成,利用多流融合策略来提高识别性能。最后,该方法采用多流方法,将骨架数据分为三个流:关节流、骨流和运动流。 为了评估LKA-GCN,作者使用了各种实验对三个基于骨架的动作识别数据集(NTU-RGBD 60、NTU-RGBD 120和Kinetics-Skeleton 400)进行了实验研究。将该方法与基准进行了比较,并分析了SLKA算子和关节运动建模(JMM)策略等不同组件的影响。还探讨了两流融合策略。实验结果表明,LKA-GCN优于最先进的方法,证明了其在捕捉长程依赖关系和提高识别准确性方面的有效性。视觉分析进一步验证了该方法捕捉动作语义和关节依赖性的能力。 总之,LKA-GCN解决了基于骨架的动作识别中的关键挑战,捕捉了长程依赖关系和有价值的时间信息。通过SLKA算子和JMM策略,LKA-GCN在实验评估中优于最先进的方法。其创新方法在各种应用中有望实现更准确、更稳健的动作识别。然而,研究团队也意识到一些限制。他们计划扩展他们的方法,包括深度图和点云等数据模态,以获得更好的识别性能。此外,他们还计划使用知识蒸馏策略来优化模型的效率,以满足工业需求。

Leave a Comment

2023年最佳基于人工智能的艺术生成器

梦幻帮助 Wombo 梦幻帮助是一种与其他AI图片生成器相比,可以进行连续图像合成而无需额外费用的AI生成器。如果您的预算有限或刚开始使用,这款AI生成器是一个很好的选择。梦幻帮助也非常用户友好。您必须注册、撰写一些内容并选择图像风格,然后才能开始使用。如果您不喜欢为您生成的视觉类型,您可以随时重新开始。 DALL-E 2 OpenAI于2021年发布了DALL-E 2。OpenAI开发了一个名为DALL-E 2的图像生成AI模型的新版本。DALL-E 2与其前身一样,旨在根据文字输入生成专业标准的图像。DALL-E 2在多个方面改进了其前身,包括生成更高质量、更细腻的图像的能力。DALL-E 2可以处理更细腻的文本信号并响应各种视觉表达。此外,它可以根据特定用途或领域进行调整,例如在拍摄特定主题或地点的图像时。 Midjourney 由于其广泛的功能和极快的合成速度,Midjourney可以说是最好的人工智能(AI)图片生成器。向Midjourney发送短信命令,它将处理剩下的事情。许多创意专业人士使用Midjourney生成作为他们工作灵感的图像。使用Midjourney制作的人工智能作品“Théâtre d’Opéra Spatial”在科罗拉多州博览会的美术类别中击败了其他20位画家,获得了第一名。但是,目前,Midjourney可以在Discord服务器上找到。您必须加入MidJourney Discord服务器并使用机器人的命令来制作图像。不过,这很简单,您可以立即开始工作。 梦幻工作室(稳定扩散) 梦幻工作室,也被称为稳定扩散,是一款流行的文本到图像的AI生成器。它是一个免费和公共模型,可以即时可视化文本建议。照片、插图、3D模型甚至标志都在梦幻工作室可能创作的范围之内。通过将用户上传的图像与书面描述相结合,可以制作逼真的艺术品。 Craiyon Craiyon是一款有趣的人工智能图片生成器,网站和应用程序可在Google Play商店上提供给Android设备。DALL-E的免费版本(前身为DALL-E Mini)具有与商业版本相同的功能。您可以根据文本说明制作出不错的图片。不幸的是,Craiyon的服务器不稳定经常导致创建过程中的长时间延迟和不幸的设计缺陷。这些图片可以用于个人和商业用途,前提是给予Craiyon适当的信用并遵守使用条款。 FotorAI图像生成器 该公司提供FotorAI图像生成器,使用AI技术生成原始照片。用户可以输入示例图像,然后生成全新的图像。这个新功能使用生成对抗网络(GAN)来创建据称具有高分辨率、逼真的图像。它具有许多应用,包括为数字媒体创建原创艺术品。您只能在Fotor的付费版本中获得它。 Nightcafe…

Leave a Comment

见到GOAT-7B-社区模型:一种在GoatChat应用收集的数据集上对AI模型Fine-Tuned LLaMA-2 7B模型进行微调的模型

最近,AI研究实验室的科学家们发布了GOAT-7B-Community模型,该模型通过使用GoatChat应用的数据对LLaMA-2 7B模型进行了改进。Meta的LLaMA v2 7B经过微调,成为了最先进的GOAT-7B-Community模型,利用了从GoatChat应用获得的新颖、细粒度的数据集。 “对齐”在创建大型语言模型(LLM)中至关重要。这是一种模型可以拒绝回答其认为不道德或非法的问题的思想,基于其教育和经验。对齐对于道德AI实施至关重要,但也给模型优化带来了新的障碍。 研究人员注意到,通过对齐生成的回答很少提供客户所需的精确细节。这些反应通常更为温和,表明不愿意详细阐述。解决这个问题是至关重要的,如果要构建一个可靠的模型,为问题提供深入和完整的回答。他们发现,对齐过滤器并不能消除所有不当建议。因此,对齐通常会导致丢弃大量的数据集。这相当于案例中总信息的三分之一左右。 鉴于这个问题,研究人员开发了一种新的清理数据集的技术。此外,他们进行了一项受管制的实验,以全面了解对齐回复对模型性能的影响。 科学家们是如何受教的 配备八个A100 NVIDIA GPU的高性能节点为深度学习计算提供了支持。研究人员选择了bfloat16浮点格式和DeepSpeed ZeRO-3优化作为训练过程的基础。他们对模型进行了三次迭代,每隔一个时期保存一次进展。然而,经验证据显示,执行一个时期后,质量开始下降。这促使他们重新思考他们的策略,并选择进行一次训练时期并进行一次中途检查。常用的评估语言模型的标准,如MMLU和BigBench Hard,用于评估GOAT-7B-Community模型。团队目前正在分析所有模型,并将很快发布他们的研究结果。 用途 大语言模型和聊天机器人的研究是GOAT-7B-Community的主要关注点。自然语言处理、机器学习和人工智能的学者和爱好者将发现它特别有用。 限制 尽管具有令人印象深刻的推理能力,该模型仍然存在与其相对较小的规模(7B模型被认为是“小型”LLM)相关的问题。其中最明显的问题是“幻觉”。这些“幻觉”是一个不断阻碍解决的障碍,随着LLM的改进和扩展。 “幻觉”是人工智能研究中非常强调的一个持久性问题。最终目标是开发出能够产生逻辑上正确、符合语法的答案,并忠实于所提供事实的模型。 风险和偏见 由于GOAT-7B-Community模型使用了公共和专有数据进行训练,因此该模型的可靠性不高,可能会返回与现实相悖的结果。因此,GOAT-7B-Community模型可能产生不准确、有偏见甚至令人反感的结果。 主要观察 没有比这更好的免费7B模型。 良好的MMLU结果的关键是多样化和高质量的数据集。 与当前的13B模型相比,7B的表现令人钦佩。 然而,尺寸限制仍然存在。…

Leave a Comment

FraudGPT AI 动力的网络犯罪工具的惊人崛起

在互联网的一个黑暗而不祥的角落,网络犯罪分子再次利用人工智能的力量推进其恶意议程。继臭名昭著的WormGPT之后,又有一个新角色出现了,它的名字是FraudGPT。这个邪恶的AI工具专门设计用于攻击目的,使威胁行为者能够策划复杂的网络犯罪,从钓鱼邮件到创建不可检测的恶意软件。随着网络安全界迎接又一个挑战,让我们深入探讨FraudGPT的世界以及对在线安全的潜在影响。 也可阅读:犯罪分子使用人工智能冒充亲人 担心FraudGPT的崛起:黑暗网络的轰动 就在网络安全界正在从WormGPT的影响中恢复过来之际,FraudGPT作为最新一款网络犯罪生成的AI工具出现了。这一存在被Netenrich安全研究员Rakesh Krishnan揭露,他对这个新的AI威胁发出了警报。FraudGPT在暗网市场和秘密的Telegram频道上提供了一系列邪恶的攻击能力。 也可阅读:网络犯罪分子使用WormGPT侵犯电子邮件安全 FraudGPT背后的行为者 在匿名的可怕幕布后面,一个名为“CanadianKingpin”的神秘行为者声称负责制作FraudGPT。这个AI机器人专门为网络犯罪分子提供各种工具和功能,以适应他们的恶意意图。从钓鱼邮件到破解工具和卡片欺诈,FraudGPT是一个落入错误手中的强大武器。 订阅和费用 网络犯罪的地下世界并不靠善意运作,而是由利润驱动。FraudGPT也不例外,每月订阅费用为200美元,六个月和一年的订阅费用分别为1000美元和1700美元,享有折扣。这种付费模式使得那些愿意利用其能力的人更易接触到它。 揭示威胁 负责开发FraudGPT的确切大型语言模型(LLM)仍然是一个谜。然而,它的影响远非隐形。通过3000多个确认的销售和评论,网络犯罪分子正在找到使用其能力进行恶意目的的创造性方式。从编写不可检测的恶意代码到识别泄漏和漏洞,FraudGPT对网络安全构成严重威胁。 也可阅读:PoisonGPT:Hugging Face的LLM散播假新闻 利用AI进行网络犯罪活动 网络犯罪分子正在利用OpenAI ChatGPT等AI工具的可用性,创建没有道德保障的对抗性变体。FraudGPT就是这种趋势的典型,使新手行为者能够扩大规模发动复杂的钓鱼和商业电子邮件妥协攻击。 也可阅读:在AI时代如何检测和处理Deepfake? 升级的钓鱼即服务(PhaaS)模式 钓鱼长期以来一直是网络犯罪分子钟爱的技术,但FraudGPT将其提升到一个全新的水平。其强大的AI驱动能力成为新手行为者发动令人信服的钓鱼和商业电子邮件妥协(BEC)攻击的跳板。潜在的后果包括窃取敏感信息和未经授权的电汇。 也可阅读:在使用生成AI工具时保护您的隐私的6个步骤 伦理困境 像ChatGPT这样的AI工具可以与伦理保障一起开发,但FraudGPT证明了这些保障可以轻易被规避。正如Rakesh Krishnan所指出的那样,实施深层防御策略对于应对这些快速移动的威胁至关重要。组织必须利用所有可用的安全遥测进行快速分析,以在网络威胁演变为勒索软件攻击或数据外泄之前识别和挫败网络威胁。 也可阅读:Airtel开发AI工具识别欺诈钓鱼信息…

Leave a Comment

认识 REPLUG 一种检索增强的语言建模框架,它将一个冻结的语言模型与一个冻结/可调节的检索器结合,将GPT-3 (175B) 在语言建模方面的性能提高了6.3%

近年来,语言模型已成为人工智能领域增长最快的领域之一。这些模型被开发用于处理和生成自然语言文本,正在推动一些最创新和突破性的人工智能应用,并处于人工智能扩展的新时代的前沿。特别是一种语言模型,名为GPT-3,因其非凡的能力和性能而引起了全球轰动。GPT-3使用了变压器架构来处理文本,从而产生了一个能够像人类一样回答问题的模型。不仅如此,该模型甚至可以对长段落进行总结,完成代码,以及以无与伦比的速度和准确性完成任务。 像GPT-3这样的语言模型在生成准确和适当的响应时仍然存在一些局限性。这就是REPLUG发挥作用的地方。一种名为REPLUG的新方法已经被引入:一种检索增强的语言模型框架。这是一种通过将它们与检索式结构合并来改善黑盒语言模型性能的方法。检索系统从大量文本语料库中找到与给定提示匹配的最合适的段落,然后在检索到的段落上对语言模型进行微调。这使得语言模型能够产生更准确的答案,特别是当提示在其训练数据中看不见时。 REPLUG方法包括两个主要步骤-文档检索和输入重构。首先,使用检索器从外部语料库中识别相关文档。然后,将每个检索到的文档明确添加到原始输入上下文中,并从多个传递中组合输出概率。该方法使用了一种能够支持注意机制的深度神经网络来学习不同模态之间的网络。 REPLUG在包括大型图像字幕数据集在内的各种基准数据集上进行了测试,并且在准确性和可扩展性方面显示出比现有系统更好的结果。REPLUG的一个关键优势是它不需要对基础语言模型架构进行任何修改。可以通过添加检索系统来增强像GPT-3这样的当前模型。这使得REPLUG易于访问和实施。通过调整的检索器,REPLUG将GPT-3(175B)在语言建模方面的性能提高了6.3%,并将Codex在五个样本MMLU上的性能提高了5.1%。 因此,REPLUG的引入似乎是自然语言处理领域的一个游戏规则改变者。它结合了黑盒语言模型和检索系统的优势,生成了一个优于传统语言模型的混合模型。REPLUG使用的深度神经网络架构具有可扩展性,适用于需要处理大量多模态数据的真实世界应用。REPLUG的潜在应用范围绝对是巨大的,并在不久的将来似乎很有前景。

Leave a Comment

斯坦福大学的研究人员引入了Gisting:一种用于语言模型中高效提示压缩的新技术

模型专业化涉及将预训练的机器学习模型适应特定的任务或领域。在语言模型(LMs)中,模型专业化对于改进其在摘要、问答、翻译和语言生成等各种任务中的性能至关重要。将语言模型专门用于特定任务的两个主要过程是指令微调(将预训练模型适应新任务或任务集)和模型蒸馏(从预训练的“教师”模型转移知识到更小、专门的“学生”模型)。提示是LM专业化领域的一个关键概念,因为它提供了引导模型朝特定行为的方式,允许更有效地使用有限的训练数据,并且对于实现最先进的性能至关重要。压缩提示是一种研究中的技术,希望能够在计算、内存和存储方面节省大量开销,同时不会对输出的总体性能或质量产生显著降低。 本文由斯坦福大学的研究人员提出,提出了一种名为gisting的提示压缩新技术,该技术训练了一个LM将提示压缩为更小的“要点”标记集。为了降低提示的成本,可以使用微调或蒸馏等技术训练一个模型,该模型的行为类似于没有提示的原始模型,但在这种情况下,模型必须针对每个新提示进行重新训练,这远非理想。然而,gisting的思想是使用元学习方法从提示中预测要点标记,这不需要为每个任务重新训练模型,并且可以在没有额外训练的情况下实现对未见指令的泛化。这将降低计算成本,并允许压缩、缓存和重用提示以提高计算效率。它还允许用户在有限的上下文窗口中容纳更多内容。 作者们尝试了一种实现这种模型的简单方法-他们使用LM本身(利用其现有的知识)在指令微调过程中预测要点标记,同时修改Transformer注意力掩码。给定一个(任务、输入)对,他们在任务和输入之间添加要点标记,并将注意力掩码设置如下:要点标记之后的输入标记不能与要点标记之前的任何提示标记关联(但它们可以与要点标记关联)。由于输入和输出不能参考提示,这迫使模型将提示中的信息压缩到要点标记之间。为了训练要点模型,他们需要一个包含各种任务的数据集,因此他们创建了一个称为Alpaca+的数据集,该数据集结合了两个现有的指令微调数据集(斯坦福Alpaca和Self-Instruct),总共超过130k个示例。然后,他们保留了3个验证拆分,以便在训练后验证模型,其中包括已见、未见和手工制作的人类提示。通过这种方式,他们能够测试对未见指令的泛化性能,其中人类拆分提出了更强的泛化挑战。他们还使用了多种LM架构(即LLaMA-7Bm、仅解码器的GPT风格模型和FLAN-T5-XXL),并使用不同数量的要点标记(1、2、5或10)训练要点模型。然而,结果显示,模型对于要点标记的数量通常不敏感,有些情况下甚至显示出更多标记实际上对性能有害。因此,他们在后续实验中使用了单个要点模型。 为了评估提示压缩的质量,他们将性能与正面控制进行了校准,正面控制实际上是标准指令微调,它提供了性能的上限,并且负面控制中模型完全无法访问指令,导致生成随机要点标记,这提供了性能的下限。为了将模型的输出与正面控制进行比较并测量胜率,他们要求ChatGPT选择哪个响应更好,并解释其推理过程。他们还使用了一个称为ROUGE-L的简单词汇重叠统计指标(用于衡量生成文本与人类编写的指令之间的相似性)。50%的胜率表示模型的质量与不进行提示压缩的模型相当。 研究结果显示,在已见指令上,概要模型的胜率非常接近正向对照模型,LLaMA为48.6%,FLAN-T5为50.8%。更重要的是,他们能够表明概要模型在未见提示上具有竞争力的泛化能力,LLaMA为49.7%,FLAN-T5为46.2%。只有在最具挑战的人类分割上,他们的胜率略微下降(但仍具竞争力),LLaMA为45.8%,FLAN-T5为42.5%。FLAN-T5的表现稍差以及特定的失败案例为未来的研究提供了更多的假设。 研究人员还调查了通过概要提取可能实现的效率提升。结果非常令人鼓舞,概要缓存导致FLOPs减少40%,墙上时钟时间比未优化的模型降低4-7%。尽管这些改进在仅有解码器的语言模型中较小,研究人员还证明了概要模型使未见提示的压缩率提高了26倍,为输入上下文窗口提供了相当大的额外空间。 总的来说,这些发现说明了概要提取对于增强专用语言模型的有效性和效率的巨大潜力。作者还提出了几个有前途的概要提取后续工作方向。例如,他们指出,从概要提取中获得的最大计算和效率收益将来自于对更长提示的压缩,并且“概要预训练”可以通过首先学习压缩任意自然语言段落来改善压缩性能。

Leave a Comment

Meta AI和剑桥大学的研究人员研究了如何利用大型语言模型(LLMs)加强语音识别能力

大型语言模型是新的趋势,得益于著名的ChatGPT的引入。这个聊天机器人由OpenAI开发,能够回答问题、对长段落的文本数据进行摘要、完成代码片段、将文本翻译成不同的语言等等。大型语言模型具有模仿人类的能力,基于人工智能的子领域,包括自然语言处理、自然语言理解、自然语言生成、计算机视觉等等。 在没有明确监督的情况下,大型语言模型通过预测大量文本数据中的下一个单词进行训练,从而在其神经网络的限制内开发了对外部世界的大量知识编码能力,使其在各种下游任务中非常有用。尽管大型语言模型在不同领域展现出了出色的性能,但最近的研究将一个小型音频编码器纳入模型中,通过启用语音识别进一步扩展了大型语言模型的能力。 该过程直接将一系列音频嵌入,如音频数据表示,融入已有的文本标记嵌入中。这使得大型语言模型能够像文本等价物一样自动执行语音识别(ASR)任务,因为它具有集成的表示。它还可以将口头交流翻译成打印文本。团队表示,仅具有解码器的大型语言模型可以执行多语种语音识别,并在训练时超过监督式单语训练基线。音频编码器模型的大小和帧速率、LLM参数的低秩适应、文本标记掩蔽以及所使用的大型语言模型类型是研究考察以提高识别准确性的几个变量之一。 通过分析音频编码器的输出,团队证明了音频嵌入与相应的文本标记准确匹配,展示了音频和文本信息的有效融合。为了评估这种策略的有效性,团队使用了Multilingual LibriSpeech(MLS)数据集来衡量其效果。开源的LLaMA-7B大型语言模型采用了一种专门用于音频处理的神经网络——conformer编码器。结果表明,这种调整使LLM在语音识别任务上的表现比单语基线提高了18%。主要以英文文本进行训练的LLaMA-7B在多语种语音识别方面表现出色。 除了主要实验外,该研究还对增强型LLM的性能的其他方面进行了调查。为了确定在LLM被冻结训练时是否能够保留其初始能力,研究人员进行了剔除试验。这意味着在ASR系统进行训练时不改变LLM的参数,并且结果表明,即使在LLM被冻结的情况下,它仍然能够很好地执行多语种ASR。 团队还研究了增加音频编码器规模、提高音频编码器步幅(与音频如何划分相关的参数)和生成更少的音频嵌入的效果。通过这些测试,旨在提高ASR系统的有效性和效率。总之,研究结果表明,即使使用更大的音频编码器或更长的步幅,多语种ASR的可行性仍然存在,并且LLM能够处理长格式音频输入。

Leave a Comment

在机器学习系统中探索设计模式,以提高性能和可用性

机器学习无处不在,得益于其最近的发展和新发布。随着人工智能和机器学习日益普及和对生产级机器学习模型的需求增加,发现机器学习问题并为其构建解决方案非常重要。设计模式是缩小机器学习相关问题解决方案范围的最佳方法。模式的概念有助于定义问题并找到深入的解决方案,这些解决方案可以在类似问题上重复使用任意次数。 设计模式将知识编码为全球从业者可遵循的指令。在机器学习生命周期的不同阶段使用不同的机器学习设计模式。其中一些模式用于问题框架、评估可行性或解决机器学习模型的开发或部署阶段。最近,一位名为Eugene Yan的Twitter用户在其推文中讨论了机器学习系统中的设计模式。他在推文中列出了其中的一些。 级联:级联将复杂问题分解为较简单的问题,然后使用后续模型来解决更困难或更具体的问题。所分享的例子是关于Stack Exchange,这是一个在线社区平台,他们使用级联防御来对抗垃圾邮件。它由多个层次的保护组成,用于检测和防止垃圾邮件被发布到他们的平台上,其中每个层次都专注于垃圾邮件检测的不同方面。第一道防线是当有人发布速度过快以致于不可能是人类操作时(HTTP 429错误),第二道是如果有人通过正则表达式和规则被捕获(启发式算法),第三道则是基于阴影测试的极其准确(机器学习)。级联以系统化和分层的方式工作,因此是一种有效的方法。在此处查看资源。 重构 – 重构涉及重新定义原始问题,以使其更容易解决。推文中给出的例子是关于阿里巴巴,一个大型电子商务平台,他们重新定义了连续推荐的范式,帮助预测用户可能与之互动的下一个物品。在此处查看资源。 人在回路中 – 这涉及从用户、注释服务或领域专家那里收集标签或注释,以提高机器学习模型的性能。推文中提到的示例是Stack Exchange和LinkedIn,用户可以标记垃圾邮件。这允许用户对垃圾内容提供反馈,这些反馈可以用于训练机器学习模型以更好地检测垃圾邮件并过滤出冒犯性消息。在此处查看资源。 数据增强 – 它涉及创建训练数据的合成变化,以增加大小和多样性,以提高机器学习模型的泛化能力并减少过拟合的风险。其中提到了DoorDash这个食品配送平台的例子,数据增强被用于解决准确分类和标记新菜单项的挑战,这些菜单项的训练数据有限或没有可用的数据。在此处查看资源。 数据飞轮 – 这是一个正反馈循环,通过收集更多数据来改善机器学习模型,从而吸引更多用户和数据。其中分享了特斯拉的例子,它从其汽车中收集数据,例如传感器数据、性能指标和使用模式。这些数据用于识别和标记有助于改善用于自动驾驶等任务的模型的错误。在此处查看资源。 业务规则:这涉及根据领域知识或业务需求添加一些额外的逻辑或约束,以增强或调整机器学习模型的输出。Twitter使用机器学习模型来预测用户参与度,从而调节推文在时间轴中的可见性。它还使用手动调整的权重或规则作为机器学习模型输出的约束,以将知识纳入决策过程中。在此处查看资源。 因此,机器学习系统中的设计模式可以提高模型的性能、可靠性和解释性,并帮助解决该领域的挑战。

Leave a Comment

Spotify拥抱人工智能:从个性化播放列表到音频广告

流行音乐流媒体平台 Spotify 一直处于技术的前沿,不断探索提升用户体验的方式。最近,该公司进军生成式人工智能领域,已经成功推出了 DJ 功能。这一由人工智能驱动的工具根据用户的听歌习惯为其提供个性化的播放列表,带来了无与伦比的个性化体验。但 Spotify 的人工智能之路并不止于此。在一次创新的举措中,该公司现在利用生成式人工智能改革音频广告。让我们深入了解 Spotify 的人工智能探索以及对用户和广告商的潜在影响。 还可阅读:AI 生成的歌曲走红 见面 DJ – Spotify 的 AI 助推个人 DJ Spotify 最新的突破,DJ,是一项利用人工智能提供个性化体验的功能。与 ChatGPT 和 DALL-E 的开发者…

Leave a Comment

见面Co-BioNet:莫纳什大学的对抗性人工智能系统,革新医学图像分析,提高准确性,无需大量人工标注

深度学习在医疗人工智能方面取得了显著进展。然而,它面临着需要大量带注释的数据进行训练的挑战,这可能是费力且容易受到人类偏见的问题,尤其是在图像分割任务中。莫纳什大学的研究人员意识到人类注释的医学图像的有限性,并提出了一种创新的对抗学习方法来解决这个问题。他们旨在推进医学图像分析,使放射科医生和医疗专家受益。目前依赖于人工手动注释是耗时、主观和容易出错的,强调了需要替代解决方案的需求。 传统上,放射科医生和其他医学专家通过手工注释医学扫描,突出显示感兴趣的特定区域,如肿瘤或其他病变。然而,这种方法依赖于个人的主观解释,耗时且容易出错,特别是在涉及到3D医学模态(例如MRI CT)时,导致患者等待治疗的时间延长。此外,医学图像中的解剖结构(器官或组织)的轮廓需要耗时的手动输入,因为医学图像通常具有低对比度的切片和模糊的区域。 莫纳什大学的研究团队开发了一种“双视图”人工智能系统,以克服传统医学图像注释技术的局限性。这种创新方法涉及两个相互竞争的组件-一个部分模拟放射科医生的专业知识,标记医学图像;而另一个通过将其与人类放射科医生提供的有限注释扫描进行比较,评估AI生成的标签的质量。通过利用带有标签和未标记的数据,提出的AI算法提高了准确性,并在半监督学习中取得了突破性的成果。即使只有有限的注释,AI模型也可以做出明智的决策,验证初步评估,并产生更准确的诊断和治疗决策。这一进展为医学图像分析中广泛的人工注释提供了一个有前景的替代方案。 在他们的新颖的AI算法中,研究人员使用评论网络使AI系统的每个视图能够从其他理论的高置信度预测中学习。通过引入不确定性,AI系统可以有效地衡量其生成标签的质量,提高医学图像分割的准确性。为了共同学习双视图和评论家,研究人员将学习问题制定为最小最大优化,从而实现更健壮和准确的分割。 在实验中,研究人员将他们提出的方法与最先进的基线方法进行了性能比较。评估是定性和定量的,涉及到四个公共数据集,包括多种模态,如计算机断层扫描(CT)和磁共振成像(MRI)。结果表明,所提出的半监督方法在性能上超过了竞争基线,并在与全监督方法相同条件下实现了竞争性能。在三个公开可访问的医学数据集中,仅利用10%的标记数据与最近的最先进方法相比,平均改进了3%。这一结果突显了基于不确定性引导的协同训练框架在生成合理的分割掩膜、促进半自动分割过程以及推进放射科医生和医疗专家的医学图像分析方面的效率。 提出的架构 https://www.nature.com/articles/s42256-023-00682-w 莫纳什大学的研究团队开发的AI系统代表了医学图像分析方面的重大突破。通过使AI模型能够做出明智的决策和验证其评估,它有望揭示更准确的诊断和治疗决策。该团队致力于进一步研究和开发,包括将应用扩展到不同的医学图像并为放射科医生创建专用的端到端产品,展示了他们通过AI技术推进医疗保健的承诺。

Leave a Comment

CMU研究人员提出了TIDEE:一种具有体现能力的代理,可以在从未见过的房间中整理,而无需任何明确的指令

有效的机器人操作不仅仅需要盲目遵守预设命令。当明显偏离正常情况时,机器人应该作出反应,并且能够从不完整的指令中推断出重要的上下文信息。部分或自生成的指令需要一种推理能力,这种推理能力需要对环境中的事物(物体、物理、其他代理等)的行为有扎实的理解。这种思考和行动方式是具有身临其境的常识推理的关键组成部分,对于机器人在现实世界中自然工作和交互是至关重要的。 与能够遵循具体的逐步指令的具体化代理相比,身临其境的常识思考领域滞后,因为后者必须学会在没有明确指令的情况下观察和行动。通过整理物品等任务可以研究身临其境的常识思考,其中代理必须识别错误放置的物品,并采取纠正措施将其放回更合适的位置。代理必须在搜索可能的物体位移位置时智能地导航和操作,识别当前场景中物体是否在其自然位置之外,并确定将物体重新定位到正确位置。物体放置的常识推理和智能存在的可取技能在这个挑战中相结合。 TIDEE是由研究团队开发的一个提议的身临其境的代理,它可以在没有指导的情况下清理它以前从未见过的空间。TIDEE是第一种类型,因为它可以扫描场景以查找不在正确位置的物品,找出在场景中放置它们的位置,然后精确地将它们移动到那里。 TIDEE调查了一个家庭周围的环境,找到错放的物品,推断出它们的可能物体上下文,将这些上下文定位在当前场景中,并将物体移回其正确位置。常识先验知识被编码在视觉搜索网络中,该网络指导代理在当前场景中寻找感兴趣的容器,以重新定位物体;ii) 视觉语义检测器可以检测到放错位置的物体;iii) 关联神经图记忆记录了事物和空间关系,为物体重新定位提出了合理的语义容器和表面。研究人员使用AI2THOR模拟环境让TIDEE清理混乱的环境。TIDEE仅通过像素和原始深度输入完成任务,而没有事先见过同一个房间,仅仅使用从不同训练家庭的收集中学到的先验知识。根据对房间布局变化的人工评估,TIDEE的性能优于除去一个或多个常识先验的模型的变体。 TIDEE可以在没有任何指导或先前接触相关地点或物体的情况下整理它从未见过的空间。TIDEE通过环顾四周的区域,识别物品并将它们标记为正常或异常来实现这一点。TIDEE利用其场景图和外部图形存储进行图推理,以推断物体不在原位时的可能容器类别。然后,它使用场景的空间语义地图来引导基于图像的搜索网络,以可能的容器类别的可能位置。 它是如何工作的? TIDEE通过三个不同的步骤来清理房间。TIDEE首先扫描区域,并在每个时间步骤运行异常检测器,直到发现可疑物体。然后,TIDEE移动到物品所在的位置并抓取它。第二步涉及TIDEE根据场景图和联合外部图形存储推断物品的可能容器。如果TIDEE尚未识别容器,它将使用视觉搜索网络引导其对区域的探索,并建议容器可能被发现的位置。TIDEE在内存中保留先前识别物体的估计3D质心,并使用此信息进行导航和物体跟踪。 使用商用可用的物体检测器收集每个物品的视觉属性。同时,通过为物体之间的3D关系(如“旁边”,“支持”,“上方”等)提供预训练的语言模型预测,生成关系语言特征。 TIDEE包含一个神经图模块,用于在拾起物体后预测可能的物品放置点子。物品放置、从训练场景中学到的可能的上下文连接的内存图以及编码了当前场景中的物体关系配置的场景图相互作用,使模块能够正常工作。 TIDEE采用光学搜索网络,在障碍物地图中预测每个空间点上物体存在的可能性,给定语义障碍物地图和搜索类别。然后,代理程序查看它认为最有可能包含目标的那些区域。 TIDEE有两个缺点,这两个缺点都是未来研究的明显方向:它没有考虑物品的打开和关闭状态,也没有将它们的3D姿势包括在混乱和重组过程的一部分。 有可能随意散落在房间中的东西所导致的混乱可能不代表真实生活中的混乱。 TIDEE直接从像素和原始深度输入完成任务,而无需事先看到相同的房间,仅使用从不同的训练房屋集合中学习到的先验知识。根据对结果房间布局变化的人类评估,TIDEE的性能优于排除一个或多个常识先验的模型的削弱变体。简化的模型版本在可比较的房间重新布局基准测试中远远优于表现最佳的解决方案,使代理程序能够在重新布局之前观察客观状态。

Leave a Comment

“可能是补丁的原因吗?这种AI方法分析了视觉Transformer成功的关键因素”

卷积神经网络(CNN)一直是计算机视觉任务系统的基础。它们一直是各种问题的首选架构,从目标检测到图像超分辨率。事实上,深度学习领域的著名突破(例如AlexNet)之所以能够实现,得益于卷积神经网络。 然而,当基于Transformer模型的新架构——Vision Transformer(ViT)展示出有希望的结果并在大型数据集上优于经典的卷积架构时,情况发生了变化。从那时起,该领域一直在寻求为多年来使用CNN解决的问题提供基于ViT的解决方案。 ViT使用自注意力层来处理图像,但如果在像素级别上天真地应用,这些层的计算成本将随图像每个像素的数量呈二次倍增。因此,ViT首先将图像分成多个补丁,对其进行线性嵌入,然后直接将Transformer应用于这个补丁集合。 在原始ViT的成功之后,许多工作修改了ViT架构以提高其性能。替换自注意力层、进行其他小的改变等。虽然进行了所有这些改变,几乎所有的ViT架构都遵循一个共同且简单的模板。它们在整个网络中保持相等的大小和分辨率,并表现出各向同性的行为,通过在交替步骤中实现空间和通道混合来实现。此外,所有网络都使用补丁嵌入,这允许在网络开始时进行下采样,并促进了直接和统一的混合设计。 这种基于补丁的方法是所有ViT架构的常见设计选择,简化了整体设计过程。因此,问题就出现了。视觉变换器的成功主要是由于基于补丁的表示吗?还是由于使用了自注意力和MLP等先进且富有表现力的技术?视觉变换器的出色性能主要取决于哪个因素? 有一种方法可以找到答案,它被称为ConvMixer。 ConvMixer概述。来源:https://openreview.net/forum?id=rAnB7JSMXL ConvMixer是一种卷积架构,用于分析ViT的性能。它在许多方面与ViT非常相似:它直接处理图像补丁,在整个网络中保持一致的分辨率,并将通道混合与图像不同部分的空间混合分离开。 然而,关键的区别在于ConvMixer使用标准卷积层来实现这些操作,而不是Vision Transformer和MLP-Mixer模型中使用的自注意力机制。最终,由此得到的模型在计算能力方面更便宜,因为深度卷积和逐点卷积操作比自注意力和MLP层更便宜。 尽管极其简单,ConvMixer在某些参数数量相似的“标准”计算机视觉模型(例如ResNet)以及一些对应的ViT和MLP-Mixer变体之上表现出色。这表明基于补丁的各向同性混合架构是一种功能强大的基本原理,几乎适用于任何良好的混合操作选择。 ConvMixer是一类极其简单的模型,它独立地使用标准卷积来混合补丁嵌入的空间和通道位置。通过使用受ViT和MLP-Mixer大感受野启发的大内核大小,可以实现显著的性能提升。最后,ConvMixer可以作为未来基于补丁的架构的基准。

Leave a Comment

南方科技大学VIP实验室提出了一种名为“轨迹任意模型”(Track Anything Model, TAM)的方法,在视频中实现了高性能的交互式跟踪和分割

视频目标跟踪(VOT)是计算机视觉研究的基石,因为在无约束的环境中追踪未知目标的意义重大。视频对象分割(VOS)是一种类似于VOT的技术,旨在识别视频中感兴趣的区域,并将其与帧的其他部分隔离开来。目前最好的视频跟踪器/分割器是通过分割掩模或边界框启动,并在大规模手动注释的数据集上进行训练的。大量的标记数据一方面隐藏了庞大的人力,另一方面,半监督的VOS在现有的初始化参数下需要一个唯一的对象掩模基本事实。 “任意分割”方法(SAM)是最近开发的用于图像分割的综合基准。得益于其可适应的提示和实时掩模计算,它可以进行交互使用。当以点、框或语言的形式提供用户友好的建议时,SAM可以返回指定图像区域的满意的分割掩模。然而,由于其缺乏时间一致性,研究人员在SAM立即应用于视频时并不看到令人瞩目的性能。 南方科技大学VIP实验室的研究人员介绍了“Track Anything”项目,为视频目标跟踪和分割创造了强大的工具。 Track Anything模型(TAM)具有直观的界面,可以在一次推理中跟踪和分割视频中的任何对象。 TAM是SAM的扩展,是一个大规模分割模型,集成了最先进的VOS模型XMem。用户可以通过交互初始化SAM(即点击对象)定义目标对象;接下来,XMem根据时间和空间对应关系对下一帧中的对象进行掩模预测。最后,SAM提供了更精确的掩模描述;用户可以在跟踪过程中暂停和纠正,一旦注意到跟踪失败。 TAM在TAM的分析中使用了DAVIS-2016验证集和DAVIS-2017测试开发集。最值得注意的是,研究结果表明TAM在具有挑战性和复杂环境中表现出色。TAM可以处理多对象分离、目标变形、尺寸变化和相机运动等问题,展示了在仅点击初始化和一轮推理下的出色跟踪和分割能力。 提出的Track Anything模型(TAM)为自适应视频跟踪和分割提供了多种选择,包括但不限于以下内容: 快速简便的视频转录: TAM可以将电影中的感兴趣区域分离出来,并允许用户选择他们想要跟踪的项目。这意味着它可以用于视频注释,如跟踪和分割视频对象。 长时间观察一个对象:由于长期跟踪在许多现实世界应用中具有重要意义,研究人员对此越来越关注。TAM的现实世界应用更加先进,因为它们可以适应长视频中频繁的镜头变换。 易于使用的视频编辑器: Track Anything模型允许我们将事物分成不同的类别。TAM的对象分割掩模使我们能够选择性地剪切或重新定位电影中的任何对象。 用于可视化和开发视频相关活动的工具箱:团队还为各种视频操作提供了可视化用户界面,包括VOS、VOT、视频修复等,以便于它们的使用。用户可以在真实场景的素材上测试他们的模型,并通过工具箱实时查看结果。

Leave a Comment

厌倦了调整学习率吗?来见识一下DoG:一个简单、无需参数的优化器,具备可靠的理论保证

以色列特拉维夫大学的研究人员提出了一种调整自由动态 SGD 步长的公式,称为梯度距离(Distance over Gradients,DoG),它仅依赖于经验数量,而不需要学习率参数。他们在理论上证明,对 DoG 公式进行轻微变化将导致局部有界的随机梯度收敛。 随机过程需要优化参数,而学习率仍然困难。先前成功的方法包括从先前的工作中选择合适的学习率。像自适应梯度方法这样的方法需要调整学习率参数。无参数优化不需要调整,因为算法被设计为在没有问题先验知识的情况下实现接近最优的收敛速度。 特拉维夫大学的研究人员采用了 Carmon 和 Hinder 的关键见解,并开发了一种无参数步长表。他们表明,在迭代 DoG 时,有很高的概率 DoG 实现了对数收敛速度。然而,DoG 不总是稳定的。它的迭代可能会远离优化。因此,他们使用 DoG 的变体,称为 T-DoG,其中步长比对数因子小。他们获得了一个高概率,确保了收敛性。 与 SGD 相比,他们的结果表明,在余弦步长表和基于调整的学习中,DoG 很少实现相对误差改进超过…

Leave a Comment