Press "Enter" to skip to content

Tag: Technology

认识 Pix2Act:一种可以使用基于像素的屏幕截图和通用键盘和鼠标操作与GUI进行交互的AI代理,其使用与人类通常使用的概念界面相同

通过使用户连接工具和服务,能够遵循图形用户界面(GUI)指令的系统可以自动化繁琐的工作,增加可访问性,并增加数字助手的实用性。 许多基于GUI的数字代理实现都依赖于HTML衍生的文本表示,这些表示并不总是容易获取。人们通过感知视觉输入并使用标准的鼠标和键盘快捷键来使用GUI;他们不需要查看应用程序的源代码来弄清楚程序的工作原理。无论底层技术如何,他们都可以通过直观的图形用户界面快速掌握新的程序。 雅达利游戏系统只是一个例子,说明了一个从仅像素输入中学习的系统可以表现得多么出色。然而,在尝试基于GUI的指令跟随任务时,从仅像素输入中学习时会面临许多障碍,这与通用的低级动作相结合。要对GUI进行视觉解释,必须熟悉界面的结构,能够识别和解释视觉定位的自然语言,识别和识别视觉元素,并预测这些元素的功能和交互方法。 谷歌DeepMind和谷歌介绍了PIX2ACT,这是一个模型,它以基于像素的截屏作为输入,并选择与基本鼠标和键盘控件匹配的操作。研究小组首次证明,一个只有像素输入和通用操作空间的代理可以超过人类众包工作者,并达到使用DOM信息和相当数量的人类演示的最先进代理的性能。 为此,研究人员扩展了PIX2STRUCT。这个基于Transformer的图像到文本模型已经通过大规模在线数据进行了训练,将截图转换为基于HTML的结构化表示。PIX2ACT应用树搜索来反复构建新的专家轨迹进行训练,采用人类演示和与环境的交互的组合。 团队在这里的努力包括创建一个通用的基于浏览器的环境框架,并使用标准的跨域观察和操作格式调整了两个基准数据集MiniWob++和WebShop,以在其环境中使用。使用他们提出的选项(不带DOM的CC-Net),PIX2ACT在MiniWob++上的表现比人类众包工作者高出约四倍。削减实验表明,PIX2STRUCT的基于像素的预训练对PIX2ACT的性能至关重要。 对于基于GUI的指令跟随像素输入,研究结果表明PIX2STRUCT通过屏幕截图解析的预训练的有效性。在行为克隆环境中进行预训练将MiniWob++和WebShop任务得分分别提高了17.1和46.7。尽管与使用基于HTML的输入和任务特定操作的较大语言模型相比仍存在性能劣势,但这项工作为这个环境设置了第一个基准。

Leave a Comment

ETH Zurich 和 HKUST 研究人员提出了 HQ-SAM:通过对原始 SAM 引入可忽略的开销,实现高质量零-shot 分割模型

准确地分割多个对象对于各种场景理解应用非常重要,例如图像/视频处理、机器人感知和AR/VR。最近发布了Segment Anything Model (SAM),这是一个广泛的图像分割基本视觉模型。它使用十亿级别的掩码标签进行训练。SAM可以使用一系列点、边界框或粗略掩码作为输入,在多个上下文中分割各种对象、组件和可视结构。它的零-shot分割能力引发了快速的范式变化,因为它们可以在许多应用程序中仅使用一些基本提示。 尽管其表现出色,但SAM的分割结果仍然需要改进。SAM存在两个重要问题:1)粗糙的掩码边缘,经常遗漏细小物体结构的分割,如图1所示。2)在困难情况下,错误的预测、损坏的掩码或显著的不准确性。这通常与SAM的误读细小结构有关,例如图中右上角的风筝线。基本分割方法(如SAM)的应用和效果受到这些错误的严重限制,特别是对于自动注释和图像/视频编辑作业,其中极其精确的图像掩码至关重要。 图1:比较了SAM和我们的HQ-SAM的预测掩码,使用了单个红色框或对象上的多个点的输入提示。具有极其精确边界的HQ-SAM生成明显更详细的结果。在最右边的一列中,SAM误读了风筝线的细小结构,并为输入框提示生成了大量的错误和破损孔。 来自苏黎世联邦理工学院和香港科技大学的研究人员建议HQ-SAM,它保持了原始SAM的强大零-shot能力和灵活性,同时能够预测非常准确的分割掩码,即使在极其困难的情况下(参见图1)。他们建议对SAM进行小的调整,添加少于0.5%的参数,以增加其高质量分割的能力,同时保持效率和零-shot性能。直接调整SAM解码器或添加新的解码器模块会对零-shot分割的一般布局造成严重的影响。因此,他们建议HQ-SAM设计完全保留零-shot效率,与并重用当前学习的SAM结构相集成。 除了原始提示和输出令牌外,他们还创建了一个可学习的HQ-Output Token,馈送到SAM的掩码解码器中。与原始输出令牌相比,他们的HQ-Output Token及其相关的MLP层被教授预测高质量的分割掩码。其次,他们的HQ-Output Token在改进的特征集上运行,以生成精确的掩码信息,而不仅仅是使用SAM的掩码解码器功能。他们将SAM的掩码解码器特征与其ViT编码器的早期和晚期特征图结合使用,以使用全局语义上下文和细粒度的本地特征。 在训练期间,完整的预训练SAM参数被冻结,只更新HQ-Output Token、相关的三层MLP和一个小型特征融合块。学习准确分割所需的是一个具有复杂几何形状的各种对象的精确掩码注释的数据集。使用11M张照片和类似于SAM的模型自动创建的1.1亿个掩码的SA-1B数据集来训练SAM。然而,图1中SAM的性能表明,使用这个大型数据集具有重大的经济后果。它无法产生研究所需的高质量掩码生成。 因此,他们创建了HQSeg-44K,一个新的数据集,包括44K个高精度细粒度图像掩码注释。他们将六个现有的图像数据集与非常精确的掩码注释结合起来,以创建HQSeg-44K,涵盖了1000多个不同的语义类别。由于数据集较小,以及他们简单的集成设计,HQ-SAM可以在8个RTX 3090 GPU上进行训练,时间不到4小时。他们进行了严格的定量和定性实验研究,以验证HQ-SAM的有效性。 他们在来自各种下游任务的九个不同分割数据集上将HQ-SAM与SAM进行了比较,其中有七个在零-shot转移协议下,包括COCO、UVO、LVIS、HQ-YTVIS、BIG、COIFT和HR-SOD。这一彻底的分析表明,与SAM相比,所提出的HQ-SAM可以制造出更高质量的掩模,同时仍具有零-shot能力。他们的GitHub页面上有一个虚拟演示。 通过引入对原始SAM的可忽略开销,他们提出了第一个高质量的零-shot分割模型。 查看论文和GitHub。不要忘记加入我们的23k+ ML SubReddit、Discord频道和电子邮件通讯,在这里我们分享最新的AI研究新闻、酷炫的AI项目等等。如果您对上述文章有任何问题或我们漏掉了任何东西,请随时发送电子邮件至Asif@marktechpost.com 查看AI工具俱乐部中的100个AI工具 这篇文章最初发表在MarkTechPost上。

Leave a Comment

Google研究人员推出了StyleDrop:一种人工智能方法,可以使用文本到图像模型忠实地追随特定样式来合成图像

谷歌的一组研究人员最近与 Muse 的快速文本到图像模型合作开发了创新的神经网络 StyleDrop。这项开创性的技术允许用户生成忠实地体现特定视觉风格的图像,捕捉细微的差别和复杂性。通过选择具有所需风格的原始图像,用户可以将其无缝地转移到新图像,同时保留所选择的风格的所有独特特征。StyleDrop 的多功能性还可用于与完全不同的图像一起使用,使用户能够将儿童绘画转换成风格化的标志或角色。 StyleDrop 由 Muse 先进的生成视觉转换器驱动,使用用户反馈、生成图像和 Clip 分数的组合进行训练。神经网络是通过最小的可训练参数进行微调的,仅占总模型参数的不到 1%。通过迭代训练,StyleDrop 不断提高生成图像的质量,确保在短短几分钟内获得令人印象深刻的结果。 这个创新工具对于寻求开发其独特视觉风格的品牌来说是非常宝贵的。有了 StyleDrop,创意团队和设计师可以高效地以其所偏爱的方式原型设计想法,使其成为不可或缺的资产。对 StyleDrop 的性能进行了广泛的研究,将其与其他方法(如 DreamBooth、Imagen 上的文本反转和 Stable Diffusion)进行了比较。结果一致展示了 StyleDrop 的卓越性,提供了高质量的图像,紧密地符合用户指定的风格。 StyleDrop 的图像生成过程依赖于用户提供的基于文本的提示。StyleDrop…

Leave a Comment

CMU研究人员推出ReLM:一种使用标准正则表达式验证和查询LLM的人工智能系统

尽管被广泛赞誉为能够生成自然语言文本的能力,但大型语言模型(LLMs)存在数据记忆、偏见和不适当语言等潜在负面影响,这引起了人们对其潜在负面影响的担忧。由于LLMs的复杂性和不断发展的能力,验证和纠正这些担忧是具有挑战性的。在这项研究中,作者提出了ReLM,这是一个通过传统的正则表达式检查和查询LLMs的系统。通过ReLM,许多语言模型评估可以通过将复杂的评估方法简化为正则表达式查询来形式化和实现。 通过对记忆、性别偏见、毒性和语言理解的查询结果,ReLM可以将统计和快速调整覆盖范围扩展到比最先进的即席搜索多达15倍。对于日益增长的LLM验证挑战,ReLM提供了一个有竞争力和广义的起点。 ReLM是第一个允许从整体上描述测试模式集合以直接测量LLM行为的解决方案。ReLM的成功源于使用解空间的紧凑图形表示,该解空间是从正则表达式导出的,然后在执行之前被编译成LLM特定的表示。因此,用户不需要熟悉LLM的内部工作方式;测试产生的结果与如果所有可能的字符串存在于现实世界中一样。除了建立ReLM之外,作者还展示了如何在各种LLM评估任务中使用字符串模式。 Python用户程序可以使用ReLM框架;ReLM公开了这些程序可以使用的特定API。要使用ReLM,软件需要发送一个查询对象和在第三方库(如Hugging Face Transformers(Wolf等,2020))中定义的LLM。正则表达式、LLM决策规则和遍历算法都存储在查询对象中。 在编写代码的同时,ReLM的用户可以将验证任务分为两个部分: 使用正则表达式正式描述一组字符串的子集。 引导引擎通过字符串枚举和评估的过程。 研究人员表明,ReLM可以快速、表达地执行常见查询,从而显著减少LLMs所需的验证工作量。最重要的是: 形式上概述了将正则表达式应用于LLM预测。与可数的多项选择问题不同,正则表达式可以描述具有不确定大小的集合。与有时会产生模糊响应的开放式问题相比,ReLM的结果始终是清晰的。 识别和构建了LLM推理查询的条件和无条件类别。许多令牌序列可以表示一个固定的查询字符串,这激发了一种压缩表示的方法,因为学者在研究无条件生成时已经证明了这一点。他们是第一组使用自动机来容纳这些变体编码的人。 设计和实现了一个有效将正则表达式转换为有限自动机的正则表达式推理引擎。研究人员使用了最短路径和随机图遍历,实现了具有竞争力的GPU利用率和运行时间(几秒钟)。 作者使用GPT-2模型说明了在LLM验证的上下文中,ReLM在评估记忆、性别偏见、毒性和语言理解任务方面的价值。 更多细节可在https://github.com/mkuchnik/relm中找到。 最后 由于自然语言的复杂性和LLMs的不断增长,验证大型语言模型(LLMs)的抽象性变得越来越必要。为了使用LLMs执行验证任务,研究人员提出了ReLM,这是第一个可编程框架。使用ReLM,您可以在正则表达式中编写逻辑查询,然后将其转换为LLM语言中的可执行形式。ReLM可以以比以前的方法节省2.5倍的数据,或以比以前的方法快15倍,或以提供额外见解的方式运行记忆、性别偏见、毒性和语言理解任务。虽然ReLM的结果强烈反对依赖即席LLM验证,但系统地解决这些问题引入了其他困难(例如,从左到右的自回归解码有利于后缀完成)。我们的长期目标包括提高ReLM的查询优化能力并将其带到更多模型系列中。

Leave a Comment

了解PRODIGY:一种预训练AI框架,可在图形上进行上下文学习

GPT模型是OpenAI开发的ChatGPT聊天机器人背后的变压器架构,它基于通过仅几个例子学习任务的概念。这种称为上下文学习的方法,使模型避免了使用数千个输入文本进行微调,只使用特定于任务的示例作为输入就能学习在不同任务上表现良好。针对特定任务微调模型可能非常昂贵,因为GPT是一个具有数十亿参数的“大”语言模型,由于在微调期间需要更新所有模型参数,因此相对而言成本较高。 上下文学习在代码生成、问答、机器翻译等方面得到了有效应用,但在图机器学习任务中仍然存在局限性和挑战。一些图机器学习任务包括识别在社交网络上传播半真半假或虚假新闻的传播者和跨电子商务网站的产品推荐。上下文学习在制定和建模这些任务的过程中面临局限性,无法形成和建模统一的任务表示,使模型能够处理各种任务而无需重新训练或参数调整。 最近,一组研究人员在其研究论文中介绍了PRODIGY,这是一个预训练框架,可实现在图形上下文中学习。PRODIGY(Pretraining Over Diverse In-Context Graph Systems)使用提示图表示形式来制定上下文学习。提示图作为上下文图任务表示,集成了节点、边缘和图级机器学习任务的建模。提示网络将输入节点或边缘与其他标签节点连接,并对提示示例和查询进行上下文化。这种互连表示允许指定各种图形机器学习任务到同一模型中,而不受图形大小的限制。 由斯坦福大学和卢布尔雅那大学的研究人员提出,团队设计了一种图形神经网络架构,专门用于处理提示图,并有效地对图结构化数据进行建模和学习。所提出的设计利用GNN教授提示图的节点和边缘的表示。此外,还引入了一系列上下文预训练目标,以指导学习过程,提供监督信号,使模型能够捕获相关的图形模式并在不同的任务中进行推广。 为了评估PRODIGY的性能和有效性,作者在涉及引文网络和知识图的任务上进行了实验。引文网络代表科学论文之间的关系,而知识图则捕获有关不同领域的结构化信息。使用上下文学习对预训练模型进行了测试,并将结果与硬编码适应性的对比预训练基线和使用有限数据的标准微调进行了比较。PRODIGY在准确性方面平均优于对比预训练基线的硬编码适应性18%。当应用上下文学习时,与标准微调相比,平均提高了33%。 总之,PRODIGY在基于图形的场景中似乎很有前途,如图机器学习应用中的上下文学习。它甚至可以在以前未见过的图形上执行下游分类任务,使其更加有效和有益。

Leave a Comment

英国领先:举办首届全球人工智能峰会

随着人工智能(AI)的快速发展,世界面临着机遇和挑战。英国首次全球人工智能安全峰会的举办是一个史无前例的举措。英国首相里希·苏纳克于6月7日星期三宣布了这一开创性事件。这次峰会旨在解决负责任的AI发展的紧迫需求,确保技术的安全和负责任的利用。让我们深入了解这次历史性峰会的细节及其对未来的影响。 改善生活的AI突破 人工智能已经展示了其显著改善我们生活的能力。AI的突破正在革新各个领域,从通过机器人外骨骼使瘫痪的人重新行走到发现能够对抗以前无法治疗的超级病菌的救生抗生素。这些进展证明了人工智能在积极地改变我们的世界的巨大潜力。 灵活领导的必要性 AI的发展速度异常快,需要灵活的领导来引导其快速发展。英国承认其全球责任,确保AI技术的负责任和安全的发展。随着领先的专家最近警告AI的潜在危险,这被认为是与大流行病或核武器相当的紧迫问题,因此有必要全面解决AI的安全问题。 揭开首届全球人工智能安全峰会的面纱 首届全球人工智能安全重要国际峰会计划于今年秋季在英国举行,将汇集全球专家。峰会旨在讨论和评估与AI相关的风险,包括前沿系统。它还计划通过国际协调行动制定减轻这些风险的策略。此外,峰会将为各国提供平台,以协作和制定确保负责任和安全开发和利用AI的共同方法。 英国在AI安全方面的领导地位 英国通过与全球领导人和行业专家的各种倡议和讨论,展示了其对AI安全的承诺。在全球AI排名中,英国排名第三,仅次于美国和中国,其AI行业对其经济做出了巨大贡献。它创造了37亿英镑的收入,并在全国范围内雇用了50,000人。此外,英国脱离欧盟赋予其更大的灵活性和敏捷性,以应对快速变化的AI格局。 还阅读:中国提出的人工智能法规震动了行业 推动国际合作,实现更安全的未来 英国认识到,没有一个国家能够单独应对AI的挑战,强调志同道合的盟友和公司共同合作的重要性。峰会将促进讨论,以制定国际框架,以确保AI的安全可靠的开发和利用。英国旨在在未来发挥关键作用,其中负责任和安全至关重要。 还阅读:欧盟呼吁采取措施识别Deepfakes和AI内容 加强英美科技关系 作为加强英美关系的一部分,英国首相将会见拜登总统,讨论各种话题,包括技术。值得注意的是,英国和美国是全球仅有的三个科技产业价值超过1万亿美元的国家之一。他们世界著名的大学和研究机构进一步增强了他们在技术发展方面的领导地位。 还阅读:战场革命:英国,美国,澳大利亚通过AI无人机试验推动边界 投资未来的AI领袖 为了培养STEM学科的专业知识和鼓励国际合作,英国政府计划增加在英国和美国大学的研究生学习和研究的奖学金数量。70年前成立的马歇尔奖学金将增加25%,为高潜力的美国学生提供在英国学习两年的机会。此外,英国每年将资助五个新的富布莱特奖学金,促进AI和其他领域的知识交流和合作。 我们的看法 英国举办首届全球人工智能安全峰会,迈出了朝着负责任的AI驱动的未来的重要一步。这一开创性事件突显了英国优先考虑负责任的AI发展并认识到国际合作的必要性。首相表示,这次峰会将成为一个全球合作和创新平台。他补充说,该事件旨在确保AI使人类受益,同时维护安全和伦理考虑。随着英国站在最前沿,这次峰会标志着国际合作的新时代。它为未来奠定了基础,使AI的进步在积极地改变我们的生活的同时保障我们的共同福祉。

Leave a Comment

BYJU’s使用人工智能来量身定制您的教育旅程

印度领先的教育科技公司BYJU’s最近推出了BYJU’s WIZ,这是一套革命性的AI模型,旨在彻底改变学习体验。该套件包括三个不同的组件——BADRI、MathGPT和TeacherGPT。该套件旨在提供超个性化的学习体验,同时强调教师在教育中的持续重要性。BYJU’s WIZ利用人工智能的力量来识别个人的优势和劣势,提供准确的解决方案来解决复杂的数学难题,并促进独立解决问题的能力。让我们深入了解这个具有突破性的发展,它承诺重新塑造教育。 还阅读:教育中的生成AI:汗学院的案例研究 介绍BYJU’s WIZ:AI模型套件 BYJU’s WIZ引入了三个卓越的AI模型,旨在重新定义个性化学习的格局。该套件包括BADRI,这是一种AI模型,利用个性化的“遗忘曲线”全面分析学生的优势和劣势。MathGPT利用先进的机器学习算法来解决复杂的数学问题,包括具有挑战性的三角形证明。最后,TeacherGPT是一种AI驱动的助手,提供个性化的指导,培养独立解决问题的能力。 重新定义个性化学习 BYJU’s自豪地宣布,其AI模型的准确率接近90%。通过利用公司庞大的数据仓库和现有的模型,BYJU’s WIZ为每个学生创建了一种沉浸式和定制化的学习体验。与传统的“一刀切”的方法不同,WIZ预测学生的知识状态,识别误解和学习差距,并提供个性化的学习路径。这增强了学生的参与度和效果,并优化了内部系统,如教师审计。 还阅读:人类训练的AI模型对于训练人类有多好? 协作方式:教师与AI共同进步 BYJU’s WIZ是BYJU’s实验室的研究人员、数据科学家和教育专家共同努力的结果。团队非常注意确保AI模型的安全、可靠,并与课程密切对齐。虽然整合AI技术旨在增强组织的效率,但它绝不是要取代教师。相反,AI通过提供精确的反馈来增强教师的效果,使他们更好地协助学生的学习之旅。 教师是不可替代的导师 BYJU’s联合创始人Divya Gokulnath强调,将AI技术整合到教育中并不意味着要降低教师的作用。相反,AI技术作为支持和增强教师效果的工具。 Gokulnath坚定地表示,没有任何AI可以复制教师在视频课程、现场课程或补习中带来的人性化触感和专业知识。目标是为教师提供有价值的见解和反馈,让他们更有效地指导学生。 还阅读:教育合作伙伴呼吁将AI整合到学校课程中 技术和教师:协作伙伴关系 Gokulnath强调,技术和教师之间的关系不是竞争,而是协作。通过利用AI,教师可以更有效地培养学生的学习能力。教室中教师的存在对于学生的全面发展仍然至关重要。Gokulnath确认,即使在先进技术时代,教师的人性化触感、关注和指导也是不可替代的。 我们的观点 BYJU’s WIZ是一套用于个性化学习的AI模型,它开启了教育的新时代。通过BADRI、MathGPT和TeacherGPT,BYJU旨在通过提供量身定制的学习路径和准确的解决方案来改变学习体验。了解到AI模型旨在支持和赋予教师权力,而不是取代他们,这一点至关重要。教师可以通过协作的方式利用AI获得有价值的见解和反馈,确保每个学生都能获得最好的教育。在BYJU’s…

Leave a Comment

萨姆·阿特曼与印度总理纳伦德拉·莫迪的高风险会晤:规划印度的人工智能未来

OpenAI的创始人兼CEO Sam Altman于6月7日星期三抵达印度,作为其覆盖六个国家的国际之旅的一部分。在访问期间,Altman抓住了一个关键机会,与印度总理纳伦德拉·莫迪会面,讨论印度在人工智能革命方面的立场,并探索互利途径。让我们深入了解这次具有里程碑意义的会面的细节。 弥合差距:Sam Altman会见总理Narendra Modi OpenAI的CEO Sam Altman抵达印度,以了解该国如何拥抱人工智能革命。与印度总理纳伦德拉·莫迪的会晤是他此次访问期间备受期待的事件。这次会晤旨在交换有关印度人工智能领域的见解,并探索合作机会。它还探讨了减少负面影响的潜在需要的问题。 图片来源:moneycontrol 导航人工智能监管:观点汇聚 会晤的意义进一步提高,因为它与印度通过即将出台的数字印度法案来规范人工智能的努力相吻合。阿尔特曼和莫迪总理就印度的人工智能监管方法进行了有益的讨论。虽然印度政府的立场可能与阿尔特曼的倡导不同,但这次会晤提供了一个机会来弥合全球观点和印度特定需求之间的差距。 还要阅读:中国提出的人工智能监管震动了行业 抓住机遇:探索印度的人工智能潜力 在他们的互动中,阿尔特曼强调了印度在人工智能领域呈现的广阔机遇。阿尔特曼和莫迪总理探讨了利用人工智能技术推动印度创新、经济增长和社会发展的潜在途径。讨论涵盖了该国的人工智能计划以及它在将印度定位为全球人工智能中心方面可能发挥的作用。 还要阅读:印度将在G20提出基于人工智能的中小企业门户网站:对小企业来说是一个改变游戏规则的举措 全球合作:解决缺点和监管问题 在他的讲话中,阿尔特曼强调了全球合作在解决人工智能技术潜在缺陷方面的重要性。OpenAI的CEO强调需要深思熟虑的监管,以确保负责任的发展并防止意外后果。会晤为讨论全球监管框架提供了一个平台,承认平衡创新和保障的必要性。 还要阅读:英国领先:举办首届全球人工智能峰会 紧张的日程:阿尔特曼在印度的会议 阿尔特曼访问印度,包括一个充满战略性的会议和活动的繁忙日程。除了与莫迪总理的会晤外,阿尔特曼还与政府官员、思想领袖和行业专家接触,深入探讨印度人工智能领域的各个方面。讨论围绕着印度著名的人工智能计划、人工智能在关键领域的作用以及释放该国人工智能潜力的潜在合作展开。 还要阅读:“我们将解决幻觉问题”,Sam Altman表示 我们的看法 OpenAI的CEO…

Leave a Comment