Press "Enter" to skip to content

Month: September 2023

OpenAI发布了ChatGPT Enterprise,搭载GPT-4的强大功能

OpenAI,先驱性的人工智能研究组织,刚刚在人工智能领域引入了一个令人兴奋的新篇章 – ChatGPT Enterprise。在其前身病毒性成功的基础上,这个尖端人工智能聊天机器人承诺将彻底改变企业与技术互动的方式。以增强的隐私、前所未有的速度和先进的功能为重点,ChatGPT Enterprise将重新定义企业人工智能解决方案的格局。 另请阅读:Microsoft Azure推出面向企业人工智能的ChatGPT 企业人工智能的新曙光 为了满足对复杂人工智能解决方案不断增长的需求,OpenAI推出了ChatGPT Enterprise。他们广受欢迎的AI聊天机器人的这个版本经过精心设计,以满足渴望隐私和性能完美融合的企业的独特需求。与其前身不同,ChatGPT Enterprise不仅仅是兑现了其承诺 – 它更进了一步。 另请阅读:VMware和NVIDIA合作革新企业生成型人工智能 ChatGPT Enterprise的威力 加固的安全和隐私:在数据隐私的关注下,ChatGPT Enterprise大步迈进,提供企业级安全和隐私功能。企业现在可以利用人工智能技术,同时保护其敏感信息免受窥视。 高速GPT-4访问:速度对于企业界至关重要。ChatGPT Enterprise秉承这一理念,提供闪电般快速的GPT-4访问。这个强化版聊天机器人确保快速响应,让团队在更短的时间内取得更多成果。 扩展上下文窗口:复杂的输入需要全面的上下文。ChatGPT Enterprise拥有扩展的上下文窗口,使其能够处理更长的输入。告别内容截断,迎接无缝交互。 高级数据分析能力:理解数据是决策的基石。ChatGPT Enterprise赋予企业先进的数据分析能力。从生成图表到解决复杂数学问题,这个功能对于数据驱动的组织来说是一个改变游戏规则的因素。 定制个性化:每个企业都有其独特的需求。OpenAI认识到这一点,并为ChatGPT…

Leave a Comment

S-Lab和NTU研究人员提出了Scenimefy:一种新颖的半监督图像到图像翻译框架,用于从现实世界图像生成高质量动漫场景渲染,填补了自动化方面的差距

动漫场景需要大量的创造才能和时间来创作。因此,基于学习的自动场景风格化方法的发展具有不可否认的实际和经济意义。由于生成对抗网络(GANs)的最新进展,自动风格化已经显著改善,但大部分研究仍主要集中在人脸上。尽管其巨大的研究价值,但从复杂的现实世界场景照片中创建高质量的动漫场景的过程仍然需要研究。由于几个因素,将现实世界的场景照片转换为动漫风格需要大量的工作。 1)场景的构图:图1说明了场景中前景和背景部分之间的层次关系,这些场景通常由几个以复杂方式连接的物品组成。 2)动漫的特点:图1显示了如何在草地、树木和云等自然环境中使用预设计的笔触来创建独特的纹理和精确的细节,这些纹理的有机和手绘特性使它们比之前的实验中的清晰边缘和均匀色块更具挑战性。 3)数据短缺和领域差距:高质量的动漫场景数据集对于弥合现实和动漫场景之间的差距至关重要。由于人脸和其他前景物品的大量存在,现有数据集质量较低,其美学与背景景观不同。 图1:动漫场景特点。在新海诚的2011年电影《追逐失落的声音的孩子们》中,可以看到草地和石头(前景)以及树木和云(背景)的手绘笔触,与清晰的边缘和平面表面形成鲜明对比。 无监督的图像转换方法是一种用于复杂场景风格化的流行方法,不需要配对的训练数据。尽管显示出有希望的结果,但现有的专注于动漫风格的技术在几个方面仍需改进。首先,复杂场景中缺乏像素级的相关性使得现有方法难以执行明显的纹理风格化同时保持语义含义,可能导致输出结果异常并包含明显的伪影。其次,某些方法无法产生动漫场景的精细细节。这是由于它们构建的动漫特定损失或预提取的表示,这些损失强制执行边缘和表面的平滑性。 为解决上述问题,南洋理工大学的S-Lab研究人员提出了Scenimefy,这是一种用于创建高质量动漫风格场景图片的独特的半监督图像转换流程。他们的主要建议是使用生成的伪配对数据将新的监督训练分支引入无监督框架,以解决无监督训练的缺点。他们利用StyleGAN的优势特性,通过对其进行微调,提供了真实和动漫之间的粗略配对数据或伪配对数据。 图2显示了Scenimefy生成的动漫场景渲染。上排:翻译后的图片;下排:翻译结果。 他们提供了一种全新的语义约束微调方法,利用了CLIP和VGG等丰富的预训练模型先验知识,指导StyleGAN捕捉复杂场景细节并减少过拟合。为了过滤低质量的数据,他们还提供了一种基于分割的数据选择技术。通过使用伪配对数据和独特的基于补丁的对比风格损失,Scenimefy在两个领域之间创建了细节,并学习了有效的像素级对应关系。他们的半监督框架在场景风格化的忠实性和保真度以及无监督训练分支之间寻求了一种理想的平衡。 他们还收集了一组高质量的纯动漫场景数据集来辅助训练。他们进行了大量测试,展示了Scenimefy的有效性,超越了行业对感知质量和定量评估的基准。以下是他们的主要贡献概述: • 他们提供了一个全新的、半监督的场景风格化框架,将实际照片转换为优质的动漫场景图像。他们的系统添加了独特的分块对比风格损失,以增强风格化和细节。 • 通过丰富的预训练先验指导,结合分割引导的数据选择方案,他们开发了一个新的语义约束的StyleGAN微调技术,产生了结构一致的伪配对数据,作为训练监督的基础。 • 他们收集了一组高分辨率的动漫场景,以辅助未来对场景风格化的研究。

Leave a Comment

AI的优势:在NVIDIA Canvas、Blender、TikTok和CapCut中提升创意工作流程

编辑的话:本文是我们每周的”NVIDIA工作室系列”的一部分,该系列庆祝精选艺术家,提供创意技巧,展示NVIDIA工作室技术如何改进创意工作流程。我们还深入研究了新的GeForce RTX 40系列GPU功能、技术和资源,以及它们如何显著加速内容创作。 艺术形式的美丽和非凡之处可以让人忘记创意领域中内容创作带来的简单快乐和舒适逃避。 本周的”NVIDIA工作室系列”的主人公Janice K. Lee,即Janice.Journal,是一位使用人工智能加速创作过程、寻找灵感和自动化重复任务的TikTok之星。 https://blogs.nvidia.com/wp-content/uploads/2023/08/week72-nvidia-bts-video-1280w-2.mp4   此外,本周NVIDIA工作室技术为一些最受欢迎的移动和桌面应用程序提供动力,推动了有抱负的艺术家和创意专业人士的创作工作流程。 TikTok和CapCut,由NVIDIA和云端驱动 逐周,人工智能在内容创作中变得越来越普遍。 以热门社交媒体应用程序TikTok为例。其中包括AI绿屏在内的所有移动应用程序功能都由云端的GeForce RTX GPU加速。TikTok创作者工作流程的其他部分也得到了加速 —— 受欢迎的生成式AI视频编辑应用Descript AI在最新的NVIDIA L4 Tensor Core GPU上运行速度比T4 Tensor Core GPU快50%。…

Leave a Comment

使用SynthID识别人工智能生成的图像

今天,我们与谷歌云合作,正式推出SynthID,一款用于给AI生成的图像添加水印和识别的新工具它将首先在限定数量的Vertex AI客户中使用Imagen进行测试,Imagen是我们最新的文本到图像模型之一,它可以根据输入的文本生成逼真的图像这项技术将数字水印直接嵌入图像的像素中,对人眼来说几乎不可察觉,但可以用于识别虽然生成式人工智能可以释放巨大的创造潜力,但也带来了新的风险,比如创作者故意或无意地传播虚假信息能够识别AI生成的内容对于赋予人们知识,让他们了解何时与生成媒体进行交互,以及防止虚假信息的传播至关重要

Leave a Comment

企业如何利用人工智能(AI)、物联网(IoT)、增强现实/虚拟现实(AR/VR)实现企业可持续发展目标

“工业4.0企业和制造商一直在寻求帮助实现可持续发展目标和减少排放的众多技术这些技术包括自动化、传感器技术、物联网和无线连接因此,整个行业和制造商现在可以生成、收集、跟踪和分析大量数据,这些数据是人工智能的基础”

Leave a Comment

2023年找工作要具备的前十个人工智能技能

人工智能(AI)是技术领域中表现出色且充满机遇的领域之一。无论您目前的技能水平如何,要在AI领域找到工作并不容易,尤其是当招聘人员一直在寻找熟练的候选人时。提升技能并转行有很大且容易的可能性。因此,成为一名顶级AI技术人员需要激情和努力。本文介绍了能够构建您的AI技能,使您成为一流AI公司潜在候选人的顶级分支。 什么是AI技能? AI技能包括一系列设计、开发和实施人工智能解决方案所需的能力和专业知识。这些技能包括熟练掌握Python等编程语言、机器学习算法、神经网络、自然语言处理、数据预处理、数据可视化、强化学习、数据分析、问题解决和伦理考虑。AI技能使专业人士能够创建能够学习、适应和执行类似人类智能的任务的智能系统,推动各行各业的技术进步。 前十个AI技能 以下是前十个AI技能及其子技能的列表: 了解AI领域 熟练掌握编程语言 精通机器学习 数据预处理和分析 深度学习和神经网络 自然语言处理(NLP)技能 计算机视觉熟练 AI伦理和偏见意识 云和AI部署 持续学习和适应 了解AI领域 人工智能是一个多学科平台,拥有各种分支,每个分支都具有不同的功能,可以将人类的知识和行为模拟到机器中。AI应用广泛应用于汽车、航空航天工程、生物技术、生物信息学、医疗保健等行业。 从基础到高级,开始掌握概念,以便将您的AI技能定制到AI的专门领域。一些主要的AI分支包括: 机器学习:作为人工智能的基础,它使用算法从数据中学习并随着时间的推移增强功能。 自然语言处理(NLP):人工智能的一个分支,使机器能够模仿和解释人类语言。 机器人技术:将人工智能与工程学相结合,生成可以自主运行的模型或机器。 计算机视觉:人工智能可以帮助识别和理解视觉信息。 熟练掌握编程语言 在AI领域,有几种编程语言专门用于生成算法和设计模型。编程语言的能力使机器能够可视化、吸收和反映,从而使智能系统栩栩如生。 在AI中使用各种编程语言来完成不同的任务,例如:…

Leave a Comment

遇见DevOpsGPT:一种将LLM与DevOps工具结合起来,将自然语言需求转化为可工作软件的多智能体系统

DevOpsGPT将大型语言模型(LLM)和DevOps工具结合起来,为软件开发提供了一个以人工智能驱动的自动化解决方案。DevOpsGPT可以将自然语言表达的需求转化为功能软件,从而提高效率,减少周期时间和降低沟通成本。 DevOpsGPT的工作原理 DevOpsGPT开始处理自然语言描述的用户需求。可以通过文本、语音和代码等多种方式输入这些规格。DevOpsGPT利用其LLM,在消费了这些规格后生成符合规格的代码。然后使用DevOps技术检查所创建的代码是否有错误,并确保满足用户的需求。有关详细信息,请访问GitHub页面。 主要特点 DevOpsGPT不仅提供以下优点,还提供以下优势和功能: DevOpsGPT支持多种编程语言,可以创建Python、Java、C++等代码。 DevOpsGPT具有适应性,可以根据任何企业的独特需求进行定制。 DevOpsGPT的可扩展性意味着它可以用于自动化大型公司的软件开发。 DevOps-GPT的好处 DevOpsGPT能够自动化多个软件开发过程,包括需求收集、文档编制和代码生成,从而提高生产力。这可以极大地提高开发生产力,并为开发人员提供更具创造性和战略性的工作机会。 通过自动化许多通常会减慢开发进程的流程,DevOpsGPT可以帮助缩短开发周期。因此,新的软件功能和产品可以更快地面向消费者。 DevOpsGPT能够将自然语言需求转化为代码的自动化过程,减少沟通成本。因此,在开发过程中更容易避免混淆和误解。 DevOpsGPT的自动代码检查功能有助于整个软件交付过程的质量。这有助于在开发的早期阶段发现和修复缺陷,从而得到更高质量的软件,并降低在生产环境中出现故障的风险。 限制 虽然DevOpsGPT提供了许多优势,但也有一些缺点。 DevOpsGPT仍在不断发展中,因此其正确性会随着需求的变化而改变。 DevOpsGPT可能不像人类开发人员那样具有创造力,因此可能需要帮助解决新问题。 DevOpsGPT应谨慎使用,因为它可能被滥用用于创建恶意代码。 DevOpsGPT是一种前沿的新解决方案,可以帮助企业提高开发生产力,缩短迭代时间,并减少沟通成本。通过自动化重复的操作,DevOpsGPT使程序员能够更多地投入战略性和创造性的工作中。这可以提高软件交付质量,并缩短推出新功能和产品的时间。

Leave a Comment

“遇见DenseDiffusion:一种无需训练的人工智能技术,用于解决文本到图像生成中的密集描述和布局操作问题”

最近,文本到图像模型的进展使得能够根据简短的场景描述生成高质量图像的复杂系统成为可能。然而,这些模型在面对复杂的标题时遇到困难,通常导致不同对象的视觉属性的遗漏或混合。在这一背景下,“密集”一词源于密集字幕的概念,其中利用单独的短语来描述图像中的特定区域。此外,用户在仅使用文本提示的情况下,在生成的图像中精确指定元素的排列也面临挑战。 最近的几项研究提出了通过训练或改进基于布局的文本到图像模型的解决方案,以赋予用户空间控制能力。虽然像“Make-aScene”和“Latent Diffusion Models”这样的特定方法从头开始构建具有文本和布局条件的模型,但其他同时进行的方法,如“SpaText”和“ControlNet”,通过微调将附加的空间控制引入现有的文本到图像模型。不幸的是,训练或微调模型可能需要大量计算资源。此外,模型需要为每个新颖的用户条件、领域或基本文本到图像模型重新训练。 基于上述问题,提出了一种名为DenseDiffusion的新型无训练技术,以适应密集字幕并提供布局操作。 在介绍主要思想之前,让我简要回顾扩散模型的工作原理。扩散模型通过顺序去噪步骤生成图像,从随机噪声开始。噪声预测网络估计添加的噪声并尝试在每个步骤中呈现更清晰的图像。最近的模型通过减少去噪步骤的数量,以更快的速度生成结果,而不会显著损害生成的图像。 最先进的扩散模型中有两个重要的模块,即自注意力和交叉注意力层。 在自注意力层中,中间特征还可以作为上下文特征。这通过在不同区域涵盖图像令牌之间建立连接来实现全局一致的结构的创建。同时,交叉注意力层根据从输入文本标题中获取的文本特征进行自适应,使用CLIP文本编码器进行编码。 回到主题上,DenseDiffusion的主要思想是修订的注意力调节过程,如下图所示。 首先,对预训练的文本到图像扩散模型的中间特征进行审查,以揭示生成图像的布局与自注意力和交叉注意力图之间的显著相关性。根据这一见解,基于布局条件动态调整中间注意力图。此外,该方法还考虑了原始注意力评分范围,并根据每个区域的面积微调调节程度。在展示的工作中,作者展示了DenseDiffusion提高了“稳定扩散”模型的性能,并在密集字幕、文本和布局条件以及图像质量方面超过多个组合扩散模型。 以下图片显示了从研究中选择的样本结果。这些视觉效果提供了DenseDiffusion和最先进方法之间的比较概述。 这是DenseDiffusion的概要,这是一种新的无训练的AI技术,用于适应密集字幕并在文本到图像合成中提供布局操作。

Leave a Comment

谷歌研究人员介绍了RO-ViT:一种简单的人工智能方法,以区域感知的方式预训练视觉变换器,以提高开放词汇检测能力

近年来的进步使计算机能够像人类视觉一样解释和理解来自世界的视觉信息。它涉及处理、分析和从图像和视频中提取有意义的信息。计算机视觉使需要视觉解释的任务自动化,减少了手动干预的需要。目标检测是一项计算机视觉任务,涉及在图像或视频帧中识别和定位多个感兴趣的对象。 目标检测的目标是确定场景中存在哪些对象,并提供关于它们在图像中的位置的信息。大多数现代目标检测器依赖于区域和类别标签的手动注释,这限制了它们的词汇量大小,并使进一步扩展变得昂贵。 与此相反,可以使用视觉语言模型(VLM)来填补图像级预训练和对象级微调之间的差距。然而,在这些模型的预训练过程中,需要充分利用对象/区域的概念。 Google Brain的研究人员提出了一种简单的模型来填补图像级预训练和对象级微调之间的差距。他们提出了区域感知开放词汇视觉变换器(RO-ViT)来完成这个任务。 RO-ViT是一种简单的方式,以区域感知的方式预训练视觉变换器,用于开放词汇对象检测。标准的预训练需要完整的图像位置嵌入。相反,研究人员随机裁剪和调整位置嵌入的区域,而不是使用整个图像的位置嵌入。他们称这种方法为“裁剪位置嵌入”。 团队展示了使用聚焦损失的图像-文本预训练比现有的softmax CE损失更有效。他们还提出了各种新颖的目标检测技术。他们认为,现有方法在对象提议阶段经常会错过新颖的对象,因为这些提议通常需要更加平衡。 该团队表示,他们的模型RO-ViT在LVIS开放词汇检测基准测试中达到了最先进的水平。他们的统计数据显示,在12个图像-文本检索基准测试指标中,它在9个指标上取得了最好的成绩。这反映出在区域级别上学到的表示对开放词汇检测非常有益且高效。 随着目标检测技术的不断发展,负责任的开发、部署和监管将至关重要,以确保其积极影响的最大化,同时减轻潜在风险。总体而言,目标检测技术的持续进步有望通过革新产业、提高安全和生活质量,并实现曾被视为科幻的创新,为更加光明的未来做出贡献。 查看论文和Google博客。该研究的所有荣誉归于该项目的研究人员。还请不要忘记加入我们的29k+ ML SubReddit、40k+ Facebook社群、Discord频道和邮件订阅,我们会分享最新的人工智能研究新闻、有趣的人工智能项目等。 如果你喜欢我们的工作,你会喜欢我们的新闻通讯.. 这篇文章最初发表于MarkTechPost。

Leave a Comment

VoAGI新闻,8月30日:7个基于生成性人工智能的项目•超越Numpy和Pandas:鲜为人知的Python库

7个使用生成式人工智能构建的项目 • 超越Numpy和Pandas:释放不太知名的Python库的潜力 • 你可以用ChatGPT的代码解释器进行数据科学的5种方式 • GPT-4:8个模型合一;秘密揭晓

Leave a Comment