人工智能和机器学习作为世界从技术中受益的领域的创新领导者。选择使用哪种工具可能会很困难,因为市场上有很多流行的工具来保持竞争力。 选择机器学习工具就是选择未来。由于人工智能领域的一切都发展得如此迅速,保持“老狗,老把戏”和“刚做出来昨天”的平衡非常重要。 机器学习工具的数量正在扩大;随之而来的要求是评估它们并理解如何选择最好的工具。 在本文中,我们将介绍一些知名的机器学习工具。此评测将涵盖机器学习库、框架和平台。 Hermione 最新的开源库Hermione将使数据科学家更容易、更快地设置更有序的脚本。此外,Hermione还提供了数据视图、文本向量化、列归一化和反归一化等主题的课程,这些课程有助于日常工作。有了Hermione,您只需遵循一套程序,剩下的事情都会由她来处理,就像魔术一样。 Hydra 名为Hydra的开源Python框架使创建复杂的研究应用程序变得更加容易。Hydra的命名来源于其管理许多相关任务的能力,就像一个有着许多头的九头蛇一样。其主要功能是能够动态地组合层次结构配置,并通过配置文件和命令行进行覆盖。 另一个特性是动态命令行选项补全。它可以从各种来源进行层次化配置,并且配置可以从命令行提供或更改。此外,它可以启动程序以在远程或本地运行,并使用一个命令执行多个任务,并带有不同的参数。 Koalas Koalas项目将pandas DataFrame API集成到Apache Spark之上,以提高数据科学家在处理大量数据时的生产力。 Pandas是事实上的(单节点)Python DataFrame实现,而Spark是大规模数据处理的事实上的标准。如果您已经熟悉pandas,您可以使用此软件包立即开始使用Spark,并避免任何学习曲线。一个代码库同时兼容Spark和Pandas(测试、较小的数据集)(分布式数据集)。 Ludwig Ludwig是一个声明式机器学习框架,为定义机器学习流程提供了一种简单灵活的数据驱动配置方法。Linux基金会AI&Data托管Ludwig,可用于各种人工智能活动。 在配置中声明输入和输出特征以及适当的数据类型。用户可以指定其他参数来预处理、编码和解码特征,从预训练模型中加载数据,构建内部模型架构,调整训练参数或进行超参数优化。 Ludwig将根据配置的显式参数自动创建端到端的机器学习流程,对于那些没有指定设置的情况,会回退到智能默认值。 MLNotify 使用开源程序MLNotify,只需一行导入语句,即可在模型训练结束时向您发送在线、手机和电子邮件通知。MLNotify是一个附加到知名机器学习库的fit()函数的Python库,在过程完成后通知用户。 每个数据科学家都知道,在训练了数百个模型后,等待训练结束是很乏味的。因为训练需要一些时间,您需要来回切换以偶尔检查它。一旦训练开始,MLNotify将为您打印出特定的跟踪URL。您有三种输入代码的选项:扫描QR码、复制URL或浏览https://mlnotify.aporia.com。然后,您可以看到训练的进展。训练结束后,您将立即收到通知。您可以启用在线、手机或电子邮件通知,以在训练结束后立即收到提醒。 PyCaret 通过开源的基于Python的PyCaret模块,可以自动化机器学习的工作流程。PyCaret是一个简短、简单易懂的Python低代码机器学习库,可以让您花更多时间进行分析,而不是开发。有许多数据准备选项可用。从特征工程到缩放。PyCaret的设计是模块化的,每个模块都有特定的机器学习操作。…
Leave a CommentTag: AI Tool
数字世界的一个关键入口,更普遍地存在于社交、购物、游戏和其他活动中,是一个外观吸引人且有动画效果的3D头像。一个合适的头像应该吸引人,并且可以根据用户的外貌进行定制。许多著名的头像系统,如Zepeto1和ReadyPlayer2,采用卡通和风格化的外观,因为它们有趣且用户友好。然而,手动选择和修改头像通常需要从许多图形元素中进行繁琐的修改,这对于初学者用户来说既耗时又具有挑战性。在这项研究中,他们研究了从正面拍摄的一张自拍照片自动生成风格化3D头像的自动化方法。 具体而言,给定一张自拍照片,他们的算法预测一个头像向量作为图形引擎生成3D头像并从预定义的3D资源中渲染头像图像的完整配置。头像向量包含特定于预定义资源的参数,可以是连续的(例如头部长度)或离散的(例如发型类型)。一种简单的解决方案是标注一组自拍照片,并训练一个模型通过监督学习来预测头像向量。然而,需要大规模的标注来处理大量的资源(通常是数百个)。建议使用自监督方法训练一个可微分的模拟器,通过不同的识别和语义分割损失来复制图形引擎的渲染,从而自动地将生成的头像图片与自拍照片进行匹配,从而减少标注成本。 更准确地说,给定一张自拍照片,他们的系统将预测一个头像向量作为图形引擎生成3D头像并从指定的3D资源中渲染头像图像的完整设置。构成头像向量的特征是特定于预设资源的,可以是连续的(如头部长度)或离散的(如发型类型)。一种简单的方法是标注一系列自拍照片,并使用监督学习构建模型来预测头像向量。然而,需要大规模的标注来处理各种各样的资源(通常是数百个)。 头像向量转换、自监督头像参数化和肖像风格化是他们创新架构的三个步骤。根据图1所示,在整个流程中,识别信息(发型、肤色、眼镜等)在三个阶段逐渐关闭域差距的同时保留。肖像风格化阶段首先关注2D真实到风格化视觉外观的域交叉。这一步保持了图像空间,同时将输入的自拍照片转换为风格化头像。对于翻译的当前风格化技术的粗略使用将保留诸如表情之类的元素,这将在流水线的后续阶段中引起明显的复杂性。 图1 因此,他们开发了一种修改版的AgileGAN,以确保表情的一致性,同时保持用户的识别。然后,自监督头像参数化步骤关注的是从基于像素的图片到基于向量的头像的过渡。他们发现强制执行参数离散性会阻止优化达到收敛行为。他们采用一种宽松的形式,称为放松的头像向量,以克服这个问题,将离散参数编码为连续的独热向量。他们教授一个模拟器像不可微分的引擎一样行为,以实现训练中的可微性。在头像向量转换步骤中,所有离散参数都被转换为独热向量。从放松的头像向量空间到严格的头像向量空间进行域交叉。然后,图形引擎可以构建最终的头像并使用严格的头像向量进行渲染。他们使用一种独特的搜索技术,产生的结果优于直接量化。他们利用人类喜好研究评估他们的发现,并将结果与基线方法(如F2P和手工制作)进行比较,以查看他们的方法如何有效地保护个人独特性。他们的结果得分明显高于基线技术,并与手工制作的结果非常相似。 他们还提供了一个消融研究来支持他们的流水线设计决策。他们的技术贡献包括以下要点: • 一种新颖的自监督学习框架,结合连续和离散参数生成高质量的风格化3D头像 • 一种通过肖像风格化来弥合风格域差异的新方法,用于创建风格化的3D头像 • 一种级联的松弛和搜索流水线,用于解决离散头像参数优化中的收敛问题。 您可以在他们的网站上找到该论文的视频演示。
Leave a Comment自从大规模图像-文本配对和复杂的生成模型拓扑结构(如扩散模型)的出现以来,生成模型在生成高保真度的二维图片方面取得了巨大的进展。这些模型通过允许用户根据文本提示创建逼真的视觉效果,消除了人工参与。与二维模型相比,由于三维学习模型的多样性和可访问性的不足,三维生成模型仍然面临着重大的问题。高质量的三维模型的可用性受到了软件引擎中繁琐且高度专业化的手动开发三维资产的限制。 研究人员最近研究了预训练的图像-文本生成方法,以创建高保真度的三维模型来解决这个问题。这些模型包括物品的几何和外观的详细先验知识,这可能会使创建逼真且多样化的三维模型变得更容易。在这项研究中,来自腾讯、南洋理工大学、复旦大学和浙江大学的研究人员提出了一种使用经过训练的文本到图像扩散模型创建三维风格化头像的独特方法,允许用户通过文本提示选择头像的风格和面部特征。他们选择使用基于 GAN 的 EG3D 三维生成网络,主要是因为它具有几个优点。 首先,EG3D 在训练时使用校准的照片而不是三维数据,这使得利用改进的图像数据不断增加三维模型的多样性和逼真度成为可能。对于二维照片来说,这个特性非常简单。其次,他们可以独立地生成每个视角,有效地控制图像生成过程中的随机性,因为用于训练的图像在外观上不需要严格的多视角一致性。他们的方法使用了基于 StableDiffusion 的 ControlNet,允许通过预定的姿势进行图片生成,为 EG3D 训练创建校准的二维训练图像。 通过从姿势照片中重复使用摄像机特征进行学习,这些姿势可以在当前引擎中合成或检索。即使在使用准确的姿势照片作为指导时,ControlNet 在创建大角度视角(如头部的背面)时经常遇到困难。这些失败的输出需要改进生成完整的三维模型。为了解决这个问题,他们采取了两种不同的方法。首先,他们为图片生成过程中的各个视角创建了特定于视角的提示,极大地减少了失败的发生次数。即使有特定于视角的提示,合成的照片可能只能部分匹配姿势照片。 为了解决这种不匹配的问题,他们为三维 GAN 训练创建了一个粗到精的姿势感知判别器。他们的系统中的每个图片数据都有一个粗略和精细的姿势注释。在 GAN 训练过程中,他们随机选择一个训练注释。对于自信的视角(如正面),他们有很大的机会选择好的姿势注释,但对于其它视角的学习更依赖于粗略的想法。即使输入的照片包含混乱的注释,这种方法也可以生成更准确和多样化的三维模型。此外,他们还在 StyleGAN 的潜在风格空间中创建了一个潜在扩散模型,以实现使用图像输入进行条件三维生成。 由于风格代码的低维度、高表现力和紧凑性,扩散模型的训练速度很快。他们直接从训练好的三维生成器中采样图像和风格代码配对来学习扩散模型。他们对许多大规模数据集进行了全面的测试,以评估他们提出的策略的有效性。研究结果显示,他们的方法在视觉质量和多样性方面超过了当前的尖端技术。总之,这项研究介绍了一种使用经过训练的图像-文本扩散模型生成高保真度的三维头像的独特方法。 他们的架构通过允许通过文本提示确定风格和面部特征,极大地增加了头像制作的灵活性。为了解决图像位置不匹配的问题,他们还提出了一个粗到精的姿势感知判别器,这将使带有错误姿势注释的图像数据更好地利用起来。最后,他们创建了一个额外的条件生成模块,可以在潜在风格空间中使用图像输入进行条件三维生成。这个模块进一步增加了框架的适应性,并允许用户创建符合自己口味的三维模型。他们还计划开源他们的代码。
Leave a CommentChapyter由一群语言模型师开发,是一个新的Jupyter插件,可以集成ChatGPT,让用户创建Python笔记本。该系统还可以读取先前执行的单元格的结果。 Chapyter是JupyterLab的一个附加组件,可以无缝地将GPT-4集成到开发环境中。它有一个解释器,可以将自然语言编写的描述转换为可以自动执行的Python代码。Chapyter可以提高生产力,通过在首选的IDE中启用“自然语言编程”,让用户尝试新事物。 主要特点 从自然语言自动生成代码并执行。 基于过去的代码和之前执行的结果生成新代码。 实时代码纠正和错误修复。 自定义选项和完全可见的AI设置提示。 在使用尖端AI技术时注重隐私。 该库的提示和设置是公开的,研究人员正在努力简化这些问题和设置的自定义。Chapyter/programs.py是可以查看这些内容的位置。 请查看他们的API数据使用政策,以了解OpenAI如何处理训练数据。相比之下,每当使用Copilot或ChatGPT时,部分数据将被缓存并用于这些服务的训练和分析。Chapyter由两个主要部分组成:使用ipython魔法命令管理提示和使用该命令调用GPT-X模型。监视Chapyter单元格执行的用户界面将运行新创建的单元格并自动更新单元格样式。 许多程序员更喜欢以“碎片化”的方式在笔记本中工作,一次只写几行代码,然后转到下一个单元格。每个单元格的任务或目的相对较小,与相邻单元格的任务相互独立。后续工作可能与之前的工作没有太多共同之处。例如,在创建神经网络时添加数据集加载器需要不同的思考和编写代码的方式。不断在任务之间切换不仅效率低下,而且可能会令人精疲力尽。当用户想要键入“请以某种方式加载数据集以测试神经网络”时,可以使用该命令,让机器完成剩下的工作。 Chapyter的单元格级代码开发和自动执行可以解决这个问题。当用户创建一个新的单元格时,Chapyter会自动调用GPT-X模型根据他们编写的文本构建代码并运行。与像Copilot这样专注于支持仅涉及几行代码但与正在进行的工作高度相关的微任务(如完成函数调用)的系统不同,Chapyter旨在接管整个任务,其中一些可能与现有代码不同。 Chapyter是一个轻量级的Python工具,在本地安装后可以与JupyterLab完美集成。默认情况下,OpenAI API设置为在调用GPT-X模型后丢弃交互数据和代码。该库包含所有标准提示、“程序”和加载个性化提示的选项。通过分析以前的编码决策和运行时数据,Chapyter可以提供智能建议。如果需要,可以加载文件,并提供额外处理和分析的建议。 鉴于当今AI的局限性,Chapyter的生成代码易于调试和改进。 安装过程分为三个简单的步骤,可以在GitHub的https://github.com/chapyter/chapyter上找到更多信息。 不久之后,研究人员将发布对Chapyter的重大改进,使其在代码生成和执行方面更加灵活和安全。他们迫不及待地想要在一些最苛刻和复杂的实际编码任务上测试它,比如确保一个有300个单元格执行的Jupyter笔记本有所有所需的帮助。请尝试我们的工具,敬请期待进一步的改进,我们重视您的想法和意见。
Leave a CommentDeepSwap DeepSwap是一个基于人工智能的工具,适用于任何想要创建令人信服的深度伪造视频和图像的人。通过重新面向视频、图片、表情包、旧电影、GIF等方式,创建您的内容非常简单。该应用程序没有内容限制,因此用户可以上传任何内容的材料。此外,您还可以首次成为产品的订阅用户,享受50%的折扣。 Docktopus AI Docktopus是一种由AI驱动的演示工具,通过100多个可自定义的模板简化在线内容的创建,让用户能够在几秒钟内创建专业演示文稿。 Promptpal AI Promptpal AI帮助用户发现获取AI模型(如ChatGPT)最大利益的最佳提示。 Quinvio AI Quinvio是一种AI视频制作工具,可以通过直观的编辑器、AI辅助写作和选择AI发言人的选项快速制作视频演示。 Ask your PDF AskYourPdf是一种AI聊天机器人,可帮助用户轻松与PDF文档进行交互并提取洞见。 Supernormal AI Supernormal是一种AI工具,可以自动创建会议记录,每次会议可节省5-10分钟。 Suggesty Suggesty由GPT-3驱动,为Google搜索提供类似人类的答案。 ChatGPT Sidebar ChatGPT Sidebar是一款ChatGPT…
Leave a Comment在一系列前所未有的事件中,一种名为Zeroscope的下一代开源AI模型已经在市场上推出,具备在现代图形卡上运行最先进的文本到视频服务的能力,并且以相对较低的成本提供给用户。中国的Modelscope旗下的Zeroscope旨在通过解锁新的AI用例,彻底改变媒体和视频创作领域。 了解Zeroscope的功能组成对于理解它如何通过文本革新视频生成领域非常重要。这个开源模型的独特之处在于它的两个关键组件,Zeroscope V2和Zeroscope V2XL;Zeroscope_v2 567w,用于以576×320像素的分辨率快速创建内容以探索视频概念。然后可以使用zeroscope_v2_XL将高质量视频升级到“高清”分辨率1024×576,因此用户可以使用ZeroScope V2快速创建视频,然后使用V2XL进行升级。 除此之外,由于多级模型的17亿个参数,Zeroscope的要求令人惊讶地易于管理。Zeroscope在较低分辨率下的VRAM需求为7.9千兆字节,而在较高分辨率下为15.3千兆字节。较小的模型可以在许多标准图形卡上执行,使其可供更广泛和更一般的用户使用。 Zeroscope通过对近10,000个剪辑和近30,000个帧进行偏移噪声的战略训练。这种非传统的行为组合为Zeroscope开启了新的机遇和可能性。通过引入随机物体移动、帧时序的微小变化和轻微扭曲等变化,模型改善了对数据分布的理解,从而帮助模型以多样化的尺度生成更真实的视频,并有效地解释文本描述中微妙的变化。凭借所有这些功能,Zerscope迅速成为商业文本到视频模型提供商Runway的有力竞争对手。 文本到视频作为一项工作仍在进展中,生成的视频片段往往较短且存在一些视觉缺陷。然而,如果我们看一下图像AI模型的发展历程,它们在达到照片逼真质量之前也面临了类似的挑战。主要挑战是视频生成在训练和生成阶段都需要更多的资源。 Zeroscope作为一种强大的文本到视频模型的出现为许多新的数字进展和用例铺平了道路,例如: 个性化游戏、虚拟现实和元宇宙:Zeroscope的转换能力可以重新定义视频游戏中的故事叙述。玩家可以通过他们的话语实时影响剪辑和游戏玩法,实现难以想象的互动和个性化。此外,游戏开发者可以快速原型和可视化游戏场景,加快开发速度。 个性化电影:Zeroscope的技术通过基于用户描述生成个性化内容来颠覆媒体行业。用户可以输入情节或场景描述,并根据其回应创建个性化视频。此功能可以实现观众的积极参与,并为定制内容创作开辟了新的途径,例如个性化视频广告或用户定制的电影场景。 合成创作者:Zeroscope为依靠AI将其想法编写、制作和编辑成现实的新一代创作者铺平了道路。它消除了视频创作中的技术技能障碍,并有可能为自动化、高质量的视频内容建立新的标准。人类和AI创作者之间的界限变得模糊,拓宽了创造力的领域。 Zeroscope旨在成为一种轻量级的突破性模型,可以轻松进行微调,并且不需要特殊的资源设置,使其不仅成为多个普通用户可以使用的工具,而且许多缺乏大型实验室资源的新兴研究人员现在可以使用此类算法来更好地理解它们并以合理的成本推进整个领域的发展。看到激烈竞争将激励Zeroscope的创作者创新并占据强劲的市场地位将是令人惊叹的。
Leave a CommentAI工具正在快速发展,新的工具不断推出。查看下面一些可以增强您日常工作的AI工具。 tl;dv 这个工具由GPT模型提供动力,是Zoom和Google Meet的会议记录器。 tl;dv 为用户转录和总结通话。 Otter AI Otter.AI使用人工智能,为用户提供实时会议笔记转录,这些笔记可共享、可搜索、易于访问和安全。 Taskade Taskade是一款AI生产力工具,可帮助用户高效地管理任务和项目。 Notion AI Notion AI是一款写作助手,可以帮助用户在Notion工作区内写作、头脑风暴、编辑和总结。 Bing 微软推出了AI驱动的Bing搜索引擎,就像在搜索网络时拥有研究助手、个人计划师和创意伙伴。 Bard Bard是由Google开发的聊天机器人,可帮助提高生产力并将想法变为现实。 Forefront Forefront AI是一个平台,提供GPT-4、图像生成、自定义角色和可共享聊天等免费访问,从而为企业提供了改进的效率和用户体验。 Merlin Merlin是一个ChatGPT扩展程序,可帮助用户在任何网站上完成任何任务,提供博客摘要和Gmail AI写手等功能。…
Leave a Comment