Press "Enter" to skip to content

Tag: Technology

这篇人工智能论文提议将3D世界注入大型语言模型,并引入全新的3D-LLM家族

在过去几年中,我们见证了大规模语言模型(LLM)(如GPT4)的崛起,这些模型在包括沟通和常识推理在内的各种任务上表现出色。最近的研究关注如何将图片和视频与LLM对齐,以创建一种新型的多模态LLM(如Flamingo和BLIP-2),能够理解和理解二维视觉。然而,尽管这些模型在沟通和决策方面非常有效,但它们并不基于真实的三维物理世界中的更深层次概念,包括空间连接、可行性、物理和交互等。因此,与科幻电影中展示的能够理解三维情境并基于这些理解进行推理和规划的机器人助手相比,这种LLM是微不足道的。为了做到这一点,他们建议将三维世界纳入大规模语言模型,并引入一类全新的三维LLM,可以使用三维表示(即带有相关属性的三维点云)作为输入来处理各种三维相关任务。 图 1 当LLM使用三维情景表示作为输入时,它们从两个方面获益:(1) 它们可以将完整场景的长期记忆存储在整体的三维表示中,而不是片段性的部分观察。(2) 从三维表示中推理可以推断出三维特征,如可行性和空间链接,远远超出基于语言或二维图像的LLM的能力。数据收集是训练提出的三维LLM的一个重要障碍。缺乏三维数据使得基于三维数据创建基础模型变得困难,而互联网上的二维图像和文本数据却非常丰富。更难获取的是与口头描述相结合的三维数据。 他们提出了一系列独特的数据生成过程,以提供大量与语言相关的三维数据来解决这个问题。他们为三维数据和语言之间的交流提供了三个有效的提示过程,特别是使用ChatGPT。如图1所示,他们可以通过这种方式获取30万条三维语言数据,其中包括各种任务的信息,例如三维字幕、密集字幕、三维问题回答、三维任务分解、三维基础、三维辅助对话、导航等。下一个困难是找到与语言特征相匹配的有用的三维属性,用于三维LLM。一种方法是使用类似于CLIP的对比学习范式从头开始训练三维编码器,对齐语言和二维图片。然而,这种方法使用了大量的数据、时间和GPU资源。从不同的角度来看,最近的一些努力(如想法融合和3D-CLR)从二维多视图照片构建三维特征。他们还使用了一个三维特征提取器,根据这个提取器使用二维预训练特征的渲染多视图图片创建三维特征。 近期许多视觉语言模型(如BLIP-2和Flamingo)开始使用二维预训练的CLIP特征来训练它们的VLMs。由于它们映射到与二维预训练特征相同的特征空间,它们可以轻松地将二维VLMs作为骨干,并输入提取的三维特征以有效地训练三维LLM。三维LLM被预期具有潜在的三维空间信息感,这使它们在几个重要方面与传统的LLM和二维VLM不同。因此,来自加州大学洛杉矶分校、上海交通大学、华南理工大学、伊利诺伊大学厄巴纳-香槟分校、麻省理工学院、马萨诸塞大学阿默斯特分校和麻省理工-IBM沃森人工智能实验室的研究人员创建了一个将语言与地理位置连接起来的三维定位系统。他们将三维位置嵌入到检索到的三维特征中,更有效地编码空间信息。此外,他们向三维LLM添加了几个位置标记。然后,可以根据景物的语言描述生成位置标记来训练定位。这将使三维LLM能够更有效地记录三维空间数据。 总之,他们的论文提出了以下贡献: • 他们提出了一种新的基于3D的大型语言模型(3D-LLMs),可以使用来自带有特征和语言提示的3D点的输入来处理一系列与3D相关的任务。他们集中研究传统的或2D-LLMs无法涵盖的活动,例如对整个场景的认知、3D空间连接、适应性和3D规划等。 • 他们创建了创新的数据收集管道,可以生成大量的3D语言数据。基于这些管道,他们收集了一个包含超过30万个3D语言数据点的数据集,涵盖了广泛的3D相关活动,例如3D grounding、密集字幕、3D问题回答、任务分解、3D辅助对话、导航等。 • 他们使用3D特征提取器,该提取器可以接收渲染的多视角图片并提取有用的3D特征。他们使用2D预训练的VLMs构建了他们的训练系统。为了让3D-LLMs更好地收集3D空间信息,他们添加了一种3D定位方法。 • 在实验中,ScanQA(一种保留评估数据集)的表现优于先进的基准模型。在ScanQA上,特别是3D LLMs在基准模型(例如BLEU-1时提高了9%)的基础上表现更好。他们的方法在使用保留数据集进行3D字幕、任务创建和3D辅助对话的测试中击败了2D VLMs。定性调查显示,他们的方法可以更详细地处理各种工作。 • 他们希望将他们的3D-LLMs、3D语言数据集以及数据集的语言对齐的3D特征提供给即将进行的研究。

Leave a Comment

这篇来自韩国的人工智能(AI)论文提出了FFNeRV:一种使用帧间流图和多分辨率时间网格的新型逐帧视频表示方法

最近,对于通过神经网络将坐标映射到其数量(如标量或向量)来表示信号的神经场的研究已经迅速增长。这引发了对利用这项技术处理各种信号(包括音频、图像、3D形状和视频)的兴趣增加。通用逼近定理和坐标编码技术为大脑场的准确信号表示提供了理论基础。最近的研究表明,它在数据压缩、生成模型、信号操作和基本信号表示方面具有适应性。 图1显示了(a)所提出的流引导的逐帧表示的一般结构,(b)逐帧视频表示,(c)像素级视频表示(FFNeRV) 最近,对于通过神经网络将坐标映射到其数量(如标量或向量)来表示信号的神经场的研究已经迅速增长。这引发了对利用这项技术处理各种信号(包括音频、图像、3D形状和视频)的兴趣增加。通用逼近定理和坐标编码技术为大脑场的准确信号表示提供了理论基础。最近的研究表明,它在数据压缩、生成模型、信号操作和基本信号表示方面具有适应性。 每个时间坐标由由多层感知机(MLP)和卷积层堆叠创建的视频帧来表示。与基本神经场设计相比,我们的方法大大减少了编码时间,并且在视频压缩技术方面表现出色。这种范式遵循了最近提出的E-NeRV,同时也提升了视频质量。如图1所示,它们提供了用于电影的流引导的逐帧神经表示(FFNeRV)。它们将光流嵌入到逐帧表示中,利用时间冗余,借鉴了常见的视频编解码器。通过组合由光流引导的附近帧,FFNeRV创建了一个视频帧,强制重用先前帧的像素。鼓励网络避免在帧之间再次记住相同的像素值,极大地提高了参数效率。 根据对UVG数据集的实验结果,FFNeRV在视频压缩和帧插值方面击败了其他逐帧算法。他们建议使用多分辨率时间网格,以固定空间分辨率代替MLP,将连续的时间坐标映射到相应的潜在特征,以进一步提高压缩性能。这受到基于网格的神经表示的启发。此外,他们建议使用更简洁的卷积结构。他们在推荐的逐帧流表示中使用群组和逐点卷积,由生成模型驱动,生成高质量的图片和轻量级神经网络。通过量化感知训练和熵编码,FFNeRV击败了流行的视频编解码器(H.264和HEVC),并与最先进的视频压缩算法表现相当。代码实现基于NeRV,可在GitHub上获得。

Leave a Comment

“认识罗丹:一种新颖的人工智能(AI)框架,可以从各种输入源生成3D数字化身”

生成模型正在成为计算机科学中许多具有挑战性任务的事实解决方案。它们代表了分析和合成视觉数据最有前景的方法之一。稳定扩散是目前最知名的生成模型,可以从复杂的输入提示生成美丽而逼真的图像。该架构基于扩散模型(DMs),已经展现出图像和视频的惊人生成能力。扩散和生成模型的快速发展正在推动二维内容创作的革命。这个口号非常简单:“如果你能描述它,你就能可视化它。”或者更好的说,“如果你能描述它,模型就能为你绘制出来。”确实令人难以置信,生成模型的能力。 虽然二维内容已被证明是对DMs的一种压力测试,但三维内容由于包括但不限于额外的维度而带来了几个挑战。生成与2D内容相同质量的三维内容,例如头像,是一项艰巨的任务,由于内存和处理成本可能会限制为高质量头像生成所需的丰富细节。 随着技术推动数字头像在电影、游戏、元宇宙和3D行业中的使用,允许任何人创建数字头像可能是有益的。这是推动该工作开发的动力。 作者提出了Roll-out扩散网络(Rodin)来解决创建数字头像的问题。下图给出了该模型的概述。 模型的输入可以是图像、随机噪声或所需头像的文本描述。然后从给定的输入中派生潜在向量z,并在扩散过程中使用它。扩散过程包括多个噪声去噪步骤。首先,随机噪声被添加到起始状态或图像中,并进行去噪以获得更清晰的图像。 这里的不同之处在于所需内容的三维性质。扩散过程与通常运行一样,但扩散模型生成头像的粗略几何形状,随后使用扩散上采样器进行细节合成。 计算和内存效率是该工作的目标之一。为了实现这一目标,作者利用了神经辐射场的三平面(三个轴)表示,与体素网格相比,它具有更小的内存占用,而不会损失表达能力。 然后,训练另一个扩散模型,将产生的三平面表示上采样以匹配所需分辨率。最后,利用由4个全连接层组成的轻量级MLP解码器生成RGB体积图像。 下面报告了一些结果。 与提到的最先进方法相比,Rodin提供了最清晰的数字头像。对于该模型,在共享样本中没有可见的伪影,与其他技术相反。 这是Rodin的摘要,一个能够轻松从各种输入源生成3D数字化身的新颖框架。如果您有兴趣,可以在下面的链接中找到更多信息。

Leave a Comment

“赋能设备端人工智能:高通和Meta与Llama 2技术合作”

Meta发布了新的开源Llama 2,引发了关于大型语言模型(LLMs)用例的讨论。然而,对于许多人来说,在本地硬件上访问和运行Llama 2仍然是一个重要的障碍。为了解决这个问题并使Llama 2的能力普及化,Meta与高通合作,优化该模型以在设备上使用,利用高通的AI能力骁龙芯片。 Meta和高通的合作旨在在设备上实现Llama 2,并利用新的AI能力骁龙芯片的功能。通过在设备上运行模型,开发人员可以减少云计算成本,并为用户提供增强的隐私,因为没有数据传输到外部服务器。设备上的AI处理还可以实现生成式AI而无需互联网连接,并且可以根据用户的偏好对模型进行个性化。 高通的Hexagon处理器为其骁龙芯片配备了各种AI功能,包括微瓦推断、张量核心以及SegNet、标量和矢量工作负载的专用处理。将Llama 2整合到高通AI堆栈中,进一步优化了在设备上运行AI模型。 Meta从第一款LLaMA模型的泄露中吸取了教训,该模型最初仅向研究人员和学术机构开放。然而,互联网上的泄露导致了开源LLM创新的爆发,产生了各种改进版的LLaMA。开源社区做出了重大贡献,创建了可以在设备上运行的版本,使LLM更加易于访问更广泛的受众。 为了应对泄露事件,Meta在Llama 2的发布中采取了不同的方式,积极接受开放和合作。与高通的合作使芯片制造商了解了模型的内部工作原理,使他们能够优化骁龙芯片上的性能。这种合作预计将与高通的骁龙8 Gen 3芯片在2024年发布同时进行。 开源社区也预计在Llama 2的开发中发挥关键作用。将行业对设备上AI的势头与开放的LLM生态系统结合起来,这一举措被视为朝着培育活跃的设备上AI生态系统的众多步骤中的第一步。 专家预测,开源LLM可能会引领一代新的以AI为动力的内容生成、智能助手、生产力应用等。在设备上本地运行LLM的能力为设备上的AI处理开启了众多可能性,并支持AI能力在边缘的不断增长趋势,例如苹果在M1芯片中加入神经引擎和微软的混合AI Loop工具包。 总的来说,Meta和高通之间的合作标志着向AI模型普及化迈出了重要的一步,为开发人员创造AI应用程序开辟了令人兴奋的机会,并引领着类似于iPhone应用商店繁荣的设备上AI生态系统的新时代。

Leave a Comment

这项脑AI研究通过稳定扩散从读取脑电波中重建图像

构建与人类视觉系统类似的人工系统,是计算机视觉的一个重要目标。最近在人口脑活动测量方面的进展,以及深度神经网络模型的实现和设计的改进,使得可以直接比较人工网络的结构特征与生物大脑潜在表示的架构特征,揭示了这些系统的工作方式的关键细节。从脑活动中重建视觉图像,比如通过功能磁共振成像(fMRI)检测到的脑活动,就是其中的一个应用之一。这是一个有趣但困难的问题,因为潜在的脑表示大部分是未知的,而且用于脑数据的样本量通常很小。 近年来,学者们使用深度学习模型和技术,如生成对抗网络(GAN)和自监督学习,来应对这一挑战。然而,这些研究要求对fMRI实验中使用的特定刺激进行微调,或者从头开始训练新的生成模型。这些尝试在像素级和语义保真度方面表现出很大但受限的性能,部分原因是神经科学数据量较小,部分原因是构建复杂生成模型的多个困难。 扩散模型,尤其是计算资源消耗较少的潜在扩散模型,是最近的一个GAN替代方案。然而,由于LDMs仍然相对较新,很难完全理解它们的内部工作原理。 大阪大学和CiNet的研究团队使用一种名为稳定扩散的LDM来从fMRI信号重建视觉图像,试图解决上述问题。他们提出了一个简单的框架,可以在不需要训练或微调复杂深度学习模型的情况下,重建具有高语义保真度的高分辨率图像。 作者在这项研究中使用的数据集是自然场景数据集(NSD),该数据集收集了来自fMRI扫描仪的数据,每个受试者在30-40个会话期间观看了10,000张图片的三次重复。 来源:https://www.biorxiv.org/content/10.1101/2022.11.18.517004v2.full 首先,他们使用潜在扩散模型从文本中创建图像。在上图(顶部)中,z被定义为由模型通过c进行修改的生成的潜在表示,c被定义为文本的潜在表示(描述图像),zc被定义为由自编码器压缩的原始图像的潜在表示。 为了分析解码模型,作者按照以下三个步骤进行操作(上图,中部)。首先,他们从早期视觉皮层(蓝色)的fMRI信号中预测出呈现图像X的潜在表示z。然后,将z经过解码器处理,产生粗糙的解码图像Xz,然后将其编码并通过扩散过程。最后,将噪声图像添加到从高级视觉皮层(黄色)的fMRI信号中得到的解码潜在文本表示c中,并进行去噪处理,得到zc。从zc出发,解码模块产生最终重建的图像Xzc。需要强调的是,这个过程所需的唯一训练是线性映射fMRI信号到LDM组件zc、z和c。 从zc、z和c出发,作者进行了编码分析,通过将它们映射到脑活动来解释LDM的内部操作(上图,底部)。从表示中重建图像的结果如下所示。 来源:https://www.biorxiv.org/content/10.1101/2022.11.18.517004v2.full 使用简单的 z 重新创建的图像具有与原始图像的视觉一致性,但其语义价值丧失了。另一方面,仅使用 c 部分重建的图像产生了具有很强语义保真度但视觉不一致的图像。通过使用 zc 恢复的图像能够产生具有很高语义保真度的高分辨率图像,从而证明了该方法的有效性。 对大脑的最终分析揭示了关于 DM 模型的新信息。在大脑的后部,即视觉皮层中,所有三个组件都取得了很高的预测性能。特别是,z 在早期视觉皮层(位于视觉皮层后部)中提供了强大的预测性能。同时,它在上部视觉皮层(即视觉皮层的前部)中表现出很强的预测值,但在其他区域的值较小。另一方面,在上部视觉皮层中,c 提供了最佳的预测性能。 来源:https://www.biorxiv.org/content/10.1101/2022.11.18.517004v2.full 查看论文和项目页面。所有关于这项研究的荣誉归功于该项目的研究人员。还请不要忘记加入我们的26k+ ML…

Leave a Comment

加拿大UBC研究人员引入了一种新的人工智能算法,为城市驾驶员绘制最安全的路线

导航应用是提供实时导航指引的应用程序。大多数可用的导航应用可以显示到指定位置的最快旅行路线,但这些应用不能告诉我们到目的地的最安全路线。 需要注意的是,最快的路线并不总是能够保证最高的安全水平。鉴于安全的至关重要性,全球范围内正在进行广泛的研究,以改进导航系统并实现对最安全和最高效路线的识别。 UBC的研究人员开发了一种能够导航和建议最安全路线的算法。研究团队开发了一种方法,可以使用实时碰撞风险数据在城市网络中识别最安全的可能路线。此外,这个算法还可以集成到导航应用程序中,如Google地图,使得它可以被每个人使用。 为了促进这项研究,研究团队使用了10架在希腊雅典市操作的无人机,连续多天收集了这些无人机生成的数据。他们收集的数据包括车辆位置、速度和加速度。这些信息对于识别车辆之间的近距离接触以及预测实时车辆碰撞风险非常关键。这项研究旨在开发一种实时路由算法,考虑特定路线上不同点的碰撞风险程度以及暴露在这些条件下的时间。然后将最安全的路线与最快的路线进行比较,并研究安全性和流动性之间的权衡。 这项研究的结果非常有趣。研究表明,最安全的路线相对于最快的路线更安全,安全性提高了22%,但最快的路线只比最安全的路线快11%。在许多情况下,最安全路线算法往往沿着与最快路线相同的路线行驶,在特定点处绕道以避开被识别为危险位置的地方。事实上,最安全的路线在54%的时间里也是最快的路线。研究人员表示,道路使用者在选择方向时应考虑安全性和效率的综合。 这个实验表明最快路线和最安全路线之间存在权衡。此外,这项研究为该领域的各种其他研究领域铺平了道路。未来,可以相对于其他路线来量化一个路线的安全性。 该模型的局限性在于数据仅针对一个城市在有限的时间内进行收集,可能无法准确描述交通环境变化的位置变化。因此,对于更大范围和更长时间的更多可用路线进行测试,并确定和概括安全性和流动性之间的权衡将是有益的。因此,研究人员目前正在将他们的研究范围扩展到其他城市。

Leave a Comment

“我们应该如何存储AI图像?谷歌研究人员提出了一种使用基于分数的生成模型的图像压缩方法”

一年前,用人工智能生成逼真的图像还只是一个梦想。尽管大部分生成的输出仍然有三只眼睛、两个鼻子等等,但我们对于看到与真实相似的生成的脸庆幸不已。然而,随着扩散模型的发布,情况发生了很大变化。如今,很难区分出人工智能生成的图像和真实的图像。 生成高质量图像的能力是方程式的一部分。如果我们要充分利用它们,高效地压缩它们在内容生成、数据存储、传输和带宽优化等任务中发挥着至关重要的作用。然而,图像压缩在很大程度上仍然依赖于传统的变换编码和量化技术,对生成模型的探索有限。 尽管扩散模型和基于评分的生成模型在图像生成方面取得了成功,但在图像压缩方面,它们尚未成为主导方法,落后于基于GAN的方法。它们在高分辨率图像上的表现往往比不上HiFiC等基于GAN的方法。即使尝试将文本到图像模型重新用于图像压缩,也会产生不令人满意的结果,生成的重建图像与原始输入有所偏差,或者包含不良伪影。 在图像生成任务中,基于评分的生成模型的性能与它们在图像压缩中的有限成功之间的差距引发了有趣的问题,并激发了进一步的研究。令人惊讶的是,能够生成高质量图像的模型在图像压缩这个特定任务中无法超越GAN。这种差异表明,在将基于评分的生成模型应用于压缩任务时,可能存在独特的挑战和考虑因素,需要专门的方法来充分发挥其潜力。 因此,我们知道在图像压缩中使用基于评分的生成模型存在潜力。问题是,如何实现呢?让我们来看答案。 谷歌研究人员提出了一种方法,将经过均方误差(MSE)优化的标准自编码器与扩散过程结合起来,以恢复并添加自编码器丢弃的细节。对于编码图像的比特率仅由自编码器确定,因为扩散过程不需要额外的比特。通过专门为图像压缩微调扩散模型,结果显示它们在图像质量方面可以胜过几种最近的生成方法。 所提出的方法能够更好地保留细节,与最先进的方法相比。来源:https://arxiv.org/pdf/2305.18231.pdf 该方法探索了两种紧密相关的方法:扩散模型表现出令人印象深刻的性能,但需要大量的采样步骤;而修正流模型在允许较少的采样步骤时表现更好。 这种两步方法首先使用MSE优化的自编码器对输入图像进行编码,然后应用扩散过程或修正流方法来增强重建图像的逼真度。扩散模型采用与文本到图像模型相反方向的噪声调度,优先考虑细节而不是全局结构。另一方面,修正流模型利用自编码器提供的配对关系,直接将自编码器输出映射到未压缩图像。 所提出的HFD模型概述。来源:https://arxiv.org/pdf/2305.18231.pdf 此外,该研究揭示了一些具体细节,这些细节对未来在该领域的研究具有实用价值。例如,研究表明,噪声计划和在图像生成过程中注入的噪声量显著影响结果。有趣的是,尽管文本到图像模型在高分辨率图像上训练时受益于增加的噪声水平,但发现在压缩方面减少扩散过程的整体噪声是有利的。这种调整使模型能够更多地关注细节,因为粗略的细节已经被自动编码器重建充分捕捉到了。

Leave a Comment

“见面短GPT:一个强大的人工智能框架,用于自动化内容创作和简化视频制作流程”

在快节奏的数字内容创作世界中,效率和创造力至关重要。请见识ShortGPT,一个强大的框架,旨在自动化内容创作并简化视频制作流程。利用大型语言模型(LLMs)和尖端技术的能力,ShortGPT以前所未有的方式简化视频创作、素材获取、语音合成和编辑任务。 自动化编辑框架 ShortGPT的核心是一种创新的面向LLM的视频编辑语言,它是自动化编辑框架的支撑。该语言将编辑过程分解为可管理和可定制的块,使其能够被大型语言模型理解。这使得ShortGPT能够高效地生成脚本和提示,用于各种自动化编辑过程,为创作者提供即用资源。 多语言语音合成和内容创作 ShortGPT旨在支持多种语言,确保内容创作者的全球覆盖。ShortGPT的语音合成功能使创作者能够以他们偏爱的语言传递内容,打破语言障碍,触及全球各地的不同受众,从英语、西班牙语到阿拉伯语、法语、波兰语、德语、意大利语和葡萄牙语。 自动生成字幕和素材获取 字幕是视频内容的重要组成部分,提升可访问性和参与度。通过ShortGPT的自动字幕生成功能,创作者可以轻松地为他们的视频添加字幕,节省时间和精力。此外,ShortGPT从互联网上获取图像和视频素材,连接网络并利用Pexels API访问庞大的高质量视觉库。这个功能简化了找到相关素材的过程,进一步加快了内容创作流程。 无缝编辑的记忆和持久性 通过使用轻量级数据库TinyDB,ShortGPT确保了自动化编辑变量的长期持久性。这个特性使得框架能够记住用户的偏好和设置,实现在多个会话中无缝和一致的编辑体验。 与Google Colab的轻松实现 ShortGPT为那些喜欢无需在本地系统上安装先决条件的人提供了Google Colab笔记本选项。这个基于网络的界面是免费且随时可用的,使用户可以在不需要任何安装要求的情况下运行ShortGPT。 安装步骤和API集成 ShortGPT的详细安装指南提供了设置ImageMagick、FFmpeg和克隆存储库的逐步说明。此外,该框架与OpenAI和ElevenLabs的API集成,需要用户输入他们的API密钥以实现任务的顺利自动化。 可定制和灵活 ShortGPT的灵活性通过其各种引擎展现出来 – ContentShortEngine、ContentVideoEngine和Automated EditingEngine。创作者可以选择最适合其项目的引擎,无论是创建短视频还是更长的内容,或者需要可定制的编辑选项。 开源和不断发展 作为一个开源项目,ShortGPT积极鼓励社区的贡献。开发者们重视新功能、改进基础设施和更好的文档,以使ShortGPT始终处于AI内容创建的前沿。 ShortGPT是内容创作的颠覆者,通过AI自动化改变视频制作。其强大的框架、多语言支持、自动字幕和素材获取功能使创作者能够高效地制作引人入胜、高质量的内容。凭借用户友好的界面和持续的发展,ShortGPT承诺推动AI驱动的内容创作的未来,激发创造力并简化全球创作者的视频制作流程。

Leave a Comment

这篇AI论文展示了一种利用LLM而不是人类创造大量具有不同复杂程度的指导数据的方法

在开放领域指令遵循数据上训练LLM的结果是惊人的。然而,手动开发这种类型的指令数据需要时间和精力。此外,人类可能需要帮助创建高度复杂的指令。最近,许多自然语言处理(NLP)社区的努力集中在教导大型语言模型更好地理解和遵循指令。最近的研究表明,LLM也可能从教学中受益。因此,这种数据现在常规用于在开放领域训练和微调LLM。 Evol-Instruct是一种革命性的方法,使用LLM创建不同复杂度的大量指令数据;这是由微软和北京大学的研究人员团队开发的。该团队的WizardLM模型生成的指令在人类评估中得分高于人类创建的指令数据集。 Evol-Instruct流程分为三个阶段: 指令的演化 基于新开发的教育的响应的演化 消除的演化 为了从简单的种子指令生成更复杂的指令,Evol-Instruct可以执行深度演化(涉及五种操作之一:添加约束、加深、具体化、增加推理步骤和复杂化输入)或广度演化(基于给定的指令创建新的指令)。最后一个阶段,消除演化,作为一个过滤器来消除不良指令。 研究人员使用Evol-Instruct生成不同复杂度的指令。然后,他们将所有生成的指令数据合并起来,通过实证研究来微调LLaMA LLM并开发他们的WizardLM模型。WizardLM与ChatGPT、Alpaca和Vicuna等行业标准工具进行了评估。 研究人员主要得出以下结论: Evol-Instruct的指令优于人类开发的ShareGPT。使用相同数量的Evol-Instruct数据(即70k)微调LLaMA 7B时,WizardLM的表现比Vicuna高出12.4%(41.3%对28.9%)。 在面临困难的测试指令时,标注者对WizardLM的结果比对ChatGPT的结果更满意。在测试集上,WizardLM相比ChatGPT输了12.8%,胜率为28.0%对40.8%。然而,在测试集的高难度部分(难度级别8)中,WizardLM相对于ChatGPT的胜率高出7.9个百分点,为42.9%对35.0%。这表明该技术极大地增强了大型语言模型处理复杂指令的能力。 研究的作者通过评估高复杂性组件的人类评估结果,显示WizardLM模型的输出优于OpenAI ChatGPT的输出。结果显示,使用AI演进的指令进行微调是增强大型语言模型的潜在途径,即使WizardLM在某些方面仍落后于ChatGPT。源代码和输出数据都可以在https://github.com/nlpxucan/WizardLM上查看。 研究人员使用以下三个LLM作为起点: OpenAI创建了AI聊天机器人ChatGPT,以使对话变得自然和有趣。它基于从互联网等大量文本数据训练的LLM,如GPT-3.5和GPT-4。在人类训练员的监督下,使用监督学习和强化学习方法对ChatGPT进行微调。 Alpaca是斯坦福大学的一个倡议,旨在创建和传播一种免费的、由社区驱动的遵循指令的范例。该模型使用通过查询OpenAI的text-davinci003模型创建的52K个遵循指令实例开发,并建立在LLaMA 7B上,这是一个经过训练的大型语言模型,使用了多个文本来源。 Vicuna是一个开源聊天机器人,可以为用户提供人性化和有趣的回复。它基于LLaMA 13B,使用了来自ShareGPT的70K个用户共享对话数据进行微调。 研究人员使用ChatGPT来评估每个指令的复杂性和困难度,从而使他们能够更深入地了解指令演化过程。根据LLaMA模型许可,研究人员以增量权重的形式发布[WizardLM]权重。可以通过将增量添加到初始LLaMA权重来获得WizardLM权重。 研究人员使用人工指导评估集将Wizard的输出与人类评估者生成的输出进行比较。在Wizard和控制组之间进行了盲目的成对比较。作者的评估数据收集涵盖了许多以用户为中心的任务,从复杂的代码生成和调试到数学推理,复杂格式的推理,学术写作和广泛的学科。 这些结果表明,Evol-Instruct的AI演化指令方法可以极大地提高LLM性能,并使模型具备处理具有挑战性和复杂指令的能力,例如涉及数学计算、程序开发和逻辑思考的指令。

Leave a Comment

基于Transformer的LLM如何从其参数中提取知识

近年来,基于Transformer的大型语言模型(LLMs)因其捕捉和存储事实知识的能力而变得非常流行。然而,这些模型在推理过程中如何提取事实关联的方式仍然相对未被充分探索。谷歌DeepMind、特拉维夫大学和谷歌研究的研究人员最近进行了一项研究,旨在研究Transformer-based LLMs存储和提取事实关联的内部机制。 该研究提出了一种信息流方法,以调查模型如何预测正确属性以及内部表示如何在层之间演化以生成输出。具体而言,研究人员关注了仅有解码器的LLMs,并确定了与关系和主题位置相关的关键计算点。他们通过使用“去除”策略,在特定层次阻止最后一个位置与其他位置进行关注,并观察推理过程中的影响。 为了进一步确定属性提取发生的位置,研究人员分析了在这些关键点和前面的表示构建过程中传播的信息。他们通过对词汇表、模型的多头自注意力(MHSA)和多层感知机(MLP)子层和投影进行额外干预来实现这一目标。 研究人员确定了一种基于主题丰富过程和属性提取操作的属性提取内部机制。具体而言,在模型的早期层中,关于主题的信息在最后一个主题令牌中得到丰富,而关系传递给最后一个令牌。最后,最后一个令牌使用关系通过注意力头参数从主题表示中提取相应的属性。 这些发现揭示了LLMs内部存储和提取事实关联的机制。研究人员认为,这些发现可能为知识定位和模型编辑开辟新的研究方向。例如,该研究的方法可以用于确定LLMs获取和存储有偏见信息的内部机制,并开发缓解此类偏见的方法。 总的来说,这项研究强调了研究Transformer-based LLMs存储和提取事实关联的内部机制的重要性。通过了解这些机制,研究人员可以开发更有效的方法来改善模型性能并减少偏见。此外,该研究的方法可以应用于自然语言处理的其他领域,如情感分析和语言翻译,以更好地了解这些模型的内部运作方式。

Leave a Comment

如果您只使用适量的未标记图像来训练一个线性层,您能否将您的仅视觉模型转换为VLM?通过跨模型对齐,我们介绍文本到概念(和反向)的方法

深度视觉模型使用的表示空间中充满了语义结构。然而,由于涉及的统计数据量巨大,人类很难理解这些深度特征空间。与深度模型不同,人类已经发展了语言,用来简洁地表示周围的世界,将概念编码为高维空间中的向量。 马里兰大学和Meta AI提出了一种方法,使用无需文本监督训练的现成视觉编码器将文本映射到概念向量,以便直接比较单词和图像的表示。该方法调整了视觉模型的表示空间,使其与CLIP模型的表示空间一致。CLIP表示空间旨在同时训练视觉和文本编码器。因此,文本到概念的文本编码器已经包含在CLIP模型中。 该方法学习了表示空间之间的映射,以利用商用可用模型的这种能力。更确切地说,研究人员通过最大化一个函数来推断出图像在现成视觉模型中的表示的CLIP表示。在将预包装模型的表示映射到CLIP之后,对于目标文本的概念向量,对齐的特征将存在于同一空间中。然而,映射函数可能会严重改变输入的语义。为了避免这种情况,他们确保映射的假设空间只存在仿射变换。尽管看起来缺乏复杂性,但研究团队发现线性层在实现不同体系结构和训练方法的模型之间的特征空间对齐方面意外地有用。 使用商用可用的文本到概念零射击分类器为该方法提供了强有力的支持。与CLIP模型相比,这些模型在许多任务上表现出惊人的零射击准确性,尽管它们体积更大,使用更多样本进行更丰富的监督,并且最重要的是,明确地专门与文本编码器对齐。 文本到概念的可解释性好处不仅限于免费的零射击学习,还包括将视觉编码器转换为无需概念监督的概念瓶颈模型(CBMs)。例如,研究团队将这种方法应用于RIVAL10数据集,该数据集包含属性标签,以确保零射击概念预测的准确性。通过提出的零射击方法,他们能够以很高的准确度(93.8%)预测RIVAL10的属性,从而获得了具有预期可解释性好处的CBM。 他们的论文还通过分析一组文本到概念向量和数据的对齐表示之间的相似性,展示了文本到概念可以以人类术语解释庞大数据集的分布。通过比较对易理解概念的变化来诊断分布偏移。基于概念的图片检索是另一种文本到概念的方法,它方便与庞大数据集进行交互。研究人员使用概念逻辑来查询满足一组概念相似度阈值的图像表示,使人类能够更多地影响搜索中每个概念的相对权重,并在庞大语料库中定位特定照片时得到可接受的结果。 最后,团队还引入了概念到文本,以直接解码模型表示空间中的向量,完成人机通信循环。他们使用现有的CLIP空间解码器和嵌入来指导GPT-2的输出,在将模型空间与CLIP对齐后。然后,他们利用人类研究来检查解码的标题是否准确解释了与每个向量相关联的类别。研究结果显示,在92%的测试中,他们的简单方法都是成功的。

Leave a Comment

见面Brain2Music:一种使用功能磁共振成像(fMRI)捕获的脑活动重建音乐的人工智能方法

谁不喜欢音乐呢?你是否曾经记得一首歌的节奏,但却想不起歌词,也无法找出歌曲的名字?谷歌和大阪大学的研究人员一起找到了一种方法,使用功能性磁共振成像(fMRI)从脑活动中重构音乐。根据音乐的流派、乐器和情绪,生成音乐。 谷歌和大阪大学的研究人员使用深度神经网络生成音乐,通过预测高级、语义结构化的音乐来生成音乐特征,如fMRI扫描。根据人类听觉皮层的活动,可以预测音乐的不同组成部分。研究人员使用了JukeBox进行实验,该系统生成具有高时间连贯性的音乐,其中包含可预测的特征。使用低比特率的压缩神经音频编解码器生成高质量音频。 从fMRI生成音乐需要中间阶段,其中包括通过选择音乐嵌入来表示音乐。他们使用的架构包括音乐嵌入,用于随后的音乐生成的瓶颈。如果预测的音乐嵌入接近受试者听到的原始刺激的音乐嵌入,则使用MusicLM(音乐生成模型)生成类似原始刺激的音乐。 音乐生成模型MusicLM由名为MuLan和w2v-BERT-avg的音频派生嵌入组成。在侧前额皮质中,MuLan往往比w2v-BERT-avg具有更高的预测性能,因为它捕捉到了人脑中的高级音乐信息处理。与音频派生嵌入相比,音乐的抽象信息在听觉皮层中以不同的方式表示。 MuLan嵌入通过生成模型转换为音乐。模型中恢复了嵌入中不包含的信息。在检索技术中,重建的音乐也是音乐性的,因为它直接从音乐数据集中提取。这确保了更高水平的重建质量。研究人员使用fMRI响应数据的线性回归。该方法也存在局限性,包括在使用fMRI数据的线性回归中的确切信息量的不确定性。 研究人员表示,他们未来的工作包括从个体的想象中重构音乐。当用户想象一段音乐片段时,解码分析会考察想象能否被准确重构。这将符合实际的读心术。不同音乐专业背景的多样化受试者存在,需要通过比较进行多个重构属性。比较受试者之间的重构质量,其中包括专业音乐家,可以为他们的观点和理解差异提供有用的见解。 他们的研究工作只是将您纯粹的、富有想象力的思想变为现实的第一步。这也将导致仅凭空想象生成全息图像的可能性。在这一领域的进步还将从生物学角度提供定量解释。

Leave a Comment

一种扩散规则扩散:调节预训练扩散模型用于多模态图像合成

图像生成AI模型在过去几个月里席卷了领域。你可能听说过中途、DALL-E、ControlNet或Stable dDiffusion。这些模型能够根据给定的提示生成逼真的照片,无论给定的提示有多奇怪。你想看到皮卡丘在火星上跑来跑去吗?随便找一个这些模型,让它为你做,你就能得到。 现有的扩散模型依赖于大规模的训练数据。当我们说大规模时,是真的很大。例如,Stable Diffusion本身是在超过25亿个图像-标题对上进行训练的。所以,如果你计划在家里训练自己的扩散模型,你可能要重新考虑一下,因为训练这些模型在计算资源方面非常昂贵。 另一方面,现有的模型通常是无条件的,或者以文本提示等抽象格式为条件。这意味着它们在生成图像时只考虑一个单一的因素,并且无法传递像分割图这样的外部信息。结合它们对大规模数据集的依赖,意味着大规模生成模型在我们没有大规模数据集进行训练的领域中的适用性受到限制。 克服这种限制的一种方法是针对特定领域对预训练模型进行微调。然而,这需要访问模型参数和大量的计算资源来计算整个模型的梯度。此外,微调一个完整的模型限制了它的适用性和可扩展性,因为每个新的领域或模态组合都需要新的全尺寸模型。此外,由于这些模型的体积庞大,它们往往很快就会过度拟合到它们进行微调的较小数据子集上。 也可以从头开始训练模型,并根据所选择的模态进行调节。但同样,这受限于训练数据的可用性,并且从头训练模型非常昂贵。另一方面,人们试图在推理时引导预训练模型朝着期望的输出方向发展。他们使用来自预训练分类器或CLIP网络的梯度,但这种方法会减慢模型的采样速度,因为它在推理过程中增加了很多计算。 如果我们能够使用任何现有的模型,并在不需要非常昂贵的过程的情况下对其进行调节,那么该怎么办呢?如果我们不去繁琐而耗时的改变扩散模式,它是否仍然可以被调节?答案是肯定的,让我来向你介绍。 多模态调节模块的用例。来源:https://arxiv.org/pdf/2302.12764.pdf 所提出的方法,多模态调节模块(MCM),是一个可以集成到现有扩散网络中的模块。它使用一个小型的类似扩散网络的网络,在每个采样时间步骤上训练,以调节原始扩散网络的预测,使生成的图像符合提供的条件。 MCM不需要对原始扩散模型进行任何形式的训练。唯一需要训练的是调节网络,它是小规模的,训练起来不昂贵。这种方法在计算上效率高,所需的计算资源比从头开始训练扩散网络或微调现有扩散网络要少,因为它不需要为大型扩散网络计算梯度。 此外,MCM即使在没有大量训练数据的情况下也能很好地泛化。它不会减慢推理过程,因为不需要计算梯度,唯一的计算开销来自运行小型扩散网络。 所提出的调节流程概述。来源:https://arxiv.org/pdf/2302.12764.pdf 通过引入多模态调节模块,图像生成的控制能力得到增强,可以对附加的模态进行调节,例如分割图或素描。该方法的主要贡献是引入多模态调节模块,一种适应预训练扩散模型进行有条件图像合成的方法,不改变原始模型的参数,并且在成本更低、内存使用更少的情况下实现高质量和多样化的结果,而不是从头开始训练或微调一个大模型。 查看论文和项目。这项研究的所有功劳归功于该项目上的研究人员。还请不要忘记加入我们的26k+ ML SubReddit、Discord频道和电子邮件通讯,我们在其中分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 使用Tensorleap的可解释性平台揭示深度学习的奥秘 本文由MarkTechPost发布,标题为《一次扩散控制所有扩散:调节预训练扩散模型进行多模态图像合成》。

Leave a Comment

斯坦福的一项新的人工智能研究解释了语言模型中过度自信和不确定表达的作用

随着自然语言系统在现实场景中的普及,这些系统必须正确地传达不确定性。人类通常依靠不确定性表达来告知决策过程,从带伞到开始化疗的决策都范围之内。然而,有必要研究语言不确定性与自然语言生成系统的相互作用,从而需要了解模型与自然语言交互的关键组成部分。 最近的研究探讨了语言模型(LMs)解释不确定性表达的能力以及当它们被训练用于发出不确定性表达时的行为变化。自然的不确定性表达可以包括表示犹豫、归因信息或承认限制等其他话语行为。尽管先前的研究集中于学习模型的内部概率与语言或数字序数输出之间的映射,但当前的研究旨在将非单一维度的语言特征(如修饰语、认识标记、主动动词和证据标记)纳入自然语言生成模型中。 本研究检查了大型语言模型(LMs)在解释和生成不确定性提示时在问答(QA)任务的上下文中的行为。研究在零样本设置下进行实验,以分离提示中不确定性的影响,并在上下文学习场景中研究学习表达不确定性如何影响QA任务的生成。 研究发现,使用高确定性的表达可能导致准确性和校准性的缺陷。具体而言,在使用确定性表达来加强介词时,准确性存在系统性损失。此外,教导LM发出削弱语气而不是加强语气可以在不牺牲准确性的情况下获得更好的校准。该研究引入了不确定性表达的分类学以评估语言特征对LM生成的影响。 结果表明,在设计语言校准模型时至关重要,鉴于模型发出高度确定性语言的潜在缺陷。该研究的贡献包括: 提供不确定性表达与LMs相互作用的框架和分析。 引入不确定性表达的分类学。 展示模型使用确定性表达或惯用语言时出现的准确性问题。 最后,研究表明,不确定性表达可能比确定性表达更好地实现校准。 结论 本研究分析了自然不确定性表达对零样本提示和上下文学习中模型行为的影响。研究人员发现,在零样本提示中使用自然不确定性表达(如加强语气和主动动词)以及数值不确定性习语(如“100%确定”)会降低准确性。然而,教导模型仅在不确定时发出不确定性表达可能是人机交互的更安全设计选择。这是因为先前的研究表明,辅助决策的人工智能表现不如仅依靠人类决策,这表明过度依赖人工智能。教导模型发出确定性表达可能会加剧模型的校准不良和脆弱性。 研究人员建议,在进一步研究人类如何解释生成的自然表达式时,社区应将重点放在训练模型发出不确定性表达上。

Leave a Comment

“结识PaLM-E:一个新的拥有5620亿参数的具身多模态语言模型,能够执行机器人操作规划、视觉问答等任务”

大型语言模型(LLMs)展示了在包括对话、逐步推理、数学问题解决和代码撰写在内的各个领域中的强大推理能力。尽管将大量文本数据用于LLMs的训练可以产生与其物理环境有关的表示,但将这些表示与真实世界的视觉和物理传感器模态相连接对于解决计算机视觉和机器人领域中更广泛的基于真实世界的问题至关重要。 以前的工作将LLMs的输出与学习到的机器人策略和可行性函数结合起来进行决策,但这种方法受到限制。以前的工作的局限性在于LLM只接收文本输入,这对于许多需要场景的几何配置至关重要的任务来说是不足够的。此外,他们的研究表明,在常见的视觉语言任务(如视觉问答)上训练的最先进的视觉语言模型无法直接解决机器人推理问题。在这项研究中,来自Google和TU Berlin的研究人员提出了具有体现的语言模型,该模型直接包括来自具体代理的传感器模态的连续输入,并允许语言模型在实际世界中进行更准确的顺序决策。他们开发了PaLM-E,这是一个单一的大型具体化多模态模型,具有积极的迁移效果,可以解决多种观察模态下的多种具体化推理问题。 PaLM-E LLM表现出积极的迁移效果,即学习者在学习第二语言(L2)时可以将他们在第一语言(L1)中的知识或技能应用于L2学习中,从而更快、更有效地掌握L2。例如,如果学习者的L1与他们正在学习的L2具有相似的语法结构,他们可能能够利用对L1语法的了解来更快地理解和应用L2语法规则。同样,如果学习者的L1和L2共享同源词(在两种语言中拼写和含义相似的词),他们可以通过识别和记忆这些同源词来快速扩展他们的L2词汇量。积极迁移与负迁移相对应,负迁移发生在学习者的L1的知识或技能干扰他们获得L2的能力时。例如,如果学习者的L1的语法结构与他们的L2大相径庭,即使他们在理解上理解了L2的语法规则,他们也可能在正确应用L2的语法规则时遇到困难。 与基于Transformer的LLM的自注意力层处理语言标记的方式类似,图片和状态估计等输入也被合并到与语言标记相同的潜在嵌入中。他们首先通过编码器将连续输入注入到预训练的LLM中。这些编码器经过端到端训练,可以产生自然语言中的顺序判断,具体化代理可以通过配置低层规则或响应具体化查询来理解这些判断。通过对比各种输入表示(例如标准与以物体为中心的ViT编码用于视觉输入)、在训练编码器时冻结与微调语言模型以及研究在多个任务上进行联合训练是否能够实现迁移,他们在一系列情境中评估了这种方法。 他们在三个机器人操作领域(其中两个在真实世界中是闭环的)、常见的视觉语言任务(如VQA和图片描述)和语言任务上测试了这种技术,以确定该方法的广度。根据他们的研究结果,多任务训练相对于单一任务训练可以提高性能。他们展示了在机器人任务中这种任务之间的迁移可能导致更高的数据效率,包括在新的物品组合或未知对象上表现出一次性或零次性的泛化,并大大提高从少量训练样本中的学习性能。据他们所知,将540B的PaLM LLM和22B的Vision Transformer(ViT)结合起来创建了迄今为止发表的最大的视觉语言模型,使PaLM-E扩展到了562B个参数。 在没有使用任务特定的微调的情况下,PaLM-E-562B在OK-VQA基准测试上取得了最先进的性能。他们还发现,即使只在单个图像示例上进行训练,PaLM-E-562B显示出了广泛的技能,包括零次多模态思维链(CoT)少量提示、无OCR算术推理和多图像推理。在他们的知识范围内,使用端到端模型在多模态数据上展示零次CoT尚未被证明具体化程序。 总结他们的主要贡献,他们(1)建议并展示了如何在训练多模态大型语言模型时包含具体化数据,以创建一个通用的、迁移学习的、多具体化决策代理。他们证明,即使最先进的通用视觉语言模型在开箱即用的情况下不能有效解决具体化推理问题(零-shot),也有可能训练一个既有效的具体化推理器又能胜任任务的通用视觉语言模型。在研究这种模型的最佳训练方法时, 他们(3)提供了新的架构概念,包括实体标记的多模态标记和神经场景表示。最后但并非最不重要的是,他们(4)证明了PaLM-E不仅是一个具体化推理器,而且还是一个定量技能丰富的视觉和语言通用模型,并且(5)显示扩大语言模型的规模可以实现多模态微调而减少灾难性遗忘。可以在他们的项目网站上找到各种演示。

Leave a Comment

阿里巴巴AI研究提出Composer:一个基于数十亿(文本,图像)对训练的巨型(50亿参数)可控扩散模型

现如今,基于文本的生成图片模型已经能够创建各种逼真的图片。最近的许多研究努力将文本到图片的模型进一步扩展,通过添加分割图、场景图、绘画、深度图和修复遮罩等条件或在少量特定主题数据上进行微调来实现定制化生成。然而,当将这些模型应用于实际应用时,设计师仍然需要更多的控制。例如,在真实世界的设计项目中,生成模型通常需要帮助可靠地生成同时对语义、形式、风格和颜色有要求的图片。 阿里巴巴中国的研究人员介绍了Composer。它是一个训练有数十亿个(文本,图片)对的大型(50亿参数)可控扩散模型。他们认为组合性而不仅仅是条件性是控制图像生成的秘密。后者引入了很多可能的组合,可以极大地扩大控制空间。类似的思想在语言和场景理解领域也有研究。在这些领域中,组合性被称为组合泛化,即能够从有限数量的可用组件中识别或创建出有限数量的独特组合的能力。基于上述概念,他们在这项工作中提供了一个组合生成模型的实现,称之为Composer。他们将可以平滑重新组合视觉元素以创建新图片的生成模型称为组合生成模型。他们使用一个具有UNet骨干的多条件扩散模型来实现Composer。每个Composer训练迭代有两个阶段:分解阶段,在这个阶段,计算机视觉算法或预训练模型被用来将一批图片分解成单个表示;合成阶段,在这个阶段,Composer被优化以从表示子集中重建图片。 图1:组合图像合成的思想,首先将一张图片分解成多个基本部分,然后以很高的创造力和控制度重新组合它们。为了做到这一点,这些组件以各种形式存在,并在整个生成过程中充当条件,使得在推理步骤中可以进行广泛的修改。建议以高分辨率查看。 Composer可以解码出从未见过的表示组合中的独特图片,这些表示可能来自多个来源,可能不兼容,而仅仅是通过重建目的进行训练。尽管概念上很简单且易于使用,但Composer在传统和以前未开发的图片生成和操作任务上表现出色,如但不限于文本到图片生成、多模态条件图片生成、风格转换、姿势转换、图片翻译、虚拟试穿、插值和来自各个方向的图片变化、通过修改草图进行图片重构、依赖图片翻译和图片翻译。 此外,Composer可以将所有上述操作的可编辑区域限制在用户指定的区域内,这比传统的修复操作更灵活,同时通过引入掩膜的正交表示防止在该区域之外修改像素。尽管经过多任务训练,Composer在COCO数据集上利用标题作为标准,在文本到图片合成中获得了零射击FID为9.2的结果,展示了其出色的性能。他们的分解-合成范式表明,当条件是可组合的而不仅仅是单独使用时,生成模型的控制空间可以大大增加。因此,他们的Composer架构可以重塑广泛的传统生成任务,并揭示了迄今未被认识的生成能力,为进一步研究各种分解技术提供了启示。此外,基于无分类器和双向引导,他们展示了许多使用Composer进行不同图片生成和修改任务的方法,并为后续研究提供了有益的参考。在将这项工作公开之前,他们计划仔细检查Composer如何降低滥用风险,并可能提供一个经过筛选的版本。

Leave a Comment

加州大学圣地亚哥分校和Meta AI研究人员引入MonoNeRF:一种自动编码器架构,通过相机编码器和深度编码器将视频分解为相机运动和深度图

加利福尼亚大学圣地亚哥分校(UC San Diego)和 Meta AI 的研究人员提出了 MonoNeRF。这种新颖的方法可以从单目视频中学习可推广的神经辐射场(NeRF),而无需依赖于真实相机姿态。 该工作强调了 NeRF 在各种应用中展现出的有希望的结果,包括视图合成、场景和物体重建、语义理解和机器人技术。然而,构建 NeRF 需要精确的相机姿态注释,并且限制于单个场景,导致训练耗时长且适用性有限。 针对这些挑战,最近的研究工作集中于在包含多个场景的数据集上进行训练,然后在各个场景上进行微调,以学习可推广的 NeRF。这种策略可以使用较少的视图输入进行重建和视图合成,但仍需要在训练过程中提供相机姿态信息。虽然一些研究人员尝试了在没有相机姿态的情况下训练 NeRF,但这些方法仍然局限于特定场景,并且由于自监督校准的复杂性而难以在不同场景之间进行泛化。 MonoNeRF 通过在捕捉静态场景中的相机运动的单目视频上进行训练,有效消除了对真实相机姿态的需求。研究人员关键观察到,真实世界的视频通常呈现缓慢的相机变化而不是多样的视角,他们利用了这种时间连续性来构建他们提出的框架。该方法涉及一个基于自动编码器的模型,该模型在大规模的真实世界视频数据集上进行训练。具体而言,深度编码器估计每个帧的单目深度,而相机姿态编码器确定连续帧之间的相对相机姿态。然后,利用这些解耦表示来构建每个输入帧的 NeRF 表示,然后根据估计的相机姿态对另一个输入帧进行解码。 模型使用重建损失进行训练,以确保渲染和输入帧之间的一致性。然而,仅依赖重建损失可能会导致一个平凡的解决方案,因为估计的单目深度、相机姿态和 NeRF 表示可能不在同一个尺度上。研究人员提出了一种新颖的尺度校准方法来解决在训练过程中对齐这三种表示的挑战。他们提出的框架的关键优势有两个方面:它消除了 3D 相机姿态注释的需求,并在大规模视频数据集上展现了有效的泛化性,从而提高了可迁移性。 在测试时,学习到的表示可以应用于各种下游任务,例如从单个…

Leave a Comment

加州大学伯克利分校的研究人员提出了一种名为“后见之链(CoH)”的新技术,可以使LLMs从任何形式的反馈中学习,提高模型性能

在过去的几年里,大规模神经网络引起了研究人员的广泛关注。这主要是因为它们在各种任务中表现出色,包括自然语言理解、解决具有挑战性的数学方程,甚至蛋白质结构预测。然而,为了确保这些模型对社会做出建设性贡献,关键是它们与人类价值观保持一致,并考虑人类偏好。使用人类反馈是实现这一目标最重要的方面之一,因为它使人类能够根据一系列指标(如准确性、公平性、偏见等)评估这些模型的性能,并提供改进这些模型以产生更具伦理输出的见解。为了提高整合用户反馈的效率,研究人员在过去几年中一直在尝试多种人机协同系统的方法。结果表明,ChatGPT和InstructGPT在使用人类反馈进行学习方面取得了惊人的成果。 这种语言建模的性能提升主要归因于依赖监督微调(SFT)和利用人类反馈进行强化学习(RLHF)的策略。尽管这些策略在提高语言模型性能方面做出了显著贡献,但它们也有自己的缺点。SFT主要依赖于人工注释,使得这些模型难以使用并且在数据利用上效率低下。另一方面,由于强化学习是基于奖励函数的,优化这些模型非常具有挑战性。 为了解决这些问题,加州大学伯克利分校的研究人员开发了一种将所有反馈转化为句子并使用它们来微调模型以理解反馈的新技术。这种技术被称为“回顾链”(CoH),它在很大程度上受到人类如何处理以语言形式提供的大量反馈的启发。研究人员在设计这种技术时的目标是结合SFT和RLHF的优势,同时避免使用强化学习来充分利用所有反馈。他们目前的方法利用语言理解和学习反馈的能力,最终提高模型在执行各种任务时的准确性和效果。 研究人员利用人类从语言形式的丰富反馈中学习得很好的事实。鉴于预训练语言模型在上下文中有效学习的卓越能力,研究人员想知道是否可以将所有反馈都转化为一个句子,并训练模型遵循这些反馈。更详细地说,研究人员建议微调模型以预测结果,同时依赖于一个或多个排序结果及其比较形式的反馈。CoH在训练过程中随机选择一个或多个模型输出,并利用它们构建一个包含正面和负面比较反馈的句子。例如,两个示例句子可以是“以下是一个糟糕的摘要”和“以下摘要更好”。模型在推理时使用正面反馈生成所需的输出。 CoH方法允许模型从正面和负面反馈中学习,以识别和纠正负面属性或错误。该策略还具有其他一些优点,包括更有机的反馈样式和一个训练系统。此外,根据研究人员进行的众多实验评估,CoH技术在关联语言模型与人类偏好方面远远优于先前的方法。该方法在人类评估中受到青睐,并在摘要和讨论任务上表现出色。加州大学伯克利分校的研究团队坚信,CoH在未来在各种其他类型的反馈(如自动和数值反馈)中具有巨大潜力。

Leave a Comment

这篇来自乔治亚理工学院的人工智能论文提出了一种人工智能方法,以更快、更可靠的方式帮助识别潜在超导体的新候选材料

超导体,在降至临界温度以下时,不受电阻的限制,表现出零电阻的特性。这种超导体的奇妙特性为能源、交通运输和尖端电子学等领域的实际应用打开了大门。在过去的十年里,人们在寻找高临界温度超导体方面取得了重大进展。在这篇论文中,来自乔治亚理工学院和河内科技大学(越南)的研究人员提出了将原子级信息纳入机器学习路径以发现新的常规(或BCS)超导体的第一步,尤其是在常压下。 由于缺乏原子级信息,对于研究学者来说,预测零温下的高温超导性是一项具有挑战性的任务。研究人员精心策划了一个包含584个原子结构的数据集,其中包含了在不同压力下计算得到的超过1100个λ和ωlog的值。他们开发了用于λ和ωlog的机器学习模型,并用它们来筛选材料项目数据库中的80,000多个条目,揭示了(通过第一性原理计算)两种在热力学和动力学上都稳定的材料,其超导性可能存在于Tc约等于10-15K和P = 0的情况下。他们使用matminer软件包将原子结构转换为数值向量,并使用高斯过程回归作为机器学习算法来实现这一点。 研究人员使用机器学习模型对35个候选材料进行了超导性能预测。其中有六个具有最高预测的Tc值。其中一些是不稳定的,需要进行进一步的稳定性计算。在验证了剩下两个候选材料,即CrH和CrH2的稳定性之后,他们使用第一性原理计算了这些材料的超导性能。研究人员使用局域密度近似(LDA)XC功能验证了他们的预测,并进行了额外的计算,确认预测结果与报告值的准确度在2-3%之内。此外,研究人员通过追踪无机晶体结构数据库(ICSD)中的起源,调查了超导体的可合成性。他们发现这些材料在过去已经进行了实验合成,并希望未来的测试能够证实它们的预测超导性。 在未来的研究中,研究人员计划通过扩大和多样化数据集,使用深度学习技术,并整合逆向设计策略来提高他们的机器学习方法,以高效地探索实际上无限的材料。研究人员设想进一步改进他们的方法,以便更好地发现高Tc超导体,并与实验专家合作进行实际测试和合成。 查看论文。感谢该项目上的研究人员进行这项研究。此外,请务必加入我们的26k+ ML SubReddit、Discord频道和电子邮件通讯,我们在这里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 本文来源:MarkTechPost,《AI论文:乔治亚理工学院提出一种人工智能方法,以更快、更可靠的方式帮助识别潜在超导体的新候选材料》。

Leave a Comment

来自加州大学伯克利分校和Deepmind的研究人员提出了SuccessVQA:一种适用于预训练的VLMs(如Flamingo)的成功检测的重新表述

为了实现最佳性能准确性,了解代理在训练过程中是否在正确或首选的轨道上至关重要。这可以通过在强化学习中为代理提供奖励或使用评估指标来判断最佳策略来实现。因此,在训练先进的智能代理时,能够检测到这种成功行为变得至关重要。这就是成功检测器的作用,它们可以用来分类代理的行为是否成功。先前的研究表明,开发特定领域的成功检测器相对比较容易,而开发更通用的成功检测器则更加困难。这是因为定义大多数实际任务的成功是相当具有挑战性的,因为它常常是主观的。例如,一幅由人工智能生成的艺术作品可能会让某些人着迷,但对整个观众来说可能并非如此。 在过去的几年里,研究人员提出了不同的方法来开发成功检测器,其中之一是使用偏好数据进行奖励建模。然而,这些模型存在一定的缺陷,因为它们只在固定的任务集和环境条件下表现出可观的性能,这些任务和环境条件都是在偏好注释的训练数据中观察到的。因此,为了确保泛化性能,需要更多的注释来覆盖各种领域,这是一项非常费时费力的任务。另一方面,当涉及到同时使用视觉和语言作为输入的模型训练时,可泛化的成功检测应该确保在语言和视觉上的变化中都能给出准确的度量,以完成指定的任务。现有的模型通常只针对固定条件和任务进行训练,因此无法适应这种变化。此外,适应新的条件通常需要收集新的带注释的数据集并重新训练模型,这并不总是可行的。 在解决这个问题的过程中,Alphabet子公司DeepMind的研究人员团队开发了一种训练稳健成功检测器的方法,可以抵御语言规范和感知条件的变化。他们通过利用大规模预训练的视觉语言模型(如Flamingo)和人类奖励注释来实现这一目标。研究基于研究人员的观察,即对Flamingo进行大量多样化语言和视觉数据的预训练将导致训练更稳健的成功检测器。研究人员声称他们最重要的贡献是将可泛化的成功检测任务重新定义为视觉问答(VQA)问题,称为SuccessVQA。这种方法将任务定义为一个简单的是/否问题,并使用一个统一的架构,该架构只包括定义状态环境的短视频剪辑和描述所需行为的一些文本。 DeepMind团队还证明了通过使用人类注释来微调Flamingo可以实现在三个主要领域的可泛化成功检测。这些领域包括家庭模拟中的交互式自然语言代理、现实世界中的机器人操作和野外自我中心人类视频。SuccessVQA任务公式的通用性使得研究人员可以对来自不同领域的各种任务使用相同的架构和训练机制。此外,使用像Flamingo这样的预训练视觉语言模型使得充分利用在大型多模态数据集上的预训练优势变得相当容易。团队认为这使得在语言和视觉变化方面实现了泛化。 为了评估他们对成功检测的重新定义,研究人员进行了几个实验,涵盖了未见过的语言和视觉变化。这些实验揭示了预训练的视觉语言模型在大多数分布内任务上具有可比性的性能,并在分布外场景中明显优于任务特定的奖励模型。调查还揭示了这些成功检测器能够在语言和视觉上对未见过的变化进行零样本泛化,而现有的奖励模型则无法。尽管DeepMind研究人员提出的这种新方法具有显著的性能,但在与机器人环境相关的任务中仍然存在某些缺点。研究人员表示,他们未来的工作将涉及在这个领域做出更多的改进。DeepMind希望研究社区将他们的初步工作视为实现成功检测和奖励建模方面更多进展的基石。

Leave a Comment

认识Quivr:一个开源项目,旨在像第二个大脑一样存储和检索非结构化信息

在过去的几年中,OpenAI领域持续增长。许多大学的研究人员建立了开源项目,为数据科学领域的发展做出了贡献。Stan Girar建立的一个开源项目是Quivr。它也被称为第二大脑,因为它可以存储按照目前数据模型或模式未排列的数据,因此无法存储在传统的关系数据库或RDBMS中。文本和多媒体是两种常见的非结构化内容。 它有一个官方网站,通过点击“试用演示”按钮可以访问Quivr的高级版本。如果有人想要无限制地使用Quivr,则可以将其下载到本地设备上。安装Quivr有一套正确的程序。我们应该将Quivr存储库克隆到本地设备上,然后导航到它。我们还应该创建一个虚拟环境,然后在我们的设备上激活它。我们还应该安装所有依赖项,复制Streamlit秘密,并添加重要的凭据。最后,我们应该能够通过这些步骤运行Quivr应用程序。您还可以从OpenAI的官方网站获取参考。您还应该在设备上预装官方和最新版本的Python。您还应该拥有一个官方工具,可以在您想要安装Quivr的本地设备上创建一个虚拟的Python编程环境。 Quivr openAI软件还具有各种功能,使其成为存储非结构化数据和信息的重要工具。Quivr可以存储任何数据集,如图像、文本、代码模板、演示文稿、文档、CSV和xlsx文件、PDF文档,甚至更多其他内容。它还借助自然语言处理技术帮助生成信息和产生更多数据。它还可以通过先进的人工智能帮助我们找回丢失的信息。它的速度非常快,尽可能快地访问我们的数据集,并通过输出传递给我们。在Quivr中,数据不会丢失,因为它被正确地存储在云端。 Quivr是一个开源应用程序,将其信息检索能力与云系统集成在一起。它将成为未来几乎每个人都用来提高生产力的软件。使用Quivr的主要优势是可以同时处理多种工具。在未来的数据科学和人工智能领域,它即将成为一项新兴技术。

Leave a Comment

法国国家科学研究中心(CNRS)的人工智能研究提出了一种噪声自适应智能可编程元成像器:一种及时应对特定任务、噪声自适应感知的方法

法国国家科学研究中心的研究人员提出了一种噪声自适应智能可编程元成像器。感知系统在我们生活的许多方面中越来越广泛地使用,包括非接触式人机界面、无人驾驶车辆和环境支持的医疗保健。然而,这些系统通常缺乏智能,因为它们有收集所有信息的倾向,而不管其是否相关。这可能导致隐私侵犯,同时在处理数据时也会浪费时间、精力和计算资源。 然而,在实际应用中,测量过程总是受到不同类型的噪声的影响。每个测量都伴随着噪声。特别是在室内环境中,传输的电磁信号必须保持适度,信噪比可能较低。为了推进先前的研究,法国国家科学研究中心的研究人员现已开发了一种智能可编程计算元成像器,不仅可以根据特定的信息提取任务(如物体识别)调整其照明模式,还可以适应各种类型和水平的噪声。 某种类型和强度的噪声不可避免地影响测量过程。我们假设噪声的类型和数量将影响智能可编程元成像器应该使用的最佳相干照明模式,以有效地从图像中提取特定任务的信息。该系统被认为是一种单发射器、单探测器多次拍摄的可编程计算成像系统。这些系统在微波领域尤为重要,因为昂贵的收发器可以被可编程的元表面孔径所取代,后者可以从单个射频链合成相干波前。 研究人员根据研究仔细探讨了延迟限制和噪声对智能多次拍摄可编程元成像器的影响。研究人员研究了一个常见的物体识别问题,并提出了一个微波计算可编程元成像器系统来测试他们的理论。这些系统可以用于地球观测、室内监控等领域。 在他们的模型中,一个微波动态元表面天线(DMA)使用单个发射器向场景发送一系列相干波前,而第二个DMA使用单个探测器相干地收集反射波。他们开发了一个可微分的端到端信息流管道,包括未来的数字处理阶段以及带有噪声的可编程物理测量过程。 这种联合优化,涉及对可训练的物理参数和可训练的数字参数进行任务特定的端到端联合优化,使测量过程具有任务意识,使其能够区分与手头任务相关的模拟域信息和与任务无关的信息。 科学家发现,在信息受到延迟约束和/或噪声约束的情况下,这种可编程元成像器生成一系列与任务和噪声相关的场景照明,比传统的具有随机配置的压缩感知方法表现更好。 这种方法虽然具有“黑盒”特性,但研究人员发现,学习到的光照模式的“宏观”方面,尤其是它们的互相重叠和强度,是直观可理解的。 根据研究人员的说法,向一个能够自动识别噪声类型和数量并相应地修改其DMA设置的系统过渡是简单的,而无需额外的人类输入。

Leave a Comment

马里兰大学的新人工智能研究探讨了在一天内使用单个GPU训练语言模型的压缩挑战

在自然语言处理的许多领域中,包括语言解释和自然语言合成,利用变压器拓扑的大规模机器学习模型的训练取得了突破性的进展。这些系统的广泛认可行为是它们在模型参数数量和数据量增加时能够稳定扩展或继续表现更好的能力。 虽然大多数研究都集中在寻找推动极端计算边界的新方法上,但马里兰大学的研究人员正在研究最佳的语言模型训练规模缩减方式和可能出现的权衡。 研究人员认为,由于规模效应带来的竞争,他们可以训练一个语言模型。最初的BERT模型在自然语言处理的许多实际应用中得到了使用。然而,这个模型已经需要大量计算才能训练。 在资源相对有限的情况下,有可能训练一个接近BERT性能水平的语言模型,这带来了许多有趣的后果。一个原因是,如果缩减模型的预训练是大规模计算预训练的有效替代品,那么它将开辟一系列目前难以实现的额外学术研究。研究人员表示,可能会出现一些场景,从业者有兴趣利用专门的或可靠的数据源重新训练他们的语言模型,但法律因素使得不确定是否可以接受在具有可疑来源的公共数据上训练的模型。 马里兰大学的研究人员进行了一项新研究,探索了“挤压”挑战——在考试前一天学习整个语言模型。他们的研究证明,在这种受限情况下,性能与大规模计算环境中发现的缩放规律密切相符。为了确定对训练流程的更改是否会导致缩小的情况下性能的提高,该研究首先研究了各种训练流程方面。 缩小规模是具有挑战性的。虽然较小的模型设计可以实现更快的梯度计算,但随时间的推移,模型改进的整体速率几乎保持不变。然而,利用缩放定律的训练配方修改可以通过增加梯度计算的有效速率而获得收益,而不需要减小模型的大小。最终,团队能够在有限的预算下训练模型并提供可观的性能,在GLUE任务中经常接近甚至超过BERT。 团队评估了将基于变压器的语言模型放入计算资源非常有限的情况下的性能。他们发现,多个变化方面导致在GLUE上可观的下游性能。团队希望这项工作可以作为对挤压问题进行调查的起点,并对多种改进和策略提供额外的见解。

Leave a Comment

微软AI研究提出了一种新的训练策略AltFreezing:用于更广泛的人脸伪造检测

由于面部生成和操作工具的迅速发展,面部视频提供的身份或质量现在可以非常容易地改变和操纵。这对于制作搞笑视频、电影和其他媒体类型具有几个重要和惊人的用途。然而,这些方法也可能被恶意利用,导致社会对安全和信心的重大危机。因此,学习如何识别视频面部伪造最近成为一项热门研究课题。 迄今为止,一种有效的研究方法尝试通过寻找生成图像中的“空间”伪迹(例如棋盘格、不自然和生成模型底层的伪迹等)来区分真实和虚假照片。这些技术在寻找空间相关伪迹时有着显著的效果。然而,它们忽略了视频的时间连贯性,错过了视频面部伪造中的“时间”伪迹,如闪烁和不连续性。最近的研究注意到了这个问题,并努力通过使用时间线索来解决它。 由此产生的模型可以在时间级别上识别不自然的伪迹,但它们需要提高对与空间相关的伪迹的检测能力。他们试图在这项研究中捕捉空间和时间伪迹,以识别广泛的视频面部伪造。一种有效的时空网络(3D ConvNet)通常可以搜索空间和时间伪迹。然而,他们发现纯粹的训练可能会使其过于依赖空间伪迹,而忽视时间伪迹,从而导致推理能力较差。这样一来,3D卷积网络可能更容易依赖空间伪迹,因为空间伪迹通常比时间不连贯更可见。 因此,问题在于使时空网络能够捕捉到时间和空间伪迹。中国科学技术大学、微软亚洲研究院和合肥综合国家科学中心的研究人员在本研究中提出了一种创新的训练方法,称为AltFreezing,以实现这一目标。重要的概念是在整个训练过程中交替冻结与空间和时间相关的权重。具体构建了一个使用1×Kh×Kw空间卷积和Kt×1×1时间卷积的3D resblocks的时空网络。通过这些空间和时间卷积核,分别捕捉到了空间和时间级别的特征。为了克服空间和时间伪迹,他们的AltFreezing技术促使两组权重交替更新。 此外,他们提供了一套用于创建视频级别虚假内容的工具。这些技术可以分为两类。第一类是伪造剪辑,它们仅使用时间伪迹,随机重复和删除实际剪辑的帧。第二类剪辑是通过将一个真实剪辑的一部分与另一个真实剪辑混合而成,它只有空间伪迹。这些视频增强技术是首次产生既有空间又有时间限制的虚假视频。这些改进有助于时空模型捕捉到空间和时间伪迹。通过上述两种方法,他们可以在各种困难的面部伪造检测场景中处于前沿地位,包括对未见伪造的泛化和对各种扰动的鲁棒性。 以下是他们的三个主要贡献: • 他们建议研究用于检测视频面部伪造的空间和时间伪迹。提出了一种名为AltFreezing的全新训练技术来实现这一目标。 • 他们提供了视频级别的虚假数据增强技术,以推动模型捕捉更广泛的伪造。 • 在包括对操作和数据集的评估在内的五个基准数据集上进行了广泛的测试,结果显示该方法达到了最新的性能水平。

Leave a Comment

认识Powderworld:一个轻量级的模拟环境,用于理解人工智能的泛化

尽管强化学习(RL)和决策过程中取得了最近的进展,但对新任务的概括能力仍然是最主要的问题之一。 RL代理在单任务设置下表现出色,但在面对意外障碍时经常犯错误。此外,单任务RL代理可以在训练时过度拟合任务,使其不适用于实际应用。这就是通用代理的用处所在,它可以成功处理各种前所未有的任务和意外困难。 大多数通用代理都是通过多样化的任务进行训练的。最近的深度学习研究表明,模型的概括能力与使用的训练数据量密切相关。然而,主要问题在于开发训练任务是昂贵且困难的。因此,大多数典型设置在本质上过于具体和狭窄,只关注单一任务类型。这个领域的大部分先前研究都集中在多任务训练的专门任务分布上,特别关注特定的决策问题。强化学习社区将从“基础环境”中获得巨大的好处,该环境允许各种任务源自相同的核心规则,因为越来越需要研究训练任务和概括之间的联系。此外,一个简单比较不同训练任务变化的设置也将是有利的。 为了支持代理学习和多任务概括,麻省理工学院计算机科学与人工智能实验室(CSAIL)的两位研究人员设计了Powderworld,一个仿真环境。这个简单的仿真环境直接在GPU上运行,有效地提供环境动力学。在目前的Powderworld中,还包括两个用于指定世界建模和强化学习任务的框架。虽然在强化学习实例中发现,任务复杂性的增加促进了概括,直到达到特定的拐点后表现下降,但在越来越复杂的环境中训练的世界模型展示了改进的传递性能。团队认为这些结果可以作为进一步社区研究的绝佳跳板,利用Powderworld作为调查概括的初始模型。 Powderworld的开发旨在具有模块化和支持新兴交互的能力,同时又不损失其表达设计的能力。规定附近两个元素应该如何相互作用的基本原则构成了Powderworld的核心。这些规范的一致性为代理的概括能力提供了基础。此外,这些局部互动可以扩展为产生新兴的大规模现象。因此,代理可以通过使用这些基本的Powderworld先验知识进行概括。 RL概括的另一个重要障碍是任务经常是不可调整的。理想的环境应该提供一个空间,可以探索并代表有趣的目标和挑战的任务。每个任务都由Powderworld表示为一个二维元素数组,允许使用各种程序化创建技术。代理更有可能面对这些障碍,因为评估特定代理能力的方式有很多种。由于Powderworld是在GPU上运行的,它可以并行执行大规模的仿真批处理,从而实现高效的运行时。这个优势变得至关重要,因为多任务学习可能非常计算密集。此外,Powderworld使用与神经网络兼容的矩阵形式进行任务设计和代理观察。 在最新版本中,团队为在Powderworld内训练世界模型提供了初步的基础。世界模型的目标是预测在一定数量的仿真时间步骤之后的状态。由于Powderworld实验应该关注概括,所以世界模型的性能是在一组保留的测试状态上报告的。基于多个研究,团队还发现,使用更复杂的训练数据的模型在概括方面表现更好。在训练过程中暴露给模型的元素越多,性能越好,这表明Powderworld的逼真仿真足够丰富,可以改变世界模型的表示。 团队专注于探索用于强化学习的随机多样性任务,其中代理在测试中必须克服未知的障碍。实验评估显示,增加训练任务的复杂性有助于概括,直到任务特定的拐点后,过于复杂的训练任务会在强化学习过程中导致不稳定性。这种复杂性对Powderworld世界建模和强化学习任务中训练的影响的区别引起了有趣的研究问题,这是未来的研究重点。 强化学习的一个主要问题是对新的未经测试的任务进行概括。为了解决这个问题,麻省理工学院的研究人员开发了Powderworld,一个可以为监督学习和强化学习产生任务分布的仿真环境。Powderworld的创建者期望他们的轻量级仿真环境能够促进进一步的研究,以开发一个既强大又计算有效的任务复杂性和代理概括的框架。他们预计未来的研究将利用Powderworld来研究无监督环境设计策略和开放式代理学习以及其他各种主题。

Leave a Comment

介绍DiffusionDet:一种利用扩散进行目标检测的人工智能(AI)模型

目标检测是一种强大的技术,用于识别图像和视频中的物体。借助深度学习和计算机视觉的进展,它近年来取得了长足的发展。它有潜力在从交通和安全到医疗和零售的各个行业中引发革命。随着技术的不断改进,我们可以期待在目标检测领域看到更多令人兴奋的发展。 目标检测中的一个关键挑战是准确地定位图像中的物体。这涉及到确定物体是否存在以及确定其精确的位置和大小。 大多数目标检测器使用回归和分类技术的组合来识别图像中的物体。通常通过查看图像的特定区域,如滑动窗口或区域建议,并使用这些作为“引导”来帮助识别物体。其他方法,如锚框或参考点,也可以帮助目标检测。 尽管这些目标检测技术相对简单且有效,但它们依赖于一组固定的预定搜索条件。大多数情况下需要定义一组候选物体。然而,定义所有这些预定条件可能很繁琐。是否有一种更简化这个过程而无需这些预定搜索准则的方法? 腾讯的研究人员提出了DiffusionDet,这是一种在目标检测中使用的扩散模型。 在过去几个月中,扩散模型一直是人工智能界的关注中心,主要得益于稳定扩散模型的公开发布。简单来说,扩散模型将输入作为噪声,并逐渐去噪,遵循一定的规则,直到得到期望的输出。在稳定扩散的背景下,输入是通过文本提示获得的噪声图像,并且在逐渐去噪,直到获得与给定文本提示类似的图像。 那么,扩散方法如何用于目标检测?我们不是在生成新的东西,而是想知道给定图像中的物体。他们是如何做到的? DiffusionDet的概览。来源:https://arxiv.org/pdf/2211.09788.pdf 在DiffusionDet中,设计了一种新颖的框架,用于直接从一组随机框中检测物体。这些框在训练期间不包含需要优化的可学习参数,预期通过噪声到框的方法逐渐精确地覆盖目标物体。 将这些框想象成输入噪声,这里的约束是它们应该包含一个物体。因此,最终我们希望得到一组包含不同物体的框。去噪步骤是逐渐改变框的大小和位置。这种方法不需要启发式的对象先验和可学习的查询,简化了物体候选的识别,并推动了检测流水线的发展。 DiffusionDet的框架。来源:https://arxiv.org/pdf/2211.09788.pdf DiffusionDet将目标检测视为涉及图像中边界框位置和大小的生成任务。在训练过程中,通过方差调度控制的噪声被添加到地面实况框中,创建了带有噪声的框,然后使用这些框从骨干编码器的输出特征图中裁剪特征。然后,将这些特征发送到检测解码器,该解码器被训练以无噪声地预测地面实况框。这使得DiffusionDet能够从随机框中预测地面实况框。在推理时,DiffusionDet通过反向学习扩散过程并调整噪声先验分布到学习到的边界框分布来生成边界框。

Leave a Comment

在人工智能(AI)中使用模拟计算机

模拟计算机是一类设备,其中物理量如电压、机械运动或流体压力被表示为与问题中相应数量相似的量。 这是一个模拟计算机的简单示例。 来源:https://www.youtube.com/watch?v=IgF3OX8nT0w&t=763s 如果我们按一定量转动黑色和白色的轮子,灰色的轮子显示两个旋转的总和。 最早的模拟计算机之一是公元前100-200年左右建造的安提基瑟拉机械。它由一系列相互连接的青铜齿轮组成,某些指针的运动类似于太阳和月亮的运动。它还能够提前几十年预测日食。 来源:https://arstechnica.com/science/2021/03/scientists-solve-another-piece-of-the-puzzling-antikythera-mechanism/ 模拟计算机的优点和缺点 要添加两个八位数,需要大约50个晶体管。然而,使用模拟计算机,我们只需将两根电线连接起来即可相加两个电流。同样,要乘以两个数,我们需要1000多个晶体管。相反,我们可以通过电阻(R-欧姆)通过电流(I安培),线两端的电势差将是I*R,即两个数的乘积。 模拟计算机功能强大、快速且能源高效。然而,数字计算机取代了它们,因为它们是单用途的且不准确,而且由于输入是连续的,很难完全重复过程。 模拟计算机与人工智能 在人工智能中,模拟计算机用于各种任务,包括模式识别、决策和控制。例如,它们被用于训练神经网络,这是受人脑结构和功能启发的机器学习模型。模拟计算机还用于实现基于规则的人工智能系统,这些系统使用特定规则进行决策或采取行动。 尽管在过去广泛使用,但模拟计算机在人工智能和机器学习中已不再常见,这主要是由于数字计算机的出现。数字计算机比模拟计算机更快速、可靠,可以存储和处理更大量的数据。此外,数字计算机更易于编程和维护,这使其成为大多数人工智能和机器学习应用的首选。 模拟计算机在人工智能中的应用增加 在机器学习和人工智能应用中,使用更大的神经网络的趋势越来越明显。这一趋势是由于需要在日益复杂的任务上提高性能,以及更多的数据、硬件和算法来支持更大网络的训练。然而,这种增加的需求也带来了一些挑战。 训练一个大型神经网络需要的能量相当于三个家庭一年的平均消耗量。 现代计算机将数据存储在内存中,并根据需要访问。但是当神经网络需要大规模矩阵乘法时,大部分能量用于获取权重的值,而不是执行计算。 根据摩尔定律,芯片上的晶体管数量传统上每两年翻一番。然而,我们现在正接近晶体管的尺寸接近原子尺寸的点,这对进一步微型化带来了重大的物理挑战。 随着数字计算机接近其极限,神经网络在矩阵乘法上的广泛应用使其受到了广泛关注。此外,神经网络不要求数字计算机进行精确计算,对于将图像分类为狗的置信度达到98%或95%即可。这些因素为模拟计算机在人工智能领域扮演更重要的角色提供了绝佳机会。 案例研究: Mythic AI Mythic AI 是一家模拟计算初创公司,致力于创建用于运行神经网络的模拟芯片。不同的人工智能算法,如动作检测、深度估计、对象分类等,都在模拟领域中运行。 Mythic修改了数字闪存单元,使其能够实现这一点。这些单元通常用于存储内存,可以存储1或0。将正电压应用于控制栅,电子将穿过绝缘层并被困在浮动栅上。然后可以去除电压,电子将长时间保持在浮动栅上,阻止电流通过该单元。…

Leave a Comment

Salesforce AI和哥伦比亚大学的研究人员推出DialogStudio:一个保留原始信息的统一而多样化的对话数据集合,包含80个对话数据集

近年来,对话式人工智能取得了重大进展,使得机器和用户之间的交互更加类似于人类之间的交流。推动这一进展的关键组成部分之一是大规模且多样化的数据集,这些数据集为训练复杂的语言模型提供了基础。Salesforce AI和哥伦比亚大学的研究人员推出了DialogStudio,作为一项开创性的倡议,为研究提供了一个包含统一对话数据集的综合性收集平台,以及训练大型语言模型(LLM)的支持。 统一对话数据集的需求 开发高效且多功能的对话式人工智能系统需要访问覆盖各个领域和对话类型的多样化数据集。传统上,不同的研究小组贡献了旨在解决特定对话场景的数据集。然而,这种分散的方法导致了对数据集之间更多标准化和互操作性的需求,使得比较和集成变得更加困难。 DialogStudio通过汇总33个不同的数据集来填补这一空白,这些数据集代表了多个类别,如知识驱动对话、自然语言理解、开放领域对话、任务导向对话、对话摘要和对话推荐。统一过程保留了每个数据集的原始信息,同时促进了无缝集成和跨领域研究。 对话质量评估 为了确保数据集的质量和适用性,DialogStudio采用了一套全面的对话质量评估框架。根据六个关键标准(理解、相关性、正确性、连贯性、完整性和整体质量)评估对话,使得研究人员和开发人员能够有效衡量模型的性能。评分范围为1到5分,分数越高表示对话质量越好。 通过HuggingFace实现无缝访问 DialogStudio通过HuggingFace提供了方便访问其庞大的数据集收藏。研究人员可以通过声明与DialogStudio中的数据集文件夹名称相对应的数据集名称来快速加载任何数据集。这一简化流程加速了对话式人工智能模型的开发和评估,节省了宝贵的时间和精力。 模型版本和限制 DialogStudio提供了基于选定数据集训练的1.0版本模型。这些模型基于小规模预训练模型,并且不包括用于训练像Alpaca、ShareGPT、GPT4ALL、UltraChat等大规模数据集的模型,也不包括OASST1和WizardCoder等其他数据集。尽管在创造性能力方面存在一些限制,但这些模型为开发复杂模型提供了一个坚实的起点。 DialogStudio是发展对话式人工智能的一个重要里程碑,提供了一个统一且广泛的对话数据集收藏。通过将多样化的数据集集中在一个平台上,DialogStudio使得研究人员和开发人员能够探索对话式人工智能的新领域,为机器和用户之间更加复杂、类似于人类的交互铺平了道路。凭借其持续改进和社区参与的关注,DialogStudio注定将在未来多年中塑造对话式人工智能的未来。

Leave a Comment

部署机器学习模型意味着什么?

数据科学是一个有前景的领域,吸引着越来越多的公司,但它在工业化过程中的整合仍然面临困难。在大多数情况下,机器学习(ML)模型在科学研究环境中离线实现。创建的模型中有近90%从未在生产条件下部署。部署可以定义为将ML模型集成到现有生产环境中以实现有效的数据驱动业务决策的过程。这是机器学习生命周期的最后阶段之一。然而,近年来,ML已经从纯粹的学术研究领域发展为可以解决实际业务问题的领域。然而,在操作系统中使用机器学习模型可能会面临各种问题和担忧。 在生产环境中定义ML模型有几种方法,具体取决于范围的不同优势。大多数数据科学家认为,部署模型是软件工程任务,应由软件工程师处理,因为所需的所有技能更与他们的日常工作密切相关。 像Kubeflow和TFX这样的工具可以解释整个模型部署过程,数据科学家应该使用它们。使用Dataflow等工具可以与工程团队密切合作。它可以设置临时环境,在部署之前可以测试数据管道的部分。 部署过程可以分为四个主要步骤: 1)准备和配置数据管道 第一项任务是确保数据管道结构高效,并能提供相关且高质量的数据。确定如何在部署后扩展数据管道和模型非常重要。 2)访问相关的外部数据 在部署生产预测模型时,必须注意使用最佳的数据,从合适的来源从概念到发布。即使仔细设计,一个破损的模型也是无用的。此外,此挑战的另一个要素是捕获足够的历史数据以获得稳健且具有普适性的模型。一些公司会内部收集所需的所有数据。为了全面了解和洞察,考虑包括外部数据源。 3)构建强大的测试和训练自动化工具 在进入预测模型部署阶段之前,严密且无妥协的测试和训练是必不可少的,但可能需要时间。因此,为了避免减慢速度,尽可能自动化。除了研究一些节省时间的技巧或工具,还需要生成可以无需工程师任何努力或操作就能工作的模型。 4)规划和设计强大的监控、审计和回收协议 在部署和运行ML模型之前,必须检查它是否实际产生了预期类型的结果。必须验证这些结果是否准确,并且提供给模型的数据能够保持这些模型的一致性和相关性。此外,弱旧数据可能导致不准确的结果。 如果我们更详细地观察机器学习实验,我们会意识到这些实验是在时间上冻结的数据上进行的,也就是说,用于训练模型的数据通常是固定的。换句话说,这些数据不会改变或在实验期间变化很小。在这种情况下,我们称之为封闭模型。在真实世界条件下,模型不断遇到与创建模型时使用的数据相当不同的新数据。因此,模型继续学习并更新其参数非常重要。迅速而轻松地使用新数据重新训练模型非常有趣。模型重新训练是指开发具有与原始模型不同属性的新模型。重要的是能够重新部署此模型以获得其新功能的好处。 总之,部署ML模型是一个具有挑战性的过程,要成功完成,需要对ML模型的使用和利用周围的所有关注点有全面的理解。一个人很少具备完成所有这些过程所需的必要才能: 了解公司的需求 创建ML模型。 使模型工业化 批量或实时收集数据 在数据上使用部署的模型 因此,数据科学家很难独自完成所有这些过程。 数据工程师、软件工程师和数据科学家之间的合作至关重要。 总之,数据科学项目的成功受到所需才能的多样性和每个团队对问题的全面理解的影响。

Leave a Comment

基于草图的图像到图像翻译:利用生成对抗网络将抽象草图转化为逼真图像

有些人擅长素描,而其他人可能在其他任务上有天赋。当给出一张鞋子的图片时,人们可以用简单的线条来代表照片,但素描的质量可能会有所不同。相反,人类具有根据甚至是抽象的绘画进行可视化的内在能力,这是在数百万年的进化过程中培养出来的技能。 随着人工智能和生成模型的出现,从抽象素描生成逼真图像的问题属于图像到图像翻译文献的更广泛背景。这个问题在之前的作品中得到了探索,如pix2pix、CycleGAN、MUNIT和BicycleGAN。其中一些先前的方法,包括针对素描的变体,声称通过生成照片的边缘图来解决类似的问题,这些边缘图突出了素描中物体的重要轮廓和外形。这些边缘图是详细的图片,这意味着这些模型不考虑抽象的素描,而是专注于精细的素描。 本文介绍的论文侧重于基于素描的图像到图像翻译,但与引用的方法有一个重要的区别。它专注于直接从抽象人类素描生成图像,而不是使用照片边缘图。根据作者的说法,使用边缘图训练的模型生成了具有边缘图的高质量逼真照片,但对业余人类素描生成了不现实的结果。这是因为所有先前的方法在翻译过程中都假设像素对齐。因此,生成的结果准确反映了个体的绘画技巧(或其缺乏),导致非艺术家的结果不佳。 因此,非训练有素的艺术家永远不会在这些模型中获得令人满意的结果。然而,本文介绍的新型人工智能方法旨在使素描到照片生成技术民主化。 该技术的架构如下图所示。 https://subhadeepkoley.github.io/PictureThatSketch/ 这种技术能够从素描中生成逼真的图像,而不受素描质量的限制。作者们发现,先前方法中呈现的像素对齐伪影是由于将编码器-解码器架构端到端进行训练所导致的。这导致生成的结果严格遵循输入素描(边缘图)中定义的边界,限制了结果的质量。为了解决这个问题,他们引入了一种解耦的编码器-解码器训练方法。研究人员首先使用StyleGAN仅对照片进行预训练解码器,然后冻结它。这确保生成的结果具有逼真的质量,并从StyleGAN的流形中进行采样。 另一个重要的方面是抽象素描与逼真照片之间的差距。为了解决这个问题,他们训练了一个编码器,将抽象素描表示映射到StyleGAN的潜在空间,而不是通常的实际照片。他们使用地面实况素描-照片对,并对输入素描和生成的照片之间施加了一种新颖的细粒度辨别损失,以确保准确的映射。此外,他们引入了一种局部感知的增强策略来处理素描的抽象性质。这涉及渲染完整素描的部分版本,并根据部分信息的程度适当地分配潜在向量。 在训练他们的生成模型后,研究人员观察到了几个有趣的特性。他们发现,通过调整预测的潜在向量数量和添加高斯噪声,可以轻松地控制生成照片中的抽象级别。由于局部感知的素描增强策略,该模型还对噪声和部分素描表现出鲁棒性。此外,该模型对输入素描的不同抽象级别表现出良好的泛化能力。 下面报告了所提出方法和最先进技术的一系列结果。 https://subhadeepkoley.github.io/PictureThatSketch/ 这是一种新颖的AI生成图像到图像模型的概述,可以从抽象的人类草图合成逼真的图像。如果您对此工作感兴趣并希望了解更多信息,您可以通过点击下面的链接找到更多信息。

Leave a Comment