Press "Enter" to skip to content

Month: November 2023

斯坦福研究人员在大型语言模型的准确性方面创新:自动优先排名和NLP(自然语言处理)进展以降低错误率

来自斯坦福大学和北卡罗来纳大学教堂山分校的研究人员解决了由语言模型产生的事实不准确的音调,也称为幻觉。在无需人工标注的情况下,研究人员对语言模型进行了微调,以增强在开放式生成环境中的事实准确性。利用自然语言处理的最新创新,他们采用了通过与外部知识库一致性评估事实性的方法,并使用直接偏好优化算法进行微调。该方法显著改善了Llama-2的事实性,大大降低了生成传记和医学问题回答方面的事实错误率,达到了7B规模。 各种策略旨在减轻语言模型中的事实错误,包括提示、内部表示扰动和基于检索的方法。在冲突解决和事实保持方面存在挑战,尤其是随着模型规模的增大。FactScore变种采用了训练期间的检索来解决推理时间复杂度的问题。通过微调实现的基于偏好的学习能够有效减少错误事实。该研究引入了一种无参考方法,利用语言模型的不确定性估计真实性。从自动生成的偏好对中学习事实性成为一种省时高效的方法,展示了不需要人工干预的潜力性改进。 该研究侧重于无限制生成环境,提出了一种通过微调语言模型来改善事实性的方法,无需人工标注。他们利用最新的自然语言处理创新,包括通过外部知识库判断事实性和使用直接偏好优化算法。该方法涉及从自动生成的事实性偏好排序中学习,与基准数据集上的其他策略相比,生成传记和回答医学问题的事实错误率显着降低。 本研究在判断事实性方面结合了与外部知识库一致性或模型置信度评分。 使用直接偏好优化算法进行微调,侧重于超越监督模仿的目标。它提出使用现有的检索系统或新颖的无检索方法,从自动生成的事实性偏好排序中学习。评估包括FactScore等自动度量标准,人工评估者的观点,以及与推理时间干预和对比层解码等方法的比较。 该方法证明了从自动生成的事实性偏好排序中学习以提高语言模型事实性的有效性。经过微调的Llama-2模型在生成传记方面的事实错误率降低了58%,在回答医学问题方面降低了40%,与RLHF或解码策略相比。 人工评估者认为FactTune-FS模型优于SFT模型。 GPT-4评估和FactScore评级显示高相关性,表明FactTune-FS在减少事实错误方面取得了成功。 该研究提出了改善语言模型事实性的有效策略,着重于长篇生成。 探索了两种方法:利用外部知识进行基于参考的真实性估计和利用模型的不确定性进行无参考估计。 用任一方法微调语言模型始终能减少错误事实。 无参考方法为事实性改进提供了可扩展的自我监督策略,无需金标准参考语料库。 实验结果显示出有希望的研究方向,建议进一步探索结合事实性调整方法并将方法扩展至更大模型。 未来的研究建议探索事实性调整与现有方法的组合,例如事实性调整DOLA实验。 建议进一步研究将事实性增强的解码技术与事实性调整过程相结合以提高事实性。 通过评估不同方法的组合效果,如事实性调整和推理时间干预,可以提供关于补充机制的见解。 建议研究较简单的提取原子事实的方法,并将事实性调整方法扩展到更大模型,如GPT-4。

Leave a Comment

商汤研究提出Story-to-Motion:一种从长文本生成人类动作和轨迹的新人工智能方法

人工智能正步入几乎每个行业。从一个故事中创造出自然的人类动作有着彻底改变动画、视频游戏和电影行业的能力。其中一项最困难的任务是故事到动作的转换,当角色必须在不同区域移动并执行某些动作时就会出现这种情况。基于详细的书面描述,这项任务需要高级运动语义控制和处理轨迹的低级控制之间的平滑集成。 尽管已经付出了很多努力来研究文本到动作和角色控制,但还没有找到适当的解决方案。现有的角色控制方法有很多局限性,因为它们不能处理文本描述。即使是当前的文本到动作方法也需要更多的位置约束,导致生成不稳定的动作。 为了克服所有这些挑战,一组研究人员提出了一种独特的方法,该方法在生成轨迹方面非常有效,并生成了受输入文本影响的可控且无限长的动作。该方案包括以下三个主要组成部分。 文本驱动的动作调度:现代大型语言模型从长篇的文字描述中获取文本、位置和持续时间的序列,并将它们用作文本驱动的动作调度器。这一阶段确保生成的动作基于故事,并包含有关每个动作位置和长度的细节。 文本驱动的动作检索系统:将运动匹配和运动轨迹和语义的约束相结合,创建了一个全面的动作检索系统。这确保生成的动作满足预期的语义和位置属性,同时还包括文本描述。 渐进式遮罩变换器:设计了一个渐进式遮罩变换器,用于解决转场动作中频繁出现的问题,如脚滑动和不寻常的姿态。这个元素对于提高生成的动作质量、产生过渡更流畅、外观更逼真的动画至关重要。 研究团队表示,该方法已在三个不同的子任务上进行了测试:动作融合、时间动作组合和轨迹跟踪。与早期的运动合成技术相比,评估结果显示在每个方面性能都有所提升。研究人员总结了他们的主要贡献如下。 从长篇文字描述生成全面动作引入了轨迹和语义,从而解决了故事到动作的问题。 提出了一种名为文本驱动的运动匹配的新方法,使用广泛的文本输入提供精确和可定制的运动合成。 在轨迹跟踪、时间动作组合和动作融合子任务中,该方法优于现有技术,这已通过在基准数据集上进行的实验证明。 总之,该系统在从文字叙述中综合生成人类动作方面无疑是一个重大的进步。它为故事到动作工作所带来的问题提供了完整的解决方案。它无疑将对动画、游戏和电影行业产生颠覆性的影响。

Leave a Comment

使用Amazon SageMaker JumpStart进行大规模的文本嵌入和句子相似度检索

在本文中,我们展示了如何使用SageMaker Python SDK进行文本嵌入和句子相似度的使用方法句子相似度涉及在通过LLM将两个文本片段转换为嵌入后,评估它们之间的相似程度,这是像检索增强生成(RAG)这样的应用的基础步骤

Leave a Comment

亚马逊音乐如何利用SageMaker与NVIDIA优化机器学习训练和推理性能及成本

在亚马逊音乐的动态流媒体世界中,每一次搜索歌曲、播客或播放列表都抱有一个故事、一种情绪或一股等待揭示的情感洪流这些搜索成为探索新事物、珍贵经历和持久记忆的门户搜索栏不仅仅是找歌曲的工具;[…]

Leave a Comment

NVIDIA与盖尼特合作,利用生成式人工智能加速药物研发

Roche集团的成员Genentech正在开创性地使用生成型人工智能来发现和开发新的治疗方法,并以更高效的方式向患者提供治疗。 Genentech,这家生物技术先驱与NVIDIA之间的新合作旨在通过将两家公司的专家汇聚在一起,优化和加速Genentech专有的算法,从而改变发现和开发新药物的方式。 NVIDIA将与Genentech合作,加速在NVIDIA DGX Cloud上进行这些模型,该平台提供由NVIDIA云服务提供商合作伙伴托管的专用AI超级计算机实例和软件。 Genentech计划使用NVIDIA BioNeMo,该平台能够使生物技术公司以规模化方式定制模型,并将BioNeMo云应用程序接口直接整合到计算药物发现工作流程中。 BioNeMo现已作为训练服务提供,它是一个领域特定的平台,简化、加速和扩展了计算药物发现的生成型人工智能应用程序。它使研究人员能够在DGX Cloud上对最先进的模型进行预训练或微调。 这次合作最初的重点将放在优化Genentech的药物发现AI模型上,以实现“实验室循环”框架。目标是使研究人员能够理解复杂的生物分子模式和关系,真正颠覆药物研发,提高研发的成功率,并赋予科学家为患者和更广泛的医疗生态系统带来乘法效益,而不是线性或加法效益。 Genentech研究与早期发展执行副总裁Aviv Regev表示:“我们与NVIDIA的合作建立在长期以来在技术方面取得成功并在最初并不显而易见的领域部署技术的基础上。我们是第一家利用分子生物学进行药物发现和开发的生物技术公司,改变了世界。我们开创了抗体治疗的范式。现在,我们将人工智能、实验室和临床结合在一起,以揭示海量数据中无法访问的模式,并设计实验来测试这些模式。与NVIDIA的合作,引入生成型AI,有能力快速推动发现和设计改进全球患者生活的治疗方法。” 通过计算简化药物发现 目前,药物发现和开发是一个耗时、复杂且昂贵的过程。预测新药物的药靶是困难的,同样成功将分子开发为潜在的治疗药物也是如此。人工智能可以发挥转变性的作用,因为生成型和其他人工智能模型可以通过在大规模数据集上进行训练,帮助科学家快速识别潜在的药物分子和相互作用。 对于Genentech来说,使用人工智能有助于弥合实验室实验和计算算法之间的差距。 该公司的研发团队gRED已经在多个领域使用人工智能进行了重要工作,以发现和开发新的治疗方法,并更多地了解生物学和疾病的基本构建块。 Genentech和NVIDIA的团队将共同努力,优化Genentech定制开发的模型,以缩短药物发现和开发这一耗时的过程,并取得更大的成功。 将人工智能纳入循环 Genentech的“实验室循环”是一个迭代框架,用于生成和探索具有预测特性的分子设计。它旨在使用实验数据来建立生成型计算模型,并更好地优化未来的分子设计。NVIDIA将帮助Genentech通过加速训练和推断Genentech的药物发现模型来优化其框架。 通过这种合作,NVIDIA的人工智能专家将获得有关药物发现和开发中与AI相关的挑战的见解。NVIDIA计划利用这些见解来改进其BioNeMo平台和其他平台,以进一步适应生物技术行业使用的模型的要求。 NVIDIA的医疗保健副总裁Kimberly Powell表示:“人工智能在加速药物发现和开发方面可以发挥转变性的作用,就像在医疗保健和生命科学的其他许多领域一样。 NVIDIA与Genentech共同开发和实施的人工智能模型和算法使我们能够快速迭代和发现洞见,从而推动科学创新。” 订阅NVIDIA医疗资讯。

Leave a Comment

揭示感官人工智能:实现人工通用智能(AGI)的路径

在不断演进的人工智能领域中,有两个重要领域处于创新的前沿:感知型人工智能和人工通用智能(AGI)的追求感知型人工智能作为一个引人入胜的领域,探索让机器能够解释和处理感官数据,模拟人类感官系统它涵盖了广泛的领域[…]

Leave a Comment

欲知答案:通过编码大型语言模型实现人类级奖励设计

随着近年来大型语言模型的进展,大型语言模型框架在顺序高级决策任务的语义规划中表现突出,这并不令人意外然而,开发人员仍然发现难以充分利用大型语言模型框架来学习复杂的低级操作任务尽管它们高效,但现今的大型语言模型需要相当的[…]

Leave a Comment

文本到图像革命:Segmind的SD-1B模型成为最快的游戏中的模型

介绍 Segmind AI 自豪地发布了 SSD-1B(Segmind Stable Diffusion 1B),这是一种具有颠覆性的开源文本到图像生成模型革命。这个闪电般快速的模型具有前所未有的速度、紧凑设计和高质量的视觉输出。人工智能在自然语言处理和计算机视觉方面取得了快速进展,并展示出重新定义界限的创新。由于其关键特征,SSD 1B 模型是计算机视觉的开拓之门。在这篇全面的文章中,我们深入探讨了该模型的特点、用例、架构、训练信息等等。 学习目标 探索 SSD-1B 的架构概述,了解它如何从专家模型中进行知识蒸馏。 通过在 Segmind 平台上使用 SSD-1B 模型进行快速推理和使用代码推理,获得实践经验。 了解下游用例,了解 SSD-1B 模型如何用于特定任务。 认识 SSD-1B 的局限性,特别是在实现绝对照片逼真度和在某些场景中保持文本清晰度方面。…

Leave a Comment

谷歌 DeepMind 和 YouTube 研究人员宣布了 Lyria:一种先进的 AI 音乐生成模型

在最近的一项公告中,Google的DeepMind与YouTube合作,推出了一款名为Lyria的音乐生成模型,该模型将改变艺术表达的景观。这项创新技术配备了两个实验性工具集,Dream Track和Music AI,标志着人工智能辅助音乐创作迈出了重要的一步,承诺重新定义音乐家和创作者与他们的创作互动。 Lyria的发布紧随Google先前在基于人工智能的音乐创作方面的尝试,其通过单词提示生成曲调的方式进入这一领域。现在,重点转向了DeepMind的Lyria模型,旨在与YouTube合作,使创作者能够发挥其潜力。Dream Track是一种开创性的工具,赋予创作者们创造以人工智能生成的音乐为基础的YouTube Shorts背景音乐的能力,使他们能够沉浸在备受赞誉的艺术家独特的音乐风格中。 然而,在人工智能在音乐创作中的角色引发的兴奋中,出现了关于人工智能生成作品的真实性和可持续性的担忧。在音频片段之间保持音乐连贯性的复杂性对人工智能模型构成了挑战。DeepMind承认了这种复杂性,并强调在延长的时间内保持预期音乐效果的困难,从而导致时间上的超现实失真。 DeepMind和YouTube最初集中在更短的音乐作品上以缓解这些挑战。Dream Track的首个发布面向一小群创作者,为其提供了机会以反映所选择艺术家的音乐本质来创作精心策划的30秒人工智能生成背景音乐。值得注意的是,艺术家们积极参与测试这些模型,以确保其真实性并提供宝贵的见解。 团队强调了这些努力的合作性质。他们强调了一个名为Music AI孵化器的集体,其中包括艺术家、词曲作者和制作人积极为改进人工智能工具做出贡献。他们的参与意味着探索人工智能的边界并提升创作过程的动力。 虽然Dream Track的发布范围有限,但Music AI工具的更广泛应用将在今年晚些时候推出。DeepMind令人兴奋地暗示了这些工具的功能,其中包括基于指定乐器或哼唱来创作音乐,从简单的MIDI键盘输入组合创作乐团,以及创作与现有人声线伴奏的器乐曲目。 Google进军人工智能生成音乐的探索并非孤立的。Meta的开源AI音乐生成器以及Stability AI和Riffusion等初创公司的其他创举,突显了音乐行业加速向 embrace AI 驱动的创新迈进的趋势。在这些进展下,这个行业正处于转型之中。 随着人工智能与创造力交叉,令人关注的问题是:人工智能创作是否将成为音乐的新常态?尽管存在不确定性,DeepMind和YouTube之间的合作表明了一种共同努力,旨在确保人工智能生成的音乐在保持可信度的同时与人类创造力相辅相成。 在技术和艺术交汇的领域,DeepMind和YouTube在人工智能音乐生成方面的努力预示着一个充满希望的未来,一个创新和艺术表达协调一致地重新定义音乐创作本质的未来。 本文来自谷歌DeepMind和YouTube研究人员宣布Lyria:先进的人工智能音乐生成模型,首发于MarkTechPost。

Leave a Comment

使用AutoGen轻松进行战略AI团队建设

介绍 在一个数字前沿无边界的世界中,AutoGen以一种变革性范式的建筑师的身份出现。想象一下拥有个性化的人工智能团队,每个团队都擅长不同领域,无缝协作,无障碍沟通,不知疲倦地处理复杂任务。这就是AutoGen的本质,它是一种开创性的多智能体对话框架,赋予您创建个性化的人工智能团队的能力。在这篇文章中,我们揭开AutoGen的神奇之处,探索它如何使您能够组建自己的数字梦想团队并实现非凡成就。欢迎来到一个人与机器之间的边界消失,协作无限的未来。 学习目标 在我们深入了解细节之前,让我们概述一下本文的主要学习目标: 全面了解AutoGen作为多智能体对话框架的能力。 了解智能体在多智能体对话框架中的自主沟通和协作。 了解config_list在AutoGen运行中的关键作用。了解保护API密钥和管理配置以实现智能体高效性能的最佳实践。 探索各种对话风格,从完全自主到人类参与的交互。了解AutoGen支持的静态和动态对话模式。 了解如何利用AutoGen根据验证数据、评估函数和优化指标调整LLM。 探索示例,如构建协作内容创作团队和带有文化背景的语言翻译,以了解AutoGen如何在不同场景中应用。 本文作为数据科学博文马拉松的一部分发表。 AutoGen是什么? AutoGen是一个统一的多智能体对话框架,作为使用基础模型的高级抽象。它将能力强大、可定制、可对话的智能体通过自动化聊天集合在一起,与LLMs、工具和人类参与者整合。本质上,它使智能体能够自主沟通和协作,有效地简化复杂任务并自动化工作流程。 为什么AutoGen很重要? AutoGen解决了与人工智能进行高效灵活的多智能体通信的需求。它的重要性在于它能够: 简化复杂LLM工作流程的编排、自动化和优化。 充分发挥LLM模型的性能,同时克服其局限性。 以最少的工作量基于多智能体对话开发下一代LLM应用。 设置开发环境 创建虚拟环境 创建虚拟环境是一种良好的实践,可以隔离特定项目的依赖项,避免与系统范围的软件包冲突。以下是设置Python环境的方法: 选项1:Venv python -m venv…

Leave a Comment

“深入挖掘 Rust 编写的矢量数据库 Qdrant”

介绍 Vector数据库已经成为存储和索引非结构化和结构化数据表示的首选位置。这些表示是由嵌入模型生成的向量嵌入。向量存储已成为开发带有深度学习模型的应用程序的重要组成部分,尤其是大型语言模型。在向量存储的不断发展中,Qdrant是最近推出的一个功能齐全的向量数据库。让我们深入了解一下。 学习目标 熟悉Qdrant的术语,以更好地理解它 深入研究Qdrant Cloud并创建Clusters 学习如何创建我们的文档的嵌入并将它们存储在Qdrant Collections中 探索在Qdrant中查询的工作原理 在Qdrant中调试过滤器,以检查其工作原理 本文作为Data Science Blogathon的一部分发表。 什么是嵌入? 嵌入是一种以数字形式表示数据的方式,即以n维空间中的数字或数值向量的形式表示不同类型的数据,如文本、照片、音频、视频等。嵌入使我们能够以这种方式对相关数据进行分组。使用特定模型可以将某些输入转换为向量。Google创建的一种广为人知的嵌入模型是将单词转化为向量(向量是具有n维的点),称之为Word2Vec。每个大型语言模型都有一个嵌入模型,用于生成LLM的嵌入。 嵌入的用途是什么? 将单词转换为向量的一个优点是可以进行比较。当拿到两个单词作为数字输入或向量嵌入时,计算机可以进行比较,尽管它无法直接比较它们。可以将具有可比较嵌入的单词分组在一起。因为它们彼此相关,诸如“王”、“皇后”、“王子”和“公主”这些术语将出现在一个聚类中。 从这个意义上讲,嵌入帮助我们找到与给定术语相关的单词。这可以用于句子,我们输入一个句子,提供的数据返回相关的句子。这为许多用例奠定了基础,包括聊天机器人、句子相似性、异常检测和语义搜索。我们开发的用于根据我们提供的PDF或文档回答问题的聊天机器人利用了这种嵌入概念。所有生成式大型语言模型都使用这种方法,以获得与他们提供的查询相关联的内容。 什么是向量数据库? 如前所述,嵌入是各种数据的表示,通常是非结构化数据以数字格式在n维空间中。那么我们该如何存储它们呢?传统的关系型数据库管理系统(RDMS)不能用于存储这些向量嵌入。这就是向量存储/向量数据库发挥作用的地方。向量数据库的设计目的是以高效的方式存储和检索向量嵌入。有许多不同的向量存储器,它们通过所支持的嵌入模型和用于获取相似向量的搜索算法的种类而有所不同。 什么是Qdrant? Qdrant是一种新型的向量相似性搜索引擎和向量数据库,采用Rust语言构建的可用于生产的服务。Qdrant具有用户友好的API,用于存储、搜索和管理具有元数据的高维点(点就是向量嵌入),这些元数据称为载荷。这些载荷成为有价值的信息,提高搜索精度,并为用户提供有见地的数据。如果您熟悉其他向量数据库,如Chroma,Payload类似于元数据,它包含有关向量的信息。 Qdrant是用Rust编写的,即使在负载很重的情况下也是快速可靠的向量存储。Qdrant与其他数据库的区别在于它提供的客户端API数量。目前,Qdrant支持Python、TypeScript/JavaScript、Rust和Go。它使用HSNW(层次可导航小世界图)进行向量索引,并提供了许多距离度量,如余弦、点和欧氏距离。它还提供了一个内置的推荐API。 了解Qdrant术语 要顺利开始使用Qdrant,熟悉Qdrant向量数据库中的术语/主要组件是一个好习惯。…

Leave a Comment