Press "Enter" to skip to content

Tag: Deep Learning

NVIDIA DGX Cloud现已可用,以加速生成式AI训练

NVIDIA DGX云——提供可以将几乎任何公司转变为AI公司的工具——现已广泛可用,包括在Oracle云基础设施上在线提供数千个NVIDIA GPU,以及位于美国和英国的NVIDIA基础设施。 DGX云是在NVIDIA的GTC大会上于三月份发布的AI超级计算服务,它使企业能够立即访问所需的基础设施和软件,以训练先进模型用于生成式AI和其他突破性应用。 “生成式AI已经使得AI的快速采用成为各行业领先公司的业务必需品,推动许多企业寻求更加快速的计算基础设施,”全球管理咨询公司麦肯锡的首席分析师Pat Moorhead表示。 根据麦肯锡最近的估计,生成式AI每年可以为全球经济增加超过4万亿美元,将世界各行业的专有业务知识转化为下一代AI应用。 产业先驱以生成式AI改变业务 几乎每个行业都可以从生成式AI获益,早期的先驱已经在其市场上引领了变革。 医疗保健公司使用DGX云来训练蛋白质模型,以加快药物发现和临床报告的速度,并实现自然语言处理。 金融服务提供商使用DGX云来预测趋势、优化投资组合、构建推荐系统和开发智能生成式AI聊天机器人。 保险公司正在构建模型以自动化理赔处理。 软件公司正在使用它来开发以AI为动力的功能和应用程序。 其他人正在使用DGX云来构建AI工厂和有价值资产的数字孪生。 即时提供的专用AI超级计算 DGX云实例提供了企业按月租用的专用基础设施,确保客户能够快速轻松地开发大规模、多节点的训练工作负载,而无需等待常常供不应求的加速计算资源。 “NVIDIA DGX云的可用性提供了一个新的AI超级计算资源池,几乎可以即时访问,”Moorhead表示。 这种简单的AI超级计算方法消除了获取、部署和管理本地基础设施的复杂性。DGX云提供了NVIDIA DGX AI超级计算与NVIDIA AI企业软件的配套,使得企业可以使用Web浏览器访问自己的AI超级计算机。 在浏览器中的NVIDIA AI超级计算和软件 DGX云的每个实例都配备了8个NVIDIA…

Leave a Comment

斯坦福的一项新的人工智能研究解释了语言模型中过度自信和不确定表达的作用

随着自然语言系统在现实场景中的普及,这些系统必须正确地传达不确定性。人类通常依靠不确定性表达来告知决策过程,从带伞到开始化疗的决策都范围之内。然而,有必要研究语言不确定性与自然语言生成系统的相互作用,从而需要了解模型与自然语言交互的关键组成部分。 最近的研究探讨了语言模型(LMs)解释不确定性表达的能力以及当它们被训练用于发出不确定性表达时的行为变化。自然的不确定性表达可以包括表示犹豫、归因信息或承认限制等其他话语行为。尽管先前的研究集中于学习模型的内部概率与语言或数字序数输出之间的映射,但当前的研究旨在将非单一维度的语言特征(如修饰语、认识标记、主动动词和证据标记)纳入自然语言生成模型中。 本研究检查了大型语言模型(LMs)在解释和生成不确定性提示时在问答(QA)任务的上下文中的行为。研究在零样本设置下进行实验,以分离提示中不确定性的影响,并在上下文学习场景中研究学习表达不确定性如何影响QA任务的生成。 研究发现,使用高确定性的表达可能导致准确性和校准性的缺陷。具体而言,在使用确定性表达来加强介词时,准确性存在系统性损失。此外,教导LM发出削弱语气而不是加强语气可以在不牺牲准确性的情况下获得更好的校准。该研究引入了不确定性表达的分类学以评估语言特征对LM生成的影响。 结果表明,在设计语言校准模型时至关重要,鉴于模型发出高度确定性语言的潜在缺陷。该研究的贡献包括: 提供不确定性表达与LMs相互作用的框架和分析。 引入不确定性表达的分类学。 展示模型使用确定性表达或惯用语言时出现的准确性问题。 最后,研究表明,不确定性表达可能比确定性表达更好地实现校准。 结论 本研究分析了自然不确定性表达对零样本提示和上下文学习中模型行为的影响。研究人员发现,在零样本提示中使用自然不确定性表达(如加强语气和主动动词)以及数值不确定性习语(如“100%确定”)会降低准确性。然而,教导模型仅在不确定时发出不确定性表达可能是人机交互的更安全设计选择。这是因为先前的研究表明,辅助决策的人工智能表现不如仅依靠人类决策,这表明过度依赖人工智能。教导模型发出确定性表达可能会加剧模型的校准不良和脆弱性。 研究人员建议,在进一步研究人类如何解释生成的自然表达式时,社区应将重点放在训练模型发出不确定性表达上。

Leave a Comment

“结识PaLM-E:一个新的拥有5620亿参数的具身多模态语言模型,能够执行机器人操作规划、视觉问答等任务”

大型语言模型(LLMs)展示了在包括对话、逐步推理、数学问题解决和代码撰写在内的各个领域中的强大推理能力。尽管将大量文本数据用于LLMs的训练可以产生与其物理环境有关的表示,但将这些表示与真实世界的视觉和物理传感器模态相连接对于解决计算机视觉和机器人领域中更广泛的基于真实世界的问题至关重要。 以前的工作将LLMs的输出与学习到的机器人策略和可行性函数结合起来进行决策,但这种方法受到限制。以前的工作的局限性在于LLM只接收文本输入,这对于许多需要场景的几何配置至关重要的任务来说是不足够的。此外,他们的研究表明,在常见的视觉语言任务(如视觉问答)上训练的最先进的视觉语言模型无法直接解决机器人推理问题。在这项研究中,来自Google和TU Berlin的研究人员提出了具有体现的语言模型,该模型直接包括来自具体代理的传感器模态的连续输入,并允许语言模型在实际世界中进行更准确的顺序决策。他们开发了PaLM-E,这是一个单一的大型具体化多模态模型,具有积极的迁移效果,可以解决多种观察模态下的多种具体化推理问题。 PaLM-E LLM表现出积极的迁移效果,即学习者在学习第二语言(L2)时可以将他们在第一语言(L1)中的知识或技能应用于L2学习中,从而更快、更有效地掌握L2。例如,如果学习者的L1与他们正在学习的L2具有相似的语法结构,他们可能能够利用对L1语法的了解来更快地理解和应用L2语法规则。同样,如果学习者的L1和L2共享同源词(在两种语言中拼写和含义相似的词),他们可以通过识别和记忆这些同源词来快速扩展他们的L2词汇量。积极迁移与负迁移相对应,负迁移发生在学习者的L1的知识或技能干扰他们获得L2的能力时。例如,如果学习者的L1的语法结构与他们的L2大相径庭,即使他们在理解上理解了L2的语法规则,他们也可能在正确应用L2的语法规则时遇到困难。 与基于Transformer的LLM的自注意力层处理语言标记的方式类似,图片和状态估计等输入也被合并到与语言标记相同的潜在嵌入中。他们首先通过编码器将连续输入注入到预训练的LLM中。这些编码器经过端到端训练,可以产生自然语言中的顺序判断,具体化代理可以通过配置低层规则或响应具体化查询来理解这些判断。通过对比各种输入表示(例如标准与以物体为中心的ViT编码用于视觉输入)、在训练编码器时冻结与微调语言模型以及研究在多个任务上进行联合训练是否能够实现迁移,他们在一系列情境中评估了这种方法。 他们在三个机器人操作领域(其中两个在真实世界中是闭环的)、常见的视觉语言任务(如VQA和图片描述)和语言任务上测试了这种技术,以确定该方法的广度。根据他们的研究结果,多任务训练相对于单一任务训练可以提高性能。他们展示了在机器人任务中这种任务之间的迁移可能导致更高的数据效率,包括在新的物品组合或未知对象上表现出一次性或零次性的泛化,并大大提高从少量训练样本中的学习性能。据他们所知,将540B的PaLM LLM和22B的Vision Transformer(ViT)结合起来创建了迄今为止发表的最大的视觉语言模型,使PaLM-E扩展到了562B个参数。 在没有使用任务特定的微调的情况下,PaLM-E-562B在OK-VQA基准测试上取得了最先进的性能。他们还发现,即使只在单个图像示例上进行训练,PaLM-E-562B显示出了广泛的技能,包括零次多模态思维链(CoT)少量提示、无OCR算术推理和多图像推理。在他们的知识范围内,使用端到端模型在多模态数据上展示零次CoT尚未被证明具体化程序。 总结他们的主要贡献,他们(1)建议并展示了如何在训练多模态大型语言模型时包含具体化数据,以创建一个通用的、迁移学习的、多具体化决策代理。他们证明,即使最先进的通用视觉语言模型在开箱即用的情况下不能有效解决具体化推理问题(零-shot),也有可能训练一个既有效的具体化推理器又能胜任任务的通用视觉语言模型。在研究这种模型的最佳训练方法时, 他们(3)提供了新的架构概念,包括实体标记的多模态标记和神经场景表示。最后但并非最不重要的是,他们(4)证明了PaLM-E不仅是一个具体化推理器,而且还是一个定量技能丰富的视觉和语言通用模型,并且(5)显示扩大语言模型的规模可以实现多模态微调而减少灾难性遗忘。可以在他们的项目网站上找到各种演示。

Leave a Comment

阿里巴巴AI研究提出Composer:一个基于数十亿(文本,图像)对训练的巨型(50亿参数)可控扩散模型

现如今,基于文本的生成图片模型已经能够创建各种逼真的图片。最近的许多研究努力将文本到图片的模型进一步扩展,通过添加分割图、场景图、绘画、深度图和修复遮罩等条件或在少量特定主题数据上进行微调来实现定制化生成。然而,当将这些模型应用于实际应用时,设计师仍然需要更多的控制。例如,在真实世界的设计项目中,生成模型通常需要帮助可靠地生成同时对语义、形式、风格和颜色有要求的图片。 阿里巴巴中国的研究人员介绍了Composer。它是一个训练有数十亿个(文本,图片)对的大型(50亿参数)可控扩散模型。他们认为组合性而不仅仅是条件性是控制图像生成的秘密。后者引入了很多可能的组合,可以极大地扩大控制空间。类似的思想在语言和场景理解领域也有研究。在这些领域中,组合性被称为组合泛化,即能够从有限数量的可用组件中识别或创建出有限数量的独特组合的能力。基于上述概念,他们在这项工作中提供了一个组合生成模型的实现,称之为Composer。他们将可以平滑重新组合视觉元素以创建新图片的生成模型称为组合生成模型。他们使用一个具有UNet骨干的多条件扩散模型来实现Composer。每个Composer训练迭代有两个阶段:分解阶段,在这个阶段,计算机视觉算法或预训练模型被用来将一批图片分解成单个表示;合成阶段,在这个阶段,Composer被优化以从表示子集中重建图片。 图1:组合图像合成的思想,首先将一张图片分解成多个基本部分,然后以很高的创造力和控制度重新组合它们。为了做到这一点,这些组件以各种形式存在,并在整个生成过程中充当条件,使得在推理步骤中可以进行广泛的修改。建议以高分辨率查看。 Composer可以解码出从未见过的表示组合中的独特图片,这些表示可能来自多个来源,可能不兼容,而仅仅是通过重建目的进行训练。尽管概念上很简单且易于使用,但Composer在传统和以前未开发的图片生成和操作任务上表现出色,如但不限于文本到图片生成、多模态条件图片生成、风格转换、姿势转换、图片翻译、虚拟试穿、插值和来自各个方向的图片变化、通过修改草图进行图片重构、依赖图片翻译和图片翻译。 此外,Composer可以将所有上述操作的可编辑区域限制在用户指定的区域内,这比传统的修复操作更灵活,同时通过引入掩膜的正交表示防止在该区域之外修改像素。尽管经过多任务训练,Composer在COCO数据集上利用标题作为标准,在文本到图片合成中获得了零射击FID为9.2的结果,展示了其出色的性能。他们的分解-合成范式表明,当条件是可组合的而不仅仅是单独使用时,生成模型的控制空间可以大大增加。因此,他们的Composer架构可以重塑广泛的传统生成任务,并揭示了迄今未被认识的生成能力,为进一步研究各种分解技术提供了启示。此外,基于无分类器和双向引导,他们展示了许多使用Composer进行不同图片生成和修改任务的方法,并为后续研究提供了有益的参考。在将这项工作公开之前,他们计划仔细检查Composer如何降低滥用风险,并可能提供一个经过筛选的版本。

Leave a Comment

加州大学伯克利分校的研究人员提出了一种名为“后见之链(CoH)”的新技术,可以使LLMs从任何形式的反馈中学习,提高模型性能

在过去的几年里,大规模神经网络引起了研究人员的广泛关注。这主要是因为它们在各种任务中表现出色,包括自然语言理解、解决具有挑战性的数学方程,甚至蛋白质结构预测。然而,为了确保这些模型对社会做出建设性贡献,关键是它们与人类价值观保持一致,并考虑人类偏好。使用人类反馈是实现这一目标最重要的方面之一,因为它使人类能够根据一系列指标(如准确性、公平性、偏见等)评估这些模型的性能,并提供改进这些模型以产生更具伦理输出的见解。为了提高整合用户反馈的效率,研究人员在过去几年中一直在尝试多种人机协同系统的方法。结果表明,ChatGPT和InstructGPT在使用人类反馈进行学习方面取得了惊人的成果。 这种语言建模的性能提升主要归因于依赖监督微调(SFT)和利用人类反馈进行强化学习(RLHF)的策略。尽管这些策略在提高语言模型性能方面做出了显著贡献,但它们也有自己的缺点。SFT主要依赖于人工注释,使得这些模型难以使用并且在数据利用上效率低下。另一方面,由于强化学习是基于奖励函数的,优化这些模型非常具有挑战性。 为了解决这些问题,加州大学伯克利分校的研究人员开发了一种将所有反馈转化为句子并使用它们来微调模型以理解反馈的新技术。这种技术被称为“回顾链”(CoH),它在很大程度上受到人类如何处理以语言形式提供的大量反馈的启发。研究人员在设计这种技术时的目标是结合SFT和RLHF的优势,同时避免使用强化学习来充分利用所有反馈。他们目前的方法利用语言理解和学习反馈的能力,最终提高模型在执行各种任务时的准确性和效果。 研究人员利用人类从语言形式的丰富反馈中学习得很好的事实。鉴于预训练语言模型在上下文中有效学习的卓越能力,研究人员想知道是否可以将所有反馈都转化为一个句子,并训练模型遵循这些反馈。更详细地说,研究人员建议微调模型以预测结果,同时依赖于一个或多个排序结果及其比较形式的反馈。CoH在训练过程中随机选择一个或多个模型输出,并利用它们构建一个包含正面和负面比较反馈的句子。例如,两个示例句子可以是“以下是一个糟糕的摘要”和“以下摘要更好”。模型在推理时使用正面反馈生成所需的输出。 CoH方法允许模型从正面和负面反馈中学习,以识别和纠正负面属性或错误。该策略还具有其他一些优点,包括更有机的反馈样式和一个训练系统。此外,根据研究人员进行的众多实验评估,CoH技术在关联语言模型与人类偏好方面远远优于先前的方法。该方法在人类评估中受到青睐,并在摘要和讨论任务上表现出色。加州大学伯克利分校的研究团队坚信,CoH在未来在各种其他类型的反馈(如自动和数值反馈)中具有巨大潜力。

Leave a Comment

来自加州大学伯克利分校和Deepmind的研究人员提出了SuccessVQA:一种适用于预训练的VLMs(如Flamingo)的成功检测的重新表述

为了实现最佳性能准确性,了解代理在训练过程中是否在正确或首选的轨道上至关重要。这可以通过在强化学习中为代理提供奖励或使用评估指标来判断最佳策略来实现。因此,在训练先进的智能代理时,能够检测到这种成功行为变得至关重要。这就是成功检测器的作用,它们可以用来分类代理的行为是否成功。先前的研究表明,开发特定领域的成功检测器相对比较容易,而开发更通用的成功检测器则更加困难。这是因为定义大多数实际任务的成功是相当具有挑战性的,因为它常常是主观的。例如,一幅由人工智能生成的艺术作品可能会让某些人着迷,但对整个观众来说可能并非如此。 在过去的几年里,研究人员提出了不同的方法来开发成功检测器,其中之一是使用偏好数据进行奖励建模。然而,这些模型存在一定的缺陷,因为它们只在固定的任务集和环境条件下表现出可观的性能,这些任务和环境条件都是在偏好注释的训练数据中观察到的。因此,为了确保泛化性能,需要更多的注释来覆盖各种领域,这是一项非常费时费力的任务。另一方面,当涉及到同时使用视觉和语言作为输入的模型训练时,可泛化的成功检测应该确保在语言和视觉上的变化中都能给出准确的度量,以完成指定的任务。现有的模型通常只针对固定条件和任务进行训练,因此无法适应这种变化。此外,适应新的条件通常需要收集新的带注释的数据集并重新训练模型,这并不总是可行的。 在解决这个问题的过程中,Alphabet子公司DeepMind的研究人员团队开发了一种训练稳健成功检测器的方法,可以抵御语言规范和感知条件的变化。他们通过利用大规模预训练的视觉语言模型(如Flamingo)和人类奖励注释来实现这一目标。研究基于研究人员的观察,即对Flamingo进行大量多样化语言和视觉数据的预训练将导致训练更稳健的成功检测器。研究人员声称他们最重要的贡献是将可泛化的成功检测任务重新定义为视觉问答(VQA)问题,称为SuccessVQA。这种方法将任务定义为一个简单的是/否问题,并使用一个统一的架构,该架构只包括定义状态环境的短视频剪辑和描述所需行为的一些文本。 DeepMind团队还证明了通过使用人类注释来微调Flamingo可以实现在三个主要领域的可泛化成功检测。这些领域包括家庭模拟中的交互式自然语言代理、现实世界中的机器人操作和野外自我中心人类视频。SuccessVQA任务公式的通用性使得研究人员可以对来自不同领域的各种任务使用相同的架构和训练机制。此外,使用像Flamingo这样的预训练视觉语言模型使得充分利用在大型多模态数据集上的预训练优势变得相当容易。团队认为这使得在语言和视觉变化方面实现了泛化。 为了评估他们对成功检测的重新定义,研究人员进行了几个实验,涵盖了未见过的语言和视觉变化。这些实验揭示了预训练的视觉语言模型在大多数分布内任务上具有可比性的性能,并在分布外场景中明显优于任务特定的奖励模型。调查还揭示了这些成功检测器能够在语言和视觉上对未见过的变化进行零样本泛化,而现有的奖励模型则无法。尽管DeepMind研究人员提出的这种新方法具有显著的性能,但在与机器人环境相关的任务中仍然存在某些缺点。研究人员表示,他们未来的工作将涉及在这个领域做出更多的改进。DeepMind希望研究社区将他们的初步工作视为实现成功检测和奖励建模方面更多进展的基石。

Leave a Comment

法国国家科学研究中心(CNRS)的人工智能研究提出了一种噪声自适应智能可编程元成像器:一种及时应对特定任务、噪声自适应感知的方法

法国国家科学研究中心的研究人员提出了一种噪声自适应智能可编程元成像器。感知系统在我们生活的许多方面中越来越广泛地使用,包括非接触式人机界面、无人驾驶车辆和环境支持的医疗保健。然而,这些系统通常缺乏智能,因为它们有收集所有信息的倾向,而不管其是否相关。这可能导致隐私侵犯,同时在处理数据时也会浪费时间、精力和计算资源。 然而,在实际应用中,测量过程总是受到不同类型的噪声的影响。每个测量都伴随着噪声。特别是在室内环境中,传输的电磁信号必须保持适度,信噪比可能较低。为了推进先前的研究,法国国家科学研究中心的研究人员现已开发了一种智能可编程计算元成像器,不仅可以根据特定的信息提取任务(如物体识别)调整其照明模式,还可以适应各种类型和水平的噪声。 某种类型和强度的噪声不可避免地影响测量过程。我们假设噪声的类型和数量将影响智能可编程元成像器应该使用的最佳相干照明模式,以有效地从图像中提取特定任务的信息。该系统被认为是一种单发射器、单探测器多次拍摄的可编程计算成像系统。这些系统在微波领域尤为重要,因为昂贵的收发器可以被可编程的元表面孔径所取代,后者可以从单个射频链合成相干波前。 研究人员根据研究仔细探讨了延迟限制和噪声对智能多次拍摄可编程元成像器的影响。研究人员研究了一个常见的物体识别问题,并提出了一个微波计算可编程元成像器系统来测试他们的理论。这些系统可以用于地球观测、室内监控等领域。 在他们的模型中,一个微波动态元表面天线(DMA)使用单个发射器向场景发送一系列相干波前,而第二个DMA使用单个探测器相干地收集反射波。他们开发了一个可微分的端到端信息流管道,包括未来的数字处理阶段以及带有噪声的可编程物理测量过程。 这种联合优化,涉及对可训练的物理参数和可训练的数字参数进行任务特定的端到端联合优化,使测量过程具有任务意识,使其能够区分与手头任务相关的模拟域信息和与任务无关的信息。 科学家发现,在信息受到延迟约束和/或噪声约束的情况下,这种可编程元成像器生成一系列与任务和噪声相关的场景照明,比传统的具有随机配置的压缩感知方法表现更好。 这种方法虽然具有“黑盒”特性,但研究人员发现,学习到的光照模式的“宏观”方面,尤其是它们的互相重叠和强度,是直观可理解的。 根据研究人员的说法,向一个能够自动识别噪声类型和数量并相应地修改其DMA设置的系统过渡是简单的,而无需额外的人类输入。

Leave a Comment

马里兰大学的新人工智能研究探讨了在一天内使用单个GPU训练语言模型的压缩挑战

在自然语言处理的许多领域中,包括语言解释和自然语言合成,利用变压器拓扑的大规模机器学习模型的训练取得了突破性的进展。这些系统的广泛认可行为是它们在模型参数数量和数据量增加时能够稳定扩展或继续表现更好的能力。 虽然大多数研究都集中在寻找推动极端计算边界的新方法上,但马里兰大学的研究人员正在研究最佳的语言模型训练规模缩减方式和可能出现的权衡。 研究人员认为,由于规模效应带来的竞争,他们可以训练一个语言模型。最初的BERT模型在自然语言处理的许多实际应用中得到了使用。然而,这个模型已经需要大量计算才能训练。 在资源相对有限的情况下,有可能训练一个接近BERT性能水平的语言模型,这带来了许多有趣的后果。一个原因是,如果缩减模型的预训练是大规模计算预训练的有效替代品,那么它将开辟一系列目前难以实现的额外学术研究。研究人员表示,可能会出现一些场景,从业者有兴趣利用专门的或可靠的数据源重新训练他们的语言模型,但法律因素使得不确定是否可以接受在具有可疑来源的公共数据上训练的模型。 马里兰大学的研究人员进行了一项新研究,探索了“挤压”挑战——在考试前一天学习整个语言模型。他们的研究证明,在这种受限情况下,性能与大规模计算环境中发现的缩放规律密切相符。为了确定对训练流程的更改是否会导致缩小的情况下性能的提高,该研究首先研究了各种训练流程方面。 缩小规模是具有挑战性的。虽然较小的模型设计可以实现更快的梯度计算,但随时间的推移,模型改进的整体速率几乎保持不变。然而,利用缩放定律的训练配方修改可以通过增加梯度计算的有效速率而获得收益,而不需要减小模型的大小。最终,团队能够在有限的预算下训练模型并提供可观的性能,在GLUE任务中经常接近甚至超过BERT。 团队评估了将基于变压器的语言模型放入计算资源非常有限的情况下的性能。他们发现,多个变化方面导致在GLUE上可观的下游性能。团队希望这项工作可以作为对挤压问题进行调查的起点,并对多种改进和策略提供额外的见解。

Leave a Comment

在人工智能(AI)中使用模拟计算机

模拟计算机是一类设备,其中物理量如电压、机械运动或流体压力被表示为与问题中相应数量相似的量。 这是一个模拟计算机的简单示例。 来源:https://www.youtube.com/watch?v=IgF3OX8nT0w&t=763s 如果我们按一定量转动黑色和白色的轮子,灰色的轮子显示两个旋转的总和。 最早的模拟计算机之一是公元前100-200年左右建造的安提基瑟拉机械。它由一系列相互连接的青铜齿轮组成,某些指针的运动类似于太阳和月亮的运动。它还能够提前几十年预测日食。 来源:https://arstechnica.com/science/2021/03/scientists-solve-another-piece-of-the-puzzling-antikythera-mechanism/ 模拟计算机的优点和缺点 要添加两个八位数,需要大约50个晶体管。然而,使用模拟计算机,我们只需将两根电线连接起来即可相加两个电流。同样,要乘以两个数,我们需要1000多个晶体管。相反,我们可以通过电阻(R-欧姆)通过电流(I安培),线两端的电势差将是I*R,即两个数的乘积。 模拟计算机功能强大、快速且能源高效。然而,数字计算机取代了它们,因为它们是单用途的且不准确,而且由于输入是连续的,很难完全重复过程。 模拟计算机与人工智能 在人工智能中,模拟计算机用于各种任务,包括模式识别、决策和控制。例如,它们被用于训练神经网络,这是受人脑结构和功能启发的机器学习模型。模拟计算机还用于实现基于规则的人工智能系统,这些系统使用特定规则进行决策或采取行动。 尽管在过去广泛使用,但模拟计算机在人工智能和机器学习中已不再常见,这主要是由于数字计算机的出现。数字计算机比模拟计算机更快速、可靠,可以存储和处理更大量的数据。此外,数字计算机更易于编程和维护,这使其成为大多数人工智能和机器学习应用的首选。 模拟计算机在人工智能中的应用增加 在机器学习和人工智能应用中,使用更大的神经网络的趋势越来越明显。这一趋势是由于需要在日益复杂的任务上提高性能,以及更多的数据、硬件和算法来支持更大网络的训练。然而,这种增加的需求也带来了一些挑战。 训练一个大型神经网络需要的能量相当于三个家庭一年的平均消耗量。 现代计算机将数据存储在内存中,并根据需要访问。但是当神经网络需要大规模矩阵乘法时,大部分能量用于获取权重的值,而不是执行计算。 根据摩尔定律,芯片上的晶体管数量传统上每两年翻一番。然而,我们现在正接近晶体管的尺寸接近原子尺寸的点,这对进一步微型化带来了重大的物理挑战。 随着数字计算机接近其极限,神经网络在矩阵乘法上的广泛应用使其受到了广泛关注。此外,神经网络不要求数字计算机进行精确计算,对于将图像分类为狗的置信度达到98%或95%即可。这些因素为模拟计算机在人工智能领域扮演更重要的角色提供了绝佳机会。 案例研究: Mythic AI Mythic AI 是一家模拟计算初创公司,致力于创建用于运行神经网络的模拟芯片。不同的人工智能算法,如动作检测、深度估计、对象分类等,都在模拟领域中运行。 Mythic修改了数字闪存单元,使其能够实现这一点。这些单元通常用于存储内存,可以存储1或0。将正电压应用于控制栅,电子将穿过绝缘层并被困在浮动栅上。然后可以去除电压,电子将长时间保持在浮动栅上,阻止电流通过该单元。…

Leave a Comment

部署机器学习模型意味着什么?

数据科学是一个有前景的领域,吸引着越来越多的公司,但它在工业化过程中的整合仍然面临困难。在大多数情况下,机器学习(ML)模型在科学研究环境中离线实现。创建的模型中有近90%从未在生产条件下部署。部署可以定义为将ML模型集成到现有生产环境中以实现有效的数据驱动业务决策的过程。这是机器学习生命周期的最后阶段之一。然而,近年来,ML已经从纯粹的学术研究领域发展为可以解决实际业务问题的领域。然而,在操作系统中使用机器学习模型可能会面临各种问题和担忧。 在生产环境中定义ML模型有几种方法,具体取决于范围的不同优势。大多数数据科学家认为,部署模型是软件工程任务,应由软件工程师处理,因为所需的所有技能更与他们的日常工作密切相关。 像Kubeflow和TFX这样的工具可以解释整个模型部署过程,数据科学家应该使用它们。使用Dataflow等工具可以与工程团队密切合作。它可以设置临时环境,在部署之前可以测试数据管道的部分。 部署过程可以分为四个主要步骤: 1)准备和配置数据管道 第一项任务是确保数据管道结构高效,并能提供相关且高质量的数据。确定如何在部署后扩展数据管道和模型非常重要。 2)访问相关的外部数据 在部署生产预测模型时,必须注意使用最佳的数据,从合适的来源从概念到发布。即使仔细设计,一个破损的模型也是无用的。此外,此挑战的另一个要素是捕获足够的历史数据以获得稳健且具有普适性的模型。一些公司会内部收集所需的所有数据。为了全面了解和洞察,考虑包括外部数据源。 3)构建强大的测试和训练自动化工具 在进入预测模型部署阶段之前,严密且无妥协的测试和训练是必不可少的,但可能需要时间。因此,为了避免减慢速度,尽可能自动化。除了研究一些节省时间的技巧或工具,还需要生成可以无需工程师任何努力或操作就能工作的模型。 4)规划和设计强大的监控、审计和回收协议 在部署和运行ML模型之前,必须检查它是否实际产生了预期类型的结果。必须验证这些结果是否准确,并且提供给模型的数据能够保持这些模型的一致性和相关性。此外,弱旧数据可能导致不准确的结果。 如果我们更详细地观察机器学习实验,我们会意识到这些实验是在时间上冻结的数据上进行的,也就是说,用于训练模型的数据通常是固定的。换句话说,这些数据不会改变或在实验期间变化很小。在这种情况下,我们称之为封闭模型。在真实世界条件下,模型不断遇到与创建模型时使用的数据相当不同的新数据。因此,模型继续学习并更新其参数非常重要。迅速而轻松地使用新数据重新训练模型非常有趣。模型重新训练是指开发具有与原始模型不同属性的新模型。重要的是能够重新部署此模型以获得其新功能的好处。 总之,部署ML模型是一个具有挑战性的过程,要成功完成,需要对ML模型的使用和利用周围的所有关注点有全面的理解。一个人很少具备完成所有这些过程所需的必要才能: 了解公司的需求 创建ML模型。 使模型工业化 批量或实时收集数据 在数据上使用部署的模型 因此,数据科学家很难独自完成所有这些过程。 数据工程师、软件工程师和数据科学家之间的合作至关重要。 总之,数据科学项目的成功受到所需才能的多样性和每个团队对问题的全面理解的影响。

Leave a Comment

密歇根州立大学的研究人员开发了名为“DANCE”的Python库,用于支持大规模分析单细胞基因表达的深度学习模型

从单模态分析(RNA、蛋白质和开放染色质)到多模态分析和空间转录组学,近年来,分析单个细胞的技术发展迅速。机器学习为基础的大量计算方法应运而生,这是由于该领域的迅速扩展所推动的。 研究人员指出,由于当前方法的多样性和复杂性,很难复制原始文章中显示的结果。超参数调整、编程语言之间的不兼容以及缺乏公开可用的代码库都提供了重大障碍。由于大多数现有作品仅在有限的数据集上报告了其性能,并与不足的方法进行了比较,因此需要进行系统的基准测试程序来全面评估方法。 作为最近一项研究的一部分,来自密歇根州立大学、华盛顿大学、浙江工业大学、斯坦福大学和强生公司的研究人员介绍了DANCE,这是一个用于加速单个细胞分析进展的深度学习库和基准。 DANCE提供了一套全面的工具,用于大规模分析单个细胞的数据,使开发者能够更轻松高效地创建他们的深度学习模型。此外,它还可以用作比较各种计算模型在单个细胞分析中性能的基准。DANCE目前包括对3个模块、8个任务、32个模型和21个数据集的支持。 目前,DANCE提供以下功能: 单模态分析。 多模态分析。 空间转录组学分析。 自动编码器和GNN是广泛使用的深度学习框架,适用于各个领域。根据他们的论文,DANCE是第一个全面的单细胞分析基准平台。 在这项工作中,研究人员使用了创新的组件。他们通过编制任务特定的标准基准数据集并通过单个参数调整使其可立即使用来开始工作。为每个任务实现了基线的经典和深度学习算法。所有收集到的基准数据集都被用于微调基线,直到它们达到与原始研究相同或更好的结果。最终用户只需运行一条命令行,其中预先包装了所有超参数,就可以获得微调模型的性能。 团队使用PyTorch Geometric (PSG)框架作为基础。此外,他们通过将其转化为适应-预测-评分的框架,使其基线标准化。对于每个任务,通过网格搜索在所有收集到的标准基准上对所有实现的算法进行微调,以获得最佳模型。相关的超参数存储在单个命令行中,以便用户能够重现实验结果。 团队认为他们的工作使整个单细胞社区受益于DANCE平台。最终用户不需要花费太多时间和精力来实现和微调模型。相反,为了复制他们的结果,他们只需要运行一条命令行。此外,研究人员还为基于深度学习的模型的快速训练提供了图形处理单元(GPU)的支持。 目前,DANCE缺乏用于预处理和图形创建的统一工具集。团队计划在未来进行改进。他们还表示,DANCE将作为一项SaaS服务提供,这样用户就不必完全依赖自己设备的处理能力和存储容量。 本文是MarkTechPost员工根据研究论文“DANCE:用于单细胞分析的深度学习库和基准”的研究摘要文章编写的。所有关于这项研究的荣誉归功于这个项目的研究人员。查看论文、代码和工具。 请别忘记加入我们的机器学习Subreddit 这篇文章最初发表于MarkTechPost网站,标题为《密歇根州立大学的研究人员开发了一种名为“DANCE”的Python库,支持单细胞基因表达大规模分析的深度学习模型》。

Leave a Comment

字节跳动人工智能研究提出了一种新颖的自监督学习框架,用于创建具有连续和离散参数混合的高质量风格化3D头像

数字世界的一个关键入口,更普遍地存在于社交、购物、游戏和其他活动中,是一个外观吸引人且有动画效果的3D头像。一个合适的头像应该吸引人,并且可以根据用户的外貌进行定制。许多著名的头像系统,如Zepeto1和ReadyPlayer2,采用卡通和风格化的外观,因为它们有趣且用户友好。然而,手动选择和修改头像通常需要从许多图形元素中进行繁琐的修改,这对于初学者用户来说既耗时又具有挑战性。在这项研究中,他们研究了从正面拍摄的一张自拍照片自动生成风格化3D头像的自动化方法。 具体而言,给定一张自拍照片,他们的算法预测一个头像向量作为图形引擎生成3D头像并从预定义的3D资源中渲染头像图像的完整配置。头像向量包含特定于预定义资源的参数,可以是连续的(例如头部长度)或离散的(例如发型类型)。一种简单的解决方案是标注一组自拍照片,并训练一个模型通过监督学习来预测头像向量。然而,需要大规模的标注来处理大量的资源(通常是数百个)。建议使用自监督方法训练一个可微分的模拟器,通过不同的识别和语义分割损失来复制图形引擎的渲染,从而自动地将生成的头像图片与自拍照片进行匹配,从而减少标注成本。 更准确地说,给定一张自拍照片,他们的系统将预测一个头像向量作为图形引擎生成3D头像并从指定的3D资源中渲染头像图像的完整设置。构成头像向量的特征是特定于预设资源的,可以是连续的(如头部长度)或离散的(如发型类型)。一种简单的方法是标注一系列自拍照片,并使用监督学习构建模型来预测头像向量。然而,需要大规模的标注来处理各种各样的资源(通常是数百个)。 头像向量转换、自监督头像参数化和肖像风格化是他们创新架构的三个步骤。根据图1所示,在整个流程中,识别信息(发型、肤色、眼镜等)在三个阶段逐渐关闭域差距的同时保留。肖像风格化阶段首先关注2D真实到风格化视觉外观的域交叉。这一步保持了图像空间,同时将输入的自拍照片转换为风格化头像。对于翻译的当前风格化技术的粗略使用将保留诸如表情之类的元素,这将在流水线的后续阶段中引起明显的复杂性。 图1 因此,他们开发了一种修改版的AgileGAN,以确保表情的一致性,同时保持用户的识别。然后,自监督头像参数化步骤关注的是从基于像素的图片到基于向量的头像的过渡。他们发现强制执行参数离散性会阻止优化达到收敛行为。他们采用一种宽松的形式,称为放松的头像向量,以克服这个问题,将离散参数编码为连续的独热向量。他们教授一个模拟器像不可微分的引擎一样行为,以实现训练中的可微性。在头像向量转换步骤中,所有离散参数都被转换为独热向量。从放松的头像向量空间到严格的头像向量空间进行域交叉。然后,图形引擎可以构建最终的头像并使用严格的头像向量进行渲染。他们使用一种独特的搜索技术,产生的结果优于直接量化。他们利用人类喜好研究评估他们的发现,并将结果与基线方法(如F2P和手工制作)进行比较,以查看他们的方法如何有效地保护个人独特性。他们的结果得分明显高于基线技术,并与手工制作的结果非常相似。 他们还提供了一个消融研究来支持他们的流水线设计决策。他们的技术贡献包括以下要点: • 一种新颖的自监督学习框架,结合连续和离散参数生成高质量的风格化3D头像 • 一种通过肖像风格化来弥合风格域差异的新方法,用于创建风格化的3D头像 • 一种级联的松弛和搜索流水线,用于解决离散头像参数优化中的收敛问题。 您可以在他们的网站上找到该论文的视频演示。

Leave a Comment

认识TxGNN:一种利用几何深度学习和以人为中心的人工智能来进行零样本预测的新模型,可以跨越17,080种疾病的广泛范围进行治疗用途预测

世界各地数十亿人的健康需求迫切需要开发治疗方法。然而,目前只有少数被临床认可的疾病有授权的治疗方法。基因功能和它们产生的分子的改变是疾病的常见原因。恢复正常分子活动的药物是对这些疾病的潜在防御。不幸的是,恢复受损基因的生物活动的治疗方法对于许多疾病仍然难以实现。此外,大多数疾病是由多个基因的变化引起的,即使在单个基因内,个体之间的突变模式也可能存在巨大差异。与参与疾病相关的过程和活动的基因网络(即相互作用组)是解释这些遗传事件的重要工具。为了解析疾病中被破坏的遗传结构并帮助创造针对性治疗药物,机器学习已经被用于分析高通量分子相互作用组和电子病历数据。 新药开发具有挑战性,尤其是对于治疗选择有限的疾病,但可以用更安全、更有效的药物替代效率低下的药物。美国FDA只为数百种人类疾病授权了治疗方法。在分析的17,080种临床认可的疾病中,只有1,363种疾病有专门的药物处方,其中435种只有一种处方,182种有两种处方,128种有三种处方。对于已有治疗方法的疾病来说,寻找新的药物具有重要的治疗意义,它提供了更多治疗选择,并减少了不良反应,可以替代某些患者群体中无效的药物。 TXGNN是一种用于治疗使用预测的几何深度学习技术,由对分子原因和潜在治疗方法需要更多了解的疾病感兴趣的研究人员引入。TXGNN使用一个以治疗为重点的图层与目前正在治疗的疾病干扰网络相结合进行训练。该知识图整合和编制了几十年来对17,080种常见和不常见疾病的生物学研究。它被优化以反映TXGNN的治疗中心图的几何特性。一个图神经网络模型将治疗候选药物和疾病集成到一个潜在的表示空间中。TXGNN使用在潜在表示空间中工作的度量学习模块,可以将TXGNN的模型从训练过程中见过的疾病转移到被忽视的疾病上,以避免有监督深度学习对于预测被忽视疾病的治疗使用的限制。 TxGNN是在包括17,080种临床认可的疾病和7,957种治疗候选药物的知识图上进行预训练的图神经网络。它可以以统一的形式执行不同的治疗任务。由于在训练后不需要微调地面真实标签或额外参数,因此TxGNN可以进行未训练疾病的零样本推理。与最先进的方法相比,TxGNN在指示任务的准确性上提高了49.2%,在禁忌任务的准确性上提高了35.1%。 实验设计和方法 – 对数据集进行全面性能评估的分区 疾病领域划分: 许多疾病具有治疗潜力,但缺乏有效的治疗方法和很少的生物理解。通过使用研究团队开发的数据分割来模拟已经进行了分子特征化的疾病,测试TXGNN在预测药物与疾病的联系方面的潜力。 首先,将该组的疾病和相关的药物-疾病边缘复制到测试集中。这意味着在训练过程中,TXGNN对于代表选定疾病类别的当前指示和禁忌边缘的存在是盲目的。这模拟了治疗具有未知基础生物机制的疾病的困难。 系统性数据集划分: 针对不可治疗的疾病进行预测应该非常适合正在实施的机器学习模型。预测已经有现有治疗方法的疾病的潜在疗法要比预测没有现有治疗方法的疾病要简单得多。研究人员设计了这个划分来严格研究该模型预测以前未被发现疾病的能力。研究人员首先随机划分所有疾病。当在训练过程中没有识别出治疗方法,并且测试集包含唯一的疾病时,研究人员将与测试集相关的所有药物-疾病关系转移到测试集中。每次迭代测试集中包含超过一百个唯一疾病。 以疾病为中心的数据集划分: 研究人员使用以疾病为中心的评估来模拟药物候选者在临床中的使用情况。首先,研究人员将知识图中的所有药物与测试集中的所有疾病进行关联,排除训练集中的药物-疾病关联。然后,研究人员基于它们相互作用的可能性对所有可能的配对进行评分。然后,研究人员通过检索前K个药物来计算召回率(即在测试集中有多少药物和疾病在完整的K中)。最后一步是建立一个随机筛选基准,其中在药物集中随机抽样前K个药物,并计算召回率。 结果 使用几何生物先验在TXGNN中进行治疗应用预测。TXGNN基于这样的假设:针对蛋白质相互作用网络中受疾病扰动的网络的药物将具有最大的成功机会。TXGNN经过优化,能够捕捉TXGNN知识图谱的几何特征,它是一种基于知识的图神经网络,将治疗候选者和疾病(疾病概念)映射到潜在表示空间中。 使用参考TXGNN进行零样本治疗应用预测。研究人员测试了TXGNN预测指示和禁忌症的能力。由于TXGNN的目标是治疗像Stargardt病16和高草酸尿症这样目前没有可用治疗方法的疾病,所以使用一种叫做零样本性能的指标来衡量其性能,即模型被要求预测在模型训练期间未见过的另一个数据集(称为保留(测试)集)中的疾病的治疗用途。 在预测五种疾病类型的治疗用途方面达到100%的准确率。类似的治疗方法可能适用于具有相似生物学基础的疾病。 无法预测那些经常拒绝治疗的患者的治疗用途。 对于存在指示的1,363种疾病和存在禁忌症的1,195种情况,准确率达到100%。 对推荐哪些治疗方法和哪些禁忌症给予仔细考虑。 将TXGNN的预测与当前的治疗选择进行比较。研究人员考虑了在TXGNN的数据集和模型开发完成之后获得授权的10种新上市药物,以展示TXGNN不受确认偏见的驱动。在TXGNN的数据集中,没有直接连接的药物-疾病节点。然后,要求TXGNN为研究人员提供预测。 特点 对于不存在药物并且我们对其分子知识很少的疾病,TXGNN具有“零样本”预测治疗用途的能力。 尽管我们对特定疾病没有任何药物的实际了解,并且需要推断到在训练过程中未观察到的新疾病领域,但TXGNN可以极大地提高对各种疾病的治疗用途的预测能力。…

Leave a Comment

“遇见P+:文本到图像生成中的扩展文本逆转的丰富嵌入空间”

文本到图像合成是指从文本提示描述中生成逼真图像的过程。这项技术是人工智能领域中生成模型的一个分支,并在近年来越来越受到关注。 文本到图像生成旨在使神经网络能够解释和翻译人类语言为视觉表达,从而实现各种合成组合。此外,除非另有教导,生成网络会为相同的文本描述生成多个不同的图片。这对于收集新的想法或呈现我们心中准确的视觉是非常有用的,而在互联网上找不到。 这项技术在虚拟现实、增强现实、数字营销和娱乐等各个领域都具有潜在的应用。 在最常用的文本到图像生成网络中,我们可以找到扩散模型。 文本到图像扩散模型通过迭代地改进以文本输入为条件的噪声分布来生成图像。他们将给定的文本描述编码为潜在向量,该向量影响噪声分布,并通过扩散过程迭代地改进噪声分布。这个过程产生了与输入文本匹配的高分辨率和多样化的图像,通过捕捉和融合输入文本的视觉特征的U-net架构实现。 这些模型中的条件空间被称为P空间,由语言模型的标记嵌入空间定义。基本上,P代表文本条件空间,在合成过程中,已经通过文本编码器传递给U-net的输入实例“p”被注入到所有注意层中。 下面是去噪扩散模型的文本条件机制概述。 通过这个过程,由于只有一个实例“p”被馈送到U-net架构中,对编码文本的获得的分离和控制是有限的。 因此,作者引入了一个被称为P+的新的文本条件空间。 这个空间由多个文本条件组成,每个条件被注入到U-net的不同层中。这样,P+可以保证更高的表达能力和分离性,提供对合成图像的更好控制。正如作者所描述的,U-net的不同层对合成图像的属性具有不同程度的控制。特别是,粗糙层主要影响图像的结构,而细层主要影响图像的外观。 在介绍了P+空间之后,作者引入了一个相关的过程,称为扩展文本倒置(XTI)。它是经典文本倒置(TI)的重新审视版本,TI的过程是模型学习将几个输入图像中描述的特定概念表示为专用标记。在XTI中,目标是将输入图像反转为一组标记嵌入,每个层一个标记嵌入,即反转为P+。 为了清楚地说明两者之间的区别,想象一下将“绿色蜥蜴”的图片输入到一个两层的U-net中。TI的目标是获得输出“绿色蜥蜴”,而XTI需要输出两个不同的实例,在这种情况下是“绿色”和“蜥蜴”。 作者在他们的工作中证明了P+中扩展倒置过程不仅比TI更具表达能力和精确性,而且速度更快。 此外,增加P+上的分离性能够通过文本到图像生成进行混合,例如对象样式的混合。 下面是来自上述工作的一个示例。 这就是P+的概述,一个用于扩展文本倒置的丰富的文本条件空间。

Leave a Comment

一项新的人工智能研究提出了一种基于蛋白质的三维结构的简单而有效的结构编码器,用于蛋白质表示学习

蛋白质是细胞的能量,在各种应用中都起着重要作用,包括材料和治疗。它们由一条氨基酸链组成,折叠成一定的形状。由于低成本测序技术的发展,近年来发现了大量的新型蛋白质序列。由于对新型蛋白质序列的功能注释仍然昂贵且耗时,因此需要准确有效的基于计算的蛋白质功能注释方法来弥合当前的序列-功能差距。 许多数据驱动的方法依赖于学习蛋白质结构的表示,因为许多蛋白质功能受到它们折叠方式的控制。然后,这些表示可以应用于蛋白质设计、结构分类、模型质量评估和功能预测等任务。 由于实验蛋白质结构鉴定的困难,已发表的蛋白质结构数量比其他机器学习应用领域的数据集数量少几个数量级。例如,蛋白质数据银行有182K个经实验证实的结构,而Pfam中有47M个蛋白质序列和ImageNet中有10M个注释图片。一些研究利用丰富的无标签蛋白质序列数据来开发适当的现有蛋白质表示,以弥合这种表征差距。许多研究人员已经利用自监督学习在数百万个序列上预训练蛋白质编码器。 准确的基于深度学习的蛋白质结构预测技术的最新发展使得能够有效自信地预测许多蛋白质序列的结构成为可能。然而,这些技术没有特别捕捉或使用关于蛋白质结构的信息,而这些信息已知决定蛋白质的功能。已经提出了许多基于结构的蛋白质编码器来更好地利用结构信息。不幸的是,这些模型尚未明确解决模拟蛋白质结构中至关重要的边缘之间的相互作用问题。此外,由于实验确定的蛋白质结构的匮乏,直到最近才进行了相对较少的工作,以创建利用无标签3D结构的预训练技术。 受到这一进展的启发,他们创建了一种可应用于各种属性预测应用的蛋白质编码器,并对最可行的蛋白质结构进行了预训练。他们提出了一种简单而高效的基于结构的编码器,称为GeomEtry-Aware关系图神经网络,它在编码空间信息后,在蛋白质残基图上进行关系传递。他们提出了一种稀疏边缘传递技术,以改进蛋白质结构编码器,这是第一个在蛋白质结构编码的GNN上实现边缘级消息传递的尝试。他们的想法受到Evoformer中三角形注意力设计的启发。 他们还提供了一种基于众所周知的对比学习框架的几何预训练方法,以学习蛋白质结构编码器。他们提出了创新的增强函数,增强来自同一蛋白质的亚结构获取表示之间的相似性,同时减小来自不同蛋白质的亚结构之间的相似性,以找到在蛋白质中同时出现的生理相关的蛋白质亚结构。他们同时提出了一套基于自预测的简单基线。 通过将他们的预训练方法与几个下游属性预测任务进行比较,他们为预训练蛋白质结构表示奠定了坚实的基础。这些预训练问题包括对各种几何或物理化学属性(如残基种类、欧氏距离和二面角)的屏蔽预测。使用各种基准测试,例如酶委员会编号预测、基因本体术语预测、折叠分类和反应分类,显示在监督环境中,具有边缘消息传递功能的GearNet在大多数任务上始终优于现有蛋白质编码器。 此外,使用建议的预训练策略,他们的模型在少于一百万个样本的训练下,获得了与甚至优于以百万或十亿的数据集为基础预训练的最先进序列编码器相当或更好的结果。代码库在Github上公开可用。它使用PyTorch和Torch Drug编写。

Leave a Comment

遇见CLAMP:一种新的AI工具,用于分子活性预测,可以在推理时间适应新的实验

几十年来,基于化学结构预测分子的化学、宏观或生物性质的任务一直是一个关键的科学研究问题。由于近年来技术的显著进步,许多机器学习算法已被用于发现化学结构与这些分子特性之间的相关性。此外,深度学习的出现标志着引入了活性预测模型,这些模型用于在去除具有不良特征的分子后对剩余分子进行生物测试排序。这些基于深度学习的活性预测模型是计算药物发现行业的主要工具,它们可以与自然语言处理中的大型语言模型和计算机视觉中的图像分类模型进行比较。这些基于深度学习的活性预测模型利用了各种低级化学结构描述,包括化学指纹、描述符、分子图、SMILES字符串表示或其组合。 尽管这些架构表现出色,但它们的进展并不像视觉和语言领域那样具有革命性。通常,使用来自生物实验或“生物检测”的分子对和活性标签来训练活性预测模型。由于标注训练数据(也称为生物活性)的过程非常耗时和劳动密集,研究人员急切地寻找能够以较少数据点高效训练活性预测模型的方法。此外,当前的活性预测算法还不能够使用关于活性预测任务的全面信息,这主要是因为这些模型需要从它们所训练或微调的生物检测或活性预测任务中获得测量数据。因此,当前的活性预测模型无法进行零样本活性预测,并且在少样本情况下的预测准确性较差。 由于其被报道具有零样本和少样本能力,研究人员已经转向各种科学语言模型来进行低数据任务。但是,当涉及到活性预测时,这些模型在预测质量方面明显不足。在解决这个问题的过程中,来自奥地利林茨约翰内斯·开普勒大学机器学习系的一组杰出研究人员发现,使用化学数据库作为训练或预训练数据,并选择一个高效的分子编码器,可以提高活性预测的效果。为了解决这个问题,他们提出了一种名为对比语言-生物检测-分子预训练(CLAMP)的新型活性预测架构,该架构可以根据预测任务的文本描述进行条件化。这种模块化架构由一个单独的分子编码器和一个单独的语言编码器组成,这两个编码器在这两个数据模态之间进行对比性预训练。研究人员还提出了一种对训练数据中包含的化学数据库中的信息进行对比性预训练的目标。这些数据中包含了比生物医学文本中的化学结构多几个数量级的化学结构。 如前所述,CLAMP使用可训练的文本编码器创建生物检测嵌入和可训练的分子编码器创建分子嵌入。假设这些嵌入已进行层归一化。奥地利研究人员提出的方法还包括一个评分函数,当一个分子在某个生物检测上活跃时提供高值,而在不活跃时提供低值。此外,对比学习策略使模型能够进行零样本迁移学习,简而言之,为未见过的生物检测产生有见地的预测。根据研究人员进行的多个实验评估显示,他们的方法在少样本学习基准和药物发现中的零样本问题上显著改善了预测性能,并产生了可迁移的表示。研究人员认为他们模型的模块化架构和预训练目标是其出色性能的主要原因。 需要记住的是,尽管CLAMP表现出色,但仍有改进的空间。许多影响生物检测结果的因素,如化学剂量,未被考虑在内。此外,某些不正确的预测可能由于语法不一致和否定引起。尽管如此,对比学习方法CLAMP在几个大型数据集上展示了在零样本预测药物发现任务中的最佳性能。

Leave a Comment

每个数据科学家都必须阅读的前7本自然语言处理书籍

介绍 自然语言处理(NLP)的最新进展对于数据科学家来说至关重要。NLP相关书籍是提供深入知识、实用指导和前沿技术的宝贵资源。本文将介绍8本最佳的NLP书籍,这些书对于数据科学家来说是必读的。这些作品涵盖了从NLP的基本原理到尖端的深度学习技术。无论你是初学者还是经验丰富的从业者,这些书籍都将提高你在NLP方面的理解和能力。 什么是NLP? 自然语言处理是人工智能领域的一个研究方向,专注于计算机与人类语言之间的交互。它涉及开发算法和技术,使计算机能够理解、解释和生成人类语言,以便实现诸如语言翻译、情感分析、聊天机器人和信息检索等任务。 请查看我们关于自然语言处理入门的免费课程。 1. 语音和语言处理 作者:Daniel Jurafsky和James H. Martin 《语音和语言处理》被认为是关于NLP最全面的手册,包括语音和语言处理方法。这本书介绍了基本概念、前沿的研究主题和算法。它提供了针对各种能力水平读者的练习和实际例子,对建立NLP的坚实基础非常有帮助。 书籍链接:语音和语言处理 2. 使用Python进行自然语言处理 作者:Steven Bird, Ewan Klein和Edward Loper 如果你想通过实践来学习新知识,那么《使用Python进行自然语言处理》是一个不错的选择。这本书演示了如何使用Python和NLTK(自然语言工具包)等知名模块开发NLP算法。重要的NLP过程包括情感分析、命名实体识别、词性标注、分词和命名实体识别。这本NLP书籍通过提供有用的例子和代码片段,让你能够在实际环境中运用NLP思想。 书籍链接:使用Python进行自然语言处理 3. 统计自然语言处理基础 作者:Christopher…

Leave a Comment

《斯坦福的一项新的人工智能研究展示了解释如何减少决策过程中对人工智能系统的过度依赖》

近年来,人工智能(AI)的繁荣与AI能够更快地完成工作并减少努力有多大关系。现如今,几乎没有任何领域不使用AI。例如,从Amazon Echo和Google Home等语音助手中的AI代理到使用机器学习算法预测蛋白质结构,AI无处不在。因此,合理地相信与AI系统合作的人会做出比单独行动更优越的决策是合理的。但实际情况是否确实如此呢? 以往的研究表明,情况并非总是如此。在一些情况下,AI并不总是产生正确的反应,这些系统必须进行重新训练以纠正偏见或其他问题。然而,对人工智能决策团队有效性构成危险的另一个相关现象是AI过度依赖,即人们受到AI影响并经常接受不正确的决策而不验证AI的正确性。在进行诸如识别银行欺诈和提供医学诊断等关键和重要任务时,这可能非常有害。研究人员还表明,解释性人工智能并不能减少AI过度依赖问题,解释性人工智能是指AI模型在每一步解释为何做出某个决策而不仅仅提供预测。一些研究人员甚至声称,认知偏见或未校准的信任是过度依赖的根源,将过度依赖归因于人类认知的不可避免性。 然而,这些研究结果并未完全证实AI解释应该减少过度依赖的观点。为了进一步探索这一点,斯坦福大学人类中心人工智能(HAI)实验室的研究团队声称,人们在是否与AI解释进行交互方面是有策略选择的,表明在某些情况下,AI解释可以帮助人们减少过度依赖。根据他们的论文,当相关的AI解释比手头的任务容易理解,并且这样做有更大的利益(可以是财务奖励形式),个体更不可能依赖于AI的预测。他们还证明,当我们专注于与解释互动而不仅仅是让目标提供解释时,可以大大减少对AI的过度依赖。 该团队将这种策略性决策在成本收益框架中进行了测试。在这个框架中,主动参与任务的成本和效益与依赖AI的成本和效益进行了比较。他们邀请在线众包工人与AI合作解决三个不同复杂度的迷宫挑战。相应的AI模型提供答案,要么没有解释,要么提供了多个程度的解释,从下一步的单个指令到退出整个迷宫的逐步指导。试验结果表明,诸如任务难度和解释难度之类的成本以及货币补偿等利益大大影响了过度依赖。对于AI模型提供逐步指导的复杂任务,过度依赖并没有减少,因为解读生成的解释与独自解决迷宫一样具有挑战性。此外,当能够独立解决迷宫时,大多数解释对过度依赖没有影响。 该团队得出结论,如果手头的工作具有挑战性并且相关的解释清晰明了,它们可以帮助防止过度依赖。然而,当工作和解释都很困难或简单时,这些解释对过度依赖几乎没有影响。如果活动容易执行,那么解释并不重要,因为人们可以自己轻松地执行任务,而不是依赖解释生成结论。此外,当任务复杂时,人们有两个选择:要么手动完成任务,要么检查生成的AI解释,这些解释通常同样复杂。这主要是因为AI研究人员可用的解释工具很少,需要的验证工作比手动执行任务要少得多。因此,人们倾向于相信AI的判断而不质疑它或寻求解释,并不奇怪。 作为一项额外的实验,研究人员还将经济利益因素引入了方程式。他们向众包工人提供了独立完成不同难度的迷宫任务以获得一笔钱的选择,或者以较少的金钱换取AI的帮助,要么没有解释,要么提供复杂的逐步指导。研究结果显示,当任务具有挑战性时,工人更重视AI的帮助,并更喜欢简单明了的解释。此外,发现随着使用AI的长期好处增加(在本例中是财务奖励),过度依赖减少。 斯坦福研究人员对他们的发现寄予厚望,希望能给那些被事实解释不能减少过度依赖的学者们带来一些安慰。此外,他们希望通过提供引人入胜的论据,激励可解释的人工智能研究人员,以改进和简化人工智能的解释。 查看论文和斯坦福文章。此研究的所有荣誉归功于该项目的研究人员们。此外,请不要忘记加入我们的26k+ ML SubReddit、Discord Channel和Email Newsletter,我们在那里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 使用Tensorleap的可解释性平台揭示深度学习的秘密 这篇文章来源于MarkTechPost,介绍了斯坦福的一项新的人工智能研究,展示了解释如何在决策过程中减少对人工智能系统的过度依赖。

Leave a Comment

“微软AI提出MM-REACT:一种将ChatGPT和视觉专家结合起来进行高级多模态推理和行动的系统范式”

大型语言模型(LLMs)正在迅速发展,并对经济和社会变革做出重要贡献。随着互联网上发布了许多人工智能(AI)工具,其中一个在过去几个月中非常受欢迎的工具是ChatGPT。ChatGPT是一种自然语言处理模型,允许用户生成像人类一样有意义的文本。OpenAI的ChatGPT基于GPT变压器架构,GPT-4是支撑它的最新语言模型。 随着最新的人工智能和机器学习发展,计算机视觉得到了指数级的提升,网络架构和大规模模型训练得到了改进。最近,一些研究人员引入了MM-REACT,这是一种将多个视觉专家与ChatGPT结合起来进行多模态推理和行动的系统范例。MM-REACT以更灵活的方式将各个视觉模型与语言模型结合起来,以克服复杂的视觉理解挑战。 MM-REACT的目标是处理现有视觉和视觉语言模型难以应对的各种复杂视觉任务。为此,MM-REACT使用提示设计来表示各种类型的信息,例如文本描述、文本化的空间坐标以及作为对齐文件名表示的密集视觉信号,如图像和视频。这种设计使ChatGPT能够接受和处理不同类型的信息与视觉输入相结合,从而实现更准确、全面的理解。 MM-REACT是一个将ChatGPT的能力与一组视觉专家相结合以增加多模态功能的系统。文件路径被用作占位符,并输入到ChatGPT中,以使系统能够接受图像作为输入。每当系统需要从图像中获取特定信息,例如识别名人姓名或框坐标时,ChatGPT会寻求特定视觉专家的帮助。专家的输出被序列化为文本,并与输入结合起来进一步激活ChatGPT。如果不需要外部专家,则直接将响应返回给用户。 通过向ChatGPT提示中添加与每个专家能力、输入参数类型和输出类型相关的特定指令,以及每个专家的一些上下文示例,使ChatGPT能够理解视觉专家的使用知识。此外,还指导使用正则表达式匹配来调用相应的专家。 通过实验,零-shot实验显示了MM-REACT如何有效地解决其特定的感兴趣的能力。它已经证明在解决需要复杂视觉理解的各种高级视觉任务方面非常高效。作者分享了一些例子,其中MM-REACT能够解决图像上显示的线性方程。此外,它还能够通过命名图像中的产品及其成分等来进行概念理解。总之,这种系统范例很好地结合了语言和视觉专业知识,并能够实现高级视觉智能。

Leave a Comment

一种新的深度强化学习(DRL)框架可以在模拟环境中对攻击者做出反应,并在攻击升级之前阻止95%的网络攻击

网络安全防御者必须根据技术发展和系统复杂性的提高动态调整他们的技术和策略。随着过去十年中机器学习(ML)和人工智能(AI)研究的进展,这些技术在各种与网络安全相关的领域中的使用案例也得到了发展。大多数现有安全应用程序中的一些功能性由在大量数据集上训练的强大的机器学习算法支持。其中一个例子是在早期的2010年代将ML算法集成到电子邮件安全网关中。 在实际情况下,创建自主的网络安全系统防御策略和行动建议是一项相当困难的任务。这是因为为此类网络安全系统防御机制提供决策支持需要同时考虑攻击者和防御者之间的动态特征以及系统状态的动态特征化。此外,网络安全防御者通常面临各种资源限制,包括与成本、劳动力和时间相关的限制。即使有了AI,开发一个能够主动防御的系统仍然是一个理想目标。 为了解决这个问题,美国能源部太平洋西北国家实验室(PNNL)的研究人员开发了一种基于深度强化学习(DRL)的新型AI系统,能够在模拟环境中响应攻击者,并能在攻击升级之前阻止95%的网络攻击。研究人员创建了一个自定义的模拟环境,展示了网络中攻击者和防御者之间的多阶段数字冲突。然后,他们使用强化学习的原则训练了四个DRL神经网络,例如根据避免妥协和减少网络中断来最大化奖励。该团队的工作还在华盛顿特区的人工智能促进协会上做了介绍,并获得了很高的评价。 该团队开发这样一个系统的理念是首先展示成功训练这样一个DRL架构是可能的。在深入研究复杂结构之前,他们希望展示有用的评估指标。研究人员首先使用Open AI Gym工具包创建了一个抽象的模拟环境。下一阶段是利用这个环境开发攻击者实体,在MITRE ATT&CK框架的15种方法和7种策略的子集上展示出技能和持久性水平。攻击者的目标是通过从初始访问和侦察阶段到其他攻击阶段直到达到其最终目标——影响和外泄阶段的七个攻击链步骤。 需要记住的是,团队并没有打算开发一个模型,在敌人在环境内发动攻击之前就能封锁敌人。相反,他们假设系统已经被入侵。然后,研究人员使用强化学习来训练四个神经网络。研究人员表示,在不使用强化学习的情况下训练这样一个模型是可以想象的,但需要很长时间来开发一个良好的机制。另一方面,深度强化学习通过模仿人类行为的某些方面,非常有效地利用了这个巨大的搜索空间。 研究人员努力证明AI系统能够在模拟攻击环境中成功训练,并展示出AI模型能够实时对攻击做出防御反应。为了对四个无模型DRL算法在实际的多阶段攻击序列中的表现进行严格评估,研究人员进行了多次实验。他们的研究表明,DRL算法可以在具有不同技能和持久性水平的多阶段攻击配置文件下进行训练,在模拟环境中产生有效的防御结果。

Leave a Comment

来自苏黎世联邦理工学院和微软的研究人员提出了X-Avatar:一种可以捕捉人体姿势和面部表情的可动态变换的隐式人类化身模型

姿势、眼神、面部表情、手势等,统称为“肢体语言”,一直是许多学术研究的课题。准确记录、解读和创建非言语信号可以极大地增强遥感、增强现实(AR)和虚拟现实(VR)环境中人物形象的逼真程度。 现有的最先进的人物形象模型,如SMPL系列中的模型,可以正确地描绘出逼真姿势中不同的人体形态。然而,它们受到其使用的基于网格的表示和3D网格质量的限制。此外,这类模型通常只模拟裸体,不包含服装和头发,从而降低了结果的逼真度。 他们介绍了X-Avatar,这是一种创新模型,可以在数字化人物形象中捕捉到人类表情的完整范围,以创建逼真的遥感、增强现实和虚拟现实环境。X-Avatar是由瑞士苏黎世联邦理工学院(ETH Zurich)和微软(Microsoft)研究人员开发的一种富有表现力的隐式人类人物模型。它可以捕捉高保真度的人体和手部动作、面部情绪和其他外貌特征。该技术可以从完整的3D扫描或RGB-D数据中学习,生成身体、手部、面部情绪和外貌的综合模型。 研究人员提出了一种部位感知的学习前向蒙皮模块,可以通过SMPL-X参数空间控制,实现X-Avatar的富有表现力的动画。研究人员提出了独特的部位感知采样和初始化算法,以有效地训练神经形状和变形场。研究人员通过一个纹理网络,根据位置、面部表情、几何形状和变形表面的法线来增强几何和变形场,以捕捉具有高频细节的人物外貌。这样可以提高细小身体部位的保真度,同时在关节骨骼数量增加的情况下保持训练的有效性。研究人员凭经验证明,该方法在动画任务上相对于强基线模型在数据领域和质量方面取得了更优秀的定量和定性结果。 研究人员提出了一个名为X-Humans的新数据集,其中包含来自20个受试者的233个高质量纹理扫描序列,共计35,500个数据帧,以促进对表达人物形象的研究。X-Avatar提供了一种以关节神经隐式表面为特征的人体模型,适应着穿着衣物的个体的多样拓扑结构,并实现了更好的几何分辨率和整体外貌的保真度。研究的作者定义了三个不同的神经场:一个用于使用隐式占据网络建模几何形状,另一个用于使用学习的前向线性混合蒙皮(LBS)建模变形,具有连续的蒙皮权重,第三个用于使用RGB颜色值建模外貌。 X-Avatar模型可以接受3D姿势扫描或RGB-D图像进行处理。其设计的一部分包括一个用于在规范空间中建模几何形状的塑形网络,以及一个使用学习的线性混合蒙皮(LBS)建立规范和变形区域之间对应关系的变形网络。 研究人员从SMPL-X的参数空间开始,这是一种捕捉全身人物形状、外貌和变形的SMPL扩展,特别关注手部位置和面部情绪,以生成富有表现力和可控的人类人物形象。以关节神经隐式表面来描述人体模型,代表着穿着衣物的个体的各种拓扑结构。同时,一种独特的部位感知初始化方法通过提高对细小身体部位的采样率,极大地增强了结果的逼真度。 结果表明,X-Avatar可以准确记录人体和手部姿势,以及面部情绪和外貌,从而可以创造出更具表现力和逼真的人物形象。这个倡议的团队衷心希望他们的方法可以激发更多的研究,赋予人工智能更多的个性。 使用的数据集 高质量纹理扫描和SMPL[-X]注册;20个受试者;233个序列;35,427个帧;身体姿势+手势+面部表情;各种服装和发型选择;各个年龄段 特点 有几种方法可以教授X-Avatars。 训练中使用的3D扫描图像,右上方。底部:测试姿势驱动的人物形象。 教学目的使用的RGB-D信息,顶部。测试姿势的人物形象表现较差。 该方法在动画测试中恢复了更好的手部灵活性和面部表情,超过了其他基线模型。这导致使用PyMAF-X从单眼RGB影片中恢复的运动进行动画化的X-Avatars。 限制 X-Avatar在模拟露肩上衣或裤子(例如,裙子)时存在困难。然而,研究人员通常只对每个主题训练一个模型,因此他们在单个个体之外的泛化能力仍然需要扩展。 贡献 X-Avatar是第一个全面捕捉身体姿势、手势、面部情绪和外观的富有表现力的隐式人类化身模型。 考虑底层结构的初始化和采样过程提高了输出质量并保持了训练效率。 X-Humans是一个全新的数据集,包含20个人的233个序列,总共有35,500帧高质量纹理扫描,显示了各种身体、手势和面部情绪。 X-Avatar在捕捉身体姿势,手势,面部情绪和整体外观方面无与伦比。研究人员使用最近发布的X-Humans数据集展示了该方法的效果。

Leave a Comment

AI推动的生产力:生成式AI开启了跨行业效率的新时代

2022年11月22日是一个具有里程碑意义的时刻,虽然大部分是虚拟的,但它震动了全球几乎每个行业的基础。 在那天,OpenAI发布了ChatGPT,这是迄今为止最先进的人工智能聊天机器人。这引发了对生成式人工智能应用的需求,这些应用帮助企业更高效地工作,从为消费者提供问题的答案,到加速研究人员在寻求科学突破时的工作,以及更多其他方面。 之前只是尝试过人工智能的企业现在正急于采用和部署最新的应用。生成式人工智能——算法创造新的文本、图像、声音、动画、3D模型甚至计算机代码的能力——正在以超光速发展,改变人们工作和娱乐的方式。 通过使用大型语言模型(LLMs)处理查询,这项技术可以大大减少人们用于搜索和整理信息等手动任务的时间。 利益巨大。据普华永道估计,到2030年,人工智能可能为全球经济贡献超过15万亿美元。而人工智能的采用影响可能超过互联网、移动宽带和智能手机的发明——总和超过。 推动生成式人工智能的引擎是加速计算。它使用GPU、DPU和网络以及CPU,加速应用程序在科学、分析、工程以及消费者和企业用例中的应用。 从药物发现、金融服务、零售和电信到能源、高等教育和公共部门的早期采用者,正在将加速计算与生成式人工智能结合起来,改变业务运营、服务提供和生产力。 点击查看信息图表:生成下一波人工智能转型 药物发现的生成式人工智能 今天,放射科医生使用人工智能来检测医学影像中的异常,医生使用它来扫描电子健康记录以发现患者洞察,研究人员使用它来加速新药的发现。 传统的药物发现是一个资源密集型的过程,可能需要合成5000多种化合物,平均成功率仅为10%。大多数新药候选品要花费十多年的时间才能上市。 研究人员现在使用生成式人工智能模型读取蛋白质的氨基酸序列,并能够在几秒钟内准确预测目标蛋白的结构,而不是几周或几个月。 使用NVIDIA BioNeMo模型,全球生物技术领导者Amgen将为分子筛选和优化定制模型的时间从三个月缩短到几周。这种可训练的基础模型使科学家能够为研究特定疾病创建变体,使他们能够开发针对罕见疾病的靶向治疗。 无论是预测蛋白质结构还是在大型真实世界和合成数据集上安全训练算法,生成式人工智能和加速计算正在开辟研究的新领域,有助于减轻疾病的传播、实现个性化医疗治疗和提高患者的生存率。 金融服务的生成式人工智能 根据最近的一项NVIDIA调查,金融服务行业中的顶级人工智能应用案例是客户服务和深度分析,其中自然语言处理和LLMs用于更好地回答客户的问题并发现投资见解。另一个常见的应用是推荐系统,它们提供个性化的银行体验、优化营销和投资指导。 先进的人工智能应用有助于帮助该行业更好地预防欺诈,并改变银行的方方面面,从投资组合规划和风险管理到合规和自动化。 80%的业务相关信息是以非结构化格式——主要是文本——存在的,这使其成为生成式人工智能的首选。彭博新闻每天发布与金融和投资社区相关的5000篇报道。这些报道代表了一大批非结构化的市场数据,可以用于进行及时的投资决策。 NVIDIA、德意志银行、彭博社和其他机构正在创建基于领域特定和专有数据的LLMs,用于支持金融应用。 财务变形器,或称“FinFormers”,可以学习上下文并理解非结构化金融数据的含义。它们可以驱动问答聊天机器人,概述和翻译金融文本,提供反对方风险的早期预警,快速检索数据并识别数据质量问题。 这些生成式人工智能工具依赖于能够将专有数据集成到模型训练和微调中的框架,集成数据策划以防止偏见,并使用安全措施保持与金融相关的对话。 预计金融科技初创企业和大型国际银行将扩大他们对LLMs和生成式人工智能的应用,开发复杂的虚拟助手为内部和外部利益相关者提供服务,创建超个性化的客户内容,自动化文档摘要以减少手动工作,并分析公共和私人数据的TB级数据以生成投资见解。 零售业的生成式人工智能 随着60%的购物旅程从线上开始,消费者比以往任何时候都更加联网和知识丰富,人工智能已成为帮助零售商满足不断变化的期望并与日益激烈的竞争区分开来的重要工具。…

Leave a Comment

MosaicML帮助AI用户提高准确性,降低成本并节省时间

初创公司MosaicML的使命是帮助AI社区通过提供易于训练和部署大型AI模型的工具,提高预测准确性,降低成本并节省时间。 在NVIDIA的AI播客中,主持人Noah Kravitz与MosaicML的首席执行官兼联合创始人Naveen Rao进行了对话,探讨了该公司如何致力于使大型语言模型的访问民主化。 MosaicML是NVIDIA Inception计划的成员之一,已经确定了普遍采用的两个关键障碍:协调大量GPU进行模型训练的困难以及与此过程相关的成本。 本月早些时候,当Databricks宣布以13亿美元收购MosaicML时,MosaicML成为新闻的焦点。 对于许多需要控制模型行为、尊重数据隐私并快速迭代开发基于AI的新产品的公司来说,使模型训练可访问是关键。 您可能还喜欢 Jules Anh Tuan Nguyen解释了AI如何让截肢者通过思维控制假肢和视频游戏 明尼苏达大学的一位博士后研究员讨论了他为截肢者实现通过思维控制假肢(甚至是手指动作)的努力。 Overjet的Ai Wardah Inam带来AI到牙科 Overjet是NVIDIA Inception的成员,正在迅速将AI引入牙科诊所。该公司的首席执行官Wardah Inam博士讨论了使用AI改善患者护理的问题。 Immunai的首席技术官和联合创始人Luis Voloch利用深度学习开发新药物 Immunai的联合创始人兼首席技术官Luis Voloch谈到了用机器学习和数据科学思维应对免疫系统挑战的问题。 订阅AI播客…

Leave a Comment