Press "Enter" to skip to content

Month: November 2023

使用Amazon SageMaker Model Registry、HashiCorp Terraform、GitHub和Jenkins CI/CD在多环境设置中推广管道

在人工智能(AI)和机器学习(ML)的快速发展环境中,为组织构建一个机器学习操作(MLOps)平台对于无缝衔接数据科学实验和部署,同时满足模型性能、安全性和合规性要求至关重要为了满足监管和合规要求,

Leave a Comment

未来无忧:在AI的企业进军中培养下一代实习生

在我在新加坡充满活力的亚太ESSEC管理硕士的授课过程中,我们深入讨论了AI和可持续性的交叉点。在这个论坛上,我们揭示了将技术解密以真正了解AI能力的必要性-只是这些,没有其他。 考虑一下哈佛商学院的Karim Lakhani的见解:“人类般的回应是一种统计幻觉。”拉卡尼揭开了外表,揭示了表面上的有知觉互动实际上只是“一种统计或计算幻觉”,一种通过消化我们的人文文本和视频而产生的模仿[1]。这与我的长期观点相吻合:当AI与技巧结合时,它不是取代角色,而是人类能力的有力盟友[2]。 然而,我们必须小心谨慎。让我们未经检查地承诺提升的进步可能对未来一代的蓬勃发展产生重大影响。我们现在要做的不是回避这些潜力巨大的工具,而是要智能地与它们接触,确保我们将AI的舵向人类潜力的提升,而不是削弱它。 随着数字时代的加速发展,AI在业务中的日益重要的角色揭示出对实习生和初级培训的彻底重新设想的迫切需求。大型语言模型(LLMs)的出现给我们敲响了警钟-让我们不要让我们的实习生过时了。想想这个:这些LLMs,虚拟世界中的年轻实习生,已经接管了曾经是新手的人类任务。它们起草备忘录,打扮演示文稿,丝毫不休息,又只消耗计算资源的“代币费用”。它们在效率上令人眼花缭乱,但必须明确一点:它们无法取代人类智慧-逻辑、推理和创造力,只有人类才能提供。 在企业增长的繁忙生态系统中,培养新手就像在一片高耸的橡树森林中培育娇嫩的树苗一样重要。实习生的角色是至关重要的。他们是海绵,吸收的不仅仅是技术知识,还有企业文化微妙的舞蹈。正是在这些早期职业生涯中,他们的专业之旅的基础被奠定,塑造了他们的成长轨迹。 然而,这种不可或缺的入门面临来自AI的威胁,它可以轻松自动化曾经为初学者所保留的差事甚至分析工作。如果能模仿简・奥斯汀(Jane Austen)小说主人公般自如地进行人机对话的LLMs能够承担曾经是实习生证明自己的地方,我们该怎么办?谷歌及其同类已经开创了试图弥合差距的培训计划,但真正的转变在于将最初的职业年改造为一个实战练习班——一个“执行教室”,在这里,学习是通过实践来完成,实践带来学习。 这里的关键是:技术作为工作崩溃的先兆的叙述并不完全准确。担心AI将取代人类角色的恐惧就像认为LLMs拥有无尽的智慧一样。虽然它们确实可以生成与人类闲聊惊人相似的回答,但事实是它们擅长将词语拼凑在一起,仅此而已。它们不是硅谷的圣贤,它们是算法幻术师,能够让数据跳舞,但仍然无法达到人类智慧的水平。 这使我们陷入了期望的两难境地。我们把在机器上施加了阿西莫夫第一条机器人定律的高标准-不造成伤害-同时却原谅了LLMs的错误,对它们的对话技巧感到迷醉。我们嘲笑了自主车辆的少有的失误,但对于聊天机器人的有缺陷的诗句则会哈哈大笑。 那么,行动的号召是什么?在将AI融入我们的业务中时,我们必须重新审视实习生的手册。我们必须注入人性化的培训,培养耐心,并提供一系列的经验,任何算法都无法复制。我们的目标是给我们的实习生武装技能,使他们能够与AI一起取得成功,确保随着公司阶梯的变革,它仍然是通往启示的攀登,而不是陷入无关紧要的滑坡。 总的来说,在我的讲座中,我揭穿了关于人工智能的神话,明确表示LLMs虽然复杂,但并不完美,人工智能是一种增强工具,而不是替代品。我强调一个更深层次的信息。我们必须发展我们的企业教育,不是对技术的一种反射动作,而是将其战略性地融入其中,确保我们的年轻人成为未来企业的有韧性的建筑师,而不是它的牺牲品。机器人可以负责拿咖啡,但是董事会的席位呢?让我们留给那些学会与机器共舞的人类。 参考资料 [1] Lakhani, Karim. “AI Won’t Replace Humans — But Humans With AI…

Leave a Comment

微软研究员揭示FP8混合精度训练框架:为大规模语言模型训练效率注入动力

大型语言模型以前未曾有过的语言创造和理解的能力已经得到展示,为逻辑、数学、物理和其他领域的进步铺平了道路。但大型语言模型的训练非常昂贵。例如,要训练一个540B模型,PaLM需要6144个TPUv4芯片,而GPT-3 175B的预训练需要数千个拍夫洛普/秒的计算。这凸显了降低大型语言模型训练成本的需求,尤其是为了扩展下一代极智能模型。其中最有前景的节约成本方法是低精度训练,它可以提供快速处理、少内存使用和最小的通信开销。目前大多数的训练系统,如Megatron-LM、MetaSeq和Colossal-AI,通常默认使用FP16/BF16混合精度或FP32完全精度来训练大型语言模型。 对于大型模型来说,这是为了获得完全的准确性而非必需的。随着Nvidia H100 GPU的到来,FP8正在成为下一代低精度表示的数据类型。与现有的16位和32位浮点混合精度训练相比,FP8理论上具有2倍的加速、50%至75%的内存成本降低以及50%至75%的通信节省。这些结果对于扩展下一代基础模型非常鼓舞人心。遗憾的是,FP8训练还需更多、更少的支持。Nvidia Transformer Engine是唯一可行的框架,然而它只使用FP8进行GEMM计算,并将主权重和梯度保持在极高精度(如FP16或FP32)中。因此,综合性能提高、内存节省和通信成本节约相对较小,使FP8的全部潜力仍然隐藏着。 Microsoft Azure和Microsoft Research的研究人员提供了一个高效的FP8混合精度框架,用于解决大型语言模型训练中的这一问题。其主要原理是在大型模型训练过程中利用低精度的FP8进行计算、存储和通信。这将大大降低系统需求,与之前的框架相比。更准确地说,他们创建了三个优化阶段,使用FP8简化分布式和混合精度训练。三个阶段逐步引入了优化器、分布式并行训练和8位集中通信。更高的优化级意味着在大型语言模型训练过程中使用了更多的FP8。此外,他们的系统还提供FP8低位平行性,包括张量、流水线和序列平行性。它可以实现规模化训练,例如使用数千个GPU训练的GPT-175B,打开了低精度并行训练的大门。 使用建议的FP8低精度框架对GPT风格模型的训练(包括有监督的精细调节和预训练),进行验证。将他们的FP8方法与广泛使用的BF16混合精度训练方法进行比较,实验结果显示了显著的改进,例如实际内存使用量减少了27%至42%,重要的是,重量梯度通信开销减少了63%至65%。无论是在预训练还是下游任务中,使用FP8训练的模型与利用BF16高精度的模型性能相当,而不需要对学习率和权重衰减等超参数进行任何调整。在GPT-175B模型的训练过程中,有一点值得注意,他们的FP8混合精度框架在H100 GPU平台上使用的内存比TE少21%,节省的训练时间比TE少17%。 图1:使用我们的FP8混合精度训练方法与更流行的BF16方法在一台拥有80G RAM的Nvidia H100 GPU集群上可以实现的最大模型尺寸的比较。 更重要的是,当模型规模增大时,如图1所示,使用低精度FP8所达到的成本节约可能进一步增强。为了更好地匹配预训练LLMs与最终任务和用户偏好,他们使用FP8混合精度进行指令微调和人工输入的强化学习。特别是,他们使用公开可用的用户共享的指令跟踪数据对预训练模型进行微调。在获得27%的训练速度增益的同时,使用他们的FP8混合精度调整的模型在AlpacaEval和MT-Bench基准测试中表现与使用半精度BF16的模型相似。此外,FP8混合精度在需要加载许多训练模型的RLHF过程中显示出显著的优势。 通过在训练中使用FP8,流行的RLHF框架AlpacaFarm可以在模型权重上实现46%的减少,并在优化器状态的内存使用上实现62%的减少。这更加显示了他们的FP8低精度训练架构的灵活性和适应性。以下是他们为未来一代LLMs进一步发展FP8低精度训练所做的贡献。 • 一种逐渐解锁8位权重、梯度、优化器和分布式训练的易于使用的FP8混合精度训练新框架。通过仅更改超参数和训练凭据,可以轻松将当前16/32位混合精度等价物与这个8位框架互换。他们还提供了一个PyTorch的实现,只需几行代码即可进行8位低精度训练。 • 一系列新的以FP8训练的GPT风格模型。通过将其应用于GPT预训练和微调,他们展示了所提出的FP8方案在从7B到175B参数的一系列模型尺寸上的能力。他们为流行的并行计算范式提供了FP8支持(张量、流水线和序列并行),使FP8可用于训练大型基础模型。他们基于Megatron-LM实现的第一个FP8 GPT训练代码库已公开提供。他们期待引入他们的FP8框架将为未来一代面向大基础模型的低精度训练系统提供新的标准。

Leave a Comment

KOSMOS-2:微软的多模态大型语言模型

介绍 2023年是一个人工智能的年份,从语言模型到稳定的扩散模型。其中一个新的玩家登上了舞台,那就是由微软开发的KOSMOS-2。它是一个多模态大型语言模型(MLLM),在理解文本和图像方面具有开创性的能力。开发语言模型是一回事,而为视觉创建模型是另一回事,但拥有同时具备这两种技术的模型则是另一个全新层次的人工智能。在本文中,我们将深入探讨KOSMOS-2的特点和潜在应用,以及它对人工智能和机器学习的影响。 学习目标 了解KOSMOS-2多模态大型语言模型。 了解KOSMOS-2如何执行多模态接地和指称表达生成。 深入了解KOSMOS-2在现实世界中的应用。 在Colab中使用KOSMOS运行推理。 本文是作为 数据科学博客马拉松 的一部分发布的。 了解KOSMOS-2模型 KOSMOS-2是微软研究团队的一项成果,他们在一篇名为“Kosmos-2:将多模态大型语言模型接地到世界”的论文中介绍了这个模型。KOSMOS-2旨在同时处理文本和图像,并重新定义我们与多模态数据的交互方式。KOSMOS-2基于基于Transformer的因果语言模型架构构建,类似于其他著名模型如LLaMa-2和Mistral AI的7b模型。 然而,KOSMOS-2的独特训练过程是其与众不同之处。它使用一组庞大的图像-文本对训练数据集,称为GRIT,其中文本以特殊令牌形式包含了对图像中物体的引用边界框。这种创新的方法使KOSMOS-2能够提供对文本和图像的新理解。 什么是多模态接地? KOSMOS-2的一个亮点功能是其执行“多模态接地”的能力。这意味着它可以为图像生成描述对象及其在图像中的位置的字幕。这大大减少了语言模型中的“幻觉”问题,极大地提高了模型的准确性和可靠性。 这个概念通过独特的令牌将文本与图像中的对象联系起来,有效地将对象“接地”到视觉环境中。这减少了幻觉,增强了模型生成准确图像字幕的能力。 指称表达生成 KOSMOS-2在“指称表达生成”方面也表现出色。这个功能允许用户以图像中特定边界框和问题的方式提示模型。然后,模型可以回答有关图像中特定位置的问题,为理解和解释视觉内容提供了强大的工具。 这种令人印象深刻的“指称表达生成”用例允许用户使用提示,并为与视觉内容的自然语言交互打开了新的途径。 使用KOSMOS-2进行代码演示 我们将看到如何在Colab上使用KOSMOS-2模式进行推理。在这里找到完整的代码:https://github.com/inuwamobarak/KOSMOS-2 步骤1:设置环境 在这一步中,我们安装必要的依赖库,如🤗 Transformers、Accelerate和Bitsandbytes。这些库对使用KOSMOS-2进行高效推理至关重要。 !pip install…

Leave a Comment

认识CodeGPT:AI社区中掀起风潮的全新代码生成工具

在AI代码生成工具中,CodeGPT是程序员的最爱之一。它是用于Visual Studio Code的附加组件,利用GPT-3语言模型生成代码、翻译语言、撰写各种类型的内容和回答问题。 CodeGPT目前还在开发中,但它有潜力改变开发人员编码的方式。CodeGPT能够理解自然语言是与其他AI代码生成工具不同的特点之一。这意味着开发人员可以用自然语言编写描述来指示CodeGPT构建代码,而不是使用正式的编程术语。对于学习新语言或框架的开发人员来说,这样节省的时间可能是很大的。 CodeGPT的另一个优点是它能够生成高效和惯用的代码。CodeGPT之所以具有这个优势,是因为它经过大量实际项目的代码训练。这意味着CodeGPT精通每种编程语言的规范和标准。 最后,CodeGPT经常发布更新和增强功能。CodeGPT团队定期更新软件,修复可能出现的问题。这意味着CodeGPT在代码生成、语言翻译、内容创建和问题回答等各种任务中不断改进。 CodeGPT的应用领域: CodeGPT可以自动完成不完整或不清楚的代码片段。特别是在处理庞大而复杂的代码库时,这对工程师来说是一个巨大的时间节省。 使用CodeGPT可以生成函数、类甚至整个程序。这可以帮助快速生成基本代码或开发新概念。 CodeGPT可以帮助程序员重构代码,推荐更清晰、更惯用的代码结构。它还可以帮助程序员发现和修复代码中常见的安全漏洞。 在调试代码方面,CodeGPT是一个有用的工具,因为它提供可能导致错误的原因,并提供修复建议。 查找错误:CodeGPT可以帮助开发人员通过识别潜在问题和提供测试来发现代码中的错误。 如果使用正确,CodeGPT是一个强大的工具,可以提高程序员编写代码的速度、效率和质量。 您可以在这里获取CodeGPT:https://marketplace.visualstudio.com/items?itemName=DanielSanVoAGI.dscodegpt&ssr=false 您可以在这里下载并使用Mistral:https://docs.codegpt.co/docs/tutorial-ai-providers/ollama Introducing CodeGPT, running the @MistralAI 7B model locally in VSCode…

Leave a Comment

“Phind的新人工智能模型在编码方面表现优于GPT-4,在速度上类似于GPT-3.5,并具备16k的上下文”

<img alt=”” src=”https://ai.miximages.com/www.marktechpost.com/wp-content/uploads/2023/11/Screenshot-2023-11-08-at-8.11.55-PM-1024×520.png”/><img alt=”” src=”https://ai.miximages.com/www.marktechpost.com/wp-content/uploads/2023/11/Screenshot-2023-11-08-at-8.11.55-PM-150×150.png”/><p>在编码和技术问题解决中,速度和准确性之间的权衡一直是一个挑战,当寻找复杂问题的答案时,开发人员经常需要快速可靠的帮助。</p><p>GPT-4经常面临较慢的响应时间问题。获得答案的延迟可能会影响生产力。</p><p>Phind的v7模型超过了GPT-4的编码能力,而且速度非常快。Phind模型的响应时间提高了5倍,只需10秒钟即可提供高质量的技术问题答案,相比其前身需要50秒的等待时间,有了显著的改进。</p><p>Phind模型现在已经进入第7代,该模型是基于CodeLlama-34B优化而建立的,是第一个在HumanEval得分中超过GPT-4的模型。这个新模型经过了700亿个高质量代码和推理问题的令人印象深刻的优化。虽然它获得了显著的HumanEval分数达到了74.7%,但值得注意的是,真实世界中的有用性往往超越这些指标。通过全面的反馈收集和用户体验,Phind模型已经证明了在实际编码场景中,能够始终达到或超过GPT-4的效用。</p><p>Phind模型的一大亮点是其速度。通过利用NVIDIA的H100s和TensorRT-LLM库的强大功能,它可以在单个流中每秒处理100个标记,为需要帮助的用户提供快速的协助。</p><p>此外,Phind模型在响应中提供了广泛的上下文支持,支持高达16,000个标记。目前,该模型允许在网站上输入最多12,000个标记,其余4,000个用于基于网络的结果。</p><p>尽管Phind模型提供了实质性的好处,在某些方面仍需要改进。一个值得注意的挑战是一致性,特别是处理复杂问题时。在这些情况下,Phind模型可能需要更多的迭代才能得出正确答案,而GPT-4则不同。</p><p>总之,Phind模型是解决高效可靠编码辅助的持续问题的一种有希望的解决方案。它集合了卓越的编码能力,显著的速度和广泛的上下文支持,为用户提供了真实世界的帮助。随着这个模型的不断发展和解决剩余的挑战,它有潜力在回答技术问题的方式上实现革命性的改变,为开发人员和技术爱好者提供更高效和生产力的编码体验。</p><p>本文发表在<a href=”https://www.xiaozhuai.com/chinese-ai-researchers-have-proposed-4k4d-a-4d-point-cloud-representation-that-enables-hardware.html”>xiaozhuai.com</a>上,原文标题《Phind的新AI模型在编码方面超越了GPT-4,速度和16k上下文类似于GPT-3.5》。</p><p>本文首发于<a href=”/?s=MarkTechPost”>MarkTechPost</a>。</p>

Leave a Comment

LLM革命:改变语言模型

介绍 在过去几年中,语言模型领域经历了一场巨大的演变,特别是随着大规模语言模型(LLMs)的出现。这些模型具备数十亿个参数和对自然语言的深刻理解,对于改变人工智能领域起到了关键作用。今天,我们将探索这场革命,重点介绍从闭源到开源LLMs的转变,精细调整的重要性以及最近出现的高效调整技术的发展。 学习目标: 了解闭源和开源LLMs的区别。 了解LLMs中的传统和参数高效调整。 探索不同的参数高效调整策略。 学习使用Ludwig进行高效调整。 闭源vs开源LLMs:选择正确的方法 语言模型领域存在着闭源模型(如OpenAI的ChatGPT、GPT 3.5和GPT 4)和开源变种(如Meta、Google和各种研究实验室提供的)之间的两极分化。闭源LLMs由于其管理基础设施和快速概念验证能力,成为一个引人注目的起点。这些模型提供高质量的预训练数据集,并且无需设置基础设施,使得那些探索LLMs能力的人可以轻松入门。 然而,尽管闭源LLMs易于获取,但它们存在根本性的局限性。它们缺乏模型所有权和极少的自定义能力,特别是对于数据隐私和模型控制至关重要的领域,这使得闭源LLMs不太适合长期投资。相比之下,开源LLMs提供了一个有希望的替代方案。它们使得完全拥有模型和自定义成为可能,并便利地获得开源空间中的创新发展。而付出的代价则是主机费用和困难。 传统微调和参数高效微调 微调成为了最大化LLMs潜力的关键过程,特别是考虑到特定领域任务的情况下。闭源模型常常缺乏所需的灵活性进行微调,而开源模型则可以完全控制这个过程。微调允许通过更新模型权重将预训练的LLMs适应于特定任务,从而提高性能。这是将这些通用模型个性化为专用应用的手段,为独特任务优化性能。 关于微调和类似检索增强生成(RAG)模型之间的辩论,重点在于是否需要针对具体任务进行定制的模型,而非通用智能模型。开源LLMs的性质允许自定义和高效微调以实现卓越的任务特定性能。 传统微调涉及更新所有模型参数,这一过程已被证明是资源密集型、耗时且不总能获得最佳的任务特定性能。然而,参数高效微调的最新创新取得了突破。通过冻结预训练LLM并仅训练一小部分特定任务层(不到总模型权重的1%),高效微调变得既节约资源又更有效。 向参数高效微调的转变显著影响了LLMs如何适应特定任务。通过仅关注训练少量特定任务层,这个过程变得更具成本效益和高效性。这种创新方法在较小数据集上实现了最佳任务特定性能,展示了开源LLMs相对于闭源模型的潜力。 Meta等人的LIMA论文等研究支持了在较小数据集上进行微调可以超越GPT 4等闭源模型性能的观点。这种通过较少数据实现更多的概念的概念突出了开源LLMs在适当微调下的效率和效果。 理解高效训练策略 在利用预训练模型进行特定任务时,LoRA(低秩自适应)和QLoRA(量化低秩自适应)已经成为有效微调大型语言模型(LLMs)的创新方法。这些方法对于将预训练模型定制为专用任务而最小化附加参数非常重要。 LoRA:对体系结构的深入研究 LoRA的体系结构涉及低秩分解,通过将变压器架构中的大型权重矩阵分解为较小矩阵来实现。在变压器的上下文中,LoRA专注于查询,键和值线性投影。 通常,这些线性投影具有大的权重矩阵,例如1024×1024,LoRA将其分解为较小的矩阵,例如1024×8和8×1024。这些较小的矩阵相乘,可以产生原始的维度。这种压缩大大减少了可调参数的数量,约为总LLM参数的一半到1%。 在变压器体系结构的上下文中,LoRA为键和查询投影层集成了适配器模块。这些通过低秩分解构造的适配器保持了原始形状,同时使其能够插入到变压器层中。基本层保持冻结状态,只有适配器权重是可训练的。…

Leave a Comment

Core42和Cerebras发布Jais 30B,为阿拉伯语大型语言模型设定了新的基准

Cerebras和Core42(G42公司和总部位于阿联酋的全国性云和生成AI赋能机构)宣布推出 Jais 30B,这是其开源阿拉伯大型语言模型(LLM)的最新和最精细版本。 Jais 30B是其上一版本Jais 13B的重大升级,Jais 13B于2023年8月发布。新模型具有300亿个参数,而Jais 13B只有130亿个,并且它是在更大的数据集上进行训练的。这导致在语言生成、摘要和阿拉伯-英语翻译方面取得了显著的改进。 Jais 30B现已与单语英语模型持平,并在基础模型评估中胜过大多数开源模型。该模型还能够用阿拉伯语和英语生成更长、更详细的回答。 Core42致力于负责任和安全的AI实践,Jais 30B开发团队进一步加强了其过程和政策,以监管模型产生偏见、仇恨或有害内容的情况。 Jais 30B可在Hugging Face上下载。 Hugging Face基础模型:https://huggingface.co/core42/jais-30b-v1 Hugging Face聊天模型:https://huggingface.co/core42/jais-30b-chat-v1 Jais 30B的推出是Core42和阿拉伯语世界的重要里程碑。该模型有可能彻底改变我们在阿拉伯语中的沟通、学习和工作方式。 该文章由MarkTechPost发布:作者:Core42和Cerebras发布了Jais 30B,创造了阿拉伯大型语言模型的新标杆。

Leave a Comment

解读隐藏马尔可夫模型的力量

介绍 你是否曾经思考过智能手机语音识别的机制,以及天气预报的复杂性?如果是的话,你可能会对隐藏马尔可夫模型(HMM)所起的关键作用感到好奇。这些数学结构在语音识别、自然语言处理和生物信息学等领域产生了深刻的变革,使系统能够解开顺序数据的复杂性。本文将简要介绍隐藏马尔可夫模型、它们的应用、组成部分、解码方法等内容。 学习目标 了解隐藏马尔可夫模型(HMM)的基本组成部分,包括状态、观测、转移概率、发射概率和初始状态概率。 探索HMM的主要解码算法:前向算法、维特比算法和鲍姆-韦尔奇算法,以及它们在语音识别、生物信息学等领域的应用。 认识到HMM的局限性和挑战,并学会如何减轻这些问题,比如对初始化的敏感性、独立性假设和数据数量需求。 隐藏马尔可夫模型 来源:Wisdom ML 隐藏马尔可夫模型(HMM)是由Baum L.E.于1966年引入的强大统计模型。它们利用观察数据揭示了马尔可夫过程中的隐藏状态。HMM在语音识别、字符识别、移动通信、生物信息学和故障诊断等领域起着关键作用。它们通过概率分布将关注事件和状态之间的差距连接起来。HMM是双重随机的,结合了一个主要的马尔可夫链和连接状态和观测的过程。它们在解码监控数据的趋势、适应变化的模式以及包含季节性等元素方面表现出色。在时间序列监视中,HMM是无价的,甚至可以扩展到空间信息应用。 HMM的应用 由于其对顺序数据和隐藏状态建模的能力,隐藏马尔可夫模型(HMM)在多个领域有着广泛的应用。让我们探索HMM在不同领域的应用: 使用步态进行人类识别:HMM在基于独特步态模式识别个体的身份方面发挥着重要作用。通过对人们独特的行走风格建模,HMM可以帮助区分一个人和另一个人。这个应用在安全系统和访问控制中至关重要,通过融合人类步态分析来增强生物特征识别方法。 从时间顺序图像中识别人类动作:HMM在识别和分类从顺序图像或视频帧中的人类动作方面至关重要。通过捕捉不同姿势和动作之间的时间依赖性和转换,HMM可以准确地识别个人的各种活动。这个应用在监视、视频分析和体育表现评估等领域广泛应用。 通过视频识别面部表情:在情感计算和人机交互中,HMM用于分析视频中的面部表情。通过捕捉面部肌肉运动和表情的时间动态,它们帮助识别和解释情绪和情绪变化。这个应用对于理解用户体验、情感反应和各种交互系统中的非语言沟通线索至关重要。 HMM的基本组成部分 隐藏马尔可夫模型(HMM)具有定义其结构和功能的几个基本组成部分。了解这些组成部分对于有效地使用HMM非常重要。以下是HMM的基本组成部分: 状态(S) 观测(O) 转移概率(A) 发射概率(B) 初始状态概率(π) 状态空间(S) 观测空间(O)…

Leave a Comment

这篇人工智能研究介绍了PERF:将单张图像转化为可探索的3D场景的全景NeRF变换

NeRF代表神经辐射场,是一种基于深度学习的三维场景重建和视图合成技术。为了准确地构建三维表示,通常需要多张场景的图像或视图。 NeRF包括一组从不同视点拍摄的场景图片。 NeRF已经激发了扩展和改进,例如NeRF-W,旨在使其更加高效、准确,并适用于各种场景,包括动态场景和实时应用。其变种对计算机视觉、计算机图形和三维场景重建领域都产生了重要影响。 然而,如果只有一张图片并且想要融入3D先验知识,就需要改善三维重建的质量。目前的技术限制了视野范围,这极大地限制了其在面对真实世界的360度全景场景和大尺寸情况下的可扩展性。研究人员提出了一种名为PERF的360度全景新视图合成框架。其中PERF代表全景神经辐射场。他们的框架通过单个全景图来训练一个全景神经辐射场。 全景图是通过捕捉多张图像,通常是连续的,然后将它们拼接在一起形成一个无缝的广角景观、城市景观或其他场景的表示。团队提出了一种协同RGBD修复方法,用于完成可见区域的RGB图像和深度图的修复。他们还训练了一个单目深度估计器,用于生成从输入全景图中不可见的新奇外观和三维形状。 从单个全景图中训练一个全景神经辐射场(NeRF)是一个具有挑战性的问题,原因是缺乏三维信息、大尺寸对象遮挡、重建和生成的耦合问题以及在填充期间可见区域和不可见区域之间的几何冲突。为了解决这些问题,PERF包括三个步骤:1)获得带深度监督的单视角NeRF训练;2)协同RGBD修复感兴趣区域;3)使用渐进式填充和抹除生成。 为了优化感兴趣区域的深度图预测并使其与整体全景场景一致,他们提出了填充和抹除方法,该方法通过从随机视角填充不可见区域并从其他参考视图中观察到的冲突几何区域进行抹除,以获得更好的三维场景完成。 研究人员在Replica和PERF-in-the-wild数据集上进行了实验。他们证明了PERF实现了最新的单视角全景神经辐射场技术。他们表示PERF可以应用于全景到三维、文本到三维和三维场景风格化任务,以获得令人惊叹的结果和几个有前景的应用。 PERF显著提高了单镜头NeRF的性能,但严重依赖深度估计器和稳定扩散的准确性。因此,团队表示未来的工作将包括改进深度估计器和稳定扩散模型的准确性。

Leave a Comment

使用MONAI Deploy在AWS上构建医学影像AI推理流程

在这篇文章中,我们向您展示如何创建一个可在使用MONAI Deploy App SDK构建的应用程序中重复使用的MAP连接器,以与AWS HealthImaging集成并加速从云原生DICOM存储中检索图像数据,用于医学影像人工智能工作负载MONAI Deploy SDK可用于支持医院运营我们还演示了两种托管选项,以便在SageMaker上大规模部署MAP AI应用程序

Leave a Comment

NVIDIA与APEC经济体合作,改变人们的生活,增加机会,改善结果

在越南,当病人进入医疗机构感到困扰时,医生利用英伟达技术进行更准确的扫描以诊断他们的疾病。在香港,另一组医生利用生成式人工智能发现治疗患者的新方法。 改善市民的健康和福祉,增强经济和社区的发展是2023年亚太经济合作组织(APEC)峰会即将在旧金山召开的关键主题。 当他们会面讨论改善市民和社会生活的大胆解决方案时,英伟达的人工智能和加速计算项目是一个关键的推动者。 英伟达致力于改善日常人群的结果,同时解决未来的挑战,这是多年来与APEC合作伙伴的深度投资的积累。英伟达在该地区的业务非常强大,包括数以千计的员工和在农业、医疗保健和教育等领域的众多合作项目,致力于提供新技术和员工培训计划,以增强产业发展和推进生成式人工智能研究。 除了技术进步,这些努力还推动经济增长,创造高薪工作机会,并提高全球人民的健康和福祉。 研究和国家计算合作伙伴关系 英伟达与几个APEC经济体建立了先进的人工智能研究合作伙伴关系。这些合作促进人工智能和高性能计算方面的科学突破,以应对包括医疗保健、技能发展和创建更强大的本地人工智能生态系统等国家挑战。例如: 澳大利亚的国家科学与研究机构CSIRO与英伟达合作,推进澳大利亚的人工智能计划,涵盖气候行动、空间探索、量子计算和人工智能教育等领域。 新加坡的国家超级计算中心和教育部与英伟达合作,重点推动主权级人工智能能力发展,特别关注医疗保健、气候科学和数字孪生等领域。 泰国是东南亚首个参与英伟达“人工智能国家”项目的国家,将教育部与一系列顶尖大学的联盟组织在城市规划、公共卫生和自动驾驶等领域开展公私合作。 在越南,英伟达与越南最大的雇主Viettel以及越南科学技术学院合作,提升员工技能,加速将人工智能服务引入工业,部署下一代5G服务。 创新生态系统 创业公司是人工智能创新的前沿,健康的创业公司生态系统对于推动APEC经济体内的技术发展至关重要。 英伟达加速是一个免费计划,帮助创业公司更快地创新。通过该计划,英伟达支持APEC内的5000多家创业公司,并且全球支持超过15000家创业公司,提供尖端技术、与风险投资家的联系,以及最新的技术资源。 在2023年,英伟达将近1000家APEC地区的创业公司加入了该计划。除了创造经济机会,加速还支持中小型企业开发创新解决方案来应对社会面临的一些最大挑战。以下是其中一些成员的情况: 在马来西亚,Tapway使用人工智能技术来减少拥堵,为每天超过100万名乘客提供交通资源优化。 在新西兰,Lynker利用地理空间分析、深度学习和遥感技术进行地球观测。Lynker的技术可以测量农场的碳吸收情况,检测、监测和恢复湿地,并实现更有效的灾害救援。 在泰国,AltoTech Global与加速合作伙伴,将人工智能软件与物联网设备整合,优化酒店、建筑、工厂和智能城市的能源消耗。AltoTech的最终目标是为实现零碳经济做出贡献,并帮助客户实现零碳目标。 数字技能提升和增长工具 英伟达深度学习研究所(DLI)提供人工智能培训和数字技能提升计划,培养创新并创造经济机会。 DLI的培训和认证计划旨在帮助个人和组织加快在人工智能、高性能计算和工业数字化方面的技能发展和劳动力转型。 课程由NVIDIA专家创建和教授,提供实践操作、自主学习和带领学习的方式,将现实世界的经验和深厚的技术知识带给开发人员和IT专业人员。 通过该计划,NVIDIA已经培训了超过11.5万名APEC经济体的个人,其中今年有超过1.6万名新学员。 此外,NVIDIA开发者计划为APEC经济体的200多万开发人员提供软件开发工具包、应用程序接口、预训练的人工智能模型和性能分析工具,帮助开发人员创造和创新。会员可以免费获得实际操作的培训、访问开发者论坛以及提前获得新产品和服务的权限。…

Leave a Comment