Press "Enter" to skip to content

Month: September 2023

AI初创企业战胜大型科技公司的3个策略

构建具有防御能力的公司变得比以往任何时候都更加困难,尤其是随着生成式人工智能的出现大型科技公司在分销和竞争定价方面相对于初创公司具有固有的优势任何初创公司创始人都知道噩梦般的场景:醒来后发现自己的领域有一家大公司提供了具有竞争力的新功能或产品而且,这还是免费的而且,他们还将其捆绑在了……

Leave a Comment

“物联网公司的智能视频分析平台与AI在班加罗尔机场合作成功降落”

每年有近3200万人通过孟加拉国际机场(BLR),这是世界上人口最多的国家中最繁忙的机场之一。 为了为这么多人提供更安全、更快捷的体验,这座位于原名班加罗尔的城市的机场正在利用由Industry.AI提供支持的视觉AI技术。 作为NVIDIA Metropolis视觉AI合作伙伴生态系统的成员,Industry.AI已经在BLR最新的T2航站楼(也被称为花园航站楼,因为它拥有室内花园和瀑布)部署了其视觉AI平台。这是印度机场规模上的智能视频分析的首批部署之一。 BLR最新航站楼中的绿化。 Industry.AI通过使用视觉AI和目标检测来追踪遗弃的行李、标记长队并向安全团队发出潜在问题的警报等应用案例,提高了航站楼的运营安全性和效率。 通过使用视觉AI识别拥堵点并预测延误,工作人员可以主动将乘客引导到人流较少的区域,或者提供信号以开放额外的检查点,从而减少等待时间,提升乘客体验。 “在这个规模上部署视觉AI对我们来说是第一次,”BLR母公司的首席信息官George Fanthome表示。“通过采用这些先进的深度学习技术,我们力争成为世界上最好的机场之一,并为我们的客户提供最佳体验。” 更智能、更安全的机场运营 Industry.AI平台将BLR航站楼的500多个实时摄像头连接到视觉AI技术,可以实时完成近十几项任务。 首先,该平台可以检测到行李或钱包被遗忘。 它还有助于管理航站楼入口、办理登机手续柜台、安检通道和其他区域的乘客排队。机场工作人员可以根据AI平台收集的乘客运动的历史数据,主动进行任务。 Industry.AI首席执行官Tejpreet Chopra表示:“我们的平台通过实时可视化和传感器反馈的仪表板,加快了高峰运营时段的乘客流动速度,向机场工作人员提醒排队时间超过最佳时间。”。“这样可以使机场工作人员在最短的时间内对情况做出响应。” 未经授权的人员和车辆在机场也可以被实时跟踪并向平台的用户发出警报,以增强安全性。此外,Industry.AI还可以检测到航站楼外部车辆的超速违规行为,有助于管理旅行枢纽周围的安全交通。 AI帮助管理BLR内外交通。 Industry.AI使用NVIDIA TAO Toolkit和A100 Tensor Core GPU来训练其AI模型。对于AI推理,该公司使用NVIDIA Triton Inference…

Leave a Comment

Deepdub的人工智能正在重新定义从好莱坞到宝莱坞的配音

在全球娱乐界,电视节目和电影制作远不止于好莱坞或宝莱坞 – 它是一个全球现象。 然而,尽管流媒体平台拓宽了内容的传播范围,但配音和翻译技术仍有很大的发展空间。 Deepdub充当数字桥梁,利用生成式人工智能打破语言和文化障碍,提供访问内容的途径。 在NVIDIA的AI Podcast的最新一期中,主持人诺亚·克拉维茨(Noah Kravitz)与这家总部位于以色列的初创公司的联合创始人兼首席执行官Ofir Krakowski进行了对话。Deepdub利用AI驱动的配音帮助娱乐公司提高效率,降低成本,同时提高可访问性。 克拉科夫斯基表示,传统配音速度慢、成本高且常常无法达到预期。当前的技术在语言的细微之处存在困难,导致笑话、习语或行话在翻译中丢失。 Deepdub提供了一个基于Web的平台,使人们能够与复杂的AI模型进行互动,以高效地处理翻译和配音过程的每个部分。它可以翻译文本,生成语音,并将其混合到原始音乐和音效中。 但正如克拉科夫斯基所指出的,即使是最好的AI模型也会出错,因此该平台涉及人工验证翻译,并确保生成的声音听起来自然,并捕捉到正确的情感。 Deepdub还在努力将嘴唇的运动与配音声音相匹配。 最终,克拉科夫斯基希望通过这项技术摆脱语言障碍所带来的限制。 “我相信这项技术将使人们能够享受全球创作的内容,”他说。“它将使故事和知识全球化,这些目前受到语言障碍的限制。” 你可能还喜欢 Jules Anh Tuan Nguyen解释了如何使用AI让截肢者控制义肢手和视频游戏 明尼苏达大学的一位博士后研究员讨论了他为截肢者提供控制义肢的努力 – 包括手指运动 – 通过他们的大脑。…

Leave a Comment

威斯康星大学麦迪逊分校的研究人员提出了Eventful Transformers:一种成本效益高、准确度损失最小的视频识别方法

最初用于语言建模的Transformer最近被研究人员作为一种可能的视觉相关任务架构来进行研究。视觉Transformer在目标识别、图片分类和视频分类等应用中具有最先进的性能,在各种视觉识别问题上表现出色。视觉Transformer的高计算成本是其主要缺点之一。与标准卷积网络(CNN)相比,视觉Transformer有时需要更高的计算量,每张图片高达数百GFlops。视频处理中涉及的大量数据进一步增加了这些开销。这种有趣的技术的潜力受到了高计算需求的限制,这些需求阻止了视觉Transformer在资源有限或需要低延迟的设备上的使用。 这项工作由威斯康星大学麦迪逊分校的研究人员提出,旨在利用连续输入之间的时间冗余来降低视觉Transformer在处理视频数据时的成本。想象一下将视觉Transformer逐帧或逐段应用于视频序列。这个Transformer可能是一个简单的逐帧模型(如目标检测器)或者是一个时空模型中的过渡阶段(如初始分解模型)。与语言处理不同,他们将Transformer视为应用于时间上的几个不同输入(帧或片段),而不是代表整个序列的一个Transformer输入。自然电影具有很高的时间冗余度和帧间变化很小的特点。然而,尽管如此,深度网络(如Transformer)在每一帧上都经常被“从头开始”计算。 这种方法是低效的,因为它丢弃了先前结论中任何可能有用的数据。他们的主要观点是,他们可以通过重复使用先前时间步骤的中间计算来更好地利用冗余序列。智能推理。视觉Transformer(和深度网络一般)的推理成本通常由设计确定。然而,现实世界应用中可用的资源可能随着时间的推移而发生变化(例如,由于竞争进程或电源供应的变化)。因此,需要能够实时修改计算成本的模型。适应性是这项研究的主要设计目标之一,该方法旨在提供对计算成本的实时控制。有关他们如何在电影中更改计算预算的示例,请参见图1(下部分)。 图1:该策略利用了连续模型输入之间的时间重叠。 (上)他们仅检测和更新在每个Transformer块中随时间发生重大变化的令牌。 (下)他们的解决方案在提高效率的同时提供了对运行时计算成本的精细控制。 以前的研究已经研究了CNN的时间冗余和适应性。然而,由于Transformer和CNN之间存在重大的架构差异,这些方法通常与Transformer的视觉不兼容。尤其是,Transformer引入了一种新的原语——自注意力,这与多个基于CNN的方法有所不同。尽管存在这些障碍,视觉Transformer提供了巨大的可能性。将CNN的稀疏性增益(特别是通过考虑时间冗余所获得的稀疏性)转化为明显的加速是具有挑战性的。要做到这一点,必须对稀疏结构设置大约束条件,或者使用特殊的计算核心。相比之下,由于Transformer操作的本质是围绕令牌向量的操作,因此将稀疏性转化为更短的运行时间使用传统操作符更简单。具有事件的Transformer。 为了促进有效的自适应推理,他们提出了一种称为Eventful Transformers的新型Transformer,该Transformer利用输入之间的时间冗余。 “Eventful”一词是为了描述被称为事件相机的传感器,它们在响应场景变化时创建稀疏输出。Eventful Transformers选择性地在每个时间步更新令牌表示和自注意力图,以跟踪令牌级别的变化。门控模块是Eventful Transformer中的块,允许对更新的令牌数量进行运行时控制。他们的方法适用于各种视频处理应用,并可以用于预先构建的模型(通常无需重新训练)。他们的研究表明,基于当前最先进模型创建的Eventful Transformers可以大大降低计算成本,同时基本保持原始模型的准确性。 他们的源代码包含了用于创建Eventful Transformers的PyTorch模块,并向公众开放。Wisionlab的项目页面位于wisionlab.com/project/eventful-transformers。他们在CPU和GPU上展示了加速的实际时间。从技术角度来看,他们基于标准PyTorch操作符的方法可能不是最佳选择。他们确信通过进一步减少开销(例如构建用于门控逻辑的融合CUDA内核)可以进一步提高加速比。此外,他们的方法会导致一定的内存开销。毫不奇怪,保留某些张量在内存中是必要的,以便重用之前时间步骤的计算。 查看论文。本研究的所有功劳归功于该项目的研究人员。此外,别忘了加入我们的29k+机器学习SubReddit,40k+ Facebook社区,Discord频道和电子邮件通讯,我们在那里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 如果你喜欢我们的工作,你会喜欢我们的通讯。 这篇文章来自威斯康星大学麦迪逊分校的研究人员,提出了Eventful Transformers:一种在视频识别中成本效益高且准确度损失最小的方法。该文章最初发表于MarkTechPost。

Leave a Comment

LLM会取代知识图谱吗?元研究人员提出“头对尾”:一种衡量大型语言模型事实知识的新基准

大型语言模型因其超强的能力而受到了很多赞赏。它们能够模仿人类并生成与人类类似的内容。预训练的大型语言模型(LLMs),例如ChatGPT和LLaMA,展示了惊人的理解材料和回答常见问题的能力。一些研究已经证明了它们吸纳知识和回答问题的能力。尽管LLMs取得了显著进展,但它们经常缺乏对特定领域细微差别的复杂理解,并容易产生错误信息,即幻觉。这突显了提高LLM准确性和减少幻觉回答发生率的重大障碍。 与LLMs相关的讨论主要集中在三个主要领域,即减少LLM生成的幻觉回答、提高LLMs的事实准确性以及推测LLMs是否最终可能取代知识图谱(KGs)作为以符号格式存储世界知识的手段。最近,来自Meta Reality Labs的研究人员采用了一种新方法来回答这些问题,试图确定LLMs实际拥有多少信息。 在回答LLMs在知识方面掌握程度的问题时,团队讨论了两个方面。首先,直接问一个LLM所包含的知识可能是困难的。即使知识已经并入模型的参数中,幻觉可能是由于缺乏知识或发生故障的生成模型引起的。研究建议使用正确性作为评估LLM内知识程度的指标。这涉及评估模型回答清晰准确的问题的能力,例如“篮球运动员迈克尔·乔丹出生在哪里?”LLM还被要求提供简洁的回答,并在自信度较低时使用“unsure”一词表示不确定。 其次,没有一个能够准确反映用户兴趣多样性或世界信息广度的便利基准。即使是最全面的知识图谱在知识方面也存在空白,特别是在涉及较不知名的事实时。主要LLMs或搜索引擎的查询日志并不公开。 为了解决所有的限制,团队引入了一个他们创建的基准,名为“Head-to-Tail”。该基准包括18,000个问题-回答(QA)对,根据其各自主题的受欢迎程度被划分为头部、躯干和尾部事实。这些类别反映了不同的公众熟悉程度。团队创建了一种自动化评估方法和一组能够反映LLM已经有效吸收的知识广度的度量标准,以评估LLMs所保持的知识。 研究的核心是评估对公众可用的14个LLMs。结果显示,现有的LLMs在完善其对事实数据的理解方面仍需要显著改进。这尤其适用于属于躯干到尾部区域并涉及较不知名组织的信息。 总之,这项研究使用最近提出的基准和尖端评估技术考察了LLMs的事实知识。该研究通过解决重要的研究问题和概述具体发现,对于关于大型语言模型在整合事实信息方面的可靠性和未来发展的持续讨论做出了重大贡献。

Leave a Comment

使用R编程语言介绍统计学

从基本概念到高级技术,本文是您的全面指南。R是一个开源工具,使数据爱好者能够精确地探索、分析和可视化数据。无论您是研究描述性统计、概率分布还是复杂的回归模型,R的多功能性和广泛的包都能促进无缝的统计探索。 让我们踏上学习之旅,探索基础知识,揭开复杂方法的神秘面纱,并阐明R如何培养对数据驱动世界的更深入理解。 什么是R? R是一个强大的开源编程语言和环境,专门用于统计分析。由统计学家开发,R作为一个多功能平台,用于数据处理、可视化和建模。其庞大的包(packages)集合使用户能够揭示复杂的数据洞察并做出明智的决策。作为统计学家和数据分析师的首选工具,R为数据探索和解释提供了一扇通往门。 了解更多:从零开始学习R中的数据科学的完整教程 R编程基础 在深入研究使用R编程语言进行统计分析之前,熟悉R编程的核心概念至关重要。在进行更复杂的分析之前,了解R的基本原理是必不可少的,因为它是推动统计计算和数据处理的引擎。 安装和设置 在计算机上安装R是必要的第一步。您可以从官方网站(The R Project for Statistical Computing)安装和下载程序。RStudio(Posit)是一个集成开发环境(IDE),您可能希望使用它来使R编码更加实用。 了解R环境 R提供了一个交互式环境,您可以直接键入和执行命令。它既是一种编程语言,也是一个环境。IDE或命令行界面是您与R进行交互的两种方式。可以完成计算、数据分析、可视化和其他任务。 工作空间和变量 在R中,您当前的工作空间保存您在会话期间创建的所有变量和对象。借助赋值运算符(‘<-’或‘=’),可以通过给变量赋值来创建变量。数据可以存储在变量中,包括逻辑值、文本、数字等。 基本语法 R具有简单直观的语法,易于学习。命令以函数名开头,后跟括号中的参数。例如,您可以使用‘print()’函数打印内容。 数据结构 R提供了几种基本的数据结构,用于处理不同类型的数据: 向量:相同数据类型的元素集合。 矩阵:具有行和列的2D数据数组。 数据框:带有行和列的表格结构,类似于电子表格或SQL表。…

Leave a Comment

顶级生成型人工智能项目

在一个快速发展的技术景观中,生成式人工智能项目的出现重新定义了我们与内容的交互、创造和体验方式。这些项目利用人工智能的力量来复制人类的创造力和生产力,涵盖从文本聊天机器人到视频生成器的范围。这些生成式人工智能项目证明了人工智能不断扩展的能力,塑造了一个无限创新的未来。 顶级生成式人工智能项目 这些开创性的生成式人工智能项目利用技术的威力来创造内容,从文本聊天机器人到音乐生成器,革新了行业和创造力。以下是一些最佳的生成式人工智能项目: 文本聊天机器人 文本聊天机器人是通过人工智能生成的项目,与用户进行自然语言对话。这些由人工智能驱动的系统模拟人类交互,并在多个行业提供信息、帮助和协助。 功能 文本聊天机器人使用自然语言处理(NLP)来理解用户输入并生成相应的回答。 它们可以处理各种查询,从回答常见问题到提供个性化建议。 一些先进的聊天机器人利用机器学习来分析用户交互,随着时间的推移不断改进回答。这些聊天机器人可以包含在网站、消息应用和客户服务平台中。 应用 全天候可用性:文本聊天机器人提供全天候的协助,即使在工作时间之外也能即时回应用户的查询。 可扩展性:聊天机器人可以同时处理多个对话,确保增强的客户服务而无需长时间等待。 一致性:聊天机器人提供稳定的回答和信息,减少人为错误和不一致性的风险。 成本效益:实施聊天机器人可以通过减少对庞大人工客户支持团队的需求来节省成本。 快速信息检索:聊天机器人可以快速检索相关信息,相比手动搜索节省用户时间。 示例:Weobot:心理健康机器人 YouTube视频摘要生成器 YouTube视频摘要生成器是一种生成式人工智能工具,从视频中提取关键内容,将冗长的内容压缩为简洁的摘要。这项技术为内容创作者、研究人员和观众提供了高效访问视频信息的方式。 功能 YouTube视频摘要生成器采用音频转录、图像分析和自然语言处理(NLP)技术来分析视频内容。 它们识别关键片段、关键词和视觉线索,生成捕捉视频要点的简洁摘要。这些摘要通常包括关键因素、讨论主题和相关部分的时间戳。 应用 节省时间:视频摘要生成器使观众能够快速了解主要内容,无需观看整个视频,节省时间。 高效内容创作:创作者可以重复使用摘要内容进行推广、社交媒体发布或演示。 研究协助:研究人员可以在较短时间内审查多个视频,提取重要信息用于研究。…

Leave a Comment

阿里巴巴研究员推出Qwen-VL系列:一套大规模视觉语言模型,旨在感知和理解文本和图像

近来,由于其强大的文本生成和理解能力,大型语言模型(LLMs)引起了人们的广泛关注。这些模型具有显著的交互能力,并且通过进一步将指令与用户意图对齐,有潜力作为智能助手来提高生产力。然而,原生的大型语言模型仅限于纯文本领域,无法处理其他广泛使用的模态,如图片、音频和视频,严重限制了模型的应用范围。为了克服这一限制,研究人员开发了一系列大型视觉语言模型(LVLMs),以提高大型语言模型对视觉信息的识别和理解能力。 这些扩展的视觉语言模型在解决实际的视觉中心问题方面显示出了巨大的潜力。阿里巴巴集团的研究人员推出了开源的Qwen系列最新成员——Qwen-VL系列模型,以促进多模态开源社区的发展。Qwen-VL系列的大规模视觉语言模型有两种类型:Qwen-VL和Qwen-VL-Chat。预训练模型Qwen-VL将视觉编码器与Qwen-7B语言模型连接起来,提供了视觉能力。在完成三个训练阶段后,Qwen-VL可以在多个层次的尺度上感知和理解视觉信息。此外,Qwen-VL-Chat是基于Qwen-VL的交互式视觉语言模型,使用对齐方法,提供更灵活的交互方式,如多张图片输入、多轮讨论和定位能力。如图1所示。 图1:Qwen-VL-Chat生成的一些定性样本如图1所示。Qwen-VL-Chat支持多张图片输入、轮流对话、多语言对话和定位能力。 该模型的特点包括: • 强大的性能:在多个评估基准测试中,包括零样本字幕生成、视觉问答、文档问答和定位等,它在相同模型层次上远远超过当前开源的大型视觉语言模型(LVLM)。 • 多语言LVLM促进中英文双语文本和图像实例的端到端识别和对齐:Qwen-VL自然支持英文、中文和多语言对话。 • 多图像交错对话:这个功能可以比较多张图片,对图片提出问题,并参与多图像叙事。 • 准确的识别和理解:与竞争的开源LVLM当前采用的224×224分辨率相比,448×448分辨率有助于精细的文本识别、文档质量保证和边界框识别。

Leave a Comment

这篇来自中国GSAi的人工智能论文介绍了基于LLM的自主代理的综合研究

自主代理代表展示不同程度独立的自我运作系统。最近的研究突出了大型语言模型(LLMs)模仿人类智能的显著能力,这是通过广泛的训练数据集和大量的模型参数组合实现的。本研究论文对利用LLMs的自主代理的架构、构建技术、评估方法和挑战进行了全面的研究。 https://arxiv.org/abs/2308.11432v1 LLMs已被广泛应用于自主代理的核心协调器,旨在复制人类决策过程并增强人工智能系统。上述图像展示了基于LLMs的自主代理领域的增长趋势。值得注意的是,第三个点之后X轴从年份切换到月份。从本质上讲,这些基于LLMs的代理正在从被动的语言系统转变为具有推理能力的主动目标导向代理。 基于LLMs的自主代理构建 为了有效展示类似人类的能力,需要注意两个重要方面: 架构设计: 选择最合适的架构对于最大程度地发挥LLMs的能力至关重要。现有研究已经进行了系统综合,形成了一个全面统一的框架。 学习参数优化: 为了提高架构的性能,出现了三种广泛采用的策略: 从例子中学习: 这种方法涉及使用精心策划的数据集对模型进行微调。 从环境反馈中学习: 利用实时互动和观察来提高模型的能力。 从人类反馈中学习: 利用人类专业知识和干预来改进模型的响应。 基于LLMs的自主代理应用 基于LLMs的自主代理在各个领域的应用标志着我们在问题解决、决策制定和创新方面的根本转变。这些代理具备语言理解、推理和适应性,通过提供无与伦比的见解、支持和解决方案产生深远影响。本节主要探讨了基于LLMs的自主代理在社会科学、自然科学和工程领域的变革效果。 基于LLMs的自主代理评估 为了评估基于LLMs的自主代理的有效性,引入了两种评估策略: 主观评估和客观评估。 主观评估: 某些潜在属性,如代理的智能和用户友好性,无法通过定量指标来衡量。因此,主观评估对当前的研究至关重要。 客观评估: 与人类评估相比,利用客观评估具有诸多优势。定量指标有助于在各种方法之间进行直接比较,并监测随时间推移的进展。进行广泛的自动化测试的可行性使得可以评估大量任务,而不仅仅是少数任务。 最后,虽然之前的工作已经展示了许多有希望的方向,但这个领域仍处于初级阶段,存在许多挑战,包括角色扮演能力、广义人类对齐、提示鲁棒性等。总之,本调查研究为我们提供了关于基于LLMs的自主代理的一切知识,并对此进行了系统总结。

Leave a Comment