3D头像在游戏开发、社交媒体与通信、增强与虚拟现实以及人机交互等行业中有广泛应用。高质量的3D头像建模一直备受关注。传统上,这些复杂的3D模型是由训练有素的艺术家手工建造的,这是一项耗时且劳动密集的过程,需要几千小时的时间和丰富的美学和3D建模知识。因此,他们的目标是仅使用自然语言描述自动创建高质量的3D头像,因为这具有重要的研究潜力和资源节约能力。 最近,从多视角电影或参考照片重建高保真度的3D头像引起了很大关注。这些技术无法根据复杂的文本提示构建富有想象力的头像,因为它们依赖于从电影或参考图片中获取的限制性视觉先验知识。扩散模型在创建2D图像时表现出色,主要是因为有许多大规模的文本-图像组合可用。然而,缺乏多样性和3D模型的短缺使得充分训练3D扩散模型变得困难。 最近的研究探索了优化神经辐射场以使用预训练的文本-图像生成模型生成高保真度的3D模型。然而,创建具有不同位置、外观和形式的坚固3D头像仍然具有挑战性。例如,仅使用常规评分蒸馏采样而没有额外的控制来指导NeRF优化可能会引入Janus问题。除此之外,目前的方法创建的头像经常显示出明显的粗糙和模糊,导致缺乏高分辨率的局部纹理细节、配饰和其他重要方面。 字节跳动和CMU的研究人员提出了AvatarVerse,这是一个专为使用文本描述和位置指导生成高质量可靠的3D头像的独特框架,以解决这些限制。他们首先使用800K或更多人类DensePose图片训练了一个全新的ControlNet。然后,在ControlNet之上,实施了基于2D DensePose信号的SDS损失条件。他们可以在每个2D视图和3D空间之间以及许多2D视图之间实现精确的视图对应关系。他们的技术消除了困扰大多数以前方法的Janus问题,同时还能够对创建的头像进行姿势控制。因此,它为头像的生成过程提供了更可靠和一致的保证。通过DensePose提供的精确和可调整的监督信号,生成的头像还可以与SMPL模型的关节对齐,使得骨骼绑定和控制变得简单高效。 他们提出了一种渐进式高分辨率生成技术,以提高局部几何的逼真度和细节,而仅依赖于DensePose条件的ControlNet可能会产生局部伪像。他们使用平滑度损失,在计算上高效的显式神经辐射场中促进密度体素网格的平滑梯度,以减少生成头像的粗糙度。 以下是总体贡献: • 他们介绍了AvatarVerse,一种只使用文字描述和参考人体姿态就能自动创建高质量3D头像的技术。 • 他们提供了基于DensePose条件的评分蒸馏采样损失方法,这种方法使得创建具有姿势意识的3D头像更加容易,并成功缓解了Janus问题,提高了系统的稳定性。 • 通过一种系统的高分辨率生成过程,他们提高了生成的3D头像的质量。这项技术通过严格的由粗到细的精炼过程,创建了具有出色细节的3D头像,包括手部、配饰等。 • AvatarVerse在质量和稳定性方面表现出色,优于竞争对手。通过深入的用户研究和细致的定性评估,展示了AvatarVerse在创建高保真度3D头像方面的卓越性。 这为可靠的零次试验3D头像生成设立了新的标准。他们在GitHub网站上提供了他们技术的演示。
Leave a CommentTag: Tech News
大型语言模型(LLMs)已经出现和发展,为人工智能领域增加了一种新的复杂性。通过密集的训练方法,这些模型已经掌握了一些惊人的自然语言处理、自然语言理解和自然语言生成任务,例如回答问题、理解自然语言推理和总结材料。它们还完成了与NLP不常见相关的活动,例如理解人类意图和执行指令。 像AutoGPT、BabyAGI和AgentGPT这样的应用程序利用LLMs实现了自主目标,这些应用程序的实现得益于所有NLP的进步。尽管这些方法引起了公众的浓厚兴趣,但评估LLMs作为代理的标准基线的缺失仍然是一个重大障碍。虽然过去已经使用基于文本的游戏环境来评估语言代理人,但由于其有限和离散的动作空间,它们经常存在一些缺点。此外,它们主要评估模型的常识基础能力。 大多数现有的代理人基准测试都专注于特定的环境,这限制了它们在各种应用场景中对LLMs进行全面评估的能力。为了解决这些问题,清华大学、俄亥俄州立大学和加州大学伯克利分校的研究人员提出了AgentBench,这是一个多维基准测试,旨在评估LLMs作为代理的能力在各种环境中。 AgentBench包含了八个不同的环境,其中五个是全新的:侧面思考难题(LTP)、知识图谱(KG)、数字卡牌游戏(DCG)、操作系统(OS)和数据库(DB)。最后的三个环境——家政(Alfworld)、在线购物(WebShop)和网络浏览(Mind2Web)——是从现有数据集进行改编的。这些环境都经过精心设计,以代表文本化的LLMs可以扮演自主代理的交互情境。它们严格评估LLM的关键能力,如编码、知识获取、逻辑推理和遵循指示,因此AgentBench成为评估代理和LLMs的全面测试平台。 利用AgentBench,研究人员对包括基于API和开源模型在内的25个不同的LLMs进行了深入分析和评估。研究结果显示,像GPT-4这样的顶级模型擅长处理各种现实世界的任务,这意味着可以创建高效能并不断适应的代理人。然而,这些顶级的基于API的模型在性能上明显不如它们的开源替代品。开源LLMs在其他基准测试中表现良好,但当他们面对AgentBench的困难任务时,它们表现不佳。这强调了进一步改进开源LLMs学习能力的需求。 研究的贡献可以总结如下: AgentBench是一个全面的基准测试,定义了标准化的评估程序,并引入了将LLMs作为代理进行评估的创新概念。它通过整合八个模拟现实世界情境的真实环境,为评估LLMs的各种能力提供了一个有用的平台。 该研究利用AgentBench对25个不同的LLMs进行了全面评估,揭示了领先的商业API型LLMs和开源替代品之间的显著性能差距。这种评估突出了LLM作为代理的当前状况,并确定了需要改进的领域。 该研究还提供了一个基于“API&Docker”交互范式的集成工具集,使定制AgentBench评估过程更加容易。这个工具集对更广泛的研究社区可用,结合相关数据集和环境,促进了LLMs领域的合作研究和开发。
Leave a CommentOpenAI通过引入一种名为GPTBot的新型网络爬虫工具,回应了在采集公共网站上的数据时出现的隐私和知识产权问题。这项技术旨在透明地收集公共网络数据,并将其用于训练他们的AI模型,一切都在OpenAI的旗帜下进行。 GPTBot的用户代理旨在收集有助于改进未来AI模型的数据。在此过程中,GPTBot将省略需要付费的来源。然而,需要注意的是,一些收集到的数据可能无意中包含可识别的信息或文本,从而违反了OpenAI的政策。 OpenAI认识到需要为网站管理员提供有关GPTBot平台访问的选项。授予访问权限被视为在提高AI模型的准确性、增强其功能和加强安全措施方面的一种合作方式。与此相反,OpenAI还为那些不希望将其网站包含在GPTBot数据收集工作中的人提供了一套程序。该指南包括将GPTBot指令整合到网站的robots.txt文件中,并配置其访问特定内容段。 为了更加透明,OpenAI已发布了与GPTBot活动相关的IP地址范围。此举不仅有助于识别机器人的行为,还提供了必要时阻止其访问的手段。 这些透明度举措突显了OpenAI对AI模型运营商所面临的批评的回应,这些运营商被指控在未经明确同意的情况下收集数据。普遍的观点认为,该行业的做法可能侵犯了知识产权和隐私保护,通过未经适当授权从公共网站收集内容。这反过来促使AI实体提供更全面的选择加入和退出机制,允许网站所有者和数据保管人对其内容的使用发表意见。 在相关发展中,Kickstarter的筹款平台最近引入了AI项目规定。这些规定包括一个重要要求,即利用外部数据源的项目必须提供来自源网站的适当许可协议和获得的同意的证据。未能履行此义务的项目将无资格在Kickstarter上列出。 预计在接下来的一周,OpenAI将进行一次重大改革,其中包括将基础ChatGPT层转换为GPT-4。此外,对Code Interpreter插件的增强将包括支持上传多个文件到提示,反映了OpenAI对持续改进和创新的承诺。
Leave a Comment在各种应用领域中创建令人满意的文本时,大型语言模型(LLMs)在自然语言生成方面带来了革命性的变化。尽管扩大模型规模(100B+参数)会显著提高性能,但事实仍然是,完成单个解码步骤所需的时间随着模型大小的增加而增长。更大的模型引入了大量的计算和更大的内存占用,这两者都对LLM的推理速度缓慢产生重要影响。KV缓存和训练模型参数以及推理所需的临时状态的内存需求是相当大的。 由于系统的内存访问速度较慢,LLMs的令牌生成速度较慢。至于产生每个标记所需的时间,它大致与模型参数的总数相关。 有几项工作旨在使推理更加高效。这些研究的基本重点是最小化内存使用量和缓解内存流量拥塞。无锡国家超级计算中心和清华大学的一项新研究调查了有效的解码技术,以最大化标记生成,并同时保持内存处理预算不变。为了实现快速解码,他们引入了一种名为RecycleGPT的新的语言模型架构,它可以重复使用先前创建的模型状态。 他们的策略是通过将一个新的可回收模块纳入原始语言模型中来进行微调,该模块基于先前生成的状态预测接下来的几个标记,而无需重复运行完整的模型。可回收模块由几个基于Transformer的层构建,这些层一起允许在进行预测时进行更好的表示。RecycleGPT可以与传统的解码技术以多种不同的方式结合使用,以进行推理。本研究循环使用它们(即,每生成两个标记需要运行一次整个模型),留下其他方式的研究以供未来参考。可回收模块的目的是加快解码过程,它之所以能够做到这一点,是因为尽管其结构简单,但该模块能够有效地表示上下文信息并生成正确的预测。 团队对RecycleGPT进行了多项测试,与几个行业标准进行了比较。研究结果显示,该模型的速度比最先进的语言模型快1.4倍,参数仅增加15%,同时在下游任务上保持类似的性能。研究人员计划很快展示不同规模的RecycleGPT模型。 由于其适应性和可扩展性,我们的回收技术可以与各种预训练模型一起使用。此外,可以修改创作技术和可回收模块的大小以达到所需的加速性能。
Leave a Comment随着技术和人工智能领域的最新进展,取得了许多进步和提升。无论是使用众所周知的ChatGPT模型进行文本生成,还是文本到图像的生成;现在一切都是可行的。扩散模型因其能够让人们使用简单的口头建议或草图制作引人注目的视觉效果而引起了很大的兴趣。庞大的训练数据量使得确认每个图像的来源变得困难,因此这些模型甚至引发了关于准确识别生成照片来源的问题。 已经提出了许多策略来处理这个问题,包括在使用训练样本之前限制其影响,解决使用后不正确的训练示例的影响,并限制样本对训练输出的影响。另一个目标是确定哪些样本对模型的训练产生了最大影响,以避免创建与训练数据过于相似的图像。尽管在这些领域进行了持续研究,但这些保护策略在扩散模型中并没有显示出有效性,特别是在大规模环境中,因为模型的权重结合了来自多个样本的数据,使得像取消学习这样的任务变得困难。 为了克服这一问题,亚马逊云服务(AWS)人工智能实验室的研究人员提出了最新的方法论,称为分区扩散模型(CDM),它可以在各种数据源上训练各种扩散模型或提示,然后在推理阶段无缝地将它们组合起来。通过使用这种方法,每个模型可以在不同的时间和使用不同的数据集或领域进行单独训练。这些模型可以组合在一起,提供与同时在所有数据上进行训练的理想模型相当的性能。 CDM的独特之处在于,每个单独的模型只知道它在训练过程中接触到的特定数据子集。这种特性为保护训练数据提供了各种方法的机会。在扩展扩散模型的背景下,CDM是第一个能够同时实现选择性遗忘和持续学习的方法,因此模型的各个组成部分可以被更改或遗忘,提供了更灵活和安全的方法来改变和发展模型。 CDM还具有根据用户访问权限创建唯一模型的好处,这意味着模型可以根据特定用户要求或约束进行修改,提高其实用性并保持数据隐私。除了这些特点,CDM还提供了对理解产生特定样本的特定数据子集的重要性的洞察。这意味着模型可以提供关于对给定结果产生最大影响的训练数据部分的信息。 总之,分区扩散模型无疑是一个强大的框架,允许在各种数据源上训练不同的扩散模型,然后无缝集成以产生结果。这种方法有助于保护数据并促进灵活学习,同时扩展扩散模型的能力以满足各种用户需求。
Leave a Comment基于大型语言模型(LLMs)的多agent系统具有模拟和改进人类操作的特殊机会。然而,最近的研究表明,当前系统在现实应用中的复杂性中有时需要更准确。这些系统主要需要通过口头和基于工具的交流来促进建设性的协作,这在生成连贯的交流、减少反生产性的反馈循环和促进有益的协作交互方面存在困难。对于多方面的过程来说,有良好结构化的标准化操作程序(SOPs)是必要的。对现实世界实践的全面认识和整合至关重要。 解决这些常见限制并将这些见解纳入LLM-based多agent系统的设计和结构以提高其效力和应用至关重要。此外,通过广泛的集体实践,人们在各个领域已经建立了广泛认可的SOPs。这些SOPs对于促进有效的工作拆分和协调至关重要。例如,软件工程中的瀑布流程为需求分析、系统设计、编码、测试和可交付物建立了逻辑步骤。 借助这种共识工作流程,几个工程师可以有效地合作。此外,人类职位具有适合其工作的专业知识:软件工程师利用其编程技能来创建代码,而产品经理利用市场研究来确定客户需求。协作偏离了典型的输出,并变得杂乱无章。例如,产品经理必须进行全面的竞争研究,对用户需求、市场趋势和竞争产品进行研究以推动开发。这些分析必须紧接着创建具有清晰的、标准化格式和优先目标的产品需求文档(PRDs)。 这些规范性的工件对于推进复杂的、多样化的项目,需要各种角色的相关贡献,是必不可少的。它们凝聚了共同的理解。因此,使用组织良好的文档、报告和显示依赖关系的图形是至关重要的。在这项研究中,来自DeepWisdom、厦门大学、香港中文大学深圳分校、南京大学、宾夕法尼亚大学和加州大学伯克利分校的研究人员介绍了MetaGPT,这是一个具有基于SOPs的实用知识的开创性多agent框架。首先,他们使用描述其职责的职位名称来标识每个agent。这使得系统能够以正确的角色特定提示前缀初始化。这样,不再需要笨拙的角色扮演线索,而是将领域知识融入到agent定义中。其次,他们审查有效的人类过程,提取用于群体项目所需的SOPs的过程知识。 这些SOPs在agent架构中使用基于角色的操作规范进行编码。第三,为了促进信息交流,agent创建标准化的操作输出。MetaGPT通过形式化人类专家交流的工件,简化了相互依赖的工作之间的协调。agent通过共享环境相连接,这个环境提供有关活动和工具资源的洞察力。所有agent之间的通信都包含在这个环境中。它们还提供了一个全局内存池,存储所有合作记录,允许任何agent订阅或搜索所需的数据。agent可以从这个内存池中检索以获取更多上下文。 与通过对话被动吸收信息相反,这种架构使agent能够主动观察和提取相关信息。这个环境模拟了鼓励团队合作的实际工作场所中的系统。他们展示了协作式软件开发工作流程和相关的代码实现实验,涵盖了小游戏的开发和更复杂的大系统的生产,以说明他们的架构的效力。MetaGPT管理的软件复杂性远远超过GPT-3.5或其他开源框架如AutoGPT和AgentVerse,以产生的代码行数来衡量。 此外,MetaGPT通过自动化的端到端过程生成高质量的需求文档、设计工件、流程图和接口规范。这些中间标准化的输出极大地增加了最终代码执行的成功率。借助自动生成的文档,人类开发者可以迅速学习和提高他们的专业知识,以进一步改进他们的需求、设计和代码。它还实现了更复杂的人工智能与人类的互动。总之,他们通过对不同软件项目进行广泛的研究来验证MetaGPT。 通过定量的代码生成基准和整体过程输出的定性评估,展示了MetaGPT基于角色的专家agent合作范式所带来的可能性。总结起来,他们主要做出了以下贡献: • 设计了一种新的元编程机制,包括角色定义、任务分解、流程标准化和其他技术设计。 • 他们提出了MetaGPT,这是一种基于LLM的多代理协作框架,将人类的标准操作规程编码到LLM代理中,从根本上扩展了复杂问题解决的能力。 • 他们使用AutoGPT、AgentVerse、LangChain和MetaGPT对开发CRUD2代码、基本数据分析任务和Python游戏进行了广泛的测试。 通过采用标准操作规程,MetaGPT可以创建复杂的软件。总体研究结果表明,MetaGPT在代码质量和符合预期流程方面显著优于竞争对手。
Leave a Comment在麻省理工学院(MIT)和丹娜-法伯癌症研究所之间的一项开创性合作中,研究人员利用机器学习的力量解决了癌症治疗中的一个棘手难题。对于一小部分癌症患者来说,其恶性肿瘤的起源仍然是一个谜团,使得选择合适的治疗方法变得复杂。一种通过机器学习开发的计算模型,以全新的方法解码这个谜团,并为更有效的个体化治疗铺平了道路。 传统的癌症治疗策略通常依赖于针对癌症起源的特定药物,使精确药物非常有效。然而,在大约3至5%的病例中,癌症已经扩散到全身,确定疾病的来源成为一项艰巨的任务。这些病例被归类为未知原发癌(CUP),长期以来困扰着肿瘤科医生,导致受影响患者的精确治疗选择有限。 麻省理工学院和丹娜-法伯的研究人员设计了一种强大的计算模型,通过仔细分析大约400个常见癌症相关基因的遗传序列来构建。这个机器学习驱动的模型熟练地检查基因序列,并准确预测肿瘤的起源。他们的研究结果展示了一个显着的成功率:该模型以高置信度正确分类了超过40%的肿瘤,为根据预测的癌症起源进行个体化治疗开辟了途径。 研究团队强调了他们的模型在辅助治疗决策中的关键贡献。通过有效地引导医生为CUP患者提供个体化治疗,该模型为那些从癌症起源中苦苦寻找答案的人带来了希望。 研究团队利用近3万名被诊断为22种不同癌症类型的患者的遗传序列构建了一个庞大的数据集,以开发他们的模型。这一训练阶段使得机器学习模型OncoNPC能够在未知肿瘤上以惊人的80%准确率预测癌症的起源。对于高置信度的预测,准确度提高到了约95%。 将他们的模型应用于测试,研究人员分析了丹娜-法伯的约900个CUP患者的数据集。令人惊讶的是,该模型自信地预测了这些肿瘤中40%的起源,这在癌症治疗个体化方面取得了重大进展。 通过与常染色体突变分析进行比较,该模型的预测得到了进一步的证实,常染色体突变分析是一种揭示特定癌症遗传易感性的方法。令人鼓舞的是,该模型的预测与基于常染色体突变的最强预测癌症类型密切吻合。 除了预测准确性,该模型的潜在临床影响也是明显的。CUP患者的生存时间与该模型的预后相关,预测为预后较差的癌症类型的患者生存时间较短。值得注意的是,接受与该模型预测相符的治疗的患者的疗效要好于接受针对不同癌症类型的治疗的患者。 也许最有希望的方面是,该模型确定了额外15%的患者(增加了2.2倍),如果他们的癌症类型已知,可能会受益于现有的靶向治疗。这一突破为更广泛地采用精确疗法打开了大门,从而充分发挥已有治疗的潜力。 展望未来,研究人员计划通过融合病理学和放射学图像等多种肿瘤分析模态来改进他们的模型。涵盖肿瘤分析的多个方面不仅可以提高预测准确性,还可以指导治疗选择,开启个性化癌症护理的新时代。随着技术与医学科学之间的合作加强,患者在与癌症起源的斗争中将迎来更加充满希望的未来。
Leave a Comment近年来,深度学习的最新进展对计算成像、显微镜和全息成像相关领域产生了重大影响。这些技术在生物医学成像、传感、诊断和3D显示等各个领域都有应用。深度学习模型在图像翻译、增强、超分辨率、去噪和虚拟染色等任务中展示出了非凡的灵活性和有效性。它们已成功应用于各种成像模式,包括明场和荧光显微镜;深度学习的整合正在重新塑造我们对微观尺度复杂世界的理解和能力。 在计算成像中,主流技术主要采用监督学习模型,需要大量带有注释或基准实验图像的数据集。这些模型通常依赖于通过各种方法获取的带标签的训练数据,例如经典算法或来自不同成像模式的注册图像对。然而,这些方法存在一些限制,包括繁琐的训练图像获取、对齐和预处理,以及可能引入推断偏差。尽管通过无监督和自监督学习来解决这些挑战的努力,但对实验测量或样本标签的依赖仍然存在。虽然一些尝试已经使用带标签的模拟数据进行训练,但准确表示实验样本分布仍然复杂,并且需要对样本特征和成像设置有先验知识。 为了解决这些固有问题,加州大学洛杉矶分校Samueli工程学院的研究人员引入了一种名为GedankenNet的创新方法,它提出了一种革命性的自监督学习框架。这种方法消除了对标记或实验训练数据以及任何与现实样本的相似性的需求。通过基于物理一致性和人工随机图像进行训练,GedankenNet克服了现有方法所面临的挑战。它为全息重建建立了一个新的范式,为在各种显微镜、全息术和计算成像任务中常用的监督学习方法的局限性提供了一个有前途的解决方案。 GedankenNet的架构由一系列空间傅里叶变换(SPAF)块组成,通过残差连接相互连接,有效捕捉空间和频率域信息。通过整合物理一致性损失函数,该模型在全息重建过程中强制执行波动方程的一致性,从而产生物理准确的复杂场输出。这种独特的训练策略使得GedankenNet能够在合成和实验全息图像上具有出色的泛化能力,即使面对未见样本、轴向散焦和光照波长的变化。 a)插图描述传统的迭代全息重建技术、自监督深度神经网络GedankenNet和现有的监督深度神经网络。| b)GedankenNet用于全息重建的自监督训练过程。 性能评估显示,GedankenNet在全息重建方面具有出色的能力。通过结构相似性指数(SSIM)、均方根误差(RMSE)和误差校正系数(ECC)等定量指标,GedankenNet在各种全息图像集上始终优于传统的监督技术。值得注意的是,GedankenNet的物理一致性损失有效地减轻了非物理性伪影,从而实现了更锐利和更准确的重建。模型与波动方程的兼容性进一步增强了其性能,使其能够通过正确的波动传播从散焦全息图中恢复高质量的物体场。这些发现突显了GedankenNet在外部推广方面的优越性,使其能够以出色的保真度处理新颖的实验数据和仅相位样本。 总体而言,加州大学洛杉矶分校研究团队的GedankenNet代表了计算成像和显微镜领域的一个开创性进展。通过采用自监督学习的力量和以物理为基础的思想实验,GedankenNet为训练神经网络模型提供了一种新的方法。这种创新方法不仅克服了当前监督学习技术的局限性,还为各种计算成像任务提供了更加多样化、与物理相容且易于训练的深度学习模型的途径。这一突破将极大地加速显微镜领域的进步,促进更广泛的应用和对微观世界的更深入的认识。
Leave a Comment视觉和语言研究是一个不断发展的领域,最近取得了显著的进展,特别是在建立静态图像和相应标题之间联系的数据集方面。这些数据集还涉及使用多种方法将标题中的某些词与图像中的特定区域关联起来。最新的本地化叙事(ImLNs)提供了一种有趣的方法:注释者在描述图像的同时,通过鼠标光标移动来标记他们讨论的区域。这种语音和光标移动的双重过程反映了自然交流,为每个单词提供了全面的视觉基础。然而,值得注意的是,静态图像只能捕捉到一瞬间。注释视频的前景更具吸引力,因为视频展示了完整的叙事,展示了多个实体和物体动态交互的事件。 为了解决这个耗时且复杂的任务,提出了一种增强的注释方法,将ImLNs扩展到视频中。 所提出技术的流程如下所示。 这种新的协议允许注释者在受控环境中构建视频叙事。注释者开始仔细观察视频,识别主要角色(如“男人”或“鸵鸟”),并选择代表每个角色重要时刻的关键帧。 随后,针对每个角色单独构建叙事。注释者在同时引导光标在关键帧上突出显示相关对象和动作的同时,使用口头描述表达角色在各种事件中的参与。这些口头描述包括角色的名称、属性,特别是它所承担的动作,包括与其他角色的互动(例如“与鸵鸟玩耍”)和与无生命物体的互动(例如“拿起食物杯”)。为了提供全面的背景信息,注释者还在单独的阶段提供了对背景的简要描述。 有效地使用关键帧消除了时间限制,而为每个角色创建独特的叙述使得复杂情况的分解成为可能。这种分解有助于全面描绘涉及多个角色相互交互和与许多被动物体互动的多面事件。与ImLN类似,这个协议利用鼠标轨迹段来定位每个单词。该研究还实施了几项额外措施,以确保精确定位,超过了先前工作的成果。 研究人员使用视频本地化叙事(VidLNs)在不同的数据集上进行了注释。考虑到的视频展示了复杂的场景,其中各种角色和无生命物体之间的交互,通过详细的注释描述了引人入胜的叙事。以下是一个示例。 VidLNs数据集的深度为各种任务(如视频叙事基础(VNG)和视频问答(VideoQA))提供了坚实的基础。新引入的VNG挑战要求开发一种能够通过在视频帧上生成分割掩码来定位输入叙述中的名词的技术。这个任务面临着重大挑战,因为文本中经常包含多个相同的名词,需要从周围词语中利用上下文线索进行消歧。虽然这些新的基准测试仍然是复杂的挑战,并远未完全解决,但所提出的方法在正确的方向上取得了有意义的进展(有关详细信息,请参阅已发表的论文)。 这是关于视频本地化叙事的总结,这是一种将视觉和语言连接起来的新型多模态视频注释。如果您对此感兴趣并想了解更多信息,请随时参考下面引用的链接。
Leave a Comment在传统的基于模型的控制方法中,控制器直接与机器人的动态模型进行推理。最近的研究使用通过强化学习建立的策略,随着机器人结构变得更加复杂和仿生。这在涉及多个手指和人型机器人手的操作等需要技能的操作中尤为明显。协同移动的能力可以彻底改变多个行业,从拣选和放置仓库工作到流水线制造,以及在家庭中提供帮助。 苏黎世联邦理工学院(ETH Zurich)和马克斯普朗克联邦理工学院学习系统中心(Max Planck ETH Center for Learning Systems)的最新研究介绍了Faive Hand作为一个灵巧的操作平台。作为朝向类人操作的第一步,该团队报告了他们目前将其模型整合到RL环境中并在机器人上应用闭环控制器以实现灵巧的手内球形旋转。 目前最突出的机器人手是用于灵巧操作研究的,考虑到能力强大的机器人需要硬件和控制器两者。研究人员提出,更类人化的手部设计更适合与工具和环境中的物品进行互动,因为它们从一开始就是为人们设计的。从人类示例中学习时,使用类似框架的机器人更容易传递操纵活动。 Faive Hand是在软体机器人实验室中开发的一种仿生、腱驱动的机器人平台,用于研究精细操作。最新版本的手是3D打印的,由伺服电机驱动,使得批量生产变得容易和可行。然而,与使用RL教授的其他灵巧手不同,这只手包含了旋转接触关节的特点,其旋转没有定义的旋转轴,给控制高自由度的机器人手的本已困难的任务增加了难度。由于在这种设计中实施传统的旋转编码器是具有挑战性的,内部关节角编码器仍在研究中,但必须包含在手中。由于这个限制,伺服电机角度被用来估计腱长,从而估计关节角度。通过这些对仿真框架和低级控制器的补充,可以在真实机器人上执行通过闭环RL训练的策略。 研究人员通过在IsaacGym模拟器中展示了手的潜力,展示了通过RL教授的技能的零样本迁移。他们计划通过添加执行和传感器能力,在RL sim2real任务和其他任务(如行为克隆)上改进它。
Leave a Comment随着人工智能领域的不断发展,它已经在许多用例中找到了应用,包括机器人技术。考虑到视觉位置识别(VPR)是估计机器人状态的关键技能,并广泛应用于各种机器人系统,如可穿戴技术、无人机、自动驾驶车辆和地面机器人。利用视觉数据,VPR使机器人能够识别和理解其所处环境中的当前位置或地点。 在各种情境下实现VPR的普适应用一直是困难的。虽然现代VPR方法在应用于与其所学环境相似的情境(如城市驾驶场景)时表现良好,但在各种其他环境中(如水下或空中环境)的效果显著下降。为了解决这个问题,人们努力设计一种通用的VPR解决方案,可以在任何环境中无误地运行,包括空中、水下和地下环境,不受白天-黑夜或季节变化等变化的影响,并且从任何视角都不受透视变化(包括直接相反的视角)的影响。 为了解决这些限制,一组研究人员提出了一种新的基线VPR方法,称为AnyLoc。该团队研究了来自大规模预训练模型的视觉特征表示,他们将其称为基础模型,作为仅依赖于VPR特定训练的替代选择。虽然这些模型最初并不是为VPR而训练的,但它们存储了丰富的视觉特征,有望成为一个全面的VPR解决方案的基石。 在AnyLoc技术中,仔细选择具有所需不变性属性的最佳基础模型和视觉特征,其中不变性属性包括模型在环境或视点变化时保持特定视觉特性的能力。然后将经常在VPR文献中使用的流行的局部汇聚方法与这些选择的属性进行合并。通过使用局部汇聚技术,可以更有根据的从视觉输入的不同区域整合数据,以更准确地进行位置识别。 AnyLoc通过将基础模型的丰富视觉元素与局部聚合技术相结合,使装备有AnyLoc的机器人在各种环境中极具适应性和实用性。它可以在各种环境中进行视觉位置识别,无论是一天中的任何时间还是一年中的任何时间,无论是从任何角度观察。该团队总结了研究结果如下。 通用的VPR解决方案:AnyLoc被提出作为VPR的新基线,在包含地点、时间和视角变化的12个不同数据集中无缝运行。 特征-方法协同作用:将像DINOv2这样的自监督特征与像VLAD或GeM这样的无监督聚合相结合,相对于直接使用现成模型的每个图像特征,可以显著提高性能。 语义特征表征:分析聚合局部特征的语义属性,揭示了潜在空间中的不同领域,增强了VLAD词汇构建并提高了性能。 强大的评估:该团队在具有挑战性的VPR条件下对AnyLoc进行了多样化的数据集评估,如白天-黑夜变化和相反的视角,为未来的通用VPR研究奠定了坚实的基础。
Leave a Comment在机器学习不断发展的领域中,特征管理已成为Airbnb的ML工程师面临的一个关键问题。尽管他们努力为各种产品创建创新模型,但他们经常发现自己花费大量时间处理基础设施复杂性,而不是专注于模型本身。Airbnb意识到需要一个能够简化特征数据管理、提供实时更新并确保训练和生产环境一致性的解决方案。 这就是Chronon,由Airbnb团队设计的强大API,旨在直面这些挑战。Chronon赋予ML从业者定义特征和集中数据计算以进行模型训练和生产推断的能力,从而确保整个过程的准确性和一致性。 从多样化的数据源摄取数据 Chronon可以从各种数据源摄取数据,包括事件流、数据仓库中的事实/维度表、表快照、变更数据流等。无论是实时事件数据还是历史快照,Chronon都可以无缝处理。 灵活转换数据 借助Chronon的类SQL转换和基于时间的聚合功能,ML从业者可以自由地处理数据。无论是标准聚合还是复杂的窗口技术,Chronon的Python API赋予用户执行复杂计算的能力,同时确保完全灵活性和可组合性。 在线和离线结果生成 Chronon同时满足在线和离线数据生成需求。Chronon为提供特征数据的低延迟端点或用于训练数据的Hive表提供支持。通过“准确性”参数,用户可以决定更新频率,使其适用于从实时更新到每日刷新的各种用例。 理解准确性和数据源 Chronon对准确性的独特方法使用户能够表达派生数据的所需更新频率。无论是近实时还是每日间隔,Chronon的“时间”或“快照”准确性模型都确保计算与每个用例的特定要求相一致。 数据源是Chronon生态系统中的重要组成部分。它支持三种主要的数据摄取模式: 事件数据源用于时间戳活动 实体数据源用于与业务实体相关的属性元数据 累积事件源用于跟踪缓慢变化维度的历史更改 计算上下文和类型 Chronon在两个不同的上下文中运行:在线和离线。在线计算为具有低延迟的应用程序提供服务,而离线计算使用批处理作业在数据仓库数据集上执行。所有Chronon定义都分为三类:GroupBy用于聚合、Join用于组合来自各种GroupBy计算的数据,以及StagingQuery用于自定义Spark SQL计算。 理解聚合以获取强大的洞察力 Chronon的GroupBy聚合提供了对传统SQL group-by功能的各种扩展。用户可以利用窗口进行基于时间的聚合、进行分桶以获得更精细的粒度,并使用自动解包处理数组中的嵌套数据。此外,基于时间的聚合提供了更大的灵活性,可为ML模型创建有深度的特征。 Airbnb的ML从业者的无缝集成 Chronon已经成为Airbnb机器学习工具中不可或缺的一部分。通过简化特征工程,Chronon使用户能够轻松生成数千个特征以供ML模型使用。这一革命性的解决方案使ML工程师摆脱了手动管道实现的负担,使他们能够专注于构建创新模型,以满足不断变化的用户行为和产品需求。 总之,Chronon已成为Airbnb机器学习工具中不可或缺的工具。提供全面的特征管理解决方案提高了特征工程的生产力和可扩展性,使ML从业者能够提供尖端的模型,为数百万用户提供更好的Airbnb体验。
Leave a Comment蛋白质是控制几乎所有疾病的聚合物结构。主要问题是找出哪种蛋白质可以与相应的蛋白质聚合物结构结合。主要的负担是从大量分子中找出这些可以结合的分子。这涉及到在这个领域使用机器学习和深度学习模型。研究科学家团队使用深度学习技术预测了分子,其大小比先前获得的分子增加了10倍。研究科学家们仍在通过深度学习模型改进亲水性键强度的质量。 深度学习算法利用原始数据提取高质量的特征和信息,如前所述。通过深度学习技术使用迭代方法研究蛋白质序列中的变化。预测或生成的结构被发现几乎接近于1的准确度。这些迭代方法用于收敛到准确预测的模型上。研究团队开发了2个用于蛋白质设计的软件工具。同时发现,由于向量形式的独立信息,所有蛋白质设计都是相互独立的。问题被分解成数百万个设计,同时在大规模计算单元上运行。 华盛顿大学、西雅图市、霍华德·休斯医学研究所和蛋白质设计研究所的研究团队将获得的蛋白质分子分成小块。然后,使用Linux设施将每个块分配给frontera的计算节点。这些较小的蛋白质实体进一步分为更小的实体。这些实体被传递到计算设计软件中。然后将其传递到蛋白质软件中以提高计算效率。这使效率提高了约200倍,与之前的记录相比。 这个结果显示了与目标蛋白质结合的研究速率增加了10倍。研究人员付出了很大的努力,但在这个路径上还有很长的路要走。这项研究的进一步计划是为蛋白质分子提供更好的目标,并提高蛋白质分子的成功率或准确率。该项目还旨在打造明天的抗癌工具。
Leave a Comment观察到在群体成员之间的简单互动中产生的动物集体运动现象,如成群的蝗虫、成群的鱼群、成群的鸟群和成群的有蹄动物,由于其引人注目的视觉特性和其从群体成员之间简单互动中产生,已被广泛研究。最近的研究侧重于更具生物学动机的基于智能体的方法,旨在建模特定行为电路和决策规则,以控制个体行为。研究人员设计了一个基于主动推理的模型,桥接了人类行为的理论和生物学方面。 这个模型类统一了认知和基于物理的观点,提供了对自适应行为的全面理解。它关注个体如何估计与邻居的距离,并利用这些细节进行决策。它有两个部分 – 动态模型描述了距离随时间如何变化,观察模型解释了个体如何感知这些距离。主动推理更新其信念和行动以最小化惊奇。 该模型强调复杂行为是由预测驱动的简单行为产生的。在某些情况下,它收敛到传统的作用力向量,如吸引力、排斥力和一致性,这些作用力向量被作为自由能泛函,作为惊奇的上限。行为可塑性是一种有助于增强和共同表示临时波动的关键机制。与使用特定结果的附加规则或机制不同,可塑性涉及对模型参数进行自由能梯度下降。这个机制被整合到主动推理中,扩展了其应用于模型参数更新。 研究人员希望他们的工作能够成为现有集体动物行为理论模型和更多与神经/机器学习相关的领域(如主动推理和贝叶斯大脑框架)之间的桥梁。他们还强调,他们选择的模型解释了观察到的集体系统的关键属性,并有效地重现了增强和解码信息的能力,而以前的模型在不引入额外机制的情况下难以建模。
Leave a Comment什么是人工智能? 简单来说,人工智能(AI)是机器具备执行我们通常与人类思维相关的功能的能力,例如进行推理任务、解决数学问题、股票交易等等。AI的核心是将计算机科学与强大的数据集结合起来,以实现问题解决。 自问世以来,AI经历了许多炒作周期,但去年OpenAI发布的ChatGPT推动了AI的兴奋和期待达到了新的高度,这标志着一个重要的里程碑,特别是在自然语言处理领域。此外,生成模型证明了它们在语言之外的适应性,展示了学习各种数据类型的语法的能力,例如软件代码、分子、自然图像等。 AI的应用正在日益发展,本文将讨论其在Web3中的作用和用例。 什么是Web3? Web3被定义为一系列相互连接的开源应用程序。这些应用程序以区块链计算架构为动力,是去中心化的,可以在节点网络中保护和分布数据和交易,消除了对中央机构或中间人的需求。 Web1(1990-2004)是静态且只读的(例如雅虎新闻),用户只是消费信息。Web2引入了互动性(例如Facebook、YouTube),但引发了隐私问题(利用用户数据进行定向广告)和集中控制(单方面做出决策,如封锁任何特定账户)。Web3旨在去中心化,赋予用户所有权和治理权,通过区块链来解决Web2的局限性,促进更加用户控制的互联网。 Web3应用的一个例子是Brave浏览器,这是一款基于Chromium的浏览器,以其Web3集成和加密货币集成而闻名。Brave在公共区块链上运行,并利用比HTTPS更快地发送和传递数据的IPFS(一种传输协议),使用户能够轻松赚取加密货币、链接钱包、探索NFT并访问DApp。具有强大的安全功能和对在线安全的关注,Brave为Web3爱好者提供了理想的浏览体验。 来源:https://www.businessinsider.com/personal-finance/what-is-web3?IR=T AI在Web3中的作用 自治智能体 自治智能体可以提供实时数据和一组预定义规则,以增强Web3平台中智能合约的能力。此外,这些智能体可以进行协商、执行交易并提供个性化服务。使用这样的智能体可以自动化复杂的流程、减少中间人,并提升整个Web3生态系统的能力。 个性化 在Web3的背景下,人工智能(AI)通过数据分析、交互模式和偏好来打造定制的用户体验至关重要。AI采用协同过滤和基于内容的过滤技术,生成个性化的推荐,增强Web3平台的各个方面。 这种个性化通过将内容和交互与个体的需求和偏好相一致,从而促进更深入的用户参与,最终丰富去中心化的Web3体验,实现高效的内容发现和策展。 去中心化数据市场 通过利用人工智能,可以创建去中心化的数据市场,赋予个体增强的数据控制能力。AI算法能够实现选择性的数据共享和货币化,并确保隐私。它们促进数据分析、分类和高效、安全地进行交易,在这些去中心化市场中优化数据买卖方之间的匹配。 分析与洞察 通过利用机器学习和自然语言处理等人工智能方法,Web3网络可以高效地处理和分析大量数据。这使用户具备预测分析、情感分析和个性化推荐的能力,增强他们对去中心化动态的理解,并改进在这一领域的导航能力。 安全与隐私 Web3生态系统可以通过利用先进的人工智能技术来改善网络安全和保护用户数据隐私。人工智能模型可以分析大量数据以识别漏洞、恶意行为和异常情况。机器学习算法可以防止网络威胁,如钓鱼和分布式拒绝服务(DDoS)攻击。通过积极确保安全性,人工智能增强了用户对Web3平台和应用的信任和信心。 去中心化自治组织(DAOs) 人工智能在去中心化自治组织(DAOs)的发展中起着关键作用。这些基于区块链的组织通过整合人工智能和优化Web3治理模型,自动化投票、资金管理和运营,实现更大的透明度和适应性。 Web3中人工智能的实际应用示例 Medibloc…
Leave a Comment长期以来,人工智能的目标之一是创建能够与人们在现实世界中进行有机交流的机器人。现今的具身代理人可以执行简单的低级命令,例如“拿起蓝色的积木”或“经过电梯然后向右转”。然而,交互式代理人需要能够理解人们在“此时此地”之外使用语言的全部方式,包括知识传递(例如,“左上角的按钮关闭电视”),情境信息(例如,“我们没有牛奶了”)和协调(例如,“我已经清理过客厅了”)。 大部分孩子在书籍中阅读或从他人那里听到的内容都传达了关于世界的信息,无论是它如何运作还是它目前的状态。他们如何使代理人能够说其他语言?强化学习(RL)是一种教授以语言为条件的代理人解决问题的技术。然而,目前大多数使用的语言条件的RL技术是通过从任务特定的指令中产生动作来训练的,例如,通过将像“拿起蓝色的积木”这样的目标描述作为输入并生成一系列运动命令。直接将语言映射到最佳行动方案在考虑到自然语言在实际世界中扮演的各种角色时,提供了一个困难的学习挑战。 如果正在进行的工作是清理,代理人应该通过进行下一个清理步骤来回答,但如果是用餐,代理人应该收拾碗。以“我把碗放好了”为例。当语言不讨论任务时,语言与代理人最佳行动方案之间只有弱相关性。因此,仅通过将语言映射到活动的任务奖励可能是学习信号更好,以便学会使用各种语言输入完成任务。相反,他们建议,语言对代理人的一个统一功能是帮助进行未来预测。短语“我把碗放好了”可以使代理人更准确地预测未来的观察结果(例如,如果它打开柜子,它会看到碗)。 从这个意义上说,孩子们接触到的大部分语言可能根植于视觉经验。代理人可以使用先前的信息来预测环境变化,例如“扳手可以用来拧紧螺母”。代理人可以通过说“包裹在外面”来预期观察结果。这种范式还将常见的按照指令实践与预测术语结合起来:指令帮助代理人期待奖励。他们认为,预测未来表示为代理人提供了丰富的学习信号,有助于他们理解语言以及它如何与外部世界交互,类似于下一个令牌预测使语言模型能够构建内部对世界知识的表示。 加州大学伯克利分校的研究人员引入了Dynalang,一种通过在线经验获取世界的语言和视觉模型,并利用该模型理解如何行为的代理。Dynalang将使用该模型的行为学习(具有任务激励的强化学习)与使用语言模型(具有预测目标的监督学习)的世界建模分开。世界模型接收视觉和文本输入作为观察模态,这些输入被压缩为潜在空间。随着代理人与周围环境的互动,使用在线收集的数据,它训练世界模型预测未来的潜在表示。使用世界模型的潜在表示作为输入,他们训练策略采取决策以最大化任务奖励。 由于世界建模与行动是不同的,Dynalang可以在没有活动或任务奖励的情况下预先训练单模态(仅文本或仅视频数据)。此外,语言生成的框架可以统一:代理人的感知可以影响其语言模型(即其关于未来令牌的预测),从而使其能够通过在动作空间中生成语言来与环境进行交流。他们在各种语言环境中测试了Dynalang的性能。Dynalang学会了利用关于未来观察结果、环境动态和修正的语言线索,在多任务清洁房屋的环境中更快地完成家务。在Messenger基准测试中,Dynalang通过阅读游戏手册来匹配游戏的最难关卡,优于任务特定的架构。他们展示了Dynalang可以在视觉和语言复杂的环境中掌握指令,在视觉语言导航中超越了最先进的强化学习算法和任务特定的架构。 以下是他们所做的贡献: • 他们提出了Dynalang,一种使用未来预测来连接语言与视觉体验的代理。 • 他们展示了Dynalang通过学习理解各种类型的语言来应对各种任务,优于最先进的RL算法和任务特定设计。 • 他们证明了Dynalang的构想打开了新的可能性,包括在单一模型中将语言创作与纯文本预训练相结合,而无需行动或任务激励。
Leave a CommentJupyter AI,是Jupyter项目的一个官方子项目,为Jupyter笔记本带来了生成式人工智能。它允许用户解释和生成代码,修复错误,总结内容,甚至从自然语言提示生成整个笔记本。该工具将Jupyter与来自各个提供商的大型语言模型(LLM),包括AI21、Anthropic、AWS、Cohere和OpenAI,通过LangChain的支持连接起来。 设计时考虑了负责任的人工智能和数据隐私,Jupyter AI使用户能够选择他们喜爱的LLM、嵌入模型和向量数据库,以满足他们特定的需求。该软件的底层提示、链和组件是开源的,确保数据透明性。此外,它保存有关模型生成内容的元数据,方便跟踪工作流中生成的AI代码。重要的是,Jupyter AI尊重用户数据隐私,只在被请求时联系LLM,绝不会在没有明确同意的情况下读取或传输数据。 要开始使用Jupyter AI,用户可以使用pip为其JupyterLab(版本3或4)安装适当的版本。该软件提供了两个与LLM交互的界面:JupyterLab内的聊天界面和支持的笔记本环境的魔术命令界面。聊天界面内的AI助手Jupyter Naut通过文本进行通信,并提供广泛的功能。它可以回答一般问题,用简单的英语或其他语言解释代码,修改代码并识别错误。此外,用户可以使用“/generate”命令从文本提示生成整个笔记本。 聊天界面允许用户使用“/learn”命令教授Jupyternaut有关本地文件的知识。Jupyternaut使用嵌入模型将数据转换并存储在本地向量数据库中,使用户可以使用“/ask”命令对这些文件提出问题。然后,AI根据存储的信息进行回答。 在笔记本环境中,用户可以使用“%%ai”等魔术命令与LLM交互。该软件支持多个提供商,并且用户可以使用“–format”参数自定义输出格式。此外,变量插值使得与AI模型的动态交互成为可能。 Jupyter AI是在Jupyter笔记本中进行AI驱动的代码生成和辅助的有价值的工具,注重道德考虑、隐私和数据透明性。鼓励用户在执行之前审查AI生成的代码,遵循与人工编写代码相同的实践。总之,Jupyter AI是Project Jupyter的一个强大而道德的补充,提供了AI驱动的代码生成、辅助和解释,同时保护数据隐私和负责任的AI实践。
Leave a Comment在数字化时代兴起的技术中,大型语言模型(LLMs)已成为一种强大的工具,革新了人类社会和文化的许多方面,重塑了我们与计算机的互动方式。然而,存在一个需要解决的关键挑战。LLMs的限制显而易见,揭示了无法理解对话的上下文和细微差别以及依赖于提示的质量和特定性的差距。一个主要的限制是它们缺乏真实交流的深度,错过了所有的语际信息。 微软的Rumi项目旨在通过解决对非语言线索和上下文细微差别的理解的局限性,提升LLMs的能力。它将语际输入纳入基于提示的LLMs交互,以提高沟通质量。研究人员使用音频和视频模型从数据流中检测实时非语言线索。使用两个独立的模型从用户的音频中提取语际信息,一个是音频的韵律音调和抑扬顿挫,另一个是从语音的语义中提取的信息。他们使用视觉转换器对帧进行编码,并从视频中识别面部表情。下游服务将语际信息纳入基于文本的提示中。这种多模态方法旨在增强用户情感和意图的理解,从而将人工智能与人类的交互提升到一个新的水平。 在这项研究中,研究人员只是简要探讨了语际在传达用户意图方面提供关键信息的作用。未来,他们计划改进模型,使其更好、更高效。他们还希望添加更多细节,如从标准视频中获取的HRV(心率变异性)以及认知和环境感知。这都是为了在与人工智能的下一个交互浪潮中增加未明示的意义和意图的更大努力的一部分。
Leave a Comment<img src=”https://www.marktechpost.com/wp-content/uploads/2023/08/362278500_245853288291883_2304974600919081225_n-1024×576.png”/><img src=”https://www.marktechpost.com/wp-content/uploads/2023/08/362278500_245853288291883_2304974600919081225_n-150×150.png”/><p>为了使研究人员和实践者能够训练他们的模型并推动技术的发展,Meta发布了其文本到音乐生成AI“AudioCraft”的源代码。MusicGen、AudioGen和EnCodec是构成AudioCraft开发框架的三个模型。</p><ul> <li>MusicGen可以根据文本用户输入生成音乐,因为它是使用Meta拥有并经过特殊许可的音乐进行训练的。</li> <li>AudioGen可以从文本输入中创建音频,并在公开的音效中进行训练。</li> <li>EnCodec是一个三合一的AI驱动的编码器、量化器和解码器。</li> </ul><p>AudioGen可以从文本输入中创建音频,并在公开的音效中进行训练。Meta将发布改进版的EnCodec解码器,使音乐生成具有更高的质量和更少的伪影,同时还提供预训练的AudioGen模型,可用于生成环境音和音效,比如狗叫声、汽车喇叭声或者木地板上的脚步声,以及AudioCraft模型的所有权重和代码。对该技术感兴趣的研究人员可以使用这些模型。Meta很高兴首次向研究人员和实践者开放其平台,让他们能够使用自己的数据集来训练模型并为技术的发展做出贡献。</p><p>经过训练后,它可以根据用户输入的文字产生逼真且高质量的音乐或音效。AudioCraft中包含了MusicGen、AudioGen和EnCodec这三个模型。MusicGen和AudioGen可以根据各自的训练集从文本生成音乐和音效。MusicGen使用Meta拥有的和经许可的音乐,而AudioGen使用公开的音频数据集。Meta在2017年的6月和10月分别发布了两个模型:MusicGen和AudioGen。</p><p>Meta声称,AudioCraft可以通过直观的界面产生专业级的声音。他们还声称,通过采用一种新的方法,它简化了当前音频生成技术的设计。他们详细介绍了AudioCraft如何使用EnCodec神经音频编解码器从原始音频数据中提取有意义的信息。在此之后,一个自回归语言模型通过利用音乐样本(音频令牌)的预先确定“词汇表”来训练一个新的音频语言模型。这个新模型生成基于文本描述的令牌,并发送回EnCodec解码器,从而实现音频和音乐的合成。</p><p>Meta演示了AudioGen与传统的AI音乐生成器的独特之处。长期以来,音乐的象征性表示,如MIDI或钢琴卷纸,一直被用于音乐训练以生成AI模型。然而,当记录音乐表达的细微差别和审美成分时,这些方法必须进行修订。更复杂的方法涉及将原始音乐输入系统,并使用自监督音频表示学习和多级(级联模型)模型来生成音乐,以捕捉信号的长距离结构。虽然效果可能需要一些改进,但是可以生成良好的声音。</p><p>根据负责任的AI原则,Meta的研究人员正在制作AudioGen和MusicGen模型卡片,记录他们开发模型的过程,并提供给研究界以不同规模的版本。音频研究框架和训练代码以MIT许可证的形式对公众开放,以供他人使用和扩展。Meta认为,如果开发出更复杂的控制方式,这样的模型对业余和专业音乐家可能非常有用。想象一下,通过强大的开源基础,可以实现带有音效和戏剧性音乐的增强睡前故事朗读等可能性。</p>
Leave a CommentIBM和开源AI平台Hugging Face共同宣布发布了watsonx.ai地理空间基础模型。这个出色的AI模型使用了NASA的卫星数据,代表了气候科学和地球研究领域的重大进展。这个合作的主要目标是民主化AI的获取,并促进这些关键领域的创新加速。 在面对不断变化的环境条件下,气候科学领域面临着获得最新数据的紧迫挑战。尽管有大量的数据涌入(预计到2024年将达到250,000 TB),但分析这些广泛的数据集对科学家和研究人员来说仍然是一个难以逾越的任务。为了解决这个问题,IBM今年早些时候与NASA签署了一项太空行动法协议,开发了一个用于地理空间数据的AI基础模型。 通过在Hugging Face上提供地理空间基础模型,这个合作旨在促进AI社区内更大的合作和信息共享。这一举措有望加速开发有益于地球的重大解决方案。 地理空间基础模型是在美国大陆范围内的一年时间内,使用协调的Landsat Sentinel-2卫星数据(HLS)进行联合训练的。该模型在现有技术上表现出令人印象深刻的15%的提升,同时只需要一半的标记数据。该模型可以通过进一步的微调适用于各种任务,包括森林砍伐追踪、作物产量预测以及温室气体的检测与监测。IBM和NASA还与克拉克大学合作,探索时间序列分割和相似性研究等应用。 IBM的地理空间模型利用了其基础模型技术,这是该公司更广泛努力的一部分,旨在为各种任务创建和训练AI模型,并利用场景之间的知识转移。今年7月,IBM推出了Watsonx,这是一个AI和数据平台,使企业能够利用可靠的数据扩展和加速先进AI的影响。集成到IBM环境智能套件(EIS)的商业版本的地理空间模型预计将于今年晚些时候发布。 总之,IBM和Hugging Face之间的合作,加强了NASA的卫星数据的支持,代表了推动科学进步和加深我们对地球气候的理解的有希望的机会。这个模型的开源性有望赋予全球研究人员和科学家在应对紧迫环境挑战方面的能力。
Leave a Comment近年来,由于生成式人工智能的最新进展,包括医学成像在内的多个领域取得了新的发展。这些生成式模型在异常检测、图像转换、去噪和磁共振成像(MRI)重建等各种用途上有着巨大的潜力。然而,这些模型因其复杂性而闻名,使得应用和复现变得困难。这种复杂性可能会降低进展速度,为用户设下障碍,并阻碍对新方法与已有方法进行比较评估。 为了使生成式模型的构建和部署更加简便和标准化,研究团队创建了一个名为MONAI Generative Models的开源平台。该团队包括来自伦敦国王学院、国家心理健康研究所、爱丁堡大学、巴塞尔大学、韩国科学技术高等研究院、NVIDIA、斯坦福大学、西奈山伊坎医学院和伦敦大学学院的研究人员。 为了证明该技术的有效性,讨论了五项涵盖医学成像相关主题的研究,从分布外检测到图像转换和超分辨率。该平台的适应性通过其在2D和3D场景中使用不同模态和解剖区域的能力得到展示,展示了它作为推动医学成像的新工具的潜力。五个实验如下: 提出的模型可以轻松调整以适应新环境,从而更全面地进行跨多种情况的比较,并扩大其初始范围。为了证明这一特性,研究人员评估了他们的软件包中最先进的模型之一——潜在扩散模型,以及它在包括具有不同体型和活动类型的受试者的各种数据集中生成新信息的能力。 潜在生成模型包括两个基本部分——压缩模型和生成模型,团队展示了这些模型的高度灵活性。 该系统使得在各种医学成像应用中使用生成式模型变得更加容易。研究团队证明了它们可以应用于检测超出正常范围的3D成像数据。 他们还使用稳定扩散2.0升频器方法研究了生成式模型在超分辨率方面的潜力。研究结果表明,生成式模型在超分辨率应用中非常有用,特别是在3D模型中。 团队还测试了他们的模型在超分辨率照片方面的性能。为此,他们将放大的测试集照片与相应的真实图像进行了比较。这些指标确认了该模型在提高图像清晰度方面的卓越超分辨率能力,证明了其效率。 未来,研究人员计划改进对其他应用(如MRI重建)的支持,并引入更多最新模型,以便更轻松地进行模型比较。由于这些发展,医学生成式模型及其应用领域将继续取得进展。
Leave a Comment最近引入的大型语言模型(LLMs)已经在人工智能(AI)社区中引起了轰动。这些模型通过使用超强的自然语言处理(NLP)、自然语言生成(NLG)和自然语言理解(NLU)成功地模仿了人类。LLMs因为能够模仿人类进行真实对话而变得著名,它们能够回答简单和复杂的问题,生成内容,代码补全,机器翻译和文本摘要。NLP的目标是使计算机系统能够理解和响应以自然语言给出的命令,使人们能够以更自然和灵活的方式与它们互动,最好的例子就是指令跟随模型。 这些模型是使用LLMs、有监督的例子或其他类型的监督进行训练,并暴露在成千上万个以自然语言指令编写的任务中。在最近的研究中,来自麦吉尔大学Mila Quebec AI研究所、麦吉尔大学和Facebook CIFAR AI Chair的团队研究了评估指令跟随模型在给定一组文本段落上执行问答(QA)任务的性能。这些模型可以在提供描述任务、问题和由检索器检索到的相关文本段落的提示时回答问题,这些模型产生的响应被认为是自然和信息丰富的,有助于建立用户的信任和参与度。 这些模型可以通过仅向其输入添加检索到的文档和指令来自然而流畅地回答用户的查询。然而,这种额外的冗长使得传统的QA评估指标如完全匹配(EM)和F1分数难以有效地量化模型的性能。这是因为模型的响应可能包含更多细节,而参考答案忽略了这些细节,但仍然准确。为了解决这个问题,团队提供了两个评估指标衡量检索增强的质量保证(QA)中的指令跟随模型。 关于信息必要性、准确性:这个维度评估模型满足用户信息需求的能力。它关注的是生成的响应是否包含相关信息,即使它超出了直接在参考答案中提及的内容。 与所提供的信息的一致性:这个维度评估模型在所提供的知识中是否正确回答问题。一个真实的模型应该避免在呈现无关信息时回答问题,并在有关信息可用时给出准确的答案。 作者在三个不同的QA数据集上评估了几个最近的指令跟随模型:用于开放域QA的自然问题,用于多跳QA的HotpotQA,以及用于对话QA的TopiOCQA。他们手动分析了900个模型的响应,并将结果与不同的自动评估指标进行了比较,以评估准确性和忠实度。他们的研究表明,召回率(衡量参考答案中的标记在模型响应中的占比)与正确性的相关性比EM或F1分数等词汇重叠度量更强。与其他用于忠实度的标记重叠度量相比,K-Precision(模型答案标记在知识片段中存在的百分比)与人类判断更强相关。 总之,本研究旨在更全面地评估指令跟随模型在QA任务中的优势和劣势。该团队通过在GitHub存储库上提供他们的代码和数据,进一步推动了该领域的进展。
Leave a Comment大型语言模型可以实现流畅的文本生成、新颖的问题解决和创造性的散文和代码生成。相比之下,视觉-语言模型可以实现开放词汇的视觉识别,甚至可以对图像中的物体-代理交互进行复杂推理。机器人学习新技能的最佳方式需要进一步明确。与在网络上训练最先进的语言和视觉-语言模型所使用的数十亿个标记和照片相比,从机器人收集的数据量可能无法相提并论。然而,要立即将这些模型适应到机器人活动中也具有挑战性,因为这些模型推理语义、标签和文本提示。相比之下,机器人必须接受低级别的指导,例如使用笛卡尔末端执行器。 Google Deepmind的研究旨在通过直接将基于互联网规模数据训练的视觉-语言模型直接融入端到端的机器人控制中,改善泛化能力并实现新兴语义推理。借助基于网络的语言和视觉-语言数据,我们旨在创建一个综合训练的模型,用于将机器人观察连接到动作。他们提出使用来自机器人轨迹和在互联网上进行的大规模视觉问答练习的数据,一起对最先进的视觉-语言模型进行微调。与其他方法相比,他们提出了一种简单通用的方法:将机器人动作表达为文本标记,并直接将其纳入模型的训练集中,就像处理自然语言标记一样。研究人员研究了视觉-语言-动作模型(VLA),RT-2是其中一个模型的实例。通过严格的测试(6,000个评估试验),他们可以确定RT-2通过基于互联网的训练获得了各种新兴技能,并且该技术导致了有效的机器人策略。 Google DeepMind推出了RT-2,这是一个基于Transformer的模型,它是作为其机器人Transformer模型1的后续而训练的,该模型是使用从网络获取的文本和图像进行训练的,可以直接执行机器人操作。使用机器人动作来表示作为第二语言的信息,可以将其转换为文本标记,并与在线可用的大规模视觉-语言数据集一起进行教学。推断涉及将文本标记解码为机器人行为,然后通过反馈循环进行控制。这使得可以将视觉-语言模型的一部分泛化、语义理解和推理能力转移到学习机器人策略上。在项目网站https://robotics-transformer2.github.io/上,RT-2团队提供了其使用的实时演示。 该模型保留了在机器人数据中发现的物理技能的应用能力。同时,它还通过阅读从网络中获取的视觉和语言命令来学习在新环境中使用这些技能。即使在机器人数据中不包含诸如精确数字或图标之类的语义线索,该模型也可以重新利用其学到的拾取和放置技能。在机器人演示中没有提供这样的关系,但该模型可以正确选择物体并将其放置在正确的位置。此外,如果命令附带一系列思路提示,例如知道岩石是 improvises锤子的最佳选择或者知道能量饮料是疲劳时的最佳选择,模型还可以进行更复杂的语义推理。 Google DeepMind的主要贡献是RT-2,这是一系列通过将基于网络规模数据进行微调的巨型视觉-语言模型创建的模型,用于作为具有泛化能力和语义感知的机器人规则。实验使用了多达550亿个参数的模型,这些参数是从公开可用的数据中学习的,并用机器人运动命令进行了注释。通过6,000个机器人评估,他们证明RT-2在对象、场景和指令的泛化方面取得了显著进展,并展示了一系列新兴能力,这些能力是基于互联网规模的视觉-语言预训练的副产品。 主要特点 RT-2的推理、符号解释和人类识别能力可在广泛的实际场景中使用。 RT-2的结果表明,使用机器人数据预训练VLMs可以使它们成为直接控制机器人的强大视觉-语言-动作(VLA)模型。 一个有希望的方向是构建一个能够思考、解决问题并理解信息以完成实际世界中各种活动的通用物理机器人,就像RT-2一样。 RT-2展示了它在处理各种任务方面的适应性和效率,它可以将语言和视觉训练数据转化为机器人动作。 限制 尽管RT-2具有令人鼓舞的泛化特性,但它也存在一些缺点。研究表明,通过VLMs(视觉语言模型)引入Web规模的预训练可以提高对语义和视觉概念的泛化能力,但这并不意味着机器人在执行动作方面具备了新的能力。尽管模型只能以新颖的方式利用机器人数据中存在的物理能力,但它确实学会了更好地利用自己的能力。研究人员认为,这是因为样本在能力维度上需要更多的多样性。新的数据收集范例,比如人类的电影,为未来研究获取新技能提供了有趣的机会。 总之,Google DeepMind的研究人员证明了大型VLA模型可以实时运行,但这需要相当大的计算开销。随着这些方法被应用于需要高频控制的情况,实时推理风险成为一个重要瓶颈。量化和蒸馏方法可以让这些模型更快地运行或在更便宜的硬件上运行,这是未来研究的有吸引力的领域。这与另一个现有限制相关,即相对较少的VLM模型可以用于开发RT-2。 来自Google DeepMind的研究人员总结了通过将预训练与视觉语言模型(VLMs)和机器人数据进行整合来训练视觉-语言-动作(VLA)模型的过程。然后他们引入了两个VLA的变种(RT-2-PaLM-E和RT-2-PaLI-X),分别受到PaLM-E和PaLI-X的启发。这些模型通过机器人轨迹的数据进行微调,以生成机器人动作,并将其分词为文本。更重要的是,他们证明了这种技术改进了泛化性能和从Web规模的视觉语言预训练中继承的新兴能力,从而导致非常有效的机器人策略。根据Google DeepMind的说法,机器人学习领域现在通过这种简单而通用的方法论得到了从其他领域改进的战略定位。
Leave a Comment大型语言模型(LLMs)在自然语言处理(NLP)领域取得了显著进展。将多模态引入LLMs并将其转化为多模态大型语言模型(MLLMs),可以进行多模态感知和解释,这是一个合乎逻辑的步骤。作为人工通用智能(AGI)的可能步骤,MLLMs在感知(如存在、计数、位置、OCR)、常识推理和代码推理等各种多模态任务中展示出了令人惊讶的新技能。与LLMs和其他任务特定模型相比,MLLMs能够以更类似人类的视角看待环境,提供用户友好的交互界面,并具备更广泛的任务解决能力。 现有的以视觉为中心的MLLMs使用Q-former或基本投影层、预训练的LLMs、视觉编码器和额外的可学习模块。另一种范式是通过API将当前的视觉感知工具(如跟踪和分类)与LLMs相结合,构建一个无需训练的系统。早期在视频领域的一些研究使用了这种范式开发了视频MLLMs。然而,以往从未对基于长时间电影(持续时间超过一分钟)的模型或系统进行过任何研究,并且也没有设定衡量这些系统有效性的标准。 在这项研究中,浙江大学、华盛顿大学、微软亚洲研究院和香港大学的研究人员介绍了一种名为MovieChat的独特框架,用于解决长时间视频解释挑战,将视觉模型与LLMs结合起来。根据他们的说法,扩展视频理解的剩余困难包括计算困难、内存开销和长期时间关联。为了解决这个问题,他们提出了一种基于阿特金森-希夫林(Atkinson-Shiffrin)记忆模型的记忆系统,其中包括快速更新的短期记忆和紧凑持久的长期记忆。 这个独特的框架将视觉模型与LLMs结合起来,是第一个能够进行扩展视频理解任务的框架。该研究通过进行严格的定量评估和案例研究,评估了理解能力和推理成本的性能,并提出了一种记忆机制,以降低计算复杂性和内存成本,同时改善长期时间关联。该研究通过将巨大的语言模型与视频基础模型相结合,提出了一种新颖的理解视频的方法。 该系统通过包含一个受阿特金森-希夫林模型启发的记忆过程来解决分析长电影的困难,其中包括由Transformers中的令牌表示的短期和长期记忆。所提出的系统MovieChat在扩展视频理解方面表现优于之前只能处理几帧电影的算法,并达到了最先进的性能。这种方法解决了长期时间关联问题,同时降低了内存使用和计算复杂性。该研究凸显了记忆过程在视频理解中的作用,使模型能够存储和检索相关信息长时间。MovieChat的普及对包括内容分析、视频推荐系统和视频监控在内的行业具有实际影响。未来的研究可能会探索如何加强记忆系统,并使用其他模态(包括音频)来提高视频理解能力。这项研究为需要全面理解视觉数据的应用创造了可能性。他们的网站上有多个演示。
Leave a Comment文本到图像模型已经成为AI领域讨论的基石,该领域的进展相当迅速,因此我们拥有了令人印象深刻的文本到图像模型。生成式人工智能进入了一个新阶段。 扩散模型是这一进展的关键贡献者。它们已经成为一个强大的生成模型类别。这些模型被设计为通过缓慢去噪输入来生成高质量的图像。扩散模型能够捕捉隐藏的数据模式并生成多样且逼真的样本。 基于扩散的生成模型的快速进展已经彻底改变了文本到图像生成方法。你可以要求一个图像,无论你能想到什么,描述出来,模型都能够相当准确地为你生成出来。随着它们的进一步发展,越来越难以理解哪些图像是由人工智能生成的。 然而,这里存在一个问题。这些模型完全依赖于文本描述来生成图像。你只能“描述”你想要看到的内容。此外,它们很难进行个性化,因为在大多数情况下需要进行微调。 想象一下,你正在为你的房子做室内设计,与一位建筑师合作。建筑师只能为你提供他为之前的客户设计的方案,当你试图个性化设计的某个部分时,他只会忽视它并为你提供另一个曾经使用过的风格。听起来不太令人愉快,不是吗?如果你在寻求个性化,这可能是你在使用文本到图像模型时会得到的体验。 幸运的是,已经有人试图克服这些限制。研究人员已经探索了将文本描述与参考图像整合起来以实现更个性化的图像生成。虽然一些方法需要在特定的参考图像上进行微调,但其他方法会在个性化数据集上重新训练基础模型,从而可能出现保真度和泛化性的潜在缺陷。此外,大多数现有算法只适用于特定领域,无法处理多概念生成、测试时微调和开放领域零样本能力。 因此,今天我们将介绍一种接近开放领域个性化的新方法——Subject-Diffusion。 SubjectDiffusion可以生成高保真度的主题驱动图像。来源:https://arxiv.org/pdf/2307.11410.pdf Subject-Diffusion是一种创新的开放领域个性化文本到图像生成框架。它仅使用一个参考图像,消除了测试时微调的需求。为了构建一个大规模的个性化图像生成数据集,它利用了一个自动数据标记工具,生成了令人印象深刻的7600万图像和2.22亿个实体的Subject-Diffusion数据集。 Subject-Diffusion有三个主要组成部分:位置控制、细粒度参考图像控制和注意力控制。位置控制是在噪声注入过程中添加主要主题的遮罩图像。细粒度参考图像控制使用一个组合的文本-图像信息模块来改善两者的整合。为了实现多个主题的平滑生成,训练过程中引入了注意力控制。 SubjectDiffusion概览。来源:https://arxiv.org/pdf/2307.11410.pdf Subject-Diffusion实现了令人印象深刻的保真度和泛化性,能够根据每个主题的一个参考图像生成单个、多个和以人为主题的个性化图像,并进行形状、姿势、背景和风格的修改。该模型还通过特别设计的去噪过程,实现了自定义图像和文本描述之间的平滑插值。定量比较显示,Subject-Diffusion在各种基准数据集上超越或与其他最先进的方法相媲美,无论是否进行测试时微调。
Leave a Comment随着人工智能(AI)继续吸引世界的目光,一项令人称奇的应用在计算机视觉和AI的交叉领域中崭露头角,即人体运动预测(HMP)。这个引人入胜的任务涉及根据观察到的运动序列预测人体主体的未来运动或动作。其目标是预测一个人的身体姿势或动作如何演变。HMP在机器人学、虚拟化身、自动驾驶车辆和人机交互等多个领域都有应用。 随机HMP是传统HMP的扩展,其重点是预测可能未来动作的分布,而不是单一确定的未来。这种方法认识到人类行为的固有自发性和不可预测性,旨在捕捉与未来动作或运动相关的不确定性。随机HMP通过考虑可能未来动作的分布来解决人类行为的可变性和多样性,从而实现更加真实和灵活的预测。在需要预测多种可能行为至关重要的场景中,如辅助机器人或监控应用,随机HMP尤为有价值。 通常使用生成模型(如GAN或VAE)来预测每个观察序列的多个未来动作来处理随机HMP。然而,这种在坐标空间中生成多样化动作的重点导致了不真实和快速发散的动作预测,可能需要更好地与观察到的动作相一致。此外,这些方法通常忽视了预测具有微小关节位移的多样化低范围行为。因此,需要新的方法来考虑行为多样性并在随机HMP任务中产生更加真实的预测。为了解决现有随机HMP方法的局限性,巴塞罗那大学和计算机视觉中心的研究人员提出了BeLFusion。这种新颖的方法引入了一个行为潜空间,以生成真实且多样化的人体运动序列。 生成模型中的快速和发散的动作。 BeLFusion的主要目标是将行为与动作分离,实现观察到的姿势和预测姿势之间的平滑过渡。这通过行为VAE实现,包括行为编码器、行为耦合器、上下文编码器和辅助解码器。行为编码器结合了门控循环单元(GRU)和2D卷积层,将关节坐标映射到潜在分布。然后,行为耦合器将采样的行为转移到进行中的动作,生成多样化且具有上下文适应性的动作。BeLFusion还结合了一种条件潜空间扩散模型(LDM),以准确地编码行为动态并将其有效地转移到进行中的动作,同时最小化潜在和重构错误,以增强生成动作序列中的多样性。 BeLFusion的创新架构还包括一个观察编码器,它是一个从关节坐标生成隐藏状态的自编码器。该模型利用了潜空间扩散模型(LDM),该模型使用了带有交叉注意机制和残差块的U-Net,从中采样出行为与姿势和动作分离的潜在空间。通过从行为的角度促进多样性并与最近的过去保持一致性,BeLFusion在随机HMP中产生了比最先进方法更加真实和连贯的动作预测。通过行为分离和潜空间扩散的独特组合,BeLFusion在人体运动预测方面代表了一个有希望的进展。它具有为各种应用程序生成更自然和上下文适应的动作的潜力。 实验评估显示,BeLFusion具有令人印象深刻的泛化能力,在已知和未知情景中表现出色。在使用Human3.6M和AMASS数据集的具有挑战性结果进行跨数据集评估时,它在各种指标上表现优于最先进的方法。在H36M上,BeLFusion的平均位移误差(ADE)约为0.372,最终位移误差(FDE)约为0.474。同时,在AMASS上,它的ADE约为1.977,FDE约为0.513。结果表明BeLFusion生成准确且多样化预测的能力优越,展示了它在不同数据集和动作类别上进行逼真人体运动预测的有效性和泛化能力。 总体而言,BeLFusion是一种用于人体运动预测的新方法,其在Human3.6M和AMASS数据集的准确性指标中实现了最先进的性能。它利用行为潜空间和潜扩散模型生成多样化且上下文自适应的预测。该方法能够捕捉和转移序列之间的行为,使其对领域转移具有鲁棒性,并提高了泛化能力。此外,定性评估表明,BeLFusion的预测比其他最先进的方法更加逼真。它为人体运动预测提供了有希望的解决方案,在动画、虚拟现实和机器人技术等领域具有潜在应用。
Leave a CommentDeepSwap DeepSwap 是一款基于人工智能的工具,适用于任何想要创建逼真深度伪造视频和图像的人。通过重新面部定位视频、图片、梗、旧电影、GIF 等,您可以轻松地创建自己的内容。该应用没有内容限制,因此用户可以上传任何内容的素材。此外,首次订阅该产品的用户可享受50%的折扣。 Aragon 使用 Aragon 轻松获得令人惊叹的专业头像照片。利用最新的人工智能技术,轻松地为自己创建高质量的头像照片!不需要费心预约摄影工作室或打扮。快速编辑和修饰您的照片,不需要等上几天。获得40张高清照片,为您在下一份工作中带来优势。 AdCreative.ai 使用 AdCreative.ai,提升您的广告和社交媒体能力,这是终极人工智能解决方案。告别数小时的创意工作,欢迎在几秒钟内生成高转化的广告和社交媒体帖子。立即使用 AdCreative.ai,最大化您的成功,最小化您的努力。 Otter AI Otter.AI 借助人工智能技术,为用户提供实时的会议笔记转录,这些转录具有共享、搜索、访问和安全的特点。获得一个会议助手,可以录制音频、撰写笔记、自动捕捉幻灯片并生成摘要。 Notion Notion 正通过利用其先进的人工智能技术来增加其用户群。他们的最新功能 Notion AI 是一个强大的生成式人工智能工具,可以帮助用户完成笔记摘要、会议中的行动项识别、文本的创建和修改等任务。Notion AI 通过自动化繁琐的任务、提供建议和模板,优化了工作流程,简化和改善了用户体验。 Docktopus…
Leave a Comment最近的语言模型可以将长上下文作为输入;需要了解它们如何更好地使用更长的上下文。能否将LLMs扩展到更长的上下文?这是一个未解答的问题。Abacus AI的研究人员进行了多次实验,涉及不同方案来开发Llama的上下文长度能力,该模型在上下文长度2048上进行了预训练。他们使用IFT将这些模型进行线性缩放,缩放比例为4和16。将模型缩放到16倍可以执行长达16k的上下文长度的任务,甚至可以执行长达20-24k的上下文长度的任务。 扩展上下文长度的不同方法包括线性缩放、通过幂将旋转位置嵌入(RoPE)的傅里叶基缩放、截断傅里叶基和随机化位置向量。Abacus AI的研究人员使用这些方法对RedPajama数据集和Vicuna数据集进行了微调。他们发现线性缩放是稳健的,但会增加模型的上下文长度。截断和随机化具有很高的困惑度分数,但在检索任务上表现较差。 为了评估这些模型,研究人员使用了来自LMSys、开放式问答数据集和WikiQA的数据集。LMSys数据集用于在上下文中定位子字符串。WikiQA任务是根据维基百科文档中给出的信息回答问题的任务。 团队根据Google自然问题中的简短回答格式数据构建了一个QA任务。他们确保输出只是从原始文档中复制粘贴的短词回答。这样可以精确定位LLM应该查找的位置,通过将答案放置在不同位置有效地评估扩展上下文长度的每个部分。他们还创建了多个具有不同大小的相同维基百科文档的版本,这使他们能够在模型大小上进行公平评估。 基于维基百科的数据集的问题是模型从其预训练的文本中回答而不是从上下文中回答。研究人员通过创建一个由只有数字答案的问题组成的改编数据集来解决这个问题。他们改变了答案和文档中响应的每个出现,使得如果LLM从其预训练的文本中回忆起来,模型将错误地回答。他们将原始QA任务命名为自由格式QA(FFQA),将改编任务命名为改编数字QA(AltQA)。 AbacusAI的研究人员在两个版本的QA任务中对每个示例进行了存在准确性评估。存在准确性是衡量生成的解决方案中是否存在答案作为子字符串的准确性。他们观察到IFT的准确性提高并不能给模型能够实现的上下文长度范围带来任何扩展。 研究人员表明,通过缩放上下文进行IFT可以显著提高性能。他们观察到在缩放上下文因子插值的所有位置上,FFQA的性能提高了2倍,AltQA的性能提高了2.5倍。最后,他们的研究工作提出了一个更大上下文的语言模型,它通过更好地捕捉文档的主题更容易地提高困惑度。
Leave a Comment融入人类输入是近期大型语言模型(LLM)能力显著提升的关键组成部分,例如ChatGPT和GPT-4。为了有效使用人类反馈,首先必须训练一个融入人类偏好、价值观和伦理问题的奖励模型。然后,在奖励模型的指导下,使用强化学习调整LLM。这个过程被称为从人类反馈中进行强化学习(RLHF),可以成功地使LLM与人类目标协调,显著提升人际交流的质量。 创建一个功能性且基于人类偏好的奖励系统并不容易。当人类标注者无法为特定提示的响应或完成提供一个数字评分时,这变得非常具有挑战性。相反,对于人们来说,根据质量进行完成的两两比较要简单得多,并且这种方法被用于InstructGPT的创建。特别是,人类标注者在看到由LLM生成的许多完成的同一个提示后,将这些完成从最高到最低的感知质量进行排序。 然后,回复根据一个经过训练的神经网络来匹配人类偏好排名的奖励模型进行奖励。尽管有一些优点,比如消除校准问题,但排名并不能充分反映多个提示的各种奖励分布。这是因为当排名较高时,很难清楚地知道一个完成比另一个完成好多少。由于一些RLHF提示是开放式的,或者换句话说,依赖于用户的历史记录,因此奖励分布可能在较大范围内变化;因此,这个问题尤为重要。 相反,有些提示是封闭式的,产生应该获得高或低分的回复,导致奖励分布的近似两点质量分布。第一类提示的例子包括“证明勾股定理”和“鸡是恐龙吗”。第二类提示的例子包括“证明勾股定理”和“写一篇关于100年后人工智能的短篇小说”。只有考虑到各种线索的微妙之处,激励模型才能帮助LLM适当地衡量不确定性。 斯坦福大学、普林斯顿大学和宾夕法尼亚大学的研究人员记录了一个意外现象,显示在根据偏好排名训练奖励模型时,它可以提供独立于提示的相同奖励分布。这个事件发生在训练的最后阶段,被称为奖励崩溃。有趣的是,在这个事件被经验性地证明之前,他们的理论分析就已经预测到了。他们证明了可以使用一个简单的优化程序,甚至更简单的闭式表达式来数值推断奖励崩溃的奖励分布。他们对奖励崩溃的预测与经验结果非常吻合。 他们的第二个重要贡献是引入了一种有原则的策略,利用来自同一个优化程序的数据来防止奖励崩溃。奖励崩溃是不可取的,因为它忽略了不同提示之间微小的区别,并且在使用强化学习和奖励模型训练LLM时可能导致人类选择的错误校准。奖励模型的训练提前结束是解决这个问题的一个简单方法,但这是相当任意的,并且很难决定何时结束。 实质上,他们建议基于提示使用不同的效用函数来训练奖励模型,这样产生的奖励分布可以是广泛分散或紧密集中的,具体取决于提示是开放式还是封闭式。这种基于提示的技术具有明显的优势,可以进行全面的分析,根据需要完全定制奖励分布的结构。他们的研究结果表明,使用这种基于提示的技术可以显著减少奖励崩溃。
Leave a CommentChatGPT和大型语言模型(LLMs)非常灵活,可以创建多种程序。然而,当应用程序受欢迎并且流量增加时,与LLM API调用相关的成本可能变得显著。在处理许多查询时,LLM服务可能还需要较长的等待时间。 为了直面这一困难,研究人员开发了GPTCache,这是一个旨在存储LLM答案的语义缓存项目。开源的GPTCache程序可以通过缓存其输出答案来加快LLMs的速度。当所请求的响应已经在缓存中存储并且之前已经请求过时,这将极大地减少获取它所需的时间。 GPTCache具有灵活和简单的特点,非常适合任何应用。它与许多语言学习机器(LLMs)兼容,例如OpenAI的ChatGPT。 它是如何工作的? 为了正常运行,GPTCache会缓存LLM的最终回复。缓存是用于快速检索最近使用的信息的内存缓冲区。每当向LLM发出新请求时,GPTCache首先查找缓存,以确定所请求的响应是否已经存储在其中。如果答案可以在缓存中找到,它将立即返回。如果缓存中没有找到,LLM将生成响应并将其添加到缓存中。 GPTCache的模块化架构使其易于实施定制的语义缓存解决方案。用户可以通过选择不同的设置来定制每个模块的体验。 LLM适配器通过将各种LLM模型使用的API和请求协议标准化为OpenAI API,统一了它们之间的接口。由于LLM适配器可以在不需要重写代码或熟悉新API的情况下在LLM模型之间移动,它简化了测试和实验。 嵌入生成器使用所请求的模型创建嵌入,以进行相似性搜索。支持的模型可以使用OpenAI的嵌入API。这是使用GPTCache/paraphrase-albert-onnx模型的ONNX,Hugging Face嵌入API,Cohere嵌入API,fastText嵌入API和SentenceTransformers嵌入API。 在缓存存储中,像ChatGPT这样的LLM的响应被保留,直到可以检索。在确定两个实体是否在语义上相似时,会获取缓存的回复并将其发送回请求方。GPTCache与许多不同的数据库管理系统兼容。用户可以选择最符合其性能、可扩展性和最常用数据库成本要求的数据库。 向量存储的选择:GPTCache包括一个向量存储模块,它使用从原始请求中导出的嵌入来识别K个最相似的请求。此功能可用于确定两个请求的相似程度。此外,GPTCache支持多个向量存储,例如Milvus、Zilliz Cloud和FAISS,并为与它们一起使用提供了简单的接口。用户可以选择各种向量存储选项,其中任何一个都可能影响GPTCache的相似性搜索性能。凭借对各种向量存储的支持,GPTCache承诺是可适应的,并满足更多种用例的需求。 GPTCache缓存管理器管理缓存存储和向量存储组件的驱逐策略。当缓存被填满时,替换策略决定哪些旧数据应该从缓存中删除,以为新数据腾出空间。 相似性评估器的信息来自于GPTCache的缓存存储和向量存储部分。它使用几种不同的方法将输入请求与向量存储中的请求进行比较。是否从缓存中提供请求取决于相似度的程度。GPTCache提供了统一的接口和可用实现的库,以确定缓存匹配。GPTCache通过各种相似度算法来确定缓存匹配的能力,使其能够适应大范围的用例和用户需求。 特点和优势 通过GPTCache减少LLM查询延迟,提高响应速度和速度。 由于许多LLM服务采用基于令牌和请求的定价结构,GPTCache可以减少服务成本,限制API调用次数。 GPTCache具有从LLM服务卸载工作的能力,提高可扩展性。随着您接收的请求数量增加,这可以帮助您保持高效运行。 借助GPTCache,可以将创建LLM应用程序的成本降至最低。通过缓存由LLM生成或模拟的数据,您可以在不向LLM服务发出API请求的情况下测试您的应用程序。 GPTCache可以与您选择的应用程序(LLM ChatGPT)、缓存存储(SQLite、PostgreSQL、MySQL、MariaDB、SQL Server或Oracle)和向量存储(FAISS、Milvus、Ziliz Cloud)配合使用。GPTCache项目的目标是在GPT-based应用程序中尽可能地重用先前生成的回复,而不是每次都从空白开始,从而实现对语言模型的最有效利用。
Leave a Comment