自然语言处理(NLP)近年来发生了一次范式转变,引入了大型语言模型(LLMs),在各种NLP任务中表现优于之前相对较小的语言模型(LMs),如GPT-2和T5 Raffel等。提示是使用LLMs执行各种任务的事实上的方法,通过使用上下文中的自然语言指令引导LLMs生成所需的输出,而无需对参数进行更新,与传统的微调范式相反,其中LMs的参数可以针对每个下游任务进行更新。 虽然这种提示模式使得LLMs在零射击或少射击环境中在各种任务上表现出色,但它们在某些特定的下游任务上的表现仍然需要改进,并且需要额外的细化,尤其在训练数据可用的情况下。然而,由于大多数LLMs只提供黑盒推理API并且微调成本高昂,大多数用户和学者无法直接优化这些LLMs。因此,必须解决的一个困难问题是如何有效地提高LLMs在特定下游任务上的性能,有时只有有限的训练实例。来自加利福尼亚大学圣巴巴拉分校和微软的一项新研究提出了使用微小可调整LM(RL)增强冻结的黑盒LLM在下游任务上的架构,称为定向刺激提示(DSP)。 来源:https://arxiv.org/pdf/2302.11520.pdf | 图1:使用通常的提示方法和我们提出的定向刺激提示的摘要任务所使用的时间比较。我们的DSP使用可调整的策略LM生成刺激,该刺激在此示例中是关键词,然后将LLM定向为提供更好的得分或其他指标(以蓝色突出显示)的所需摘要。 更准确地说,对于每个输入文本,一个微小的LM(称为策略LM)学习提供一系列离散的令牌作为指向性刺激,这些刺激可能提供有关输入样本的某些信息或指令,而不是作为工作的通用提示。为了将LLM的生成定向到所需的目标,例如更高的性能度量得分,然后将创建的刺激与原始输入混合并提供给LLM。他们最初使用具有预训练LM的监督微调(SFT),利用少量收集的训练样本。训练的目标是最大化奖励,定义为基于策略LM生成的刺激的LLM生成的下游性能度量得分。经过进一步的优化以探索更好的刺激,经过改进的LM在RL中初始化策略LM。 图1描述了摘要任务的一个示例。为了帮助LLM基于关键词生成所需的摘要,关键词充当刺激(提示)。可以使用ROUGE等评估指标分数对策略LM进行优化,以激励它提供指导LLM生成更好摘要的关键词。虽然LLMs具有出色的生成能力,但它们经常显示出不受欢迎的行为,需要对预期的生成特征和某些下游任务的方向进行细粒度的指导。这是他们提出的方法的基础。微小的策略LM可以作为指向性刺激生成一系列令牌,以向LLM提供样本级的细粒度指导,以实现预期的目标,但不能生成类似人类语言的文本。 与以往通过提示工程/优化来找到最佳提示的研究不同,RL提供了将优化对象(例如生成刺激的小型策略LM)与LLM生成定义的优化目标之间的自然桥梁。他们的方法试图为每个“问题”提供“提示”或“线索”。它还不同于鼓励LLM在解决推理任务时生成中间推理步骤的链式思维提示。他们的方法使用一个小的可调整模型来控制和引导LLM,并针对不仅有一个正确的“答案”的生成任务进行优化。他们在摘要和对话回复生成任务上评估了他们的框架。 创建刺激的小策略LM是一个优化的对象,但LLM的生成确定了优化目标。强化学习为弥合这个差距提供了简单的方法。与以前的研究不同,这次研究尝试通过使用提示工程或优化来澄清“问题”。他们的策略努力为每个“问题”提供“提示”或“线索”。此外,它与思维链提示不同,后者鼓励大脑在完成需要逻辑的任务时自行推理出中间步骤。他们的方法针对需要生成多个有效“响应”的任务,并采用一个简单可调的模型来调节和指导LLM。他们评估了他们的框架,用750M Flan-T5-large作为策略LM和175B Codex作为LLM进行测试。根据测试结果,当Codex依赖于经过调整的T5生成的指示时,其在下游任务上的性能显著提高。摘要应包含的关键词被用作摘要任务的指导刺激。使用从CNN/Daily Mail数据集中提取的2,000个样本训练的T5,Codex的性能已经提高了7.2%。 为了开发用于500个MultiWOZ数据集对话的目标回复背后的预期意义的对话行为,他们训练了策略LM。由于策略LM生成的对话行为,Codex的总分提高了52.5%。它的表现与先前使用完整训练数据(8438个对话)训练的系统一样好或更好。
Leave a CommentTag: Technology
表格经常被用于表示庞大而复杂的数据世界,并作为各种情境下数据驱动决策的基础,包括财务分析、供应链管理和医疗保健分析。利益相关者可以使用它来分析趋势、模式和关联,从而帮助他们做出明智的商业选择并优化流程和资源。数据科学家长期以来一直在使用复杂的Excel公式或自定义程序处理表格。因此,对于表格数据的更有效理解和解释需求迫切。大型语言模型 (LLM) 或生成预训练转换器 (GPT) 已经在自然语言处理中的语言数据挖掘范式上进行了革命性变革。 与这些研究保持一致,研究人员还探讨了语音和视觉等多种模态的广泛模型。它们生成类似于人类语音的文本的能力为处理表格数据开辟了新的途径。然而,由于两个原因,很难在表格领域使用标准的ChatGPT模型:(一)全局表格理解:众所周知,GPT具有令牌长度限制,使其难以扫描庞大的表格并理解其包含的信息;(二)它们的训练过程是为自然语言设计的,因此在处理表格数据时缺乏普适性。已经有几项工作用于包括自然语言的表格数据分析。 自然语言转SQL (NL2SQL) 是一个成熟的研究领域,它将自然语言转化为控制关系型数据库的SQL指令。为了使用各种电子表格软件功能,SheetCopilot最近研究了控制VBA (Visual Basic for Applications,一种嵌入式脚本语言,用于Microsoft Excel)的语言。然而,他们发现这两种选择都没有令人满意的表现。他们认为这些固有的非结构化计算机代码类型增加了复杂性,几乎不可能进行自动化后处理。浙江大学的研究人员在这项研究中创建了TableGPT,推动了使用LLM方法分析数据时可行性的极限。这是在使数据更易于访问和理解的过程中的重大进展。他们的TableGPT系统将表格、口头指令和普通语言结合为一个统一的GPT模型,提高了数据解释的用户友好性和直观性。 他们通过重新设想表格、口头语言和指令之间的交互方式,将许多关键元素融合到TableGPT中: • 全局表格表示:他们首次尝试创建表格的全局表示的学习范式,将整个表格编码为一个向量。他们使表格编码器能够通过同时对大量文本和表格数据进行LLM和编码器的训练,有效捕捉输入表格的全局信息。因此,由于LLM能够更好地看到和理解表格数据,提供了更全面和改进的对表格的理解。 • 指令链:他们使用这个概念来强调有组织、层次化任务执行的重要性。TableGPT遵循相同的指令顺序,将复杂的任务分解为简单的任务,并逐步执行,就像一个协调良好的组织,其中每个指令从更高级别级联到较低级别的相应指令。此外,它鼓励拒绝不明确或不合适的指令的能力,就像真正的数据科学家一样,而不是盲目地遵循任何可能不正确的指令,从而增强了人与LLM系统在数据科学环境中的交流。他们建议的指令集更易于使用,并减少了使用传统技术处理表格数据时常常出现的歧义。 • 领域感知微调:为了提高模型对特定领域表格数据的理解能力,领域感知微调包括调整训练,使模型生成包含给定领域中的类似风格和逻辑元素的文本。这促进了适应不同领域的表格和相应的文本材料的能力。还创建了一个数据处理流水线,使这种策略变得实用和可扩展。由NL2SQL生成的非结构化代码在实际生产环境中进行预先检查和错误修复带来了重大困难。因此,他们支持使用结构化的指令序列,使后处理更加容易。 Data-Copilot也采用了这种基于指令的方法,但它对本地LLM的依赖,用于直接理解表格数据的处理和分析逻辑,存在一些缺点。他们认为一个成功的解决方案应该专门为表格数据而设计,同时保持对更大规模下游活动的广泛适用性,这是由于表格数据的固有不可预测性和任务特定性。这种信念强调了为表格数据实施特别预训练的LLM的重要性。总之,本研究提出了一个具有开创性的TableGPT框架,这是一个全面、综合和自然语言驱动的解决方案,实现了有效的表格数据处理、分析和可视化。 他们列举了TableGPT的几个重要优点: • 以语言驱动的探索性数据分析(EDA):通过使用简洁的语言,TableGPT分析用户意图,细分所需行动,并在表格上执行外部命令。然后,将处理后的结果以表格和书面解释的形式提供给用户。由于这种创新技术,探索性数据分析(EDA)变得直观,使用户更容易与表格数据进行交互。…
Leave a Comment许多开源项目已经开发了全面的语言模型,可以进行特定任务的训练。这些模型可以对用户的问题和命令提供有用的回答。值得注意的例子包括基于LLaMA的Alpaca和Vicuna,以及基于Pythia的OpenAssistant和Dolly。 尽管每周都有新模型发布,但社区仍然在努力适当地对它们进行基准测试。由于LLM助手的问题通常含糊不清,创建一个可以自动评估其回答质量的基准测试系统是困难的。这里通常需要通过配对比较进行人工评估。基于配对比较的可伸缩、渐进和独特的基准测试系统是理想的。 当前的LLM基准测试系统中很少有满足所有这些要求的系统。像HELM和lm-evaluation-harness这样的经典LLM基准框架提供了研究标准任务的多指标测量。然而,它们并不很好地评估自由形式的问题,因为它们不是基于配对比较的。 LMSYS ORG是一个开发开放、可伸缩和易于访问的大型模型和系统的组织。他们的新工作提出了Chatbot Arena,这是一个众包LLM基准测试平台,具有匿名、随机对战的特点。与国际象棋和其他竞技游戏一样,Chatbot Arena采用了Elo评级系统。Elo评级系统在提供上述理想品质方面显示出潜力。 一周前,他们开放了与许多知名的开源LLM一起的竞技场,开始收集信息。可以在众包数据收集方法中看到LLM的一些真实应用示例。用户可以在竞技场中同时与两个匿名模型聊天,进行比较和对比。 FastChat,这个多模型服务系统,在https://arena.lmsys.org上托管了竞技场。进入竞技场的人将面对与两个无名模型的对话。当用户从两个模型那里接收到评论后,他们可以继续对话或者投票选择自己喜欢的模型。投票结束后,模型的身份将被揭示。用户可以继续与同样的两个匿名模型对话,也可以开始与两个新模型的新战斗。系统记录了所有用户的活动。只有在分析中使用了模型名称的时候,投票才会被隐藏。自一个星期前竞技场上线以来,已经统计了大约7000个合法的匿名投票。 未来,他们希望实现改进的抽样算法、锦标赛流程和服务系统,以适应更多样的模型,并为各种任务提供细粒度的排名。
Leave a Comment大型语言模型(LLM)的发展,例如OpenAI的ChatGPT和GPT-4,在自然语言处理、计算机视觉和生物医学等许多领域中重塑了人工智能。不幸的是,ChatGPT的训练细节和其变体的模型架构仍然未知。虽然LLaMA是一个开源的基础语言模型,但据推测,它在需要广泛领域知识的应用中表现不佳,是由于在模型预训练阶段缺乏领域特定数据引起的。 许多研究一直在讨论修改和使用开源LLM来实现专门目的。例如,Alpaca和Vicuna专注于通过训练模型以遵守自动创建的指令示例来扩展模型的交互能力。 上海交通大学和上海人工智能实验室最近的一项工作采用了一种不同的方法,将领域知识注入到单个预训练的LLaMA中,以将基础语言模型引导到医学专用语料库。他们介绍了PMC-LLaMA,这是一个公开可用的语言模型,通过在480万篇医学学术论文上对LLaMA-7B进行改进开发而成。团队认为,在医学讨论和咨询中,一个以医学为重点的基础语言模型会有更多的益处。 团队从S2ORC数据集开始,该数据集包含81.1M篇英文学术论文,并根据其PubMed Central(PMC)ID对其进行了排序。因此,约有490万篇论文,总计超过750亿个标记与医学知识高度相关。通过优化GPT2中首次提出的自回归生成目标,他们在这些免费的PMC论文上对LLaMA-7B模型进行了微调。他们采用bf16(脑浮点)数据格式和完全分片数据并行(FSDP)加速方法来加快学习过程。 团队通过对上述相关的医学问答数据集进行三种不同类型的微调来测试PMC-LLaMA:完全微调、参数高效微调和数据高效微调。实验结果表明,当微调指令调整时,PMC-LLaMA在医学领域中优于LLaMA和其他使用LLaMA微调指令训练的模型。 PMC-LLaMA的一个缺点是,这480万篇论文中并不包含每个标记,因为迄今为止他们只进行了五个时期的训练。在未来,他们计划逐步训练具有更多参数的PMC-LLaMA模型,持续训练PMC-LLaMA,并更新hugging face页面上的基础模型。
Leave a Comment科技巨头苹果正在推进备受期待的AI聊天机器人项目,暂定名为“AppleGPT”。这个革命性项目采用了由Google JAX提供支持的“Ajax”大型语言模型(LLM)框架,一直是公司内部严格保密的秘密。然而,消息人士透露,苹果正在努力开发这项尖端技术,并准备在不久的将来宣布重大的与AI相关的消息。让我们更多地了解苹果进军生成式AI的重要步骤。 还阅读:WWDC亮点:苹果实用的AI解决方案揭示 AppleGPT的崛起:一款正在崛起的AI奇迹 苹果一直在将AI技术融入其软件中取得进展。然而,它还未涉足生成式AI领域。代号为“AppleGPT”的聊天机器人将以其先进的语言模型和令人印象深刻的能力改变游戏规则。 还阅读:埃隆·马斯克的xAI挑战OpenAI的ChatGPT Ajax:AppleGPT智能背后的强大引擎 AppleGPT的核心是“Ajax”框架,这是一个强大的语言模型,使用Google JAX构建,旨在加快机器学习研究。这个尖端框架运行在Google Cloud上,并被苹果的多个团队利用。尽管公司对于隐私影响持谨慎态度,工程师们一直在内部探索这项技术,以优化其性能。 苹果的悄然追求:在众多竞争对手中脱颖而出 与Meta、微软和谷歌等其他科技巨头迅速向公众发布生成式AI产品不同,苹果在这一领域一直保持着一定的神秘感。有趣的是,苹果禁止员工使用ChatGPT,表明了对其自己的AI努力的高度保密。 还阅读:苹果的矛盾之举:在担心隐私问题后推广ChatGPT Siri的遗产与更远的未来:苹果的AI之旅 苹果进入AI领域的旅程始于其标志性语音助手Siri。尽管Siri在推广AI语音技术方面起到了重要作用,但批评人士认为它仍有改进的空间。鉴于此,苹果聘请了谷歌前高管John Giannandrea领导其AI和机器学习团队,表明了公司对推进其AI能力的坚定承诺。 蒂姆·库克的愿景:苹果对AI的看法 苹果首席执行官蒂姆·库克对AI技术的潜力表达了浓厚的兴趣。在最近的采访和财报电话会议中,库克强调AI是公司未来发展的重点。然而,他也承认需要解决与AI产品相关的一些挑战和关切。 还阅读:苹果CEO蒂姆·库克支持ChatGPT并讨论AI的未来 协作努力:面向所有人的LLM 为了提升对AI进展的可访问性,Meta和微软等公司已经合作,将他们的LLM提供给初创公司和研究人员。例如,Meta的LLM LLaMA 2将在微软的Azure平台上提供,而微软已将OpenAI GPT模型集成到其Bing搜索产品中。 还阅读:微软通过对Bing…
Leave a Comment文本到图像扩散模型通过使用数十亿个图像-文本对和有效的拓扑结构进行构建,展示了在以输入提供的文本合成高质量、逼真和多样化图片方面的惊人能力。它们还扩展到了几个应用领域,包括图像到图像的翻译、可控的创建和定制。这个领域最近的一个应用是能够通过使用模态特定的训练数据将其扩展到2D图片以外的其他复杂模态,而不改变扩散模型。本研究旨在解决使用预训练的文本到图像扩散模型的知识来挑战超出2D图片的高维视觉生成任务的挑战,同时利用模态特定的训练数据而不改变扩散模型。 他们从这样一个直觉开始,即许多复杂的视觉数据,包括电影和3D环境,可以被表示为具有特定模态一致性的图片集合。例如,一个3D场景是一组具有视图一致性的多视图帧,而电影是一组具有时间一致性的帧。不幸的是,因为他们的生成采样方法在利用图像扩散模型时没有考虑一致性,图像扩散模型没有能力保证合成或编辑一组图片的一致性。结果,当将图片扩散模型应用于这些复杂数据时,不考虑一致性,结果可能更连贯,如图1(分块裁剪)所示,可以清楚地看出照片被拼接在一起的地方。 图1:全景图片修改:上右侧的裁剪补丁上,Instruct-Pix2Pix会产生不规则的图片编辑。(第三行)即使有很高的引导比例y,带有多扩散的Instruct-Pix2Pix也会编辑出一张一致的图片,但对指令的忠实度稍低。第三行通过选择适当的引导比例,CSD-Edit提供了具有更高指令忠实度的一致图片编辑。 类似的行为也在视频编辑中被观察到。因此,随后的研究提出了采用图片扩散模型来解决视频特定的时间一致性问题。在这里,他们引起了一个名为评分蒸馏采样(SDS)的新策略的注意,该策略利用文本到图像扩散模型的丰富生成先验来优化任何可微分的算子。通过压缩学习到的扩散密度评分,SDS将生成采样的挑战框架为一个优化问题。虽然其他研究人员已经证明了SDS在使用神经辐射场先验从文本生成3D对象方面的有效性,该先验通过密度建模假设在3D空间中具有一致的几何结构,但尚未研究它在一致合成其他模态的视觉方面。 在这项研究中,来自KAIST和Google Research的作者提出了一种简单而高效的技术,称为协同评分蒸馏(CSD),该技术扩展了文本到图像扩散模型在可靠的视觉合成方面的潜力。他们方法的关键有两个方面:首先,他们使用斯坦变分梯度下降(SVGD)通过让多个样本共享从扩散模型中获得的信息来推广SDS,以实现样本间的一致性。其次,他们提供了CSD-Edit,一种将CSD与最近开发的指令引导图片扩散模型Instruct-Pix2Pix结合起来的强大技术,用于一致的视觉编辑。 他们使用各种应用程序,包括全景图片编辑、视频编辑和3D场景重建,来展示他们的方法的适应性。他们展示了CSD-alter如何通过最大化多个图片补丁来改变具有空间一致性的全景图像。此外,与之前的方法相比,他们的方法在指令准确性和源-目标图像一致性之间取得了更好的平衡。在视频编辑的实验中,CSD-Edit通过优化多个帧达到时间一致性,从而实现了时间帧一致的视频编辑。他们还使用CSD-Edit生成和编辑3D场景,促进了各种视点的统一性。
Leave a CommentChapyter由一群语言模型师开发,是一个新的Jupyter插件,可以集成ChatGPT,让用户创建Python笔记本。该系统还可以读取先前执行的单元格的结果。 Chapyter是JupyterLab的一个附加组件,可以无缝地将GPT-4集成到开发环境中。它有一个解释器,可以将自然语言编写的描述转换为可以自动执行的Python代码。Chapyter可以提高生产力,通过在首选的IDE中启用“自然语言编程”,让用户尝试新事物。 主要特点 从自然语言自动生成代码并执行。 基于过去的代码和之前执行的结果生成新代码。 实时代码纠正和错误修复。 自定义选项和完全可见的AI设置提示。 在使用尖端AI技术时注重隐私。 该库的提示和设置是公开的,研究人员正在努力简化这些问题和设置的自定义。Chapyter/programs.py是可以查看这些内容的位置。 请查看他们的API数据使用政策,以了解OpenAI如何处理训练数据。相比之下,每当使用Copilot或ChatGPT时,部分数据将被缓存并用于这些服务的训练和分析。Chapyter由两个主要部分组成:使用ipython魔法命令管理提示和使用该命令调用GPT-X模型。监视Chapyter单元格执行的用户界面将运行新创建的单元格并自动更新单元格样式。 许多程序员更喜欢以“碎片化”的方式在笔记本中工作,一次只写几行代码,然后转到下一个单元格。每个单元格的任务或目的相对较小,与相邻单元格的任务相互独立。后续工作可能与之前的工作没有太多共同之处。例如,在创建神经网络时添加数据集加载器需要不同的思考和编写代码的方式。不断在任务之间切换不仅效率低下,而且可能会令人精疲力尽。当用户想要键入“请以某种方式加载数据集以测试神经网络”时,可以使用该命令,让机器完成剩下的工作。 Chapyter的单元格级代码开发和自动执行可以解决这个问题。当用户创建一个新的单元格时,Chapyter会自动调用GPT-X模型根据他们编写的文本构建代码并运行。与像Copilot这样专注于支持仅涉及几行代码但与正在进行的工作高度相关的微任务(如完成函数调用)的系统不同,Chapyter旨在接管整个任务,其中一些可能与现有代码不同。 Chapyter是一个轻量级的Python工具,在本地安装后可以与JupyterLab完美集成。默认情况下,OpenAI API设置为在调用GPT-X模型后丢弃交互数据和代码。该库包含所有标准提示、“程序”和加载个性化提示的选项。通过分析以前的编码决策和运行时数据,Chapyter可以提供智能建议。如果需要,可以加载文件,并提供额外处理和分析的建议。 鉴于当今AI的局限性,Chapyter的生成代码易于调试和改进。 安装过程分为三个简单的步骤,可以在GitHub的https://github.com/chapyter/chapyter上找到更多信息。 不久之后,研究人员将发布对Chapyter的重大改进,使其在代码生成和执行方面更加灵活和安全。他们迫不及待地想要在一些最苛刻和复杂的实际编码任务上测试它,比如确保一个有300个单元格执行的Jupyter笔记本有所有所需的帮助。请尝试我们的工具,敬请期待进一步的改进,我们重视您的想法和意见。
Leave a Comment大型语言模型(LLMs)在每次更新和发布新版本时都越来越受欢迎。像BERT、GPT和PaLM这样的LLMs在自然语言处理和自然语言理解领域展示了巨大的能力。由OpenAI开发的著名聊天机器人ChatGPT基于GPT 3.5和GPT 4的变压器架构,并被超过一百万用户使用。由于它具有模仿人类特性,它引起了从研究人员和开发人员到学生的所有人的注意。它可以高效地生成独特的内容,像人类一样回答问题,总结长篇文字段落,完成代码示例,翻译语言等等。 ChatGPT已经证明在各种主题上向用户提供信息非常出色,使它们成为传统网页搜索和在线寻求他人帮助的潜在替代品。但是也存在一种限制,即如果用户继续私下与大规模语言模型进行互动,公开可访问的人类生成数据和知识资源的数量可能会大幅减少。这种开放数据的减少可能会使未来模型的训练数据变得困难,因为可能会有较少的免费可用信息。 为了进一步研究这个问题,一组研究人员对Stack Overflow上的活动进行了调查,以确定ChatGPT的发布如何影响开放数据的产生。Stack Overflow是一个著名的面向计算机程序员的问答网站,它是一个很好的案例研究,可以研究当存在多个语言模型时用户行为和贡献。该团队对如何随着ChatGPT等LLMs的普及而导致类似StackOverflow等网站上的内容大幅减少进行了深入研究。 经过评估,该团队得出了一些有趣的结论。与ChatGPT访问受限的中国和俄罗斯竞争对手以及类似的数学论坛相比,Stack Overflow的活动明显减少。团队预测,在OpenAI的ChatGPT发布后,Stack Overflow每周帖子数量将下降16%。同时,ChatGPT对减少Stack Overflow活动的影响随着时间的推移而增加,这表明随着用户对该模型的特性越来越熟悉,他们开始越来越多地依赖它获取信息,进一步限制了对该网站的贡献。 该团队得出了三个关键发现,具体如下。 减少的发布活动:ChatGPT发布后,Stack Overflow的帖子数量,即问题和答案的数量,减少了。使用差异法计算了活动减少并与其他四个问答平台进行了比较。ChatGPT发布后的六个月内,Stack Overflow的帖子活动量最初下降了约16%,然后增长到约25%。 帖子投票数没有改变 – 自ChatGPT发布以来,Stack Overflow上的帖子收到的投票数(包括赞成和反对)没有显着变化,尽管帖子活动有所下降,这表明ChatGPT不仅替代了低质量的帖子,还替代了高质量的文章。 对不同编程语言的影响:ChatGPT对Stack Overflow上讨论的各种编程语言产生了不同的影响。与全球网站平均水平相比,一些语言(如Python和JavaScript)的帖子活动减少得更为明显。帖子活动的相对下降也受到GitHub上编程语言的普及程度的影响。 作者总结了广泛使用LLMs和随之而来的远离Stack Overflow等网站可能会限制用户和未来模型从中学习的开放数据的数量的影响,并且尽管在解决某些编程问题方面可能会提高效率,但对于互联网上的知识的可访问性和共享以及AI生态系统的长期可持续性都会产生影响。
Leave a Comment随着最近技术的进步,像GPT-3和PaLM这样的大型语言模型在教育、内容创作、医疗保健、研究等领域展现出了非凡的生成能力。例如,这些大型语言模型对于作家来说尤其有用,可以帮助他们提升写作风格,对于初学者开发者来说,可以帮助他们生成样板代码等。此外,结合多个第三方API的可用性,大型语言模型在学生和医疗系统等多个面向消费者的系统中的广泛应用只增加了。然而,在这种情况下,系统的安全性成为一个基本问题,因为人们信任这些系统来处理敏感的个人信息。这就需要更清楚地了解大型语言模型的不同能力和限制。 然而,大多数以前的研究都集中在通过采用更先进和复杂的架构使大型语言模型更强大。尽管这项研究在很大程度上超越了自然语言处理社区,但也导致了对这些系统安全性的忽视。在这方面,普林斯顿大学和佐治亚理工学院的博士后学生与艾伦人工智能研究所(A2I)的研究人员合作,对OpenAI的革命性AI聊天机器人ChatGPT进行了毒性分析。研究人员评估了ChatGPT的超过50万次生成过程中的毒性,并发现当ChatGPT的系统参数设置为分配一个人物角色时,其毒性在各种话题上增加了数倍。例如,当ChatGPT的人物角色设置为拳击手“穆罕默德·阿里”时,其毒性几乎比默认设置增加了3倍。这特别令人担忧,因为ChatGPT目前被用作构建其他几种技术的基础,这些技术在进行系统级修改后可能会生成相同水平的毒性。因此,A2I研究人员和大学生所做的工作侧重于在分配不同角色时,对ChatGPT生成的毒性有更深入的了解。 ChatGPT API提供了一种功能,允许用户通过设置其系统参数来分配一个人物角色,从而通过影响ChatGPT的对话方式来设定对话的基调。对于他们的用例,研究人员精心挑选了来自不同背景和国家的90个人物角色,如企业家、政治家、记者等。这些人物角色被分配给ChatGPT,以分析其对大约128个关键实体(如性别、宗教、职业等)的回应。团队还要求ChatGPT继续完成关于这些实体的某些不完整的短语,以收集更多见解。最终的研究结果显示,给ChatGPT分配一个人物角色可能会使其毒性增加多达六倍,ChatGPT经常产生严厉的输出,并沉溺于负面刻板印象和信念。 团队的研究发现,ChatGPT输出的毒性根据所给予的人物角色而有显著差异,研究人员认为这是因为ChatGPT根据其训练数据对人物的理解。例如,一个发现表明,记者的毒性是商人的两倍,即使在实践中可能并非如此。研究还显示,特定的人群和实体比其他人更频繁地成为目标(几乎是三倍),这显示了该模型固有的歧视行为。例如,毒性根据人的性别而有所不同,比基于种族的毒性大约高出50%。这种波动趋势可能对用户造成损害,并对相关个体进行贬低。此外,恶意用户可以在ChatGPT上构建技术,生成可能伤害无辜观众的内容。 这项研究对ChatGPT的毒性进行的分析主要揭示了三个问题:当分配人物角色时,模型的毒性可以显著增加(比默认设置高出多达六倍);模型的毒性根据人物角色的身份而有很大差异,ChatGPT对人物角色的观点起着重要作用;ChatGPT可以通过对特定实体进行更具毒性的内容创作来歧视性地针对特定实体。研究人员还指出,尽管ChatGPT是他们实验中使用的大型语言模型,但他们的方法可以扩展到任何其他大型语言模型。团队希望他们的工作能激励人工智能社区开发出提供道德、安全和可靠的人工智能系统的技术。
Leave a Comment自监督表示学习是发展视觉基础技能的成功方法。这一研究方向的基础是利用大型未标记数据集作为补充的训练数据源,以提高下游网络性能并减少对大型标记目标数据集的需求。最近的研究表明,自监督在ImageNet上的预训练现在可以与或超过在多个下游数据集和任务上的有监督预训练,包括像素级语义和实例分割。 对比学习的变种是最受欢迎的自监督表示学习方法之一,其中目标骨干网络被训练为将图像的修改视图在潜在空间中映射得比从数据集中随机选择的图片更接近。这种范式可以通过添加空间损失并使用更少或没有负实例来改进。另一个研究领域专注于重建损失进行监督,或者称为遮蔽图模型(MIM),其中涉及对输入图像的某些区域进行遮蔽,并训练骨干网络重建这些部分。这项工作通常被认为是确定性的,这意味着它忽略了隐藏区域的多种可能性。 通常,这个研究领域探讨了架构设计、训练方法和遮蔽策略,以训练更好的骨干网络。当与基于Vision Transformer的骨干网络一起使用时,这些技术已经达到了最先进的性能;然而,最近还展示了稀疏CNN-based图像骨干的同样有效性。在这项研究中,作者提出了一种以生成模型作为表示学习器的方法,他们认为这个目标的简单性——生成数据——和直观的表征能力——生成高质量的样本——都表明学习到了语义上足够准确的内部表示。 使用生成网络作为表示学习器的想法并不陌生。在DatasetGAN及其派生工作中,建议使用StyleGAN或扩散模型的特征来补充与任务相关的头部,然后使用这些增强网络作为标记数据的源来训练后续网络。SemanticGAN则使用了带有额外任务解码器的StyleGAN作为任务网络本身,通过将图片编码成生成模型的潜在空间,并使用任务头部创建感知输出。在这项研究中,来自NVIDIA、多伦多大学、Vector研究所和麻省理工学院的研究人员引入了DreamTeacher,这是一个使用生成模型预训练基于蒸馏的下游感知模型的表示学习框架。 他们研究了两种不同的蒸馏过程:1)作为一种通用的无标签预训练过程,他们提供了特征蒸馏的技术,即将生成的特征降低到目标骨干。2)标签蒸馏:在半监督环境中,使用生成网络上的任务头将标记数据集中的知识蒸馏到目标骨干上。他们的工作选择了扩散模型和GAN作为生成模型。 他们集中研究了CNN作为目标骨干的原因有两个主要原因:1)已经证明基于CNN的骨干可以进行对比和MIM技术的最先进表示学习;2)最先进的生成模型(如GAN和扩散模型)仍然严重依赖CNN。他们还在早期试验中调查了Vision Transformer的骨干,但发现很难将基于CNN的生成模型的特征提取到Vision Transformer中。由于使用Vision Transformer架构创建的生成模型仍处于初级阶段,因此仍需要进一步研究使用这些设计的DreamTeacher。 他们通过实验证明,DreamTeacher在许多基准测试和条件下优于当前可用的自监督学习系统。当在没有任何标签的ImageNet上进行预训练时,他们的方法在包括ADE20K的语义分割、MSCOCO上的实例分割和自动驾驶数据集BDD100K上的任务上明显优于在ImageNet上进行完全监督的预训练方法。当仅在目标领域上进行训练时,他们的技术明显优于在带有标签监督的ImageNet上进行预训练的变种。它在数百万张无标签图片的以对象为重点的数据集上达到了新的最先进性能。这些发现证明了生成模型的潜力,特别是基于扩散的生成模型,作为能够高效利用各种无标签信息的表示学习器。
Leave a Comment在控制和增强学习领域中,测量过程非常具有挑战性。一个特别不足的领域是关注高维控制的鲁棒基准,特别是高维机器人技术的“挑战问题”:掌握双手多指控制。与此同时,控制和增强学习方面的一些基准努力已经开始聚合和探索不同的深度方面。尽管对模仿人手的灵巧性进行了数十年的研究,但机器人中的高维控制仍然是一个主要难题。 加州大学伯克利分校、谷歌、DeepMind、斯坦福大学和西蒙弗雷泽大学的一组研究人员提出了一个名为ROBOPIANIST的高维控制基准套件。在他们的工作中,双手模拟的人形机器人手被要求根据音乐谱面演奏各种歌曲,这些歌曲以音乐器件数字接口(MIDI)转录为条件。机器人手总共有44个执行器,每只手有22个执行器,类似于人手的轻度欠驱动。 演奏一首好歌需要能够以展示高维控制策略的许多特质的方式对动作进行排序。这些特质包括: 空间和时间的精确性。 两只手和十个手指的协调。 关键按键的战略计划,以使其他按键更容易。 原始ROBOPIANIST-repertoire-150基准包括150首歌曲,每首歌曲都是独立的虚拟作品。研究人员通过模型自由(RL)和模型基于(MPC)方法的全面实验来研究无模型和模型方法的性能范围。结果表明,尽管还有很大的改进空间,但提出的策略可以产生出色的表现。 策略学习一首歌曲的能力可以用来按难度对歌曲(即任务)进行排序。研究人员认为,根据这种标准对任务进行分组的能力可以鼓励在与机器人学习相关的各个领域进一步研究,例如课程和迁移学习。RoboPianist为各种学习方法提供了有趣的机会,例如模仿学习、多任务学习、零样本泛化和多模态(声音、视觉和触觉)学习。总的来说,ROBOPIANIST提供了一个简单的目标,一个易于复制的环境,清晰的评估标准,并且在未来有各种扩展潜力。
Leave a Comment机器学习模型需要对长篇文本进行编码,以用于各种自然语言处理任务,包括总结或回答关于长篇文档的问题。由于注意力成本随输入长度的增加呈二次增长,并且必须对每个输入标记应用前馈和投影层,使用Transformer模型处理长文本在计算上是昂贵的。近年来出现了几种“高效Transformer”策略,降低了对长输入的注意机制的开销。然而,前馈和投影层,尤其是对于更大的模型,承载着大部分的计算负载,并且可能使分析长输入变得不可能。本研究介绍了COLT5,这是一种新的模型系列,通过同时改进注意力和前馈层的架构,构建在LONGT5的基础上,实现对长输入的快速处理。 COLT5的基础是某些标记比其他标记更重要,并且通过为重要标记分配更多的计算资源,可以以较低的成本获得更高的质量。例如,COLT5将每个前馈层和每个注意力层分为轻量级分支和重量级分支,轻量级分支应用于所有标记,重量级分支用于选择特定输入和组件的重要标记。与常规的LONGT5相比,轻量级前馈分支的隐藏维度小于重量级前馈分支的隐藏维度。此外,随着文档长度的增加,重要标记的百分比会减少,从而实现对长文本的可管理处理。 图1:有条件计算的COLT5 Transformer层概述。 图1显示了COLT5条件机制的概述。由于COLT5的存在,LONGT5架构经历了两个进一步的变化。重量级注意力分支在一组精心选择的重要标记上执行完全的注意力,而轻量级注意力分支具有较少的头部并应用局部注意力。COLT5引入的多查询交叉注意力大大加速了推理。此外,COLT5使用UL2预训练目标,他们表明这可以实现对长输入的上下文学习。 来自Google Research的研究人员建议COLT5,这是一种用于处理远程输入的新型模型,利用有条件的计算来获得更好的性能和更快的处理速度。他们证明COLT5在arXiv摘要和TriviaQA问答数据集上优于LONGT5,在SCROLLS基准测试上达到了SOTA水平。COLT5针对“关注”标记的缩放不是线性的,大大提高了长输入任务的质量和性能。COLT5在相同或更好的模型质量下,进行微调和推理速度明显更快。COLT5中的轻量级前馈和注意力层适用于所有输入,而重量级分支只影响由学习路由器选择的一部分重要标记。他们证明COLT5在各种长输入数据集上优于LONGT5,并且能够成功高效地处理长达64k个标记的输入。
Leave a Comment近年来,人工智能(AI)的繁荣与AI能够更快地完成工作并减少努力有多大关系。现如今,几乎没有任何领域不使用AI。例如,从Amazon Echo和Google Home等语音助手中的AI代理到使用机器学习算法预测蛋白质结构,AI无处不在。因此,合理地相信与AI系统合作的人会做出比单独行动更优越的决策是合理的。但实际情况是否确实如此呢? 以往的研究表明,情况并非总是如此。在一些情况下,AI并不总是产生正确的反应,这些系统必须进行重新训练以纠正偏见或其他问题。然而,对人工智能决策团队有效性构成危险的另一个相关现象是AI过度依赖,即人们受到AI影响并经常接受不正确的决策而不验证AI的正确性。在进行诸如识别银行欺诈和提供医学诊断等关键和重要任务时,这可能非常有害。研究人员还表明,解释性人工智能并不能减少AI过度依赖问题,解释性人工智能是指AI模型在每一步解释为何做出某个决策而不仅仅提供预测。一些研究人员甚至声称,认知偏见或未校准的信任是过度依赖的根源,将过度依赖归因于人类认知的不可避免性。 然而,这些研究结果并未完全证实AI解释应该减少过度依赖的观点。为了进一步探索这一点,斯坦福大学人类中心人工智能(HAI)实验室的研究团队声称,人们在是否与AI解释进行交互方面是有策略选择的,表明在某些情况下,AI解释可以帮助人们减少过度依赖。根据他们的论文,当相关的AI解释比手头的任务容易理解,并且这样做有更大的利益(可以是财务奖励形式),个体更不可能依赖于AI的预测。他们还证明,当我们专注于与解释互动而不仅仅是让目标提供解释时,可以大大减少对AI的过度依赖。 该团队将这种策略性决策在成本收益框架中进行了测试。在这个框架中,主动参与任务的成本和效益与依赖AI的成本和效益进行了比较。他们邀请在线众包工人与AI合作解决三个不同复杂度的迷宫挑战。相应的AI模型提供答案,要么没有解释,要么提供了多个程度的解释,从下一步的单个指令到退出整个迷宫的逐步指导。试验结果表明,诸如任务难度和解释难度之类的成本以及货币补偿等利益大大影响了过度依赖。对于AI模型提供逐步指导的复杂任务,过度依赖并没有减少,因为解读生成的解释与独自解决迷宫一样具有挑战性。此外,当能够独立解决迷宫时,大多数解释对过度依赖没有影响。 该团队得出结论,如果手头的工作具有挑战性并且相关的解释清晰明了,它们可以帮助防止过度依赖。然而,当工作和解释都很困难或简单时,这些解释对过度依赖几乎没有影响。如果活动容易执行,那么解释并不重要,因为人们可以自己轻松地执行任务,而不是依赖解释生成结论。此外,当任务复杂时,人们有两个选择:要么手动完成任务,要么检查生成的AI解释,这些解释通常同样复杂。这主要是因为AI研究人员可用的解释工具很少,需要的验证工作比手动执行任务要少得多。因此,人们倾向于相信AI的判断而不质疑它或寻求解释,并不奇怪。 作为一项额外的实验,研究人员还将经济利益因素引入了方程式。他们向众包工人提供了独立完成不同难度的迷宫任务以获得一笔钱的选择,或者以较少的金钱换取AI的帮助,要么没有解释,要么提供复杂的逐步指导。研究结果显示,当任务具有挑战性时,工人更重视AI的帮助,并更喜欢简单明了的解释。此外,发现随着使用AI的长期好处增加(在本例中是财务奖励),过度依赖减少。 斯坦福研究人员对他们的发现寄予厚望,希望能给那些被事实解释不能减少过度依赖的学者们带来一些安慰。此外,他们希望通过提供引人入胜的论据,激励可解释的人工智能研究人员,以改进和简化人工智能的解释。 查看论文和斯坦福文章。此研究的所有荣誉归功于该项目的研究人员们。此外,请不要忘记加入我们的26k+ ML SubReddit、Discord Channel和Email Newsletter,我们在那里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 使用Tensorleap的可解释性平台揭示深度学习的秘密 这篇文章来源于MarkTechPost,介绍了斯坦福的一项新的人工智能研究,展示了解释如何在决策过程中减少对人工智能系统的过度依赖。
Leave a Comment“大型语言模型”已经被开发出来,可以根据输入预测自然语言内容。除了语言建模挑战,使用这些模型还提高了自然语言的性能。基于LLM的方法在医学任务中,如信息提取、问答和摘要中展示了益处。提示是LLM技术中使用的自然语言指令。这些指令集包括任务规范,预测必须遵守的规则,以及可选的任务输入和输出样本。 生成式语言模型根据以自然语言给出的指令产生结果,消除了对特定任务的训练要求,使非专家能够扩展这项技术。虽然许多任务可以表示为单一线索,但进一步的研究表明,将任务分割为较小的任务可能会提高任务性能,尤其是在医疗领域。它们支持一种替代策略,包括两个关键组成部分。它始于一个迭代过程,用于改进第一个产品。与条件链接相反,这使得生成可以整体上得到完善。其次,它有一个指导者,可以通过在每次重复中提出要集中注意的区域来进行引导,使过程更加可理解。 随着GPT-4的发展,他们现在可以使用一个丰富、逼真的对话式VoAGI。来自Curai Health的研究人员建议使用对话式解决代理或DERA。DERA是一个框架,用于研究如何通过对话解决的代理来提高自然语言任务的性能。他们认为,将每个对话代理分配给特定的角色将有助于他们专注于工作的某些方面,并确保他们的合作伙伴代理与整体目标保持一致。研究者代理人寻求与问题相关的相关数据,并提议其他代理人要集中注意的主题。 为了提高自然语言任务的性能,他们提供了DERA,这是一个代理-代理交互的框架。他们根据三个不同类别的临床任务评估DERA。为了回答每个问题,需要不同的文本输入和不同的专业水平。医疗对话摘要挑战旨在提供一个医生-患者对话的摘要,该摘要在事实上是正确的,没有幻觉或遗漏。创建护理计划需要大量的信息,并且有助于临床决策支持的冗长输出。Decider代理角色可以自由回应这些数据,并选择输出的最终行动方案。 该工作有多种解决方案,目标是尽可能地提供事实上正确和相关的材料。回答关于医学的问题是一项开放性任务,需要思考知识,并且只有一个可能的解决方案。他们使用两个问答数据集在这个更具挑战性的环境中进行研究。在两个人工注释评估中,他们发现DERA在护理计划创建和医疗对话摘要任务方面的表现优于基本的GPT-4。根据定量分析,DERA成功纠正了包含许多不准确信息的医疗对话摘要。 另一方面,他们发现在问答方面,GPT-4和DERA的表现几乎没有改进。根据他们的理论,这种方法在涉及许多细粒度特征的长篇生成问题上效果很好。他们将合作发布一个基于MedQA的新型开放性医学问答工作,其中包括美国医学执照考试的实践问题。这使得对建模和评估问答系统进行新的研究成为可能。推理链和其他特定任务的方法都是链策略的示例。 推理链技术鼓励模型像专家一样处理问题,从而提高某些任务的性能。所有这些方法都努力从基本语言模型中产生适当的生成结果。这种提示系统受限于预先确定的、具有特定目的的提示集,如编写解释或修复输出异常,这是该方法的一个基本限制。他们在这个方向上迈出了一大步,但将它们应用于现实世界的情况仍然是一个巨大的挑战。
Leave a Comment使用AI驱动的系统的原型一直以来都更加复杂。但是,在使用原型一段时间后,您可能会发现它可以更加功能强大。通过基本的编程理解和几个小时的时间,可以创建一个用于记录笔记的聊天机器人、一个用于从文本创建图像的编辑器以及一个用于总结客户评论的工具。 在实际世界中,机器学习(ML)系统可能存在社会偏见和安全问题。从行人检测模型中的种族偏见到特定医学图像的系统误分类,从业者和研究人员不断发现当前最先进模型的重大局限和失败。行为评估或测试常用于发现和验证模型的局限。了解子组或输入数据切片的模型输出模式超出了检查准确性或F1分数等聚合指标的范围。ML工程师、设计师和领域专家等利益相关者必须共同努力,确定模型的预期和潜在故障。 尽管进行行为评估非常重要,但实际操作仍然很困难。此外,许多流行的行为评估工具,如公平性工具包,不支持实际从业者通常处理的模型、数据或行为。从用户和利益相关者手动测试精选案例来评估模型并选择最佳部署版本是常见做法。在从业者熟悉将使用模型的产品或服务之前,经常会先创建模型。 了解机器学习模型在完成特定任务方面的表现如何是模型评估的难点。使用聚合指标只能大致估计模型的性能,就像智商测试只是对人类智能的粗略和不完美的衡量一样。例如,它们可能无法在自然语言处理系统中嵌入准确的语法,或者掩盖社会偏见等系统性缺陷。标准的测试方法是在数据子集上计算整体性能指标。 确定模型应具备哪些特征是行为评估领域的重要问题。在复杂的领域中,由于可能存在无休止的要求,测试需求列表将是不可能的。因此,ML工程师与领域专家和设计师合作,在迭代和部署之前描述模型的预期功能。用户通过与产品和服务的交互提供对模型的限制和预期行为的反馈,这些反馈随后被纳入未来的模型迭代中。 存在许多用于识别、验证和监控ML评估系统中模型行为的工具。这些工具利用数据转换和可视化揭示模型的公平性问题和边界情况等模式。Zeno与其他系统合作并结合其他方法。基于子组或切片的分析,即在数据集的子集上计算指标,是最接近Zeno的行为评估方法。Zeno现在允许针对任何领域或活动进行基于滑动和变形的测试。 Zeno由Python应用程序编程接口(API)和图形用户界面(GUI)组成。模型输出、指标、元数据和修改后的实例只是行为评估的基本组成部分之一,可以实现为Python API函数。API的输出是构建进行行为评估和测试的主界面的框架。Zeno有两个主要的前端视图:探索UI用于数据发现和切片创建,分析UI用于测试创建、报告创建和性能监控。 Zeno通过Python脚本向公众提供。编写的前端界面使用Svelte,使用Vega-Lite进行可视化和Arquero进行数据处理;该库包含在Python软件包中。用户在指定必要的设置(包括测试文件、数据路径和列名)后,可以从命令行启动Zeno的处理和界面。Zeno将UI作为URL端点托管的能力意味着它可以在本地或服务器上与其他计算一起部署,并且用户仍然可以从自己的设备访问它。该框架已经在包含数百万实例的数据集上进行了尝试和验证。因此,它应该能够很好地适应大规模的部署场景。 机器学习环境中存在许多框架和库,每个框架和库都专注于特定的数据或模型。Zeno在很大程度上依赖于基于Python的模型推理和数据处理API,可以进行定制。研究人员开发了Zeno的后端API作为一组Python装饰器方法,可以支持大多数现代ML模型,尽管大多数ML库都基于Python,因此存在相同的碎片化问题。 研究团队进行的案例研究显示,Zeno的API和用户界面的协同作用有助于从数据集和任务中发现重大的模型缺陷。从更广泛的意义上讲,研究结果表明,行为评估框架对于各种数据和模型类型都是有用的。 根据用户的需求和任务的难度,Zeno的各种功能使行为评估变得更简单、更快捷、更准确。在案例2中,参与者使用API的可扩展性创建了模型分析元数据。案例研究参与者报告称,将Zeno整合到他们现有的工作流程中并与Zeno API进行交互的难度很小或几乎没有。 约束和预防措施 了解哪些行为对最终用户来说是必要的并由模型编码是行为评估的一个主要难点。研究人员正在积极开发ZenoHub,这是一个协作仓库,用户可以在其中分享他们的Zeno函数,并更容易地找到相关的分析组件,以鼓励模型函数的重用,以支持发现。 Zeno的主要功能是定义和测试数据片段的度量标准,但该工具仅提供有限的网格和表格视图来显示数据和片段。通过支持各种强大的可视化方法,可以提高Zeno的实用性。用户可以通过编码语义相似性的实例视图(如DendroMap、Facets或AnchorViz)来发现数据中的模式和新行为。ML Cube、Neo和ConfusionFlow是Zeno可以修改以更好显示模型行为的一些ML性能可视化工具。 虽然Zeno的并行计算和缓存使其能够扩展到大型数据集,但机器学习数据集的大小正在迅速增加。因此,更多的改进将大大加快处理速度。使用像Ray这样的库在分布式计算集群中进行处理可能是未来的更新。 多个直方图在非常大的表格上进行交叉过滤是另一个障碍。Zeno可以采用像Falcon这样的优化方法,以便在大规模数据集上实现实时交叉过滤。 总结: 即使机器学习模型在训练数据上达到了很高的准确率,它在实际世界中仍然可能遭受系统性的失败,例如负面偏见和安全隐患。从某种意义上讲,从行为的角度对模型进行评估是从某些输入到模型输出的模型缺陷的识别和纠正。行为评估的重要性不言而喻,但也很困难,需要揭示现实世界中的模式,并验证系统性的失败。对机器学习的行为评估是识别和纠正问题模型行为的关键,包括偏见和安全问题。在这项研究中,作者深入探讨了机器学习评估的困难,并开发了一种在各种情境中对模型进行评分的通用方法。通过四个实际案例研究中,实践者对现实世界的模型进行了评估,研究人员展示了Zeno如何在多个领域中应用。 许多人对人工智能的发展抱有很高的期望。然而,他们的行为复杂性与他们的能力发展的速度相同。拥有强大的资源来促进基于行为的开发,并确保构建与人类价值观相协调的智能系统是至关重要的。Zeno是一个灵活的平台,允许用户在各种与人工智能相关的工作中进行这种深入的考察。
Leave a Comment大型语言模型(LLMs)正在迅速发展,并对经济和社会变革做出重要贡献。随着互联网上发布了许多人工智能(AI)工具,其中一个在过去几个月中非常受欢迎的工具是ChatGPT。ChatGPT是一种自然语言处理模型,允许用户生成像人类一样有意义的文本。OpenAI的ChatGPT基于GPT变压器架构,GPT-4是支撑它的最新语言模型。 随着最新的人工智能和机器学习发展,计算机视觉得到了指数级的提升,网络架构和大规模模型训练得到了改进。最近,一些研究人员引入了MM-REACT,这是一种将多个视觉专家与ChatGPT结合起来进行多模态推理和行动的系统范例。MM-REACT以更灵活的方式将各个视觉模型与语言模型结合起来,以克服复杂的视觉理解挑战。 MM-REACT的目标是处理现有视觉和视觉语言模型难以应对的各种复杂视觉任务。为此,MM-REACT使用提示设计来表示各种类型的信息,例如文本描述、文本化的空间坐标以及作为对齐文件名表示的密集视觉信号,如图像和视频。这种设计使ChatGPT能够接受和处理不同类型的信息与视觉输入相结合,从而实现更准确、全面的理解。 MM-REACT是一个将ChatGPT的能力与一组视觉专家相结合以增加多模态功能的系统。文件路径被用作占位符,并输入到ChatGPT中,以使系统能够接受图像作为输入。每当系统需要从图像中获取特定信息,例如识别名人姓名或框坐标时,ChatGPT会寻求特定视觉专家的帮助。专家的输出被序列化为文本,并与输入结合起来进一步激活ChatGPT。如果不需要外部专家,则直接将响应返回给用户。 通过向ChatGPT提示中添加与每个专家能力、输入参数类型和输出类型相关的特定指令,以及每个专家的一些上下文示例,使ChatGPT能够理解视觉专家的使用知识。此外,还指导使用正则表达式匹配来调用相应的专家。 通过实验,零-shot实验显示了MM-REACT如何有效地解决其特定的感兴趣的能力。它已经证明在解决需要复杂视觉理解的各种高级视觉任务方面非常高效。作者分享了一些例子,其中MM-REACT能够解决图像上显示的线性方程。此外,它还能够通过命名图像中的产品及其成分等来进行概念理解。总之,这种系统范例很好地结合了语言和视觉专业知识,并能够实现高级视觉智能。
Leave a Comment网络安全防御者必须根据技术发展和系统复杂性的提高动态调整他们的技术和策略。随着过去十年中机器学习(ML)和人工智能(AI)研究的进展,这些技术在各种与网络安全相关的领域中的使用案例也得到了发展。大多数现有安全应用程序中的一些功能性由在大量数据集上训练的强大的机器学习算法支持。其中一个例子是在早期的2010年代将ML算法集成到电子邮件安全网关中。 在实际情况下,创建自主的网络安全系统防御策略和行动建议是一项相当困难的任务。这是因为为此类网络安全系统防御机制提供决策支持需要同时考虑攻击者和防御者之间的动态特征以及系统状态的动态特征化。此外,网络安全防御者通常面临各种资源限制,包括与成本、劳动力和时间相关的限制。即使有了AI,开发一个能够主动防御的系统仍然是一个理想目标。 为了解决这个问题,美国能源部太平洋西北国家实验室(PNNL)的研究人员开发了一种基于深度强化学习(DRL)的新型AI系统,能够在模拟环境中响应攻击者,并能在攻击升级之前阻止95%的网络攻击。研究人员创建了一个自定义的模拟环境,展示了网络中攻击者和防御者之间的多阶段数字冲突。然后,他们使用强化学习的原则训练了四个DRL神经网络,例如根据避免妥协和减少网络中断来最大化奖励。该团队的工作还在华盛顿特区的人工智能促进协会上做了介绍,并获得了很高的评价。 该团队开发这样一个系统的理念是首先展示成功训练这样一个DRL架构是可能的。在深入研究复杂结构之前,他们希望展示有用的评估指标。研究人员首先使用Open AI Gym工具包创建了一个抽象的模拟环境。下一阶段是利用这个环境开发攻击者实体,在MITRE ATT&CK框架的15种方法和7种策略的子集上展示出技能和持久性水平。攻击者的目标是通过从初始访问和侦察阶段到其他攻击阶段直到达到其最终目标——影响和外泄阶段的七个攻击链步骤。 需要记住的是,团队并没有打算开发一个模型,在敌人在环境内发动攻击之前就能封锁敌人。相反,他们假设系统已经被入侵。然后,研究人员使用强化学习来训练四个神经网络。研究人员表示,在不使用强化学习的情况下训练这样一个模型是可以想象的,但需要很长时间来开发一个良好的机制。另一方面,深度强化学习通过模仿人类行为的某些方面,非常有效地利用了这个巨大的搜索空间。 研究人员努力证明AI系统能够在模拟攻击环境中成功训练,并展示出AI模型能够实时对攻击做出防御反应。为了对四个无模型DRL算法在实际的多阶段攻击序列中的表现进行严格评估,研究人员进行了多次实验。他们的研究表明,DRL算法可以在具有不同技能和持久性水平的多阶段攻击配置文件下进行训练,在模拟环境中产生有效的防御结果。
Leave a Comment随着互联网和社交媒体的兴起,虚假新闻和误导信息的传播已经成为一个令人担忧的问题。因此,为解决这个问题,已经进行了大量的实验。近年来,大型语言模型(LLMs)作为检测和分类此类误导信息的潜在解决方案引起了广泛关注。 为了解决这个在互联网驱动的世界中出现的虚假新闻和误导信息的问题,威斯康星州立大学的研究人员进行了广泛的研究和实验。他们的研究重点是测试最先进的语言模型(LLMs)的能力,以确定新闻文章的真实性并识别虚假新闻或误导信息。他们主要关注了四个LLM模型:Open AI的Chat GPT-3.0和Chat GPT-4.0,Google的Bard/LaMDA和Microsoft的Bing AI。 研究人员对这些知名的大型语言模型(LLMs)在检测虚假新闻方面的准确性进行了彻底的研究。通过严格的实验,他们评估了这些先进LLM在分析和评估新闻文章以及区分真实和不可信信息方面的能力。 他们的研究结果旨在为LLMs如何对抗误导信息提供有价值的见解,从而最终帮助创建一个更值得信赖的数字环境。研究人员表示,他们之所以选择研究这篇论文,是因为他们有必要了解各种LLMs在对抗误导信息方面的能力和限制。此外,他们还表示,他们的目标是通过控制模拟和已建立的事实核查机构作为基准,对这些模型在分类事实和误导信息方面的能力进行严格测试。 为了进行这项研究,研究团队选取了100个由独立事实核查机构核实的新闻报道样本,并将它们分为以下三类:真实、虚假和部分真实/虚假,然后对这些样本进行建模。其目标是评估模型在准确分类这些新闻项目方面的表现,与独立事实核查机构提供的经核实事实相比较。研究人员分析了模型在将适当的标签准确分类到新闻报道上方面的能力,将其与那些独立的事实核查员提供的事实信息相一致。 通过这项研究,研究人员发现Open AI的GPT-4.0表现最佳。研究人员表示,他们对主要LLMs进行了比较评估,以区分事实和欺骗,其中Open AI的GPT-4.0表现优于其他模型。 然而,这项研究强调,尽管这些LLMs取得了进展,但人类事实核查员在分类虚假新闻方面仍然胜过它们。研究人员强调,尽管GPT-4.0表现出有希望的结果,但仍有改进的空间,而且这些模型需要改进以达到最大的准确性。此外,如果将它们应用于事实核查,还可以将它们与人类代理的工作结合起来。 这表明,虽然技术在不断发展,但识别和验证误导信息这一复杂任务仍然具有挑战性,需要人类的参与和批判性思维。
Leave a CommentChatGPT ChatGPT能够在不依赖现有代码参考的情况下编写代码。此外,它能够高效地调试用户的代码。通过引入代码解释器,ChatGPT扩展了其功能,包括自我测试自身代码的能力。 Bard Google的Bard和ChatGPT一样,能够以对话方式进行交互,适用于编写和调试代码。 GitHub Copilot GitHub Copilot是一种由人工智能驱动的代码补全工具,它分析上下文代码并通过建议相关的代码片段提供实时反馈和推荐。 Tabnine Tabnine是一种基于人工智能的代码补全工具,它为GitHub Copilot提供了一种替代方案。它在提供全功能的人工智能代码补全能力方面独具专长。 Code Snippets AI Code Snippets允许用户将问题转化为代码。它是一个集成了代码解释、代码片段库等功能的多合一工具。 MutableAI MutableAI是开发人员经常使用模板代码并希望具有高效自动完成能力的理想选择。它提供代码补全功能以及将代码整理和归类到逻辑组中的能力。 Cogram Cogram是一种SQL代码生成工具,允许用户使用自然语言编写高效的SQL查询。 Amazon CodeWhisperer CodeWhisperer也是由AWS开发的代码补全工具,它可以根据注释和现有代码进行智能补全。 Replit Replit是一个以浏览器为基础的在线编码平台。它的一个功能是Ghostwriter,根据上下文提供相关的代码建议。…
Leave a Comment在计算机视觉中,寻找图像中的对象一直是一个长期存在的任务。目标检测算法尝试通过在对象周围绘制一个框来定位对象,而分割算法则试图以像素级精确确定对象的边界。图像分割旨在根据语义含义或视觉特征将图像分割成不同的区域或对象。它在各种应用中至关重要,包括对象识别、场景理解、自动驾驶、医学成像等。 多年来,已经开发了许多方法和算法来解决这个具有挑战性的问题。传统方法使用手工设计的特征,而最近的进展则带来了以深度学习模型驱动的模型。这些现代方法已经取得了显著的进展,实现了最先进的性能,并在图像理解和分析方面开启了新的可能性。 然而,这些模型存在根本的局限性。它们受限于训练集中看到的对象,并且无法分割剩余的对象。 然后出现了完全改变图像分割游戏的Segment Anything Model (SAM)。它是一个开创性的视觉模型,能够根据用户交互提示在图像中分割任何对象。它基于在广泛的SA-1B数据集上训练的Transformer架构构建,表现出了显著的性能,并开启了一个被称为Segment Anything的新颖有趣的任务。凭借其普适性和潜力,它有望成为未来视觉应用的基石。 然而,SAM并非完美无缺。这种力量是有代价的,对于SAM来说,代价就是复杂性。它计算上过于耗费资源,这使得在实际场景中应用它变得具有挑战性。与SAM架构的核心部分——Vision Transformers (ViTs)有关的计算资源要求是与Transformer模型相关的计算资源要求。 有没有办法让SAM更快?答案是肯定的,它被称为FastSAM。 FastSAM是为了满足SAM模型在工业应用中的高需求而提出的。它成功地提高了SAM的执行速度,并使其能够应用于实际场景。 FastSAM大大加速了SAM的速度。来源:https://arxiv.org/pdf/2306.12156.pdf FastSAM将segment anything任务分解为两个顺序阶段:全实例分割和提示引导选择。第一阶段使用基于卷积神经网络(CNN)的检测器为图像中的所有实例生成分割掩模。在第二阶段,它输出与用户提示相对应的感兴趣区域。利用CNN的计算效率,FastSAM展示了实时segment anything模型的可实现性,而不会牺牲性能质量。 FastSAM概览。来源:https://arxiv.org/pdf/2306.12156.pdf FastSAM基于YOLOv8-seg,这是一个配备了受YOLACT方法启发的实例分割分支的目标检测器。通过将这个CNN检测器训练在仅占SA-1B数据集2%的数据上,FastSAM在大大降低计算需求的同时,实现了与SAM相当的性能。该方法在多个下游分割任务中证明了其有效性,包括在MS COCO上的对象提议,其中FastSAM在提议数量为1000个时的平均召回上超过了SAM,并在单个NVIDIA RTX 3090上运行速度快了50倍。
Leave a Comment最近,基于扩散的大规模文本到图像(T2I)模型改变了创建可视材料的学科。这些T2I模型使得生成引人注目、表达丰富且以人为中心的图形变得简单。这些模型的一个有趣的用途是能够使用自然语言描述生成与身份相关的各种情境,给定一个特定人的日常生活中的面部(我们的家人,朋友等)。与图1中所示的典型T2I任务不同,身份重情境挑战要求模型在遵循文本提示的同时保持输入面部识别(即ID保留)。 图1展示了DreamIdentity如何有效地从单个面部图像中创建大量保留身份和文本连贯的图像,并且无需在测试时进行优化。 为每个面部身份个性化预训练的T2I模型是一种可行的方法。它涉及通过增强其词嵌入或微调模型参数来学习将特定词与实质相关联。由于每个身份的优化,这些基于优化的方法可能更有效。为了避免耗时的每个身份的优化,各种无优化的方法建议将从预训练图像编码器(通常为CLIP)获得的图像特征直接映射到词嵌入中。然而,这会损害ID保留。因此,这些技术面临着损害原始T2I模型的编辑能力的风险,因为它们要么需要微调预训练的T2I模型的参数,要么改变原始结构以注入额外的网格图像特征。 简而言之,所有并行的无优化努力都在维持身份和模型的可编辑性方面遇到困难。它们认为,错误的身份特征表示和训练与测试之间的目标不一致是现有无优化研究中上述困难的根本原因。一方面,目前最佳的CLIP模型在面部识别准确性方面仍然比面部识别模型差得多(80.95%对87.61%),这表明并行努力中使用的常见编码器(即CLIP)对于身份重情境化任务来说是不足够的。此外,CLIP的最后一层特征主要关注高级语义而不是精确的面部描述,无法保持识别信息。 所有并行任务使用原始重建目标来学习词嵌入都会对输入面部的可编辑性产生负面影响。为了解决上述身份保留和可编辑性困难,他们提供了一种独特的无优化框架(称为DreamIdentity),具有准确的身份表示和一致的训练/推理目标。更准确地说,在Vision Transformer的架构中创建了一个独特的多词多尺度ID编码器(M2 ID编码器),用于正确的身份表示。该编码器在大规模的面部数据集上进行预训练,并将多尺度特征投影到多词嵌入中。 中国科学技术大学和字节跳动的研究人员提出了一种新颖的自我增强可编辑性学习方法,将编辑任务移入训练阶段。该方法使用T2I模型通过生成名人面孔和各种目标编辑的名人图像来构建自我增强数据集。使用这个数据集来训练M2 ID编码器以提高模型的可编辑性。他们在这项工作中做出了以下贡献:他们认为,由于错误的表示和不一致的训练/推理目标,现有的无优化方法对于身份保留和高可编辑性是无效的。 从技术上讲,(1)他们提出了M2 ID编码器,这是一个具有多嵌入投影的ID感知多尺度特征,用于适当的表示。(2)他们结合自我增强的可编辑性学习,使底层T2I模型能够为编辑提供高质量的数据集,以实现一致的训练/推理目标。通过全面的研究证明了他们的方法的有效性,这些方法能够在保持身份的同时允许灵活的文本引导修改,即身份重情境化。
Leave a Comment无论所从事的行业如何,人工智能(AI)和机器学习(ML)技术一直试图改善人们的生活质量。近年来,AI的一个主要应用是设计和创建能够在各个领域完成决策任务的代理人。例如,像GPT-3和PaLM这样的大型语言模型以及像CLIP和Flamingo这样的视觉模型在各自领域的零-shot学习方面表现出色。然而,训练这种代理人存在一个主要缺点。这是因为这些代理人在训练过程中表现出了环境多样性的固有属性。简单来说,为不同的任务或环境进行训练需要使用各种状态空间,这有时会妨碍模型在领域之间的学习、知识传递和泛化能力。此外,对于基于强化学习(RL)的任务,创建特定任务在各种环境中的奖励函数变得困难。 为解决这个问题,来自Google Research的团队研究了这些工具是否可以用于构建更通用的代理人。在他们的研究中,团队特别关注了文本引导的图像合成,其中将以文本形式呈现的期望目标输入给规划器,规划器创建一系列代表预期行动的帧序列,然后从生成的视频中提取控制行动。因此,谷歌团队在最近的论文中提出了一种名为“通过文本引导的视频生成学习通用策略”的UniPi策略,解决了环境多样性和奖励规范化方面的挑战。UniPi策略使用文本作为任务描述的通用接口,使用视频作为在各种情况下传达行动和观察行为的通用接口。具体来说,团队将视频生成器设计为一个规划器,该规划器接受当前图像帧和陈述当前目标的文本提示作为输入,生成以图像序列或视频形式的轨迹。然后,将生成的视频输入到一个逆动力学模型中,该模型提取执行的底层动作。这种方法的独特之处在于它允许利用语言和视频的通用性在不同环境中进行目标和任务的泛化。 在过去的几年中,在文本引导的图像合成领域取得了重大进展,产生了具有生成复杂图像能力的模型。这进一步激发了团队选择这个作为他们的决策任务。谷歌研究人员提出的UniPi方法主要包括四个组成部分:通过平铺实现轨迹一致性、分层规划、灵活的行为调节和任务特定的行动适应,以下分别进行详细描述: 1. 通过平铺实现轨迹一致性: 现有的文本到视频方法通常会产生具有不断变化的基础环境状态的视频。然而,确保环境在所有时间戳上保持恒定对于构建准确的轨迹规划器至关重要。因此,为了在条件视频合成中保持环境一致性,研究人员在合成视频的每一帧中提供观察到的图像,同时去噪。为了在时间上保留底层环境状态,UniPi直接将每个噪声中间帧与条件观察到的图像在采样步骤上进行连接。 2. 分层规划: 在复杂和复杂的环境中进行计划时,生成所有必要的动作很困难,这需要很多时间和措施。规划方法通过利用自然层次结构在较小的空间中创建粗略计划,并将其改进为更详细的计划来克服这个问题。同样,在视频生成过程中,UniPi首先在粗粒度级别上创建演示所需代理行为的视频,然后通过填补缺失的帧并使其更流畅来改进视频的逼真程度。这是通过使用一系列步骤的层次结构来完成的,每个步骤都会提高视频质量,直到达到所需的详细级别。 3. 灵活的行为调节: 在为较小的目标规划一系列动作时,可以轻松地包括外部约束以修改生成的计划。这可以通过结合反映计划属性的期望限制的概率先验来实现。先验可以使用学习的分类器或特定图像上的Dirac delta分布来描述,以引导计划朝特定状态发展。这种方法也与UniPi兼容。研究人员使用视频扩散算法训练了文本条件视频生成模型。该算法包括来自Text-To-Text Transfer Transformer(T5)的编码预训练语言特征。 4. 任务特定的行动适应: 一个小的反向动力学模型被训练,用一组合成的视频将视频帧转化为低级控制动作。这个模型是独立于规划器的,并且可以在由模拟器生成的一个独立的较小数据集上进行训练。反向动力学模型接收输入帧和当前目标的文本描述,合成图像帧,并生成一系列动作来预测未来的步骤。然后,一个代理执行这些低级控制动作,使用闭环控制。 总结一下,谷歌的研究人员通过展示使用基于文本的视频生成来表示能够实现组合泛化、多任务学习和现实世界转移的策略的价值,做出了令人印象深刻的贡献。研究人员在一些新颖的基于语言的任务上评估了他们的方法,并得出结论:与其他基线模型(如Transformer BC、Trajectory Transformer和Diffuser)相比,UniPi在已知和未知的语言提示组合上都具有很好的泛化能力。这些令人鼓舞的发现突显了利用生成模型和大量可用数据作为创建多功能决策系统的有价值资源的潜力。
Leave a Comment从语义搜索到问答,再到利用OpenAI LLM进行生成搜索,这是使用Weaviate向量数据库可以做的三个例子
Leave a Comment自然语言处理是人工智能系统正在迅速取得进展的领域之一,重要的是,这些模型需要经过严格的测试和引导,以降低部署风险。此前,针对这类复杂系统的评估指标主要集中在衡量语言理解或推理能力。但现在,模型正在被教授进行实际的交互式工作。这意味着基准需要评估模型在社交环境中的表现。 交互式代理可以在基于文本的游戏中进行测试。为了在这些游戏中取得进展,代理需要具备规划能力和理解自然语言的能力。在制定基准时,应该同时考虑代理的不道德倾向和技术天赋。 加利福尼亚大学人工智能安全中心、卡内基梅隆大学和耶鲁大学的一项新研究提出了Measuring Agents’ Competence & Harmfulness In A Vast Environment of Long-horizon Language Interactions(MACHIAVELLI)基准。MACHIAVELLI是评估代理在自然社交环境中规划能力的一项进展。该设置受到了choiceofgames.com上的基于文本的选择你的冒险游戏的启发,这些游戏是由实际人类开发的。这些游戏涉及高级决策,同时为代理提供现实目标,同时抽象了低级环境交互。 该环境报告代理行为的不诚实程度、较低的效用和追求权力等行为特征,以便监控不道德行为。团队通过以下步骤实现这一目标: 将这些行为操作化为数学公式 在游戏中密集注释社交概念,例如角色的幸福感 使用注释和公式为每种行为产生一个数值分数。 他们通过实证研究表明,GPT-4(OpenAI,2023)在收集注释方面比人类标注员更有效。 人工智能代理面临与人类相同的内部冲突。例如,为下一个标记预测训练的语言模型通常会生成有毒文本,为目标优化训练的人工代理通常会表现出不道德和追求权力的行为。通过鼓励代理行事道德,可以改善这种权衡。 团队发现,道德训练(引导代理更具道德)降低了语言模型代理的有害活动发生率。此外,行为规范化在两种代理中都限制了不良行为,而不会显著减少奖励。这项工作有助于开发值得信赖的顺序决策者。 研究人员尝试使用人工良心和伦理提示来控制代理。代理可以被引导显示较少的马基雅维利行为,尽管仍有很大的改进空间。他们主张更多地研究这些权衡,并强调扩大帕累托前沿,而不是追逐有限的奖励。
Leave a CommentIGEL是针对文本的指令定制的德语大型语言模型。IGEL 001版本(Instruct-igel-001)是一个原始的概念验证,旨在确定是否可以通过将现有的开源模型与德语翻译指令数据集相结合来构建德语指令定制模型。 IGEL的第一个版本基于BigScience BLOOM,由Malte Ostendorff本地化为德语。IGEL旨在执行与自然语言理解相关的各种任务,包括情感分析、语言翻译和问题回答,在每个领域都具有高准确性和可靠性。 团队想要尝试LLM在德语指令建模任务中的表现如何。他们使用预训练的自定义BLOOM模型(6B)并使用基于翻译指令的数据集进行微调来实现这一目标。为了构建数据集,他们使用了一种称为自动翻译的方法将英语指令转化为德语。尽管由于这种策略存在较大的翻译错误的可能性,但他们的目标是确定模型是否仍然能够学习生成指令回复。 Instruct-igel-001中的LoRA定制BLOOM-CLP Deutsch(6.4B参数)具有用于Hugging Face Transformers的合并权重。在对naive翻译的指令数据集进行训练之前,并没有太多关注数据的清理、筛选或后处理。 团队提到,幻觉、有毒性和刻板印象只是instruct-igel-001存在的一些问题,这些问题在语言模型中很常见。他们计划完成聊天模型的开发,以创建一个对话界面。这将以超越传统的请求-响应方法的方式改善数据质量。
Leave a CommentAI图像生成器是人工智能的前沿应用,能够根据用户给定的某些参数或提示,创建独特、高质量的图像。通过机器学习算法和神经网络,这些生成器分析无数现有图像,以理解它们的结构、颜色、上下文等。然后利用这个庞大的知识库生成符合用户规格的新图像,这些图像具有细节丰富、逼真、与用户规格一致的特点。 AI图像生成器在各行各业中的角色 由于其便利性、高效性和创造力,AI图像生成器在许多行业中都得到了广泛应用。 数字营销 在数字营销领域,AI图像生成器是一种福音。市场营销人员现在可以在不需要专业设计师或摄影师的情况下创建定制视觉效果,从而节省时间和资源。它们为社交媒体、博客文章、广告等提供了快速创建引人注目视觉效果的方法,极大增强了在线参与度。 游戏和娱乐 游戏行业正在利用AI图像生成器的力量设计复杂的游戏环境、角色和道具。这些工具可以快速生成高质量的图形,从而减少开发时间和成本。 电子商务 AI图像生成器也正在彻底改变电子商务行业。它们可以在各种环境中创建产品图像,为客户提供更互动的购物体验。 AI图像生成器如何重新定义创造力 AI图像生成器正在重新定义创造力,并扩大创作者的可能性领域。它们为视觉组合提供了无限选择,鼓励人们进行实验和创新。用户可以提供描述或提示,AI将生成相应的图像,为将抽象概念具体化提供机会。 AI图像生成器的未来前景 AI图像生成器具有巨大的未来增长潜力。这项技术不断优化,以产生越来越逼真的图像。随着AI算法的改进,生成图像的精确度和复杂度也将提高。这些生成器可能很快用于创建高度逼真的不存在的人物、地点或物品的描绘,为虚拟现实、电影制作和室内设计等领域带来令人兴奋的可能性。 2023年最佳AI图像生成器 Shutterstock AI图像生成器 FotorAI图像生成器 Nightcafe Dream By Wombo DALL-E 2 Midjourney Dream…
Leave a Comment近年来,深度学习(DL)特别是生成对抗网络(GAN)在生成高度逼真和多样化的人脸方面取得了重大突破。这些人脸在现实中并不存在,但在视频游戏、化妆品行业和计算机辅助设计等领域有着广泛的应用。然而,当这些人工生成的人脸被滥用时,会带来重大的安全和伦理问题。 合成或虚假人脸的滥用可能导致严重的后果。例如,在美国选举中,曾经有人使用GAN生成的人脸图像创建虚假的社交媒体账号,快速传播针对特定群体的虚假信息。类似地,一名17岁的高中生通过一种名为StyleGAN2的强大生成模型成功欺骗Twitter,使其验证了一张美国国会候选人的虚假头像。这些事件凸显了滥用GAN生成的人脸图像可能带来的潜在风险,并突出了解决其安全和伦理问题的重要性。 为了解决GAN生成的虚假人脸问题,已经提出了几种方法来区分虚假的GAN生成人脸和真实的人脸。这些研究的结果表明,简单的有监督深度学习分类器通常在检测GAN生成图像方面非常有效。这些分类器通常被称为法证分类器或模型。 然而,一个聪明的攻击者可以使用对抗机器学习技术来操纵这些虚假图像,以逃避法证分类器的检测,同时保持高的视觉质量。最近的研究通过展示对生成模型的流形进行潜空间优化的对抗性探索,可以生成被针对性法证检测器错误分类的逼真人脸。此外,他们还表明,与在图像空间上施加约束的传统对抗攻击相比,由此产生的对抗性虚假人脸显示出更少的伪影。 然而,这项工作存在一个重大局限性。即它无法控制生成的对抗性人脸的属性,如肤色、表情或年龄。对于那些希望通过社交媒体平台迅速传播虚假宣传,特定针对某些族群或年龄群体的攻击者来说,控制这些人脸属性至关重要。 鉴于潜在的影响,图像取证研究人员必须深入研究和开发属性条件攻击。通过这样做,他们可以揭示现有法证人脸分类器的漏洞,并最终努力设计未来的有效防御机制。本文介绍的研究旨在解决对抗攻击中对属性控制的迫切需求,以确保全面了解漏洞并促进强大的对策的发展。 下面报告了所提出方法的概述。 提出了两种架构,一种与基于属性的生成相关,另一种与文本生成相关。无论是通过图像驱动还是通过文本引导,所提出的方法旨在生成逼真的对抗性虚假人脸,可以欺骗法证人脸检测器。该技术利用StyleGAN2的高度解缠空间,在统一框架内构建属性条件下的无约束攻击。 具体而言,引入了一种高效算法,通过对抗性优化属性特定的潜在变量来生成一个展示给定参考图像中属性的虚假人脸。这个过程有效地将参考图像中的所需粗细节转移到生成的虚假图像中。当进行基于图像的属性条件时,语义属性从提供的参考图像中转移到生成的虚假图像中。这是通过在引导感知损失的指导下在对抗空间中搜索来实现的,从而使所需属性转移到生成的虚假图像中。 此外,Contrastive Language-Image Pre-training(CLIP)的联合图像-文本表示能力被用于根据提供的文本描述生成虚假的人脸。这样可以强制生成的对抗性人脸图像与相应的文本描述保持一致。通过利用CLIP的文本引导特征空间,该方法在该特征空间中搜索对抗性潜在编码,从而生成与文本中描述的属性相符的虚假人脸。 本文展示了一些可用的结果。 这是一种生成逼真对抗性人脸以逃避法证分类器的新颖AI技术摘要。如果您对此工作感兴趣并想了解更多信息,可以通过下面的链接找到更多信息。
Leave a Comment目前,为定制应用实现大型语言模型(LLM)对于大多数个人来说非常困难。创建一个可以以高准确度和速度为专业领域生成内容或模仿写作风格的LLM需要大量时间和专业知识。 Stochastic拥有一支由明智的ML工程师、博士后和哈佛研究生组成的团队,致力于优化和加速LLMs的人工智能。他们推出了xTuring,这是一个开源解决方案,让用户只需三行代码即可创建自己的LLM。 自动化文本传递、聊天机器人、语言翻译和内容生成等应用是人们努力开发和创建具有这些概念的新应用的领域。对这些模型进行训练和微调可能耗时且昂贵。无论使用LLaMA、GPT-J、GPT-2还是其他方法,xTuring都可以轻松快速地进行模型优化。 xTuring作为单GPU或多GPU训练框架的多功能性意味着用户可以根据自己的特定硬件配置定制模型。xTuring使用内存高效的微调技术,如LoRA,加快学习过程,并将硬件支出减少多达90%。通过减少微调所需的内存量,LoRA促进了更快速和有效的模型训练。 xTuring的微调能力使用LLaMA 7B模型作为基准,并将xTuring与其他微调技术进行了比较。数据集包含52K个指令,测试时使用了335GB的CPU内存和4xA100 GPU。 结果表明,使用DeepSpeed + CPU卸载每个时期对LLaMA 7B模型进行21小时的训练时,GPU使用了33.5GB,CPU使用了190GB的内存。而使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载进行微调时,内存使用量分别降至23.7GB和21.9GB。CPU使用的RAM量从14.9GB降低到10.2GB。此外,使用LoRA + DeepSpeed或LoRA + DeepSpeed + CPU卸载时,训练时间从40分钟缩短到20分钟每个时期。 开始使用xTuring非常简单。该工具的用户界面设计简单易学易用。用户只需几次鼠标点击即可微调模型,剩下的工作由xTuring完成。由于其易用性,xTuring是初学者和有经验用户的理想选择。 团队表示,由于xTuring允许单GPU和多GPU训练,使用LoRA等内存高效方法,并具有直观的界面,因此它是调整大型语言模型的最佳选择。…
Leave a Comment