LLaMaTab – 一个具有洞察力的Chrome扩展 一个名为LLaMaTab New Tab的Chrome附加程序将在每次新建标签页时显示不同的羊驼图片。这是一个愚蠢的附加程序,但在事情变得困难时,它可以让人继续前行。如果你正在使用Chrome并希望为浏览体验注入个性和乐趣,LLaMaTab New Tab是一个绝佳的扩展。此外,它还是保持动力和完成任务的绝佳方法。如果你想让Chrome的体验更有趣,LLaMaTab New Tab扩展正是你所需要的。 LLaMaTab New Tab的优势 使用LLaMaTab New Tab扩展,将一些轻松的元素注入你的日常网络活动中。 你可以通过添加羊驼照片或从一个预先制作的图库中选择照片来自定义LLaMaTab New Tab。 LLaMaTab New Tab是一个轻量级的附加程序,不会影响浏览器的性能。 特点 由于附加程序的代码是公开的,可以轻松修改以提供新的功能。 该附加程序已经翻译成多种语言,让用户可以使用他们偏好的语言工作。…
Leave a CommentTag: Tech News
自从大规模图像-文本配对和复杂的生成模型拓扑结构(如扩散模型)的出现以来,生成模型在生成高保真度的二维图片方面取得了巨大的进展。这些模型通过允许用户根据文本提示创建逼真的视觉效果,消除了人工参与。与二维模型相比,由于三维学习模型的多样性和可访问性的不足,三维生成模型仍然面临着重大的问题。高质量的三维模型的可用性受到了软件引擎中繁琐且高度专业化的手动开发三维资产的限制。 研究人员最近研究了预训练的图像-文本生成方法,以创建高保真度的三维模型来解决这个问题。这些模型包括物品的几何和外观的详细先验知识,这可能会使创建逼真且多样化的三维模型变得更容易。在这项研究中,来自腾讯、南洋理工大学、复旦大学和浙江大学的研究人员提出了一种使用经过训练的文本到图像扩散模型创建三维风格化头像的独特方法,允许用户通过文本提示选择头像的风格和面部特征。他们选择使用基于 GAN 的 EG3D 三维生成网络,主要是因为它具有几个优点。 首先,EG3D 在训练时使用校准的照片而不是三维数据,这使得利用改进的图像数据不断增加三维模型的多样性和逼真度成为可能。对于二维照片来说,这个特性非常简单。其次,他们可以独立地生成每个视角,有效地控制图像生成过程中的随机性,因为用于训练的图像在外观上不需要严格的多视角一致性。他们的方法使用了基于 StableDiffusion 的 ControlNet,允许通过预定的姿势进行图片生成,为 EG3D 训练创建校准的二维训练图像。 通过从姿势照片中重复使用摄像机特征进行学习,这些姿势可以在当前引擎中合成或检索。即使在使用准确的姿势照片作为指导时,ControlNet 在创建大角度视角(如头部的背面)时经常遇到困难。这些失败的输出需要改进生成完整的三维模型。为了解决这个问题,他们采取了两种不同的方法。首先,他们为图片生成过程中的各个视角创建了特定于视角的提示,极大地减少了失败的发生次数。即使有特定于视角的提示,合成的照片可能只能部分匹配姿势照片。 为了解决这种不匹配的问题,他们为三维 GAN 训练创建了一个粗到精的姿势感知判别器。他们的系统中的每个图片数据都有一个粗略和精细的姿势注释。在 GAN 训练过程中,他们随机选择一个训练注释。对于自信的视角(如正面),他们有很大的机会选择好的姿势注释,但对于其它视角的学习更依赖于粗略的想法。即使输入的照片包含混乱的注释,这种方法也可以生成更准确和多样化的三维模型。此外,他们还在 StyleGAN 的潜在风格空间中创建了一个潜在扩散模型,以实现使用图像输入进行条件三维生成。 由于风格代码的低维度、高表现力和紧凑性,扩散模型的训练速度很快。他们直接从训练好的三维生成器中采样图像和风格代码配对来学习扩散模型。他们对许多大规模数据集进行了全面的测试,以评估他们提出的策略的有效性。研究结果显示,他们的方法在视觉质量和多样性方面超过了当前的尖端技术。总之,这项研究介绍了一种使用经过训练的图像-文本扩散模型生成高保真度的三维头像的独特方法。 他们的架构通过允许通过文本提示确定风格和面部特征,极大地增加了头像制作的灵活性。为了解决图像位置不匹配的问题,他们还提出了一个粗到精的姿势感知判别器,这将使带有错误姿势注释的图像数据更好地利用起来。最后,他们创建了一个额外的条件生成模块,可以在潜在风格空间中使用图像输入进行条件三维生成。这个模块进一步增加了框架的适应性,并允许用户创建符合自己口味的三维模型。他们还计划开源他们的代码。
Leave a Comment当大规模数据集上进行训练时,巨大的无监督语言模型获得了令其创造者惊讶的能力。然而,这些模型是根据具有各种动机、目标和能力的人们产生的信息进行训练的。并非所有这些雄心壮志和能力都可以模拟。从其庞大的信息和技能中精心选择模型的期望响应和行为,以创建可靠、有效和可管理的系统非常重要。 斯坦福大学和CZ研究人员在不使用显式奖励建模或强化学习的情况下,展示了如何优化语言模型以符合人类喜好。他们的工作表明,目前方法采用的基于强化学习的目标可以通过一个简单的二元交叉熵目标进行精确优化,从而大大简化了偏好学习过程,并展示了如何在实践中实现这一目标。 他们提出了直接偏好优化(DPO)算法。这个新算法隐式地实现了现有RLHF算法(通过KL散度约束的奖励最大化)的相同目标,但更容易构建和训练。虽然DPO更新在直觉上增加了首选回复与非首选回复的对数比率,但它还包括一个动态的、每个示例的重要性权重,使模型不会退化。 与其他算法一样,DPO使用理论偏好模型评估奖励函数与实证偏好数据的一致性。而传统方法是使用偏好模型定义一个偏好损失来训练奖励模型,DPO则是通过变量开关来训练最大化学习奖励模型的策略。因此,在训练过程中,DPO可以基于人类对模型响应的偏好数据集优化一个具有简单二元交叉熵目标的策略,而无需显式学习奖励函数或从策略中采样。 该研究结果表明,DPO在情感调节、摘要和对话等各种任务上,与PPO-based RLHF等最先进方法一样有效。58%的人更喜欢DPO摘要而不是PPO摘要(人类评估),并且61%的人更喜欢DPO摘要而不是测试集中的人类评估。在Anthropic HH上,60%的时间内,人们更倾向于选择DPO的单轮响应而不是选择性完成。 团队表示,DPO在仅基于人类喜好训练语言模型之外,还有许多潜在用途。例如,它可以训练各种模态的生成模型。 所提出的模型评估最高达到了60亿个参数,但团队认为进一步的工作应该探索将DPO扩展到具有数量级更大数据的最先进模型。研究人员还发现,提示对GPT-4的计算胜率有影响。未来,他们计划研究从机器中引导专家意见的最有效手段。
Leave a Comment人工智能领域最新的突破是大型语言模型(LLM)的引入。这些模型使我们能够更简洁地理解语言,从而更好地利用自然语言处理(NLP)和自然语言理解(NLU)。这些模型在包括文本摘要、问答、内容生成、语言翻译等各种任务上表现良好。它们能够理解复杂的文本提示,甚至能够理解带有推理和逻辑的文本,并识别数据之间的模式和关系。 尽管语言模型在各种任务中表现出色,并且在最近的发展中取得了显著进展,但它们仍然难以高效地通过API调用使用工具。即使是像GPT-4这样有名的LLM也难以生成精确的输入参数,并经常推荐不合适的API调用。为了解决这个问题,伯克利和微软研究人员提出了Gorilla,这是一个基于细调的LLaMA模型,它在生成API调用方面击败了GPT-4。Gorilla有助于选择合适的API,提高LLM与外部工具合作执行特定活动的能力。 研究团队还创建了一个名为APIBench的数据集,其中包含了大量重叠功能的API。该数据集是通过收集TorchHub、TensorHub和HuggingFace等公共模型库的ML API创建的。每个API都包含来自TorchHub和TensorHub的每个API请求,并选择HuggingFace每个任务类别的前20个模型。此外,他们使用自我指导方法为每个API生成了十个虚构的用户查询提示。 使用这个APIBench数据集和文档检索,研究人员对Gorilla进行了细调。这个70亿参数的模型在API功能的正确性和减少产生幻觉错误方面优于GPT-4。文档检索器与Gorilla的有效集成展示了LLM更精确使用工具的可能性。Gorilla的改进的API调用生成能力以及根据需要修改文档的能力提高了模型结果的适用性和可靠性。这一发展非常重要,因为它使LLM能够跟上定期更新的文档,为用户提供更准确和最新的信息。 研究人员分享的一个例子显示了Gorilla如何正确识别任务并提供经过充分确认的API结果。模型生成的API调用显示GPT-4为假想模型生成API请求,这表明它对任务的理解不足。Claude选择了错误的库,显示了无法识别正确资源的能力不足。相比之下,Gorilla正确识别了任务。因此,Gorilla与GPT-4和Claude不同,其API调用生成准确,既展示了其增强的性能,又展示了其任务理解能力。 总之,Gorilla是语言模型列表中的重要增加,因为它甚至解决了编写API调用的问题。它的能力能够减少与产生幻觉和可靠性相关的问题。
Leave a Comment随着OpenAI发布的全新GPT 4的问世,大型语言模型中引入了多模态。与之前的版本GPT 3.5不同,该版本不仅可以接受文本输入,还可以接受图像输入。最近,来自卡内基梅隆大学的研究团队提出了一种称为Generating Images with Large Language Models (GILL)的方法,该方法专注于扩展多模态语言模型以生成一些独特的图像。 GILL方法使得可以处理混合了图像和文本的输入,并生成文本、检索图像和创建新图像。尽管模型使用了不同的文本编码器,GILL通过将仅包含文本的冻结语言模型的输出嵌入空间转移到冻结的图像生成模型的嵌入空间来实现这一点。与需要交错图像-文本数据的其他方法不同,该映射是通过利用图像标题的配对来微调少量参数来完成的。 研究团队提到,该方法将已经训练好的用于冻结文本的大型语言模型与图像编码和解码模型相结合。它可以提供各种多模态功能,例如图像检索、独特图像生成和多模态对话。这是通过将模态的嵌入空间进行映射以进行融合来实现的。GILL可以处理混合图像和文本输入的条件,并生成既连贯又可读的输出。 该方法提供了一个有效的映射网络,将LLM与文本到图像生成模型相关联,以在图片生成方面获得出色的性能。该映射网络将隐藏的文本表示转换为视觉模型的嵌入空间。通过这样做,它利用了LLM强大的文本表示能力来生成具有美学一致性的输出。 通过这种方法,模型不仅可以从指定数据集中检索图像,还可以创建新的图像。模型在推理时选择是生成还是获取图像。该选择是基于LLM的隐藏表示条件的学习决策模块进行的。这种方法在计算上非常高效,因为它在训练时无需运行图像生成模型。 与基准生成模型相比,该方法在需要更长、更复杂的语言的任务中表现更好。相比之下,GILL在处理较长的文本(包括对话和篇章)方面优于稳定扩散方法。GILL在对话条件下的图像生成方面比非LLM基础的生成模型表现更好,从多模态上下文中受益,并生成更符合给定文本的图像。与仅处理文本输入的传统文本到图像模型不同,GILL还可以处理任意交错的图像-文本输入。 总之,Generating Images with Large Language Models (GILL)似乎比以前的多模态语言模型具有更广泛的能力。它在衡量上下文依赖性的各种文本到图像任务中优于非LLM基础的生成模型,使其成为多模态任务的强大解决方案。
Leave a Comment虽然扩散模型现在被认为是最先进的文本到图像生成模型,但它们已经成为一种“颠覆性技术”,具有以前从未听说过的能力,可以从文本提示中创建高质量、多样化的图片。尽管这一进展在改变用户如何创建数字内容方面具有重大潜力,但给用户对所创建材料的直观控制能力仍然是一个挑战。 目前,有两种调整扩散模型的技术:(i) 从头开始训练一个模型,或者(ii) 对现有的扩散模型进行微调以适应当前任务。即使在微调的情况下,由于模型和训练数据的不断增加,这种策略通常需要大量的计算和漫长的开发周期。而(ii) 重用已经训练过的模型,并增加一些受控的生成能力。一些技术先前专注于特定任务并创建了一种专门的方法。本研究旨在生成MultiDiffusion,这是一个新的、统一的框架,极大地提高了预先训练的(参考)扩散模型对受控图像生成的适应性。 图1:MultiDiffusion使得灵活的文本到图像生成成为可能,它统一了对所创建内容的许多控制,如所需的长宽比或基于粗略区域的文本提示。 MultiDiffusion的基本目标是设计一个新的生成过程,其中包含多个参考扩散生成过程,这些过程通过一组共同的特征或约束连接起来。生成结果的各个区域都经过参考扩散模型,该模型更具体地为每个区域预测去噪采样步骤。然后,MultiDiffusion执行全局去噪采样步骤,使用最小二乘最佳解来协调所有这些单独的阶段。例如,考虑使用在方形图像上训练的参考扩散模型创建具有任何长宽比的图片的挑战(见下图2)。 图2:MultiDiffusion:在预先训练的参考模型Φ上定义了一个新的生成过程Ψ。从噪声图像JT开始,每个生成步骤都会解决一个优化任务,其目标是每个裁剪Fi(Jt)尽可能接近其去噪版本Φ(Fi(Jt))。请注意,虽然每个去噪步骤Φ(Fi(Jt))可能朝着不同的方向拉动,但它们的过程将这些不一致的方向融合成一个全局去噪步骤Φ(Jt),从而产生高质量的无缝图像。 MultiDiffusion将参考模型在去噪过程的每个阶段提供的方形裁剪的去噪方向合并在一起。它尽可能地跟随它们,尽管受到共享像素的相邻裁剪的限制。尽管每个裁剪可能会在去噪时拉动到不同的方向,但应注意的是,他们的框架会产生一个单一的去噪阶段,从而产生高质量且无缝的图片。我们应该要求每个裁剪都代表参考模型的真实样本。 使用MultiDiffusion,他们可以将预先训练的参考文本到图像模型应用于各种任务,例如生成具有特定分辨率或长宽比的图片,或者从不可读的基于区域的文本提示生成图像,如图1所示。值得注意的是,他们的架构通过利用共享的开发过程同时解决了这两个任务。通过将其与相关基准进行比较,他们发现他们的方法在控制生成质量方面甚至可以达到最先进的水平,而无需增加计算负担。完整的代码库将很快在他们的Github页面上发布。您也可以在他们的项目页面上查看更多演示。
Leave a Comment近年来,周期性数据的识别和理解已经成为各种实际应用的重要组成部分,从监测天气模式到检测医疗环境中的关键生命体征。周期性学习在环境遥感等领域中已经证明是不可或缺的,可以准确预测天气变化和地表温度波动。同样,在医疗领域中,基于视频测量的周期性学习已经显示出在识别关键医疗状况(如心房颤动和睡眠呼吸暂停)方面取得了有希望的结果。 为了利用周期性学习的威力,研究人员开发了一些监督方法,如RepNet,可以识别单个视频中的重复活动。然而,这些方法需要大量的标记数据,通常资源密集且具有挑战性。这种限制促使研究人员探索自监督学习(SSL)方法,如SimCLR和MoCo v2,利用大量的无标签数据来捕捉周期性或准周期性的时间动力学。尽管它们在解决分类任务方面取得了成功,但是SSL方法在全面理解数据中固有的周期性和创建适用于周期性或频率属性的鲁棒表示方面存在困难。 为了应对这些挑战,谷歌研究人员引入了SimPer,这是一个专门设计用于学习数据中周期性信息的新颖自监督对比框架。该框架通过时间自对比学习利用周期性目标的时间属性,其中正样本和负样本来自相同输入实例的周期性不变和周期性变化的扩充。 为了在周期性学习的背景下明确定义相似度的测量,SimPer提出了一种独特的周期性特征相似性构建方法。该公式使模型能够在没有任何标记数据的情况下进行训练,并允许微调以将学到的特征映射到特定的频率值。研究人员为无标签输入设计了伪速度或频率标签,即使原始频率未知,也使SimPer在实际应用中具有很高的适应性。 传统的相似度度量(如余弦相似度)强调特征向量之间的严格接近性,导致对于具有索引位移、反转特征和频率变化的特征敏感。然而,周期性特征相似性侧重于对于具有轻微时间位移或反向索引的样本保持高相似度,同时在特征频率变化时捕捉连续的相似度变化。这通过频域中的相似度度量实现,比如两个傅里叶变换之间的距离。 为了进一步提高框架的性能,研究人员设计了一个广义对比损失,将经典的InfoNCE损失扩展为软回归变体。这使得SimPer适用于连续标签(频率)上的对比,并使其适用于回归任务,其中目标是恢复连续信号,如心跳。 SimPer的评估结果显示,在六个不同的周期性学习数据集上,它相比包括SimCLR、MoCo v2、BYOL和CVRL在内的最先进的SSL方案表现出更高的性能。这些数据集涵盖了人类行为分析、环境遥感和医疗等各种实际任务。SimPer胜过现有方法,并展现出出色的数据效率、对假相关性的鲁棒性以及对未见目标的泛化能力。 凭借对周期信号学习强大特征表示的直观灵活方法,SimPer在从环境遥感到医疗等多个领域具有广泛的应用前景。SimPer能够在没有大量标记数据的情况下准确捕捉周期模式,使其成为解决各种领域复杂挑战的理想解决方案。 总之,SimPer的自监督对比框架为周期性学习这一关键任务提供了突破性的解决方案。通过利用时间自对比学习和引入新颖的周期特征相似性和广义对比损失,SimPer为实际应用中更高效、准确和鲁棒的周期性学习应用铺平了道路。随着SimPer代码库向研究社区的提供,我们期待进一步的进展和在各个领域中更广泛的应用。
Leave a Comment生成模型领域近年来对视觉合成产生了浓厚的兴趣。之前的工作已经可以实现高质量的图像生成。然而,与照片相比,视频的持续时间在实际应用中面临更大的困难。一部特技电影的平均播放时间超过90分钟,一部动画片的平均长度为30分钟。TikTok或其他类似应用上的视频理想长度为21至34秒。 微软的研究团队开发了一种创新的架构用于制作长视频。现有的大多数工作是按照片段的顺序逐个生成长电影,这通常导致在短片训练和推断大视频之间存在差距。顺序生成可能更加高效。这种新颖的方法采用了一种由粗到细的过程,在相同的粒度上同时生成视频;首先应用全局扩散模型生成范围广泛的关键帧,然后使用局部扩散模型迭代地填充相邻帧之间的内容。通过直接在长电影上进行训练,可以缩小训练和推断之间的差距,并且可以使用这种简单但成功的方法同时生成所有部分。 最重要的贡献如下: 研究团队提出了“扩散过扩散”架构NUWA-XL,将长视频的创建视为一种革命性的“由粗到细”的过程。 NUWA-XL是第一个直接训练在长电影(3376帧)上的模型,弥合了生成这种视频的训练和推断之间的差距。 NUWA-XL实现了并行推断,大大缩短了生成长视频所需的时间。在生成1024帧的情况下,NUWA-XL将推断加速了94.26%。 为了确保模型的有效性并为扩展视频创作提供标准,FlintstonesHD的研究团队创建了一个名为FlintstonesHD的新数据集。 方法 时间KLVAE(T-KLVAE) KLVAE将输入图像转换为低维潜在表示,在应用扩散过程之前,以避免直接在像素上训练和采样扩散模型的计算负担。研究人员通过增加原始空间模块与外部时间卷积和注意力层来提出时间KLVAE(T-KLVAE),以将预训练的图像KLVAE的表面知识转移到视频中。 时间掩蔽扩散(MTD) 作为提出的扩散过扩散架构的基础扩散模型,研究人员提出了时间掩蔽扩散(MTD)。虽然电影的“粗糙”故事情节仅由L个提示组成,用于全局扩散,但开头和最后的帧也被用作局部扩散的输入。建议的MTD兼容全局和局部扩散,并且可以接受具有或不具有开头和最后帧的输入条件。接下来,他们在使用UpBlock来说明各种输入条件融合之前,完整地阐述了MTD的流程。 尽管提出的NUWA-XL提高了扩展视频创建的质量并加快了推断速度,但仍存在一些限制:首先,研究人员只验证了NUWA-XL在公开可用的Flintstones卡通上的有效性,因为尚不清楚开放域长视频(如电影和电视剧集)。他们希望通过在创建开放域长视频数据集的初步成功后,最终将NUWA-XL扩展到开放域。其次,通过在长电影上进行直接训练,可以缩小训练和推断之间的差距,但这对于数据来说是一个巨大的障碍。最后,尽管NUWA-XL可以加速推断,但这种改进需要强大的图形处理单元(GPU)来实现并行推断。 研究人员提出了NUWA-XL,一种“扩散过扩散”架构,将创建长视频视为一种非传统的“由粗到细”的过程。NUWA-XL是第一个直接训练在长电影(3376帧)上的模型,弥合了长视频制作中的训练和推断之间的差距。NUWA-XL支持并行推断,可以在生成1024帧的同时将长视频的创建速度加快94.26%。为了进一步验证模型的有效性并为扩展视频创作提供基准,他们构建了一个名为FlintstonesHD的新数据集。
Leave a Comment自然语言处理(NLP)近年来发生了一次范式转变,引入了大型语言模型(LLMs),在各种NLP任务中表现优于之前相对较小的语言模型(LMs),如GPT-2和T5 Raffel等。提示是使用LLMs执行各种任务的事实上的方法,通过使用上下文中的自然语言指令引导LLMs生成所需的输出,而无需对参数进行更新,与传统的微调范式相反,其中LMs的参数可以针对每个下游任务进行更新。 虽然这种提示模式使得LLMs在零射击或少射击环境中在各种任务上表现出色,但它们在某些特定的下游任务上的表现仍然需要改进,并且需要额外的细化,尤其在训练数据可用的情况下。然而,由于大多数LLMs只提供黑盒推理API并且微调成本高昂,大多数用户和学者无法直接优化这些LLMs。因此,必须解决的一个困难问题是如何有效地提高LLMs在特定下游任务上的性能,有时只有有限的训练实例。来自加利福尼亚大学圣巴巴拉分校和微软的一项新研究提出了使用微小可调整LM(RL)增强冻结的黑盒LLM在下游任务上的架构,称为定向刺激提示(DSP)。 来源:https://arxiv.org/pdf/2302.11520.pdf | 图1:使用通常的提示方法和我们提出的定向刺激提示的摘要任务所使用的时间比较。我们的DSP使用可调整的策略LM生成刺激,该刺激在此示例中是关键词,然后将LLM定向为提供更好的得分或其他指标(以蓝色突出显示)的所需摘要。 更准确地说,对于每个输入文本,一个微小的LM(称为策略LM)学习提供一系列离散的令牌作为指向性刺激,这些刺激可能提供有关输入样本的某些信息或指令,而不是作为工作的通用提示。为了将LLM的生成定向到所需的目标,例如更高的性能度量得分,然后将创建的刺激与原始输入混合并提供给LLM。他们最初使用具有预训练LM的监督微调(SFT),利用少量收集的训练样本。训练的目标是最大化奖励,定义为基于策略LM生成的刺激的LLM生成的下游性能度量得分。经过进一步的优化以探索更好的刺激,经过改进的LM在RL中初始化策略LM。 图1描述了摘要任务的一个示例。为了帮助LLM基于关键词生成所需的摘要,关键词充当刺激(提示)。可以使用ROUGE等评估指标分数对策略LM进行优化,以激励它提供指导LLM生成更好摘要的关键词。虽然LLMs具有出色的生成能力,但它们经常显示出不受欢迎的行为,需要对预期的生成特征和某些下游任务的方向进行细粒度的指导。这是他们提出的方法的基础。微小的策略LM可以作为指向性刺激生成一系列令牌,以向LLM提供样本级的细粒度指导,以实现预期的目标,但不能生成类似人类语言的文本。 与以往通过提示工程/优化来找到最佳提示的研究不同,RL提供了将优化对象(例如生成刺激的小型策略LM)与LLM生成定义的优化目标之间的自然桥梁。他们的方法试图为每个“问题”提供“提示”或“线索”。它还不同于鼓励LLM在解决推理任务时生成中间推理步骤的链式思维提示。他们的方法使用一个小的可调整模型来控制和引导LLM,并针对不仅有一个正确的“答案”的生成任务进行优化。他们在摘要和对话回复生成任务上评估了他们的框架。 创建刺激的小策略LM是一个优化的对象,但LLM的生成确定了优化目标。强化学习为弥合这个差距提供了简单的方法。与以前的研究不同,这次研究尝试通过使用提示工程或优化来澄清“问题”。他们的策略努力为每个“问题”提供“提示”或“线索”。此外,它与思维链提示不同,后者鼓励大脑在完成需要逻辑的任务时自行推理出中间步骤。他们的方法针对需要生成多个有效“响应”的任务,并采用一个简单可调的模型来调节和指导LLM。他们评估了他们的框架,用750M Flan-T5-large作为策略LM和175B Codex作为LLM进行测试。根据测试结果,当Codex依赖于经过调整的T5生成的指示时,其在下游任务上的性能显著提高。摘要应包含的关键词被用作摘要任务的指导刺激。使用从CNN/Daily Mail数据集中提取的2,000个样本训练的T5,Codex的性能已经提高了7.2%。 为了开发用于500个MultiWOZ数据集对话的目标回复背后的预期意义的对话行为,他们训练了策略LM。由于策略LM生成的对话行为,Codex的总分提高了52.5%。它的表现与先前使用完整训练数据(8438个对话)训练的系统一样好或更好。
Leave a Comment表格经常被用于表示庞大而复杂的数据世界,并作为各种情境下数据驱动决策的基础,包括财务分析、供应链管理和医疗保健分析。利益相关者可以使用它来分析趋势、模式和关联,从而帮助他们做出明智的商业选择并优化流程和资源。数据科学家长期以来一直在使用复杂的Excel公式或自定义程序处理表格。因此,对于表格数据的更有效理解和解释需求迫切。大型语言模型 (LLM) 或生成预训练转换器 (GPT) 已经在自然语言处理中的语言数据挖掘范式上进行了革命性变革。 与这些研究保持一致,研究人员还探讨了语音和视觉等多种模态的广泛模型。它们生成类似于人类语音的文本的能力为处理表格数据开辟了新的途径。然而,由于两个原因,很难在表格领域使用标准的ChatGPT模型:(一)全局表格理解:众所周知,GPT具有令牌长度限制,使其难以扫描庞大的表格并理解其包含的信息;(二)它们的训练过程是为自然语言设计的,因此在处理表格数据时缺乏普适性。已经有几项工作用于包括自然语言的表格数据分析。 自然语言转SQL (NL2SQL) 是一个成熟的研究领域,它将自然语言转化为控制关系型数据库的SQL指令。为了使用各种电子表格软件功能,SheetCopilot最近研究了控制VBA (Visual Basic for Applications,一种嵌入式脚本语言,用于Microsoft Excel)的语言。然而,他们发现这两种选择都没有令人满意的表现。他们认为这些固有的非结构化计算机代码类型增加了复杂性,几乎不可能进行自动化后处理。浙江大学的研究人员在这项研究中创建了TableGPT,推动了使用LLM方法分析数据时可行性的极限。这是在使数据更易于访问和理解的过程中的重大进展。他们的TableGPT系统将表格、口头指令和普通语言结合为一个统一的GPT模型,提高了数据解释的用户友好性和直观性。 他们通过重新设想表格、口头语言和指令之间的交互方式,将许多关键元素融合到TableGPT中: • 全局表格表示:他们首次尝试创建表格的全局表示的学习范式,将整个表格编码为一个向量。他们使表格编码器能够通过同时对大量文本和表格数据进行LLM和编码器的训练,有效捕捉输入表格的全局信息。因此,由于LLM能够更好地看到和理解表格数据,提供了更全面和改进的对表格的理解。 • 指令链:他们使用这个概念来强调有组织、层次化任务执行的重要性。TableGPT遵循相同的指令顺序,将复杂的任务分解为简单的任务,并逐步执行,就像一个协调良好的组织,其中每个指令从更高级别级联到较低级别的相应指令。此外,它鼓励拒绝不明确或不合适的指令的能力,就像真正的数据科学家一样,而不是盲目地遵循任何可能不正确的指令,从而增强了人与LLM系统在数据科学环境中的交流。他们建议的指令集更易于使用,并减少了使用传统技术处理表格数据时常常出现的歧义。 • 领域感知微调:为了提高模型对特定领域表格数据的理解能力,领域感知微调包括调整训练,使模型生成包含给定领域中的类似风格和逻辑元素的文本。这促进了适应不同领域的表格和相应的文本材料的能力。还创建了一个数据处理流水线,使这种策略变得实用和可扩展。由NL2SQL生成的非结构化代码在实际生产环境中进行预先检查和错误修复带来了重大困难。因此,他们支持使用结构化的指令序列,使后处理更加容易。 Data-Copilot也采用了这种基于指令的方法,但它对本地LLM的依赖,用于直接理解表格数据的处理和分析逻辑,存在一些缺点。他们认为一个成功的解决方案应该专门为表格数据而设计,同时保持对更大规模下游活动的广泛适用性,这是由于表格数据的固有不可预测性和任务特定性。这种信念强调了为表格数据实施特别预训练的LLM的重要性。总之,本研究提出了一个具有开创性的TableGPT框架,这是一个全面、综合和自然语言驱动的解决方案,实现了有效的表格数据处理、分析和可视化。 他们列举了TableGPT的几个重要优点: • 以语言驱动的探索性数据分析(EDA):通过使用简洁的语言,TableGPT分析用户意图,细分所需行动,并在表格上执行外部命令。然后,将处理后的结果以表格和书面解释的形式提供给用户。由于这种创新技术,探索性数据分析(EDA)变得直观,使用户更容易与表格数据进行交互。…
Leave a Comment许多开源项目已经开发了全面的语言模型,可以进行特定任务的训练。这些模型可以对用户的问题和命令提供有用的回答。值得注意的例子包括基于LLaMA的Alpaca和Vicuna,以及基于Pythia的OpenAssistant和Dolly。 尽管每周都有新模型发布,但社区仍然在努力适当地对它们进行基准测试。由于LLM助手的问题通常含糊不清,创建一个可以自动评估其回答质量的基准测试系统是困难的。这里通常需要通过配对比较进行人工评估。基于配对比较的可伸缩、渐进和独特的基准测试系统是理想的。 当前的LLM基准测试系统中很少有满足所有这些要求的系统。像HELM和lm-evaluation-harness这样的经典LLM基准框架提供了研究标准任务的多指标测量。然而,它们并不很好地评估自由形式的问题,因为它们不是基于配对比较的。 LMSYS ORG是一个开发开放、可伸缩和易于访问的大型模型和系统的组织。他们的新工作提出了Chatbot Arena,这是一个众包LLM基准测试平台,具有匿名、随机对战的特点。与国际象棋和其他竞技游戏一样,Chatbot Arena采用了Elo评级系统。Elo评级系统在提供上述理想品质方面显示出潜力。 一周前,他们开放了与许多知名的开源LLM一起的竞技场,开始收集信息。可以在众包数据收集方法中看到LLM的一些真实应用示例。用户可以在竞技场中同时与两个匿名模型聊天,进行比较和对比。 FastChat,这个多模型服务系统,在https://arena.lmsys.org上托管了竞技场。进入竞技场的人将面对与两个无名模型的对话。当用户从两个模型那里接收到评论后,他们可以继续对话或者投票选择自己喜欢的模型。投票结束后,模型的身份将被揭示。用户可以继续与同样的两个匿名模型对话,也可以开始与两个新模型的新战斗。系统记录了所有用户的活动。只有在分析中使用了模型名称的时候,投票才会被隐藏。自一个星期前竞技场上线以来,已经统计了大约7000个合法的匿名投票。 未来,他们希望实现改进的抽样算法、锦标赛流程和服务系统,以适应更多样的模型,并为各种任务提供细粒度的排名。
Leave a Comment大型语言模型(LLM)的发展,例如OpenAI的ChatGPT和GPT-4,在自然语言处理、计算机视觉和生物医学等许多领域中重塑了人工智能。不幸的是,ChatGPT的训练细节和其变体的模型架构仍然未知。虽然LLaMA是一个开源的基础语言模型,但据推测,它在需要广泛领域知识的应用中表现不佳,是由于在模型预训练阶段缺乏领域特定数据引起的。 许多研究一直在讨论修改和使用开源LLM来实现专门目的。例如,Alpaca和Vicuna专注于通过训练模型以遵守自动创建的指令示例来扩展模型的交互能力。 上海交通大学和上海人工智能实验室最近的一项工作采用了一种不同的方法,将领域知识注入到单个预训练的LLaMA中,以将基础语言模型引导到医学专用语料库。他们介绍了PMC-LLaMA,这是一个公开可用的语言模型,通过在480万篇医学学术论文上对LLaMA-7B进行改进开发而成。团队认为,在医学讨论和咨询中,一个以医学为重点的基础语言模型会有更多的益处。 团队从S2ORC数据集开始,该数据集包含81.1M篇英文学术论文,并根据其PubMed Central(PMC)ID对其进行了排序。因此,约有490万篇论文,总计超过750亿个标记与医学知识高度相关。通过优化GPT2中首次提出的自回归生成目标,他们在这些免费的PMC论文上对LLaMA-7B模型进行了微调。他们采用bf16(脑浮点)数据格式和完全分片数据并行(FSDP)加速方法来加快学习过程。 团队通过对上述相关的医学问答数据集进行三种不同类型的微调来测试PMC-LLaMA:完全微调、参数高效微调和数据高效微调。实验结果表明,当微调指令调整时,PMC-LLaMA在医学领域中优于LLaMA和其他使用LLaMA微调指令训练的模型。 PMC-LLaMA的一个缺点是,这480万篇论文中并不包含每个标记,因为迄今为止他们只进行了五个时期的训练。在未来,他们计划逐步训练具有更多参数的PMC-LLaMA模型,持续训练PMC-LLaMA,并更新hugging face页面上的基础模型。
Leave a Comment文本到图像扩散模型通过使用数十亿个图像-文本对和有效的拓扑结构进行构建,展示了在以输入提供的文本合成高质量、逼真和多样化图片方面的惊人能力。它们还扩展到了几个应用领域,包括图像到图像的翻译、可控的创建和定制。这个领域最近的一个应用是能够通过使用模态特定的训练数据将其扩展到2D图片以外的其他复杂模态,而不改变扩散模型。本研究旨在解决使用预训练的文本到图像扩散模型的知识来挑战超出2D图片的高维视觉生成任务的挑战,同时利用模态特定的训练数据而不改变扩散模型。 他们从这样一个直觉开始,即许多复杂的视觉数据,包括电影和3D环境,可以被表示为具有特定模态一致性的图片集合。例如,一个3D场景是一组具有视图一致性的多视图帧,而电影是一组具有时间一致性的帧。不幸的是,因为他们的生成采样方法在利用图像扩散模型时没有考虑一致性,图像扩散模型没有能力保证合成或编辑一组图片的一致性。结果,当将图片扩散模型应用于这些复杂数据时,不考虑一致性,结果可能更连贯,如图1(分块裁剪)所示,可以清楚地看出照片被拼接在一起的地方。 图1:全景图片修改:上右侧的裁剪补丁上,Instruct-Pix2Pix会产生不规则的图片编辑。(第三行)即使有很高的引导比例y,带有多扩散的Instruct-Pix2Pix也会编辑出一张一致的图片,但对指令的忠实度稍低。第三行通过选择适当的引导比例,CSD-Edit提供了具有更高指令忠实度的一致图片编辑。 类似的行为也在视频编辑中被观察到。因此,随后的研究提出了采用图片扩散模型来解决视频特定的时间一致性问题。在这里,他们引起了一个名为评分蒸馏采样(SDS)的新策略的注意,该策略利用文本到图像扩散模型的丰富生成先验来优化任何可微分的算子。通过压缩学习到的扩散密度评分,SDS将生成采样的挑战框架为一个优化问题。虽然其他研究人员已经证明了SDS在使用神经辐射场先验从文本生成3D对象方面的有效性,该先验通过密度建模假设在3D空间中具有一致的几何结构,但尚未研究它在一致合成其他模态的视觉方面。 在这项研究中,来自KAIST和Google Research的作者提出了一种简单而高效的技术,称为协同评分蒸馏(CSD),该技术扩展了文本到图像扩散模型在可靠的视觉合成方面的潜力。他们方法的关键有两个方面:首先,他们使用斯坦变分梯度下降(SVGD)通过让多个样本共享从扩散模型中获得的信息来推广SDS,以实现样本间的一致性。其次,他们提供了CSD-Edit,一种将CSD与最近开发的指令引导图片扩散模型Instruct-Pix2Pix结合起来的强大技术,用于一致的视觉编辑。 他们使用各种应用程序,包括全景图片编辑、视频编辑和3D场景重建,来展示他们的方法的适应性。他们展示了CSD-alter如何通过最大化多个图片补丁来改变具有空间一致性的全景图像。此外,与之前的方法相比,他们的方法在指令准确性和源-目标图像一致性之间取得了更好的平衡。在视频编辑的实验中,CSD-Edit通过优化多个帧达到时间一致性,从而实现了时间帧一致的视频编辑。他们还使用CSD-Edit生成和编辑3D场景,促进了各种视点的统一性。
Leave a CommentChapyter由一群语言模型师开发,是一个新的Jupyter插件,可以集成ChatGPT,让用户创建Python笔记本。该系统还可以读取先前执行的单元格的结果。 Chapyter是JupyterLab的一个附加组件,可以无缝地将GPT-4集成到开发环境中。它有一个解释器,可以将自然语言编写的描述转换为可以自动执行的Python代码。Chapyter可以提高生产力,通过在首选的IDE中启用“自然语言编程”,让用户尝试新事物。 主要特点 从自然语言自动生成代码并执行。 基于过去的代码和之前执行的结果生成新代码。 实时代码纠正和错误修复。 自定义选项和完全可见的AI设置提示。 在使用尖端AI技术时注重隐私。 该库的提示和设置是公开的,研究人员正在努力简化这些问题和设置的自定义。Chapyter/programs.py是可以查看这些内容的位置。 请查看他们的API数据使用政策,以了解OpenAI如何处理训练数据。相比之下,每当使用Copilot或ChatGPT时,部分数据将被缓存并用于这些服务的训练和分析。Chapyter由两个主要部分组成:使用ipython魔法命令管理提示和使用该命令调用GPT-X模型。监视Chapyter单元格执行的用户界面将运行新创建的单元格并自动更新单元格样式。 许多程序员更喜欢以“碎片化”的方式在笔记本中工作,一次只写几行代码,然后转到下一个单元格。每个单元格的任务或目的相对较小,与相邻单元格的任务相互独立。后续工作可能与之前的工作没有太多共同之处。例如,在创建神经网络时添加数据集加载器需要不同的思考和编写代码的方式。不断在任务之间切换不仅效率低下,而且可能会令人精疲力尽。当用户想要键入“请以某种方式加载数据集以测试神经网络”时,可以使用该命令,让机器完成剩下的工作。 Chapyter的单元格级代码开发和自动执行可以解决这个问题。当用户创建一个新的单元格时,Chapyter会自动调用GPT-X模型根据他们编写的文本构建代码并运行。与像Copilot这样专注于支持仅涉及几行代码但与正在进行的工作高度相关的微任务(如完成函数调用)的系统不同,Chapyter旨在接管整个任务,其中一些可能与现有代码不同。 Chapyter是一个轻量级的Python工具,在本地安装后可以与JupyterLab完美集成。默认情况下,OpenAI API设置为在调用GPT-X模型后丢弃交互数据和代码。该库包含所有标准提示、“程序”和加载个性化提示的选项。通过分析以前的编码决策和运行时数据,Chapyter可以提供智能建议。如果需要,可以加载文件,并提供额外处理和分析的建议。 鉴于当今AI的局限性,Chapyter的生成代码易于调试和改进。 安装过程分为三个简单的步骤,可以在GitHub的https://github.com/chapyter/chapyter上找到更多信息。 不久之后,研究人员将发布对Chapyter的重大改进,使其在代码生成和执行方面更加灵活和安全。他们迫不及待地想要在一些最苛刻和复杂的实际编码任务上测试它,比如确保一个有300个单元格执行的Jupyter笔记本有所有所需的帮助。请尝试我们的工具,敬请期待进一步的改进,我们重视您的想法和意见。
Leave a Comment大型语言模型(LLMs)在每次更新和发布新版本时都越来越受欢迎。像BERT、GPT和PaLM这样的LLMs在自然语言处理和自然语言理解领域展示了巨大的能力。由OpenAI开发的著名聊天机器人ChatGPT基于GPT 3.5和GPT 4的变压器架构,并被超过一百万用户使用。由于它具有模仿人类特性,它引起了从研究人员和开发人员到学生的所有人的注意。它可以高效地生成独特的内容,像人类一样回答问题,总结长篇文字段落,完成代码示例,翻译语言等等。 ChatGPT已经证明在各种主题上向用户提供信息非常出色,使它们成为传统网页搜索和在线寻求他人帮助的潜在替代品。但是也存在一种限制,即如果用户继续私下与大规模语言模型进行互动,公开可访问的人类生成数据和知识资源的数量可能会大幅减少。这种开放数据的减少可能会使未来模型的训练数据变得困难,因为可能会有较少的免费可用信息。 为了进一步研究这个问题,一组研究人员对Stack Overflow上的活动进行了调查,以确定ChatGPT的发布如何影响开放数据的产生。Stack Overflow是一个著名的面向计算机程序员的问答网站,它是一个很好的案例研究,可以研究当存在多个语言模型时用户行为和贡献。该团队对如何随着ChatGPT等LLMs的普及而导致类似StackOverflow等网站上的内容大幅减少进行了深入研究。 经过评估,该团队得出了一些有趣的结论。与ChatGPT访问受限的中国和俄罗斯竞争对手以及类似的数学论坛相比,Stack Overflow的活动明显减少。团队预测,在OpenAI的ChatGPT发布后,Stack Overflow每周帖子数量将下降16%。同时,ChatGPT对减少Stack Overflow活动的影响随着时间的推移而增加,这表明随着用户对该模型的特性越来越熟悉,他们开始越来越多地依赖它获取信息,进一步限制了对该网站的贡献。 该团队得出了三个关键发现,具体如下。 减少的发布活动:ChatGPT发布后,Stack Overflow的帖子数量,即问题和答案的数量,减少了。使用差异法计算了活动减少并与其他四个问答平台进行了比较。ChatGPT发布后的六个月内,Stack Overflow的帖子活动量最初下降了约16%,然后增长到约25%。 帖子投票数没有改变 – 自ChatGPT发布以来,Stack Overflow上的帖子收到的投票数(包括赞成和反对)没有显着变化,尽管帖子活动有所下降,这表明ChatGPT不仅替代了低质量的帖子,还替代了高质量的文章。 对不同编程语言的影响:ChatGPT对Stack Overflow上讨论的各种编程语言产生了不同的影响。与全球网站平均水平相比,一些语言(如Python和JavaScript)的帖子活动减少得更为明显。帖子活动的相对下降也受到GitHub上编程语言的普及程度的影响。 作者总结了广泛使用LLMs和随之而来的远离Stack Overflow等网站可能会限制用户和未来模型从中学习的开放数据的数量的影响,并且尽管在解决某些编程问题方面可能会提高效率,但对于互联网上的知识的可访问性和共享以及AI生态系统的长期可持续性都会产生影响。
Leave a Comment随着最近技术的进步,像GPT-3和PaLM这样的大型语言模型在教育、内容创作、医疗保健、研究等领域展现出了非凡的生成能力。例如,这些大型语言模型对于作家来说尤其有用,可以帮助他们提升写作风格,对于初学者开发者来说,可以帮助他们生成样板代码等。此外,结合多个第三方API的可用性,大型语言模型在学生和医疗系统等多个面向消费者的系统中的广泛应用只增加了。然而,在这种情况下,系统的安全性成为一个基本问题,因为人们信任这些系统来处理敏感的个人信息。这就需要更清楚地了解大型语言模型的不同能力和限制。 然而,大多数以前的研究都集中在通过采用更先进和复杂的架构使大型语言模型更强大。尽管这项研究在很大程度上超越了自然语言处理社区,但也导致了对这些系统安全性的忽视。在这方面,普林斯顿大学和佐治亚理工学院的博士后学生与艾伦人工智能研究所(A2I)的研究人员合作,对OpenAI的革命性AI聊天机器人ChatGPT进行了毒性分析。研究人员评估了ChatGPT的超过50万次生成过程中的毒性,并发现当ChatGPT的系统参数设置为分配一个人物角色时,其毒性在各种话题上增加了数倍。例如,当ChatGPT的人物角色设置为拳击手“穆罕默德·阿里”时,其毒性几乎比默认设置增加了3倍。这特别令人担忧,因为ChatGPT目前被用作构建其他几种技术的基础,这些技术在进行系统级修改后可能会生成相同水平的毒性。因此,A2I研究人员和大学生所做的工作侧重于在分配不同角色时,对ChatGPT生成的毒性有更深入的了解。 ChatGPT API提供了一种功能,允许用户通过设置其系统参数来分配一个人物角色,从而通过影响ChatGPT的对话方式来设定对话的基调。对于他们的用例,研究人员精心挑选了来自不同背景和国家的90个人物角色,如企业家、政治家、记者等。这些人物角色被分配给ChatGPT,以分析其对大约128个关键实体(如性别、宗教、职业等)的回应。团队还要求ChatGPT继续完成关于这些实体的某些不完整的短语,以收集更多见解。最终的研究结果显示,给ChatGPT分配一个人物角色可能会使其毒性增加多达六倍,ChatGPT经常产生严厉的输出,并沉溺于负面刻板印象和信念。 团队的研究发现,ChatGPT输出的毒性根据所给予的人物角色而有显著差异,研究人员认为这是因为ChatGPT根据其训练数据对人物的理解。例如,一个发现表明,记者的毒性是商人的两倍,即使在实践中可能并非如此。研究还显示,特定的人群和实体比其他人更频繁地成为目标(几乎是三倍),这显示了该模型固有的歧视行为。例如,毒性根据人的性别而有所不同,比基于种族的毒性大约高出50%。这种波动趋势可能对用户造成损害,并对相关个体进行贬低。此外,恶意用户可以在ChatGPT上构建技术,生成可能伤害无辜观众的内容。 这项研究对ChatGPT的毒性进行的分析主要揭示了三个问题:当分配人物角色时,模型的毒性可以显著增加(比默认设置高出多达六倍);模型的毒性根据人物角色的身份而有很大差异,ChatGPT对人物角色的观点起着重要作用;ChatGPT可以通过对特定实体进行更具毒性的内容创作来歧视性地针对特定实体。研究人员还指出,尽管ChatGPT是他们实验中使用的大型语言模型,但他们的方法可以扩展到任何其他大型语言模型。团队希望他们的工作能激励人工智能社区开发出提供道德、安全和可靠的人工智能系统的技术。
Leave a Comment自监督表示学习是发展视觉基础技能的成功方法。这一研究方向的基础是利用大型未标记数据集作为补充的训练数据源,以提高下游网络性能并减少对大型标记目标数据集的需求。最近的研究表明,自监督在ImageNet上的预训练现在可以与或超过在多个下游数据集和任务上的有监督预训练,包括像素级语义和实例分割。 对比学习的变种是最受欢迎的自监督表示学习方法之一,其中目标骨干网络被训练为将图像的修改视图在潜在空间中映射得比从数据集中随机选择的图片更接近。这种范式可以通过添加空间损失并使用更少或没有负实例来改进。另一个研究领域专注于重建损失进行监督,或者称为遮蔽图模型(MIM),其中涉及对输入图像的某些区域进行遮蔽,并训练骨干网络重建这些部分。这项工作通常被认为是确定性的,这意味着它忽略了隐藏区域的多种可能性。 通常,这个研究领域探讨了架构设计、训练方法和遮蔽策略,以训练更好的骨干网络。当与基于Vision Transformer的骨干网络一起使用时,这些技术已经达到了最先进的性能;然而,最近还展示了稀疏CNN-based图像骨干的同样有效性。在这项研究中,作者提出了一种以生成模型作为表示学习器的方法,他们认为这个目标的简单性——生成数据——和直观的表征能力——生成高质量的样本——都表明学习到了语义上足够准确的内部表示。 使用生成网络作为表示学习器的想法并不陌生。在DatasetGAN及其派生工作中,建议使用StyleGAN或扩散模型的特征来补充与任务相关的头部,然后使用这些增强网络作为标记数据的源来训练后续网络。SemanticGAN则使用了带有额外任务解码器的StyleGAN作为任务网络本身,通过将图片编码成生成模型的潜在空间,并使用任务头部创建感知输出。在这项研究中,来自NVIDIA、多伦多大学、Vector研究所和麻省理工学院的研究人员引入了DreamTeacher,这是一个使用生成模型预训练基于蒸馏的下游感知模型的表示学习框架。 他们研究了两种不同的蒸馏过程:1)作为一种通用的无标签预训练过程,他们提供了特征蒸馏的技术,即将生成的特征降低到目标骨干。2)标签蒸馏:在半监督环境中,使用生成网络上的任务头将标记数据集中的知识蒸馏到目标骨干上。他们的工作选择了扩散模型和GAN作为生成模型。 他们集中研究了CNN作为目标骨干的原因有两个主要原因:1)已经证明基于CNN的骨干可以进行对比和MIM技术的最先进表示学习;2)最先进的生成模型(如GAN和扩散模型)仍然严重依赖CNN。他们还在早期试验中调查了Vision Transformer的骨干,但发现很难将基于CNN的生成模型的特征提取到Vision Transformer中。由于使用Vision Transformer架构创建的生成模型仍处于初级阶段,因此仍需要进一步研究使用这些设计的DreamTeacher。 他们通过实验证明,DreamTeacher在许多基准测试和条件下优于当前可用的自监督学习系统。当在没有任何标签的ImageNet上进行预训练时,他们的方法在包括ADE20K的语义分割、MSCOCO上的实例分割和自动驾驶数据集BDD100K上的任务上明显优于在ImageNet上进行完全监督的预训练方法。当仅在目标领域上进行训练时,他们的技术明显优于在带有标签监督的ImageNet上进行预训练的变种。它在数百万张无标签图片的以对象为重点的数据集上达到了新的最先进性能。这些发现证明了生成模型的潜力,特别是基于扩散的生成模型,作为能够高效利用各种无标签信息的表示学习器。
Leave a Comment在控制和增强学习领域中,测量过程非常具有挑战性。一个特别不足的领域是关注高维控制的鲁棒基准,特别是高维机器人技术的“挑战问题”:掌握双手多指控制。与此同时,控制和增强学习方面的一些基准努力已经开始聚合和探索不同的深度方面。尽管对模仿人手的灵巧性进行了数十年的研究,但机器人中的高维控制仍然是一个主要难题。 加州大学伯克利分校、谷歌、DeepMind、斯坦福大学和西蒙弗雷泽大学的一组研究人员提出了一个名为ROBOPIANIST的高维控制基准套件。在他们的工作中,双手模拟的人形机器人手被要求根据音乐谱面演奏各种歌曲,这些歌曲以音乐器件数字接口(MIDI)转录为条件。机器人手总共有44个执行器,每只手有22个执行器,类似于人手的轻度欠驱动。 演奏一首好歌需要能够以展示高维控制策略的许多特质的方式对动作进行排序。这些特质包括: 空间和时间的精确性。 两只手和十个手指的协调。 关键按键的战略计划,以使其他按键更容易。 原始ROBOPIANIST-repertoire-150基准包括150首歌曲,每首歌曲都是独立的虚拟作品。研究人员通过模型自由(RL)和模型基于(MPC)方法的全面实验来研究无模型和模型方法的性能范围。结果表明,尽管还有很大的改进空间,但提出的策略可以产生出色的表现。 策略学习一首歌曲的能力可以用来按难度对歌曲(即任务)进行排序。研究人员认为,根据这种标准对任务进行分组的能力可以鼓励在与机器人学习相关的各个领域进一步研究,例如课程和迁移学习。RoboPianist为各种学习方法提供了有趣的机会,例如模仿学习、多任务学习、零样本泛化和多模态(声音、视觉和触觉)学习。总的来说,ROBOPIANIST提供了一个简单的目标,一个易于复制的环境,清晰的评估标准,并且在未来有各种扩展潜力。
Leave a Comment机器学习模型需要对长篇文本进行编码,以用于各种自然语言处理任务,包括总结或回答关于长篇文档的问题。由于注意力成本随输入长度的增加呈二次增长,并且必须对每个输入标记应用前馈和投影层,使用Transformer模型处理长文本在计算上是昂贵的。近年来出现了几种“高效Transformer”策略,降低了对长输入的注意机制的开销。然而,前馈和投影层,尤其是对于更大的模型,承载着大部分的计算负载,并且可能使分析长输入变得不可能。本研究介绍了COLT5,这是一种新的模型系列,通过同时改进注意力和前馈层的架构,构建在LONGT5的基础上,实现对长输入的快速处理。 COLT5的基础是某些标记比其他标记更重要,并且通过为重要标记分配更多的计算资源,可以以较低的成本获得更高的质量。例如,COLT5将每个前馈层和每个注意力层分为轻量级分支和重量级分支,轻量级分支应用于所有标记,重量级分支用于选择特定输入和组件的重要标记。与常规的LONGT5相比,轻量级前馈分支的隐藏维度小于重量级前馈分支的隐藏维度。此外,随着文档长度的增加,重要标记的百分比会减少,从而实现对长文本的可管理处理。 图1:有条件计算的COLT5 Transformer层概述。 图1显示了COLT5条件机制的概述。由于COLT5的存在,LONGT5架构经历了两个进一步的变化。重量级注意力分支在一组精心选择的重要标记上执行完全的注意力,而轻量级注意力分支具有较少的头部并应用局部注意力。COLT5引入的多查询交叉注意力大大加速了推理。此外,COLT5使用UL2预训练目标,他们表明这可以实现对长输入的上下文学习。 来自Google Research的研究人员建议COLT5,这是一种用于处理远程输入的新型模型,利用有条件的计算来获得更好的性能和更快的处理速度。他们证明COLT5在arXiv摘要和TriviaQA问答数据集上优于LONGT5,在SCROLLS基准测试上达到了SOTA水平。COLT5针对“关注”标记的缩放不是线性的,大大提高了长输入任务的质量和性能。COLT5在相同或更好的模型质量下,进行微调和推理速度明显更快。COLT5中的轻量级前馈和注意力层适用于所有输入,而重量级分支只影响由学习路由器选择的一部分重要标记。他们证明COLT5在各种长输入数据集上优于LONGT5,并且能够成功高效地处理长达64k个标记的输入。
Leave a Comment近年来,人工智能(AI)的繁荣与AI能够更快地完成工作并减少努力有多大关系。现如今,几乎没有任何领域不使用AI。例如,从Amazon Echo和Google Home等语音助手中的AI代理到使用机器学习算法预测蛋白质结构,AI无处不在。因此,合理地相信与AI系统合作的人会做出比单独行动更优越的决策是合理的。但实际情况是否确实如此呢? 以往的研究表明,情况并非总是如此。在一些情况下,AI并不总是产生正确的反应,这些系统必须进行重新训练以纠正偏见或其他问题。然而,对人工智能决策团队有效性构成危险的另一个相关现象是AI过度依赖,即人们受到AI影响并经常接受不正确的决策而不验证AI的正确性。在进行诸如识别银行欺诈和提供医学诊断等关键和重要任务时,这可能非常有害。研究人员还表明,解释性人工智能并不能减少AI过度依赖问题,解释性人工智能是指AI模型在每一步解释为何做出某个决策而不仅仅提供预测。一些研究人员甚至声称,认知偏见或未校准的信任是过度依赖的根源,将过度依赖归因于人类认知的不可避免性。 然而,这些研究结果并未完全证实AI解释应该减少过度依赖的观点。为了进一步探索这一点,斯坦福大学人类中心人工智能(HAI)实验室的研究团队声称,人们在是否与AI解释进行交互方面是有策略选择的,表明在某些情况下,AI解释可以帮助人们减少过度依赖。根据他们的论文,当相关的AI解释比手头的任务容易理解,并且这样做有更大的利益(可以是财务奖励形式),个体更不可能依赖于AI的预测。他们还证明,当我们专注于与解释互动而不仅仅是让目标提供解释时,可以大大减少对AI的过度依赖。 该团队将这种策略性决策在成本收益框架中进行了测试。在这个框架中,主动参与任务的成本和效益与依赖AI的成本和效益进行了比较。他们邀请在线众包工人与AI合作解决三个不同复杂度的迷宫挑战。相应的AI模型提供答案,要么没有解释,要么提供了多个程度的解释,从下一步的单个指令到退出整个迷宫的逐步指导。试验结果表明,诸如任务难度和解释难度之类的成本以及货币补偿等利益大大影响了过度依赖。对于AI模型提供逐步指导的复杂任务,过度依赖并没有减少,因为解读生成的解释与独自解决迷宫一样具有挑战性。此外,当能够独立解决迷宫时,大多数解释对过度依赖没有影响。 该团队得出结论,如果手头的工作具有挑战性并且相关的解释清晰明了,它们可以帮助防止过度依赖。然而,当工作和解释都很困难或简单时,这些解释对过度依赖几乎没有影响。如果活动容易执行,那么解释并不重要,因为人们可以自己轻松地执行任务,而不是依赖解释生成结论。此外,当任务复杂时,人们有两个选择:要么手动完成任务,要么检查生成的AI解释,这些解释通常同样复杂。这主要是因为AI研究人员可用的解释工具很少,需要的验证工作比手动执行任务要少得多。因此,人们倾向于相信AI的判断而不质疑它或寻求解释,并不奇怪。 作为一项额外的实验,研究人员还将经济利益因素引入了方程式。他们向众包工人提供了独立完成不同难度的迷宫任务以获得一笔钱的选择,或者以较少的金钱换取AI的帮助,要么没有解释,要么提供复杂的逐步指导。研究结果显示,当任务具有挑战性时,工人更重视AI的帮助,并更喜欢简单明了的解释。此外,发现随着使用AI的长期好处增加(在本例中是财务奖励),过度依赖减少。 斯坦福研究人员对他们的发现寄予厚望,希望能给那些被事实解释不能减少过度依赖的学者们带来一些安慰。此外,他们希望通过提供引人入胜的论据,激励可解释的人工智能研究人员,以改进和简化人工智能的解释。 查看论文和斯坦福文章。此研究的所有荣誉归功于该项目的研究人员们。此外,请不要忘记加入我们的26k+ ML SubReddit、Discord Channel和Email Newsletter,我们在那里分享最新的人工智能研究新闻、酷炫的人工智能项目等等。 使用Tensorleap的可解释性平台揭示深度学习的秘密 这篇文章来源于MarkTechPost,介绍了斯坦福的一项新的人工智能研究,展示了解释如何在决策过程中减少对人工智能系统的过度依赖。
Leave a Comment“大型语言模型”已经被开发出来,可以根据输入预测自然语言内容。除了语言建模挑战,使用这些模型还提高了自然语言的性能。基于LLM的方法在医学任务中,如信息提取、问答和摘要中展示了益处。提示是LLM技术中使用的自然语言指令。这些指令集包括任务规范,预测必须遵守的规则,以及可选的任务输入和输出样本。 生成式语言模型根据以自然语言给出的指令产生结果,消除了对特定任务的训练要求,使非专家能够扩展这项技术。虽然许多任务可以表示为单一线索,但进一步的研究表明,将任务分割为较小的任务可能会提高任务性能,尤其是在医疗领域。它们支持一种替代策略,包括两个关键组成部分。它始于一个迭代过程,用于改进第一个产品。与条件链接相反,这使得生成可以整体上得到完善。其次,它有一个指导者,可以通过在每次重复中提出要集中注意的区域来进行引导,使过程更加可理解。 随着GPT-4的发展,他们现在可以使用一个丰富、逼真的对话式VoAGI。来自Curai Health的研究人员建议使用对话式解决代理或DERA。DERA是一个框架,用于研究如何通过对话解决的代理来提高自然语言任务的性能。他们认为,将每个对话代理分配给特定的角色将有助于他们专注于工作的某些方面,并确保他们的合作伙伴代理与整体目标保持一致。研究者代理人寻求与问题相关的相关数据,并提议其他代理人要集中注意的主题。 为了提高自然语言任务的性能,他们提供了DERA,这是一个代理-代理交互的框架。他们根据三个不同类别的临床任务评估DERA。为了回答每个问题,需要不同的文本输入和不同的专业水平。医疗对话摘要挑战旨在提供一个医生-患者对话的摘要,该摘要在事实上是正确的,没有幻觉或遗漏。创建护理计划需要大量的信息,并且有助于临床决策支持的冗长输出。Decider代理角色可以自由回应这些数据,并选择输出的最终行动方案。 该工作有多种解决方案,目标是尽可能地提供事实上正确和相关的材料。回答关于医学的问题是一项开放性任务,需要思考知识,并且只有一个可能的解决方案。他们使用两个问答数据集在这个更具挑战性的环境中进行研究。在两个人工注释评估中,他们发现DERA在护理计划创建和医疗对话摘要任务方面的表现优于基本的GPT-4。根据定量分析,DERA成功纠正了包含许多不准确信息的医疗对话摘要。 另一方面,他们发现在问答方面,GPT-4和DERA的表现几乎没有改进。根据他们的理论,这种方法在涉及许多细粒度特征的长篇生成问题上效果很好。他们将合作发布一个基于MedQA的新型开放性医学问答工作,其中包括美国医学执照考试的实践问题。这使得对建模和评估问答系统进行新的研究成为可能。推理链和其他特定任务的方法都是链策略的示例。 推理链技术鼓励模型像专家一样处理问题,从而提高某些任务的性能。所有这些方法都努力从基本语言模型中产生适当的生成结果。这种提示系统受限于预先确定的、具有特定目的的提示集,如编写解释或修复输出异常,这是该方法的一个基本限制。他们在这个方向上迈出了一大步,但将它们应用于现实世界的情况仍然是一个巨大的挑战。
Leave a Comment使用AI驱动的系统的原型一直以来都更加复杂。但是,在使用原型一段时间后,您可能会发现它可以更加功能强大。通过基本的编程理解和几个小时的时间,可以创建一个用于记录笔记的聊天机器人、一个用于从文本创建图像的编辑器以及一个用于总结客户评论的工具。 在实际世界中,机器学习(ML)系统可能存在社会偏见和安全问题。从行人检测模型中的种族偏见到特定医学图像的系统误分类,从业者和研究人员不断发现当前最先进模型的重大局限和失败。行为评估或测试常用于发现和验证模型的局限。了解子组或输入数据切片的模型输出模式超出了检查准确性或F1分数等聚合指标的范围。ML工程师、设计师和领域专家等利益相关者必须共同努力,确定模型的预期和潜在故障。 尽管进行行为评估非常重要,但实际操作仍然很困难。此外,许多流行的行为评估工具,如公平性工具包,不支持实际从业者通常处理的模型、数据或行为。从用户和利益相关者手动测试精选案例来评估模型并选择最佳部署版本是常见做法。在从业者熟悉将使用模型的产品或服务之前,经常会先创建模型。 了解机器学习模型在完成特定任务方面的表现如何是模型评估的难点。使用聚合指标只能大致估计模型的性能,就像智商测试只是对人类智能的粗略和不完美的衡量一样。例如,它们可能无法在自然语言处理系统中嵌入准确的语法,或者掩盖社会偏见等系统性缺陷。标准的测试方法是在数据子集上计算整体性能指标。 确定模型应具备哪些特征是行为评估领域的重要问题。在复杂的领域中,由于可能存在无休止的要求,测试需求列表将是不可能的。因此,ML工程师与领域专家和设计师合作,在迭代和部署之前描述模型的预期功能。用户通过与产品和服务的交互提供对模型的限制和预期行为的反馈,这些反馈随后被纳入未来的模型迭代中。 存在许多用于识别、验证和监控ML评估系统中模型行为的工具。这些工具利用数据转换和可视化揭示模型的公平性问题和边界情况等模式。Zeno与其他系统合作并结合其他方法。基于子组或切片的分析,即在数据集的子集上计算指标,是最接近Zeno的行为评估方法。Zeno现在允许针对任何领域或活动进行基于滑动和变形的测试。 Zeno由Python应用程序编程接口(API)和图形用户界面(GUI)组成。模型输出、指标、元数据和修改后的实例只是行为评估的基本组成部分之一,可以实现为Python API函数。API的输出是构建进行行为评估和测试的主界面的框架。Zeno有两个主要的前端视图:探索UI用于数据发现和切片创建,分析UI用于测试创建、报告创建和性能监控。 Zeno通过Python脚本向公众提供。编写的前端界面使用Svelte,使用Vega-Lite进行可视化和Arquero进行数据处理;该库包含在Python软件包中。用户在指定必要的设置(包括测试文件、数据路径和列名)后,可以从命令行启动Zeno的处理和界面。Zeno将UI作为URL端点托管的能力意味着它可以在本地或服务器上与其他计算一起部署,并且用户仍然可以从自己的设备访问它。该框架已经在包含数百万实例的数据集上进行了尝试和验证。因此,它应该能够很好地适应大规模的部署场景。 机器学习环境中存在许多框架和库,每个框架和库都专注于特定的数据或模型。Zeno在很大程度上依赖于基于Python的模型推理和数据处理API,可以进行定制。研究人员开发了Zeno的后端API作为一组Python装饰器方法,可以支持大多数现代ML模型,尽管大多数ML库都基于Python,因此存在相同的碎片化问题。 研究团队进行的案例研究显示,Zeno的API和用户界面的协同作用有助于从数据集和任务中发现重大的模型缺陷。从更广泛的意义上讲,研究结果表明,行为评估框架对于各种数据和模型类型都是有用的。 根据用户的需求和任务的难度,Zeno的各种功能使行为评估变得更简单、更快捷、更准确。在案例2中,参与者使用API的可扩展性创建了模型分析元数据。案例研究参与者报告称,将Zeno整合到他们现有的工作流程中并与Zeno API进行交互的难度很小或几乎没有。 约束和预防措施 了解哪些行为对最终用户来说是必要的并由模型编码是行为评估的一个主要难点。研究人员正在积极开发ZenoHub,这是一个协作仓库,用户可以在其中分享他们的Zeno函数,并更容易地找到相关的分析组件,以鼓励模型函数的重用,以支持发现。 Zeno的主要功能是定义和测试数据片段的度量标准,但该工具仅提供有限的网格和表格视图来显示数据和片段。通过支持各种强大的可视化方法,可以提高Zeno的实用性。用户可以通过编码语义相似性的实例视图(如DendroMap、Facets或AnchorViz)来发现数据中的模式和新行为。ML Cube、Neo和ConfusionFlow是Zeno可以修改以更好显示模型行为的一些ML性能可视化工具。 虽然Zeno的并行计算和缓存使其能够扩展到大型数据集,但机器学习数据集的大小正在迅速增加。因此,更多的改进将大大加快处理速度。使用像Ray这样的库在分布式计算集群中进行处理可能是未来的更新。 多个直方图在非常大的表格上进行交叉过滤是另一个障碍。Zeno可以采用像Falcon这样的优化方法,以便在大规模数据集上实现实时交叉过滤。 总结: 即使机器学习模型在训练数据上达到了很高的准确率,它在实际世界中仍然可能遭受系统性的失败,例如负面偏见和安全隐患。从某种意义上讲,从行为的角度对模型进行评估是从某些输入到模型输出的模型缺陷的识别和纠正。行为评估的重要性不言而喻,但也很困难,需要揭示现实世界中的模式,并验证系统性的失败。对机器学习的行为评估是识别和纠正问题模型行为的关键,包括偏见和安全问题。在这项研究中,作者深入探讨了机器学习评估的困难,并开发了一种在各种情境中对模型进行评分的通用方法。通过四个实际案例研究中,实践者对现实世界的模型进行了评估,研究人员展示了Zeno如何在多个领域中应用。 许多人对人工智能的发展抱有很高的期望。然而,他们的行为复杂性与他们的能力发展的速度相同。拥有强大的资源来促进基于行为的开发,并确保构建与人类价值观相协调的智能系统是至关重要的。Zeno是一个灵活的平台,允许用户在各种与人工智能相关的工作中进行这种深入的考察。
Leave a Comment大型语言模型(LLMs)正在迅速发展,并对经济和社会变革做出重要贡献。随着互联网上发布了许多人工智能(AI)工具,其中一个在过去几个月中非常受欢迎的工具是ChatGPT。ChatGPT是一种自然语言处理模型,允许用户生成像人类一样有意义的文本。OpenAI的ChatGPT基于GPT变压器架构,GPT-4是支撑它的最新语言模型。 随着最新的人工智能和机器学习发展,计算机视觉得到了指数级的提升,网络架构和大规模模型训练得到了改进。最近,一些研究人员引入了MM-REACT,这是一种将多个视觉专家与ChatGPT结合起来进行多模态推理和行动的系统范例。MM-REACT以更灵活的方式将各个视觉模型与语言模型结合起来,以克服复杂的视觉理解挑战。 MM-REACT的目标是处理现有视觉和视觉语言模型难以应对的各种复杂视觉任务。为此,MM-REACT使用提示设计来表示各种类型的信息,例如文本描述、文本化的空间坐标以及作为对齐文件名表示的密集视觉信号,如图像和视频。这种设计使ChatGPT能够接受和处理不同类型的信息与视觉输入相结合,从而实现更准确、全面的理解。 MM-REACT是一个将ChatGPT的能力与一组视觉专家相结合以增加多模态功能的系统。文件路径被用作占位符,并输入到ChatGPT中,以使系统能够接受图像作为输入。每当系统需要从图像中获取特定信息,例如识别名人姓名或框坐标时,ChatGPT会寻求特定视觉专家的帮助。专家的输出被序列化为文本,并与输入结合起来进一步激活ChatGPT。如果不需要外部专家,则直接将响应返回给用户。 通过向ChatGPT提示中添加与每个专家能力、输入参数类型和输出类型相关的特定指令,以及每个专家的一些上下文示例,使ChatGPT能够理解视觉专家的使用知识。此外,还指导使用正则表达式匹配来调用相应的专家。 通过实验,零-shot实验显示了MM-REACT如何有效地解决其特定的感兴趣的能力。它已经证明在解决需要复杂视觉理解的各种高级视觉任务方面非常高效。作者分享了一些例子,其中MM-REACT能够解决图像上显示的线性方程。此外,它还能够通过命名图像中的产品及其成分等来进行概念理解。总之,这种系统范例很好地结合了语言和视觉专业知识,并能够实现高级视觉智能。
Leave a Comment网络安全防御者必须根据技术发展和系统复杂性的提高动态调整他们的技术和策略。随着过去十年中机器学习(ML)和人工智能(AI)研究的进展,这些技术在各种与网络安全相关的领域中的使用案例也得到了发展。大多数现有安全应用程序中的一些功能性由在大量数据集上训练的强大的机器学习算法支持。其中一个例子是在早期的2010年代将ML算法集成到电子邮件安全网关中。 在实际情况下,创建自主的网络安全系统防御策略和行动建议是一项相当困难的任务。这是因为为此类网络安全系统防御机制提供决策支持需要同时考虑攻击者和防御者之间的动态特征以及系统状态的动态特征化。此外,网络安全防御者通常面临各种资源限制,包括与成本、劳动力和时间相关的限制。即使有了AI,开发一个能够主动防御的系统仍然是一个理想目标。 为了解决这个问题,美国能源部太平洋西北国家实验室(PNNL)的研究人员开发了一种基于深度强化学习(DRL)的新型AI系统,能够在模拟环境中响应攻击者,并能在攻击升级之前阻止95%的网络攻击。研究人员创建了一个自定义的模拟环境,展示了网络中攻击者和防御者之间的多阶段数字冲突。然后,他们使用强化学习的原则训练了四个DRL神经网络,例如根据避免妥协和减少网络中断来最大化奖励。该团队的工作还在华盛顿特区的人工智能促进协会上做了介绍,并获得了很高的评价。 该团队开发这样一个系统的理念是首先展示成功训练这样一个DRL架构是可能的。在深入研究复杂结构之前,他们希望展示有用的评估指标。研究人员首先使用Open AI Gym工具包创建了一个抽象的模拟环境。下一阶段是利用这个环境开发攻击者实体,在MITRE ATT&CK框架的15种方法和7种策略的子集上展示出技能和持久性水平。攻击者的目标是通过从初始访问和侦察阶段到其他攻击阶段直到达到其最终目标——影响和外泄阶段的七个攻击链步骤。 需要记住的是,团队并没有打算开发一个模型,在敌人在环境内发动攻击之前就能封锁敌人。相反,他们假设系统已经被入侵。然后,研究人员使用强化学习来训练四个神经网络。研究人员表示,在不使用强化学习的情况下训练这样一个模型是可以想象的,但需要很长时间来开发一个良好的机制。另一方面,深度强化学习通过模仿人类行为的某些方面,非常有效地利用了这个巨大的搜索空间。 研究人员努力证明AI系统能够在模拟攻击环境中成功训练,并展示出AI模型能够实时对攻击做出防御反应。为了对四个无模型DRL算法在实际的多阶段攻击序列中的表现进行严格评估,研究人员进行了多次实验。他们的研究表明,DRL算法可以在具有不同技能和持久性水平的多阶段攻击配置文件下进行训练,在模拟环境中产生有效的防御结果。
Leave a Comment随着互联网和社交媒体的兴起,虚假新闻和误导信息的传播已经成为一个令人担忧的问题。因此,为解决这个问题,已经进行了大量的实验。近年来,大型语言模型(LLMs)作为检测和分类此类误导信息的潜在解决方案引起了广泛关注。 为了解决这个在互联网驱动的世界中出现的虚假新闻和误导信息的问题,威斯康星州立大学的研究人员进行了广泛的研究和实验。他们的研究重点是测试最先进的语言模型(LLMs)的能力,以确定新闻文章的真实性并识别虚假新闻或误导信息。他们主要关注了四个LLM模型:Open AI的Chat GPT-3.0和Chat GPT-4.0,Google的Bard/LaMDA和Microsoft的Bing AI。 研究人员对这些知名的大型语言模型(LLMs)在检测虚假新闻方面的准确性进行了彻底的研究。通过严格的实验,他们评估了这些先进LLM在分析和评估新闻文章以及区分真实和不可信信息方面的能力。 他们的研究结果旨在为LLMs如何对抗误导信息提供有价值的见解,从而最终帮助创建一个更值得信赖的数字环境。研究人员表示,他们之所以选择研究这篇论文,是因为他们有必要了解各种LLMs在对抗误导信息方面的能力和限制。此外,他们还表示,他们的目标是通过控制模拟和已建立的事实核查机构作为基准,对这些模型在分类事实和误导信息方面的能力进行严格测试。 为了进行这项研究,研究团队选取了100个由独立事实核查机构核实的新闻报道样本,并将它们分为以下三类:真实、虚假和部分真实/虚假,然后对这些样本进行建模。其目标是评估模型在准确分类这些新闻项目方面的表现,与独立事实核查机构提供的经核实事实相比较。研究人员分析了模型在将适当的标签准确分类到新闻报道上方面的能力,将其与那些独立的事实核查员提供的事实信息相一致。 通过这项研究,研究人员发现Open AI的GPT-4.0表现最佳。研究人员表示,他们对主要LLMs进行了比较评估,以区分事实和欺骗,其中Open AI的GPT-4.0表现优于其他模型。 然而,这项研究强调,尽管这些LLMs取得了进展,但人类事实核查员在分类虚假新闻方面仍然胜过它们。研究人员强调,尽管GPT-4.0表现出有希望的结果,但仍有改进的空间,而且这些模型需要改进以达到最大的准确性。此外,如果将它们应用于事实核查,还可以将它们与人类代理的工作结合起来。 这表明,虽然技术在不断发展,但识别和验证误导信息这一复杂任务仍然具有挑战性,需要人类的参与和批判性思维。
Leave a CommentChatGPT ChatGPT能够在不依赖现有代码参考的情况下编写代码。此外,它能够高效地调试用户的代码。通过引入代码解释器,ChatGPT扩展了其功能,包括自我测试自身代码的能力。 Bard Google的Bard和ChatGPT一样,能够以对话方式进行交互,适用于编写和调试代码。 GitHub Copilot GitHub Copilot是一种由人工智能驱动的代码补全工具,它分析上下文代码并通过建议相关的代码片段提供实时反馈和推荐。 Tabnine Tabnine是一种基于人工智能的代码补全工具,它为GitHub Copilot提供了一种替代方案。它在提供全功能的人工智能代码补全能力方面独具专长。 Code Snippets AI Code Snippets允许用户将问题转化为代码。它是一个集成了代码解释、代码片段库等功能的多合一工具。 MutableAI MutableAI是开发人员经常使用模板代码并希望具有高效自动完成能力的理想选择。它提供代码补全功能以及将代码整理和归类到逻辑组中的能力。 Cogram Cogram是一种SQL代码生成工具,允许用户使用自然语言编写高效的SQL查询。 Amazon CodeWhisperer CodeWhisperer也是由AWS开发的代码补全工具,它可以根据注释和现有代码进行智能补全。 Replit Replit是一个以浏览器为基础的在线编码平台。它的一个功能是Ghostwriter,根据上下文提供相关的代码建议。…
Leave a Comment在计算机视觉中,寻找图像中的对象一直是一个长期存在的任务。目标检测算法尝试通过在对象周围绘制一个框来定位对象,而分割算法则试图以像素级精确确定对象的边界。图像分割旨在根据语义含义或视觉特征将图像分割成不同的区域或对象。它在各种应用中至关重要,包括对象识别、场景理解、自动驾驶、医学成像等。 多年来,已经开发了许多方法和算法来解决这个具有挑战性的问题。传统方法使用手工设计的特征,而最近的进展则带来了以深度学习模型驱动的模型。这些现代方法已经取得了显著的进展,实现了最先进的性能,并在图像理解和分析方面开启了新的可能性。 然而,这些模型存在根本的局限性。它们受限于训练集中看到的对象,并且无法分割剩余的对象。 然后出现了完全改变图像分割游戏的Segment Anything Model (SAM)。它是一个开创性的视觉模型,能够根据用户交互提示在图像中分割任何对象。它基于在广泛的SA-1B数据集上训练的Transformer架构构建,表现出了显著的性能,并开启了一个被称为Segment Anything的新颖有趣的任务。凭借其普适性和潜力,它有望成为未来视觉应用的基石。 然而,SAM并非完美无缺。这种力量是有代价的,对于SAM来说,代价就是复杂性。它计算上过于耗费资源,这使得在实际场景中应用它变得具有挑战性。与SAM架构的核心部分——Vision Transformers (ViTs)有关的计算资源要求是与Transformer模型相关的计算资源要求。 有没有办法让SAM更快?答案是肯定的,它被称为FastSAM。 FastSAM是为了满足SAM模型在工业应用中的高需求而提出的。它成功地提高了SAM的执行速度,并使其能够应用于实际场景。 FastSAM大大加速了SAM的速度。来源:https://arxiv.org/pdf/2306.12156.pdf FastSAM将segment anything任务分解为两个顺序阶段:全实例分割和提示引导选择。第一阶段使用基于卷积神经网络(CNN)的检测器为图像中的所有实例生成分割掩模。在第二阶段,它输出与用户提示相对应的感兴趣区域。利用CNN的计算效率,FastSAM展示了实时segment anything模型的可实现性,而不会牺牲性能质量。 FastSAM概览。来源:https://arxiv.org/pdf/2306.12156.pdf FastSAM基于YOLOv8-seg,这是一个配备了受YOLACT方法启发的实例分割分支的目标检测器。通过将这个CNN检测器训练在仅占SA-1B数据集2%的数据上,FastSAM在大大降低计算需求的同时,实现了与SAM相当的性能。该方法在多个下游分割任务中证明了其有效性,包括在MS COCO上的对象提议,其中FastSAM在提议数量为1000个时的平均召回上超过了SAM,并在单个NVIDIA RTX 3090上运行速度快了50倍。
Leave a Comment最近,基于扩散的大规模文本到图像(T2I)模型改变了创建可视材料的学科。这些T2I模型使得生成引人注目、表达丰富且以人为中心的图形变得简单。这些模型的一个有趣的用途是能够使用自然语言描述生成与身份相关的各种情境,给定一个特定人的日常生活中的面部(我们的家人,朋友等)。与图1中所示的典型T2I任务不同,身份重情境挑战要求模型在遵循文本提示的同时保持输入面部识别(即ID保留)。 图1展示了DreamIdentity如何有效地从单个面部图像中创建大量保留身份和文本连贯的图像,并且无需在测试时进行优化。 为每个面部身份个性化预训练的T2I模型是一种可行的方法。它涉及通过增强其词嵌入或微调模型参数来学习将特定词与实质相关联。由于每个身份的优化,这些基于优化的方法可能更有效。为了避免耗时的每个身份的优化,各种无优化的方法建议将从预训练图像编码器(通常为CLIP)获得的图像特征直接映射到词嵌入中。然而,这会损害ID保留。因此,这些技术面临着损害原始T2I模型的编辑能力的风险,因为它们要么需要微调预训练的T2I模型的参数,要么改变原始结构以注入额外的网格图像特征。 简而言之,所有并行的无优化努力都在维持身份和模型的可编辑性方面遇到困难。它们认为,错误的身份特征表示和训练与测试之间的目标不一致是现有无优化研究中上述困难的根本原因。一方面,目前最佳的CLIP模型在面部识别准确性方面仍然比面部识别模型差得多(80.95%对87.61%),这表明并行努力中使用的常见编码器(即CLIP)对于身份重情境化任务来说是不足够的。此外,CLIP的最后一层特征主要关注高级语义而不是精确的面部描述,无法保持识别信息。 所有并行任务使用原始重建目标来学习词嵌入都会对输入面部的可编辑性产生负面影响。为了解决上述身份保留和可编辑性困难,他们提供了一种独特的无优化框架(称为DreamIdentity),具有准确的身份表示和一致的训练/推理目标。更准确地说,在Vision Transformer的架构中创建了一个独特的多词多尺度ID编码器(M2 ID编码器),用于正确的身份表示。该编码器在大规模的面部数据集上进行预训练,并将多尺度特征投影到多词嵌入中。 中国科学技术大学和字节跳动的研究人员提出了一种新颖的自我增强可编辑性学习方法,将编辑任务移入训练阶段。该方法使用T2I模型通过生成名人面孔和各种目标编辑的名人图像来构建自我增强数据集。使用这个数据集来训练M2 ID编码器以提高模型的可编辑性。他们在这项工作中做出了以下贡献:他们认为,由于错误的表示和不一致的训练/推理目标,现有的无优化方法对于身份保留和高可编辑性是无效的。 从技术上讲,(1)他们提出了M2 ID编码器,这是一个具有多嵌入投影的ID感知多尺度特征,用于适当的表示。(2)他们结合自我增强的可编辑性学习,使底层T2I模型能够为编辑提供高质量的数据集,以实现一致的训练/推理目标。通过全面的研究证明了他们的方法的有效性,这些方法能够在保持身份的同时允许灵活的文本引导修改,即身份重情境化。
Leave a Comment无论所从事的行业如何,人工智能(AI)和机器学习(ML)技术一直试图改善人们的生活质量。近年来,AI的一个主要应用是设计和创建能够在各个领域完成决策任务的代理人。例如,像GPT-3和PaLM这样的大型语言模型以及像CLIP和Flamingo这样的视觉模型在各自领域的零-shot学习方面表现出色。然而,训练这种代理人存在一个主要缺点。这是因为这些代理人在训练过程中表现出了环境多样性的固有属性。简单来说,为不同的任务或环境进行训练需要使用各种状态空间,这有时会妨碍模型在领域之间的学习、知识传递和泛化能力。此外,对于基于强化学习(RL)的任务,创建特定任务在各种环境中的奖励函数变得困难。 为解决这个问题,来自Google Research的团队研究了这些工具是否可以用于构建更通用的代理人。在他们的研究中,团队特别关注了文本引导的图像合成,其中将以文本形式呈现的期望目标输入给规划器,规划器创建一系列代表预期行动的帧序列,然后从生成的视频中提取控制行动。因此,谷歌团队在最近的论文中提出了一种名为“通过文本引导的视频生成学习通用策略”的UniPi策略,解决了环境多样性和奖励规范化方面的挑战。UniPi策略使用文本作为任务描述的通用接口,使用视频作为在各种情况下传达行动和观察行为的通用接口。具体来说,团队将视频生成器设计为一个规划器,该规划器接受当前图像帧和陈述当前目标的文本提示作为输入,生成以图像序列或视频形式的轨迹。然后,将生成的视频输入到一个逆动力学模型中,该模型提取执行的底层动作。这种方法的独特之处在于它允许利用语言和视频的通用性在不同环境中进行目标和任务的泛化。 在过去的几年中,在文本引导的图像合成领域取得了重大进展,产生了具有生成复杂图像能力的模型。这进一步激发了团队选择这个作为他们的决策任务。谷歌研究人员提出的UniPi方法主要包括四个组成部分:通过平铺实现轨迹一致性、分层规划、灵活的行为调节和任务特定的行动适应,以下分别进行详细描述: 1. 通过平铺实现轨迹一致性: 现有的文本到视频方法通常会产生具有不断变化的基础环境状态的视频。然而,确保环境在所有时间戳上保持恒定对于构建准确的轨迹规划器至关重要。因此,为了在条件视频合成中保持环境一致性,研究人员在合成视频的每一帧中提供观察到的图像,同时去噪。为了在时间上保留底层环境状态,UniPi直接将每个噪声中间帧与条件观察到的图像在采样步骤上进行连接。 2. 分层规划: 在复杂和复杂的环境中进行计划时,生成所有必要的动作很困难,这需要很多时间和措施。规划方法通过利用自然层次结构在较小的空间中创建粗略计划,并将其改进为更详细的计划来克服这个问题。同样,在视频生成过程中,UniPi首先在粗粒度级别上创建演示所需代理行为的视频,然后通过填补缺失的帧并使其更流畅来改进视频的逼真程度。这是通过使用一系列步骤的层次结构来完成的,每个步骤都会提高视频质量,直到达到所需的详细级别。 3. 灵活的行为调节: 在为较小的目标规划一系列动作时,可以轻松地包括外部约束以修改生成的计划。这可以通过结合反映计划属性的期望限制的概率先验来实现。先验可以使用学习的分类器或特定图像上的Dirac delta分布来描述,以引导计划朝特定状态发展。这种方法也与UniPi兼容。研究人员使用视频扩散算法训练了文本条件视频生成模型。该算法包括来自Text-To-Text Transfer Transformer(T5)的编码预训练语言特征。 4. 任务特定的行动适应: 一个小的反向动力学模型被训练,用一组合成的视频将视频帧转化为低级控制动作。这个模型是独立于规划器的,并且可以在由模拟器生成的一个独立的较小数据集上进行训练。反向动力学模型接收输入帧和当前目标的文本描述,合成图像帧,并生成一系列动作来预测未来的步骤。然后,一个代理执行这些低级控制动作,使用闭环控制。 总结一下,谷歌的研究人员通过展示使用基于文本的视频生成来表示能够实现组合泛化、多任务学习和现实世界转移的策略的价值,做出了令人印象深刻的贡献。研究人员在一些新颖的基于语言的任务上评估了他们的方法,并得出结论:与其他基线模型(如Transformer BC、Trajectory Transformer和Diffuser)相比,UniPi在已知和未知的语言提示组合上都具有很好的泛化能力。这些令人鼓舞的发现突显了利用生成模型和大量可用数据作为创建多功能决策系统的有价值资源的潜力。
Leave a Comment自然语言处理是人工智能系统正在迅速取得进展的领域之一,重要的是,这些模型需要经过严格的测试和引导,以降低部署风险。此前,针对这类复杂系统的评估指标主要集中在衡量语言理解或推理能力。但现在,模型正在被教授进行实际的交互式工作。这意味着基准需要评估模型在社交环境中的表现。 交互式代理可以在基于文本的游戏中进行测试。为了在这些游戏中取得进展,代理需要具备规划能力和理解自然语言的能力。在制定基准时,应该同时考虑代理的不道德倾向和技术天赋。 加利福尼亚大学人工智能安全中心、卡内基梅隆大学和耶鲁大学的一项新研究提出了Measuring Agents’ Competence & Harmfulness In A Vast Environment of Long-horizon Language Interactions(MACHIAVELLI)基准。MACHIAVELLI是评估代理在自然社交环境中规划能力的一项进展。该设置受到了choiceofgames.com上的基于文本的选择你的冒险游戏的启发,这些游戏是由实际人类开发的。这些游戏涉及高级决策,同时为代理提供现实目标,同时抽象了低级环境交互。 该环境报告代理行为的不诚实程度、较低的效用和追求权力等行为特征,以便监控不道德行为。团队通过以下步骤实现这一目标: 将这些行为操作化为数学公式 在游戏中密集注释社交概念,例如角色的幸福感 使用注释和公式为每种行为产生一个数值分数。 他们通过实证研究表明,GPT-4(OpenAI,2023)在收集注释方面比人类标注员更有效。 人工智能代理面临与人类相同的内部冲突。例如,为下一个标记预测训练的语言模型通常会生成有毒文本,为目标优化训练的人工代理通常会表现出不道德和追求权力的行为。通过鼓励代理行事道德,可以改善这种权衡。 团队发现,道德训练(引导代理更具道德)降低了语言模型代理的有害活动发生率。此外,行为规范化在两种代理中都限制了不良行为,而不会显著减少奖励。这项工作有助于开发值得信赖的顺序决策者。 研究人员尝试使用人工良心和伦理提示来控制代理。代理可以被引导显示较少的马基雅维利行为,尽管仍有很大的改进空间。他们主张更多地研究这些权衡,并强调扩大帕累托前沿,而不是追逐有限的奖励。
Leave a Comment