通过将多个活动合并为一条指令,指令调整增强了对新任务的泛化能力。这种对开放式问题的回应能力为最近的聊天机器人爆发做出了贡献,因为ChatGPT 2。最近,像CLIP-ViT这样的视觉编码器已经作为视觉指令调整模型的一部分添加到会话代理中,从而可以基于图片进行人-代理交互。然而,它们需要帮助理解图片中的文本,可能是由于训练数据中自然图像的占主导地位(例如,Conceptual Captions和COCO)。然而,阅读理解对人类的日常视觉感知至关重要。幸运的是,OCR技术使得能够从照片中识别出文字。 通过将识别到的文本添加到视觉指令调整模型的输入中(较大的上下文长度),可以(天真地)增加计算量,而不完全利用视觉编码器的编码能力。为了做到这一点,他们建议收集需要理解图片中的文字的指令遵循数据,以改进视觉指令调整模型的端到端性能。通过将手动给定的指示(例如,“识别提供的图像中可见的任何文本。”)与OCR结果相结合,他们首先使用文本丰富的图像收集了422K条嘈杂的指令遵循数据。 这些大规模的嘈杂对齐数据显著增强了语言解码器和视觉特征之间的特征对齐。此外,他们要求仅使用OCR结果和图像标题作为如何遵循指令的高质量示例,让纯文本GPT-4生成16K个对话。每个对话可能包含多轮的问答对。为了根据输入产生复杂的指令,这种方法要求GPT-4对OCR数据进行去噪,并创建独特的问题(图1)。他们使用获得的数据评估了LLaVA的预训练和微调阶段,分别使用嘈杂和高质量的示例来评估数据的有效性。 图1显示了如何收集关于遵循指令的准确统计数据。| https://arxiv.org/pdf/2306.17107.pdf 来自乔治亚理工学院、Adobe研究和斯坦福大学的研究人员开发了LLaVAR,即能够阅读的大型语言和视觉助手。为了更好地编码细微的文本特征,他们在原始LLaVA的基础上将输入分辨率从2242提高到3362进行了实验。根据评估技术,他们与四个基于文本的VQA数据集以及ScienceQA微调结果一起给出了研究结果。此外,他们在基于GPT-4的指令遵循评估中使用了来自LAION的50张文本丰富图片和来自COCO的30张自然图片。此外,他们还提供了定性分析,以衡量更复杂的指令遵循能力(例如海报、网站截图和推文)。 总之,他们的贡献包括: • 他们收集了16K条高质量和422K条嘈杂的指令遵循数据。两者都被证明可以改善视觉指令调整。这种改进的能力使得他们的模型LLaVAR能够基于多样的在线材料(包括文本和图片)进行端到端交互,同时仅在自然照片上略微提高模型的性能。 • 训练和评估数据以及模型里程碑都已公开提供。 这篇文章的英文原文发表在MarkTechPost网站上。
Leave a CommentTag: Technology
本文是“数据科学家的大一纪事”系列的第二部分请务必先阅读第一部分!这样做将帮助您与团队和利益相关者建立信任,以…
Leave a Comment大型语言模型(LLMs)在自然语言处理(NLP)和自然语言理解(NLU)领域已被证明非常有效。著名的LLMs如GPT,BERT,PaLM等被研究人员用于为教育、社交媒体、金融和医疗保健等各个领域提供解决方案。通过大规模数据集的训练,这些LLMs获得了大量的知识。LLMs在问题回答、内容生成、文本摘要、语言翻译等方面显示出了能力。尽管LLMs最近展示了令人印象深刻的能力,但在生成合理且无根据的信息以及在数值推理方面存在困难。 最近的研究表明,将LLMs与外部工具(包括检索增强、数学工具和代码解释器)相结合是克服上述挑战的更好方法。评估这些外部工具的有效性存在困难,因为当前的评估方法需要帮助确定模型是否仅仅是回忆预训练信息,还是真正利用外部工具进行问题解决。为了克服这些限制,来自佐治亚理工学院计算学院的研究团队引入了ToolQA,这是一个用于问题回答的基准测试,用于评估LLMs在使用外部资源方面的熟练程度。 ToolQA包含来自八个领域的数据,并定义了13种可以从外部参考语料库中获取信息的工具类型。每个ToolQA实例中都包含一个问题、一个答案、参考语料库和可用工具列表。ToolQA的独特之处在于,所有问题只能通过使用适当的工具从参考语料库中提取信息来回答,从而最大程度地减少LLMs仅基于内部知识回答问题的可能性,并允许对其工具利用能力进行忠实评估。 ToolQA涉及三个自动化阶段:参考数据收集、人工引导的问题生成和程序化答案生成。在第一阶段,从不同领域收集各种类型的公共语料库,包括文本、表格和图表,作为基于工具的问题回答的参考语料库。在第二阶段,创建只能通过工具而不是参考语料库解决的问题。这是通过基于模板的问题生成方法实现的,该方法还涉及使用工具属性进行问题实例化和人工引导的模板制作和验证。第三阶段为生成的问题提供准确的答案,实现与工具对应的运算符,并从参考语料库中以程序化方式获取答案。 团队使用标准LLMs和工具增强的LLMs回答ToolQA中的问题进行了实验。结果显示,仅依赖内部知识的LLMs(如ChatGPT和Chain-of-thoughts prompting)的成功率较低,易问题约为5%,难问题约为2%。另一方面,通过使用外部工具,工具增强的LLMs(如Chameleon和ReAct)表现更好,易问题的最佳表现为43.15%,难问题为8.2%。 结果和错误分析显示,ToolQA对于当前的工具增强的LLM方法来说是一个具有挑战性的基准测试,尤其对于需要更复杂的工具组合推理的困难问题。这是人工智能发展中的一个有希望的补充。
Leave a Comment大型语言模型(LLMs)近年来在自然语言理解方面取得了重大突破,尤其在零样本和少样本环境下,展示出卓越的语义理解、查询解决和文本生成能力。如图1(a)所示,已经提出了多种方法来使用LLMs处理涉及视觉的任务。光学编码器可以被训练成将每张图片表示为一系列连续的嵌入,让LLM能够理解它。另一种方法是使用对比训练的冻结视觉编码器,同时在冻结的LLM上添加额外的层,然后从头开始学习。 另一种方法建议训练一个轻量级的Transformer来对齐一个冻结的视觉编码器(经过对比训练的预训练)和一个冻结的LLM。尽管在上述研究中取得了进展,但仍然难以证明额外的预训练阶段的计算成本是合理的。此外,为了将视觉和语言模态与现有的LLM同步,需要大量的数据库,包括文本、照片和视频。Flamingo在预训练的LLM中增加了新的跨注意力层,以增加视觉特征。 图1:比较协调视觉和语言模态的方法。多模态预训练有两个选择:(a)使用配对或网络数据集;(b)LENS,一种无需额外多模态数据集就可以与任何现成的LLM一起使用的无预训练技术。与LENS不同,以前的方法需要在大规模多模态数据集上进行联合对齐预训练,以完成视觉任务。 多模态预训练阶段需要惊人的20亿个图片-文本对和4300万个网站,即使使用预训练的图像编码器和预训练的冻结LLM,也可能需要15天的时间。相反,他们可以使用各种“视觉模块”从视觉输入中提取信息,并生成详细的文本表示(如标签、属性、动作和关系等),然后直接将其馈送给LLM,避免了额外的多模态预训练的需要,如图1(b)所示。Contextual AI和斯坦福大学的研究人员引入了LENS(Large Language Models Enhanced to See),这是一种模块化策略,将LLM作为“推理模块”使用,并在不同的“视觉模块”之间运行。 他们首先使用预训练的视觉模块(如对比模型和图像字幕模型)在LENS技术中提取丰富的文本信息。然后将文本发送到LLM,使其能够进行对象识别、视觉和语言(V&L)等任务。LENS通过消除对额外多模态预训练阶段或数据的需求,免费地弥合了模态之间的差距。此外,这种整合使我们能够立即利用计算机视觉和自然语言处理领域的最新进展,最大限度地发挥两个学科的优势。 他们提供了以下贡献: • 他们提出了LENS,一种通过使用语言模型的少样本、上下文学习能力来处理计算机视觉挑战的模块化方法。 • LENS使任何现成的LLM都能够在不经过进一步的训练或数据的情况下进行视觉处理。 • 他们使用冻结的LLM来处理对象识别和视觉推理任务,无需额外的视觉和语言对齐或多模态数据。实验结果表明,他们的方法在零样本性能上与Kosmos和Flamingo等端到端联合预训练模型相媲美或更优。他们的论文的部分实现已经在GitHub上可用。
Leave a Comment合成数据,坦白说,就是假数据也就是说,它并不是来自你感兴趣的人群的真实数据(人群是数据科学中的技术术语,我在这里解释了它)它是…
Leave a Comment开放词汇物体检测是各种实际计算机视觉任务的关键方面。然而,检测训练数据的有限可用性和预训练模型的脆弱性经常导致表现不佳和可扩展性问题。 为了解决这个挑战,DeepMind研究团队在他们的最新论文“Scaling Open-Vocabulary Object Detection”中介绍了OWLv2模型。这种优化的架构提高了训练效率,并采用了OWL-ST自训练方法,大大增强了检测性能,并在开放词汇检测任务中取得了最先进的结果。 这项工作的主要目标是优化标签空间、注释过滤和开放词汇检测自训练方法的训练效率,最终在有限的标记数据下实现稳健且可扩展的开放词汇性能。 所提出的自训练方法包括三个关键步骤: 团队使用现有的开放词汇检测器对WebLI数据集进行开放框检测。 他们利用OWL-ViT CLIP-L/14对所有WebLI图像进行边界框伪注释。 他们使用人工注释的检测数据对经过训练的模型进行微调,进一步改进其性能。 值得注意的是,研究人员采用了OWL-ViT架构的变体来训练更有效的检测器。该架构利用对比训练的图像-文本模型来初始化图像和文本编码器,而检测头部则是随机初始化的。 在训练阶段,团队使用相同的损失函数,并从OWL-ViT架构中添加“伪负样本”来增强查询,以优化训练效率,最大限度地利用可用的标记图像。 他们还结合了先前提出的大规模Transformer训练方法,进一步提高了训练效率。结果,OWLv2模型将训练FLOPS降低了约50%,训练吞吐量提高了2倍,相比原始的OWL-ViT模型。 团队在实证研究中将他们提出的方法与先前最先进的开放词汇检测器进行了比较。OWL-ST技术将LVIS罕见类别的平均准确率(AP)从31.2%提高到44.6%。此外,将OWL-ST自训练方法与OWLv2架构结合起来,实现了新的最先进性能。 总体而言,本文提出的OWL-ST自训练方法通过利用大规模网络数据的弱监督,显著提高了检测性能,实现了面向开放世界的规模化训练。这种方法解决了标记检测数据稀缺性带来的局限,并展示了以可扩展的方式实现稳健的开放词汇物体检测的潜力。
Leave a Comment遠程會議、虛擬試穿、視頻遊戲等許多依賴於高保真數字人類的應用都需要模擬具有吸引力和逼真的服裝行為能力。基於物理法則的模擬是生成自然動態運動的一種常用方法。儘管物理模擬可以提供驚人的結果,但計算成本高、對初始情況敏感,並且需要有經驗的動畫師;頂尖的方法不能滿足實時應用所需的嚴格計算預算。基於深度學習的技術開始產生高效且高質量的結果。 然而,迄今為止,一些限制阻礙了這些方法充分發揮潛力。首先,目前的技術主要通過身體姿勢計算服裝變形並依賴線性混合蒙皮。雖然基於蒙皮的計劃可以為緊身衣物(如襯衫和運動服)提供令人印象深刻的結果,但對於連衣裙、裙子和其他寬鬆服裝等不完全模仿身體運動的服裝,它們需要幫助。重要的是,許多頂尖的基於學習的技術是特定於服裝的,只能預測捕捉到的特定服裝的變形。應用受到每件服裝都需要重新訓練這些技術的限制。 本研究由ETH蘇黎世聯邦理工學院和智能系統馬克斯·普朗克研究所的研究人員提供了一種獨特的方法,用於預測動態服裝變形的圖神經網絡(GNN)。通過對局部變形、壓力和加速度之間的關係進行邏輯推斷,他們的方法學習預測物理逼真的布料行為。由於其局部性,他們的方法直接推廣到任意身體形狀和運動,與服裝的整體結構和形狀無關。儘管GNN在取代基於物理的模擬方面表現出潛力,但將此思想應用於服裝模擬會產生不滿意的結果。使用GNN(實現為MLP)將給定網格的特徵向量和其一環鄰域進行本地轉換,然後使用每個轉換的消息來更新特徵向量。此過程的循環使信號在整個網格中傳播。然而,固定數量的消息傳遞階段將信號傳輸限制在一定半徑內。在建模服裝時,彈性波通過拉伸迅速流經材料,這導致頂點之間具有准全局和瞬間的長程耦合。步驟太少會減慢信號傳輸速度,並產生令人不舒服的過度拉伸瑕疵,使服裝看起來不自然且有彈性。增加計算時間是愚蠢地增加迭代的代價。 由於無法事先知道模擬網格的最大大小和分辨率,以便選擇保守且適當高的迭代次數,這只會加劇這個問題。他們建議在分層網絡上進行消息傳遞系統,交替在不同解析度的傳播階段中解決此問題。這允許在大尺寸下有效處理由於硬拉伸模態引起的快速移動波,同時在更細的尺度上提供描述褶皺和皺紋等局部細節所需的關鍵。通過測試,他們展示了他們的圖表示如何在相同的計算預算下提高預測。 通過採用隱式時間步進的增量潛力作為損失函數,他們將基於圖的神經網絡的思想與不同的模擬方法結合起來,以增加他們方法的泛化能力。由於這種形式,他們不再需要任何地面真實(GT)註釋。這使得他們的網絡可以完全無監督地訓練,同時學習多尺度服裝動力學、材料參數的影響、碰撞反應以及與底層身體的摩擦接觸。圖形表示還使我們能夠模擬運動中的襯衫解扣和具有不同和變化的拓撲的服裝。 他們的HOOD方法結合了圖神經網絡、多層消息傳遞和無監督訓練,可以實時預測各種服裝風格和身體類型的逼真服裝動態。他們實驗性地證明,與頂尖方法相比,他們的方法在靈活性和廣泛性方面具有戰略優勢。特別是,他們展示了單一訓練網絡: 有效預測了各種服裝的物理逼真動態運動。 對於在訓練期間未見過的新款式和形狀具有泛化能力。 允許運行時更改材料屬性和服裝尺寸。 支持開啟拉鍊或解扣襯衫等動態拓撲變化。 研究人員已在GitHub上提供了模型和代碼,供研究使用。
Leave a CommentMeta AI,一家领先的人工智能(AI)研究机构,最近发布了一种具有突破性的算法,承诺将彻底改变机器人领域。在他们的研究论文《从人类视频中获取作为机器人多功能表示的可供性》中,作者探讨了将YouTube视频应用于机器人学习和复制人类动作的强大训练工具。通过利用在线教学视频的丰富资源,这种尖端算法旨在弥合静态数据集和真实世界机器人应用之间的差距,使机器人能够以更大的多样性和适应性执行复杂任务。 这种创新方法的核心是“可供性”概念。可供性代表对象或环境提供的潜在行为或互动。通过通过分析人类视频来训练机器人理解和利用这些可供性,Meta AI的算法为机器人提供了一个多功能表示,用于执行各种复杂任务。这一突破提高了机器人模仿人类动作的能力,并赋予它们在新的和不熟悉的环境中应用所获得的知识的能力。 为了确保将这种基于可供性的模型无缝集成到机器人的学习过程中,Meta AI的研究人员将其纳入了四种不同的机器人学习范式中。这些范式包括离线模仿学习,探索,目标条件学习和强化学习的动作参数化。通过将可供性识别的能力与这些学习方法相结合,机器人可以获得新的技能,并以更高的精度和效率执行任务。 为了有效地训练可供性模型,Meta AI利用大规模的人类视频数据集,如Ego4D和Epic Kitchens。通过分析这些视频,研究人员使用现成的手-物体交互检测器来识别接触区域并跟踪接触后手腕的轨迹。然而,当场景中的人物存在时,会出现一个重要挑战,即分布转移。为了克服这个障碍,研究人员利用可用的相机信息将接触点和接触后轨迹投影到一个与人无关的框架中,然后将其作为输入提供给他们的模型。 在这一突破之前,机器人在模仿动作方面的能力有限,主要局限于复制特定环境。然而,通过Meta AI的最新算法,在泛化机器人动作方面取得了重大进展。这意味着机器人现在可以在新的和不熟悉的环境中应用所获得的知识,展示出更高的适应性。 Meta AI致力于推进计算机视觉领域的发展,并促进研究人员和开发人员之间的合作。根据这一承诺,该组织计划共享其项目的代码和数据集。通过使这些资源对其他人可访问,Meta AI旨在鼓励对这项技术进行进一步的探索和开发。这种开放的方法将促进自学习机器人的发展,它们可以从YouTube视频中获得新的技能和知识,推动机器人领域进入新的创新领域。
Leave a Comment在一系列前所未有的事件中,一种名为Zeroscope的下一代开源AI模型已经在市场上推出,具备在现代图形卡上运行最先进的文本到视频服务的能力,并且以相对较低的成本提供给用户。中国的Modelscope旗下的Zeroscope旨在通过解锁新的AI用例,彻底改变媒体和视频创作领域。 了解Zeroscope的功能组成对于理解它如何通过文本革新视频生成领域非常重要。这个开源模型的独特之处在于它的两个关键组件,Zeroscope V2和Zeroscope V2XL;Zeroscope_v2 567w,用于以576×320像素的分辨率快速创建内容以探索视频概念。然后可以使用zeroscope_v2_XL将高质量视频升级到“高清”分辨率1024×576,因此用户可以使用ZeroScope V2快速创建视频,然后使用V2XL进行升级。 除此之外,由于多级模型的17亿个参数,Zeroscope的要求令人惊讶地易于管理。Zeroscope在较低分辨率下的VRAM需求为7.9千兆字节,而在较高分辨率下为15.3千兆字节。较小的模型可以在许多标准图形卡上执行,使其可供更广泛和更一般的用户使用。 Zeroscope通过对近10,000个剪辑和近30,000个帧进行偏移噪声的战略训练。这种非传统的行为组合为Zeroscope开启了新的机遇和可能性。通过引入随机物体移动、帧时序的微小变化和轻微扭曲等变化,模型改善了对数据分布的理解,从而帮助模型以多样化的尺度生成更真实的视频,并有效地解释文本描述中微妙的变化。凭借所有这些功能,Zerscope迅速成为商业文本到视频模型提供商Runway的有力竞争对手。 文本到视频作为一项工作仍在进展中,生成的视频片段往往较短且存在一些视觉缺陷。然而,如果我们看一下图像AI模型的发展历程,它们在达到照片逼真质量之前也面临了类似的挑战。主要挑战是视频生成在训练和生成阶段都需要更多的资源。 Zeroscope作为一种强大的文本到视频模型的出现为许多新的数字进展和用例铺平了道路,例如: 个性化游戏、虚拟现实和元宇宙:Zeroscope的转换能力可以重新定义视频游戏中的故事叙述。玩家可以通过他们的话语实时影响剪辑和游戏玩法,实现难以想象的互动和个性化。此外,游戏开发者可以快速原型和可视化游戏场景,加快开发速度。 个性化电影:Zeroscope的技术通过基于用户描述生成个性化内容来颠覆媒体行业。用户可以输入情节或场景描述,并根据其回应创建个性化视频。此功能可以实现观众的积极参与,并为定制内容创作开辟了新的途径,例如个性化视频广告或用户定制的电影场景。 合成创作者:Zeroscope为依靠AI将其想法编写、制作和编辑成现实的新一代创作者铺平了道路。它消除了视频创作中的技术技能障碍,并有可能为自动化、高质量的视频内容建立新的标准。人类和AI创作者之间的界限变得模糊,拓宽了创造力的领域。 Zeroscope旨在成为一种轻量级的突破性模型,可以轻松进行微调,并且不需要特殊的资源设置,使其不仅成为多个普通用户可以使用的工具,而且许多缺乏大型实验室资源的新兴研究人员现在可以使用此类算法来更好地理解它们并以合理的成本推进整个领域的发展。看到激烈竞争将激励Zeroscope的创作者创新并占据强劲的市场地位将是令人惊叹的。
Leave a Comment多模态大型语言模型(MLLMs)在各种活动中已经展示了成功,包括语言、视觉和视觉语言任务。在零样本和少样本条件下,MLLMs可以感知文本、图片和音频等通用模态,并使用自由形式的文本生成答案。在本研究中,它们使多模态大型语言模型具备自我定位的能力。对于视觉语言任务,定位能力可以提供更实用和有效的人工智能界面。该模型可以解释图片区域及其地理坐标,让用户可以直接指向图像中的物品或区域,而不是输入冗长的文本描述来引用它。 图1:展示了使用KOSMOS-2生成的选定样本。视觉定位、定位问题回答、使用边界框的多模态引用、定位图片字幕和视觉定位都是一些例子。 该模型的定位功能还使其能够提供视觉响应(即边界框),这可以帮助其他视觉语言任务,如理解指代表达式。与仅基于文本的响应相比,视觉响应更精确,能够消除指代模糊。生成的自由形式文本响应的定位能力可以将名词短语和指代术语与图片区域连接起来,以产生更准确、丰富和详尽的响应。微软研究的研究人员介绍了具备定位能力的多模态大型语言模型KOSMOS-2,该模型基于Transformer通过下一个单词预测任务进行训练。 他们构建了一个基于网络规模的数据集,其中包含了图片和文本的定位配对,并将其与KOSMOS-1中的多模态语料库进行整合,以充分利用定位的潜力训练模型。定位的图片和文本配对是来自LAION-2B和COYO-700M的子集。他们提供了一个流程,从字幕中提取和连接文本片段(如名词短语和指代表达式)到图片中相应对象或区域的空间位置(如边界框)。他们将边界框的地理坐标转化为一串位置标记,并在相应的文本片段之后添加。数据格式充当了将图像元素与字幕链接起来的“超链接”。 实验结果表明,KOSMOS-2在定位任务(短语定位和指代表达理解)和指代任务(指代表达式生成)上表现优秀,并且在KOSMOS-1评估的语言和视觉语言任务上也表现出竞争力。图1说明了通过定位功能,KOSMOS-2可以用于更多的下游任务,如定位图片字幕和定位视觉问题回答。GitHub上提供了在线演示。
Leave a Comment多年来,文本到图像生成领域得到了广泛的探索,并取得了重要进展。研究人员通过在大规模数据集上训练大规模模型,实现了零样本文本到图像生成,能够处理任意文本输入。DALL-E和CogView等开创性作品为研究人员提出了许多方法,使得生成与文本描述对齐的高分辨率图像成为可能,展现了卓越的保真度。这些大规模模型不仅革新了文本到图像生成,还对包括图像处理和视频生成在内的其他各种应用产生了深远影响。 尽管上述大规模文本到图像生成模型在生成与文本对齐的创造性输出方面表现出色,但在生成用户指定的新颖和独特概念时往往面临挑战。因此,研究人员探索了各种方法来定制预训练的文本到图像生成模型。 例如,一些方法涉及使用有限数量的样本对预训练生成模型进行微调。为了防止过拟合,采用不同的正则化技术。其他方法旨在将用户提供的新概念编码为单词嵌入。这种嵌入可以通过优化过程或来自编码器网络获得。这些方法使得能够根据用户输入文本定制生成新概念,同时满足额外的要求。 尽管文本到图像生成取得了重大进展,但最近的研究引发了对正则化方法在定制化方面潜在局限性的担忧。有人怀疑这些正则化技术可能会无意中限制定制化生成的能力,导致细节的丢失。 为了克服这一挑战,提出了一种新颖的框架ProFusion。其架构如下所示。 ProFusion包括一个称为PromptNet的预训练编码器,它从输入图像和随机噪声中推断出条件词嵌入,以及一种称为Fusion Sampling的新型采样方法。与先前的方法相比,ProFusion在训练过程中消除了对正则化的要求。相反,该问题在推理过程中通过Fusion Sampling方法有效地解决。 实际上,作者认为,尽管正则化可以实现受文本条件限制的内容创作,但它也会导致细节信息的丢失,从而导致性能下降。 Fusion Sampling在每个时间步骤包括两个阶段。第一步是融合阶段,它将输入图像嵌入和条件文本的信息编码为带有噪声的部分输出。之后,进行改进阶段,根据选择的超参数更新预测。更新预测有助于Fusion Sampling保留输入图像的细节信息,并将输出条件化为输入提示。 这种方法不仅节省了培训时间,还消除了与正则化方法相关的超参数调整的需要。 下面报告的结果不言自明。 我们可以看到ProFusion与最先进的方法进行了比较。提出的方法在保留与面部特征相关的细节方面表现优异。 这就是ProFusion的摘要,一种具有最先进质量的无正则化框架,用于文本到图像生成。如果您感兴趣,可以在下面的链接中了解更多关于这种技术的信息。
Leave a Comment在一份名为“希望、恐惧和人工智能”的报告中,The Verge揭示了其最新“信任调查”的结果,揭示了美国消费者对人工智能(AI)的意见和看法。与Vox Media合作,该研究旨在深入探讨生成式AI工具的快速崛起和广泛采用。这是关于大型科技公司态度的第四次信任调查系列,之前的研究分别在2017年、2020年和2021年进行。此次合作旨在全面了解成年美国人如何利用和思考人工智能。 了解人工智能的影响:来自2000多名美国人的见解 根据2023年4月对超过2000名受访者的样本进行调查,Vox Media与洞察数据叙事咨询公司The Circus合作,揭示了各种关键见解。该研究探讨了美国人使用人工智能工具的情况,以及推动最快采用的人工智能工具。它还研究了人们对AI在工作场所潜在破坏的看法,对AI作出的社会变革的期望等。 还阅读:人工智能会取代人类吗? The Verge:技术与社会交汇点的可靠来源 The Verge的主编Nilay Patel强调:“The Verge继续成为了解技术如何影响人们的目的地,而今年没有比AI更重要的故事了。”作为技术新闻界的权威,The Verge已经确立自己作为理解新兴技术对社会影响的可靠来源。随着AI在各个领域的讨论中占据中心舞台,The Verge的最新报告具有重要的相关性,并提供了宝贵的见解。 AI采纳:美国人中的普遍趋势 《希望、恐惧和人工智能》报告显示,三分之一的美国人18岁及以上已经使用过生成式AI工具。人工智能已经成为讨论的主要话题,44%的受访美国人表示在他们的讨论中“每周多次”提到了人工智能。值得注意的是,与Z一代相比,人工智能相关的讨论在Z一代中最为频繁,61%的人定期接触到人工智能相关的讨论。 还阅读:生成式人工智能可能不适用于所有人:《财富》500强首席执行官调查 透明的人工智能:消费者对披露的需求 调查结果还揭示了消费者对人工智能使用的期望。78%的受访者表示希望在数字内容中清楚披露人工智能的使用情况。这凸显了在以人工智能驱动的技术领域中透明度和问责制的重要性日益增加。消费者希望得到信息和授权,以便每天与他们互动的人工智能系统做出明智的决策。 还阅读:美国国会采取行动:两项新法案提议对人工智能进行监管 破坏和适应:人工智能对工作场所的影响 近一半(47%)的受访消费者认为人工智能将会在他们所在行业中产生重大或适度的破坏。这一发现凸显了人工智能在各个行业中具有变革潜力的日益认可。随着人工智能不断发展和渗透到工作的不同方面,专业人士正在为即将到来的变化做好准备。此外,研究表明,69%的受访者认为社会必须进行重大变革,以适应后人工智能时代。 还阅读:人工智能的迅速崛起导致失业:科技行业受影响的人数达到数千人…
Leave a Comment以色列著名的安全机构Shin Bet已经采用人工智能(AI)的力量来增强其行动,并成功地消除了重大威胁。Shin Bet主任Ronen Bar强调了生成AI在执法领域的显著潜力。这一发展标志着利用先进技术来维护国家安全的重要进步。 推荐阅读:英国领先:举办首届全球人工智能峰会 Shin Bet自己的生成AI平台 效仿ChatGPT和Bard,Shin Bet采取了积极的态度,创建了自己的生成AI平台。这种先进的技术是以色列的美国联邦调查局(FBI)或英国MI5的重要工具,使他们能够主动识别和减轻潜在威胁。 推荐阅读:Chatgpt-4与谷歌Bard的对比 AI在Shin Bet行动中的自然整合 在特拉维夫大学举办的网络周会议上的演讲中,主任Ronen Bar表示了他对将AI技术无缝地融入Shin Bet干预行动的热情。他强调,机构已经成功地利用AI的力量识别出许多威胁。这种整合通过高效地检测监视数据中的异常和筛选大量情报,使Shin Bet的工作更加顺利。 AI作为决策中不可或缺的合作伙伴 通过强调AI技术的多功能性,主任Bar强调了它在决策中的次要角色。AI是一个可信赖的合作伙伴,类似于副驾驶员,协助Shin Bet人员做出明智的选择。通过利用AI的能力,Shin Bet最大限度地发挥了应对复杂安全挑战的潜力。 推荐阅读:OpenAI探索类似于维基百科的模型以民主化人工智能决策 促进负责任的AI发展合作 认识到AI技术的公共领域性质,Bar主任强调了商业高科技部门和政府机构之间合作的重要性。他强调了合作的必要性,以确保AI的演进而不是革命。通过促进这些利益相关者之间的共生关系,以色列可以充分发挥AI的潜力,同时坚持道德和负责任的做法。 推荐阅读:OpenAI和DeepMind与英国政府合作推进AI安全和研究 对全面AI监管的需要…
Leave a Comment在MosaicML-7B取得巨大成功之后,MosaicML再次超越了他们之前设定的基准。在这个新的突破性发布中,MosaicML推出了MosaicML-30B。 MosaicML是一个非常精确和强大的预训练transformer。MosaicML声称,MosaicML-30B甚至比ChatGPT3更好。 MosaicML-30B发布之前,MosaicML-7B已经席卷了人工智能界。MPT-7B的基础指导、基础聊天和故事创作都取得了巨大的成功。公司声称,这些模型在全球下载了300多万次。推动MosaicML推出更好的引擎(如MPT-30B)的最大原因之一是社区对他们之前发布的模型的热衷。 令人难以置信的是,社区如何运用这些MPT引擎构建出更好的调整并提供具体的使用案例。一些有趣的案例包括LLaVA-MPT。LLaVa-MPT将视觉理解添加到预训练的MPT-7B中。 类似地,GGML优化MPT引擎以在Apple Silicon和CPU上更好地运行。GPT4ALL是另一个使用案例,它让您使用MPT作为基础引擎运行类似于GPT4的聊天选项。 仔细观察,MosaicML能够给大公司带来激烈竞争和更好的替代品的最大原因之一是他们提供的竞争性特性列表以及他们的模型相对于不同用例的适应性和相对简单的集成。 在这个发布中,MosaicML还声称他们的MPT-30B比现有的ChatGPT3表现更好,但使用的参数数量只有ChatGPT的三分之一,使其成为相对于现有生成解决方案来说非常轻量级的模型。 它比MosaicML现有的MPT-7B更好,并且这个MPT-30B可以在商业许可下进行商业使用。 不仅如此,MPT-30B还带有两个预训练模型,即MPT-30B-Instruct和MPT-30B-Chat,这两个模型能够受到单个指令的影响,并且能够进行较长时间的多轮对话。 它之所以更好的原因还有很多。MosaicML设计MPT-30B采用自下而上的方法,确保每个移动部件都能更好地执行和更高效地运行。MPT-30B通过8k个标记上下文窗口进行训练。它通过ALiBi支持更长的上下文。 借助FlashAttention,它改进了训练和推断性能。MPT-30B还具备更强的编码能力,这要归功于他们所处理的数据的多样性。该模型在Nvidia的H100上扩展到了8K的上下文窗口。该公司声称,就他们所知,这是在H100上进行训练的第一个LLM模型,而这些模型对于客户来说是随时可用的。 MosaicML还保持了模型的轻量级,这有助于新兴组织降低运营成本。 MPT-30B的大小也是特意选择的,以便在单个GPU上轻松部署。1xA100-80GB以16位精度或1xA100-40GB以8位精度可以运行该系统。其他相当的LLMs,如Falcon-40B,具有更大的参数数量,并且不能在单个数据中心GPU上提供服务(今天);这就需要2个或更多的GPU,从而增加了最低推理系统成本。
Leave a Comment自从Transformer设计被发现以来,训练大型人工神经网络的技术已经取得了巨大进展,但支撑这一成就的科学仍处于萌芽阶段。在Transformer发布的同时,一种秩序感逐渐形成,这种秩序在同一时间的大量复杂结果中展现出来,表明性能随着计算量或网络规模的增加而可预测地提高,这种现象现在被称为缩放定律。这些缩放规则成为后续深度学习规模研究的指南,而对这些定律变化的发现导致了性能的大幅提升。 在本文中,研究者探讨了如何通过不同的方式提高数据质量。高质量的数据可以产生更好的结果;例如,数据清洗是创建当前数据集的关键步骤,可以使数据集相对较小或能够通过更多迭代运行数据。最近针对TinyStories的研究表明,高质量数据的好处远不止于此。通过大幅改变缩放定律,改善数据质量可能使得能够用更瘦的训练/模型匹配大规模模型的性能。 在本研究中,微软研究的作者证明了高质量的数据可以进一步提高大型语言模型的最先进技术,同时显著减少数据集的大小和训练计算量。较小的模型需要更少的训练,可以大大减少LLM的环境成本。他们从文档字符串中构建了特定的Python函数,使用LLM进行编码训练。HumanEval是后一篇论文中建议使用的评估标准,常用于比较LLM在代码上的性能。 他们通过对1.3B参数模型进行大约8次7B令牌(略大于50B总令牌数)的预训练,然后对少于2亿个令牌进行微调,展示了高质量数据违反现有缩放规则的能力。总的来说,他们在“课本质量”的数据上进行预训练,包括人工创造的(使用GPT-3.5)和从网络来源筛选的,然后在“类似于课本的练习”数据上进行微调。尽管数据集和模型大小都比竞争模型小几个数量级,但他们在HumanEval上获得了50.6%的pass@1准确率,在MBPP(Mostly Basic Python Programs)上获得了55.5%的pass@1准确率,这是仅使用一个LLM生成的最佳自我报告数字之一。 通过对1.3B参数模型进行大约8次7B令牌的预训练(观察总令牌数略大于50B),然后对少于2亿个令牌进行微调,他们展示了高质量数据违反现有缩放规则的能力。总的来说,他们在“课本质量”的数据上进行预训练,包括人工创造的(使用GPT-3.5)和从网络来源筛选的,然后在“类似于课本的练习”数据上进行微调。尽管数据集和模型大小都比竞争模型小几个数量级,但他们在HumanEval上获得了50.6%的pass@1准确率,在MBPP(Mostly Basic Python Programs)上获得了55.5%的pass@1准确率,这是仅使用一个LLM生成的最佳自我报告数字之一。
Leave a Comment弄清楚基本事情,例如数据中的列是什么,原始数据类型是什么,数据的描述性统计信息对于正确地处理数据非常重要…
Leave a Comment近几个月,由于大规模语言模型(LLMs)的广泛公开部署,倡导者、政治家和来自各个学科的学者都表现出了极大的兴趣和活动。虽然这种关注是有道理的,因为新技术带来了紧迫的问题,但它也可能忽略了一些关键因素。 最近,大规模语言模型以及基于它们构建的产品,例如ChatGPT,引起了来自记者、政策制定者和跨学科学者的广泛关注。然而,由于这种技术在很多方面都是出人意料的,简明扼要的解释很容易忽略关键细节。 这其中有八个意想不到的方面: LLMs的能力将随着更多的投资而可预测地增加,即使没有刻意的创新。 LLMs的研究和投资的最近增加可以在很大程度上归因于规模定律的结果。当研究人员增加将来模型中输入的数据量、模型的大小(以参数为单位)以及用于训练它们的计算量时,规模定律允许他们精确地预测这些模型将具有多么有能力(以FLOP为单位)的某些粗略但相关的指标。因此,他们可能做出一些关键的设计决策,例如在特定预算内的最佳模型大小,而无需进行大量昂贵的实验。 在当代人工智能研究的背景下,预测的准确率是前所未有的。由于它使研发团队能够提供数百万美元的模型培训计划,并确信这些项目将成功开发出经济上有益的系统,因此它也是推动投资的有力工具。 尽管最先进的LLMs的训练方法尚未公开,但最近的深入报告暗示这些系统的基本架构甚至没有改变。 随着资源不断注入LLMs,常常会出现意想不到的关键行为。 在大多数情况下,模型正确预测未完成文本的延续能力(根据其预训练测试损失衡量)只能通过缩放规则来预测。 尽管这个指标平均上与模型在许多实际活动中的实用性相关,但很难预测模型何时开始展示特定的才能或成为执行特定任务的能力。 更具体地说,GPT-3的能力执行少量样本学习——也就是在单次交互中从少量示例中学习新任务——以及思维链推理——也就是在请求时写出其推理,如同学生在数学考试上所做的那样,并展示出更好的表现——使其成为第一个现代LLM。 未来的LLMs可能会开发出所需的任何功能,并且很少有被普遍接受的界限。 然而,LLMs所取得的进展有时比专家预期的要少。 LLMs经常获取并使用外部世界的表示。 越来越多的证据表明,LLMs建立了世界的内部表示,使它们能够以对文本的特定语言形式不敏感的抽象层次进行推理。这种现象的证据在最大和最新的模型中最为强烈,因此应该预计在更大规模的系统中,这种现象将变得更加强大。 然而,当前的LLMs需要更加有效地做到这一点。 以下发现基于各种实验技术和理论模型,支持这种说法。 模型的内部颜色表示与人类感知颜色的实证发现高度一致。 模型可以推断作者的知识和信念,预测文档的未来走向。 故事用于告诉模型,然后模型会改变其对故事中所代表的对象的特征和位置的内部表示。 有时,模型可以提供如何在纸上描绘奇怪事物的信息。 许多常识推理测试都被模型通过了,即使是像Winograd Schema Challenge这样的测试,也没有任何文本提示答案。 这些发现反驳了传统智能模型仅仅是统计下一个词的预测器,并且无法推广其学习或推理超越文本的普遍观点。…
Leave a CommentAI幻觉并非新问题。人工智能(AI)在过去几年取得了显著进展,变得更加熟练,可以执行以前只能由人类完成的活动。然而,幻觉是一个对AI构成了巨大障碍的问题。开发者已经警告,AI模型产生完全错误的事实并用虚构的答案回答问题,似乎这些答案是真实的,这可能会危及应用程序的准确性、可靠性和信任度,因此幻觉是开发和部署AI系统的严重障碍。因此,从事AI工作的人正在积极寻求解决这个问题的方法。本文将探讨AI幻觉的影响和影响,以及用户可能采取的减少接受或传播不正确信息的危险的措施。 什么是AI幻觉? 所谓人工智能幻觉的现象是指AI模型产生了预期之外的结果。请注意,一些AI模型已经被教导了有意地制造没有与现实世界输入(数据)相关联的输出。 幻觉是用来描述当AI算法和深度学习神经网络创建结果不是真实的、不匹配算法接受过的任何数据或没有遵循任何其他可辨别的模式的情况。 AI幻觉可以采取许多不同的形式,从制造虚假新闻报道到虚假的关于人、历史事件或科学事实的断言或文件。例如,像ChatGPT这样的AI程序可以制造一个有完整传记和从未真实存在的成就的历史人物。在当前社交媒体和即时通信的时代,一个单一的推文或Facebook帖子可以在几秒钟内达到数百万人,这种不正确信息传播的潜力尤其令人担忧。 为什么会发生AI幻觉? 具有欺骗AI程序使其误分类的输入数据——对抗性示例——可能会导致AI幻觉。例如,开发人员使用数据(例如图像、文本或其他类型)来训练AI系统;如果数据被改变或扭曲,应用程序将以不同的方式解释输入并产生不正确的结果。 使用编码器-解码器(输入-输出)序列,AI中的变压器是一种深度学习模型,它利用自我关注(语句中单词之间的语义联系)创建类似于人类写作的文本。对于幻觉而言,如果语言模型的训练数据和资源充足且准确,那么预期输出将是虚构的和错误的。语言模型可能会产生一个故事或叙述,没有不合逻辑的间隙或模糊的联系。 发现AI幻觉的方法 作为人工智能的一个子领域,计算机视觉旨在教会计算机从视觉输入(例如图片、绘画、电影和现实生活)中提取有用的数据,它正在培训计算机像人类一样看待世界。但是,由于计算机不是人类,它们必须依靠算法和模式来“理解”图片,而不是直接接触人类感知。因此,人工智能可能无法区分薯片和落叶。这种情况也经过了常识测试:与人类可能看到的相比,AI生成的图像。当然,随着AI变得更加先进,这变得越来越困难。 如果人工智能没有迅速融入日常生活,这一切都会显得荒谬和有趣。自动驾驶汽车已经采用了人工智能,其中幻觉可能导致死亡。虽然这还没有发生,但在实际世界中开车时误认物品是一场灾难,只等发生。 在使用流行的AI应用程序时,以下是几种识别AI幻觉的技术: 1. 大型语言处理模型 像ChatGPT这样的大型处理模型生成的信息中的语法错误是罕见的,但当它们发生时,你应该对幻觉持怀疑态度。同样,当生成的文本内容不合理、不符合提供的上下文或与输入数据不匹配时,应该对幻觉持怀疑态度。 2. 计算机视觉 人工智能有一个子领域叫做计算机视觉,机器学习和计算机科学,它使机器能够像人眼一样检测和解释图像。它们依赖于卷积神经网络中的大量视觉训练数据。 如果用于训练的视觉数据模式发生变化,就会出现幻觉。例如,如果计算机还没有接受过网球的图像训练,它可能会错误地将网球识别为绿色或橙色。如果计算机错误地将站在人类雕像旁的马识别为真实的马,它也可能会产生AI幻觉。 将产生的输出与人类预期观察到的输出进行比较,将帮助您识别计算机视觉幻觉。 3. 自动驾驶汽车 由于人工智能的推动,自动驾驶汽车在汽车工业中越来越受欢迎。自动驾驶汽车的先驱们,如福特的BlueCruise和特斯拉的Autopilot,推动了这一计划。通过查看特斯拉Autopilot感知的方式和内容,您可以了解一些关于人工智能如何支持自动驾驶汽车的知识。 幻觉对人类和人工智能模型的影响是不同的。人工智能幻觉是错误的结果,与现实极不一致或在提供的提示的情况下毫无意义。例如,AI聊天机器人可能会因噪声或其他结构问题而以语法或逻辑上不正确的方式回答,或错误地识别一个对象。…
Leave a Comment美国人工智能芯片初创公司 SiMa.ai 宣布其第一代 AI 芯片进入量产,取得了重大突破。SiMa.ai 利用 TSMC 16 纳米技术,旨在将 AI 革命带到工业世界。SiMa.ai 的 MLSoC(芯片上的机器学习系统)与传统方法不同,它专门为边缘计算而设计,而非采用一刀切的芯片。这一重大进展为工业领域的变革未来奠定了基础。 也可阅读:一家台湾公司如何成为现代 AI 的支柱? 通过 AI 和机器学习推进工业世界进入 21 世纪 SiMa.ai 的创始人兼 CEO Krishna…
Leave a Comment人工智能和机器学习领域正在快速发展,这要归功于它们在几乎所有行业中的惊人能力和用例。随着人工智能逐渐被整合到不同领域中,并且愈发受到欢迎,也出现了与之相关的问题和限制。根本原因分析(RCA)是一种发现问题根本原因以找到最佳解决方案的方法。它有助于确定模型中事件或故障的深层原因。在IT运营、电信等领域,尤其是在人工智能领域,模型的复杂性经常导致事件降低了产品系统的可靠性和有效性。通过RCA的帮助,该方法寻找多个因素并建立它们之间的因果关系,以期为这些情况提供解释。 最近,Salesforce AI的一组研究人员推出了PyRCA,这是一个针对人工智能运维(AIOps)领域的根本原因分析(RCA)的开源Python机器学习库。PyRCA提供了一个全面的框架,使用户能够独立地找到指标和事件根本原因之间的复杂因果关系。该库提供了图形构建和评分操作,并具有支持多种广泛使用的RCA模型的统一接口,同时提供了快速模型创建、测试和部署的简化方法。 这个根本原因分析的全面Python库提供了一个端到端的框架,包括数据加载、因果图发现、根本原因定位和RCA结果可视化。它支持多个模型来创建图形和评分根本原因,并帮助用户快速加载相关数据并识别各种系统组件之间的因果联系。PyRCA带有一个GUI仪表板,使交互式RCA更加容易,从而提供了更流畅的用户体验,并更好地与实际情况相适应。该GUI的点和点击接口具有直观性,并赋予用户与库进行交互并将他们的专业知识注入RCA过程的能力。 有了PyRCA,工程师和研究人员现在可以轻松地分析结果、可视化因果联系,并通过GUI仪表板在RCA过程中前进。该团队分享的PyRCA的一些关键功能如下: PyRCA旨在提供一个标准化和高度适应性的框架,以流行的pandas.DataFrame格式加载度量数据并基准测试各种RCA模型。 通过一个单一的接口,PyRCA提供了访问各种模型的机会,用于发现因果网络和定位根本原因。用户也可以选择完全自定义每个模型以适应其独特的要求,包括GES、PC、随机漫步和假设测试模型。 通过结合用户提供的领域知识,库中提供的RCA模型可以被加强,使其在处理嘈杂的度量数据时更具韧性。 通过实现一个从RCA基类继承的单个类,开发人员可以快速将新的RCA模型添加到PyRCA中。 PyRCA包提供了一个可视化工具,使用户能够比较多个模型、审查RCA结果,并快速包含领域知识,而无需任何代码。 该团队详细解释了PyRCA的架构和主要功能。它提供了该库设计和核心能力的概述。
Leave a Comment计算机生成的动画每天都变得更加逼真。这种进步最能体现在视频游戏中。想想《古墓丽影》系列中的第一个Lara Croft和最近的Lara Croft。我们从一个只有230个多边形的木偶做出了怪异的动作,到了一个在屏幕上平滑移动的逼真角色。 在计算机动画中生成自然且多样化的动作长期以来一直是一个具有挑战性的问题。传统的方法,如动作捕捉系统和手动动画制作,已知是昂贵和耗时的,导致缺乏风格、骨骼结构和模型类型多样性的有限动作数据集。动画生成的手动和耗时特性需要在行业中寻找一种自动化解决方案。 现有的数据驱动运动合成方法在其效果方面受到限制。然而,近年来,深度学习已经成为计算机动画中一种强大的技术,能够在大型和全面的数据集上训练时合成多样化和逼真的动作。 深度学习方法在运动合成方面表现出色,但它们存在局限性,限制了它们的实际适用性。首先,它们需要长时间的训练时间,这可能是动画制作流程中的重要瓶颈。其次,它们容易出现视觉伪影,如抖动或过度平滑,影响合成动作的质量。最后,它们很难适应大型和复杂的骨架结构,限制了它们在需要复杂动作时的使用。 我们知道有一种可靠的运动合成方法在实际场景中有需求。然而,这些问题并不容易克服。那么,什么是解决方案?是时候见识一下GenMM了。 GenMM是一种基于运动最近邻和运动匹配的替代方法。它使用运动匹配,这是工业界广泛使用的角色动画技术,并产生高质量的动画,看起来自然并适应不同的局部环境。 GenMM可以使用单个输入生成动作。来源:http://weiyuli.xyz/GenMM/ GenMM是一种生成模型,可以从单个或少量示例序列中提取多样化的动作。它通过利用广泛的运动捕捉数据库来近似整个自然运动空间来实现这一点。 GenMM将双向相似性作为一种新的生成成本函数。这种相似性度量确保合成的运动序列只包含所提供的示例的运动补丁,反之亦然。这种方法保持了运动匹配的质量,同时实现了生成能力。为了进一步增强多样性,它使用了一个多阶段框架,逐步合成运动序列,这些运动序列与示例相比具有最小的分布差异。此外,还引入了一个无条件的噪声输入到管道中,受到基于GAN的图像合成方法成功的启发,以实现高度多样化的合成结果。 GenMM概述。来源:https://arxiv.org/pdf/2306.00378.pdf 除了其多样化运动生成能力外,GenMM还证明了它是一种可扩展的框架,可以扩展到超出仅使用运动匹配的能力的各种场景。这些场景包括运动完成、关键帧引导生成、无限循环和运动重组,展示了生成运动匹配方法所能实现的广泛应用范围。
Leave a CommentMosaicML是著名的开源语言模型(LLM)提供商,最近推出了开创性的MPT-30B模型:Base、Instruct和Chat。这些最先进的模型由NVIDIA最新一代的H100加速器提供动力,与原始的GPT-3相比,代表了质量上的重大飞跃。 也可阅读:什么是大型语言模型(LLMs)? MPT-7B的前所未有的成功和演进到MPT-30B 自2023年5月推出以来,MPT-7B模型已经席卷了整个行业,累计下载量达到了惊人的330万次。在此胜利的基础上,MosaicML现在发布了备受期待的MPT-30B模型。这将提高标准,为各种应用程序解锁了无数新的可能性。 MPT-30B的无与伦比的特点 MPT-30B最值得注意的成就之一是,它能够在仅使用300亿个参数的情况下超越GPT-3的质量,而GPT-3使用了1750亿个参数。这种参数数量的突破性减少不仅使MPT-30B更适合本地硬件部署,而且显著降低了推理成本。此外,基于MPT-30B训练自定义模型的费用明显低于训练原始GPT-3的估计,这使其成为企业不可抵挡的选择。 了解更多信息:为现实用例定制大型语言模型GPT3 此外,MPT-30B的训练涉及长达8000个标记的序列,使其能够处理数据密集型企业应用程序。这种非凡的性能得益于利用NVIDIA的H100 GPU,这些GPU确保了更高的吞吐量和加速的训练时间。 也可阅读:中国强大的Nvidia人工智能芯片的隐藏市场 探索MPT-30B的无限应用 许多有远见的公司已经采用了MosaicML的MPT模型,彻底改变了它们的AI应用: Replit是一款先驱性的基于Web的集成开发环境(IDE),成功利用MosaicML的训练平台构建了一个卓越的代码生成模型。通过利用其专有数据,Replit在代码质量、速度和成本效益方面取得了显着的提升。 Scatter Lab是一家创新的AI初创公司,专门从事聊天机器人开发,利用MosaicML的技术训练了自己的MPT模型。结果是一个能够理解英语和韩语的多语言生成式AI模型,显著提升了其广泛用户群的聊天体验。 Navan是一家全球知名的旅游和费用管理软件公司,利用MPT提供的坚实基础来开发定制的LLM,用于先进的应用程序,如虚拟旅行代理和对话式商业智能代理。Navan的联合创始人兼CTO Ilan Twig热情赞扬MosaicML的基础模型,因为它不仅提供了无与伦比的语言能力,而且在规模化微调和推理方面也非常高效。 了解更多信息:如果您是企业领袖,希望利用人工智能的力量,“数据黑客峰会2023年”的“面向企业领袖的AI”研讨会是必须参加的。 访问MPT-30B的力量 开发人员可以通过HuggingFace Hub轻松访问MPT-30B的卓越功能,该Hub作为开源模型可用。这使开发人员可以使用自己的数据微调模型,并在其基础设施上无缝部署推理。或者,开发人员可以选择MosaicML的托管端点MPT-30B-Instruct,这是一个无需繁琐操作的模型推理解决方案,与类似端点相比成本仅为其一小部分。MPT-30B-Instruct的定价仅为每1,000个标记0.005美元,为开发人员提供了异常实惠的选择。 我们的看法 MosaicML发布MPT-30B模型的开创性举措,标志着大型语言模型领域的历史性里程碑。它使企业能够利用生成式AI的无与伦比能力,并优化成本,同时保持对其数据的完全控制。总之,MPT-30B代表了一个真正的游戏变革者,提供了无与伦比的质量和成本效益。随着更多公司采用和利用这项变革性技术推动产业创新,未来的潜力是巨大的。
Leave a Comment玫瑰的本质由其独特的几何形状、纹理和材料组成。这可以用来创建不同大小和形状的玫瑰,并在各种位置和具有广泛的照明效果。即使每朵玫瑰都有独特的像素值,我们仍然可以将它们识别为同一类的成员。 研究人员来自斯坦福大学、牛津大学和康奈尔技术学院,他们希望利用来自单张照片的数据,创建一个可以用于从不同角度和照明下生成新形状和图像的模型。 解决这个问题陈述有三个障碍: 由于训练数据集中只有一张图像,而且只有几百个实例,因此推断问题非常松散。 在这些情况下可能会有广泛的可能像素值,因为不知道姿态或照明条件。 没有两朵玫瑰是相同的,需要捕捉它们的形状、纹理和材料的分布,以利用底层的多视角信息。因此,旨在推断的对象固有属性是概率的,而不是确定的。与当前用于静态对象或场景的多视角重建或神经渲染方法相比,这是一个重要的变化。 所提出的方法以物体固有属性为起点,用于诱导模型创建中的偏差。这些规则有两个部分: 要呈现的实例应该都具有相同的物体固有属性或几何、纹理和材料的分布。 固有属性不是相互独立的,而是以一种特定的方式交织在一起,由渲染引擎定义,最终由物理世界定义。 更具体地说,他们的模型采用单个输入图像,并使用一组实例掩模和实例的特定姿态分布,学习物体三维形状、表面反射率和光泽度的分布的神经表示,从而消除了姿态和照明波动的影响。这种基于物理的、明确的解缠可以帮助他们简要解释实例。它使模型能够获取物体固有属性,而不会过度拟合由单个图像提供的稀疏观察数据。 正如研究人员所提到的,由此产生的模型可以实现多种用途。例如,可以通过从学习的物体固有属性中随机采样来生成具有不同身份的新实例。可以通过调整这些外部元素来重新渲染具有新的相机角度和照明设置的合成实例。 团队进行了彻底的测试,以展示模型的改进形状重建和生成性能、创新的视图合成和重照。
Leave a Comment微软研究人员推出了一个名为ZeRO++的新系统,该系统已经被开发用于优化大型AI模型的训练,解决了高数据传输开销和带宽有限的挑战。ZeRO++在现有的ZeRO优化基础上进行了扩展,提供了增强的通信策略,以提高训练效率,缩短训练时间和降低训练成本。 如Turing-NLG、ChatGPT和GPT-4等大型模型的训练需要跨多个GPU设备使用大量存储器和计算资源。DeepSpeed开发的ZeRO++引入了通信优化策略,以克服在每个GPU上使用小批量大小或在低带宽集群上训练时ZeRO的局限性。 ZeRO优化的家族,包括ZeRO-Inference,使模型状态在GPU之间进行分区,而不是复制,利用集体GPU内存和计算能力。然而,在训练过程中,ZeRO可能会产生高通信开销。ZeRO++通过融合三组通信优化解决了这个问题:量化权重通信(qwZ)、分层权重分区(hpZ)和量化梯度通信(qgZ)。 为了减少参数通信量,ZeRO++对权重进行了量化,利用基于块的量化来保留训练精度。这个优化的量化过程比基本的量化更快,更准确。为了在反向传播期间最小化通信开销,ZeRO++通过在每台机器内维护一个完整的模型副本来以GPU内存为代价进行通信。对于梯度通信,ZeRO++引入了一种新颖的量化梯度通信范式qgZ,以减少跨节点的流量和延迟。 这些通信优化导致通信量的大幅度减少。与ZeRO相比,ZeRO++实现了高达4倍的减少,提高了训练吞吐量和效率。当每个GPU使用小批量大小时,在高带宽集群中,ZeRO++比ZeRO-3提高了28%至36%的吞吐量。在低带宽集群中,ZeRO++与ZeRO-3相比实现了平均2倍的加速,使大型模型训练更加普及。 ZeRO++不仅限于训练场景,还扩展到使用人类反馈(RLHF)训练的对话模型中的强化学习。通过将ZeRO++与DeepSpeed-Chat集成,可以使RLHF训练受益于改进的生成和训练阶段,实现比ZeRO更高达2.25倍的更好的生成吞吐量和1.26倍的更好的训练吞吐量。 DeepSpeed发布了ZeRO++,以使大型模型训练更加高效和适用于AI社区。该系统旨在加速训练,减少通信开销并实现更大的批量大小,从而节省时间和资源。研究人员和实践者可以利用ZeRO++更有效地训练像ChatGPT这样的模型,并探索AI中的新可能性。
Leave a Comment随着人工智能的日益普及,几乎每天都会发布带有全新功能和解决能力的新模型。最近,研究人员一直在努力提出方法来加强人工智能模型对未知测试分布的抵抗力,并减少对虚假特征的依赖。考虑到自动驾驶汽车和自主厨房机器人的例子,它们尚未被广泛部署,因为它们在分布外(OOD)环境中的行为所带来的挑战,这些环境与模型接触到的训练数据有很大的差异。 许多研究已经探讨了虚假相关性(SCs)的问题,并提出了减少其对模型性能的负面影响的方法。已经证明,在像ImageNet这样的知名数据集上训练的分类器依赖于背景数据,这些数据与类标签存在虚假关联,但不一定具有预测性。尽管在开发解决SC问题的方法方面已经取得了进展,但仍需要解决现有基准的局限性。目前的基准测试,如Waterbirds和CelebA发色基准测试,存在局限性,其中之一是它们专注于简单的一对一(O2O)虚假相关性,而实际上,许多对多(M2M)虚假相关性更常见,涉及类和背景的群组。 最近,来自伦敦大学学院的研究人员介绍了一个名为Spawrious数据集的图像分类基准套件,其中包含类和背景之间的虚假相关性。它包括一对一(O2O)和一对多(M2M)虚假相关性,这些已经被分类为三个难度级别:简单,中等和困难。该数据集包含约152,000张高质量的照片逼真图像,使用文本到图像模型生成,采用图像字幕模型过滤不适合的图像,确保数据集的质量和相关性。 评估Spawrious数据集后,表现出了不可思议的性能,因为该数据集对当前的最先进(SOTA)组鲁棒性方法提出了挑战,例如Hard-splits,其中没有一种测试方法使用在ImageNet上预训练的ResNet50模型实现了70%以上的准确性。该团队提到,模型的性能问题是由于它们依赖虚假背景而导致的,通过查看其错误分类的分类,说明了Spawrious数据集如何成功地测试分类器并揭示它们在错误相关性方面的弱点。 为了说明O2O和M2M基准测试之间的差异,该团队使用了一个夏季收集训练数据的例子,其中包括来自两个不同位置的两组动物物种,每个动物组都与特定的背景组相关联。然而,随着季节的变化和动物的迁移,群组交换位置,导致动物组和背景之间的虚假相关性以无法一对一匹配的方式发生变化。这凸显了捕捉M2M虚假相关性中复杂关系和相互依赖性的必要性。 Spawrious似乎是一套有前途的基准套件,用于OOD,领域通用算法,以及评估和提高模型在存在虚假特征的情况下的鲁棒性。
Leave a CommentYouTube,全球最大的视频分享平台,宣布一项重大发展,可以革新内容创作者与全球观众互动的方式。通过整合 AI 技术,YouTube 旨在简化不同语言视频配音的过程。这一令人兴奋的消息是在庆祝在线视频社区创意和创新的 VidCon 活动期间宣布的。通过 Google 的 Area 120 孵化器开发的 Aloud 配音服务的推出,YouTube 正在向打破语言障碍和扩大内容创作者在全球观众中的影响力迈出重要一步。 另请阅读:Meta 的 Voicebox:会说每种语言的 AI 通过 AI 驱动的配音打破语言障碍 YouTube 的使命是连接人们,促进全球信息和思想的自由流动。这导致了 AI 驱动的配音服务的开发。认识到内容创作者在与多元化观众分享他们的激情时面临的挑战,YouTube…
Leave a Comment最近,文本到图像生成方面取得了一些进展,出现了可以合成高度逼真和多样化图像的扩散模型。然而,尽管这些模型具有令人印象深刻的能力,像Stable Diffusion这样的扩散模型在需要空间或常识推理的提示方面仍然需要帮助,导致生成的图片不准确。 为了解决这个挑战,加州大学伯克利分校和加州大学旧金山分校的研究团队提出了一种新的基于LLM的扩散(LMD)方法,可以增强文本到图像生成中的提示理解。他们已经确定了场景,包括否定、数字、属性分配和空间关系,在这些场景中,Stable Diffusion与LMD相比存在不足。 研究人员采用了一种成本效益的解决方案,避免了训练大型语言模型(LLMs)和扩散模型的昂贵和耗时过程。他们将现成的冻结LLMs集成到扩散模型中,形成了一个两阶段的生成过程,提供了增强的空间和常识推理能力。 在第一阶段,LLM被调整为文本引导的布局生成器,通过上下文学习。当给出一个图像提示时,LLM会产生一个由边界框和相应描述组成的场景布局。在第二阶段,扩散模型通过使用一个新颖的控制器来生成图像,由生成的布局进行引导。两个阶段都使用冻结的预训练模型,没有对LLM或扩散模型进行任何参数优化。 LMD除了改进提示理解外,还提供了几个优点。它可以实现基于对话的多轮场景规定,允许用户为每个提示提供额外的澄清和修改。此外,LMD可以处理不受基础扩散模型支持的语言提示。通过将支持多轮对话的LLM纳入其中,用户可以在初始布局生成后查询LLM,并为随后的图像生成接收更新的布局,便于请求添加对象或更改它们的位置或描述等。 此外,通过在上下文学习过程中提供非英语提示的示例和英语布局和背景描述,LMD接受非英语提示,即使基础扩散模型不支持给定的语言也能生成带有英语描述的布局。 研究人员通过与LMD利用的基础扩散模型Stable Diffusion 2.1进行比较,验证了LMD的优越性。他们邀请读者探索他们的工作,进行全面评估和进一步比较。 总之,LMD提出了一种新的方法,以解决扩散模型在准确遵循需要空间或常识推理的提示方面的局限性。通过集成冻结LLMs并采用两阶段生成过程,LMD显著增强了文本到图像生成任务中的提示理解能力。它提供了其他功能,如基于对话的场景规定和处理不支持的语言提示。研究团队的工作为通过集成现成的冻结模型来改善合成图像的准确性和多样性开辟了新的可能性。
Leave a Comment大型语言模型(LLMs)是人工智能(AI)领域的一项重大突破性进展。这些模型(例如 GPT-3)彻底改变了自然语言理解。由于这些模型具有解释大量现有数据和生成类似人类的文本的能力,因此这些模型具有巨大的潜力,可以塑造人机交互和通信的未来并开启新的可能性。然而,尽管 LLMs 取得了巨大的成功,但与此类模型通常相关的一个显著挑战是它们的计算效率低下,即使在最强大的硬件上也会导致性能缓慢。由于这些模型包含数百万乃至数十亿个参数,因此训练此类模型需要广泛的计算资源,内存和处理能力,并非总是可用。此外,这些具有缓慢响应时间的复杂体系结构可能使 LLMs 无法实用于实时或交互式应用程序。因此,解决这些挑战变得至关重要,以释放 LLMs 的全部潜力并使其好处更广泛地可用。 针对这个问题陈述,加州大学伯克利分校的研究人员开发了 vLLM,这是一个开源库,是 LLM 推理和服务的一个更简单,更快速,更便宜的替代方案。目前,大型模型系统组织(LMSYS)正在使用该库来驱动其Vicuna和 Chatbot Arena。通过切换到 vLLM 作为其后端,与最初基于 HuggingFace 转换器的后端相比,研究组织已成功高效地处理峰值流量(比以前多 5 倍),同时使用有限的计算资源并降低高运营成本。目前,vLLM 支持几个 HuggingFace 模型,如 GPT-2,GPT BigCode…
Leave a Comment随着人工智能(AI)生成的合成和文本到图像生成媒体的大量增加,虚假个人资料的复杂性也随之增加。领英与加州大学伯克利分校合作研究了尖端的检测方法。他们最近的检测方法能够准确地识别人工生成的个人资料图片,正确率达到99.6%,同时将真实图片误判为虚假图片的概率仅为1%。 有两种类型的取证方法可以用于调查这个问题。 基于假设的方法可以发现人工合成的面孔中的异常。这些方法通过学习显著的语义离群值来受益。然而,学习能力合成引擎似乎已经拥有了这些特征,这是一个问题。 基于数据驱动的方法,如机器学习,可以将自然面孔与 CGI 面孔区分开来。当出现在其专业领域之外的图像时,训练过的系统经常会在分类方面遇到困难。 所提出的方法采用混合方法,首先识别计算机生成的面孔中的独特几何属性,然后采用数据驱动的方法来测量和检测它。该方法使用轻量级、易于训练的分类器,并需要对一小组合成面孔进行培训。使用了五种不同的合成引擎来构建41,500个合成面孔,并使用了100,000个真实的领英个人资料图片作为额外的数据。 为了查看实际(公开可用的)LinkedIn个人资料图片与合成生成的(StyleGAN2)面孔的差异,他们将每个平均400张图片并排放置。由于人们的实际照片彼此非常不同,大多数个人资料图片只是普通的头像照片。相比之下,典型的 StyleGAN 面孔具有非常清晰的特征和锐利的眼睛。这是因为 StyleGAN 面孔的眼部位置和瞳距被标准化了。真实的个人资料图片通常关注上半身和肩膀,而 StyleGAN 面孔一般是从脖子以下合成的。他们希望利用社交群体内部和之间存在的相似性和差异。 为了识别 FaceForensics++ 数据集中的深度伪造面孔交换,研究人员将一个单类变分自动编码器(VAE)与一个基线单类自动编码器结合起来。与以前的面孔交换深伪造工作不同,这项工作强调了合成面孔(例如 StyleGAN)。研究人员还使用了一个相当简单且易于训练的分类器,并在相对较少的合成图像上实现了可比的总体分类性能。 他们使用 Generated.photos 和 Stable Diffusion 生成的图像评估了模型的泛化能力。使用生成对抗网络(GAN)生成的 Generated.photos…
Leave a Comment
温布尔登引入基于人工智能的解说
网球爱好者们有好消息了! 作为世界上最负盛名的网球锦标赛之一,温布尔登正在采用尖端技术来提高观众体验。 温布尔登与科技巨头IBM合作,计划在今年的比赛中引入人工智能驱动的评论。 这种创新的方法旨在为球迷提供由AI生成的音频评论和字幕,为网球爱好者提供新鲜的比赛视角和沉浸式的体验。 让我们深入了解人工智能驱动的体育评论及其对行业的影响。 此外,阅读相关文章:AI开始以多种语言为YouTube配音 AI评论提升温布尔登报道 温布尔登与技术创新领袖IBM合作,革新球迷与锦标赛互动的方式。通过利用IBM的Watson AI平台,特别是针对网球的复杂语言进行训练,温布尔登将为其在线精华视频提供由AI生成的音频评论和字幕。这种新的功能将在温布尔登应用程序和网站上提供,为传统报道之外提供沉浸式和信息丰富的体验。 揭示人工智能在网球分析中的力量 IBM的人工智能已经成为温布尔登运营的重要组成部分,为诸如球员能力指数等功能做出了贡献。基于此基础,赛事报道将融入AI驱动的单打抽签分析。通过研究球员通往决赛的路径,这种创新功能将帮助球迷发现可能不仅仅是排名所能体现的潜在惊喜和异常。IBM的人工智能能力为全面的网球分析带来了令人兴奋的可能性。 阅读相关文章:人工智能在体育中的应用:用AI生成比赛精华 温布尔登AI评论的魔力 为了让AI的体育评论生动起来,从球场上收集了大量数据。这些数据包括球追踪数据,球员追踪数据以及来自不同球场区域的击球分析。然后,收集的数据通过IBM的AI模型进行处理,生成专门针对网球语言和独特的温布尔登体验的自然语言评论。这种评论可以轻松转换为近乎实时的音频评论,让球迷沉浸在比赛中。 开创未来的可能性 温布尔登引入AI评论标志着生成整场比赛的AI驱动评论的重大里程碑。这种前瞻性的方法为沉浸式和富有见地的体育报道开辟了新时代。本月早些时候,欧洲广播联盟还宣布使用克隆语音技术为欧洲田径锦标赛提供评论。这表明人工智能在体育广播领域的普及程度正在增加。 阅读相关文章:人工智能如何推动体育的未来? Watson的遗产和AI的发展 IBM的Watson AI平台有着悠久的历史,十多年前,它因在游戏节目Jeopardy!中获胜而受到认可。自那以后,Watson不断演变,展示其理解复杂查询和实时响应的能力。随着Watson集成到温布尔登的报道中,人工智能继续推动边界,重新定义我们体验运动的方式。 阅读相关文章:IBM的Watsonx平台将彻底改变企业AI 我们的看法 温布尔登与IBM合作引入AI驱动的评论是令人兴奋的进展,承诺提高全球网球迷的观看体验。通过利用人工智能,温布尔登使球迷深入了解比赛,提供独特的见解并增强参与度。随着人工智能的不断发展,我们可以期待更加沉浸式和互动的体育报道,开启体育娱乐领域创新的新时代。
Leave a Comment