Press "Enter" to skip to content

GPT-4的细节已经泄露!

GPT-4的细节已经泄露! 四海 第1张  

很多人都想知道GPT-4相比GPT-3有何改进之处。它席卷了整个世界。它是目前最受期待的AI模型,人们想要了解更多关于它的信息。OpenAI没有发布有关GPT-4的任何信息,例如大小、数据、内部结构或者训练和构建的方法。我们一直想知道他们为什么一直隐瞒这些信息。

好了,你即将找到答案,因为有关GPT-4的详细信息已经被泄露出来!

那么我们了解到了关于GPT-4的哪些细节呢?让我们深入了解一下…

 

模型大小

 

大型语言模型(LLMs)在过去的几年里不断增长,模型大小也反映了这一点。2022年,GPT-3的模型大小为1万亿,相比过去5年增长了15,000倍。据说GPT-4的大小是其前身GPT-3的10倍。它大约有1.8万亿个参数,跨越了120层。在120层中,GPT-4是一个深度架构,能够完成各种复杂的任务,使其成为当前最先进的模型之一!

 

专家混合

 

OpenAI使用MOE(专家混合)。与静态模型GPT-3不同,GPT是由8个2200亿参数的模型组成的混合模型。这8个2200B模型在不同的数据和任务分布上进行了训练,利用了模型内的16个专家。每个模型的多层感知器大约有1110亿个参数,每个专家都有特定的角色,例如编码或格式化。

专家混合并不是新鲜事物,已经存在一段时间了。例如,谷歌使用了一种具有专家选择路由的专家混合,这意味着根据您提出的问题类型,会将您路由到不同的专家来回答您的问题。

GPT-4仅使用大约550亿个参数来进行“注意力”处理,例如引导模型保持话题一致。

 

推理

 

推理是关于LLMs如何进行预测的。与其他模型相比,GPT-4的表现相当出色。据说每次前向传递推理生成1个令牌时,仅使用约2800亿个参数和约560万亿次浮点运算(用于测量GPU性能的速率)。

 

数据集

 

您可以想象GPT-4使用了多少数据集,基于其性能和作为最先进模型的特点。据称,GPT-4在大约13万亿个令牌上进行了训练,这大约是1万亿个单词。它在基于文本的数据上使用了2个时期,在基于代码的数据上使用了4个时期。

数据集的实际大小未知,因为其中一些令牌被重新使用,所以我们可以粗略估计它包括数万亿个令牌。在内部,还有数百万行来自ScaleAI的指令,用于对数据进行微调。

 

上下文长度

 

对于GPT-4的预训练阶段,它使用了8千个令牌的上下文长度。在预训练之后,序列长度基于对8千个令牌进行微调。

 

批量大小

 

批量大小是模型更新之前处理的样本数量。批量大小不断增加,OpenAI使用了6000万的批量大小,每个专家大约处理750万个令牌。为了找出真实的批量大小,您需要将此数字除以序列长度。

 

训练成本

 

这是您中很多人都会感兴趣的领域-训练成本。您可以想象构建和训练GPT-4有多么昂贵。

开放AI耗费大约2.1e25 FLOPS(每秒浮点运算次数)的计算能力,在大约3个月的时间内使用了25个A100处理器进行训练。据称,GPT-4的运行计算成本约为GPT-3.5的3倍。同时,据报道,与GPT-3相比,GPT-4在提示方面的成本也增加了3倍。

例如,如果OpenAI在云端训练每小时需要花费约1美元的A100费用,单独这一个小时的训练成本将达到6300万美元。

 

推测解码

 

还有消息称OpenAI可能正在使用推测解码(speculative decoding)。这里的“可能”意味着他们正在使用更小更快的模型来帮助解码标记,然后将其作为单个批次输入到大型模型中。

这意味着如果来自较小模型的预测是正确的,大型模型也将同意这些预测。然而,如果大型模型拒绝了来自较小模型的预测,那么整个批次的预测也会被丢弃。

 

总结

 

这次泄漏更多地反映了高层架构的泄漏,而不是模型的泄漏,而很多人本来期望的是模型的泄漏。尽管如此,这种信息对我们来说仍然是有用的,因为我们继续看到LLM的增长以及创建GPT-4等AI模型所需的代价。Nisha Arya是一位数据科学家、自由技术作家和VoAGI社区经理。她特别热衷于提供数据科学职业建议或教程,以及围绕数据科学的理论知识。她还希望探索人工智能在人类寿命的延长方面的不同方式。作为一个热心的学习者,她希望扩展自己的技术知识和写作技巧,并帮助引导他人。

Leave a Reply

Your email address will not be published. Required fields are marked *