NVIDIA黄仁勋为什么说CPU 已落伍? 实例证明 GPU 训练大型语言模型成本可降低 96%

在美国数据平台Snowflake的开发者大会上,NVIDIA创始人黄仁勋表示,我们现在正经历60年来第一次根本性的运算平台变革。 如果你明年再买一大堆CPU,你的运算吞吐量并不会增加,必须依靠GPU来提升。

不过,这个说法是怎么来的呢?

黄仁勋这个说法首次出现在 2023 年Computex上的开幕演讲,其 GPU 可以大幅降低训练大型语言模型(LLM)的成本和耗能。 让我们回顾一下黄仁勋是怎么说明的。

传统的摩尔定律已经过时

黄仁勋在演讲中表示,他认为生成式人工智能和加速计算是未来计算的方向,而非CPU。 他认为传统的摩尔定律已经过时,未来的性能提升将主要来自生成式人工智能和基于加速计算的方法。

他在演讲中展示了一份 LLM 的总体拥有成本(Total Cost of Ownership,TCO)分析:首先,他们计算了训练一个 LLM 所需的 960 个 CPU 组成的服务器群集的完整成本(包括网络、机箱、互连等所有设备),发现这需要花费约 1,000 万美元,并消耗 11 千兆瓦时的电力。

相比之下,如果保持成本不变,购买一个价值1,000万美元的GPU集集,可以在同样的成本和更少的电力消耗(3.2千兆瓦时)下训练44个LLM。 如果转而保持电力消耗不变,那么可以通过GPU集实现150倍的加速,以11千兆瓦时的电力消耗训练150个LLM,但这需要花费3,400万美元。

此外,这个集群的占地面积比CPU丛集小得多。 最后,如果只想训练一个 LLM,那么只需要一个价值 40 万美元、消耗 0.13 千兆瓦时电力的 GPU 服务器就可以了。

简单总结一下黄仁勋所要表达的意思是,相比CPU服务器,客户可以用4%的成本和1.2%的电力消耗来训练一个LLM,这是一个巨大的成本节省。

(0)
游侠网游侠网

相关推荐

发表回复

您的电子邮箱地址不会被公开。 必填项已用 * 标注