比较Apple Silicon M2 Max GPU在使用TensorFlow训练MLP、CNN和LSTM模型时与Nvidia V100、P100和T4的性能。

Apple M1于2020年11月发布,它是在以英特尔为主导的计算机世界中的一场革命。这些新的M1 Mac在许多基准测试中展现出了令人印象深刻的性能,因为M1比大多数高端台式计算机更快,但能耗只是它们的一小部分。
这是我之前针对M1的基准测试:
Benchmark M1 vs Xeon® vs Core i5 vs K80 and T4
M1 competes with 20 cores Xeon® on TensorFlow training
在2023年1月,Apple宣布了新的M2 Pro和M2 Max。根据它们的规格,我们可以期待良好的性能提升,特别是GPU方面。

这款M2 Max拥有30个GPU核心,因此我们从拥有38个GPU核心的版本的13.6 TFLOPS中估算出10.7 TFLOPS。

相比之下,M2 Max 38个核心的GPU可以达到13.6 TFlops。下面的测试将展示单单TFlops并不能用于预估这些GPU的实际性能。
为了获得可比较的结果,我使用默认的TensorFlow FP32浮点精度进行了每个测试。
您可以通过运行以下代码验证此精度:
tf.keras.backend.floatx()'float32'
设置
在本文中,我对使用Nvidia V100、P100和T4以及MLP、CNN和LSTM的TensorFlow模型进行了M2 Max GPU的基准测试。

在M1和M2 Max计算机上,环境是在miniforge下创建的。只安装了以下软件包:
conda install python=3.10conda install tensorflowconda...