1. GPU并行计算实验环境搭建
在开始GPU并行计算实验之前,我们需要先搭建好实验环境。这个环节往往是最容易出问题的部分,很多同学在环境配置阶段就会遇到各种"坑"。
1.1 硬件与驱动检查
首先确认你的设备是否支持CUDA计算。在Windows系统下,可以通过以下步骤检查:
- 打开设备管理器,展开"显示适配器"
- 查看显卡型号是否为NVIDIA系列
- 右键点击显卡选择"属性",在"驱动程序"选项卡查看驱动版本
对于Linux系统,直接在终端执行:
bash复制nvidia-smi
这个命令会显示GPU的基本信息和驱动版本。理想情况下,你应该看到类似如下的输出:
code复制+-----------------------------------------------------------------------------+
| NVIDIA-SMI 515.65.01 Driver Version: 515.65.01 CUDA Version: 11.7 |
|-------------------------------+----------------------+----------------------+
| GPU Name Persistence-M| Bus-Id Disp.A | Volatile Uncorr. ECC |
| Fan Temp Perf Pwr:Usage/Cap| Memory-Usage | GPU-Util Compute M. |
| | | MIG M. |
|===============================+======================+======================|
| 0 NVIDIA GeForce ... On | 00000000:01:00.0 On | N/A |
| N/A 50C P8 10W / N/A | 500MiB / 8192MiB | 10% Default |
| | | N/A |
+-------------------------------+----------------------+----------------------+
注意:如果遇到"you do not appear to have an NVIDIA GPU supported"这类警告,说明你的显卡可能不支持CUDA或者驱动未正确安装。
1.2 CUDA Toolkit安装
CUDA Toolkit的版本选择非常重要,需要与你的PyTorch版本匹配。以下是当前主流版本的对应关系:
| PyTorch版本 | 推荐CUDA版本 |
|---|---|
| 1.12.x | 11.6 |
| 2.0.x | 11.7/11.8 |
| 2.1.x | 12.1 |
安装CUDA Toolkit时,建议从NVIDIA官网下载离线安装包。安装过程中需要注意:
- 不要选择"Express Installation",选择"Custom"
- 确保勾选了"CUDA"组件中的"Development"和"Runtime"选项
- 如果已经安装了显卡驱动,取消勾选"Driver"组件
1.3 PyTorch GPU版本安装
安装PyTorch GPU版本时,最常见的错误就是版本不匹配。建议使用官方提供的安装命令
