共计 1262 个字符,预计需要花费 4 分钟才能阅读完成。
显卡算力直接影响深度学习模型的训练速度和推理响应时间,高端显卡的并行计算能力可缩短实验周期数倍。不同架构的 SM 单元(Streaming Multiprocessor)设计导致算力差异显著,例如 NVIDIA 的 Ampere 架构比前代 Turing 提升近 2 倍 FP32 性能。显存容量和带宽则决定了模型规模上限,BERT-large 等大模型需要至少 24GB 显存才能流畅运行。

主流显卡性能横评(测试环境:PyTorch 2.0.1+cu118)
| 显卡型号 | FP32 算力(TFLOPS) | 显存带宽(GB/s) | ResNet50 训练速度(images/sec) | 每小时训练成本 * |
|---|---|---|---|---|
| RTX 4090 | 82.6 | 1008 | 3120 | $1.2 |
| RTX 3090 | 35.7 | 936 | 1980 | $0.8 |
| A100 40G | 19.5 | 1555 | 2450 | $3.5 |
| * 成本按 AWS 按需实例电价计算 |
环境配置全流程
CUDA 驱动安装(Ubuntu 20.04)
# 检查推荐驱动版本
ubuntu-drivers devices
# 安装驱动和工具包
sudo apt install -y nvidia-driver-535 nvidia-utils-535
# 验证安装
nvidia-smi
注意:PyTorch 2.0+ 需要 CUDA 11.7 以上版本,建议使用 Driver 535 系列保证兼容性。
PyTorch 环境搭建
# 使用清华镜像源加速下载
pip install torch torchvision --extra-index-url https://pypi.tuna.tsinghua.edu.cn/simple
GPU 监控指令精要
watch -n 1 nvidia-smi
关键指标解读:
– GPU-Util:实时计算负载(80%+ 为理想状态)
– Mem-Usage:显存占用 / 总量
– Temp:温度(超过 85℃需检查散热)
实战避坑指南
二手矿卡识别三要素
- 使用 GPU- Z 检查:
- 核心频率波动范围(矿卡通常被锁频)
- 显存颗粒品牌是否与出厂记录一致
- ASIC 质量得分(低于 70% 需警惕)
混合精度显存优化
# PyTorch 自动混合精度示例
from torch.cuda.amp import autocast
with autocast():
outputs = model(inputs)
loss = criterion(outputs, labels)
显存节省原理:FP16 占用的显存仅为 FP32 的一半,但需注意梯度缩放(Grad Scaling)避免下溢出。
PCIe 带宽测试方法
# 安装带宽测试工具
sudo apt install pciutils
# 查看链路速度
lspci -vv | grep -i 'LnkSta'
Gen3 x16 的理论带宽为 15.75GB/s,实际测得 12GB/ s 以下可能影响多卡通信效率。
思考题进阶
- 显存需求≈batch_size×(模型参数内存 + 激活值内存),实际可用
torch.cuda.memory_allocated()跟踪 - T4 的 INT8 量化能力(130TOPS)使其在推理场景性价比超 3090
- 异构显卡训练需注意:
- 按最慢显卡同步梯度
- 手动平衡各卡 batch 大小
- 避免 NVLink 与 PCIe 混用
正文完
