接入 PAI-TorchAcc 前,需准备满足规格要求的训练资源环境。您可以在 PAI 上开通 DSW 实例,或使用已有的 ECS 实例。本文介绍 TorchAcc 训练加速的环境要求。
环境规格要求
接入 TorchAcc 训练加速时,需使用 GPU 实例。具体版本和规格如下。
版本要求
驱动
版本
CUDA Driver
11.3及以上版本
Nvidia Driver
470及以上版本
规格要求
实例规格
是否支持
V100M16
支持
V100M32
支持
GU50
支持
GU100
支持
GU108
支持
A10M24
支持
更多实例规格详情,请参见附录:公共资源规格列表。
镜像要求
必须使用指定的 TorchAcc 测试镜像:
registry.cn-hangzhou.aliyuncs.com/pai-dlc/pai-pytorch-training:torch-1.12-cuda11.3-py38-acc-230219。说明该镜像目前仅支持华东1(杭州)地域。
准备测试环境
使用DSW环境
在 PAI 平台进行 TorchAcc 接入测试时,按以下步骤创建 DSW 实例,并在 Jupyter Notebook 中测试。
在华东1(杭州)地域,按环境规格要求新建资源并新增资源配额。具体操作,请参见新建资源组并购买通用计算资源和通用计算资源配额。
进入资源配额关联的工作空间,创建开发机实例。关键参数配置如下,更多内容请参见创建及管理DSW实例。
参数
描述
资源类型
选择资源配额。
资源配额
选择步骤 1 中已创建的资源配额。
资源规格
CPU(核数):配置为 30。
内存(GiB):配置为 180。
共享内存(GiB):配置为 100。
GPU(卡数):配置为 1。
镜像
在镜像地址页签配置镜像地址:
registry.cn-hangzhou.aliyuncs.com/pai-dlc/pai-pytorch-training:torch-1.12-cuda11.3-py38-acc-230219。说明该镜像目前仅支持华东1(杭州)地域。
使用自有ECS实例
使用自有 ECS 资源进行 TorchAcc 训练加速时,按以下步骤准备 ECS 实例。
在华东1(杭州)地域,购买符合环境规格要求的 ECS 实例,并安装满足版本要求的 Nvidia-smi、CUDA 驱动。购买操作请参见创建实例,其中:
实例:选择ecs.gn6v-c8g1.2xlarge。
镜像:选择公共镜像>Alibaba Cloud Linux>Alibaba Cloud Linux 3.2104 LST 64位,选中安装 GPU驱动复选框,并选择CUDA版本11.4.1>Driver版本470.161.03>CUDNN版本8.2.4。
系统盘:建议分配不少于80 GiB的存储容量。
在 ECS 实例中安装 Docker。具体操作,请参见安装并使用Docker和Docker Compose。
安装 NVIDIA Container Toolkit。具体操作,请参见Installing the NVIDIA Container Toolkit。
根据操作系统选择安装命令。本文使用 Yum 或 Dnf 安装,安装完成后重启 Docker daemon。
使用以下脚本拉起 TorchAcc 镜像。
DOCKER=registry.cn-hangzhou.aliyuncs.com/pai-dlc/pai-pytorch-training:torch-1.12-cuda11.3-py38-acc-230219 name=TorchAcc_Tutorials set -x docker run \ --name $name \ --rm -it \ --privileged \ --ulimit memlock=-1:-1 \ --gpus all \ --shm-size 10G \ -v /dev/shm:/dev/shm \ --ipc host \ --network host \ --rm \ --cap-add=CAP_SYS_ADMIN \ -v /path/to/code:/workspace \ -w /workspace \ ${DOCKER} bash