准备加速资源环境

更新时间:
复制 MD 格式

接入 PAI-TorchAcc 前,需准备满足规格要求的训练资源环境。您可以在 PAI 上开通 DSW 实例,或使用已有的 ECS 实例。本文介绍 TorchAcc 训练加速的环境要求。

环境规格要求

接入 TorchAcc 训练加速时,需使用 GPU 实例。具体版本和规格如下。

  • 版本要求

    驱动

    版本

    CUDA Driver

    11.3及以上版本

    Nvidia Driver

    470及以上版本

  • 规格要求

    实例规格

    是否支持

    V100M16

    支持

    V100M32

    支持

    GU50

    支持

    GU100

    支持

    GU108

    支持

    A10M24

    支持

    更多实例规格详情,请参见附录:公共资源规格列表

  • 镜像要求

    必须使用指定的 TorchAcc 测试镜像:registry.cn-hangzhou.aliyuncs.com/pai-dlc/pai-pytorch-training:torch-1.12-cuda11.3-py38-acc-230219

    说明

    该镜像目前仅支持华东1(杭州)地域。

准备测试环境

使用DSW环境

在 PAI 平台进行 TorchAcc 接入测试时,按以下步骤创建 DSW 实例,并在 Jupyter Notebook 中测试。

  1. 在华东1(杭州)地域,按环境规格要求新建资源并新增资源配额。具体操作,请参见新建资源组并购买通用计算资源通用计算资源配额

  2. 进入资源配额关联的工作空间,创建开发机实例。关键参数配置如下,更多内容请参见创建及管理DSW实例

    参数

    描述

    资源类型

    选择资源配额

    资源配额

    选择步骤 1 中已创建的资源配额。

    资源规格

    • CPU(核数):配置为 30。

    • 内存(GiB):配置为 180。

    • 共享内存(GiB):配置为 100。

    • GPU(卡数):配置为 1。

    镜像

    镜像地址页签配置镜像地址:registry.cn-hangzhou.aliyuncs.com/pai-dlc/pai-pytorch-training:torch-1.12-cuda11.3-py38-acc-230219

    说明

    该镜像目前仅支持华东1(杭州)地域。

使用自有ECS实例

使用自有 ECS 资源进行 TorchAcc 训练加速时,按以下步骤准备 ECS 实例。

  1. 在华东1(杭州)地域,购买符合环境规格要求的 ECS 实例,并安装满足版本要求的 Nvidia-smi、CUDA 驱动。购买操作请参见创建实例,其中:

    • 实例:选择ecs.gn6v-c8g1.2xlarge

    • 镜像:选择公共镜像>Alibaba Cloud Linux>Alibaba Cloud Linux 3.2104 LST 64,选中安装 GPU驱动复选框,并选择CUDA版本11.4.1>Driver版本470.161.03>CUDNN版本8.2.4

    • 系统盘:建议分配不少于80 GiB的存储容量。

  2. 在 ECS 实例中安装 Docker。具体操作,请参见安装并使用DockerDocker Compose

  3. 安装 NVIDIA Container Toolkit。具体操作,请参见Installing the NVIDIA Container Toolkit

    根据操作系统选择安装命令。本文使用 Yum 或 Dnf 安装,安装完成后重启 Docker daemon。

  4. 使用以下脚本拉起 TorchAcc 镜像。

    DOCKER=registry.cn-hangzhou.aliyuncs.com/pai-dlc/pai-pytorch-training:torch-1.12-cuda11.3-py38-acc-230219
    name=TorchAcc_Tutorials
    
    set -x
    docker run \
        --name $name \
        --rm -it \
        --privileged \
        --ulimit memlock=-1:-1 \
        --gpus all \
        --shm-size 10G \
        -v /dev/shm:/dev/shm \
        --ipc host \
        --network host \
        --rm \
        --cap-add=CAP_SYS_ADMIN \
        -v /path/to/code:/workspace \
        -w /workspace \
        ${DOCKER} bash