Runtime kit介绍

更新时间:
复制 MD 格式

灵骏 Runtime Kit 是灵骏裸金属节点预装的异构资源管理套件。它提供 GPU / PPU 的细粒度切分、拓扑感知调度与健康监测,帮助您提升集群资源利用率和任务连续性。

说明

公测中:本产品当前处于公测阶段,如有问题或建议,请联系灵骏技术支持。

1. Runtime Kit概述

大模型等 AI 业务快速发展,GPU 等异构资源已成为数据中心的核心算力。但在生产环境中,GPU 利用效率常面临挑战:推理服务长期低水位运行,单卡算力利用不足;大规模训练任务中,单卡故障会中断整个任务,故障定位和恢复速度直接影响集群可用性。

灵骏 Runtime Kit(以下简称 Runtime Kit)随灵骏裸金属节点预装,无需额外安装。它提供 GPU / PPU 等 xPU 资源的细粒度切分、拓扑感知调度、健康监测等能力,用更少资源支撑更大业务,提升异构集群的资源利用率和任务连续性。

Kubernetes 已成为云原生容器编排的事实标准。Runtime Kit 聚焦 IaaS 层异构资源管理,不替代上层 K8s 的调度编排,而是通过标准化 gRPC 接口暴露资源切分与监控能力。灵骏同时提供 K8s Device Plugin、Scheduler Framework、Exporter 等组件的开源参考实现及预编译版本,帮助您快速对接 K8s,也可按需定制。

2. 核心能力

2.1 算力与显存细粒度切分

Runtime Kit 支持 GPU 等 xPU 资源的细粒度算力与显存切分,让多业务共享同一张 GPU 卡,提升资源利用率。

  • 时分复用(TDM):按时间片轮转共享 GPU 算力,算力百分比精确到 1%~100%。多个容器可按各自算力配额在同一张卡上运行,互不干扰。

  • 物理空分(MIG):基于 NVIDIA MIG 硬件级空分技术,将一张物理 GPU 切分为多个独立实例。每个实例有独立的计算单元、显存和中断引擎,实现硬件级隔离。Runtime Kit 增强了原生 MIG,支持实例动态创建和自动管理,算力与显存可独立配置,并为不同硬件提供统一接口。

  • 显存与算力独立维度:显存和算力可独立设置、自由组合,无需等比例分配。例如可为一个容器分配 50% 算力但仅 2 GiB 显存,为另一个容器分配 30% 算力但 8 GiB 显存,更贴合业务实际需求。

  • 按需实时创建:资源实例随业务容器创建而动态生成,容器销毁后自动回收,无需提前静态准备,随容器生命周期管理。

  • 能力边界:算力按 1~100 整数设置(对应单卡算力百分比,留空或填 0 表示不限制);显存支持 GiB 和 MiB,MiB 模式最小粒度为 128 MiB。TDM 与 MIG 不能在同一张卡上同时启用,同一节点上不同卡可分别使用不同模式。PPU 场景建议优先使用 TDM。

2.2 资源隔离与故障管理

每个切分实例有独立的显存地址空间和算力配额,提供三层隔离:

  • 显存隔离:严格限制容器显存上限,容器内程序只能使用分配的显存,避免业务间显存争抢。

  • 算力隔离:精确控制容器可用的 GPU 算力,避免多容器共享一卡时相互干扰。

  • 故障隔离:切分实例的 GPU 错误(如显存异常、Kernel 报错)不会扩散到同卡其他容器,降低多业务共享 GPU 的故障影响面。

2.3 健康监测

Runtime Kit 提供全面的 GPU 健康监测与性能监控:

  • 多维指标采集:覆盖整卡、容器/Pod、进程三级粒度,提供运行状态、利用率、性能、健康度等多维指标。适配 Prometheus 等主流监控平台,一个组件即可采集所有异构实例指标。

  • 微感健康检测:在业务几乎无感的情况下实时检测 GPU 实例故障,覆盖掉卡、uncorrectable ECC 错误、显存泄漏、驱动异常、NVLink 故障、计算模式异常等常见故障。在大规模同步训练场景,可快速定位故障卡,结合灵骏裸金属备机替换机制快速替换故障卡并恢复训练,降低 GPU 任务调度失败率。

2.4 拓扑感知调度

多卡、多节点场景下,设备通信距离直接影响任务效率。Runtime Kit 提供拓扑感知能力:组件自动采集并上报设备与网络拓扑,您无需额外配置,按标准方式声明资源后,调度器自动选择通信距离最优的设备组合。

  • 节点内多卡拓扑调度:面向多卡请求,调度器优先选择互联最近的卡组合。申请 2/4/8 卡时自动生效,优先选择同一拓扑组内互联最近的卡;支持 GPU 与 RDMA 网卡联合亲和,按 PCIe Switch → NUMA Node → CPU Socket → 跨 Socket 逐级就近,将同一 PCIe 域内的 GPU 与 RDMA 网卡成组分配。

  • 跨节点 Gang 拓扑调度:面向多机分布式训练,调度器将同一 JobSet 下的 Pod 识别为同一调度组,按网络拓扑亲和度分配节点,将成员聚集到网络距离最近的节点,采用全有或全无的成组调度,避免部分成员先就绪导致的资源长期占用与等待。

资源声明与使用方法见拓扑感知调度(PPU)。

3. Runtime Kit优势

  • 性能折损低:整卡使用无额外开销;切分场景下对 QPS 与 RT 影响较小,实际折损因业务负载而异,建议以生产实测为准。

  • 业务零适配:部署和升级对用户无感。业务模型程序无需修改代码,容器镜像也无需改动,即可使用切分后的 GPU 资源。使用体验与整卡无异,仅资源规格不同。

  • 兼容性强:支持 NVIDIA 全系列 GPU(Pascal/Volta/Turing/Ampere/Hopper)、PPU(810E 等)、AMD GPU;兼容 CUDA 13.0、580 驱动及近两年内的 CUDA/驱动版本;兼容 CentOS/Ubuntu/AliOS 等主流系统;兼容 Docker/Pouch/containerd 等运行时。

  • 生产级稳定性:经过多年大规模生产环境验证,已通过多次大促洪峰考验,支撑多种业务长期稳定运行。

4. 应用场景

4.1 在线推理业务

推理业务受 RT 和在线水位变化限制,GPU 利用率通常较低。Runtime Kit 支持在一张 GPU 卡上部署多个推理实例,提升吞吐量。实际案例中,单卡切分为两个实例后吞吐量接近翻倍,资源用量不变。

4.2 离线训练任务

离线训练场景下,Runtime Kit 从两个维度提升训练集群效率与可靠性。一是提升单卡利用率:部分训练任务(如小规模微调、数据预处理)对单卡算力占用有限,Runtime Kit 支持在一张 GPU 卡上同时部署多份训练任务,通过细粒度切分利用空闲资源。二是大规模集群故障快速恢复:微感健康检测可在业务几乎无感的情况下实时监测每张 GPU 状态,快速定位故障卡,结合灵骏裸金属备机替换机制恢复训练任务,最大限度减少集群停机时间。

4.3 开发与测试任务

算法开发、调试与实验任务通常算力需求小、空闲时间长,但每位开发者都需要独立、无干扰的 GPU 环境。Runtime Kit 支持将一张 GPU 卡切分为多个实例,供多位开发者同时使用:每个实例有独立的算力与显存配额,并具备故障隔离,开发环境互不影响。无需增加卡数即可支撑更多开发者,降低开发测试环境成本。

5. 交付构成与开源模式

5.1 两层交付架构

Runtime Kit 分两层,两层通过统一 gRPC 接口对接:

层

交付物

形态

维护责任

资源层

Runtime 包

闭源,随灵骏裸金属 OS 镜像预装

阿里云灵骏团队负责发布与迭代

容器层

开源组件套件(Device Plugin、Scheduler Framework、Exporter、Controller)

开源参考实现及预编译镜像

用户自行部署,或按需二次开发

在该架构中,资源侧能力由阿里云灵骏提供并持续迭代,容器层组件开源,用户可按自身平台规范适配,两层通过统一 gRPC 接口对接。接口是两层唯一的对接边界,也是向后兼容的基础。

5.2 开源组件概览

组件

职责

部署形态

Device Plugin

设备发现、资源上报与分配转发

DaemonSet(打标节点)

Scheduler Framework

算力/显存双维度感知调度、拓扑感知调度

Deployment

Exporter

GPU 运行监控与健康检测指标采集

DaemonSet(打标节点)

Controller

节点 Runtime Kit 功能的启用/禁用管理

Deployment

5.3 两种使用路径

  • 路径一:直接使用预编译组件。通过部署脚本一键部署,部署后即可使用,无需二次开发。该路径下您仅需关注套件版本,部署与版本管理方法见部署与版本指南,资源申请与使用方法见使用指南。无定制需求建议优先选择此路径:预编译组件由阿里云灵骏官方发布维护,并提供技术支持;使用过程中遇到问题,可通过开源仓库 Issue 等渠道反馈。

  • 路径二:基于开源代码二次开发。您可按自身平台规范修改调度策略、监控模板等,自由适配容器层能力;约束是最终须通过统一 gRPC 接口调用底层能力,以保证接口兼容性。源码获取与定制方法见开源组件定制,接口协议见gRPC接口参考。

问题归属与支持渠道见部署与版本指南。

6. 功能支持矩阵

Y 表示当前版本已支持,N 表示当前版本未支持。

大类

子类

功能

NVIDIA GPU

PPU

AMD GPU

资源切分

算力

时分复用(TDM)

Y

Y

N

物理空分复用(MIG)

Y

Y*

N

显存

空分

Y

Y

N

健康监测

硬件单卡

计算/带宽/显存/温度等

Y

Y

Y

切分实例

时间/SM/显存利用率

Y

Y

N

健康检测

在线实时微感

Y

Y

Y

调度策略

算力时分 + 显存空分双维度

Y

Y

N

虚实混部调度

Y

Y

N

拓扑感知

节点内拓扑亲和调度

N

Y

N

跨节点 Gang 拓扑调度

N

Y

N

注:

(1)MIG 是 NVIDIA 硬件级技术,Pascal/Volta/Turing 等架构不支持;表中 PPU 列的 Y* 表示 PPU 自有空分技术(非 NVIDIA MIG)。(2)"虚实混部调度"依赖 Scheduler Framework,AMD 当前不支持该插件,故暂不支持。

7. 使用前提

使用 Runtime Kit 需满足以下条件:

  1. 使用灵骏裸金属节点。Runtime 包随灵骏裸金属 OS 镜像预装,仅在灵骏裸金属环境可用。

  2. 在 Kubernetes 中使用上述能力时,须通过开源组件套件的标准方式接入,即通过统一 gRPC 接口对接底层能力,以保证接口兼容和后续可升级。

附录:术语表

术语

全称

说明

xPU

extended Processing Unit

异构加速设备统称(GPU/PPU/AMD 等)

PPU

—

平头哥真武加速卡(PPU 810E / PPU M890P)

TDM

Time Division Multiplexing

时分复用:按时间片切分算力

MIG

Multi-Instance GPU

NVIDIA 硬件级空分技术

RDMA

Remote Direct Memory Access

远程直接内存访问,绕过 CPU 实现节点间高带宽低延迟通信

RunC

—

标准容器运行时(Docker/containerd)

UDS

Unix Domain Socket

进程间高性能本地通信通道

Gang Scheduling

—

成组调度:一组 Pod 必须全部可调度才整体下发,否则全部回滚