灵骏节点池概述

更新时间:
复制 MD 格式

ACK 通过灵骏节点池的形式管理灵骏节点,支持节点池生命周期管理、节点批量添加和移除,提供节点配置、调度编排、监控诊断和自动化运维等能力,同时针对 AI 和 HPC 场景提供 RDMA 网络、GPU 调度等增强能力。

  • 绑定关系

    ACK 中的灵骏节点池与智能计算灵骏服务(灵骏裸金属集群)的节点分组为一对一绑定关系,即一个灵骏集群的节点分组对应一个 ACK 集群中的灵骏节点池,一个灵骏节点只能属于一个灵骏节点池。通过节点池划分,可对ACK集群中的灵骏节点实施差异化管理。

  • AI / HPC 增强能力

    安装云原生AI套件后,灵骏节点池针对 AI和 HPC 场景提供以下增强能力:

    • GPU 调度:支持多 GPU 卡拓扑感知调度,结合 GPU 容器虚拟化方案提供共享 GPU 调度和隔离。

    • 任务调度策略:支持 Gang、Capacity、Binpack 等调度策略。

    • 数据加速:支持数据集编排和访问加速。

功能概览

节点生命周期管理

功能

说明

创建/编辑/删除/查看灵骏节点池

通过 ACK 控制台管理灵骏节点池。

添加已有灵骏节点

将灵骏节点分组中的节点批量加入节点池,纳入 ACK 统一管理。

不替换节点操作系统、系统盘和数据盘。

移除灵骏节点

将节点从灵骏节点池中移除,停止 ACK 对该节点的管理。移除后节点不会从灵骏节点分组缩容,也不会自动释放或退订。

节点配置与运维

功能

说明

自定义节点池kubelet配置

为节点池统一配置 kubelet 启动参数,如资源预留、Pod 并发数等,以适配特定工作负载需求。

自定义节点池OS参数

为节点池统一配置操作系统内核参数,如网络栈参数、文件描述符限制等,优化节点底层运行环境。

升级 kubelet 版本

将节点池内节点的 kubelet 升级至与集群控制面一致的版本,保持集群版本兼容性。

仅支持原地升级,不支持替盘升级。

开启节点自愈

ACK会自动监测异常事件,并在灵骏节点发生底层事件故障时调用灵骏审批运维操作能力完成修复。

AI / HPC 增强能力

功能

说明

使用RDMA功能

为灵骏节点上的 Pod 提供 RDMA 网络通信能力,满足 AI 训练和 HPC 等场景对高带宽、低延迟网络的需求。

使用共享GPU调度

在灵骏节点上实现 GPU 资源的共享与隔离,多个 Pod 按配额使用同一 GPU,提升 GPU 资源利用率。

自定义调度器参数

模型训练任务场景下,可在Pod调度时启用Binpack策略,即优先集中放置策略,以减少跨机通信延迟。

使用网络拓扑感知调度

根据灵骏节点的网络拓扑结构优化 Pod 放置策略,使通信密集型 Pod 尽量调度到网络距离近的节点,降低跨机通信延迟。

计费说明

ACK托管集群Pro中使用灵骏节点池时,费用由三部分组成:

说明

20250805起,灵骏节点管理能力结束免费邀测,并正式开启商业化收费,更多信息,请参见【收费公告】灵骏节点管理收费公告。邀测期间,灵骏节点池的功能可以免费使用,ACK托管集群Pro的其他费用(集群管理费和云产品资源费)仍然正常收取,请参见 计费概述