ACK 通过灵骏节点池的形式管理灵骏节点,支持节点池生命周期管理、节点批量添加和移除,提供节点配置、调度编排、监控诊断和自动化运维等能力,同时针对 AI 和 HPC 场景提供 RDMA 网络、GPU 调度等增强能力。
功能概览
节点生命周期管理
功能 | 说明 |
通过 ACK 控制台管理灵骏节点池。 | |
将灵骏节点分组中的节点批量加入节点池,纳入 ACK 统一管理。 不替换节点操作系统、系统盘和数据盘。 | |
将节点从灵骏节点池中移除,停止 ACK 对该节点的管理。移除后节点不会从灵骏节点分组缩容,也不会自动释放或退订。 |
节点配置与运维
功能 | 说明 |
为节点池统一配置 kubelet 启动参数,如资源预留、Pod 并发数等,以适配特定工作负载需求。 | |
为节点池统一配置操作系统内核参数,如网络栈参数、文件描述符限制等,优化节点底层运行环境。 | |
将节点池内节点的 kubelet 升级至与集群控制面一致的版本,保持集群版本兼容性。 仅支持原地升级,不支持替盘升级。 | |
ACK会自动监测异常事件,并在灵骏节点发生底层事件故障时调用灵骏审批运维操作能力完成修复。 |
AI / HPC 增强能力
功能 | 说明 |
为灵骏节点上的 Pod 提供 RDMA 网络通信能力,满足 AI 训练和 HPC 等场景对高带宽、低延迟网络的需求。 | |
在灵骏节点上实现 GPU 资源的共享与隔离,多个 Pod 按配额使用同一 GPU,提升 GPU 资源利用率。 | |
模型训练任务场景下,可在Pod调度时启用Binpack策略,即优先集中放置策略,以减少跨机通信延迟。 | |
根据灵骏节点的网络拓扑结构优化 Pod 放置策略,使通信密集型 Pod 尽量调度到网络距离近的节点,降低跨机通信延迟。 |
计费说明
在ACK托管集群Pro版中使用灵骏节点池时,费用由三部分组成:
自2025年08月05日起,灵骏节点管理能力结束免费邀测,并正式开启商业化收费,更多信息,请参见【收费公告】灵骏节点管理收费公告。邀测期间,灵骏节点池的功能可以免费使用,ACK托管集群Pro版的其他费用(集群管理费和云产品资源费)仍然正常收取,请参见 计费概述。