PAI-Instant Service提供基于 Grafana 的多维度监控大盘(即时服务 / 模板 / 实例),以及经压测验证的性能指标参考。以下介绍如何查看监控大盘,以及在 RL 训练、评测等高并发场景下的容量与吞吐表现。
Grafana 监控大盘
在即时服务工作台、模板详情页、实例详情页均可单击打开监控页面,跳转至对应维度的 Grafana 监控大盘。
即时服务工作台与模板详情页的监控大盘展示以下指标:
实例部分:
Sandbox Count:实例数量统计(总数、运行中、暂停中)。
Sandbox Creation Latency:实例创建延迟(max、avg、P50、P90 等)。
Top Sandbox Templates:使用最多的模板排行。
Requested CPU Cores / Memory / Storage:实例资源申请量。
Gateway API 部分:
Sandbox Creation/Deletion/Connection QPM:实例创建、删除、连接等管控 API 的每分钟调用量(QPM)。
Sandbox Operation Count:在所选时间范围内,实例创建、删除、连接的累计次数。
Proxy Request:访问实例服务的 Gateway 代理 API 的 QPS、延迟、错误率等指标。
实例详情页的监控大盘展示该实例的运行时指标,如CPU、Memory使用率,网络、磁盘与进程的运行时状态。
性能指标
PAI-Instant Service在大规模并发场景下经过严格的性能压测验证。以下为典型测试数据,供您评估在 RL 训练、评测等高并发场景下的容量与吞吐表现。
测试环境
集群:基于 PAI 计算集群。
节点池规模:300 个节点。
ecs.c6.13xlarge(52 核 / 91 GiB) × 277ecs.c6.26xlarge(104 核 / 183 GiB) × 23
测试时间:2026 年 4 月。
测试方法
客户端通过脚本批量提交实例创建请求至控制面,以脚本开始批量发送的时间作为压测起始时间,以最后一个实例启动成功的用时作为压测结束时间,两者之差即为实例并发启动耗时。
测试模板规格
Code Interpreter(1 CPU / 2 GiB 内存 / 8 GiB 磁盘)
测试结果
PAI-Instant Service在万级并发场景下的整体 QPS 稳定保持在 750 以上,节点单实例启动 P99 延迟控制在 600 ms 以内,可充分支撑大规模 评测、RL Rollout 等对实例启停吞吐有高要求的业务场景。
创建实例数量 | 并发启动耗时 | 整体 QPS | 节点平均延迟 | 节点 P50 延迟 | 节点 P99 延迟 |
10,000 | 13.23 s | 755.74 | 396.02 ms | 395.81 ms | 502.73 ms |
20,000 | 26.17 s | 764.23 | 457.62 ms | 437.96 ms | 582.07 ms |
并发启动耗时是全部实例启动的总耗时,受到客户端并发限制等约束。单实例的启动时间请参考节点延迟数据。