EAS(Elastic Algorithm Service)将训练好的模型部署为在线推理服务或AI-Web应用。EAS支持异构资源,结合自动扩缩容、一键压测、灰度发布、实时监控等能力,以更低成本保障高并发场景下的服务稳定性。
产品架构

核心能力
EAS覆盖资源管理、模型部署和服务运维全流程。
灵活的资源与成本管理
异构硬件支持:EAS 是全托管的模型部署与推理服务,并非传统 ECS 服务器,底层基于阿里云弹性计算资源(如 ECS、GPU 实例等)构建。支持CPU、GPU及AI专属GU/PPU等多种异构硬件规格,满足不同模型的性能需求;您在部署服务时可根据模型需求选择具体资源配置。
成本优化:支持抢占型实例,显著降低计算成本。通过定时扩缩容,可根据业务周期提前设定策略,精准控制资源投入。
弹性资源池:当专属资源组用满后,可自动将新增实例调度至公共资源组,兼顾成本控制与服务稳定性。
全面的稳定性与高可用保障
弹性扩缩容:根据实时负载自动调整服务副本数量,应对不可预测的流量高峰,避免资源闲置或服务过载。
高可用机制:自动故障恢复,确保服务连续性。专属资源为物理隔离,无资源抢占风险。
安全发布:支持灰度发布,按比例分配流量至新版本验证。支持流量镜像,将线上流量复制到测试服务验证可靠性,不影响真实用户请求。
高效的部署与运维
一键压测:支持动态加压并自动探测服务性能极限,实时查看秒级监控数据与压测报告,帮助您快速评估服务能力。
实时监控:提供QPS、响应时长、CPU利用率等关键指标的实时监控,支持开通服务监控报警,全面掌握服务运行状态。
多种部署方式:支持通过镜像(推荐)或Processor部署方式部署服务,满足不同技术栈的需求。
多样的推理模式
实时同步推理:高吞吐、低延迟,适用于搜索推荐、对话机器人等对响应延迟敏感的场景。针对大语言模型等生成式模型响应延迟高的问题,非流式输出需等待全部 Token 生成完毕才返回结果,容易造成高延迟感知;建议开启流式输出(Streaming)模式,实现 Token 级实时返回,显著改善用户体验。若开启流式输出后性能仍不满足预期,可尝试切换至更高配置的公共资源组机型进行对比测试。
近实时异步推理:内置消息队列,适用于文图生成、视频处理等长耗时任务。根据队列积压程度自动扩缩容,避免请求堆积。
离线批量推理:适用于对响应时长不敏感的批量处理场景,如语音数据批量转换。支持抢占型资源实例以降低成本。
使用流程
步骤1:准备工作
准备推理资源:根据模型大小、并发需求和预算,选择合适的EAS资源类型。资源选型及购买指导请参见EAS部署资源概述。
说明仅公共资源无需提前购买,可直接使用;其他资源类型(EAS资源组、资源配额)需先购买再使用。
准备文件:将训练好的模型、代码处理文件及依赖项上传至OSS等云存储,以便后续通过存储挂载在服务中使用。OSS 中的模型文件本身与操作系统无关,Windows 和 Linux 均可下载;但模型部署运行依赖推理框架(如 vLLM、Triton Server 等)的系统支持情况,主流框架优先支持 Linux 环境,Windows 系统需提前确认所用框架的兼容性。建议您在部署前查阅对应推理框架的官方文档,确认系统要求。
步骤2:部署服务
步骤3:调用与压测服务
步骤4:监控与管理服务
监控与报警:在推理服务列表中查看服务运行状态、资源组信息及服务ID、实例标识等信息,可按资源组筛选服务。建议开通服务监控报警以实时掌握服务健康状况。
弹性伸缩:根据业务需求配置弹性扩缩容或定时扩缩容策略,动态管理计算资源。您可在 PAI 控制台的 EAS 服务详情页面查看当前服务的部署模式配置,区分是常驻实例还是弹性伸缩模式:常驻实例保持固定副本数运行,弹性伸缩则根据策略动态调整副本数量。
服务更新:在操作列下单击更新以部署新版本。更新完成后,可查看版本信息或切换版本。
警告服务更新过程中将暂时中断运行,可能导致依赖此服务的请求失败,请谨慎操作。
服务迁移:如需跨地域迁移EAS服务配置,可使用EASCMD命令行工具导出源地域的服务配置,然后在目标地域使用该配置创建新服务。
重要提示
若EAS服务持续180天处于非运行中状态,系统将自动删除该服务。
EAS支持的地域参见地域和可用区。
计费说明
详情参见模型在线服务(EAS)计费说明。
快速开始
场景案例
常见问题
Q:专属资源 vs 公共资源?
公共资源:适合对成本敏感、可容忍性能波动的开发测试或小规模业务。成本较低,但高峰期可能存在资源争用。
专属资源:适合对稳定性和性能有高要求的生产环境。物理隔离无抢占风险,弹性资源池特性允许在专属资源用满后自动溢出到公共资源,兼顾成本与高峰期稳定性。库存紧张的机型需通过专属资源锁定购买。
Q:EAS相比自建服务有什么优势?
EAS提供托管运维:自动处理资源调度、故障恢复和监控,内置弹性伸缩、灰度发布功能。开发者可专注模型开发,省去运维成本,加速上线。
Q:如何查看EAS服务的实例ID或集群ID?
EAS(模型在线服务(EAS))是模型在线推理服务,并非 ACK 容器集群,因此不存在传统意义上的“集群ID”。如需标识某个服务,请使用服务名称或服务ID。
查看路径:登录 PAI 控制台 > 模型在线服务(EAS) > 推理服务列表,在服务列表中可查看服务名称和ID。
Q:PAI-EAS对部署的模型大小是否有限制?
EAS 本身不设固定的模型大小限制,实际可部署的模型大小取决于所选资源规格的内存/显存容量及存储挂载空间。建议您根据模型参数量和精度选择匹配的 GPU/CPU 机型,并通过 OSS 存储挂载加载大模型文件。
若模型过大导致加载失败,可尝试升级资源规格,或采用模型量化、分片加载等优化手段。