TokenWorks 是阿里云 PAI 面向 Agentic Cloud 推出的企业专属的高保障SLO推理服务平台,通过 LLM 智能路由、Cache 感知调度、KV Cache 存储、模型预热与全球算力统筹等核心能力,帮助企业以更低成本、更高 SLO 保障、更强自主可控的方式,构建专属大模型推理服务。
为什么需要 TokenWorks
Agent 与 AI Coding 场景正在把大模型推理推向“高并发、长上下文、强 Cache 依赖、成本敏感”的新阶段。传统 QPS 限流、无状态负载均衡与“堆卡扩容”的模式,已无法解决 KV Cache 命中率低、首 Token 延迟抖动、GPU 显存浪费、多租户成本难核算等一系列问题。企业需要一个专为 Token 流量而生的推理入口和调度中枢,让每一份算力都用在刀刃上。
核心亮点
LLM 智能路由:Token 时代的专用流量入口。 天然兼容 OpenAI、Anthropic Messages、通义百炼等多协议,让 Claude Code、Codex 等客户端零改造直接接入;支持 PD 分离流量编排、Token 级限流、模型路由、按权重或前缀分流代理、多租户 API Key 与用量核算,一步到位构建企业内部 AI 平台的成本治理底座。
引擎深度优化:为下一代大模型架构而生。 面向 MoE 与 Hybrid Attention 类模型深度调优,原生支持大规模 EP 分布式并行与异构 PD 分离部署;在推理引擎上融合 HiSparse 显存稀疏、DSpark / DFlash 块扩散投机采样、PPD 与 Decode Radix Cache 等缓存复用优化技术,同时结合 PPU 上的网络通信与专用算子优化,把学术前沿的模型加速能力真正沉淀为线上可用的确定性收益。
Cache-Aware 智能调度:让流量“跟着 Cache 走”。 通过 Session 亲和、Prefix 前缀命中、KV Cache 复用、负载均衡四级调度体系,把 KV Cache 从黑盒变成可运营资产,显著提升缓存命中率、降低 TTFT,同时避免热点实例过载。
KV Cache Store:把显存压力卸载到分布式存储。 将高频复用的 KV Cache 从 GPU 显存卸载到 CPU 内存、共享磁盘乃至专用 Cache 池,Prefix 存储容量提升数十倍;针对 GLM、DeepSeek 的 Sparse Attention等新型 Attention 结构进行 KV 组织与压缩优化,在长上下文场景下依旧保持高命中、低延迟。
模型预热内存缓存:秒级冷启动。 面向大模型部署的镜像与权重预热方案,把动辄数百 GB 的模型加载时间从分钟级压缩到秒级,配合 Spot 抢占式实例调度,让弹性扩缩容与故障自愈真正可用。
全球调度:算力全局统筹。 当前地域推理资源紧缺时,业务流量可自动调度到其他空闲地域的推理实例,实现跨地域算力池化与高效复用,兼顾业务连续性与成本最优。
核心功能
TokenWorks 由以下功能模块组成:
功能模块 | 说明 |
工作站 | TokenWorks 的顶层管理单元。创建工作站后,系统自动生成统一的调用入口(Base URL 和 API 密钥)。所有推理服务和 KV Cache 服务均归属于工作站。 |
推理服务 | 工作站内的模型推理实例。可从 ModelGallery 快速创建,也可基于自定义模型创建。每个推理服务保留独立调用入口,同时共享工作站的统一入口。 |
KV Cache | 工作站内的缓存服务。通过建立显存→内存→本地 SSD→远程存储的多级缓存和查询机制,提升长上下文和高频请求的响应效率。 |
智能路由 | 工作站统一入口背后的流量调度组件。根据您配置的调度策略,自动将请求分发到合适的推理服务实例。 |
配置中心 | 高级调度配置的管理入口,包括:调度策略(Session/Cache 亲和性)、分流代理、请求限流、流量镜像、全球调度等。 |
用户管理 | 管理工作站内的用户,支持用户的增删改查、启用/禁用,提供 API Key 管理,并支持按角色(普通用户、管理员、系统管理员)分配权限。 |
实时监控 | 近实时展示吞吐量、TTFT/TPOT、缓存命中率、QPS 等性能指标及各组件运行状态,帮助快速定位异常与性能瓶颈。 |