模型代理是PolarDB AI Infra的核心组件,提供统一的模型API代理、消费者管理、预算控制和可观测能力,帮助企业安全、高效地接入和管理AI模型服务。
背景信息
随着企业对大模型的使用日益广泛,直接调用模型服务面临以下挑战:
-
成本失控:缺乏统一的预算管理和限流机制,难以跟踪和控制各业务团队的Token消耗量,容易导致费用超支。
-
治理缺失:企业内部多个团队分别管理各自的模型API Key和调用逻辑,导致管理分散、运维成本高。
-
安全合规风险:API Key分散存储、缺乏请求审计,难以满足企业安全合规要求。
-
可观测性不足:无法实时掌握模型调用的成功率、延迟和Token消耗等关键指标,出现问题时排查困难。
模型代理通过在企业应用和模型服务之间建立统一的代理层,系统性地解决以上问题。
核心优势
-
成本可控:支持多维度的限流策略和预算管理,可按用户组和用户设置Token消耗上限,有效防止成本超支。
-
安全合规:API Key加密存储,所有请求经过统一鉴权和审计,满足企业安全合规要求。
-
全面可观测:实时监控模型调用的成功率、延迟、Token消耗等指标,支持调用日志查询,便于问题定位和优化。
应用场景
-
PolarDB Agent Express多智能体平台:模型代理与PolarDB Agent Express应用集成,为多智能体应用提供统一的模型接入、限流和预算管理能力。
-
企业AI平台管理:统一管理企业内部多个团队的模型调用,通过用户组实现分级管理和资源隔离。
-
财务治理:通过预算管理和费用规则,精确追踪各团队的模型使用成本,实现精细化成本管控。
-
安全管理:通过IP白名单、统一鉴权和调用审计,确保模型访问的安全性。
功能特性
|
类别 |
功能 |
说明 |
|
模型管理 |
多模型多租户 |
支持接入多个模型服务,通过模型API为不同业务团队提供独立的调用入口。 |
|
消费者管理 |
企业级分层管理 |
支持用户组和用户的分层管理,可按企业组织架构设置权限和配额。 |
|
流量控制 |
多维度限流 |
支持按用户组和用户设置每分钟Token限额,防止资源过度消耗。 |
|
可观测性 |
实时监控 |
提供调用成功率、延迟、Token消耗量等实时指标监控和调用日志查询。 |
|
高可用 |
高可用架构 |
采用高可用架构部署,确保服务稳定性。 |
|
流量调度 |
智能流量调度 |
支持按权重分流和故障自动切换等模式。 |
|
资源管理 |
精细化资源管理 |
支持按输入Token、输出Token和缓存Token分别设置费用规则,实现精细化成本核算。 |
|
协议兼容 |
协议兼容 |
兼容OpenAI与Anthropic协议,同时支持协议转换,业务应用无需修改代码即可通过模型代理接入模型服务。 |
费用说明
组件费用:模型代理收取资源组件费用,费用根据您选择的组件规格(CPU和内存)和购买时长计算。