什么是模型代理

更新时间:
复制 MD 格式

模型代理PolarDB AI Infra的核心组件,提供统一的模型API代理、消费者管理、预算控制和可观测能力,帮助企业安全、高效地接入和管理AI模型服务。

背景信息

随着企业对大模型的使用日益广泛,直接调用模型服务面临以下挑战:

  • 成本失控:缺乏统一的预算管理和限流机制,难以跟踪和控制各业务团队的Token消耗量,容易导致费用超支。

  • 治理缺失:企业内部多个团队分别管理各自的模型API Key和调用逻辑,导致管理分散、运维成本高。

  • 安全合规风险:API Key分散存储、缺乏请求审计,难以满足企业安全合规要求。

  • 可观测性不足:无法实时掌握模型调用的成功率、延迟和Token消耗等关键指标,出现问题时排查困难。

模型代理通过在企业应用和模型服务之间建立统一的代理层,系统性地解决以上问题。

核心优势

  • 成本可控:支持多维度的限流策略和预算管理,可按用户组和用户设置Token消耗上限,有效防止成本超支。

  • 安全合规:API Key加密存储,所有请求经过统一鉴权和审计,满足企业安全合规要求。

  • 全面可观测:实时监控模型调用的成功率、延迟、Token消耗等指标,支持调用日志查询,便于问题定位和优化。

应用场景

  • PolarDB Agent Express多智能体平台模型代理PolarDB Agent Express应用集成,为多智能体应用提供统一的模型接入、限流和预算管理能力。

  • 企业AI平台管理:统一管理企业内部多个团队的模型调用,通过用户组实现分级管理和资源隔离。

  • 财务治理:通过预算管理和费用规则,精确追踪各团队的模型使用成本,实现精细化成本管控。

  • 安全管理:通过IP白名单、统一鉴权和调用审计,确保模型访问的安全性。

功能特性

类别

功能

说明

模型管理

多模型多租户

支持接入多个模型服务,通过模型API为不同业务团队提供独立的调用入口。

消费者管理

企业级分层管理

支持用户组和用户的分层管理,可按企业组织架构设置权限和配额。

流量控制

多维度限流

支持按用户组和用户设置每分钟Token限额,防止资源过度消耗。

可观测性

实时监控

提供调用成功率、延迟、Token消耗量等实时指标监控和调用日志查询。

高可用

高可用架构

采用高可用架构部署,确保服务稳定性。

流量调度

智能流量调度

支持按权重分流和故障自动切换等模式。

资源管理

精细化资源管理

支持按输入Token、输出Token和缓存Token分别设置费用规则,实现精细化成本核算。

协议兼容

协议兼容

兼容OpenAIAnthropic协议,同时支持协议转换,业务应用无需修改代码即可通过模型代理接入模型服务。

费用说明

组件费用模型代理收取资源组件费用,费用根据您选择的组件规格(CPU和内存)和购买时长计算。

单个组件价格信息

中国内地

节点规格码

CPU和内存

包年包月(元/月)

按量付费(元/小时)

polar.app.g2.small

12 GB

18

0.04

polar.app.g2.medium

24 GB

250

0.52

polar.app.g4.medium

28 GB

270

0.56

polar.app.g8.medium

216 GB

330

0.6875

polar.app.g2.large

48 GB

475

0.99

polar.app.g4.large

416 GB

630

1.31

polar.app.g8.large
432 GB

660

1.375

polar.app.g2.xlarge

816 GB

1,000

2.08

polar.app.g4.xlarge

832 GB

1,240

2.58

polar.app.g8.xlarge
864 GB

1,320

2.75

polar.app.g2.2xlarge

1632 GB

2,000

4.17

polar.app.g4.2xlarge

1664 GB

2,400

5.00

polar.app.g8.2xlarge
16128 GB

2,640

5.5

polar.app.g2.4xlarge
3264 GB

4,000

8.32

polar.app.g4.4xlarge
32128 GB

4,320

8.96

polar.app.g8.4xlarge
32256 GB

5,280

11

polar.app.g4.6xlarge
48192 GB

6,000

12.48

polar.app.g8.6xlarge
48384 GB

6,480

13.44

polar.app.g2.8xlarge
64128 GB

8,000

16.64

polar.app.g4.8xlarge
64256 GB

8,640

17.92

polar.app.g8.8xlarge
64512 GB

14,080

29.32

polar.app.g8.12xlarge
88710 GB

19,360

40.31

polar.app.g8.15xlarge
120920 GB

26,400

54.98

polar.app.g8.23xlarge
1801800 GB

39,600

82.46

常见问题

  • 模型代理是否支持公网访问?

    模型代理默认仅支持VPC内访问。如果您的业务场景需要模型代理访问公网模型服务(如阿里云大模型服务平台百炼的公网API),需要配置公网NAT网关

  • API Key丢失了怎么办?

    您前往用户组管理 > 用户 页面,在目标用户的API Key列单击复制按钮查看

  • 如何控制AI模型服务的使用成本?

    模型代理提供两种成本控制机制:

    • 预算管理:在全局、用户组和用户级别设置费用上限,控制总体成本。

    • 限流策略:在用户组或用户级别配置每分钟Token限额,控制消耗速率。

  • 模型代理是否支持多模型负载均衡?

    支持,当前版本的模型代理已支持单服务多服务(按权重) 模式,您可以在创建模型API自定义配置。