使用GA实现模型代理与调度

更新时间:
复制 MD 格式

企业在跨地域调用 AI API 时,常面临以下挑战:根据业务场景不同需要访问多种模型、客户端与后端模型往往不在同一地域导致延迟高、后端模型分布在多个地域需要跨地域跨模型调度和容灾、不同区域自建网关可能产生请求绕行问题。GA 终端节点组支持 AI 服务类型,配合服务扩展能力,可在 GA 入口统一接入多家 AI 供应商进行流量分发。

产品功能邀测中,如需使用请联系商务经理。
  • 模型代理:配置AI模型的转发条件后,支持根据模型名称将流量分流到不同的 AI 服务终端节点组。

  • API Key 统一管理:真实供应商 API Key 集中保留在 GA 侧,支持多 Key 自动轮转。

  • 容错回退:转发动作支持容错回退 Fallback,支持跨地域跨模型的容错回退,在终端节点组不可用时自动容错回退到其他终端节点组。

  • 服务扩展:GA 支持服务扩展,可以通过服务扩展完成 API Key 前向鉴权,每条转发规则支持关联 1 个服务扩展。

image

多模型统一接入

企业需要在同一入口调用多种 AI 模型时,可通过 GA 终端节点组的 AI 服务类型统一接入多家供应商。客户端只需向 GA 发送符合 OpenAI 兼容格式的请求并指定模型名称,GA 的转发规则即可根据模型名称将请求路由至对应的后端 AI 服务,实现统一入口,降低业务复杂度和维护成本。

部署前确保:

  • 已开通全球加速服务。

  • 已注册自定义域名。如果加速地域在中国内地或使用华北2(北京)地域的百炼服务,自定义域名需完成ICP备案

  • 已获取至少一家 AI 供应商的 API Key(阿里云百炼可通过百炼控制台获取;OpenAI 兼容服务联系对应供应商获取)。

  • 如使用HTTPS监听(推荐),需准备与自定义域名匹配的服务器证书,并上传至证书管理服务

如果您的业务配置涉及中国内地中国香港、中国澳门、中国台湾或其他国家和地区之间的访问加速,需要根据界面提示完成数据跨境合规承诺。请您自行评估业务数据传输的合规性,确保符合所适用法律法规及产品使用协议。

控制台

配置 AI 服务终端节点组

登录全球加速管理控制台,单击创建标准型按量付费实例

  1. 实例基础配置:按需选择加速IP类型

  2. 配置加速区域:配置加速区域分配带宽

  3. 配置监听:配置智能路由(原标准监听)协议推荐选择HTTPS端口为 443,配置SSL证书选择已上传的、与自定义域名匹配的服务器证书。

  4. 配置终端节点组

    GA 实例创建完成后,可前往监听详情页,选择终端节点组页签,单击添加终端节点组,按照以下步骤配置不同地域的 AI 服务终端节点组。每个终端节点组仅支持添加1AI服务类型的后端服务类型,添加后不能添加其他后端服务。
    • 地域:选择就近的 AI 供应商服务可用地域。

      如果业务涉及中国内地与中国香港、中国澳门、中国台湾或其他国家和地区之间的访问加速,请按界面提示阅读并签署数据跨境合规承诺
    • 后端服务类型:选择AI服务

    • 大模型供应商:目前支持阿里云百炼OpenAI兼容(OpenAI Compatible)

    • 服务地址:选择供应商后自动填充。阿里云百炼默认为https://dashscope.aliyuncs.com/compatible-mode/v1,OpenAI兼容默认为https://api.openai.com/v1。如使用自建OpenAI兼容服务,请按需修改。

    • API Key:配置供应商 API Key,支持填写多个 Key(按换行分隔),GA将在多个 Key 之间轮转以提升可用性。

      该 API Key 用于与 AI 供应商之间的身份验证,请妥善保管,避免泄露。
    • 权重(0-255):每个终端节点组仅支持添加1AI服务类型的后端服务类型,添加后不能添加其他后端服务。权重固定为255,不可修改。

  5. 配置审核:提交配置。

配置转发策略

  1. 创建 GA 实例后,单击实例 ID,选择监听页签,单击监听ID,单击转发策略页签,单击插入新策略

  2. 配置转发策略,将不同模型的请求路由到对应的终端节点组:

    • 策略名称:自定义策略名称。

    • 转发条件:选择AI模型,配置如下:

      • 协议:固定为OpenAI兼容

      • 模型名称(可选):使用Glob语法匹配模型名称。例如qwen-*表示所有Qwen系列模型,*表示匹配所有模型。可添加多个模型名称,多值之间为"或"关系。

    • 转发动作:选择转发至,并选择对应的 AI 服务终端节点组。

  3. 单击确定完成转发策略创建。

  4. 如需按模型分流到多个供应商,可重复以上步骤,为不同Glob模型名称分别创建转发策略。例如,客户端调用model=qwen-plusmodel=gpt-4o命中不同转发规则,路由到对应供应商。

未填写模型名称时,本条件匹配所有 OpenAI 兼容协议请求;填写后仅匹配指定模型。可以通过鼠标拖拽来调整规则优先级。

配置DNS解析并验证

  1. 在实例详情页复制GA加速域名(CNAME),在自定义域名的DNS服务商处添加一条CNAME记录,将自定义域名指向GA加速域名。

    DNS解析生效时间通常为分钟级,具体以您DNS服务商的TTL设置为准。
  2. 客户端使用自定义域名调用 AI 服务 API,验证接入是否生效。

    以模型名称为qwen-*为例。
    curl -X POST https://your-domain.com/v1/chat/completions \
      -H "Content-Type: application/json" \
      -d '{
        "model": "qwen-plus",
        "messages": [{"role": "user", "content": "你好"}]
      }'

    请求成功时,响应中的model字段为qwen-plus,表明请求已正确路由至阿里云百炼。

API

  • 调用CreateEndpointGroup创建 AI 服务终端节点组,关键参数:EndpointGroupType=defaultEndpointConfigurations[].Type=AIServiceSubType=Bailian(阿里云百炼)或OpenAICompatible(OpenAI兼容);ApiKeys传入Key数组;Weight=255

  • 调用CreateListener接口创建HTTPS监听,默认终端节点组关联创建的AI服务终端节点组。

  • 调用CreateForwardingRules接口创建转发规则:

    • RuleConditions[].RuleConditionType:设置为AIModel

    • AIModelConfig.Protocol:设置为OpenAICompatibleAIModelConfig.ModelNames传入Glob模型名称数组(可选)。

    • RuleActions:配置RuleActionType=ForwardGroup,转发至 AI 服务终端节点组。

如果业务涉及中国内地与中国香港、中国澳门、中国台湾或其他国家和地区之间的访问加速,需先完成数据跨境合规承诺签署。

多地域容灾

在完成多模型统一接入的基础上,可进一步配置容错回退实现跨地域容灾。转发动作支持容错回退 Fallback,可配置多个回退目标,当默认转发的终端节点组不可用时自动切换到其他地域的终端节点组,客户端无需改造即可获得多地域容灾能力。

控制台

配置多地域终端节点组

创建 GA 实例后,可单击实例 ID,选择监听页签,单击监听ID,选择终端节点组页签,单击添加终端节点组,配置不同地域的 AI 服务终端节点组。

配置转发策略

配置完成后可验证:当默认转发的终端节点组调用失败时,请求自动依次回退到后续其他地域的终端节点组,由对应供应商或地域响应。

  1. 在监听详情页,单击转发策略页签,单击插入新策略编辑已有策略。

  2. 配置转发策略:

    • 转发条件:选择AI模型,配置如下:

      • 协议:固定为OpenAI兼容

      • 模型名称(可选):使用Glob语法匹配模型名称。例如qwen-*表示所有Qwen系列模型,*表示匹配所有模型。可添加多个模型名称,多值之间为"或"关系。

    • 转发动作:按顺序配置以下两条动作:

      1. 转发至:选择某一地域的终端节点组。

      2. 添加动作,选择容错回退,并选择其他地域的终端节点组。

      容错回退动作,必须放置在转发至动作之后执行。一个转发规则中必须有且只能有一条转发至重定向至返回固定响应类型的转发动作。
  3. 单击确定完成转发策略创建。如需按模型分流到多个供应商,可重复以上步骤,为不同Glob模型名称分别创建转发策略。

未填写模型名称时,本条件匹配所有 OpenAI 兼容协议请求;填写后仅匹配指定模型。可以通过鼠标拖拽来调整规则优先级。

API

  • 调用CreateEndpointGroup创建多地域 AI 服务终端节点组,以及通过CreateListener创建HTTPS监听。

  • 调用CreateForwardingRules创建转发规则:

    • RuleConditions[].RuleConditionType:设置为AIModel

    • AIModelConfig.Protocol:设置为OpenAICompatibleAIModelConfig.ModelNames传入Glob模型名称数组(可选)。

    • RuleActions1条:RuleActionType=ForwardGroup,关联默认转发的终端节点组。

    • RuleActions2条:RuleActionType=Fallback,关联其他地域的终端节点组,顺序必须在ForwardGroup之后。

服务扩展

GA 支持服务扩展能力,当前可通过 API Key 认证类型的服务扩展在 GA 入口完成客户端凭证校验。客户端使用 GA 侧统一颁发的 API Key 发起请求,仅通过鉴权的流量会被转发到 AI 服务终端节点组。客户端凭证可独立于后端真实供应商 API Key 进行发放、更换和吊销,便于企业按业务统一管理。

控制台

  1. 前往GA 控制台 - 服务扩展页面,单击创建服务扩展

    • 组件名称:目前仅支持API Key认证

    • 超时时间(毫秒):等待组件响应的最长时间,超过此时间判定请求失败。

    • 处理策略:组件执行失败时请求的处理策略。当前仅支持终止,即不满足API key鉴权的流量在此终止。

    • 凭证来源

      • Authorization:Bearer:从HTTP请求的Authorization标头中按Bearer方案提取凭证。推荐用于OpenAI兼容协议场景。

      • 自定义HTTP标头:从指定的HTTP标头中提取凭证。

      • 自定义查询字符串:从指定的URL查询字符串中提取凭证。

    • 凭证管理:最多可配置3个凭证。生成方式自定义。凭证保存后将以*******脱敏展示,请妥善保管。

  2. 在服务扩展详情页关联资源页签,单击添加关联资源,选择已完成配置的转发策略进行关联。

    服务扩展通过关联转发规则在监听流量上生效,可同时关联多条转发规则。
  3. 客户端使用 GA 颁发的凭证调用 AI 服务 API,验证鉴权效果:

    • 使用正确凭证且与配置的凭证来源匹配:请求正常转发到后端AI服务,由供应商API Key完成后端鉴权。

    • 使用错误/缺失凭证且处理策略为终止:GA 入口拒绝请求。

API

更多信息

使用限制

  • 仅标准型按量付费实例支持AI 服务类型的终端节点组。

  • AI 服务类型的终端节点组:

    • 仅支持 HTTP 和 HTTPS 协议的监听。

    • 不支持健康检查。

    • AI 模型转发条件与路径(Path)转发条件互斥,同一转发规则中不可同时配置。

    • 转发规则中配置的自定义 Header 名称不可使用以下保留前缀:X-Ga-Ga-

配额

配额项

默认值

上限值

配额提升

每个API Key认证组件中的凭据数

3

3

不支持提升。

每个转发规则中的回退(Fallback)服务数

5

10

前往配额中心申请提升配额。

每个用户的服务扩展组件数

5

20

前往配额中心申请提升配额。

每个用户可创建的服务扩展总数

50

50

不支持提升。

每个服务扩展可关联的资源数

200

300

前往配额中心申请提升配额。

每个GA实例可关联的服务扩展数

200

500

前往配额中心申请提升配额。

计费

AI 模型代理相关功能(包括 AI服务终端节点组、模型转发条件、回退动作、API Key认证服务扩展)当前限时免费。您仅需按全球加速实例本身的标准计费规则付费,详情请参见全球加速计费说明