Model 网关管理

更新时间:
复制 MD 格式

Model 网关提供Model API的管理。Model API适用于面向人工智能应用开发的团队,提供了更加灵活和智能的配置和调试能力。它可以用于各种模型代理、模型观测、消费者鉴权、内容安全防护等插件的预置。本文主要介绍了如何创建、调试Model API。

创建Model API

前提条件

创建 Model API 前,建议您完成以下准备工作:

  1. 在 AI 网关实例中完成供应商的注册,配置模型服务提供方(如 OpenAI、阿里云百炼等)的 API 接入信息。详情请参见管理供应商。

  2. (可选)在已注册的供应商下添加模型。添加后,创建 Model API 时可直接从模型列表中选择,无需手动输入模型名称。详情请参见管理模型。

  3. 确认已拥有可用的 AI 网关实例。如未创建,请参见Model API管理。

重要

创建 Model API 不强制绑定供应商下的模型资源。如未提前添加模型,创建时可直接输入模型名称字符串。

  1. 打开AI网关控制台实例页面,在顶部菜单栏选择目标实例所在地域,并单击目标实例ID。

  2. 在左侧导航栏,单击Model API,然后单击创建Model API。

  3. 选择使用场景,并单击对应场景的创建按钮。

    不同的场景会影响后续协议可选项与系统自动创建的默认路由,当前支持:

    • 文本生成(Text):支持 OpenAI 兼容协议和 Anthropic 协议

    • 图片生成(Image)

    • 视频生成(Video)

    • 语音合成(Audio)

    • 向量化(Embedding)

    • 文本排序(Rerank)

    • 其他(Others)

  4. 配置基本信息。

    在弹窗中先完成请选择使用场景,进入创建Model API表单后,您可按以下说明进行配置:

    • 协议:不同协议对应该场景下的一组内置默认路由,用于快速生成常用的 OpenAI/DashScope/vLLM 等兼容接口。

      说明

      协议转换可能会改变 Token 的统计结构。例如,阿里云百炼协议的 input token 统计会包含缓存 token(cache token),而 Anthropic 协议的 input token 统计不包含缓存 token。请在查看可观测指标时留意不同协议的统计口径差异。

    • API名称:您可自定义API名称,需注意名称必须全局唯一(同一账号下不可重复),支持英文、数字、下划线“_”、“-”,且不超过64个字符。

    • 域名:访问该 API 的域名,支持选择多个。域名与基本路径 BasePath 的组合必须唯一。

      如果还没有域名,请单击右侧添加域名按钮完成创建。
    • Base Path:配置API的基本请求路径,默认为 /。可选择是否启用转发至后端服务时移除。

      说明

      开启转发至后端服务时移除后,当请求转发到后端服务时,系统会自动移除请求路径中的BasePath部分。例如:

      • BasePath设置为 /api

      • 原始请求路径 /api/users

      • 实际转发到后端的路径变为 /users

    • AI请求观测: 开启后可查看 Metrics、Logging、Tracing 信息。Logging 与 Tracing 依赖 SLS 日志投递服务。可勾选开启记录请求内容与记录响应内容,开启后将记录对大模型的请求或大模型返回的Context。

      重要

      启用后系统会记录所有 AI 请求内容(包括请求体 body)到访问日志,请妥善配置 SLS 并做好数据安全防护。

    • 大模型服务: 支持单模型服务、多模型服务(按模型名称)、多模型服务(按权重)。

      • 单模型服务:选择 1 个 AI 服务,并可设置模型名称(可透传或改写)。模型名称字段支持下拉选择模型资源或自定义输入:

        • 模型资源:从当前实例内已创建的模型资源列表中下拉选择。该列表来源于模型管理中维护的模型,包括预置供应商下系统自带的模型和自定义供应商下创建的模型。

        • 自定义输入:用户可直接输入模型名称字符串。

        说明

        选择模型资源仅用于提示用户当前实例内有哪些模型可选,并帮助快速填写模型名称。Model API 不强制绑定模型资源,最终以用户提交的模型名称字符串为准。用户直接输入一个不在模型资源列表中的模型名称时,允许保存。

      • 多模型服务(按模型名称):根据请求体中的模型名按规则匹配到不同服务;匹配规则支持通配符 ? 与 *,例如 qwen-* 可匹配 qwen-max、qwen-long。

      • 多模型服务(按权重):选择多个 AI 服务并设置权重,支持透传或改写模型名。

      • 多服务(按观测指标):系统将根据各服务的响应时间、成功率等观测指标自动选择最优服务进行请求路由,无需手动配置权重。

      • 多模型服务(智能路由):系统将根据模型特征为请求自动选择最合适的模型,详情参考智能路由。

        说明

        多服务(按观测指标)和多模型服务(智能路由)需要将AI网关版本升级至2.1.15及以上。

    • Fallback: 可开启并按顺序配置多条 Fallback 策略(可复用同一服务)。

    • 首包超时:用于控制流式响应中从请求发送到接收到第一个响应包之间的最大等待时间,适用于对响应延迟敏感的流式交互场景。(单位为毫秒,设为0时表示不启用)。

    • 资源组:支持选择默认或已有资源组,也可新建。资源组用于对账户资源分组管理、授权与监控。

      如需创建新的资源组,您可以单击创建资源组完成创建。
  5. 确认配置参数并单击确定完成创建。

调试Model API

说明

当前只支持文本生成的/v1/chat/completions调试。

  1. 打开AI网关控制台实例页面,在顶部菜单栏选择目标实例所在地域,并单击目标实例ID。

  2. 在左侧导航栏,选择Model API,单击目标API操作列的调试。

  3. 在调试面板中,选择域名和模型,按需开启流式请求开关、配置参数设置和自定义参数。在右侧模型返回页签中,输入调试内容并单击发送进行调试。

    其中参数设置包含 System Prompt(系统提示词,上限 100 字符)、max_tokens(范围 0–8192,默认 1024)、top_p(范围 0–1,默认 0.95)和 temperature(范围 0–2,默认 1,对结果影响较大,请谨慎调整)。右侧除 模型返回 页签外,还提供 CURL命令 和 原始输出 页签。