语义缓存网关概述

更新时间:
复制 MD 格式

Tair AI Gateway 是 Tair 原生的 AI 数据网关。语义缓存作为首批核心插件,通过精确匹配和语义匹配两种策略自动缓存 LLM 响应,在重复或相似请求场景下显著降低 Token 消耗并实现毫秒级响应。

重要

产品状态:免费公测中。开通即享免费算力和存储资源,无需预付费,填写表单申请加入公测,填写后预计5个工作日内收到相关短信通知。

工作原理

语义缓存的核心思路:当用户发起一个 AI 请求时,系统先检查是否有相同或相似的问题已经被回答过。如果有,直接返回缓存结果(毫秒级);如果没有,再调用 LLM 获取答案并存入缓存。

与传统精确匹配缓存不同,语义缓存通过向量相似度判断问题是否"意思相同"。例如"今天天气如何"和"今天天气怎么样"会被识别为同一问题,共享同一个缓存结果。

产品架构

Tair AI Gateway 采用三层架构,所有能力通过单一 Endpoint 对外服务:

层级

组件

职责

入口层

AI Gateway Endpoint

统一接入,按路径前缀路由到不同插件

插件层

语义缓存插件

精确匹配、Embedding 计算、向量检索、相似度判定

服务层

Tair Vector + 百炼平台

向量存储与检索、LLM 推理(OpenAI 兼容模式独享)

image

两种模式:如何选择

语义缓存提供两种接入模式,适配不同的集成需求:

对比项

OpenAI 兼容模式

LangCache 兼容模式

一句话定位

替换 Base URL 即刻生效的全链路 AI 缓存

灵活可控的底层语义缓存能力

协议

OpenAI 兼容 + 百炼 DashScope

RESTful HTTP(兼容 Redis LangCache API)

LLM 调用

平台代理(未命中时自动调用百炼 LLM)

用户自行编排

接入改动

仅替换 base_url 和 api_key

需调用缓存 API + 自行对接 LLM

缓存策略

exact(仅精确匹配)和 exact_and_semantic(先精确、未命中再语义匹配)

exact(精确匹配)、semantic(语义匹配)和exact semantic混合

最适合

希望零改造获得缓存能力的应用

已有 LLM 编排逻辑、需要精细管理缓存的应用

说明

选择建议:如果您使用 OpenAI SDK 或百炼 SDK 调用 LLM,选择OpenAI 兼容模式最快上手。如果您已有自建的 LLM 调用链路且需要精细控制缓存行为,选择LangCache 兼容模式。两种模式可以同时开启。

适用场景

语义缓存在以下场景中价值最突出——共同特征是存在大量重复或相似的查询,且期望答案相对稳定

场景

为什么适合语义缓存

预期收益

智能客服

用户咨询高度集中在 FAQ,大促峰值流量倍增

缓存命中率高 → Token 成本下降;毫秒响应 → 保护后端模型

企业知识库

员工对政策规章的提问大同小异

减少相似答案的重复推理,降低Token成本

AI 教育助手

学生对同一知识点的疑问高度相似

即时响应 → 维持学习流状态

游戏 NPC 对话

百万玩家与 NPC 的对话高频重复

毫秒响应 → 满足游戏实时性要求

多语言翻译

高频短语跨用户反复出现

避免重复翻译 → 降低服务端压力

说明

不适合的场景:需要实时信息的查询(如"现在几点了")、每次回答需要个性化的对话(如心理咨询)、以及答案随上下文快速变化的场景(如实时股价分析)。

公测资源与费用

公测期间完全免费,开通即享以下资源包:

资源

规格

限制

AI 网关实例

标准版,2 节点

每人 1 个

Tair 实例(缓存存储)

集群版,2 分片 × 1 GB

每人 1 次开通机会

LLM 模型额度

1000 万 Token

每人限额

使用限制

限制项

说明

资源配额

免费额度用尽后,模型服务暂不可用。若需要继续使用模型服务,可切换为LangCache自行部署模型服务,或者等待BYOK功能的上线

功能迭代

公测期间配置项或接口行为可能调整,请关注产品公告

服务等级

公测期间不提供 SLA 保障

数据保留

公测结束或实例释放后缓存数据将被清理,请提前备份

支持的模型

qwen3.6-plus、qwen3.7-plus、qwen3.7-max

后续步骤