Tair AI Gateway 是 Tair 原生的 AI 数据网关。语义缓存作为首批核心插件,通过精确匹配和语义匹配两种策略自动缓存 LLM 响应,在重复或相似请求场景下显著降低 Token 消耗并实现毫秒级响应。
产品状态:免费公测中。开通即享免费算力和存储资源,无需预付费,填写表单申请加入公测,填写后预计5个工作日内收到相关短信通知。
工作原理
语义缓存的核心思路:当用户发起一个 AI 请求时,系统先检查是否有相同或相似的问题已经被回答过。如果有,直接返回缓存结果(毫秒级);如果没有,再调用 LLM 获取答案并存入缓存。
与传统精确匹配缓存不同,语义缓存通过向量相似度判断问题是否"意思相同"。例如"今天天气如何"和"今天天气怎么样"会被识别为同一问题,共享同一个缓存结果。
产品架构
Tair AI Gateway 采用三层架构,所有能力通过单一 Endpoint 对外服务:
层级 | 组件 | 职责 |
入口层 | AI Gateway Endpoint | 统一接入,按路径前缀路由到不同插件 |
插件层 | 语义缓存插件 | 精确匹配、Embedding 计算、向量检索、相似度判定 |
服务层 | Tair Vector + 百炼平台 | 向量存储与检索、LLM 推理(OpenAI 兼容模式独享) |

两种模式:如何选择
语义缓存提供两种接入模式,适配不同的集成需求:
对比项 | OpenAI 兼容模式 | LangCache 兼容模式 |
一句话定位 | 替换 Base URL 即刻生效的全链路 AI 缓存 | 灵活可控的底层语义缓存能力 |
协议 | OpenAI 兼容 + 百炼 DashScope | RESTful HTTP(兼容 Redis LangCache API) |
LLM 调用 | 平台代理(未命中时自动调用百炼 LLM) | 用户自行编排 |
接入改动 | 仅替换 base_url 和 api_key | 需调用缓存 API + 自行对接 LLM |
缓存策略 | exact(仅精确匹配)和 exact_and_semantic(先精确、未命中再语义匹配) | exact(精确匹配)、semantic(语义匹配)和exact semantic混合 |
最适合 | 希望零改造获得缓存能力的应用 | 已有 LLM 编排逻辑、需要精细管理缓存的应用 |
选择建议:如果您使用 OpenAI SDK 或百炼 SDK 调用 LLM,选择OpenAI 兼容模式最快上手。如果您已有自建的 LLM 调用链路且需要精细控制缓存行为,选择LangCache 兼容模式。两种模式可以同时开启。
适用场景
语义缓存在以下场景中价值最突出——共同特征是存在大量重复或相似的查询,且期望答案相对稳定:
场景 | 为什么适合语义缓存 | 预期收益 |
智能客服 | 用户咨询高度集中在 FAQ,大促峰值流量倍增 | 缓存命中率高 → Token 成本下降;毫秒响应 → 保护后端模型 |
企业知识库 | 员工对政策规章的提问大同小异 | 减少相似答案的重复推理,降低Token成本 |
AI 教育助手 | 学生对同一知识点的疑问高度相似 | 即时响应 → 维持学习流状态 |
游戏 NPC 对话 | 百万玩家与 NPC 的对话高频重复 | 毫秒响应 → 满足游戏实时性要求 |
多语言翻译 | 高频短语跨用户反复出现 | 避免重复翻译 → 降低服务端压力 |
不适合的场景:需要实时信息的查询(如"现在几点了")、每次回答需要个性化的对话(如心理咨询)、以及答案随上下文快速变化的场景(如实时股价分析)。
公测资源与费用
公测期间完全免费,开通即享以下资源包:
资源 | 规格 | 限制 |
AI 网关实例 | 标准版,2 节点 | 每人 1 个 |
Tair 实例(缓存存储) | 集群版,2 分片 × 1 GB | 每人 1 次开通机会 |
LLM 模型额度 | 1000 万 Token | 每人限额 |
使用限制
限制项 | 说明 |
资源配额 | 免费额度用尽后,模型服务暂不可用。若需要继续使用模型服务,可切换为LangCache自行部署模型服务,或者等待BYOK功能的上线 |
功能迭代 | 公测期间配置项或接口行为可能调整,请关注产品公告 |
服务等级 | 公测期间不提供 SLA 保障 |
数据保留 | 公测结束或实例释放后缓存数据将被清理,请提前备份 |
支持的模型 | qwen3.6-plus、qwen3.7-plus、qwen3.7-max |
后续步骤
快速开始:语义缓存实例开通说明
API 参考:技术架构与接口说明