开通Flink AI服务后,使用内置模型进行推理调用将产生模型调用费用。该费用按Token用量计费,独立于工作空间的CU计算资源费用。
计费概览
计算资源(CU):作业运行所需的计算资源,与现有CU计费方式相同。
AI服务调用费:调用内置模型产生的费用,按Token用量独立计费。
相关联云产品计费,详情请参见计费项。
计费规则
计费单位:元/千tokens,输入tokens与输出tokens分别计费。
计费周期:每分钟结算一次(以UTC+8时间为准),生成账单并扣费。
计费维度:按
地域 × 模型 × 输入用量阶梯 × Token类型组合计费,每分钟请求费用 = Σ(各Token类型用量 × 对应单价)。免费额度:每个主账号每个地域每个自然月(以 UTC+8 时间为准)前100万tokens免费(输入与输出合计)。超出部分按定价计费。
Token类型说明
每次推理请求产生的Token按以下类型分别计量:
标准输入Token:按基础输入单价计费。
标准输出Token:按基础输出单价计费。
隐式缓存命中的输入Token:按基础输入价的20%计费。
显式缓存创建的输入Token:按基础输入价的125%计费。
显式缓存命中的输入Token:按基础输入价的10%计费。
每分钟请求费用 = Σ(各Token类型用量 × 对应单价)。缓存类Token的单价 = 基础输入单价 × 计费系数。
定价表
实际价格请以计费账单为准。
基础定价
以下为标准输入Token和标准输出Token的基础单价。缓存类Token按此基础价乘以对应系数计费,详见缓存Token计费系数。
中国内地:如华东1(杭州)、华北2(北京)等。
非中国内地:包括中国香港、新加坡、美国等所有非中国内地地域。
地域列表详见:Flink AI 支持地域。
千问
中国内地
模型 | 输入用量阶梯(千tokens) | 输入(元/千tokens) | 输出(元/千tokens) |
qwen3.8-max | 0~1,000 | 0.0144 | 0.0432 |
qwen3.7-max | 0~1,000 | 0.0144 | 0.0432 |
qwen3.7-plus | 0~256 | 0.0024 | 0.0096 |
256~1,000 | 0.0072 | 0.0288 | |
qwen3.6-plus | 0~256 | 0.0024 | 0.0144 |
256~1,000 | 0.0096 | 0.0576 | |
qwen3.5-plus | 0~128 | 0.00096 | 0.00576 |
128~256 | 0.0024 | 0.0144 | |
256~1,000 | 0.0048 | 0.0288 | |
qwen3.7-flash | 0~32 | 0.00024 | 0.00096 |
32~256 | 0.00072 | 0.00288 | |
256~1,000 | 0.00144 | 0.00576 | |
qwen3.6-flash | 0~256 | 0.00144 | 0.00864 |
256~1,000 | 0.00576 | 0.03456 | |
qwen3.5-flash | 0~128 | 0.00024 | 0.0024 |
128~256 | 0.00096 | 0.0096 | |
256~1,000 | 0.00144 | 0.0144 | |
qwen3.5-ocr | 0~1,000 | 0.0006 | 0.0024 |
qwen-vl-ocr | 0~1,000 | 0.00036 | 0.0006 |
qwen-mt-plus | 0~1,000 | 0.00216 | 0.00648 |
qwen-mt-flash | 0~1,000 | 0.00084 | 0.00234 |
非中国内地
模型 | 输入用量阶梯(千tokens) | 输入(元/千tokens) | 输出(元/千tokens) |
qwen3.8-max | 0~1,000 | 0.017986 | 0.053958 |
qwen3.7-max | 0~1,000 | 0.022488 | 0.067452 |
qwen3.7-plus | 0~256 | 0.003598 | 0.014389 |
256~1,000 | 0.010792 | 0.043166 | |
qwen3.6-plus | 0~256 | 0.0045 | 0.026976 |
256~1,000 | 0.017988 | 0.053964 | |
qwen3.5-plus | 0~128 | 0.003528 | 0.021132 |
128~256 | 0.003528 | 0.021132 | |
256~1,000 | 0.004404 | 0.026424 | |
qwen3.7-flash | 0~32 | 0.00027 | 0.001169 |
32~256 | 0.000899 | 0.003598 | |
256~1,000 | 0.001799 | 0.007194 | |
qwen3.6-flash | 0~256 | 0.002244 | 0.013488 |
256~1,000 | 0.008988 | 0.035976 | |
qwen3.5-flash | 0~128 | 0.000876 | 0.003528 |
128~256 | 0.000876 | 0.003528 | |
256~1,000 | 0.000876 | 0.003528 | |
qwen-vl-ocr | 0~1,000 | 0.000617 | 0.001409 |
qwen-mt-plus | 0~1,000 | 0.021666 | 0.064908 |
qwen-mt-flash | 0~1,000 | 0.001409 | 0.004315 |
DeepSeek
中国内地
模型 | 输入用量阶梯(千tokens) | 输入(元/千tokens) | 输出(元/千tokens) |
deepseek-v4-pro | 0~1,000 | 0.0144 | 0.0288 |
deepseek-v4-flash-0731 | 0~1,000 | 0.0012 | 0.0024 |
非中国内地
模型 | 输入用量阶梯(千tokens) | 输入(元/千tokens) | 输出(元/千tokens) |
deepseek-v4-pro | 0~1,000 | 0.021583 | 0.043166 |
deepseek-v4-flash-0731 | 0~1,000 | 0.001799 | 0.003598 |
GLM
中国内地
模型 | 输入用量阶梯(千tokens) | 输入(元/千tokens) | 输出(元/千tokens) |
glm-5.2 | 0~1,000 | 0.0096 | 0.0336 |
非中国内地
模型 | 输入用量阶梯(千tokens) | 输入(元/千tokens) | 输出(元/千tokens) |
glm-5.2 | 0~1,000 | 0.01259 | 0.039569 |
Embedding
中国内地
模型 | 输入类型 | 元/千tokens |
qwen3.7-text-embedding | 文本 | 0.0006 |
text-embedding-v4 | 文本 | 0.0006 |
qwen3-vl-embedding | 文本 | 0.00084 |
图片 | 0.00216 |
非中国内地
模型 | 输入类型 | 元/千tokens |
text-embedding-v4 | 文本 | 0.000617 |
缓存Token计费系数
缓存类Token的费用 = 对应模型的基础输入单价 × 计费系数 × Token用量。详情请参见上下文缓存。
Token类型 | 计费系数 | 说明 |
隐式缓存命中 | ×0.2 | 按基础输入价的20%计费 |
显式缓存创建 | ×1.25 | 按基础输入价的125%计费 |
显式缓存命中 | ×0.1 | 按基础输入价的10%计费 |
计费示例
场景:在华北2(北京)地域使用qwen3.6-plus模型(输入用量阶梯0~256千tokens),累计消耗输入5,000千tokens、输出1,200千tokens。
费用计算:
输入费用:5,000 × 0.0024 = 12.00元
输出费用:1,200 × 0.0144 = 17.28元
合计:29.28元
账单详情
账单按地域、工作空间ID、Flink用途、模型、Token类型、输入用量阶梯分维度出账。
下载账单
在账单详情页面,选择目标账单月份。
将产品名称筛选为实时计算 Flink 版,商品名称筛选为实时计算Flink版_AI_按量付费_中国站,单击搜索。
单击账单列表右上角的导出图标,将账单下载到本地。
打开账单文件,定位实例ID(出账粒度)列。该字段以英文分号(;)分隔,格式如下:
地域;工作空间ID;项目空间名称;Flink用途;模型;Token类型;输入用量阶梯分段
说明
地域
工作空间所在地域
工作空间ID
Flink工作空间的唯一标识
项目空间名称
当前为空,预留字段
Flink用途
Token的使用场景,取值为
ai_function或flink_agents模型
调用的大模型名称
Token类型
输入Token或输出Token
输入用量阶梯
输入Token的区间上限标记,如 128、256、1000 等
欠费说明
欠费后服务暂停,所有使用内置模型的作业将无法调用模型。
充值后服务自动恢复。
欠费期间的模型调用请求不被处理,对应作业可能出现异常。
停止计费
如需停止AI服务计费,在控制台AI服务页面单击关闭服务。关闭后:
所有作业将无法使用内置模型服务。
不再产生AI服务调用费用。
工作空间的CU计算资源费用不受影响。
关闭AI服务前,需确认所有作业均未依赖内置模型,否则可能导致作业运行异常。