AI服务计费(按量付费)

更新时间:
复制 MD 格式

开通Flink AI服务后,使用内置模型进行推理调用将产生模型调用费用。该费用按Token用量计费,独立于工作空间的CU计算资源费用。

计费概览

image

  • 计算资源(CU):作业运行所需的计算资源,与现有CU计费方式相同。

  • AI服务调用费:调用内置模型产生的费用,按Token用量独立计费。

相关联云产品计费,详情请参见计费项

计费规则

  • 计费单位:元/千tokens,输入tokens与输出tokens分别计费。

  • 计费周期:每分钟结算一次(以UTC+8时间为准),生成账单并扣费。

  • 计费维度:地域 × 模型 × 输入用量阶梯 × Token类型组合计费,每分钟请求费用 = Σ(各Token类型用量 × 对应单价)。

  • 免费额度:每个主账号每个地域每个自然月(以 UTC+8 时间为准)前100tokens免费(输入与输出合计)。超出部分按定价计费。

Token类型说明

每次推理请求产生的Token按以下类型分别计量:

  • 标准输入Token:按基础输入单价计费。

  • 标准输出Token:按基础输出单价计费。

  • 隐式缓存命中的输入Token:按基础输入价的20%计费。

  • 显式缓存创建的输入Token:按基础输入价的125%计费。

  • 显式缓存命中的输入Token:按基础输入价的10%计费。

每分钟请求费用 = Σ(各Token类型用量 × 对应单价)。缓存类Token的单价 = 基础输入单价 × 计费系数。

定价表

重要

实际价格请以计费账单为准。

基础定价

以下为标准输入Token标准输出Token的基础单价。缓存类Token按此基础价乘以对应系数计费,详见缓存Token计费系数

  • 中国内地:如华东1(杭州)、华北2(北京)等。

  • 非中国内地:包括中国香港、新加坡、美国等所有非中国内地地域。

地域列表详见:Flink AI 支持地域

千问

中国内地

模型

输入用量阶梯(千tokens)

输入(元/千tokens)

输出(元/千tokens)

qwen3.8-max

0~1,000

0.0144

0.0432

qwen3.7-max

0~1,000

0.0144

0.0432

qwen3.7-plus

0~256

0.0024

0.0096

256~1,000

0.0072

0.0288

qwen3.6-plus

0~256

0.0024

0.0144

256~1,000

0.0096

0.0576

qwen3.5-plus

0~128

0.00096

0.00576

128~256

0.0024

0.0144

256~1,000

0.0048

0.0288

qwen3.7-flash

0~32

0.00024

0.00096

32~256

0.00072

0.00288

256~1,000

0.00144

0.00576

qwen3.6-flash

0~256

0.00144

0.00864

256~1,000

0.00576

0.03456

qwen3.5-flash

0~128

0.00024

0.0024

128~256

0.00096

0.0096

256~1,000

0.00144

0.0144

qwen3.5-ocr

0~1,000

0.0006

0.0024

qwen-vl-ocr

0~1,000

0.00036

0.0006

qwen-mt-plus

0~1,000

0.00216

0.00648

qwen-mt-flash

0~1,000

0.00084

0.00234

非中国内地

模型

输入用量阶梯(千tokens)

输入(元/千tokens)

输出(元/千tokens)

qwen3.8-max

0~1,000

0.017986

0.053958

qwen3.7-max

0~1,000

0.022488

0.067452

qwen3.7-plus

0~256

0.003598

0.014389

256~1,000

0.010792

0.043166

qwen3.6-plus

0~256

0.0045

0.026976

256~1,000

0.017988

0.053964

qwen3.5-plus

0~128

0.003528

0.021132

128~256

0.003528

0.021132

256~1,000

0.004404

0.026424

qwen3.7-flash

0~32

0.00027

0.001169

32~256

0.000899

0.003598

256~1,000

0.001799

0.007194

qwen3.6-flash

0~256

0.002244

0.013488

256~1,000

0.008988

0.035976

qwen3.5-flash

0~128

0.000876

0.003528

128~256

0.000876

0.003528

256~1,000

0.000876

0.003528

qwen-vl-ocr

0~1,000

0.000617

0.001409

qwen-mt-plus

0~1,000

0.021666

0.064908

qwen-mt-flash

0~1,000

0.001409

0.004315

DeepSeek

中国内地

模型

输入用量阶梯(千tokens)

输入(元/千tokens)

输出(元/千tokens)

deepseek-v4-pro

0~1,000

0.0144

0.0288

deepseek-v4-flash-0731

0~1,000

0.0012

0.0024

非中国内地

模型

输入用量阶梯(千tokens)

输入(元/千tokens)

输出(元/千tokens)

deepseek-v4-pro

0~1,000

0.021583

0.043166

deepseek-v4-flash-0731

0~1,000

0.001799

0.003598

GLM

中国内地

模型

输入用量阶梯(千tokens)

输入(元/千tokens)

输出(元/千tokens)

glm-5.2

0~1,000

0.0096

0.0336

非中国内地

模型

输入用量阶梯(千tokens)

输入(元/千tokens)

输出(元/千tokens)

glm-5.2

0~1,000

0.01259

0.039569

Embedding

中国内地

模型

输入类型

元/千tokens

qwen3.7-text-embedding

文本

0.0006

text-embedding-v4

文本

0.0006

qwen3-vl-embedding

文本

0.00084

图片

0.00216

非中国内地

模型

输入类型

元/千tokens

text-embedding-v4

文本

0.000617

缓存Token计费系数

缓存类Token的费用 = 对应模型的基础输入单价 × 计费系数 × Token用量。详情请参见上下文缓存

Token类型

计费系数

说明

隐式缓存命中

×0.2

按基础输入价的20%计费

显式缓存创建

×1.25

按基础输入价的125%计费

显式缓存命中

×0.1

按基础输入价的10%计费

计费示例

场景:在华北2(北京)地域使用qwen3.6-plus模型(输入用量阶梯0~256tokens),累计消耗输入5,000tokens、输出1,200tokens。

费用计算:

  • 输入费用:5,000 × 0.0024 = 12.00

  • 输出费用:1,200 × 0.0144 = 17.28

  • 合计:29.28

账单详情

账单按地域、工作空间ID、Flink用途、模型、Token类型、输入用量阶梯分维度出账。

下载账单

  1. 账单详情页面,选择目标账单月份。

  2. 产品名称筛选为实时计算 Flink 版,商品名称筛选为实时计算Flink版_AI_按量付费_中国站,单击搜索

  3. 单击账单列表右上角的导出图标,将账单下载到本地。

  4. 打开账单文件,定位实例ID(出账粒度)列。该字段以英文分号(;)分隔,格式如下:

    地域;工作空间ID;项目空间名称;Flink用途;模型;Token类型;输入用量阶梯

    分段

    说明

    地域

    工作空间所在地域

    工作空间ID

    Flink工作空间的唯一标识

    项目空间名称

    当前为空,预留字段

    Flink用途

    Token的使用场景,取值为 ai_function 或 flink_agents

    模型

    调用的大模型名称

    Token类型

    输入Token或输出Token

    输入用量阶梯

    输入Token的区间上限标记,如 128、256、1000 等

欠费说明

  • 欠费后服务暂停,所有使用内置模型的作业将无法调用模型。

  • 充值后服务自动恢复。

  • 欠费期间的模型调用请求不被处理,对应作业可能出现异常。

停止计费

如需停止AI服务计费,在控制台AI服务页面单击关闭服务。关闭后:

  • 所有作业将无法使用内置模型服务。

  • 不再产生AI服务调用费用。

  • 工作空间的CU计算资源费用不受影响。

重要

关闭AI服务前,需确认所有作业均未依赖内置模型,否则可能导致作业运行异常。