PAI Token服务计费说明

更新时间:
复制 MD 格式

PAI Token服务提供开源和闭源大模型的调用能力,并无缝集成于PAI模型评测、模型蒸馏、DSW、FeatureStore、多模态数据处理等产品能力中,按Token用量计费。

服务开通

PAI Token服务开通条件:

  • 主账号:可直接开通服务

  • RAM账号:可通过如下方式使用服务

    • 方式一:联系主账号,或具有AliyunPAIFullAccess权限策略或modelservice:*权限的账号开通服务,开通后RAM账号即可使用

    • 方式二:被授予AliyunPAIFullAccess权限策略或modelservice:*权限后,RAM账号即可开通服务

计费规则

开通PAI Token服务时默认同步开通按量付费(后付费)功能,按用户输入和输出的Token数目计费,即按实际用量结算费用,先使用,后付费。

计费规则:按量费用 = 输入 Token 数量 × 输入单价 + 输出 Token 数量 × 输出单价

缓存折扣:针对命中上下文缓存的请求,其输入Token享有折扣,详见附录:上下文缓存折扣

说明

实际价格以出账账单为准。

文本生成-千问

千问Max

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.8-max

非思考和思考模式

0<Token≤1M

14.4

43.2

qwen3.7-max

非思考和思考模式

0<Token≤1M

14.4

43.2

新加坡

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.8-max

国际

非思考和思考模式

0<Token≤1M

17.9856

53.958

qwen3.7-max

国际

非思考和思考模式

0<Token≤1M

22.4832

67.4484

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.8-max

全球

非思考和思考模式

0<Token≤1M

14.4

43.2

qwen3.7-max

全球

非思考和思考模式

0<Token≤1M

14.4

43.2

日本(东京)

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.8-max

全球

非思考和思考模式

0<Token≤1M

14.4

43.2

qwen3.7-max

全球

非思考和思考模式

0<Token≤1M

14.4

43.2

千问Plus

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

单次请求的输入Token范围

输入单价(每百万Token)

输出单价(每百万Token)

非思考模式

思考模式(思维链+回答)

qwen3.7-plus

0<Token≤256K

2.4

9.6

9.6

256K<Token≤1M

7.2

28.8

28.8

qwen3.6-plus

0<Token≤256K

2.4

14.4

14.4

256K<Token≤1M

9.6

57.6

57.6

qwen3.5-plus

0<Token≤128K

0.96

5.76

5.76

128K<Token≤256K

2.4

14.4

14.4

256K<Token≤1M

4.8

28.8

28.8

新加坡

模型 ID(Model ID)

服务部署范围

单次请求的输入Token范围

输入单价 (每百万Token)

输出单价 (每百万Token)

非思考模式

思考模式(思维链+回答)

qwen3.7-plus

国际

0<Token≤256K

3.5976

14.3892

14.3892

256K<Token≤1M

10.7916

43.1664

43.1664

qwen3.6-plus

国际

0<Token≤256K

4.49652

26.97912

26.97912

256K<Token≤1M

17.98608

53.958

53.958

qwen3.5-plus

国际

0<Token≤256K

3.5232

21.1368

21.1368

256K<Token≤1M

4.404

26.4216

26.4216

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

单次请求的输入Token范围

输入单价(每百万Token)

输出单价(每百万Token)

非思考模式

思考模式(思维链+回答)

qwen3.7-plus

全球

0<Token≤256K

2.4

9.6

9.6

256K<Token≤1M

7.2

28.8

28.8

qwen3.6-plus

全球

0<Token≤256K

2.4

14.4

14.4

256K<Token≤1M

9.6

57.6

57.6

qwen3.5-plus

全球

0<Token≤128K

0.96

5.76

5.76

128K<Token≤256K

2.4

14.4

14.4

256K<Token≤1M

4.8

28.8

28.8

日本(东京)

模型 ID(Model ID)

服务部署范围

单次请求的输入Token范围

输入单价(每百万Token)

输出单价(每百万Token)

非思考模式

思考模式(思维链+回答)

qwen3.7-plus

全球

0<Token≤256K

2.4

9.6

9.6

256K<Token≤1M

7.2

28.8

28.8

qwen3.6-plus

全球

0<Token≤256K

2.4

14.4

14.4

256K<Token≤1M

9.6

57.6

57.6

千问Flash

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.7-flash

非思考和思考模式

0<Token≤32K

0.24

0.96

32K<Token≤256K

0.72

2.88

256K<Token≤1M

1.44

5.76

qwen3.6-flash

非思考和思考模式

0<Token≤256K

1.44

8.64

256K<Token≤1M

5.76

34.56

qwen3.5-flash

非思考和思考模式

0<Token≤128K

0.24

2.4

128K<Token≤256K

0.96

9.6

256K<Token≤1M

1.44

14.4

新加坡

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.7-flash

国际

非思考和思考模式

0<Token≤32K

0.27

1.1688

32K<Token≤256K

0.8988

3.5976

256K<Token≤1M

1.7988

7.194

qwen3.6-flash

国际

非思考和思考模式

0<Token≤256K

2.24826

13.48956

256K<Token≤1M

8.99304

35.97096

qwen3.5-flash

国际

非思考和思考模式

0<Token≤1M

0.8808

3.5232

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.7-flash

全球

非思考和思考模式

0<Token≤32K

0.24

0.96

32K<Token≤256K

0.72

2.88

256K<Token≤1M

1.44

5.76

qwen3.6-flash

全球

非思考和思考模式

0<Token≤256K

1.44

8.64

256K<Token≤1M

5.76

34.56

qwen3.5-flash

全球

非思考和思考模式

0<Token≤128K

0.24

2.4

128K<Token≤256K

0.96

9.6

256K<Token≤1M

1.44

14.4

日本(东京)

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

qwen3.7-flash

全球

非思考和思考模式

0<Token≤32K

0.24

0.96

32K<Token≤256K

0.72

2.88

256K<Token≤1M

1.44

5.76

qwen3.6-flash

全球

非思考和思考模式

0<Token≤256K

1.44

8.64

256K<Token≤1M

5.76

34.56

千问Omni

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

输入单价(每百万Token)

输出单价(每百万Token)

文本/图片/视频

音频

文本

多模态输入

文本+音频

仅音频计费

qwen3.5-omni-plus

8.4

63.6

48

255.6

qwen3.5-omni-flash

2.64

21.6

15.96

86.4

新加坡

模型 ID(Model ID)

服务部署范围

输入单价(每百万Token)

输出单价(每百万Token)

文本/图片/视频

音频

文本

多模态输入

文本+音频

仅音频计费

qwen3.5-omni-plus

国际

12.588

98.928

74.64

395.688

qwen3.5-omni-flash

国际

3.6

26.976

19.788

107.016

文本生成-第三方模型

DeepSeek

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

deepseek-v4-pro

14.4

28.8

deepseek-v4-flash-0731

1.2

2.4

deepseek-v4-flash

1.2

2.4

新加坡

模型 ID(Model ID)

服务部署范围

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

deepseek-v4-pro

国际

21.5832

43.1664

deepseek-v4-flash-0731

国际

1.7988

3.5976

deepseek-v4-flash

国际

1.7988

3.5976

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

deepseek-v4-pro

全球

14.4

28.8

deepseek-v4-flash-0731

全球

1.2

2.4

deepseek-v4-flash

全球

1.2

2.4

日本(东京)

模型 ID(Model ID)

服务部署范围

输入单价(每百万Token)

输出单价(每百万Token)

思维链+回答

deepseek-v4-pro

全球

14.4

28.8

deepseek-v4-flash-0731

全球

1.2

2.4

deepseek-v4-flash

全球

1.2

2.4

Kimi

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

模式

输入单价(每百万Token)

输出单价(每百万Token)

kimi-k2.7-code

仅思考模式

7.8

32.4

kimi-k2.6

非思考和思考模式

7.8

32.4

新加坡

模型 ID(Model ID)

服务部署范围

模式

输入单价(每百万Token)

输出单价(每百万Token)

kimi-k2.7-code

国际

仅思考模式

8.5428

35.9724

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

模式

输入单价(每百万Token)

输出单价(每百万Token)

kimi-k2.7-code

全球

仅思考模式

7.8

32.4

GLM

计费规则:按输入Token和输出Token计费。

华北2(北京)

模型 ID(Model ID)

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链和回答

glm-5.2

非思考和思考模式

不区分阶梯

9.6

33.6

glm-5.1

非思考和思考模式

0<Token≤32K

7.2

28.8

32K<Token≤200K

9.6

33.6

glm-5

非思考和思考模式

0<Token≤32K

4.8

21.6

32K<Token≤198K

7.2

26.4

新加坡

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链和回答

glm-5.2

国际

非思考和思考模式

不区分阶梯

12.5904

39.5688

glm-5.1

国际

非思考和思考模式

0<Token≤200K

12.5904

39.5688

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链和回答

glm-5.2

全球

非思考和思考模式

不区分阶梯

9.6

33.6

glm-5.1

全球

非思考和思考模式

0<Token≤32K

7.2

28.8

32K<Token≤200K

9.6

33.6

日本(东京)

模型 ID(Model ID)

服务部署范围

模式

单次请求的输入Token

输入单价(每百万Token)

输出单价(每百万Token)

思维链和回答

glm-5.1

全球

非思考和思考模式

0<Token≤32K

7.2

28.8

32K<Token≤200K

9.6

33.6

图像生成

计费规则:按输入图像和成功生成的 图像张数 计费。未说明输入图像价格的模型,输入不计费,仅输出计费。

计费公式:费用 = 输入图像单价 × 输入的图像张数 + 输出图像单价 × 输出的图像张数

千问图像生成与编辑

按输入输出的图像张数计费

华北2(北京)

模型 ID(Model ID)

输出图像分辨率

输入单价

输出单价

qwen-image-3.0-pro

1k

0.024元/张

0.3元/张

2k

0.6元/张

qwen-image-3.0

1k

0.024元/张

0.216元/张

2k

0.216元/张

新加坡

模型 ID(Model ID)

服务部署范围

输出图像分辨率

输入单价

输出单价

qwen-image-3.0-pro

国际

1k

0.0269796元/张

0.3597216元/张

2k

0.674478元/张

qwen-image-3.0

国际

1k

0.0269796元/张

0.2697912元/张

2k

0.2697912元/张

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

输出图像分辨率

输入单价

输出单价

qwen-image-3.0-pro

全球

1k

0.024元/张

0.3元/张

2k

0.6元/张

qwen-image-3.0

全球

1k

0.024元/张

0.216元/张

2k

0.216元/张

日本(东京)

模型 ID(Model ID)

服务部署范围

输出图像分辨率

输入单价

输出单价

qwen-image-3.0-pro

全球

1k

0.024元/张

0.3元/张

2k

0.6元/张

qwen-image-3.0

全球

1k

0.024元/张

0.216元/张

2k

0.216元/张

千问文生图

仅输出计费

华北2(北京)

模型 ID(Model ID)

输出单价

qwen-image-2.0-pro

0.6元/张

qwen-image-2.0

0.24元/张

新加坡

模型 ID(Model ID)

服务部署范围

输出单价

qwen-image-2.0-pro

国际

0.6605316元/张

qwen-image-2.0

国际

0.3082476元/张

视频生成

计费规则:输入不计费,输出计费。输出按成功生成的 视频秒数 计费。

计费公式:费用 = 视频单价 × 输出的视频时长(单位:秒)

HappyHorse-文生视频

仅输出计费

华北2(北京)

模型 ID(Model ID)

输出视频分辨率

输出单价

happyhorse-1.1-t2v

480P

0.54元/秒

720P

1.08元/秒

1080P

1.44元/秒

新加坡

模型 ID(Model ID)

服务部署范围

输出视频分辨率

输出单价

happyhorse-1.1-t2v

国际

480P

0.6295128元/秒

720P

1.2590256元/秒

1080P

1.6187472元/秒

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

输出视频分辨率

输出单价

happyhorse-1.1-t2v

全球

480P

0.54元/秒

720P

1.08元/秒

1080P

1.44元/秒

HappyHorse-图生视频-基于首帧

仅输出计费

华北2(北京)

模型 ID(Model ID)

输出视频分辨率

输出单价

happyhorse-1.1-i2v

480P

0.54元/秒

720P

1.08元/秒

1080P

1.44元/秒

新加坡

模型 ID(Model ID)

服务部署范围

输出视频分辨率

输出单价

happyhorse-1.1-i2v

国际

480P

0.6295128元/秒

720P

1.2590256元/秒

1080P

1.6187472元/秒

德国(法兰克福)

模型 ID(Model ID)

服务部署范围

输出视频分辨率

输出单价

happyhorse-1.1-i2v

全球

480P

0.54元/秒

720P

1.08元/秒

1080P

1.44元/秒

万相3.0-视频生成

计费规则:输入视频和输出视频均计费,按视频秒数计费。

计费公式:计费时长 = 输入视频时长 + 输出视频时长。

华北2(北京)

模型 ID(Model ID)

输出视频分辨率

输入和输出单价

wan3.0-video

480P

0.36元/秒

720P

0.72元/秒

1080P

1.44元/秒

新加坡

模型 ID(Model ID)

服务部署范围

输出视频分辨率

输入和输出单价

wan3.0-video

国际

480P

0.449652元/秒

720P

0.899304元/秒

1080P

1.798608元/秒

万相-文生视频

仅输出计费

华北2(北京)

模型 ID(Model ID)

输出视频分辨率

输出单价

wan2.7-t2v

720P

0.72元/秒

1080P

1.2元/秒

新加坡

模型 ID(Model ID)

服务部署范围

输出视频分辨率

输出单价

wan2.7-t2v

国际

720P

0.8807088元/秒

1080P

1.3210632元/秒

万相-图生视频

仅输出计费

华北2(北京)

模型 ID(Model ID)

输出视频类型

输出视频分辨率

输出单价

wan2.7-i2v

有声视频

720P

0.72元/秒

1080P

1.2元/秒

新加坡

模型 ID(Model ID)

服务部署范围

输出视频类型

输出视频分辨率

输出单价

wan2.7-i2v

国际

有声视频

720P

0.8807088元/秒

1080P

1.3210632元/秒

文本向量

计费规则:按输入Token计费,输出不计费。

华北2(北京)

模型 ID(Model ID)

输入单价(每百万Token)

qwen3.7-text-embedding

0.6

text-embedding-v4

0.6

新加坡

模型 ID(Model ID)

输入单价(每百万Token)

text-embedding-v4

0.6168

多模态向量

计费规则:按输入Token计费,输出不计费。

华北2(北京)

模型 ID(Model ID)

输入单价(每百万Token)

文本

图片/视频

qwen3-vl-embedding

0.84

2.16

tongyi-embedding-vision-plus

0.6

0.6

tongyi-embedding-vision-flash

0.18

0.18

排序模型

文本排序模型

计费规则:按输入Token计费,输出不计费。

华北2(北京)

模型 ID(Model ID)

输入单价(每百万Token)

qwen3-rerank

文本输入:0.6

新加坡

模型 ID(Model ID)

服务部署范围

输入单价(每百万Token)

qwen3-rerank

国际

0.899304

附录:上下文缓存折扣

项目

显式缓存

隐式缓存

用于创建缓存Token计费

输入 Token 单价的125%

输入 Token 单价的100%

命中缓存的输入 Token 计费

输入 Token 单价的10%

输入 Token 单价的20%

常见问题

Q:PAI Token服务支持节省计划吗,百炼的节省计划可用于PAI Token服务吗?

PAI Token服务暂不支持节省计划,且百炼中的节省计划无法用于PAI Token服务。