在MaxCompute中,若需要使用模型进行数据处理或离线推理且不希望自持GPU资源时,可以选择购买并使用MaxCompute 模型计算服务,以满足业务对模型推理及性能的需求。本文介绍如何购买和使用MaxCompute 模型计算服务。
适用范围
支持地域:当前仅以下地域支持开通模型计算服务。
中国内地:华北2(北京)、华东2(上海)、华东1(杭州)、华南1(深圳)、华北6(乌兰察布)
国际:新加坡
支持模型
模型
支持类型
说明
qwen3.7-max仅支持文本输入
千问3.7系列旗舰模型,在推理、代码生成、多语言理解等方面全面升级,适用于高复杂度任务场景。
qwen3.7-plus支持多模态数据输入
千问 3.7 系列均衡型模型,兼顾性能与成本,适用于企业级长文本分析及多轮对话等综合场景。
qwen3-vl-embedding支持多模态数据输入
千问多模态向量化模型,支持图文混合输入的向量表示,适用于跨模态检索、图文匹配等场景。
text-embedding-v4仅支持文本输入
高精度文本向量化模型,适用于语义检索、聚类、相似度计算等场景。
qwen3.6-plus支持多模态数据输入
千问3.6系列均衡型模型,兼顾性能与成本,适用于对话、摘要、分析等通用业务场景。
qwen3.6-flash支持多模态数据输入
千问3.6系列轻量高速模型,响应速度快、成本低,适用于高并发、低延迟的在线服务场景。
deepseek-v4-pro仅支持文本输入
DeepSeek第四代旗舰推理模型,擅长数学、代码、复杂逻辑推理等高难度任务场景。
deepseek-v4-flash仅支持文本输入
DeepSeek第四代轻量模型,推理速度快、性价比高,适用于日常对话、轻量推理等场景。
qwen3.5-397b-a17b支持多模态数据输入
千问 3.5 系列MoE 架构模型,激活参数高效,兼具海量知识储备与多步推理能力,专为高难度逻辑推演、全栈代码生成及深度知识问答设计。
qwen3-asr-flash支持多模态数据输入
千问 3 系列轻量级语音识别模型,具备低延迟、高并发的实时转写能力,适用于会议记录、直播字幕生成及语音交互指令识别等实时音频处理场景。
qwen3-max(即将下线)仅支持文本输入
千问系列高性能大语言模型,适用于复杂推理、内容生成等场景。
计费规则
详情参见模型计算费用(Token费用)。
开通流程
每个地域仅需开通一次,开通后默认允许该地域所有项目使用。
登录MaxCompute控制台,在左上角选择地域。
在左侧导航栏,选择 。
在Quota管理页面,单击新购Quota。
在购买页面,商品类型选择模型计算服务。
在MaxCompute 模型计算服务页面,选择地域并确认服务协议后,确认开通服务。
购买完成后返回控制台,在Quota管理页面将会出现一个Quota名为
ai_InferenceQuota的按量付费配额。
使用指南
在MaxFrame作业中使用模型计算服务
使用MaxFrame AI Function,指定服务所支持的模型,即可使用MaxCompute 模型计算服务。
例如:使用qwen3.6-plus多模态模型进行图片理解
更多语法说明及示例详见:MaxFrame AI Function。
在SQL作业中使用模型计算服务
使用SQL AI Function,指定服务所支持的模型,即可使用MaxCompute 模型计算服务,示例:
SET odps.namespace.schema=true;
SELECT
prompt,
AI_GENERATE(
bigdata_public_modelset.default.`qwen3.7-max`,
DEFAULT_VERSION,
concat('请对以下评论进行情感分析分类,输出结果仅限于以下三个选项之一:正面、负面、中性。待分析的评论:', prompt)
) AS generated_text
FROM (
VALUES
('今天天气真好,心情很不错!阳光明媚,适合出去散步。'),
('今天天气真好,心情很不错!阳光明媚'),
('科技发展日新月异,人工智能改变生活。'),
('防控措施很到位,为医护人员点赞!'),
('这个商品质量很差')
) t (prompt);更多语法说明及示例详见:AI_GENERATE。