Model Gallery常见问题

更新时间:
复制 MD 格式

PAI-Model Gallery部署或微调模型时常见问题及解决方法。

有问题先问小PAI

PAI智能助手(小PAI)提供PAI全链路产品的使用说明和操作指引,支持对DSW实例、DLC任务、EAS服务进行运维诊断,自动识别失败原因并给出处理建议。

image

Q:Model Gallery的模型评测是开了深度思考吗?

Model Gallery提供的模型和二次训练后的模型,评测时使用Model Gallery默认部署配置。请根据模型介绍页和默认部署配置判断。

Q:如何部署Model Gallery训练的模型

进入Model Gallery任务管理,找到训练任务并进入详情页,单击右上角部署按钮。部署后,模型会以在线服务方式运行。

image

Q:训练任务失败后,如何排查失败原因?

训练任务失败的原因很多,例如数据集格式不符合要求。您可以按以下方式排查:

  • 查看任务诊断:在PAI-Model Gallery > 任务管理 > 训练任务中单击指定任务,在任务详情页签下将鼠标悬停在失败上,系统显示错误原因及解决办法。

    image

  • 查看任务日志:在任务管理 > 训练任务中单击指定任务,在任务日志页签下查看错误信息:

    image

    各错误信息的解决方法如下:

    错误类型

    错误信息

    解决办法

    输入/输出错误相关

    ValueError: output channel ${your OSS uri} must be directory

    输出路径必须是文件夹。请检查当前路径是否为文件夹。

    ValueError:train must be a file

    输入路径必须是文件。请检查当前路径是否为文件。

    FileNotFoundError

    请检查输入路径下是否存在符合要求的文件。

    JSONDecodeError

    请检查JSON文件格式是否正确。

    ValueError: Input data must be a json file or a jsonl file!

    输入文件必须是JSONJSONL文件。请检查文件格式。

    KeyError:${some key name}

    该错误多见于JSON训练集。请根据模型说明检查训练集文件的key-value是否符合要求。

    ValueError: Unrecognized model in /ml/input/data/model/.

    PyTorch无法识别提供的模型文件。

    UnicodeDecoderError

    请检查输入文件编码格式。

    Input/output error

    请确保输入路径可读,输出路径可读写

    NotADirectoryError: [Errno 20] Not a directory:

    请检查输入和输出路径是否为文件夹。

    超参数配置相关

    ERROR:torch.distributed.elastic.multiprocessing.api:failed (exitcode: -9) local_rank: 0 (pid: 51) of binary: /usr/bin/python(且没有相关subprocess的日志)

    当前机型内存不足,加载模型时OOM(Out of Memory)。请选择内存更大的机型。

    torch.cuda.OutOfMemoryError: CUDA out of memory

    当前机型显存不足。请选择显存更大的GPU机型,或降低lora dim、batch size等超参数。

    ValueError: No closing quotation

    system prompt或其他参数中出现了单个",导致算法生成training command失败。请删除单个",或补全为成对引号。

    机型资源配置相关

    Exception: Current loss scale already at minimum - cannot decrease scale anymore. Exiting run

    该模型参数格式为BF16,建议使用Ampere或更新架构的GPU(如A10/A100)训练。使用Ampere之前架构的GPU会将参数转换为FP16格式。

    RuntimeError: CUDA error: uncorrectable ECC error encountered

    当前机型硬件错误。请更换机型,或切换到其他Region重试。

    MemoryError: WARNING Insufficient free disk space

    当前机型内存不足。请更换内存更大的机型。

    用户限制相关

    failed to compose dlc job specs, resource limiting triggered, you are trying to use more GPU resources than the threshold

    训练任务最多同时运行2*GPU,超过会触发资源限制。请等待运行中的任务完成后再启动,或提交工单申请增加配额。

Q:如何在线调试已部署的模型?

  1. 模型部署成功后,在Model Gallery > 任务管理 > 部署任务中查看已部署服务。确认服务状态正常后再调试。

    image

  2. EAS页面,单击已部署服务操作列的在线调试。在线调试无需编写客户端代码即可验证模型接口。

    image

  3. 配置在线调试请求参数。

    1. 在模型介绍页查看对应部署方式的调用方法(从Model Gallery页面单击模型卡片进入)。例如,通过BladeLLM部署DeepSeek-R1-Distill-Qwen-7B后,向/v1/chat/completions发送HTTP POST请求,请求示例如下:

      image

      image

    2. 配置并发送请求。

      在请求URL后追加/v1/chat/completions,请求Body按上一步示例填写。

      image

Q:在线调试时报错“no healthy upstream”

在线调试时报错,错误码503,错误提示为“no healthy upstream”:

image

  • 报错原因:实例运行时CPU、内存或显存被过度占用,缓冲余量不足。

  • 解决方案:

    • 公共资源建议在非高峰时段再调用,或更换资源规格和地域。

    • 专属资源(EAS资源组)需为实例预留足够的CPU、内存和显存,建议至少保留20%空闲资源作为缓冲。

Q:模型训练时报错:SupportsDistributedTraining false, please set InstanceCount=1

  • 报错原因:当前训练任务使用了多个实例(节点数大于1),但该模型不支持分布式训练。

  • 解决方案:将节点数设置为1。单节点训练才能匹配该模型的训练方式。

    image

Q: 模型API调用报错 404 - {'detail': 'Not Found'}

可能的原因:

  1. 模型服务不支持 API调用。Model Gallery部署的模型服务,有些只支持在服务详情页面通过 Web 应用 按钮以网页形式交互。该类型不对外提供 OpenAI 兼容的 API 端点,不支持使用 OpenAI SDK 调用。比如PAI-DistilQwen2.5-7B-Instruct

  2. 请求路径不完整或错误。如对话接口,通常的路径格式为{domain}/api/predict/{service_name}/v1/chat/completions

模型选择FAQ

Q:PAI-DistilQwen2.5-7B-Instruct 与 DeepSeek-R1-Distill-Qwen-7B的区别?

PAI-DistilQwen2.5-7B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B 均基于 Qwen2.5-7B 蒸馏训练,但应用场景不同:

维度

PAI-DistilQwen2.5-7B-Instruct

DeepSeek-R1-Distill-Qwen-7B

基础模型

Qwen2.5-7B-Instruct

Qwen2.5-7B + DeepSeek-R1

蒸馏方式

黑盒数据蒸馏 + 白盒 Logits 蒸馏

知识蒸馏(推理能力迁移)

应用场景

通用指令遵循

数学与推理任务

特点

指令遵循能力相比原始模型有显著提升。

针对数学类问题,建议在 prompt 中包含逐步推理的要求。

Q:Fun-CosyVoice 模型与旧版 CosyVoice 有何区别?

Fun-CosyVoice 3.0 是一个基于大型语言模型 (LLM) 的高级文本转语音 (TTS) 系统,在内容一致性、说话人相似度和韵律自然性方面超越了其前身 (CosyVoice 2.0)。

Q:Qwen3 Embedding系列模型区别?

模型对比如下:

模型

模型权重

显存占用

最大嵌入维度

适用场景

Qwen3-Embedding-0.6B

1.12 GiB

2-4 GB

1024

轻量检索、内存敏感

Qwen3-Embedding-4B

7.55 GiB

10-14 GB

2560

标准语义搜索

Qwen3-Embedding-8B

14.11 GiB

18-24 GB

4096

高精度、复杂语义

请根据使用场景,选择合适的模型与GPU:

场景

推荐模型

推荐 GPU

预算

个人开发/POC

0.6B

RTX 3060 / 笔记本

中小企业 API

4B

A10 (24G)

企业级生产

8B

A100 40G/80G

超大规模向量库

0.6B 或 4B

A10 x 多实例

高精度语义搜索

8B

H100 (80G)

很高

Model Gallery支持一键部署Qwen3-Embedding系列模型,注意:

  • 不指定 --max-model-len 时,vLLM 默认读取模型 config.json 的 max_position_embeddings。该参数直接限制输入文本的 Token 数上限,超限则截断或报错。

  • Embedding 模型无自回归生成,但 vLLM 仍预分配全量 KV Cache,造成显存浪费。建议根据实际业务长度显式调小 --max-model-len,可显著降低显存占用、提升并发,同时避免过度预分配导致的资源浪费。