PAI-Model Gallery部署或微调模型时常见问题及解决方法。
有问题先问小PAI
PAI智能助手(小PAI)提供PAI全链路产品的使用说明和操作指引,支持对DSW实例、DLC任务、EAS服务进行运维诊断,自动识别失败原因并给出处理建议。

Q:Model Gallery的模型评测是开了深度思考吗?
Model Gallery提供的模型和二次训练后的模型,评测时使用Model Gallery默认部署配置。请根据模型介绍页和默认部署配置判断。
Q:如何部署Model Gallery训练的模型
进入Model Gallery的任务管理,找到训练任务并进入详情页,单击右上角部署按钮。部署后,模型会以在线服务方式运行。

Q:训练任务失败后,如何排查失败原因?
训练任务失败的原因很多,例如数据集格式不符合要求。您可以按以下方式排查:
查看任务诊断:在PAI-Model Gallery > 任务管理 > 训练任务中单击指定任务,在任务详情页签下将鼠标悬停在失败上,系统显示错误原因及解决办法。

查看任务日志:在任务管理 > 训练任务中单击指定任务,在任务日志页签下查看错误信息:

各错误信息的解决方法如下:
错误类型
错误信息
解决办法
输入/输出错误相关
ValueError: output channel ${your OSS uri} must be directory
输出路径必须是文件夹。请检查当前路径是否为文件夹。
ValueError:train must be a file
输入路径必须是文件。请检查当前路径是否为文件。
FileNotFoundError
请检查输入路径下是否存在符合要求的文件。
JSONDecodeError
请检查JSON文件格式是否正确。
ValueError: Input data must be a json file or a jsonl file!
输入文件必须是JSON或JSONL文件。请检查文件格式。
KeyError:${some key name}
该错误多见于JSON训练集。请根据模型说明检查训练集文件的key-value是否符合要求。
ValueError: Unrecognized model in /ml/input/data/model/.
PyTorch无法识别提供的模型文件。
UnicodeDecoderError
请检查输入文件编码格式。
Input/output error
请确保输入路径可读,输出路径可读写
NotADirectoryError: [Errno 20] Not a directory:
请检查输入和输出路径是否为文件夹。
超参数配置相关
ERROR:torch.distributed.elastic.multiprocessing.api:failed (exitcode: -9) local_rank: 0 (pid: 51) of binary: /usr/bin/python(且没有相关subprocess的日志)
当前机型内存不足,加载模型时OOM(Out of Memory)。请选择内存更大的机型。
torch.cuda.OutOfMemoryError: CUDA out of memory
当前机型显存不足。请选择显存更大的GPU机型,或降低lora dim、batch size等超参数。
ValueError: No closing quotation
system prompt或其他参数中出现了单个
",导致算法生成training command失败。请删除单个",或补全为成对引号。机型资源配置相关
Exception: Current loss scale already at minimum - cannot decrease scale anymore. Exiting run
该模型参数格式为BF16,建议使用Ampere或更新架构的GPU(如A10/A100)训练。使用Ampere之前架构的GPU会将参数转换为FP16格式。
RuntimeError: CUDA error: uncorrectable ECC error encountered
当前机型硬件错误。请更换机型,或切换到其他Region重试。
MemoryError: WARNING Insufficient free disk space
当前机型内存不足。请更换内存更大的机型。
用户限制相关
failed to compose dlc job specs, resource limiting triggered, you are trying to use more GPU resources than the threshold
训练任务最多同时运行2*GPU,超过会触发资源限制。请等待运行中的任务完成后再启动,或提交工单申请增加配额。
Q:如何在线调试已部署的模型?
模型部署成功后,在Model Gallery > 任务管理 > 部署任务中查看已部署服务。确认服务状态正常后再调试。

在EAS页面,单击已部署服务操作列的在线调试。在线调试无需编写客户端代码即可验证模型接口。

配置在线调试请求参数。
在模型介绍页查看对应部署方式的调用方法(从Model Gallery页面单击模型卡片进入)。例如,通过BladeLLM部署DeepSeek-R1-Distill-Qwen-7B后,向
/v1/chat/completions发送HTTP POST请求,请求示例如下:

配置并发送请求。
在请求URL后追加
/v1/chat/completions,请求Body按上一步示例填写。
Q:在线调试时报错“no healthy upstream”
在线调试时报错,错误码503,错误提示为“no healthy upstream”:

报错原因:实例运行时CPU、内存或显存被过度占用,缓冲余量不足。
解决方案:
公共资源建议在非高峰时段再调用,或更换资源规格和地域。
专属资源(EAS资源组)需为实例预留足够的CPU、内存和显存,建议至少保留20%空闲资源作为缓冲。
Q:模型训练时报错:SupportsDistributedTraining false, please set InstanceCount=1
报错原因:当前训练任务使用了多个实例(节点数大于1),但该模型不支持分布式训练。
解决方案:将节点数设置为1。单节点训练才能匹配该模型的训练方式。

Q: 模型API调用报错 404 - {'detail': 'Not Found'}
可能的原因:
模型服务不支持 API调用。Model Gallery部署的模型服务,有些只支持在服务详情页面通过 Web 应用 按钮以网页形式交互。该类型不对外提供 OpenAI 兼容的 API 端点,不支持使用 OpenAI SDK 调用。比如
PAI-DistilQwen2.5-7B-Instruct。请求路径不完整或错误。如对话接口,通常的路径格式为
{domain}/api/predict/{service_name}/v1/chat/completions。
模型选择FAQ
Q:PAI-DistilQwen2.5-7B-Instruct 与 DeepSeek-R1-Distill-Qwen-7B的区别?
PAI-DistilQwen2.5-7B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B 均基于 Qwen2.5-7B 蒸馏训练,但应用场景不同:
维度 | PAI-DistilQwen2.5-7B-Instruct | DeepSeek-R1-Distill-Qwen-7B |
基础模型 | Qwen2.5-7B-Instruct | Qwen2.5-7B + DeepSeek-R1 |
蒸馏方式 | 黑盒数据蒸馏 + 白盒 Logits 蒸馏 | 知识蒸馏(推理能力迁移) |
应用场景 | 通用指令遵循 | 数学与推理任务 |
特点 | 指令遵循能力相比原始模型有显著提升。 | 针对数学类问题,建议在 prompt 中包含逐步推理的要求。 |
Q:Fun-CosyVoice 模型与旧版 CosyVoice 有何区别?
Fun-CosyVoice 3.0 是一个基于大型语言模型 (LLM) 的高级文本转语音 (TTS) 系统,在内容一致性、说话人相似度和韵律自然性方面超越了其前身 (CosyVoice 2.0)。
Q:Qwen3 Embedding系列模型区别?
模型对比如下:
模型 | 模型权重 | 显存占用 | 最大嵌入维度 | 适用场景 |
Qwen3-Embedding-0.6B | 1.12 GiB | 2-4 GB | 1024 | 轻量检索、内存敏感 |
Qwen3-Embedding-4B | 7.55 GiB | 10-14 GB | 2560 | 标准语义搜索 |
Qwen3-Embedding-8B | 14.11 GiB | 18-24 GB | 4096 | 高精度、复杂语义 |
请根据使用场景,选择合适的模型与GPU:
场景 | 推荐模型 | 推荐 GPU | 预算 |
个人开发/POC | 0.6B | RTX 3060 / 笔记本 | 低 |
中小企业 API | 4B | A10 (24G) | 中 |
企业级生产 | 8B | A100 40G/80G | 高 |
超大规模向量库 | 0.6B 或 4B | A10 x 多实例 | 中 |
高精度语义搜索 | 8B | H100 (80G) | 很高 |
Model Gallery支持一键部署Qwen3-Embedding系列模型,注意:
不指定
--max-model-len时,vLLM 默认读取模型config.json的max_position_embeddings。该参数直接限制输入文本的 Token 数上限,超限则截断或报错。Embedding 模型无自回归生成,但 vLLM 仍预分配全量 KV Cache,造成显存浪费。建议根据实际业务长度显式调小
--max-model-len,可显著降低显存占用、提升并发,同时避免过度预分配导致的资源浪费。




