作业运行常见问题

更新时间:
复制 MD 格式

本文介绍MaxCompute作业运行过程中的常见问题。

作业运行时长不达预期(作业运行慢),通常由什么原因导致,如何解决?

导致MaxCompute作业运行时长不达预期(作业运行慢)的原因通常可分为资源不足、作业问题、模式回退三种:

  • 资源不足

    • 对于使用包年包月计算资源的作业,可能由于总体作业运行数据量大、申请资源多、作业优先级低而导致该作业出现资源等待情况,进而表现出作业运行慢。

      建议前往资源观测查看资源消耗情况,若发现资源使用量持续触达可用资源上限,应及时进入作业运维优化任务执行情况,或进行计算资源变配

    • 对于使用按量付费标准版计算资源的作业,由于按量付费资源池为共享型,计算作业按需抢占资源,不可指定用量,若瞬时作业过多,存在因多用户抢占而无法满足请求资源量的情况,可能导致返回结果较慢。

    • 对于使用按量付费闲时版计算资源的作业,由于闲时计算资源池与按量付费标准版计算资源共享,不可指定用量,如遇整体资源池资源水位高,发生资源竞争时,Spot作业资源可能会被挤压或者抢占,甚至作业被终止。

  • 作业问题

    作业问题主要指由于作业本身导致的数据倾斜,UDF执行低效,数据膨胀等。SQL作业可以通过Logview进行具体问题定位,定位方法请参见分析运行慢作业。优化方法请参见计算优化最佳实践

  • 模式回退

    MaxCompute作业运行的模式有查询加速模式和普通模式。

    对于数据量大、且不需要返回查询结果的作业,只能使用普通模式,因此在资源和作业都正常的情况下,作业运行时长通常不会出现较大波动。

    而对于数据量较小的交互式查询作业,通常会命中查询加速模式运行,该模式下的作业执行速度比普通作业快。而MaxCompute并不保证作业每次都能命中查询加速,因此可能出现查询加速作业回退至普通作业,而导致作业运行时长不达先前预期的情况。

MaxCompute 控制台免审批下载结果时点击按钮无反应或加载中断如何处理?

建议使用 Chrome 浏览器的无痕模式重新运行代码并执行下载操作,以排除浏览器缓存或插件干扰。

调度任务失败但手动重跑成功是什么原因?

通常由源端数据波动导致。例如凌晨时段源端(如 Hologres)写入了包含超长字段的脏数据,触发 MaxCompute 读取时的缓冲区超限错误;随后脏数据被更新或清理,手动重跑时读取正常数据因此成功。建议检查源端数据质量及历史写入记录。

DataWorks 数据同步任务报错 DATAX_R_ODPS_006 获取 AK 失败如何排查?

该报错表示无法获取 AccessKey,请按以下步骤排查:

  1. 确认任务历史成功记录及失败时间点。

  2. 检查源端和目标端数据源配置是否有变动。

  3. 确认任务责任人是否变更,若原责任人账号禁用,需确保新责任人具备权限。

  4. 确认当前登录账号类型(如 RAM 账号或 Role)。

  5. 修改责任人后,必须重新提交并发布上线任务,新的执行上下文才会生效。