本文介绍MaxCompute作业运行过程中的常见问题。
作业运行时长不达预期(作业运行慢),通常由什么原因导致,如何解决?
导致MaxCompute作业运行时长不达预期(作业运行慢)的原因通常可分为资源不足、作业问题、模式回退三种:
资源不足
作业问题
作业问题主要指由于作业本身导致的数据倾斜,UDF执行低效,数据膨胀等。SQL作业可以通过Logview进行具体问题定位,定位方法请参见分析运行慢作业。优化方法请参见计算优化最佳实践。
模式回退
MaxCompute作业运行的模式有查询加速模式和普通模式。
对于数据量大、且不需要返回查询结果的作业,只能使用普通模式,因此在资源和作业都正常的情况下,作业运行时长通常不会出现较大波动。
而对于数据量较小的交互式查询作业,通常会命中查询加速模式运行,该模式下的作业执行速度比普通作业快。而MaxCompute并不保证作业每次都能命中查询加速,因此可能出现查询加速作业回退至普通作业,而导致作业运行时长不达先前预期的情况。
MaxCompute 控制台免审批下载结果时点击按钮无反应或加载中断如何处理?
建议使用 Chrome 浏览器的无痕模式重新运行代码并执行下载操作,以排除浏览器缓存或插件干扰。
调度任务失败但手动重跑成功是什么原因?
通常由源端数据波动导致。例如凌晨时段源端(如 Hologres)写入了包含超长字段的脏数据,触发 MaxCompute 读取时的缓冲区超限错误;随后脏数据被更新或清理,手动重跑时读取正常数据因此成功。建议检查源端数据质量及历史写入记录。
DataWorks 数据同步任务报错 DATAX_R_ODPS_006 获取 AK 失败如何排查?
该报错表示无法获取 AccessKey,请按以下步骤排查:
确认任务历史成功记录及失败时间点。
检查源端和目标端数据源配置是否有变动。
确认任务责任人是否变更,若原责任人账号禁用,需确保新责任人具备权限。
确认当前登录账号类型(如 RAM 账号或 Role)。
修改责任人后,必须重新提交并发布上线任务,新的执行上下文才会生效。