数据集成同步任务上线后,运行延迟、任务失败、资源水位变化等问题需要持续跟踪。智能巡检任务按设定的频率主动检查同步任务的运行状况,每次运行后生成带归因诊断的结果详情报告;智能运维值守在异常事件发生的当下自动收集运行信息、分析原因,并持续跟踪任务恢复情况。两项能力均由数据集成 Data Agent 执行,将重复的人工排查转变为自动执行的周期性检查与实时响应。
能力总览
智能巡检任务与智能运维值守分别覆盖运维的日常与突发,可按需单独使用或配合使用。
能力 | 定位 | 触发方式 | 核心产出 |
智能巡检任务 | 周期性主动检查 | 按设定的运行频率定时运行,也可手动立即执行 | 带归因诊断的结果详情报告 |
智能运维值守 | 实时事件响应 | 任务命中场景中配置的事件与阈值时触发 | 值守记录与恢复跟踪结论 |
智能巡检任务面向数据集成同步任务的运维场景,入口位于数据集成左侧导航栏的 AI Native 分组下。如果环境中未看到该分组,说明当前环境暂未开放此能力。
准备工作
首次使用智能巡检任务与智能运维值守,需完成以下准备:
进入 DataWorks 数据集成控制台。
从左侧导航栏找到 AI Native 下的 Data Agent。
若当前账号尚未开通 Data Agent,可根据界面指引进行购买,购买成功后即可进入数据集成 Data Agent 界面。
首次使用数据集成 Data Agent 时,请确保当前租户下的 Serverless 资源组至少有 2 CU 的剩余资源额度;若无资源组,需要新建 Serverless 资源组。
智能巡检任务与智能运维值守均由 Data Agent 执行,运行过程会产生 Token 消耗。巡检任务的运行记录会展示每次运行的 Token 消耗,便于跟踪使用情况。Token 消耗量级与计费方式,请参见费用说明。
智能巡检任务
智能巡检任务是由 Data Agent 创建和管理的自动化巡检任务。选定巡检场景并设定运行频率后,Data Agent 按周期检查同步任务的运行状况,并将结论写入可在线查看、可下载的结果详情报告。
内置巡检场景
任务列表页顶部提供推荐场景卡片,覆盖实时同步与离线同步的常见运维诉求。每个卡片展示场景名称、场景描述与默认运行频率,单击卡片即可用该场景的模板创建巡检任务。
场景 | 关注点 | 默认运行频率 |
实时同步延迟巡检 | 运行中实时任务的业务延迟与消息积压,展示当前值、近 24 小时趋势及超阈值延迟事件。 | 每小时 |
实时同步异常与恢复巡检 | 实时任务在当前自然小时内的 Failover 与运行失败,重点关注短期重复异常与未恢复任务。 | 每小时 |
实时同步空间资源水位巡检 | 当前工作空间内实时同步任务的 CU、内存水位与剩余容量。 | 每小时 |
离线同步昨日健康处置巡检 | 昨天离线同步的整体健康状况,给出需要处理的新增失败任务与已恢复任务。 | 每天 |
离线同步运行波动巡检 | 对比昨天与前天的整体运行变化,定位异常增长时段与共性影响范围。 | 每天 |
离线同步昨日数据量异常巡检 | 昨天成功运行的离线任务,数据量是否出现清零、明显下降或异常增长。 | 每天 |
数据源任务异常巡检 | 按数据源聚合任务异常,识别连接、鉴权、网络或读写问题是否同时影响多个任务。 | 每小时 |
进入智能巡检任务
登录 DataWorks 控制台,进入目标工作空间后打开数据集成。
在数据集成左侧导航栏,选择 AI Native > 智能巡检任务,进入智能巡检任务列表页。
创建智能巡检任务
智能巡检任务支持三种创建方式,可根据使用习惯选择:
使用推荐场景卡片:适用于开箱即用的常见巡检场景。在列表页顶部的推荐场景卡片区,单击目标卡片,系统会以场景模板自动预填创建表单(包括任务名称、描述、任务内容与运行频率),确认或调整后即可完成创建。
通过 Agent 聊天创建:适用于用自然语言描述巡检诉求的场景。在任务列表页,单击新建智能巡检任务,从下拉菜单中选择通过 Agent 聊天创建,通过 Data Agent 对话窗口描述希望巡检的内容(例如巡检哪些同步任务、关注哪些运行指标),由 Data Agent 协助生成并落地巡检任务。
手动创建:适用于需要完全自定义巡检内容、运行频率与资源组的场景。在任务列表页,单击新建智能巡检任务,从下拉菜单中选择手动创建,打开手动创建智能巡检任务对话框,按下表配置后提交。
配置项 | 是否必填 | 说明 |
任务名称 | 是 | 巡检任务的名称,最长 50 个字符,需符合任务命名规则。 |
描述 | 否 | 任务的用途说明,便于识别列表中的任务。 |
资源组 | 是 | 选择调度模块的 Serverless 资源组,用于执行巡检任务。 |
运行频率 | 是 | 任务的调度周期,支持一次性、每小时、每天、每周、每月与自定义 Cron 表达式,默认为每天 08:00。 |
任务内容 | 是 | 用自然语言描述需要巡检的内容,由 Data Agent 在每次运行时解析并执行。例如:对项目下所有同步任务进行健康巡检,检查任务状态、同步延迟和资源占用情况。 |
创建成功后,页面自动返回任务列表,即可看到新创建的任务。
管理智能巡检任务
列表页顶部展示推荐场景卡片区,提示推荐场景,点击即可快速创建;下方为任务列表,统一管理已创建的全部巡检任务。任务列表展示以下信息,并支持按任务名称、ID 或描述搜索:
列 | 说明 |
任务名称 / ID | 任务名称与唯一标识,单击任务名称可跳转到该任务的运行记录。 |
自动调度 | 自动调度的开启状态,取值为已开启或未开启。 |
运行频率 | 任务的调度周期,以可读描述展示。 |
描述 | 任务的用途说明。 |
资源组 | 执行该任务的资源组名称。 |
修改时间 | 任务最近一次修改的时间。 |
每个任务支持以下操作:
开启自动调度 / 关闭自动调度:控制任务是否按设定的运行频率定时执行。未配置运行频率的任务无法开启自动调度,需先进入任务详情,配置运行频率。
任务详情:查看并编辑任务的基本信息、调度配置、运行资源与任务内容。
运行记录:查看任务的历史运行记录与每次运行的结果详情报告。
更多菜单包含以下操作:
立即执行:不等待调度周期,立即触发一次任务运行。如果任务内容中包含调度参数变量,执行前需要填写各变量的替换值。
克隆:基于当前任务创建一个新任务,需填写新任务名称。
删除:删除任务。删除后不可恢复,请谨慎操作。
查看任务详情
在任务列表的操作列单击任务详情,进入任务详情页。详情页包含四个区域:
基本信息:展示任务名称、任务 ID、修改时间与描述,支持编辑。
调度配置:管理自动调度开关与运行频率。
运行资源:展示并更改任务使用的资源组。
任务内容:展示 Data Agent 每次运行时执行的任务内容,支持直接手动编辑;也可以单击页头的智能编辑,通过与 Data Agent 对话的方式修改任务内容,随业务变化持续调整巡检范围。
查看运行记录
在任务列表的操作列单击运行记录,进入运行记录页。页面分为三个区域,选中目标历史运行记录后,可查看该次运行的运行概览与结果详情报告:
历史运行记录:位于页面左侧,展示该任务的运行总次数与全部运行记录。每条记录包含运行状态(运行中、未运行、失败、完成)、触发方式(手动触发或定时触发)、耗时、开始时间与结束时间(未运行的记录展示预计执行时间)、运行实例 ID 与本次运行的 Token 消耗。支持按运行状态筛选记录。
运行概览:位于页面右上,展示所选运行记录的运行实例 ID、运行状态、资源组、开始时间、结束时间、耗时、触发方式与 Token 消耗。在此可以单击运行日志查看运行日志,单击查看完整对话查看 Data Agent 本次运行的完整对话记录;任务运行中时,还可以单击停止终止本次运行。运行失败时,可通过运行日志与完整对话记录定位失败原因。
结果详情报告:位于页面右下,展示本次运行生成的巡检报告。报告由服务端生成后直接在页面内预览,可以单击新窗口打开,通过新浏览器标签页查看,或单击下载将报告保存到本地,便于在团队内流转和归档。
结果详情报告的内容
报告内容随巡检场景不同而变化。以离线同步昨日健康处置巡检为例,一份报告包含以下四部分:
健康摘要与总览:统计窗口内完结的实例数、成功与失败数量、成功率与失败率,并配可视化占比图,同时明确列出进入关注清单、仍需处理的任务数量。
任务维度归因诊断:对每个待核查任务做归因分类,区分新增失败、持续失败、基线不足等类型;并按统计窗口结束到报告生成时间内的最新实例终态,判定恢复状态,取值包括窗口后仍失败需处理、窗口后已恢复无需处理、窗口后重跑中待观察、失败后未再运行需确认。
共性归因:识别同源失败,例如多个任务因同一张表或同一个字段的问题同时失败。此时优先核对该类配置项,修正后可一并重跑,不必逐个任务排查。
深度诊断根因与处理建议:针对每个失败任务,给出失败方向(例如 MySQL 到 MaxCompute)、资源组、首次与最近失败时间、失败时段分布、上一日状态、表面报错,以及根因判断与可执行的处理建议。
智能运维值守
智能运维值守面向实时链路与离线链路的异常响应。选择值守场景并应用到任务后,任务命中场景中配置的事件时,系统会自动收集运行信息、分析原因,并持续跟踪任务的恢复情况。
[需要确认:智能运维值守的控制台入口路径(在数据集成左侧导航栏中的具体位置、是否与智能巡检任务同属 AI Native 分组),以及使用前提(是否需要指定资源组、是否需要额外开通)。]
场景与事件的关系
值守以场景为管理单元,一个场景是一组事件的集合。配置顺序如下:
定义场景适用的任务类型,确定该场景可以应用到哪些同步任务。
在场景内配置多个监控事件,并为每个事件设定各自的触发阈值。
将场景应用到具体的同步任务。应用后,还可以针对单个任务单独覆盖事件阈值,实现重点任务的精细化调整。
[需要确认:创建自定义值守场景、配置事件阈值、将场景应用到任务,以及为单个任务覆盖阈值的具体界面操作步骤与配置项说明。]
内置值守场景
系统提供以下内置值守场景,可直接应用到符合适用类型的同步任务:
值守场景 | 适用任务类型 | 监控事件 | 触发后的自动分析 |
实时同步延迟值守 | 整库实时同步任务、单表实时同步任务 | 业务延迟持续超限 | 自动分析源端、同步链路与目标端,定位可能的性能瓶颈。 |
实时同步运行值守 | 整库实时同步任务、单表实时同步任务 | 实时同步任务运行失败;频繁发生容灾切换(Failover) | 自动分析异常原因。 |
离线同步运行值守 | 整库离线同步任务 | 整库离线同步任务运行失败;离线增量实例执行失败 | 自动收集运行信息并给出处理建议。 |
无论命中哪个事件,值守都会在完成分析后持续跟踪任务的恢复情况,直至任务恢复。
查看值守记录
每次触发的值守事件都会沉淀为一条值守记录,形成可回溯的运维台账。单条记录展示触发时间、命中事件的任务、命中的具体事件、分析结论与当前是否已恢复,便于事后复盘与责任对齐。
[需要确认:值守记录列表的完整字段、筛选与搜索条件,以及记录详情中的分析结论展示形式(是否与巡检报告一致,支持新窗口打开与下载)。]
场景选择建议
根据运维诉求选择巡检场景,需要异常发生时立即响应的链路可再搭配对应的值守场景:
运维诉求 | 推荐巡检场景 | 建议搭配的值守场景 |
大促等高峰期保障实时数仓链路,订单、支付、物流数据的延迟会直接影响实时大屏与运营决策。 | 实时同步延迟巡检 | 实时同步延迟值守、实时同步运行值守 |
凌晨完成离线批处理日切,需要在上班时直接获得昨夜的失败任务、已恢复任务与仍需处理的任务清单。 | 离线同步昨日健康处置巡检 | 离线同步运行值守 |
大量任务共用同一批数据源,数据库密码变更、网络抖动或权限调整可能导致一批任务同时报错,需要判断异常是否来自同一数据源。 | 数据源任务异常巡检 | 无 |
防范误改过滤条件、删除字段等配置变更导致任务跑空或报错,需要在影响下游前发现。 | 离线同步昨日数据量异常巡检、离线同步运行波动巡检 | 无 |
实时同步长期占用 CU 与内存资源,水位过高会触及容量上限影响任务稳定,过低则意味着资源浪费,需要扩容与成本优化依据。 | 实时同步空间资源水位巡检 | 无 |
费用说明
智能巡检任务与智能运维值守由 Data Agent 调用大模型完成分析,当前使用的模型为 DeepSeek-v4-flash,按模型的 Token 用量计费,计费单价请参见模型调用计费。典型消耗量级如下:
能力 | 统计口径 | Token 消耗 | 参考费用 |
智能巡检任务 | 单个巡检任务运行一次 | 约 50 万 Token | 约 1 元 |
智能运维值守 | 单个值守场景触发一天 | 约 1 亿 Token | 约 100 元 |
上述 Token 消耗与费用为典型场景下的估算值,实际消耗随巡检内容的复杂度、任务数量与事件触发频率变化。费用以实际支付金额为准。
巡检任务的每次运行都会在运行记录中展示该次运行的实际 Token 消耗,可据此核对用量。