全部产品
Search
文档中心

大数据开发治理平台 DataWorks:数据集成智能巡检与运维值守

更新时间:Sep 07, 2026

数据集成同步任务上线后,运行延迟、任务失败、资源水位变化等问题需要持续跟踪。智能巡检任务按设定的频率主动检查同步任务的运行状况,每次运行后生成带归因诊断的结果详情报告;智能运维值守在异常事件发生的当下自动收集运行信息、分析原因,并持续跟踪任务恢复情况。两项能力均由数据集成 Data Agent 执行,将重复的人工排查转变为自动执行的周期性检查与实时响应。

能力总览

智能巡检任务与智能运维值守分别覆盖运维的日常与突发,可按需单独使用或配合使用。

能力

定位

触发方式

核心产出

智能巡检任务

周期性主动检查

按设定的运行频率定时运行,也可手动立即执行

带归因诊断的结果详情报告

智能运维值守

实时事件响应

任务命中场景中配置的事件与阈值时触发

值守记录与恢复跟踪结论

智能巡检任务面向数据集成同步任务的运维场景,入口位于数据集成左侧导航栏的 AI Native 分组下。如果环境中未看到该分组,说明当前环境暂未开放此能力。

准备工作

首次使用智能巡检任务与智能运维值守,需完成以下准备:

  1. 进入 DataWorks 数据集成控制台

  2. 从左侧导航栏找到 AI Native 下的 Data Agent

  3. 若当前账号尚未开通 Data Agent,可根据界面指引进行购买,购买成功后即可进入数据集成 Data Agent 界面。

  4. 首次使用数据集成 Data Agent 时,请确保当前租户下的 Serverless 资源组至少有 2 CU 的剩余资源额度;若无资源组,需要新建 Serverless 资源组

说明

智能巡检任务与智能运维值守均由 Data Agent 执行,运行过程会产生 Token 消耗。巡检任务的运行记录会展示每次运行的 Token 消耗,便于跟踪使用情况。Token 消耗量级与计费方式,请参见费用说明

智能巡检任务

智能巡检任务是由 Data Agent 创建和管理的自动化巡检任务。选定巡检场景并设定运行频率后,Data Agent 按周期检查同步任务的运行状况,并将结论写入可在线查看、可下载的结果详情报告。

内置巡检场景

任务列表页顶部提供推荐场景卡片,覆盖实时同步与离线同步的常见运维诉求。每个卡片展示场景名称、场景描述与默认运行频率,单击卡片即可用该场景的模板创建巡检任务。

场景

关注点

默认运行频率

实时同步延迟巡检

运行中实时任务的业务延迟与消息积压,展示当前值、近 24 小时趋势及超阈值延迟事件。

每小时

实时同步异常与恢复巡检

实时任务在当前自然小时内的 Failover 与运行失败,重点关注短期重复异常与未恢复任务。

每小时

实时同步空间资源水位巡检

当前工作空间内实时同步任务的 CU、内存水位与剩余容量。

每小时

离线同步昨日健康处置巡检

昨天离线同步的整体健康状况,给出需要处理的新增失败任务与已恢复任务。

每天

离线同步运行波动巡检

对比昨天与前天的整体运行变化,定位异常增长时段与共性影响范围。

每天

离线同步昨日数据量异常巡检

昨天成功运行的离线任务,数据量是否出现清零、明显下降或异常增长。

每天

数据源任务异常巡检

按数据源聚合任务异常,识别连接、鉴权、网络或读写问题是否同时影响多个任务。

每小时

进入智能巡检任务

  1. 登录 DataWorks 控制台,进入目标工作空间后打开数据集成。

  2. 在数据集成左侧导航栏,选择 AI Native > 智能巡检任务,进入智能巡检任务列表页。

创建智能巡检任务

智能巡检任务支持三种创建方式,可根据使用习惯选择:

  • 使用推荐场景卡片:适用于开箱即用的常见巡检场景。在列表页顶部的推荐场景卡片区,单击目标卡片,系统会以场景模板自动预填创建表单(包括任务名称、描述、任务内容与运行频率),确认或调整后即可完成创建。

  • 通过 Agent 聊天创建:适用于用自然语言描述巡检诉求的场景。在任务列表页,单击新建智能巡检任务,从下拉菜单中选择通过 Agent 聊天创建,通过 Data Agent 对话窗口描述希望巡检的内容(例如巡检哪些同步任务、关注哪些运行指标),由 Data Agent 协助生成并落地巡检任务。

  • 手动创建:适用于需要完全自定义巡检内容、运行频率与资源组的场景。在任务列表页,单击新建智能巡检任务,从下拉菜单中选择手动创建,打开手动创建智能巡检任务对话框,按下表配置后提交。

配置项

是否必填

说明

任务名称

巡检任务的名称,最长 50 个字符,需符合任务命名规则。

描述

任务的用途说明,便于识别列表中的任务。

资源组

选择调度模块的 Serverless 资源组,用于执行巡检任务。

运行频率

任务的调度周期,支持一次性、每小时、每天、每周、每月与自定义 Cron 表达式,默认为每天 08:00。

任务内容

用自然语言描述需要巡检的内容,由 Data Agent 在每次运行时解析并执行。例如:对项目下所有同步任务进行健康巡检,检查任务状态、同步延迟和资源占用情况。

创建成功后,页面自动返回任务列表,即可看到新创建的任务。

管理智能巡检任务

列表页顶部展示推荐场景卡片区,提示推荐场景,点击即可快速创建;下方为任务列表,统一管理已创建的全部巡检任务。任务列表展示以下信息,并支持按任务名称、ID 或描述搜索:

说明

任务名称 / ID

任务名称与唯一标识,单击任务名称可跳转到该任务的运行记录。

自动调度

自动调度的开启状态,取值为已开启未开启

运行频率

任务的调度周期,以可读描述展示。

描述

任务的用途说明。

资源组

执行该任务的资源组名称。

修改时间

任务最近一次修改的时间。

每个任务支持以下操作:

  • 开启自动调度 / 关闭自动调度:控制任务是否按设定的运行频率定时执行。未配置运行频率的任务无法开启自动调度,需先进入任务详情,配置运行频率。

  • 任务详情:查看并编辑任务的基本信息、调度配置、运行资源与任务内容。

  • 运行记录:查看任务的历史运行记录与每次运行的结果详情报告。

  • 更多菜单包含以下操作:

    • 立即执行:不等待调度周期,立即触发一次任务运行。如果任务内容中包含调度参数变量,执行前需要填写各变量的替换值。

    • 克隆:基于当前任务创建一个新任务,需填写新任务名称。

    • 删除:删除任务。删除后不可恢复,请谨慎操作。

查看任务详情

在任务列表的操作列单击任务详情,进入任务详情页。详情页包含四个区域:

  • 基本信息:展示任务名称、任务 ID、修改时间与描述,支持编辑。

  • 调度配置:管理自动调度开关与运行频率

  • 运行资源:展示并更改任务使用的资源组。

  • 任务内容:展示 Data Agent 每次运行时执行的任务内容,支持直接手动编辑;也可以单击页头的智能编辑,通过与 Data Agent 对话的方式修改任务内容,随业务变化持续调整巡检范围。

查看运行记录

在任务列表的操作列单击运行记录,进入运行记录页。页面分为三个区域,选中目标历史运行记录后,可查看该次运行的运行概览与结果详情报告:

  • 历史运行记录:位于页面左侧,展示该任务的运行总次数与全部运行记录。每条记录包含运行状态(运行中未运行失败完成)、触发方式(手动触发定时触发)、耗时、开始时间与结束时间(未运行的记录展示预计执行时间)、运行实例 ID 与本次运行的 Token 消耗。支持按运行状态筛选记录。

  • 运行概览:位于页面右上,展示所选运行记录的运行实例 ID运行状态资源组开始时间结束时间耗时触发方式Token 消耗。在此可以单击运行日志查看运行日志,单击查看完整对话查看 Data Agent 本次运行的完整对话记录;任务运行中时,还可以单击停止终止本次运行。运行失败时,可通过运行日志与完整对话记录定位失败原因。

  • 结果详情报告:位于页面右下,展示本次运行生成的巡检报告。报告由服务端生成后直接在页面内预览,可以单击新窗口打开,通过新浏览器标签页查看,或单击下载将报告保存到本地,便于在团队内流转和归档。

结果详情报告的内容

报告内容随巡检场景不同而变化。以离线同步昨日健康处置巡检为例,一份报告包含以下四部分:

  • 健康摘要与总览:统计窗口内完结的实例数、成功与失败数量、成功率与失败率,并配可视化占比图,同时明确列出进入关注清单、仍需处理的任务数量。

  • 任务维度归因诊断:对每个待核查任务做归因分类,区分新增失败、持续失败、基线不足等类型;并按统计窗口结束到报告生成时间内的最新实例终态,判定恢复状态,取值包括窗口后仍失败需处理、窗口后已恢复无需处理、窗口后重跑中待观察、失败后未再运行需确认。

  • 共性归因:识别同源失败,例如多个任务因同一张表或同一个字段的问题同时失败。此时优先核对该类配置项,修正后可一并重跑,不必逐个任务排查。

  • 深度诊断根因与处理建议:针对每个失败任务,给出失败方向(例如 MySQL 到 MaxCompute)、资源组、首次与最近失败时间、失败时段分布、上一日状态、表面报错,以及根因判断与可执行的处理建议。

智能运维值守

智能运维值守面向实时链路与离线链路的异常响应。选择值守场景并应用到任务后,任务命中场景中配置的事件时,系统会自动收集运行信息、分析原因,并持续跟踪任务的恢复情况。

[需要确认:智能运维值守的控制台入口路径(在数据集成左侧导航栏中的具体位置、是否与智能巡检任务同属 AI Native 分组),以及使用前提(是否需要指定资源组、是否需要额外开通)。]

场景与事件的关系

值守以场景为管理单元,一个场景是一组事件的集合。配置顺序如下:

  1. 定义场景适用的任务类型,确定该场景可以应用到哪些同步任务。

  2. 在场景内配置多个监控事件,并为每个事件设定各自的触发阈值。

  3. 将场景应用到具体的同步任务。应用后,还可以针对单个任务单独覆盖事件阈值,实现重点任务的精细化调整。

[需要确认:创建自定义值守场景、配置事件阈值、将场景应用到任务,以及为单个任务覆盖阈值的具体界面操作步骤与配置项说明。]

内置值守场景

系统提供以下内置值守场景,可直接应用到符合适用类型的同步任务:

值守场景

适用任务类型

监控事件

触发后的自动分析

实时同步延迟值守

整库实时同步任务、单表实时同步任务

业务延迟持续超限

自动分析源端、同步链路与目标端,定位可能的性能瓶颈。

实时同步运行值守

整库实时同步任务、单表实时同步任务

实时同步任务运行失败;频繁发生容灾切换(Failover)

自动分析异常原因。

离线同步运行值守

整库离线同步任务

整库离线同步任务运行失败;离线增量实例执行失败

自动收集运行信息并给出处理建议。

无论命中哪个事件,值守都会在完成分析后持续跟踪任务的恢复情况,直至任务恢复。

查看值守记录

每次触发的值守事件都会沉淀为一条值守记录,形成可回溯的运维台账。单条记录展示触发时间、命中事件的任务、命中的具体事件、分析结论与当前是否已恢复,便于事后复盘与责任对齐。

[需要确认:值守记录列表的完整字段、筛选与搜索条件,以及记录详情中的分析结论展示形式(是否与巡检报告一致,支持新窗口打开与下载)。]

场景选择建议

根据运维诉求选择巡检场景,需要异常发生时立即响应的链路可再搭配对应的值守场景:

运维诉求

推荐巡检场景

建议搭配的值守场景

大促等高峰期保障实时数仓链路,订单、支付、物流数据的延迟会直接影响实时大屏与运营决策。

实时同步延迟巡检

实时同步延迟值守、实时同步运行值守

凌晨完成离线批处理日切,需要在上班时直接获得昨夜的失败任务、已恢复任务与仍需处理的任务清单。

离线同步昨日健康处置巡检

离线同步运行值守

大量任务共用同一批数据源,数据库密码变更、网络抖动或权限调整可能导致一批任务同时报错,需要判断异常是否来自同一数据源。

数据源任务异常巡检

防范误改过滤条件、删除字段等配置变更导致任务跑空或报错,需要在影响下游前发现。

离线同步昨日数据量异常巡检、离线同步运行波动巡检

实时同步长期占用 CU 与内存资源,水位过高会触及容量上限影响任务稳定,过低则意味着资源浪费,需要扩容与成本优化依据。

实时同步空间资源水位巡检

费用说明

智能巡检任务与智能运维值守由 Data Agent 调用大模型完成分析,当前使用的模型为 DeepSeek-v4-flash,按模型的 Token 用量计费,计费单价请参见模型调用计费。典型消耗量级如下:

能力

统计口径

Token 消耗

参考费用

智能巡检任务

单个巡检任务运行一次

约 50 万 Token

约 1 元

智能运维值守

单个值守场景触发一天

约 1 亿 Token

约 100 元

说明

上述 Token 消耗与费用为典型场景下的估算值,实际消耗随巡检内容的复杂度、任务数量与事件触发频率变化。费用以实际支付金额为准。

巡检任务的每次运行都会在运行记录中展示该次运行的实际 Token 消耗,可据此核对用量。

相关文档

数据集成 Data Agent