全部產品
Search
文件中心

DataWorks:Data Integration智能巡檢與營運值守

更新時間:Sep 08, 2026

Data Integration同步任務上線後,運行延遲、任務失敗、資源水位變化等問題需要持續跟蹤。智能巡檢任務按設定的頻率主動檢查同步任務的健全狀態,每次運行後產生帶歸因診斷的結果詳情報告;智能營運值守在例外狀況事件發生的當下自動收集運行資訊、分析原因,並持續跟蹤任務恢複情況。兩項能力均由Data Integration Data Agent 執行,將重複的人工排查轉變為自動執行的周期性檢查與即時響應。

能力總覽

智能巡檢任務與智能營運值守分別覆蓋營運的日常與突發,可按需單獨使用或配合使用。

能力

定位

觸發方式

核心產出

智能巡檢任務

周期性主動檢查

按設定的運行頻率定時運行,也可手動立即執行

帶歸因診斷的結果詳情報告

智能營運值守

即時事件響應

任務命中情境中配置的事件與閾值時觸發

值守記錄與恢複跟蹤結論

智能巡檢任務面向Data Integration同步任務的營運情境,入口位於Data Integration左側導覽列的 AI Native 分組下。如果環境中未看到該分組,說明當前環境暫未開放此能力。

準備工作

首次使用智能巡檢任務與智能營運值守,需完成以下準備:

  1. 進入 DataWorks Data Integration控制台。

  2. 從左側導覽列找到 AI Native 下的 Data Agent。

  3. 若當前帳號尚未開通 Data Agent,可根據介面指引進行購買,購買成功後即可進入Data Integration Data Agent 介面。

  4. 首次使用Data Integration Data Agent 時,請確保當前租戶下的 Serverless 資源群組至少有 2 CU 的剩餘資源額度;若無資源群組,需要建立 Serverless 資源群組。

說明

智能巡檢任務與智能營運值守均由 Data Agent 執行,運行過程會產生 Token 消耗。巡檢任務的運行記錄會展示每次啟動並執行 Token 消耗,便於跟蹤使用方式。Token 消耗量級與計費方式,請參見費用說明。

智能巡檢任務

智能巡檢任務是由 Data Agent 建立和管理的自動化巡檢任務。選定巡檢情境並設定運行頻率後,Data Agent 按周期檢查同步任務的健全狀態,並將結論寫入可線上查看、可下載的結果詳情報告。

內建巡檢情境

工作清單頁頂部提供推薦情境卡片,覆蓋即時同步與離線同步的常見營運訴求。每個卡片展示情境名稱、情境描述與預設運行頻率,單擊卡片即可用該情境的模板建立巡檢任務。

情境

關注點

預設運行頻率

即時同步延遲巡檢

運行中即時任務的業務延遲與訊息積壓,展示當前值、近 24 小時趨勢及超閾值延遲事件。

每小時

即時同步異常與恢複巡檢

即時任務在當前自然小時內的 Failover 與運行失敗,重點關注短期重複異常與未恢複任務。

每小時

即時同步空間資源水位巡檢

當前工作空間內即時同步任務的 CU、記憶體水位與剩餘容量。

每小時

離線同步昨日健康處置巡檢

昨天離線同步的整體健康情況,給出需要處理的新增失敗任務與已恢複任務。

每天

離線同步運行波動巡檢

對比昨天與前天的整體運行變化,定位異常增長時段與共性影響範圍。

每天

離線同步昨日資料量異常巡檢

昨天成功啟動並執行離線任務,資料量是否出現清零、明顯下降或異常增長。

每天

資料來源任務異常巡檢

按資料來源彙總任務異常,識別串連、鑒權、網路或讀寫問題是否同時影響多個任務。

每小時

進入智能巡檢任務

  1. 登入 DataWorks 控制台,進入目標工作空間後開啟Data Integration。

  2. 在Data Integration左側導覽列,選擇 AI Native > 智能巡检任务,進入智能巡檢工作清單頁。

建立智能巡檢任務

智能巡檢任務支援三種建立方式,可根據使用習慣選擇:

  • 使用推薦情境卡片:適用於開箱即用的常見巡檢情境。在列表頁頂部的推薦情境卡片區,單擊目標卡片,系統會以情境模板自動預填建立表單(包括任務名稱、描述、任務內容與運行頻率),確認或調整後即可完成建立。

  • 通过 Agent 聊天创建:適用於用自然語言描述巡檢訴求的情境。在工作清單頁,單擊新建智能巡检任务,從下拉式功能表中選擇通过 Agent 聊天创建,通過 Data Agent 交談視窗描述希望巡檢的內容(例如巡檢哪些同步任務、關注哪些運行指標),由 Data Agent 協助產生並落地巡檢任務。

  • 手动创建:適用於需要完全自訂巡檢內容、運行頻率與資源群組的情境。在工作清單頁,單擊新建智能巡检任务,從下拉式功能表中選擇手动创建,開啟手动创建智能巡检任务對話方塊,按下表配置後提交。

配置項

是否必填

說明

任务名称

是

巡檢任務的名稱,最長 50 個字元,需符合任務命名規則。

描述

否

任務的用途說明,便於識別列表中的任務。

资源组

是

選擇調度模組的 Serverless 資源群組,用於執行巡檢任務。

运行频率

是

任務的調度周期,支援一次性、每小時、每天、每周、每月與自訂 Cron 運算式,預設為每天 08:00。

任务内容

是

用自然語言描述需要巡檢的內容,由 Data Agent 在每次運行時解析並執行。例如:對專案下所有同步任務進行健康巡檢,檢查任務狀態、同步延遲和資源佔用情況。

建立成功後,頁面自動返回工作清單,即可看到新建立的任務。

管理智能巡檢任務

列表頁頂部展示推薦情境卡片區,提示推荐场景,点击即可快速创建;下方為工作清單,統一管理已建立的全部巡檢任務。工作清單展示以下資訊,並支援按任務名稱、ID 或描述搜尋:

列

說明

任务名称 / ID

任務名稱與唯一標識,單擊任務名稱可跳轉到該任務的運行記錄。

自动调度

自動調度的開啟狀態,取值為已开启或未开启。

运行频率

任務的調度周期,以可讀描述展示。

描述

任務的用途說明。

资源组

執行該任務的資源群組名稱。

修改时间

任務最近一次修改的時間。

每個任務支援以下操作:

  • 开启自动调度 / 关闭自动调度:控制任務是否按設定的運行頻率定時執行。未配置運行頻率的任務無法開啟自動調度,需先進入任務詳情,配置運行頻率。

  • 任务详情:查看並編輯任務的基本資料、調度配置、運行資源與任務內容。

  • 运行记录:查看任務的歷史運行記錄與每次啟動並執行結果詳情報告。

  • 更多菜單包含以下操作:

    • 立即执行:不等待調度周期,立即觸發一次任務運行。如果任務內容中包含調度參數變數,執行前需要填寫各變數的替換值。

    • 克隆:基於當前任務建立一個新任務,需填寫新任務名稱。

    • 删除:刪除任務。刪除後不可恢複,請謹慎操作。

查看任務詳情

在工作清單的操作列單擊任务详情,進入任務詳情頁。詳情頁包含四個地區:

  • 基本信息:展示任務名稱、任務 ID、修改時間與描述,支援編輯。

  • 调度配置:管理自动调度開關與运行频率。

  • 运行资源:展示並更改任務使用的資源群組。

  • 任务内容:展示 Data Agent 每次運行時執行的任務內容,支援直接手動編輯;也可以單擊頁頭的智能編輯,通過與 Data Agent 對話的方式修改任務內容,隨業務變化持續調整巡檢範圍。

查看運行記錄

在工作清單的操作列單擊运行记录,進入運行記錄頁。頁面分為三個地區,選中目標歷史運行記錄後,可查看該次啟動並執行運行概覽與結果詳情報告:

  • 历史运行记录:位於頁面左側,展示該任務的運行總次數與全部運行記錄。每條記錄包含運行狀態(运行中、未运行、失败、完成)、觸發方式(手动触发或定时触发)、耗時、開始時間與結束時間(未啟動並執行記錄展示預計執行時間)、运行实例 ID 與本次啟動並執行 Token 消耗。支援按運行狀態篩選記錄。

  • 运行概览:位於頁面右上,展示所選運行記錄的运行实例 ID、运行状态、资源组、开始时间、结束时间、耗时、触发方式與 Token 消耗。在此可以單擊运行日志查看作業記錄,單擊查看完整对话查看 Data Agent 本次啟動並執行完整對話記錄;任務運行中時,還可以單擊停止終止本次運行。運行失敗時,可通過作業記錄與完整對話記錄定位失敗原因。

  • 结果详情报告:位於頁面右下,展示本次運行產生的巡檢報告。報告由服務端產生後直接在頁面內預覽,可以單擊新窗口打开,通過新瀏覽器標籤頁查看,或單擊下载將報告儲存到本地,便於在團隊內流轉和歸檔。

結果詳情報告的內容

報告內容隨巡檢情境不同而變化。以離線同步昨日健康處置巡檢為例,一份報告包含以下四部分:

  • 健康摘要與總覽:統計視窗內完結的執行個體數、成功與失敗數量、成功率與失敗率,並配可視化佔比圖,同時明確列出進入關注清單、仍需處理的任務數量。

  • 任務維度歸因診斷:對每個待核查任務做歸因分類,區分新增失敗、持續失敗、基準不足等類型;並按統計視窗結束到報告產生時間內的最新執行個體終態,判定恢複狀態,取值包括視窗後仍失敗需處理、視窗後已恢複無需處理、視窗後重跑中待觀察、失敗後未再運行需確認。

  • 共性歸因:識別同源失敗,例如多個任務因同一張表或同一個欄位的問題同時失敗。此時優先核對該類配置項,修正後可一併重跑,不必逐個任務排查。

  • 深度診斷根因與處理建議:針對每個失敗任務,給出失敗方向(例如 MySQL 到 MaxCompute)、資源群組、首次與最近失敗時間、失敗時段分布、上一日狀態、表面報錯,以及根因判斷與可執行檔處理建議。

智能營運值守

智能營運值守面向即時鏈路與離線鏈路的異常響應。選擇值守情境並應用到任務後,任務命中情境中配置的事件時,系統會自動收集運行資訊、分析原因,並持續跟蹤任務的恢複情況。

[需要確認:智能營運值守的控制台入口路徑(在Data Integration左側導覽列中的具體位置、是否與智能巡檢任務同屬 AI Native 分組),以及使用前提(是否需要指定資源群組、是否需要額外開通)。]

情境與事件的關係

值守以情境為嵌入式管理單元,一個情境是一組事件的集合。配置順序如下:

  1. 定義情境適用的任務類型,確定該情境可以應用到哪些同步任務。

  2. 在情境內配置多個監控事件,並為每個事件設定各自的觸發閾值。

  3. 將情境應用到具體的同步任務。應用後,還可以針對單個任務單獨覆蓋事件閾值,實現重點任務的精細化調整。

[需要確認:建立自訂值守情境、配置事件閾值、將情境應用到任務,以及為單個任務覆蓋閾值的具體介面操作步驟與配置項說明。]

內建值守情境

系統提供以下內建值守情境,可直接應用到符合適用類型的同步任務:

值守情境

適用任務類型

監控事件

觸發後的自動分析

即時同步延遲值守

整庫即時同步任務、單表即時同步任務

業務延遲持續超限

自動分析源端、同步鏈路與目標端,定位可能的效能瓶頸。

即時同步運行值守

整庫即時同步任務、單表即時同步任務

即時同步任務運行失敗;頻繁發生容災切換(Failover)

自動分析異常原因。

離線同步運行值守

整庫離線同步任務

整庫離線同步任務運行失敗;離線增量執行個體執行失敗

自動收集運行資訊並給出處理建議。

無論命中哪個事件,值守都會在完成分析後持續跟蹤任務的恢複情況,直至任務恢複。

查看值守記錄

每次觸發的值守事件都會沉澱為一條值守記錄,形成可回溯的營運台賬。單條記錄展示觸發時間、命中事件的任務、命中的具體事件、分析結論與當前是否已恢複,便於事後複盤與責任對齊。

[需要確認:值守記錄列表的完整欄位、篩選與搜尋條件,以及記錄詳情中的分析結論展示形式(是否與巡檢報告一致,支援新視窗開啟與下載)。]

情境選擇建議

根據營運訴求選擇巡檢情境,需要異常發生時立即響應的鏈路可再搭配對應的值守情境:

營運訴求

推薦巡檢情境

建議搭配的值守情境

大促等高峰期保障即時數倉鏈路,訂單、支付、物流資料的延遲會直接影響即時大屏與營運決策。

即時同步延遲巡檢

即時同步延遲值守、即時同步運行值守

淩晨完成離線批處理日切,需要在上班時直接獲得昨夜的失敗任務、已恢複任務與仍需處理的任務清單。

離線同步昨日健康處置巡檢

離線同步運行值守

大量任務共用同一批資料來源,資料庫密碼變更、網路抖動或許可權調整可能導致一批任務同時報錯,需要判斷異常是否來自同一資料來源。

資料來源任務異常巡檢

無

防範誤改過濾條件、刪除欄位等配置變更導致任務跑空或報錯,需要在影響下遊前發現。

離線同步昨日資料量異常巡檢、離線同步運行波動巡檢

無

即時同步長期佔用 CU 與記憶體資源,水位過高會觸及容量上限影響任務穩定,過低則意味著資源浪費,需要擴容與成本最佳化依據。

即時同步空間資源水位巡檢

無

費用說明

智能巡檢任務與智能營運值守由 Data Agent 調用大模型完成分析,當前使用的模型為 DeepSeek-v4-flash,按模型的 Token 用量計費,計費單價請參見模型調用計費。典型消耗量級如下:

能力

統計口徑

Token 消耗

參考費用

智能巡檢任務

單個巡檢任務運行一次

約 50 萬 Token

約 1 元

智能營運值守

單個值守情境觸發一天

約 1 億 Token

約 100 元

說明

上述 Token 消耗與費用為典型情境下的估算值,實際消耗隨巡檢內容的複雜度、任務數量與事件觸發頻率變化。費用以實際支付金額為準。

巡檢任務的每次運行都會在運行記錄中展示該次啟動並執行實際 Token 消耗,可據此核對用量。

相關文檔

Data Integration Data Agent