Data Integration同步任務上線後,運行延遲、任務失敗、資源水位變化等問題需要持續跟蹤。智能巡檢任務按設定的頻率主動檢查同步任務的健全狀態,每次運行後產生帶歸因診斷的結果詳情報告;智能營運值守在例外狀況事件發生的當下自動收集運行資訊、分析原因,並持續跟蹤任務恢複情況。兩項能力均由Data Integration Data Agent 執行,將重複的人工排查轉變為自動執行的周期性檢查與即時響應。
能力總覽
智能巡檢任務與智能營運值守分別覆蓋營運的日常與突發,可按需單獨使用或配合使用。
能力 | 定位 | 觸發方式 | 核心產出 |
智能巡檢任務 | 周期性主動檢查 | 按設定的運行頻率定時運行,也可手動立即執行 | 帶歸因診斷的結果詳情報告 |
智能營運值守 | 即時事件響應 | 任務命中情境中配置的事件與閾值時觸發 | 值守記錄與恢複跟蹤結論 |
智能巡檢任務面向Data Integration同步任務的營運情境,入口位於Data Integration左側導覽列的 AI Native 分組下。如果環境中未看到該分組,說明當前環境暫未開放此能力。
準備工作
首次使用智能巡檢任務與智能營運值守,需完成以下準備:
進入 DataWorks Data Integration控制台。
從左側導覽列找到 AI Native 下的 Data Agent。
若當前帳號尚未開通 Data Agent,可根據介面指引進行購買,購買成功後即可進入Data Integration Data Agent 介面。
首次使用Data Integration Data Agent 時,請確保當前租戶下的 Serverless 資源群組至少有 2 CU 的剩餘資源額度;若無資源群組,需要建立 Serverless 資源群組。
智能巡檢任務與智能營運值守均由 Data Agent 執行,運行過程會產生 Token 消耗。巡檢任務的運行記錄會展示每次啟動並執行 Token 消耗,便於跟蹤使用方式。Token 消耗量級與計費方式,請參見費用說明。
智能巡檢任務
智能巡檢任務是由 Data Agent 建立和管理的自動化巡檢任務。選定巡檢情境並設定運行頻率後,Data Agent 按周期檢查同步任務的健全狀態,並將結論寫入可線上查看、可下載的結果詳情報告。
內建巡檢情境
工作清單頁頂部提供推薦情境卡片,覆蓋即時同步與離線同步的常見營運訴求。每個卡片展示情境名稱、情境描述與預設運行頻率,單擊卡片即可用該情境的模板建立巡檢任務。
情境 | 關注點 | 預設運行頻率 |
即時同步延遲巡檢 | 運行中即時任務的業務延遲與訊息積壓,展示當前值、近 24 小時趨勢及超閾值延遲事件。 | 每小時 |
即時同步異常與恢複巡檢 | 即時任務在當前自然小時內的 Failover 與運行失敗,重點關注短期重複異常與未恢複任務。 | 每小時 |
即時同步空間資源水位巡檢 | 當前工作空間內即時同步任務的 CU、記憶體水位與剩餘容量。 | 每小時 |
離線同步昨日健康處置巡檢 | 昨天離線同步的整體健康情況,給出需要處理的新增失敗任務與已恢複任務。 | 每天 |
離線同步運行波動巡檢 | 對比昨天與前天的整體運行變化,定位異常增長時段與共性影響範圍。 | 每天 |
離線同步昨日資料量異常巡檢 | 昨天成功啟動並執行離線任務,資料量是否出現清零、明顯下降或異常增長。 | 每天 |
資料來源任務異常巡檢 | 按資料來源彙總任務異常,識別串連、鑒權、網路或讀寫問題是否同時影響多個任務。 | 每小時 |
進入智能巡檢任務
登入 DataWorks 控制台,進入目標工作空間後開啟Data Integration。
在Data Integration左側導覽列,選擇 AI Native > 智能巡检任务,進入智能巡檢工作清單頁。
建立智能巡檢任務
智能巡檢任務支援三種建立方式,可根據使用習慣選擇:
使用推薦情境卡片:適用於開箱即用的常見巡檢情境。在列表頁頂部的推薦情境卡片區,單擊目標卡片,系統會以情境模板自動預填建立表單(包括任務名稱、描述、任務內容與運行頻率),確認或調整後即可完成建立。
通过 Agent 聊天创建:適用於用自然語言描述巡檢訴求的情境。在工作清單頁,單擊新建智能巡检任务,從下拉式功能表中選擇通过 Agent 聊天创建,通過 Data Agent 交談視窗描述希望巡檢的內容(例如巡檢哪些同步任務、關注哪些運行指標),由 Data Agent 協助產生並落地巡檢任務。
手动创建:適用於需要完全自訂巡檢內容、運行頻率與資源群組的情境。在工作清單頁,單擊新建智能巡检任务,從下拉式功能表中選擇手动创建,開啟手动创建智能巡检任务對話方塊,按下表配置後提交。
配置項 | 是否必填 | 說明 |
任务名称 | 是 | 巡檢任務的名稱,最長 50 個字元,需符合任務命名規則。 |
描述 | 否 | 任務的用途說明,便於識別列表中的任務。 |
资源组 | 是 | 選擇調度模組的 Serverless 資源群組,用於執行巡檢任務。 |
运行频率 | 是 | 任務的調度周期,支援一次性、每小時、每天、每周、每月與自訂 Cron 運算式,預設為每天 08:00。 |
任务内容 | 是 | 用自然語言描述需要巡檢的內容,由 Data Agent 在每次運行時解析並執行。例如:對專案下所有同步任務進行健康巡檢,檢查任務狀態、同步延遲和資源佔用情況。 |
建立成功後,頁面自動返回工作清單,即可看到新建立的任務。
管理智能巡檢任務
列表頁頂部展示推薦情境卡片區,提示推荐场景,点击即可快速创建;下方為工作清單,統一管理已建立的全部巡檢任務。工作清單展示以下資訊,並支援按任務名稱、ID 或描述搜尋:
列 | 說明 |
任务名称 / ID | 任務名稱與唯一標識,單擊任務名稱可跳轉到該任務的運行記錄。 |
自动调度 | 自動調度的開啟狀態,取值為已开启或未开启。 |
运行频率 | 任務的調度周期,以可讀描述展示。 |
描述 | 任務的用途說明。 |
资源组 | 執行該任務的資源群組名稱。 |
修改时间 | 任務最近一次修改的時間。 |
每個任務支援以下操作:
开启自动调度 / 关闭自动调度:控制任務是否按設定的運行頻率定時執行。未配置運行頻率的任務無法開啟自動調度,需先進入任務詳情,配置運行頻率。
任务详情:查看並編輯任務的基本資料、調度配置、運行資源與任務內容。
运行记录:查看任務的歷史運行記錄與每次啟動並執行結果詳情報告。
更多菜單包含以下操作:
立即执行:不等待調度周期,立即觸發一次任務運行。如果任務內容中包含調度參數變數,執行前需要填寫各變數的替換值。
克隆:基於當前任務建立一個新任務,需填寫新任務名稱。
删除:刪除任務。刪除後不可恢複,請謹慎操作。
查看任務詳情
在工作清單的操作列單擊任务详情,進入任務詳情頁。詳情頁包含四個地區:
基本信息:展示任務名稱、任務 ID、修改時間與描述,支援編輯。
调度配置:管理自动调度開關與运行频率。
运行资源:展示並更改任務使用的資源群組。
任务内容:展示 Data Agent 每次運行時執行的任務內容,支援直接手動編輯;也可以單擊頁頭的智能編輯,通過與 Data Agent 對話的方式修改任務內容,隨業務變化持續調整巡檢範圍。
查看運行記錄
在工作清單的操作列單擊运行记录,進入運行記錄頁。頁面分為三個地區,選中目標歷史運行記錄後,可查看該次啟動並執行運行概覽與結果詳情報告:
历史运行记录:位於頁面左側,展示該任務的運行總次數與全部運行記錄。每條記錄包含運行狀態(运行中、未运行、失败、完成)、觸發方式(手动触发或定时触发)、耗時、開始時間與結束時間(未啟動並執行記錄展示預計執行時間)、运行实例 ID 與本次啟動並執行 Token 消耗。支援按運行狀態篩選記錄。
运行概览:位於頁面右上,展示所選運行記錄的运行实例 ID、运行状态、资源组、开始时间、结束时间、耗时、触发方式與 Token 消耗。在此可以單擊运行日志查看作業記錄,單擊查看完整对话查看 Data Agent 本次啟動並執行完整對話記錄;任務運行中時,還可以單擊停止終止本次運行。運行失敗時,可通過作業記錄與完整對話記錄定位失敗原因。
结果详情报告:位於頁面右下,展示本次運行產生的巡檢報告。報告由服務端產生後直接在頁面內預覽,可以單擊新窗口打开,通過新瀏覽器標籤頁查看,或單擊下载將報告儲存到本地,便於在團隊內流轉和歸檔。
結果詳情報告的內容
報告內容隨巡檢情境不同而變化。以離線同步昨日健康處置巡檢為例,一份報告包含以下四部分:
健康摘要與總覽:統計視窗內完結的執行個體數、成功與失敗數量、成功率與失敗率,並配可視化佔比圖,同時明確列出進入關注清單、仍需處理的任務數量。
任務維度歸因診斷:對每個待核查任務做歸因分類,區分新增失敗、持續失敗、基準不足等類型;並按統計視窗結束到報告產生時間內的最新執行個體終態,判定恢複狀態,取值包括視窗後仍失敗需處理、視窗後已恢複無需處理、視窗後重跑中待觀察、失敗後未再運行需確認。
共性歸因:識別同源失敗,例如多個任務因同一張表或同一個欄位的問題同時失敗。此時優先核對該類配置項,修正後可一併重跑,不必逐個任務排查。
深度診斷根因與處理建議:針對每個失敗任務,給出失敗方向(例如 MySQL 到 MaxCompute)、資源群組、首次與最近失敗時間、失敗時段分布、上一日狀態、表面報錯,以及根因判斷與可執行檔處理建議。
智能營運值守
智能營運值守面向即時鏈路與離線鏈路的異常響應。選擇值守情境並應用到任務後,任務命中情境中配置的事件時,系統會自動收集運行資訊、分析原因,並持續跟蹤任務的恢複情況。
[需要確認:智能營運值守的控制台入口路徑(在Data Integration左側導覽列中的具體位置、是否與智能巡檢任務同屬 AI Native 分組),以及使用前提(是否需要指定資源群組、是否需要額外開通)。]
情境與事件的關係
值守以情境為嵌入式管理單元,一個情境是一組事件的集合。配置順序如下:
定義情境適用的任務類型,確定該情境可以應用到哪些同步任務。
在情境內配置多個監控事件,並為每個事件設定各自的觸發閾值。
將情境應用到具體的同步任務。應用後,還可以針對單個任務單獨覆蓋事件閾值,實現重點任務的精細化調整。
[需要確認:建立自訂值守情境、配置事件閾值、將情境應用到任務,以及為單個任務覆蓋閾值的具體介面操作步驟與配置項說明。]
內建值守情境
系統提供以下內建值守情境,可直接應用到符合適用類型的同步任務:
值守情境 | 適用任務類型 | 監控事件 | 觸發後的自動分析 |
即時同步延遲值守 | 整庫即時同步任務、單表即時同步任務 | 業務延遲持續超限 | 自動分析源端、同步鏈路與目標端,定位可能的效能瓶頸。 |
即時同步運行值守 | 整庫即時同步任務、單表即時同步任務 | 即時同步任務運行失敗;頻繁發生容災切換(Failover) | 自動分析異常原因。 |
離線同步運行值守 | 整庫離線同步任務 | 整庫離線同步任務運行失敗;離線增量執行個體執行失敗 | 自動收集運行資訊並給出處理建議。 |
無論命中哪個事件,值守都會在完成分析後持續跟蹤任務的恢複情況,直至任務恢複。
查看值守記錄
每次觸發的值守事件都會沉澱為一條值守記錄,形成可回溯的營運台賬。單條記錄展示觸發時間、命中事件的任務、命中的具體事件、分析結論與當前是否已恢複,便於事後複盤與責任對齊。
[需要確認:值守記錄列表的完整欄位、篩選與搜尋條件,以及記錄詳情中的分析結論展示形式(是否與巡檢報告一致,支援新視窗開啟與下載)。]
情境選擇建議
根據營運訴求選擇巡檢情境,需要異常發生時立即響應的鏈路可再搭配對應的值守情境:
營運訴求 | 推薦巡檢情境 | 建議搭配的值守情境 |
大促等高峰期保障即時數倉鏈路,訂單、支付、物流資料的延遲會直接影響即時大屏與營運決策。 | 即時同步延遲巡檢 | 即時同步延遲值守、即時同步運行值守 |
淩晨完成離線批處理日切,需要在上班時直接獲得昨夜的失敗任務、已恢複任務與仍需處理的任務清單。 | 離線同步昨日健康處置巡檢 | 離線同步運行值守 |
大量任務共用同一批資料來源,資料庫密碼變更、網路抖動或許可權調整可能導致一批任務同時報錯,需要判斷異常是否來自同一資料來源。 | 資料來源任務異常巡檢 | 無 |
防範誤改過濾條件、刪除欄位等配置變更導致任務跑空或報錯,需要在影響下遊前發現。 | 離線同步昨日資料量異常巡檢、離線同步運行波動巡檢 | 無 |
即時同步長期佔用 CU 與記憶體資源,水位過高會觸及容量上限影響任務穩定,過低則意味著資源浪費,需要擴容與成本最佳化依據。 | 即時同步空間資源水位巡檢 | 無 |
費用說明
智能巡檢任務與智能營運值守由 Data Agent 調用大模型完成分析,當前使用的模型為 DeepSeek-v4-flash,按模型的 Token 用量計費,計費單價請參見模型調用計費。典型消耗量級如下:
能力 | 統計口徑 | Token 消耗 | 參考費用 |
智能巡檢任務 | 單個巡檢任務運行一次 | 約 50 萬 Token | 約 1 元 |
智能營運值守 | 單個值守情境觸發一天 | 約 1 億 Token | 約 100 元 |
上述 Token 消耗與費用為典型情境下的估算值,實際消耗隨巡檢內容的複雜度、任務數量與事件觸發頻率變化。費用以實際支付金額為準。
巡檢任務的每次運行都會在運行記錄中展示該次啟動並執行實際 Token 消耗,可據此核對用量。