Data Integration の同期タスクが本番稼働すると、実行の遅延、タスクの失敗、リソース使用率の変動などの問題には、継続的な追跡が必要です。インテリジェント巡回タスクは、設定された実行頻度で同期タスクの実行ステータスを能動的にチェックし、実行ごとに根本原因診断を含む結果詳細レポートを生成します。O&M 監視は、異常イベントが発生した際に自動的に実行情報を収集して原因を分析し、タスクの復旧を継続的に追跡します。これらの機能は両方とも Data Integration データエージェントが実行し、反復的な手動トラブルシューティングを自動化された定期チェックとリアルタイム応答に変えます。
機能概要
インテリジェント巡回タスクと O&M 監視は、それぞれ定型および非定型の O&M ニーズをカバーします。必要に応じて、これらを個別に使用することも、組み合わせて使用することもできます。
機能 | 位置づけ | トリガー方法 | 主要な出力 |
インテリジェント巡回タスク | 定期的な能動的なチェック | 設定された実行頻度でスケジュール実行、または手動でトリガー可能 | 根本原因診断を含む結果詳細レポート |
O&M 監視 | リアルタイムのイベント応答 | タスクが、シナリオで設定されたイベントと閾値に合致した際にトリガー | 監視記録と復旧追跡の結論 |
インテリジェント巡回タスクは、Data Integration の同期タスクの O&M シナリオに適用されます。エントリポイントは、Data Integration の左側メニューにある AI ネイティブ グループ内にあります。このグループが表示されない場合、現在の環境ではこの機能は利用できません。
前提条件
インテリジェント巡回タスクと O&M 監視を初めて使用する前に、以下の準備を完了してください。
DataWorks の Data Integration コンソール に移動します。
左側メニューで、[AI Native] の下にある [Data Agent] を見つけます。
お使いのアカウントで [Data Agent] が有効化されていない場合は、画面の指示に従って購入してください。購入が完了すると、Data Integration データエージェントのページにアクセスできます。
Data Integration データエージェントを初めて使用する前に、テナント内のサーバーレスリソースグループに少なくとも 2 CU の利用可能なリソースクォータがあることを確認してください。リソースグループが存在しない場合は、サーバーレスリソースグループを作成します。
インテリジェント巡回タスクと O&M 監視はどちらも Data Agent が実行し、実行ごとにトークンを消費します。巡回タスクの実行記録には、各実行のトークン消費量が表示され、追跡が容易になります。トークンの消費規模と課金については、「課金」をご参照ください。
インテリジェント巡回タスク
インテリジェント巡回タスクは、Data Agent が作成および管理する自動化された巡回タスクです。巡回シナリオを選択して実行頻度を設定すると、Data Agent は定期的に同期タスクの実行ステータスをチェックし、結論を結果詳細レポートに書き込みます。このレポートはオンラインで表示したり、ダウンロードしたりできます。
組み込みの巡回シナリオ
タスク一覧ページの上部には、推奨シナリオカードが表示され、リアルタイム同期とバッチ同期の一般的な O&M ニーズをカバーしています。各カードには、シナリオ名、シナリオの説明、デフォルトの実行頻度が表示されます。カードをクリックすると、シナリオテンプレートを使用して巡回タスクを作成できます。
シナリオ | 焦点 | デフォルトの実行頻度 |
リアルタイム同期の遅延巡回 | 実行中のリアルタイムタスクのビジネス遅延とメッセージバックログ。現在の値、過去 24 時間の傾向、閾値を超えた遅延イベントを含みます。 | 毎時 |
リアルタイム同期の例外と復旧巡回 | 現在の正時内におけるリアルタイムタスクのフェイルオーバーと実行失敗。短期的に繰り返される例外と未復旧のタスクに焦点を当てます。 | 毎時 |
リアルタイム同期ワークスペースのリソース使用率巡回 | 現在のワークスペースにおけるリアルタイム同期タスクの CU とメモリの使用率および残存キャパシティ。 | 毎時 |
バッチ同期の前日の正常性と修復の巡回 | 前日のバッチ同期タスクの全体的な正常性。注意が必要な新規失敗タスクと復旧済みタスクを一覧表示します。 | 毎日 |
バッチ同期の実行変動巡回 | 前日と前々日の全体的な実行変動を比較し、異常な増加が見られる時間帯と共通の影響範囲を特定します。 | 毎日 |
バッチ同期の前日のデータ量異常巡回 | 前日に成功したバッチタスクのデータ量がゼロに減少したか、大幅に減少したか、または異常に増加したかどうか。 | 毎日 |
データソースタスクの例外巡回 | データソースごとにタスクの例外を集約し、接続、認証、ネットワーク、または読み取り/書き込みの問題が複数のタスクに同時に影響しているかどうかを特定します。 | 毎時 |
インテリジェント巡回タスクへの移動
DataWorks コンソール にログインし、ワークスペースに移動してから、Data Integration を開きます。
Data Integration の左側メニューで、AI ネイティブ > 定期タスク を選択し、インテリジェント巡回タスク一覧ページに移動します。
インテリジェント巡回タスクの作成
要件に応じて、以下のいずれかの方法でインテリジェント巡回タスクを作成できます。
推奨シナリオカードの使用:すぐに使える一般的な巡回ニーズに適用できます。一覧ページ上部の推奨シナリオカードエリアで、使用したいカードをクリックします。システムがタスク名、説明、タスク内容、実行頻度を含むシナリオテンプレートを作成フォームに事前入力します。設定を確認または調整して作成を完了します。
[Agent チャットによる作成]:巡回ニーズを自然言語で記述したい場合に適用できます。タスク一覧ページで 定期タスクの新規作成 をクリックし、ドロップダウンメニューから Agent チャットによる作成 を選択します。Data Agent のチャットウィンドウで、どの同期タスクを巡回するか、どの実行メトリクスに注目するかなど、巡回したい内容を記述します。Data Agent が巡回タスクの生成と作成を支援します。
[手動作成]:巡回内容、実行頻度、リソースグループを完全にカスタマイズする必要がある場合に適用できます。タスク一覧ページで 定期タスクの新規作成 をクリックし、ドロップダウンメニューから 手動作成 を選択します。定期タスクの手動作成 ダイアログボックスで、次の表で説明されているパラメーターを設定し、タスクを送信します。
パラメーター | 必須 | 説明 |
[タスク名] | はい | 巡回タスクの名前。名前は最大 50 文字で、タスクの命名規則に従う必要があります。 |
[説明] | いいえ | タスクの説明。タスク一覧でタスクを識別するのに役立ちます。 |
[リソースグループ] | はい | 巡回タスクの実行に使用するサーバーレスリソースグループを選択します。 |
[実行頻度] | はい | タスクのスケジューリングサイクル。有効な値は、1 回、毎時、毎日、毎週、毎月、カスタム Cron 式です。デフォルト値:毎日 08:00。 |
[タスク内容] | はい | 巡回内容を自然言語で記述します。Data Agent は実行ごとにこの説明を解析して実行します。例:プロジェクト内のすべての同期タスクに対して正常性巡回を実行します。タスクのステータス、同期の遅延、リソース使用状況を確認します。 |
タスクが作成されると、ページは自動的にタスク一覧に戻り、新しく作成されたタスクが表示されます。
インテリジェント巡回タスクの管理
タスク一覧ページの上部には、「[推奨シナリオをクリックして、素早く作成できます。]」というヒントが付いた推奨シナリオカードが表示されます。カードの下にはタスク一覧があり、作成したすべての巡回タスクを一元管理します。タスク一覧には以下の情報が表示され、タスク名、ID、または説明で検索できます。
列 | 説明 |
[タスク名 / ID] | タスク名と一意の識別子。タスク名をクリックすると、そのタスクの実行履歴に移動します。 |
[自動スケジューリング] | 自動スケジューリングのステータス。有効な値は 有効 と 無効 です。 |
[実行頻度] | タスクのスケジューリング頻度。人間が判読可能な説明で表示されます。 |
[説明] | タスクの目的の説明。 |
[リソースグループ] | タスクを実行するリソースグループの名前。 |
[変更日時] | タスクが最後に変更された日時。 |
各タスクでは、以下の操作がサポートされています。
自動スケジューリングの有効化 / 自動スケジューリングのシャットダウン:設定された実行頻度でタスクを定期的に実行するかどうかを制御します。実行頻度が設定されていないタスクでは、自動スケジューリングを有効にできません。まずタスク詳細に移動して実行頻度を設定する必要があります。
タスク詳細:基本情報、スケジューリング設定、ランタイムリソース、タスク内容を表示および編集します。
実行レコード:過去の実行記録と各実行の結果詳細レポートを表示します。
その他 メニューには、以下の操作が含まれています。
今すぐ実行:次のスケジュールサイクルを待たずに、タスクの実行をすぐにトリガーします。タスク内容にスケジューリングパラメーター変数が含まれている場合、タスクを実行する前に各変数の置換値を指定する必要があります。
クローン:現在のタスクに基づいて新しいタスクを作成します。新しいタスクの名前を指定する必要があります。
削除:タスクを削除します。この操作は元に戻せません。注意して進めてください。
タスク詳細の表示
タスク一覧の **[操作]** 列で、タスク詳細 をクリックしてタスク詳細ページに移動します。詳細ページには 4 つのセクションがあります。
[基本情報]:タスク名、タスク ID、最終変更日時、説明を表示します。これらのフィールドは編集できます。
[スケジューリング設定]:自動スケジューリング トグルと 実行頻度 設定を管理します。
[実行中のリソース]:タスクが使用するリソースグループを表示し、変更できます。
[タスク内容]:Data Agent が各実行時に実行するタスク内容を表示します。内容を手動で直接編集するか、ページ上部の インテリジェント編集 をクリックして Data Agent との対話を通じてタスク内容を変更し、ビジネスの進化に合わせて巡回範囲を継続的に調整できます。
実行記録の表示
タスク一覧の **[操作]** 列で 実行レコード をクリックし、実行記録ページに移動します。ページは 3 つのエリアに分かれています。過去の実行記録を選択すると、その実行の実行概要と結果詳細レポートを表示できます。
[実行履歴]: ページの左側にあり、このエリアにはタスクの実行総数とすべての実行記録が表示されます。各レコードには、実行ステータス (実行中、未実行、失敗、完了)、トリガーメソッド (手動トリガー または 定時トリガー)、期間、開始時刻、終了時刻 (未実行 ステータスのレコードには推定実行時間が表示されます)、実行中のインスタンス ID、および実行の Token 消費 が含まれます。実行ステータスでレコードをフィルターできます。
[稼働概要]:ページの右上エリアにあり、選択した実行記録の 実行中のインスタンス ID、実行状態、リソースグループ、開始時間、終了時間、所要時間、トリガー方式、Token 消費 を表示します。このセクションでは、運用ログ をクリックして実行ログを表示したり、会話の全文を表示 をクリックして実行の Data Agent の完全な会話ログを表示したりできます。タスクの実行中に 停止 をクリックして現在の実行を終了することもできます。実行が失敗した場合、実行ログと完全な会話ログを使用して失敗の原因を特定できます。
[結果の詳細レポート]:ページの右下エリアにあり、実行によって生成された巡回レポートを表示します。サーバー上でレポートが生成されると、ページに直接プレビューが表示されます。新しいウィンドウで開く をクリックして新しいブラウザタブでレポートを表示したり、ダウンロード をクリックしてレポートをローカルに保存し、チーム内で共有およびアーカイブしたりできます。
結果詳細レポートの内容
レポートの内容は、巡回シナリオによって異なります。以下の例では、バッチ同期の前日の正常性と修復の巡回シナリオを使用しています。レポートには、以下の 4 つのセクションが含まれています。
正常性のサマリーと概要:統計期間内に完了したインスタンスの数、成功と失敗の数、成功率と失敗率を視覚的な割合グラフと共に表示します。また、ウォッチリストに追加され、まだ対応が必要なタスクの数を明示的にリストアップします。
タスクレベルの根本原因診断:レビュー対象の各タスクの根本原因を分類し、新規の失敗、継続的な失敗、ベースライン不足などのタイプを区別します。統計期間の終了からレポート生成時刻までの最新のインスタンスの最終ステータスに基づいて、復旧ステータスが判断されます。可能な値には、期間後も失敗が継続しており対応が必要、期間後に復旧したため対応不要、期間後に再実行中のため要観察、後続の実行がなく失敗状態のため確認が必要、などがあります。
共通の根本原因分析:同じ根本原因を共有する障害を特定します。たとえば、同じテーブルや同じフィールドの問題により、複数のタスクが同時に失敗する場合があります。この場合、関連する設定項目を優先的に検証します。問題を修正した後、各タスクを個別にトラブルシューティングするのではなく、影響を受けたタスクをまとめて再実行できます。
詳細な根本原因診断と推奨アクション:失敗した各タスクについて、同期方向 (例:MySQL から MaxCompute)、リソースグループ、初回および最新の失敗時刻、失敗時刻の分布、前日のステータス、表面的なエラーメッセージ、根本原因分析、および実行可能な推奨事項を提供します。
O&M 監視
O&M 監視は、リアルタイムおよびオフラインのデータ同期パイプラインにおける異常に対応するために設計されています。監視シナリオを選択してタスクに適用すると、シナリオで設定されたイベントがトリガーされたときに、システムは自動的にランタイム情報を収集し、根本原因を分析し、タスクの復旧ステータスを継続的に追跡します。
[要確認:インテリジェント O&M ウォッチのコンソールエントリパス (Data Integration の左側のナビゲーションペインにおける具体的な場所、およびインテリジェント点検タスクと同じ AI Native グループに属するかどうか)、および前提条件 (リソースグループが必要かどうか、および追加の有効化が必要かどうか)。]
シナリオとイベントの関係
O&M 監視はシナリオによって管理されます。シナリオはイベントの集合です。設定手順は以下の通りです。
シナリオに適用可能なタスクタイプを定義し、どの同期タスクにシナリオを適用できるかを決定します。
シナリオ内に複数の監視イベントを設定し、各イベントのトリガー閾値を設定します。
特定の同期タスクにシナリオを適用します。シナリオが適用された後、個々のタスクのイベント閾値を上書きして、重要なタスクの監視を微調整できます。
[要確認: カスタム監視シナリオの作成、イベントしきい値の設定、タスクへのシナリオの適用、および個々のタスクのしきい値の上書きに関する詳細な UI 操作手順と設定項目の説明。]
組み込みの監視シナリオ
システムは、適用可能なタイプの同期タスクに直接適用できる、以下の組み込みの監視シナリオを提供します。
監視シナリオ | 適用可能なタスクタイプ | 監視イベント | トリガー後の自動分析 |
リアルタイム同期の遅延監視 | データベース全体のリアルタイム同期タスク、単一テーブルのリアルタイム同期タスク | ビジネス遅延が継続的に閾値を超える | ソース、同期リンク、デスティネーションを自動的に分析し、潜在的なパフォーマンスのボトルネックを特定します。 |
リアルタイム同期の実行監視 | データベース全体のリアルタイム同期タスク、単一テーブルのリアルタイム同期タスク | リアルタイム同期タスクが失敗する、頻繁なフェイルオーバーが発生する | 例外の原因を自動的に分析します。 |
バッチ同期の実行監視 | データベース全体のバッチ同期タスク | データベース全体のバッチ同期タスクが失敗する、バッチ増分インスタンスが失敗する | 実行情報を自動的に収集し、対処の提案を提供します。 |
どのイベントが一致したかに関わらず、監視は分析完了後もタスクが復旧するまで継続的に追跡します。
監視記録の表示
トリガーされた各監視イベントは監視記録として記録され、追跡可能な O&M 台帳を形成します。各記録には、トリガー時刻、イベントに一致したタスク、一致した特定のイベント、分析の結論、およびタスクが復旧したかどうかが表示されます。これにより、事後レビューと責任の所在の明確化が容易になります。
[要確認: 監視レコードリストの全フィールド、フィルター条件、検索条件、およびレコード詳細における分析結果の表示形式(検査レポートとの整合性、および新しいウィンドウで開くこととダウンロードの可否)。]
シナリオ選択の推奨事項
O&M 要件に基づいて巡回シナリオを選択します。例外発生時に即時対応が必要なパイプラインについては、対応する監視シナリオをさらに設定できます。
O&M 要件 | 推奨される巡回シナリオ | 推奨される監視シナリオ |
大規模なプロモーションなどのピーク期間中に、リアルタイムデータウェアハウスパイプラインを保護することが求められます。注文、支払い、物流データの遅延は、リアルタイムダッシュボードと運用上の意思決定に直接影響します。 | リアルタイム同期の遅延巡回 | リアルタイム同期の遅延監視、リアルタイム同期の実行監視 |
オフラインのバッチ処理の日次ジョブが早朝に完了した後、業務開始時に失敗したタスク、復旧したタスク、およびまだ注意が必要なタスクのリストが必要です。 | バッチ同期の前日の正常性と修復の巡回 | バッチ同期の実行監視 |
多くのタスクが同じデータソースセットを共有しています。データベースのパスワード変更、ネットワークのジッター、または権限の調整により、多数のタスクが同時に失敗する可能性があります。例外が同じデータソースから発生しているかどうかを判断する必要があります。 | データソースタスクの例外巡回 | なし |
フィルター条件の偶発的な変更、フィールドの削除、またはその他の設定変更により、タスクが空の結果を返すか失敗する可能性があります。下流のタスクが影響を受ける前に、このような問題を検出する必要があります。 | バッチ同期の前日のデータ量異常巡回、バッチ同期の実行変動巡回 | なし |
リアルタイム同期タスクは、継続的に CU とメモリリソースを消費します。使用率が過度に高いと容量制限に達してタスクの安定性に影響を与える可能性があり、一方、使用率が過度に低いとリソースの無駄を示します。容量拡張とコスト最適化の決定をサポートするデータが必要です。 | リアルタイム同期ワークスペースのリソース使用率巡回 | なし |
課金
インテリジェント巡回タスクと O&M 監視は Data Agent が提供し、大規模言語モデルを呼び出して分析を実行します。現在使用されているモデルは DeepSeek-v4-flash であり、トークン使用量に基づいて課金されます。料金の詳細については、「モデル推論の料金設定」をご参照ください。一般的な消費レベルは以下の通りです。
機能 | 測定単位 | トークン消費量 | 概算コスト |
インテリジェント巡回タスク | 単一の巡回タスクの 1 回の実行 | 約 500,000 トークン | 約 1 CNY |
O&M 監視 | 単一の監視シナリオが 1 日にトリガーされた場合 | 約 100,000,000 トークン | 約 100 CNY |
上記のトークン消費量とコストは、一般的なシナリオでの推定値です。実際の消費量は、巡回内容の複雑さ、タスクの数、イベントトリガーの頻度によって異なります。コストは、実際の請求額が適用されます。
巡回タスクの各実行では、実際のトークン消費量が実行記録に表示され、使用状況を確認できます。