定期的な統合およびコンピューティングタスクは、スケジュールされたランタイムにインスタンスを生成します。これらのインスタンスは、実行ログの表示、再実行、現在または下流インスタンスの強制再実行、ノードコードの表示などによって管理できます。このトピックでは、統合およびコンピューティングタスクインスタンスの表示および管理方法について説明します。
前提条件
ガントチャートを表示するには、インテリジェント O&M 付加価値サービスを購入し、現在のテナントでインテリジェント O&M モジュールを有効にする必要があります。
統合およびコンピューティングインスタンスへのアクセス
Dataphin ホームページの上部のナビゲーションバーで、[開発] > [タスク O&M] を選択します。
左側のナビゲーションウィンドウで、[インスタンス O&M] > [定期インスタンス] を選択します。
上部のナビゲーションバーで、本番環境または開発環境を選択します。
[定期インスタンス] ページで、[統合とコンピューティング] タブをクリックします。
インスタンスリストでの操作
定期的な統合およびコンピューティングタスクがインスタンスを生成すると、そのインスタンスは [定期インスタンス] > [統合とコンピューティング] タブのリストに表示されます。リストには、インスタンスオブジェクト、インスタンス ID、ディレクトリ、ステータス、スケジューリング周期、ビジネス日付、スケジュール時刻、開始時刻、終了時刻、持続時間、再試行/自動再試行、優先度、所有者、プロジェクト、関連ベースラインインスタンス、HTTP パス、スケジューリングリソースグループ、タグ、および利用可能な操作など、各インスタンスの情報が表示されます。
[インスタンスオブジェクト]:定期タスクが実行されるたびにインスタンスオブジェクトが生成されます。この列には、インスタンスオブジェクトの名前と ID が表示され、タスクのスケジューリングメソッドが示されます。列名の横にある
アイコンをクリックすると、オブジェクトを名前の昇順または降順でソートできます。詳細については、「定期インスタンスのアイコンの説明」をご参照ください。[ディレクトリ]:インスタンスが生成されたときのタスクディレクトリのスナップショットです。タスクディレクトリが変更されても、この情報は更新されません。ディレクトリ情報は、Dataphin V6.2 へのアップグレード後に生成されたインスタンスに対してのみ表示されます。権限のないディレクトリ内のインスタンスを操作しようとすると、システムはエラーを報告します。
[ステータス]:インスタンスの実行ステータスです。取りうるステータスには、成功、失敗、実行中、スケジュール時刻待ち、スロットリング中、スケジューリングリソース待ち、未実行があります。各ステータスの詳細については、「定期インスタンスの実行ステータスの説明」をご参照ください。
[開始時刻]:インスタンスが実行を開始した時刻です。列名の横にある
アイコンをクリックすると、開始時刻の昇順または降順でソートできます。説明論理テーブルノードの場合、開始時刻はインスタンスオブジェクトの最も早い内部実体化ノードが実行を開始した時刻です。
[終了時刻]:インスタンスが終了した時刻です。列名の横にある
アイコンをクリックすると、終了時刻の昇順または降順でソートできます。説明論理テーブルノードの場合、終了時刻はインスタンスオブジェクトの最も遅い内部実体化ノードが実行を終了した時刻です。
[再試行/自動再試行]:インスタンスの手動および自動再実行の回数です。ここで、
再試行 = 実行回数 - 1です。[持続時間]:開始から終了までの経過時間です。列名の横にある
アイコンをクリックすると、持続時間の昇順または降順でソートできます。説明論理テーブルノードの場合、持続時間は最も早い内部実体化ノードの開始時刻と最も遅いノードの終了時刻の差です。
[優先度]:インスタンスの優先度レベルです。
説明ベースライン機能が有効になっている場合、タスクの優先度は関連するベースラインの最高優先度に設定され、設定された優先度を上書きします。
[プロジェクト]:タスクが属するプロジェクトで、
ProjectEnglishName(ProjectChineseName)のフォーマットで表示されます。[関連ベースラインインスタンス]:インスタンスをエンドポイントノードとして保証するベースライン、および保証範囲内でインスタンスを上流ノードとして含む関連ベースラインです。
説明ベースライン機能が有効になっていない場合、このフィールドは表示されません。
[HTTP パス]:選択された環境に基づいて、Databricks SQL インスタンスの本番環境または開発環境の HTTP パスを表示します。
説明このフィールドは Databricks SQL インスタンスに対してのみ表示されます。他のタスクタイプでは - と表示されます。
[スケジューリングリソースグループ]:インスタンスが実行に使用するスケジューリングリソースグループの名前です。
タスクに指定されたカスタムリソースグループが利用できない場合、プロジェクトのデフォルトリソースグループが使用されます。プロジェクトのデフォルトリソースグループも利用できない場合、テナントのデフォルトリソースグループが使用されます。優先順位は次のとおりです:カスタムリソースグループ > プロジェクトのデフォルトリソースグループ > テナントのデフォルトリソースグループ。
説明プロジェクトのデフォルトリソースグループを変更した後、更新された情報が表示されるまでに遅延が生じることがあります。ただし、タスクの実行には新しく指定されたリソースグループが使用されます。
テナントのデフォルトリソースグループ:このリソースグループはどのプロジェクトにも属しません。各テナントにはデフォルトリソースグループが 1 つだけあります。タスクがカスタムリソースグループを指定せず、プロジェクトにデフォルトのリソースグループがない場合、テナントのデフォルトリソースグループがスケジューリングに使用されます。これは、SQL や仮想タスクなどの専用リソースタスクにのみ適用されます。
次の表に、統合およびコンピューティングタスクインスタンスで利用可能な操作を示します。
操作 | 説明 |
DAG |
|
[実行ログの表示] |
|
[再実行] |
ビジネスシナリオでこのチェックに関わらず再実行が必要な場合は、強制再実行を実行できます。 |
[ガントチャートの表示] |
ガントチャートの詳細については、「クリティカルパスのガントチャートの表示」をご参照ください。 |
[上流および下流ノードのダウンロード] | 現在のノードの上流および下流ノードのリストをダウンロードします。リストには、現在 UI に表示されていない列もすべて含まれます。 [上流および下流ノードのダウンロード] をクリックします。[上流および下流ノードのダウンロード] ダイアログボックスで、上流および下流ノードのレベルを選択します。[レベル 1] から [レベル 10] または [すべてのレベル] を選択できます。両方のデフォルトはレベル 1 です。レベルを選択した後、[OK] をクリックして Excel ファイルのダウンロードを開始します。ファイル名は |
[ノードコードの表示] |
[論理コード]:作成したタスクコードです。 [物理コード]:Flink エンジンで実行するためにコンパイルされたコードです。 |
定期タスク |
|
[開発ノードの編集] |
説明 この操作は、Dev-Prod モードを使用するプロジェクトの統合およびコンピューティングタスクインスタンスでのみ利用できます。 |
[本番ノードの表示] |
説明 この操作は、Dev-Prod モードを使用するプロジェクトの統合およびコンピューティングタスクインスタンスでのみ利用できます。 |
[ノードの編集] |
説明 この操作は、Basic モードを使用するプロジェクトの統合およびコンピューティングタスクインスタンスでのみ利用できます。 |
下流の再実行 |
パイプライン全体を再実行するには、下流インスタンスの強制再実行を使用することを推奨します。詳細については、「下流インスタンスの強制再実行」をご参照ください。 [下流の再実行] 操作は、主に次のようなシナリオで使用されます:
|
[成功に設定してスケジューリングを続行] |
|
終了 |
説明 [成功]、[失敗]、または [未実行] の状態にあるインスタンスは終了できません。他の状態のインスタンスは終了できます。 [終了] 操作は、主に次のようなシナリオで使用されます:
|
[強制再実行] |
重要 強制再実行では、すべての上流ノードが正常に実行されたか、またはインスタンスのスケジュールされたランタイムに達したかはチェックされません。これにより、実行の失敗やデータ品質の問題が発生する可能性があります。続行する前に、下流データに影響がないことを確認してください。 |
[上流依存関係の削除] |
重要 少なくとも 1 つの上流インスタンスを保持する必要があります。 |
[一時停止] |
説明
|
再開 |
|
HTTP パスの変更 | 対応するタスクの本番 HTTP パスを変更します。本番プロジェクトに関連付けられたクラスター用に設定された任意の HTTP パスを選択できます。 説明 この操作は、本番環境で Databricks SQL タスクを選択した場合にのみサポートされます。 |
[スケジューリングリソースグループの変更] |
説明
|
[優先度の変更] |
|
DAG ノードの操作
DAG は、インスタンスノードの上流および下流の依存関係を明確に可視化します。また、システムでは上流および下流のインスタンスノードを管理することもできます。デフォルトでは、DAG はメインノード (選択されたノード) とその第 1 レベルの上流および下流ノードを表示します。統合およびコンピューティングタスクインスタンスノードを選択して、関連する O&M 操作を実行できます。
Dataphin は、異なるプロジェクト間での O&M をサポートしています。別のプロジェクトの統合およびコンピューティングタスクノードで O&M を実行するには、インスタンスが配置されているプロジェクトの表示および操作権限が必要です。
DAG ビューでの操作
操作
説明
親ノードを展開
DAG 内のメインノードの異なるレベルの依存ノードを展開します。
[子ノードの展開]
タスクの表示
現在のインスタンスノードを生成したタスクの DAG に移動します。ここでは、タスクノードの詳細、上流および下流の情報を表示し、O&M を実行できます。詳細については、「定期タスク」をご参照ください。
[操作ログの表示]
このインスタンスで実行された操作のログを表示します。
DAG ノードの操作
DAG ノードにカーソルを合わせると、その名前、タイプ、スケジューリング周期、所有者、および説明が表示されます。統合およびコンピューティングタスクインスタンスの DAG ノードで利用可能な操作は、インスタンスリストの操作と同じです。詳細については、「インスタンスリストでの操作」をご参照ください。
バッチ操作
次の表に、定期的な統合およびコンピューティングタスクでサポートされているバッチ操作を示します。
操作 | 説明 |
[再実行] |
|
終了 |
|
[成功に設定してスケジューリングを続行] | 複数のインスタンスを選択した後、統合およびコンピューティングタスクインスタンスのステータスを [失敗] または [未実行] から [成功] に手動で設定し、スケジューリングを続行できるようにします。 |
[一時停止] |
|
[再開] | [一時停止中] ステータスの複数の定期インスタンスを再開します。 |
[HTTP パスの変更] | 複数の Databricks SQL インスタンスの本番 HTTP パスを変更します。選択したインスタンスが異なる Databricks クラスターに属している場合、各クラスターに異なる HTTP パスを指定できます。対応するクラスター用に設定された任意の HTTP パスを選択できます。 説明 この操作は、本番環境で Databricks SQL インスタンスを選択した場合にのみサポートされます。 |
スケジューリングリソースグループの変更 | インスタンスの実行に使用されるスケジューリングリソースグループを変更します。 説明
|
[優先度の変更] | 選択したインスタンスの優先度を変更します。[最高]、[高]、[中]、[低]、または [最低] を選択できます。 |
[すべてダウンロード] | これをクリックするとダウンロードタスクが送信され、システムはバックグラウンドで非同期にファイルを生成します。生成されると、ファイルは自動的にローカルマシンにダウンロードされます。ファイルは .xlsx 形式で、名前は ファイルには次の情報が含まれます:インスタンスオブジェクト、インスタンス ID、ステータス、スケジューリング周期、ビジネス日付、優先度、所有者、プロジェクト (複数のプロジェクトを持つサマリー論理テーブルの場合、プロジェクト名はカンマで区切られます)、スケジュール時刻、開始時刻、終了時刻、持続時間、再試行/自動再試行、関連ベースラインインスタンス (インスタンスに関連付けられたベースラインの名前、カンマで区切られます)、およびスケジューリングリソースグループ (このフィールドはモデリングタスクインスタンスでは空です)。 |
下流インスタンスの再実行
[下流の再実行] ダイアログボックスで、パラメーターを設定します。
説明[待機中] または [実行中] ステータスの下流インスタンスは再実行できません。パイプライン全体を再実行するには、下流インスタンスの強制再実行を使用することを推奨します。詳細については、「下流インスタンスの強制再実行」をご参照ください。
パラメーター
説明
[開始ノードの実行モード]
開始ノードの実行方法を定義します。[ドライラン] または [通常実行] を選択できます。
[ドライラン]:インスタンスのステータスが [成功] に設定され、通常のスケジューリングが続行されますが、実行ログは空で、持続時間はなく、データは処理されません。
[通常実行]:インスタンスは通常どおりスケジュールされ、実行されます。
下流の再実行範囲
再実行する下流ノードの範囲を選択します。
すべての失敗したインスタンス:システムは、特定のリストを表示することなく、失敗したすべての下流インスタンスを自動的に選択して再実行します。
[カスタム]:再実行する下流インスタンスを指定する必要がある場合は、このオプションを選択します。ノード名または ID で検索し、ステータス、所有者、またはプロジェクトでフィルターできます。
[OK] をクリックします。
下流インスタンスが再実行されると、そのデータが更新されます。
下流インスタンスの強制再実行
[下流の強制再実行] ダイアログボックスで、パラメーターを設定します。
パラメーター
説明
[開始ノードの実行モード]
開始ノードの実行方法を定義します。[ドライラン] または [通常実行] を選択できます。
[ドライラン]:インスタンスのステータスが [成功] に設定され、通常のスケジューリングが続行されますが、実行ログは空で、持続時間はなく、データは処理されません。
[通常実行]:インスタンスは通常どおりスケジュールされ、実行されます。
下流強制再実行の範囲
強制再実行する下流ノードの範囲を選択します。
[すべてのインスタンス]:開始ノードのすべての下流インスタンスを選択します。
[カスタム]:再実行する下流インスタンスを指定する必要がある場合は、このオプションを選択します。ノード名または ID で検索し、ステータス、所有者、またはプロジェクトでフィルターできます。
[OK] をクリックして設定を完了します。