データサンプリングは、ビジネスユーザーがデータパターンをより深く理解し、SQL を開発するのに役立ちます。このトピックでは、データサンプリングの設定方法について説明します。
前提条件
サンプリング設定機能を利用するには、Agile R&D Edition 以上のバージョン、または資産運用機能が有効になっている必要があります。
制限事項
自動データサンプリングは、1,500 以下のフィールドを持つデータテーブルでのみサポートされます。この制限を超えるテーブルは自動的にスキップされます。
権限
スーパー管理者、運用管理者、および [サンプリング設定]-[管理] 権限を持つカスタムグローバルロールは、サンプリング設定を管理できます。
操作手順
Dataphin ホームページの上部ナビゲーションバーで、[ガバナンス] > [メタデータ] を選択します。
左側のナビゲーションウィンドウで、[一般設定] > [サンプリング設定] を選択します。[サンプリング設定] ページでは、計算ソーステーブルとデータソーステーブルのデータサンプリングを個別に設定できます。
基本
ページ下部の [編集] をクリックし、パラメーターを設定します。
パラメーター
説明
データサンプリング
すべてのサンプリング設定のマスタースイッチです。
有効にすると、[基本設定]、[計算ソース]、[データソース] タブで設定を行えます。[計算ソース] と [データソース] タブの自動サンプリング設定を確認し、要件を満たしていることを確認してください。
無効にすると、自動または手動のサンプリングをトリガーできず、関連するシナリオでサンプルデータを使用することもできません。既存のサンプルデータを削除するか、保持するかを選択できます。
[同期的に削除]:既存のすべてのサンプルデータを削除します。
[既存データを保持]:サンプルデータは保持されますが、表示したり使用したりすることはできません。後でサンプリングを再度有効にすると、データは再び利用可能になります。
クエリ設定
自動サンプリングのトリガーシナリオ
データサンプリングクエリを自動的にトリガーするタスクタイプを指定します。サポートされているタイプには、[メタデータ収集]、[データプロファイリング]、[セキュリティ識別ルール/標準-フィールドマッピングルールの実行] があります。システムは、最後のサンプリング時間とサンプリング更新ポリシーに基づいて、新しいサンプリングクエリを開始するかどうかを自動的に決定します。
[データプロファイリング]:データプロファイリングを使用するには、グローバル品質またはドメイン品質機能が有効になっている必要があります。
[セキュリティ識別ルール/標準-フィールドマッピングルールの実行]:セキュリティルールにコンテンツベースの識別が含まれている場合、または標準-フィールドマッピングが認識機能によるインテリジェントマッピング用に設定されている場合は、このオプションを有効にします。そうしないと、各識別タスクが一時的なデータクエリを実行し、大量の計算リソースを消費します。
自動サンプリング更新ポリシー
データサンプリングクエリの更新頻度を制御します。システムは、最後のサンプリング時間 (自動および手動サンプリングの両方から) とこのポリシーを使用して、トリガーシナリオの新しいクエリを開始するかどうかを決定します。固定間隔で更新するか、更新しないかを選択できます。
固定間隔で更新:最後のサンプリングが N 日以上前の場合にデータを再サンプリングします。N は 1 から 60 までの整数です。たとえば、N が 7 の場合、最後のサンプリング成功が 7 日以上前であれば、タスク実行時にシステムはデータを再サンプリングします。
[更新しない]:データを一度だけサンプリングして保存します。最初のサンプリングが成功した場合、データはその後自動的に更新されません。
NULL 値補完
サンプリング後に NULL 値のみを含むフィールドの処理戦略を定義します。補完を実行しないか、NULL 値のみを含むフィールドに対して補完クエリを実行するかを選択できます。
[補完しない]:サンプルデータのフィールドに NULL 値しか含まれていない場合、システムは非 NULL 値を見つけるための別のサンプリングクエリを実行せず、そのフィールドに対して識別も行いません。
[一部のフィールドが NULL の場合に補完クエリを実行]:サンプルデータのフィールドに NULL 値しか含まれていない場合、システムはそのフィールドの非 NULL 値を見つけるために 2 番目のサンプリングクエリを実行します。補完クエリが成功した場合、システムはその結果を次の識別タスクに使用します。失敗した場合、そのフィールドは識別されません。次のコードは例を示しています。
-- 最初のサンプリングクエリは、tableA からフィールド a、b、c を選択します。 select a,b,c from tableA limit 100; -- フィールド 'a' の最初の 100 行がすべて NULL であるため、フィールド 'a' に対して 2 番目のクエリが実行されます。 select distinct a from tableA where a is not null limit 100;重要NULL 値補完は識別精度を向上させることができますが、より多くの計算リソースを消費します。ビジネス要件に基づいてこの設定を行ってください。
NULL 値補完の同時実行数
同時に実行できる NULL 値補完タスクの数を制御します。デフォルトは 30 です。1 から 50 までの整数を入力できます。
ストレージ設定
サンプルストレージ
各フィールドに保存するサンプル値の数を指定します。デフォルトは 100 です。1 から 100 までの整数を入力できます。
使用設定
データプレビュー用
資産インベントリと資産カタログでのデータプレビューにサンプルデータを使用できるようにします。データテーブルにサンプルデータが存在する場合、システムはデフォルトでそれを表示しますが、手動でクエリをトリガーして最新のデータを取得することもできます。サンプルデータが存在しない場合、データプレビュークエリが自動的にトリガーされます。
システムは各フィールドのサンプルデータを個別に保存および表示しますが、元の行レコードの整合性は保証されません。
プレビュー中、システムはまず列レベルのセキュリティとフィールドのデータマスキングポリシーを検証します。アクセス権限のあるフィールドのサンプルデータのみを表示できます。データは行レベルのセキュリティに基づいてフィルタリングされません。
たとえば、テーブル
Aのfield_bにデータマスキングポリシーが設定されているとします。元のデータとサンプルデータは次の図のようになります。
セキュリティ/標準識別用
この設定は、データセキュリティまたはデータ標準機能のいずれかを購入した場合にのみ表示されます。セキュリティルールにコンテンツベースの識別が含まれる場合、または標準-フィールドマッピングが認識機能によるインテリジェントマッピング用に設定されている場合、システムはデフォルトでサンプルデータを使用します。サンプルデータが利用できない場合は、一時的なデータクエリが実行されます。
インテリジェントアプリケーション用
この設定は、少なくとも 1 つのインテリジェントアプリケーションが有効になっている場合にのみ表示されます。[SuperX] > [インテリジェントアプリケーション管理] > [インテリジェントアプリケーション] ページでインテリジェントアプリケーションを編集する際に、サンプルデータの設定を行うことができます。
[OK] をクリックして基本設定を保存します。
計算ソース
自動データサンプリングの対象となるデータテーブルの範囲を設定します。
ページ下部の [編集] をクリックし、パラメーターを設定します。
パラメーター
説明
自動サンプリング
有効にすると、計算ソーステーブルの自動データサンプリングを設定できます。[基本設定] タブで自動サンプリングのトリガーシナリオを変更できます。
自動サンプリング設定
物理テーブルの範囲
すべてのプロジェクト、すべての本番プロジェクト (Basic および Prod)、または特定のプロジェクトを選択することで、自動サンプリングが有効になる物理テーブルと物理ビューの範囲を定義できます。
[すべてのプロジェクト]:既存および将来のプロジェクトを含む、すべてのプロジェクトの物理テーブルとビューに対して自動サンプリングを有効にします。
[すべての本番プロジェクト (Basic および Prod)]:既存および将来のプロジェクトを含む、すべての本番プロジェクトの物理テーブルとビューに対して自動サンプリングを有効にします。
[指定されたプロジェクト]:自動サンプリングを有効にする 1 つ以上のプロジェクトを選択します。
論理テーブルの範囲
すべてのデータボード、すべての本番データボード (Basic および Prod)、または特定のデータボードを選択することで、自動サンプリングの対象となる論理テーブルと論理ビューの範囲を定義できます。
[すべてのビジネスカテゴリ]:既存および将来のビジネスカテゴリを含む、すべてのビジネスカテゴリの論理テーブルとビューに対して自動サンプリングを有効にします。
[すべての本番ビジネスカテゴリ (Basic および Prod)]:既存および将来のビジネスカテゴリを含む、すべての本番ビジネスカテゴリの論理テーブルとビューに対して自動サンプリングを有効にします。
[指定されたビジネスカテゴリ]:自動サンプリングを有効にする 1 つ以上のビジネスカテゴリを選択します。
サンプリング実行
説明これらの設定は、自動サンプリングが無効になっている場合にコンテンツベースの識別のためにトリガーされる自動サンプリングおよび一時的なサンプリングクエリに適用されます。
実行スペース
データサンプリングクエリタスクの計算リソースを選択します。データが存在するプロジェクトのリソース、または指定されたプロジェクトのリソースを使用できます。
[データのソースプロジェクト]:データ資産が配置されているプロジェクトでサンプリングクエリを実行します。
[指定されたプロジェクト]:データ資産の環境に対応する指定されたプロジェクトでサンプリングクエリを実行します。たとえば、開発テーブルのクエリは開発プロジェクトの計算リソースを使用し、本番テーブルのクエリは本番プロジェクトのリソースを使用します。
説明データサンプリングクエリは計算リソースを消費します。データ資産が配置されているプロジェクトを使用することを推奨します。
ソースプロジェクトのリソース負荷とクエリコストを削減し、通常のビジネス運用への干渉を避けるために、別のサブスクリプションプロジェクトなど、サンプリングクエリ専用のプロジェクトまたはキューを割り当てることができます。
選択したプロジェクトの計算ソースで設定されたアカウントに、関連するデータテーブルに対する読み取り権限があることを確認してください。
同時実行数制限
同時に実行できるデータサンプリングクエリの数を制御します。デフォルトは 16 です。1 から 100 までの整数を入力できます。
説明同時実行数制限は、クラスターの安定性を維持し、短期間に大量のクエリが発生することによるシステム障害を防ぐのに役立ちます。
同時実行数制限を増やすと、サンプリングクエリの速度は向上しますが、クラスターへの負荷が高くなります。ビジネス要件に基づいてこの設定を行ってください。
スキャンはクラスターの計算リソースを消費します。
クエリタイムアウト
データサンプリングクエリが指定されたしきい値よりも長く実行された場合、システムは自動的にそれを終了し、失敗としてマークします。この持続時間はアクティブな実行時間を測定し、リソースの待機やスケジューリングに費やされた時間は含まれません。デフォルトは 0.5 時間です。0 から 12 時間までの値を、小数点以下 1 桁まで設定できます。
スキャンブラックアウト期間
有効にすると、開始時刻と終了時刻を設定する必要があります。この指定された期間中、システムは自動的にトリガーされたデータサンプリングクエリを開始せず、代わりに失敗としてマークします。これにより、サンプリングが本番タスクに必要な計算リソースを消費するのを防ぎ、オンラインデータ操作の安定性を確保します。
[OK] をクリックして、計算ソーステーブルのサンプリング設定を保存します。
データソース
[データソース] タブには、データサンプリングをサポートし、メタデータが収集されているデータソースタイプが表示されます。このタブでは、自動データサンプリングを有効にするデータソーステーブルの範囲を設定できます。
各データソースの名前、タイプ、最大タスク同時実行数、自動データサンプリングステータス、クエリタイムアウト、最終変更時刻を表示できます。
データソース名で検索したり、データソースタイプでフィルタリングしたりできます。
ターゲットデータソースのデータサンプリングを設定するには、[操作] 列の [編集] アイコンをクリックします。[サンプリング設定] ダイアログボックスで、パラメーターを設定します。
パラメーター
説明
自動サンプリング範囲
開発/本番環境
このオプションは、データソース設定で対応する環境のメタデータ収集タスクを設定した場合にのみ利用できます。本番環境と開発環境の自動サンプリング範囲を個別に設定できます。有効にすると、データソースタイプに基づいて異なる収集範囲を定義できます。詳細については、「収集範囲」をご参照ください。
サンプリング実行
説明これらの設定は、自動サンプリングが無効になっている場合にコンテンツベースの識別のためにトリガーされる自動サンプリングおよび一時的なサンプリングクエリに適用されます。
同時実行数制限
同時に実行できるデータサンプリングクエリの数を制御します。デフォルトは 16 です。1 から 100 までの整数を入力できます。
説明同時実行数制限は、クラスターの安定性を維持し、短期間に大量のクエリが発生することによるシステム障害を防ぐのに役立ちます。
同時実行数制限を増やすと、サンプリングクエリの速度は向上しますが、クラスターへの負荷が高くなります。ビジネス要件に基づいてこの設定を行ってください。
スキャンはクラスターの計算リソースを消費します。
クエリタイムアウト
データサンプリングクエリが指定されたしきい値よりも長く実行された場合、システムは自動的にそれを終了し、失敗としてマークします。この持続時間はアクティブな実行時間を測定し、リソースの待機やスケジューリングに費やされた時間は含まれません。デフォルトは 0.5 時間です。0 から 12 時間までの値を、小数点以下 1 桁まで設定できます。
スキャンブラックアウト期間
有効にすると、開始時刻と終了時刻を設定する必要があります。この指定された期間中、システムは自動的にトリガーされたデータサンプリングクエリを開始せず、代わりに失敗としてマークします。これにより、サンプリングが本番タスクに必要な計算リソースを消費するのを防ぎ、オンラインデータ操作の安定性を確保します。
[OK] をクリックして、データソーステーブルのサンプリング設定を保存します。