データ分類とグレーディングは、組織のデータ資産全体で機密データを識別し、各フィールドにセキュリティレベルを割り当てます。その結果得られるインベントリは、アクセス制御、データマスキング、アクセス監査を推進し、データセキュリティ全体を強化します。
概要
データ分類とグレーディングは、DataWorks セキュリティセンターにおけるすべてのデータ保護機能の基盤です。これにより、さまざまなデータソースにわたる機密データを自動的に検出し、タグ付けすることができ、「どのような機密データがあるか?」や「それはどこにあるか?」といった重要な問いに答えることができます。
ステップ 1: データ分類とグレーディングルールの設定
まず、機密データを識別するための基準を定義します。これには以下が含まれます。
データ分類:データに
S1(公開) やS2(内部) などの秘密度ラベルを割り当てます。データ分類:データを
個人情報や財務データなどのビジネスカテゴリにグループ化します。データ型:
電話番号やID カード番号など、特定の種類の機密データを定義します。データ型を作成する際には、それを データ分類に割り当て、データグレーディングを指定する必要があります。検出ルール:これは自動検出のコアです。データ型ごとに強力な識別ルールを設定できます。以下のメソッドがサポートされています。
コンテンツによる識別:正規表現や ID カード検証などの組み込みアルゴリズムを使用してデータコンテンツを照合します。
フィールド名/コメントによる識別:正規表現を使用してフィールド名やコメントを照合します。
ステップ 2: 識別タスクの作成
識別タスクを作成して、定義したルールを適用し、MaxCompute や Hologres などの指定されたデータソースをスキャンします。タスクは1 回限りのスキャンとして即時実行することも、継続的なモニタリングのために定期的 (日次、週次、または月次) なスキャンとしてスケジュールすることもできます。
ステップ 3: 識別結果の生成
タスクが完了すると、システムは詳細な識別結果のリストを生成します。これは機密データ資産カタログとして機能します。定期タスクの場合、結果は翌日 (T+1) に利用可能になります。このカタログには、各テーブルのどのフィールドが特定の種類の機密データとして識別されたかがリストされます。不一致が見つかった場合は、結果を修正してカタログの精度を確保できます。
確定した機密データ資産のカタログは、データマスキング、リスク監視、アクセス監査などの下流のセキュリティポリシーの入力として機能します。
制限事項
-
対象ユーザー:この機能は、セキュリティセンターで新しいデータセキュリティ機能が有効になっている DataWorks Standard、Professional、Enterprise の各エディションで利用できます。
-
サポートリージョン:中国 (杭州)、中国 (上海)、中国 (北京)、中国 (張家口)、中国 (ウランチャブ)、中国 (深セン)、中国 (成都)、中国 (香港)、日本 (東京)、シンガポール、インドネシア (ジャカルタ)。
-
サポート対象のコンピュートエンジン:MaxCompute および Hologres。
前提条件
ご利用の Alibaba Cloud アカウントまたは RAM ユーザーは、次のいずれかの条件を満たす必要があります:
-
Alibaba Cloud アカウントまたは RAM ユーザーに AliyunDataWorksFullAccess ポリシーがアタッチされている。
-
Alibaba Cloud アカウントまたは RAM ユーザーに DataWorks のテナントセキュリティ管理者ロールが割り当てられている。
-
Alibaba Cloud アカウントまたは RAM ユーザーに DataWorks のテナント管理者ロールが割り当てられている。
-
新規ユーザーガイドを完了していること。初期設定を完了していない場合、[データ分類とグレーディング] ページにアクセスすると、自動的に新規ユーザーガイドページにリダイレクトされます。まず初期化を完了してから、このページに戻ってください。
機能ページ
DataWorks コンソールにログインします。 対象のリージョンの左側のナビゲーションウィンドウで、 をクリックします。 表示されたページで、移動 セキュリティセンター をクリックします。
左側のナビゲーションウィンドウで、 を選択します。
設定 データ分類
データ分類ページへの移動
[データ分類とグレーディング] ページで、データ分類 タブをクリックします。
左側に データ分類 ツリーが表示され、右側には選択した データ分類 に属する データ型 が表示されます。分類ツリーのブランチをクリックして、関連する データ型 を表示します。その後、[操作] 列からデータ型を 詳細、編集、または 削除 できます。
データ型の追加
重要システムには、データ分類 と データ型 のための組み込みテンプレートが用意されています。必要に応じて編集できます。
データ分類 タブで、左上隅の データ型の追加 をクリックします。
以下のパラメーターを設定します。
パラメーター
説明
データ型
データ型の名前を入力します。名前はグローバルに一意である必要があります。DataWorks は、識別ルールに一致するデータ (フィールド) にこのデータ型でタグ付けします。
データ分類
データ型が属するデータ分類を指定します。
データレベル
このデータ型のセキュリティレベルを指定します。DataWorks は、識別ルールに一致するデータ (フィールド) にこのデータグレーディングでタグ付けします。
検出ルール
識別ルールが満たされると、DataWorks はデータ (フィールド) を識別済みとしてマークします。
3 種類の識別ルールがサポートされています:データコンテンツの検出、フィールド名の検出、および フィールドコメントの検出。各ルールタイプは個別に設定および検証する必要があります。
いずれかのルールを満たす:3 つのルールのいずれかが一致した場合に条件が満たされます。
以下のすべてのルールを満たす:3 つのルールすべてが一致した場合にのみ条件が満たされます。
データ型の説明
ビジネスシナリオに基づいて、データ型のカスタム説明を入力します。
設定完了後、ルールをすぐに適用するか、保存のみかを選択します。
すぐに適用:設定を保存し、識別ルールをすぐに適用します。識別タスクが実行されると、ルールに一致するデータ (フィールド) にこのデータ型でタグ付けします。
保存のみ:設定を保存しますが、識別ルールは有効になりません。識別タスクが実行されても、このデータ型でデータにタグ付けされることはありません。
データ型の削除:組み込みのデータ型ではなく、カスタムのデータ型のみ削除できます。
重要データ型を削除すると、以下の影響があります。
過去の 検出結果 が削除され、新しい 検出ジョブ はこのデータ型を識別しなくなります。
このデータ型のマスキングルールは、マスキングポリシーポリシーから削除されます。
この データ型 の機密データへのアクセスレコードが削除されます。
このタイプに関連するルールは、セキュリティリスク 識別ルールから削除されます。
データ型を削除する際に表示される確認ダイアログボックスには、[MaxCompute フィールドラベルをリセット] オプションがあります。MaxCompute の対応するフィールドのラベルも特定レベルにリセットするかどうかを選択できます。デフォルト値は 0 で、フィールドからラベルをクリアします。一括削除の場合、デフォルト値は選択された項目の中で最も高いセキュリティレベル番号です。この機能は、[MaxCompute ラベルに書き込む] スイッチとは独立しています。スイッチがオフの場合でも、削除時に MaxCompute ラベルをリセットするかどうかを選択できます。
設定 データグレーディング
DataWorks は最大 10 のグレーディングレベルをサポートしています。ビジネスニーズに応じて各レベルの説明を変更できます。数値が大きいほど、セキュリティレベルが高くなります。
データグレーディングページに移動: 「データ分類とグレーディング」ページで、データ分類 タブをクリックします。
データグレーディングの編集:左上隅の 編集 をクリックして、異なるデータグレーディングレベルの 詳細な説明 を変更します。
データグレーディングの保存:詳細な説明を変更した後、左上隅の 保存 をクリックします。
MaxCompute ラベルへの書き込み (MC ラベル同期)
[データグレーディング] タブには、[MaxCompute ラベルに書き込む] 機能があり、DataWorks で識別されたセキュリティレベルを MaxCompute の対応するフィールドのラベルに同期します。これにより、DataWorks と MaxCompute 間のデータセキュリティ制御が統合されます。
この機能は MaxCompute エンジンにのみ適用されます。他のエンジンタイプのフィールドは同期されません。MaxCompute プロジェクトでラベルセキュリティが有効になっている場合、ラベルの変更はそのプロジェクトのデータへのアクセス制御権限に直接影響します。慎重に操作してください。
[MaxCompute ラベルに書き込む] スイッチ:有効にすると、識別タスクが完了した後、またはユーザーが結果を修正した後に、DataWorks はフィールドのセキュリティレベルを対応する MaxCompute フィールドラベルに自動的に書き込みます。無効にすると、ラベルは書き込まれません。
[今すぐ同期]:現在のすべての識別結果を一度に MaxCompute に書き込む、1 回限りの完全なラベル同期をトリガーします。このボタンは、スイッチがオフの場合や同期タスクが進行中の場合は無効になります。確認ダイアログでは、MaxCompute でラベルセキュリティが有効になっている場合、この同期はデータアクセス制御権限に影響するという警告が表示されます。
最終同期日時:最後のラベル同期タスクの実行時刻と同期されたフィールドの数を表示します。同期が実行されていない場合は、レコードなし と表示されます。同期中は、進捗が自動的に更新されます。
データの管理 検出ジョブ
識別タスクページへの移動:[データ分類とグレーディング] ページで、検出ジョブ タブをクリックします。
識別タスクの作成
検出ジョブ タブで、左上隅の タスクを作成 をクリックします。
以下のパラメーターを設定します。
パラメーター
説明
タスク名
データ分類とグレーディング識別タスクのカスタム名。
データソースタイプ
データソースタイプを選択します。MaxCompute と Hologres がサポートされています。
ジョブタイプ
単発タスク:一度だけ実行され、繰り返されません。
定期タスク:スケジュールされた時刻に繰り返し実行されます。
重要定期タスク は新しいデータ (フィールド) のみをスキャンします。ワンタイムタスクを使用して、過去の識別結果を再評価できます。
DataWorks は 1 つの 定期タスク のみをサポートします。
検出範囲
識別タスクのデータ範囲を指定します。最小範囲はデータテーブルです。
データソースタイプ を MaxCompute に設定した場合、プロジェクトまたはデータテーブルを選択できます。
データソースタイプ を Hologres に設定した場合、データベースまたはデータテーブルを選択できます。特定の ワークスペース 内で データソース としてバインドされたインスタンスを選択し、次に リソースグループ を選択してネットワーク接続を検証する必要があります。
サンプル数
識別タスク実行時に各フィールドからサンプリングするデータの量。
サンプルサイズが大きいほど識別精度は向上しますが、タスクの所要時間も長くなります。最大値は 200 です。
データサンプリングの使用
識別タスク中、DataWorks は指定されたアカウントを使用してデータにアクセスします。指定されたアカウントに必要な権限がない場合、サンプリングと識別は失敗します。
重要指定したアカウントが、指定された識別範囲内のテーブル名、フィールド名、フィールドコメント、およびフィールドデータにアクセスする権限を持っていることを確認してください。
パラメーターを設定した後、OK をクリックしてタスクを保存します。
識別タスクの編集
定期的な識別タスクを再設定するには、検出ジョブ タブで、対象タスクの 操作 列にある 編集 をクリックします。
重要ワンタイムタスクは編集できません。タスクを削除して新しいタスクを作成する必要があります。
識別タスクの表示
検出ジョブ タブで、表示したいタスクを見つけ、操作 列の 詳細 をクリックしてタスク詳細ページを開きます。
タスク詳細ページで、実行履歴 の横にある数字をクリックして、各実行の 実行開始時間 と 実行終了時間 を表示します。
識別タスクの削除
検出ジョブ タブでは、タスクを個別にまたは一括で削除できます。
単一タスクの削除:
削除したいタスクを見つけ、操作 列の 削除 をクリックします。
タスクの一括削除:
削除したいタスクのチェックボックスを選択し、左下隅の バッチ削除 をクリックします。
重要識別タスクを削除しても、実行中のタスクは停止しません。
定期タスクが削除されると、それ以降は実行されなくなります。
削除されたタスクの以前の実行による識別結果は保持されます。
分類とグレーディングの結果
データ識別は、毎日深夜以降に最新のテーブルスキーマ情報を取得します。したがって、新しいフィールド、テーブル、またはデータベースは翌日に分類およびグレーディングされます。
[データ分類とグレーディング] ページで、検出結果 タブをクリックします。このタブでは、タスク実行後のテーブルフィールドの識別結果を表示できます。
データ分類とグレーディング結果の表示
[識別結果] ページには、データ資産の分類とグレーディング情報が表示されます。以下の表は各列の説明です。
パラメーター
説明
データソースタイプ
データ資産が属するデータエンジン。
インスタンス / プロジェクト / データベース
データ資産が属するインスタンス、プロジェクト、またはデータベースの名前。
テーブル
データ資産が属するデータテーブルの名前。
フィールド
データ資産内のフィールドの名前。
データ分類
データ型に対応するデータ分類ディレクトリ、またはユーザーによって修正されたディレクトリ。パスは
レベル 1 ディレクトリ/レベル 2 ディレクトリ/...の形式で表示されます。データ型
識別タスクによって決定されたデータ型、またはユーザーによって修正されたデータ型。
データ分類
データ型に対応するセキュリティレベル、またはユーザーによって修正されたレベル。
判定方式
システム検出:識別タスクが結果を決定しました。
改訂:ユーザーが結果を修正しました。
更新日時
システムが結果を決定した、またはユーザーが結果を修正した最終日時。
データ分類とグレーディング結果の修正
[操作] 列から結果を削除または修正できます。2 つの修正方法が利用可能です。
再スキャンして上書き:新しいワンタイムタスクを作成して、特定の範囲内の資産の識別結果を再評価します。
手動で修正:データ資産の識別結果を手動で修正します。次の手順を実行します。
[識別結果] タブで、検索バーを使用して変更したいデータ資産をフィルタリングし、[操作] 列の 改訂 をクリックします。
表示されるダイアログボックスで、新しいデータ型を選択して変更を適用します。
識別結果リストは、以下のバッチおよび手動操作もサポートしています。
一括修正:複数の識別結果を選択し、リストの下部にある [修正] ボタンをクリックして、選択したレコードのデータ分類、データグレーディング、またはデータ型を一度に更新します。
手順:
識別結果リストで、最初の列のチェックボックスを使用して修正したいレコードを選択します。1 つまたは複数のレコードを選択するか、全選択チェックボックスをクリックして現在のページのすべてのレコードを選択できます。
レコードを選択すると、リストの左下に選択したレコード数が表示されます。[修正] をクリックします。
[修正] ダイアログボックスで、修正情報 (「バッチ修正のために x 件のレコードが選択されました」と選択されたレコードの詳細が表示されます) を確認し、複数レベルのドロップダウンリストを使用してターゲットのデータ分類を選択します。
[確認] をクリックします。システムに「X 件のレコードを正常に修正しました」と表示されます。修正後、これらのレコードの判断モードは自動的に修正に変わります。
一括削除:複数の識別結果を選択し、リストの下部にある [削除] ボタンをクリックして、選択したレコードを一括で削除します。削除中に [MaxCompute フィールドラベルをリセット] オプションも表示されます。デフォルト値は、選択された項目の中で最も高いセキュリティレベル番号です。
識別結果の手動追加:検出結果 タブのツールバーで、[追加] をクリックします。ダイアログボックスで、エンジンタイプ、カタログ (プロジェクト/インスタンス/クラスター/カタログ)、データベース/スキーマ、データテーブル、フィールド、およびデータ型を選択して、判断モードが 改訂 に設定された識別結果を作成します。これは、自動識別では一致しなかったが、機密性を確認したフィールドに使用します。
未認識フィールドの管理
検出結果 タブには、[認識済み] と [未認識] の 2 つのサブタブがあります。[認識済み] サブタブには、識別タスクまたはユーザーの修正によって機密としてマークされたフィールドがリストされます。[未認識] サブタブには、テナント範囲内でどの識別ルールにも一致しなかったフィールドがリストされ、これはおおよそ総メタデータフィールドから機密フィールドを引いたものに相当します。このタブを使用して、カバレッジのギャップを埋め、バッチ手動タグ付けを実行します。
[未認識] サブタブは、エンジンタイプを選択した後にのみフィールドリストを取得します。エンジンタイプが選択されていない場合、リストは空です。この設計は、一度にすべてのフィールドを返すことによるページのパフォーマンスの問題を回避します。
[未認識] サブタブのツールバーでは、以下の 3 つのアクションが提供されます。
インポート:
.csvファイルのアップロードのみをサポートします。最初に [エクスポート] をクリックして未認識フィールド (xls 形式) をテンプレートとして取得することをお勧めします。各フィールドのターゲットデータ型を入力し、csv として保存してからアップロードします。ファイルは OSS にアップロードされ、手動タグ付けは非同期で実行されます。進捗と結果は [タスクリスト] で確認できます。エクスポート:現在のフィルターに基づいて未認識フィールドのリストをエクスポートします (xls 形式、インポートテンプレートとして使用するために csv として保存できます)。フィルターに一致するデータがない場合、ボタンは無効になります。
タスクリスト:以前の [インポート] および [エクスポート] タスクの送信時刻、ステータス、および結果ファイルのダウンロードリンクを示すドロワーパネルを開きます。失敗した行があるインポートタスクの場合、ドロワーで行レベルの原因を含むエラーリストを表示します。ドロワーが開いている間、タスクのステータスは自動的に更新されます。