DataWorks のデータマップは、一元化されたデータ資産の管理および発見プラットフォームです。企業のデータランドスケープの包括的なビューを提供し、必要なデータを迅速かつ正確に見つけるのに役立ちます。主な機能は次のとおりです。
[データの概要]:データ資産に関する統計情報を提供し、現在の状態を素早く把握できます。
グローバルキーワード検索:単一のエントリポイントから、目的のテーブル、フィールド、またはビジネス用語を迅速に見つけることができます。
多次元フィルタリングとブラウジング:さまざまな条件を組み合わせることで、より詳細で探索的なデータ検索が可能になります。
[使用制限]
既存の PAI ワークスペースを利用しているテナントは、データセット、AI モデル、アルゴリズムタスク、モデルサービスなど、関連する AI 資産を検索して表示できます。
コード検索は、DataWorks Standard Edition 以降のユーザーのみが利用できます。
データマップへのアクセス
DataWorks コンソールにログインします。 左側のナビゲーションウィンドウで、 を選択します。 表示されるページで、[データマップに移動] をクリックします。
データ概要:マクロレベルのインサイト獲得
データ概要ページでは、データソースの使用状況に関する概要を高いレベルで確認できます。
データマップの ホームページ で、メタデータ取得 の横にある データの概要 をクリックします。
データ概要ページで、現在のリージョンにあるすべてのエンジンリソースを表示できます。
MaxCompute の主要メトリック:
[名前]
[説明]
[総プロジェクト数]
現在のリージョンにある MaxCompute プロジェクトの総数です。これは ほぼリアルタイム のデータです。
[総テーブル数]
現在のリージョンにある MaxCompute テーブルの総数です。このデータはオフラインで収集され、T+1 の遅延があります。
[ストレージ容量]
現在のリージョンにあるすべてのテーブルの論理ストレージの合計サイズです。これには、スケジューリングタスクによって生成された一時ファイルや、テーブル削除後に解放されていないストレージが含まれます。このデータはオフラインで収集され、T+1 の遅延があります。
[総 API 数]
現在のリージョンで API ゲートウェイに発行された MaxCompute API の総数です。
[ストレージの推移グラフ]
現在のリージョンにある MaxCompute プロジェクトの論理ストレージ合計の傾向グラフです。このデータには、スケジューリングタスクによって生成された一時ファイルや、テーブル削除後に解放されていないストレージが含まれます。このデータはオフラインで収集され、T+1 の遅延があります。
[ストレージ別上位プロジェクト]
現在のリージョンにおける MaxCompute プロジェクトを論理ストレージサイズでランク付けしたものです。このデータはオフラインで収集され、T+1 の遅延があります。プロジェクトをクリックすると、そのメタデータを表示できます。
重要テーブルストレージに加えて、プロジェクトストレージにはリソースストレージ、ごみ箱ストレージ、およびその他のシステムファイルストレージも含まれます。したがって、プロジェクトストレージはテーブルストレージよりも大きくなります。
[ストレージ別上位テーブル]
MaxCompute テーブルをサイズでランク付けしたものです。このデータはオフラインで収集され、T+1 の遅延があります。テーブルをクリックすると、そのメタデータを表示できます。
重要テーブルストレージは、物理ストレージではなく論理ストレージに基づいて計算されます。
[人気テーブル]
過去 30 日間で最も閲覧されたテーブルを、データマップのテーブル詳細ページの PV (ページビュー) でランク付けしたものです。これは ほぼリアルタイム のデータです。
その他のエンジンメトリック:データベースの総数、テーブルの総数、クラスターの総数などの情報を表示できます。
データの検索方法:検索から発見まで
データマップは、さまざまなデータ検索のニーズに応えるために、2 つの補完的な検索方法を提供します。
グローバルキーワード検索
探しているデータについて明確な手がかりがある場合、グローバル検索が最も効率的な方法です。ホームページからは、[最近の閲覧]、[フォロー中のコレクション]、[管理対象コレクション] にも素早くアクセスできます。
検索バーへの移動:データマップのホームページの上部にある、目立つ検索ボックスを見つけます。
キーワードの入力:テーブル名、フィールド名、中国語のコメント、またはその他の [キーワード] を入力します。たとえば、「ユーザー」、「注文」、「user_info」などを入力します。
検索の実行:Enter キーを押します。システムは関連するすべてのデータ資産のリストを返します。項目をクリックして詳細を表示します。
多次元フィルタリングとブラウジング
結果をより正確に絞り込んだり、ビジネスカテゴリ別にデータを探索したりする必要がある場合は、検索ページに移動して高度な検索を行います。グローバルキーワード検索バーは、上部メニューで引き続き利用できます。
検索ページへの移動:左側のナビゲーションペインにある検索アイコン
をクリックして、高度な検索ページを開きます。フィルター条件の組み合わせ:ページの左側で、さまざまなフィルター条件を選択して、結果を段階的に絞り込みます。
[タイプ]:メタデータタイプを選択します。サポートされているタイプには、テーブル、コード、[インデックス]、[API]、[データセット]、[ワークスペース]などがあります。テナントに PAI ワークスペースがある場合は、[AI モデル]、[アルゴリズムジョブ]、[モデルサービス] (現在ベータ版) などの AI 資産タイプでフィルタリングすることもできます。
データソース:テーブルを選択すると、MaxCompute、EMR Hive、Hologres などの特定のエンジンに検索を限定できます。
重要データソースの数が特定のしきい値を超えた場合は、右上隅にある もっと見る ボタンをクリックして、非表示のデータソースを表示します。
フィルター条件:プロジェクト、所有者、環境、クラスター、データカタログ、データベースなどでフィルタリングできます。
利用可能なフィルター条件は、メタデータタイプによって異なります。
使用例:
MaxCompute で「田中一郎」が所有するすべての本番テーブルを検索したい場合。手順:[データソース] でMaxComputeを選択し、[所有者] に田中一郎を入力し、[環境] で本番環境を選択します。
[AI 検索]
単一のキーワードで探しているデータを説明するのが難しい場合や、ビジネスシナリオに基づいて推奨を得たい場合は、[AI 検索]を使用して自然言語で質問できます。データマップは、インテリジェントに資産を特定し、関連テーブルを推奨し、その推奨の理由を説明します。
検索ページからのアクセス:データマップの検索ページの右上隅で AI 検索 タブに切り替えて、対話形式の検索を開始します。
ホームページからのアクセス:データマップのホームページの検索ボックスで AI Q&A モードに切り替え、質問を入力すると、システムは AI 検索の会話ページにリダイレクトして対話を続行します。
使用方法:入力ボックスに自然言語で要件を記述します。例:
トランザクションビジネスに関連するファクトテーブルを検索する。過去 7 日間に追加されたデータセットを照会する。「データガバナンス」事業部に属する MaxCompute プロジェクトをリストアップする。
セッション管理:ホームページから送信された質問は、新しいセッションを作成します。セッションを指定せずに AI 検索ページに入ると、最新のセッションが再開されます。必要に応じて、新しいセッションを作成したり、過去のセッションに戻ったりすることができます。
クイック質問テンプレート:AI 検索の会話ページの下部には、よく使われる質問テンプレートが用意されています。テンプレートをクリックして送信すると、すぐに使い始めることができます。
統合検索との関係:統合検索は キーワードとフィルター条件 によってメタデータを正確に照合しますが、AI 検索は 自然言語とセマンティックコンテキスト を通じて要件を理解し、推奨を提供します。これら 2 つのアプローチは補完的です。明確な対象オブジェクトがある場合は統合検索を使用し、ビジネス要件を記述したい場合は AI 検索を使用します。
AI 検索は現在、テナントごとに段階的な展開を通じて利用可能です。この機能がテナントで有効になっている場合にのみ表示されます。有効にするには、管理者にお問い合わせいただくか、チケットを起票してください。
[よくある質問]
Q:探しているテーブルが見つからない場合はどうすればよいですか。
A:DataWorks データマップで対象のテーブルが見つからない場合、通常、以下の原因が考えられます。1 つずつトラブルシューティングを行い、対応する解決策をご参照ください。
検索キーワードの不一致:検索は、テーブル名、説明、フィールド名による検索をサポートしています。より正確な、または部分的なキーワードを使用してみてください。
メタデータの非同期:MaxCompute または DLF を DataWorks にバインドすると、メタデータは自動的に収集されます。ただし、新しいテーブルが作成されたり、テーブル構造が変更されたりした後は、遅延が発生する場合があります。手動で同期をトリガーするには、次の手順を実行します。
[マイデータ] > [テーブルメタデータの更新] に移動し、GUID 入力ボックスに対象テーブルの GUID を
project.tableまたはodps.project.tableの形式で入力し、[同期] をクリックします。
操作が成功したら、再度検索して対象のテーブルを見つけることができます。
テーブルが非表示になっている:テーブルが「非表示」状態に設定されている可能性があり、その場合、検索で発見できなくなります。テーブルが「非表示」に設定されている場合、誰にも表示されません。「プロジェクトのみ」に設定されている場合は、現在のワークスペースのメンバーにのみ表示されます。
権限不足:デフォルトでは、検索は現在のワークスペースと承認されたプロジェクトのみを対象とします。対象のテーブルが別のアカウントまたは未承認のワークスペースに属している場合、存在していても見つけることはできません。さらに、テーブルに対するクエリ権限がない場合、デフォルトではデータマップで表示できません (特に標準モードのワークスペースの場合) 。
解決策:テーブルの所有者または管理者に連絡して権限を要求するか、対応するプロジェクトに参加しているかどうかを確認してください。