このチュートリアルでは、DataWorks のサンプルデータセットを使用してユーザープロファイルを作成する手順を説明します。 China (Shanghai) リージョンでデータ同期、データ処理、品質監視を実行する方法を学びます。 開始する前に、MaxCompute プロジェクト、DataWorks ワークスペース、および必要なデータソース、コンピューティングリソース、ストレージリソースを準備してください。
背景情報
ビジネス戦略を改善するために、ウェブサイトのユーザー行動を分析して基本的なユーザープロファイルを作成する必要があります。 これらのプロファイルには、地理的な場所や社会的特徴などの属性を含めることができます。 スケジュールされた分析を実行することで、ウェブサイトのトラフィックをきめ細かく制御できます。
事前準備
このチュートリアルを完了するには、「チュートリアルの概要」を読み、ユーザープロファイル分析のワークフロー全体を理解していることを確認してください。
注意事項
このチュートリアルでは、必要なユーザー情報とウェブサイトのアクセステストデータを提供します。 このデータは直接使用できます。
このチュートリアルで提供されるデータは、DataWorks での実践的な演習のみを目的としています。 すべてのデータはモックデータです。
このチュートリアルでは、Data Studio の新しいバージョンを使用してデータ処理を行います。
MaxCompute 環境の準備
ステップ 1:MaxCompute の有効化
このチュートリアルでは MaxCompute を使用します。 続行する前に、China (Shanghai) リージョンで以下の設定で MaxCompute を有効化してください。
[リージョン]:China (Shanghai)
[仕様タイプ]:標準コンピューティングリソース
ステップ 2:MaxCompute プロジェクトの作成
標準モードの DataWorks ワークスペースは、2 つの MaxCompute プロジェクトにバインドする必要があります。 1 つのプロジェクトは開発環境用で、もう 1 つは本番環境用です。
MaxCompute コンソールに移動します。 左側のナビゲーションペインで、 を選択します。
プロジェクトの作成 をクリックし、2 つの個別の MaxCompute プロジェクトを作成します。 次の表に、このチュートリアルの主要なパラメーターを示します。 その他のパラメーターについては、デフォルト値を使用してください。
パラメーター
説明
[プロジェクト名]
カスタム。 名前はグローバルに一意である必要があります。
このチュートリアルの例:
本番環境:
workshop2024_01開発環境:
workshop2024_01_dev
[計算リソースの料金タイプ]
このチュートリアルでは、[従量課金] を選択します。
[デフォルト Quota]
このチュートリアルでは、ドロップダウンリストから
os_PayAsYouGoQuota (従量課金 Standard Edition)を選択します。[データ型]
このチュートリアルでは、ドロップダウンリストから [2.0 データ型 (推奨)] を選択します。
[ストレージの暗号化]
このチュートリアルでは、[暗号化しない] を選択します。
MaxCompute プロジェクトの作成に関する詳細については、「MaxCompute プロジェクトの作成」をご参照ください。
DataWorks 環境の準備
DataWorks を使用する前に、サービスを有効化してください。 詳細については、「購入ガイド」をご参照ください。
ステップ 1:ワークスペースの作成
China (Shanghai) リージョンで Data Studio の新しいバージョンを使用するワークスペースが既にある場合は、この手順をスキップできます。
DataWorks コンソールにログインします。 上部のナビゲーションバーで、リージョンを 中国 (上海) に切り替えます。 左側のナビゲーションペインで ワークスペース をクリックして、ワークスペースリストページに移動します。
+ ワークスペースの作成 をクリックして、データ開発 (DataStudio) (新版) パブリックプレビューへの参加 し、本番環境と開発環境の隔離 する 標準モード のワークスペースを作成します。
説明2025 年 2 月 18 日以降、Alibaba Cloud プライマリアカウントが DataWorks を初めて有効化し、China (Shanghai) リージョンにワークスペースを作成する場合、DataWorks はデフォルトで Data Studio の新しいバージョンを有効にします。
ワークスペースの作成方法に関する詳細については、「ワークスペースの作成」をご参照ください。
ステップ 2:サーバーレスリソースグループの作成
サーバーレスリソースグループを購入します。
このチュートリアルでは、データ同期とスケジューリングのために DataWorks サーバーレスリソースグループが必要です。 サーバーレスリソースグループを購入して準備する必要があります。
DataWorks リソースグループリスト ページにログインします。 上部のナビゲーションバーで、リージョンを 中国 (上海) に切り替えます。 左側のナビゲーションペインで、リソースグループ をクリックして リソースグループの一覧 ページに移動します。
リソースグループの新規作成 をクリックします。 購入ページで、[リージョンとゾーン] を 中国 (上海) に設定し、リソースグループ名 を指定します。 プロンプトに従ってその他のパラメーターを設定し、支払いを完了します。 サーバーレスリソースグループの課金の詳細については、「サーバーレスリソースグループの課金」をご参照ください。
説明現在のリージョンで利用可能な VPC または vSwitch がない場合は、パラメーターの説明にある対応するコンソールリンクをクリックして作成してください。 VPC と vSwitch の詳細については、「VPC とは」をご参照ください。
リソースグループを DataWorks ワークスペースにバインドします。
新しいサーバーレスリソースグループを使用する前に、ワークスペースにバインドする必要があります。
DataWorks リソースグループリストページにログインし、リージョンを 中国 (上海) に切り替えます。購入したサーバーレスリソースグループを見つけます。操作 列で、所属ワークスペースの変更 をクリックします。次に、作成した DataWorks ワークスペースを見つけ、アタッチ をクリックします。
リソースグループのパブリックネットワークアクセスを設定します。
このチュートリアルでは、パブリックインターネットからアクセスする必要があるテストデータを使用します。 デフォルトでは、リソースグループは パブリックインターネットにアクセスできません。 アクセスを有効にするには、インターネット NAT ゲートウェイを設定し、リソースグループにバインドされている VPC に EIP を追加する必要があります。
VPC - インターネット NAT ゲートウェイコンソールにログインします。トップナビゲーションバーで、リージョンを 中国 (上海) に切り替えます。
NAT Gateway の作成 をクリックして、パラメーターを設定します。このチュートリアルの主要なパラメーターを、次の表で説明します。その他のパラメーターにはデフォルト値を使用します。
パラメーター
値
[リージョン]
China (Shanghai)。
[ネットワーク & ゾーン]
リソースグループにバインドされている VPC と vSwitch を選択します。
DataWorks コンソールに移動し、リージョンを 中国 (上海) に切り替え、左側のナビゲーションウィンドウで リソースグループ をクリックして リソースグループの一覧 ページに移動します。 作成したリソースグループを見つけ、操作 列の ネットワーク設定 をクリックします。 [データスケジューリング & データ統合] セクションで、バインドされた VPC のアタッチ と vSwitch を表示できます。 VPC と vSwitch の詳細については、「VPC とは」をご参照ください。
[ネットワークタイプ]
インターネット NAT ゲートウェイ。
[EIP]
EIP を作成します。
[サービスリンクロールの作成]
初めてインターネット NAT ゲートウェイを作成する場合、サービスにリンクされたロールを作成する必要があります。サービスにリンクされたロールの作成 をクリックします。
今すぐ購入 をクリックし、サービス利用規約に同意した後、今すぐ利用を開始 をクリックして購入を完了します。
インターネット NAT ゲートウェイを購入した後、コンソールに戻り、新しいゲートウェイインスタンスの SNAT エントリを作成します。
説明VPC 内のリソースグループは、SNAT エントリを設定した後にのみパブリックインターネットにアクセスできます。
新しいインスタンスの行で、操作列の管理をクリックします。インスタンス詳細ページで、[SNAT 管理] タブをクリックします。
SNAT エントリで使用 タブで、SNAT エントリの作成 をクリックします。次の主要なパラメーターを設定します。
パラメーター
値
SNAT エントリの粒度
[VPC を指定] を選択します。 これにより、VPC 内のすべてのリソースグループが、設定された EIP を介してパブリックインターネットにアクセスできるようになります。
EIP の選択
現在のインターネット NAT ゲートウェイインスタンスにバインドされている EIP を選択します。
SNAT エントリのパラメーターを設定した後、OK をクリックして SNAT エントリを作成します。
SNAT エントリで使用 タブで、新しい SNAT エントリの ステータス が 利用可能 になるまで待ちます。 ステータスが利用可能になると、リソースグループにバインドされている VPC はパブリックインターネットにアクセスできるようになります。
サーバーレスリソースグループの追加と使用方法に関する詳細については、「サーバーレスリソースグループの使用」をご参照ください。
ステップ 3:MaxCompute プロジェクトのバインド
Data Studio を使用して MaxCompute でデータを処理するには、まず MaxCompute プロジェクトをコンピューティングリソースとして DataWorks ワークスペースにバインドする必要があります。
DataWorks ワークスペースリストページに移動します。上部のナビゲーションバーで、リージョンを 中国 (上海) に切り替えます。作成したワークスペースを見つけ、その名前をクリックして ワークスペースの詳細 ページに移動します。
左側のナビゲーションペインで、計算リソース をクリックします。
計算リソースのアタッチ をクリックし、バインドする 計算リソースタイプ を選択してから、関連するパラメーターを設定します。
[ワークスペース] 管理ページの左側のナビゲーションペインで、[コンピューティングリソース] をクリックし、ページ上部の [コンピューティングリソースのバインド] ボタンをクリックします。
このチュートリアルでは、コンピューティングとストレージに MaxCompute を使用します。 コンピューティングエンジンタイプとして MaxCompute を選択し、パラメーターを設定します。 次の表では、このチュートリアルの主要なパラメーターについて説明します。 その他のパラメーターには、デフォルト値を使用します。
パラメーター
説明
[MaxCompute プロジェクト]
バインドする MaxCompute プロジェクトを選択します。 このチュートリアルでは、ステップ 2 で作成したプロジェクトを、それぞれ開発環境と本番環境にバインドします。
[デフォルトアクセス主体]
このワークスペースから MaxCompute プロジェクトにアクセスするために使用されるアイデンティティを指定します。
開発環境: 実行者 ID のみがサポートされています。
本番環境: ログインアカウントに基づいて、ドロップダウンリストから ID を選択できます。このチュートリアルでは、Alibaba Cloud アカウント を選択します。
説明別のアカウントタイプでログインしている場合は、具体的な手順は「Data Studio (新バージョン):MaxCompute コンピューティングリソースのバインド」をご参照ください。
[計算リソースインスタンス名]
コンピュートエンジンを識別するためのカスタム名を入力します。 タスクが実行されると、この名前に基づいてコンピュートエンジンが選択されます。
[接続設定]
MaxCompute コンピューティングリソースへの接続に使用するリソースグループを選択します。 作成して現在のワークスペースにバインドしたサーバーレスリソースグループが表示されます。 開発環境と本番環境の両方で接続をテストする必要があります。
確認 をクリックして、MaxCompute コンピューティングリソースの設定を完了します。
コンピュートエンジンのバインド方法に関する詳細については、「コンピュートエンジンのバインド」をご参照ください。
次のステップ
これで環境の準備が整いました。次のチュートリアルに進むことができます。ここでは、ユーザー情報データとウェブサイトのアクセスログデータを OSS に同期し、ODPS SQL ノードを使用してテーブルを作成し、同期されたデータをクエリする方法を学びます。 詳細については、「データの同期」をご参照ください。