データ同期、処理、品質モニタリングを含むユーザー プロファイル分析ワークフローに従うため、EMR クラスターおよび DataWorks ワークスペースを準備します。
背景情報
地理的属性およびソーシャル属性を含む基本的なユーザー プロファイルを構築し、ウェブサイト上のユーザー動作を分析します。また、スケジュールされた分析を実行して、詳細なトラフィック運用およびビジネス戦略を支援します。
前提条件
エンドツーエンドのユーザー プロファイル分析ワークフローを理解するには、「実験の概要」をご参照ください。
注意事項
-
このチュートリアルでは、直接使用可能なユーザー情報およびウェブサイトアクセスのテストデータを提供しています。
-
提供されるデータはシミュレーションデータであり、DataWorks のハンズオン練習専用です。
-
このチュートリアルでは、データ処理にDataStudio (レガシバージョン) を使用します。
EMR 環境の準備
EMR クラスターの作成
クラスター上でデータ処理タスクを実行できるように、EMR クラスターを作成し、DataWorks と統合します。クラスター作成時に、以下の主要パラメーターを設定します。
|
パラメーター |
値 |
|
リージョン |
中国 (上海)。 |
|
Business Scenario |
Data Lake。 |
|
Product Version |
最新バージョンを選択します。 |
|
Optional Services |
ニーズに応じてコンポーネントを選択します。本チュートリアルでは、Hive コンポーネントおよび OSS-HDFS コンポーネントが必須です。 |
|
メタデータ |
DLF 統合メタデータ。 |
|
クラスターストレージのルートパス |
OSS-HDFS インスタンスを選択します。ドロップダウンリストが空の場合、[OSS-HDFS バケットの作成] をクリックします。 |
EMR クラスターの作成手順の詳細については、「クラスターの作成」をご参照ください。
DataWorks のサポート内容は EMR クラスターの構成によって異なります。DataWorks で EMR タスクを開発する場合は、クラスター作成前に「EMR クラスター上での DataWorks 構成に関するベストプラクティス」をお読みください。
DataWorks 環境の準備
DataWorks で開発を行う前に、DataWorks サービスを有効化する必要があります。詳細については、「事前準備」をご参照ください。
手順 1:ワークスペースを作成する
すでに中国 (上海) リージョンにワークスペースがある場合は、それを使用してこの手順をスキップできます。
-
DataWorks コンソール にログインします。左上隅でリージョンを 中国 (上海) に切り替えます。
-
左側のナビゲーションウィンドウで ワークスペース をクリックします。「ワークスペース」ページで、+ ワークスペースの作成 をクリックして、開発環境と本番環境を分離する標準モードでワークスペースを作成します。詳細については、「ワークスペースの作成」をご参照ください。
ステップ 2:サーバーレスリソースグループの作成
本チュートリアルでは、サーバーレスリソースグループがデータ同期およびスケジューリングを処理します。購入して初期設定を完了してください。
-
サーバーレスリソースグループを購入します。
-
DataWorks コンソール にログインし、画面上部でリージョンを 中国 (上海) に切り替え、左側のナビゲーションバーで リソースグループ をクリックしてリソースグループの一覧ページに移動します。
-
リソースグループの新規作成 をクリックします。購入ページで、リージョンと可用性ゾーン を 中国 (上海) に設定し、リソースグループ名 を指定します。その他のパラメーターは画面の指示に従って設定し、支払いを完了します。請求情報については、「サーバーレスリソースグループの課金」をご参照ください。
説明現在のリージョンに VPC または vSwitch がない場合は、パラメーター説明内の該当リンクをクリックして作成します。VPC および vSwitch の詳細については、「VPC とは」をご参照ください。
-
-
リソースグループを DataWorks ワークスペースに関連付けます。
新しく購入したサーバーレスリソースグループは、使用前にワークスペースに関連付ける必要があります。
DataWorks コンソール にログインします。上部のナビゲーションバーでリージョンを 中国 (上海) に切り替えます。購入したサーバーレスリソースグループを見つけ、操作 列で 所属ワークスペースの変更 をクリックします。ご利用のワークスペースを見つけ、アタッチ をクリックします。
-
リソースグループのパブリックネットワークアクセスを設定します。
テストデータはインターネットからダウンロードされます。サーバーレスリソースグループはデフォルトでパブリックネットワークアクセスを持たないため、関連付けられた VPC に対してインターネット NAT Gateway および Elastic IP アドレス (EIP) を設定する必要があります。
-
VPC コンソールのインターネット NAT Gateway ページ に移動します。上部のナビゲーションバーでリージョンを 中国 (上海) に切り替えます。
-
インターネット NAT ゲートウェイの作成 をクリックして、パラメーターを設定します。次の表では、このチュートリアルで重要なパラメーターについて説明します。その他のパラメーターはデフォルト値のままにしておけます。
パラメーター
値
リージョン
中国 (上海)。
VPC
リソースグループに関連付けられている VPC および vSwitch を選択します。
この情報を確認するには、DataWorks コンソール にアクセスし、正しいリージョンに切り替えて、左側のナビゲーションウィンドウで リソースグループの一覧 をクリックします。ご利用のリソースグループを見つけ、操作 列で ネットワーク設定 をクリックします。データスケジューリング & データ統合 セクションに VPC のアタッチ および vSwitch が表示されます。VPC および vSwitch の詳細については、「VPC とは」をご参照ください。
vSwitch の関連付け
アクセスモード
VPC 向けフルコーンモード (SNAT)。
EIP
新規 EIP の購入。
サービスリンクロールの作成
インターネット NAT Gateway を初めて作成する場合は、サービスリンクロールを作成する必要があります。サービスにリンクされたロールの作成 をクリックします。
-
今すぐ購入 をクリックします。サービス契約をお読みいただき同意のうえ、今すぐ利用を開始 をクリックして購入を完了します。
-
サーバーレスリソースグループの追加および使用方法の詳細については、「サーバーレスリソースグループの使用」をご参照ください。
ステップ 3:EMR クラスターの登録およびリソースグループの初期化
EMR クラスターを DataWorks ワークスペースに登録してから使用する必要があります。
-
EMR クラスター登録ページに移動します。
-
管理センターページに移動します。
DataWorks コンソール にログインします。リージョンを 中国 (上海) に切り替えた後、左側のナビゲーションウィンドウで を選択します。ドロップダウンリストから対象のワークスペースを選択し、管理センターへ をクリックします。
-
左側のナビゲーションウィンドウで クラスター管理 をクリックします。「クラスター管理」ページで、登録済みクラスター をクリックし、登録済みクラスタータイプ を E-MapReduce に設定します。
-
-
EMR クラスターを登録します。
E-MapReduce クラスターの登録 ページで、クラスター情報を設定します。以下の表は主要パラメーターを示しています。
パラメーター
値
クラスターの Alibaba Cloud アカウント
現在の Alibaba Cloud アカウント。
クラスタータイプ
データレイク (DataLake)。
デフォルトアクセス主体
クラスターアカウント:hadoop。
proxy user 情報の転送
伝播。
-
リソースグループを初期化します。
-
クラスター管理 ページで、登録済みの EMR クラスターを見つけ、右上隅の リソースグループの初期化 をクリックします。
-
対象のリソースグループを見つけ、初期化 をクリックします。
-
初期化が完了したら、確認 をクリックします。
重要初期化が成功していることを確認してください。失敗した場合、タスクが失敗する可能性があります。失敗した場合は、エラーメッセージを確認し、画面の指示に従って接続性診断を実行してください。
-
EMR クラスターの登録手順の詳細については、「DataStudio (レガシバージョン):EMR 計算リソースの関連付け」をご参照ください。
次のステップ
環境を設定した後は、ユーザー情報およびウェブサイトアクセスログを OSS に同期し、EMR Hive ノードでテーブルを作成してデータをクエリします。詳細については、「データの同期」をご参照ください。