すべてのプロダクト
Search
ドキュメントセンター

E-MapReduce:DataWorks on EMR を使用したユーザープロファイル分析

最終更新日:Aug 22, 2026

DataWorks は E-MapReduce (EMR) と統合して、データウェアハウスの開発と分析を実現します。このチュートリアルでは、Data Integration、Data Studio、およびオペレーションセンターを利用したユーザープロファイル分析のケーススタディを、手順を追って説明します。

実験の概要

効果的なビジネス戦略を策定するには、ユーザーアクティビティから導き出される地理的属性や社会的属性といった、Webサイトユーザーの基本的なプロファイルデータが必要です。時間や場所別にプロファイルデータを分析することで、Webサイトのトラフィックの運用を最適化できます。DataWorks と EMR を組み合わせることで、エンドツーエンドのデータ同期、処理、管理、および利用をサポートします。

説明

このチュートリアルを開始する前に、実験の概要 をお読みいただき、ユーザープロファイル分析実験の全体的な流れを把握してください。

操作手順

  1. ステップ 1:環境の準備

    EMR クラスターと DataWorks ワークスペースを作成し、環境を設定します。

  2. ステップ 2:データの同期

    DataWorks でデータ同期タスクを設定してユーザー情報とWebサイトアクセスログを Object Storage Service (OSS) データソースに同期し、EMR Hive ノードでテーブルを作成して同期済みデータをクエリします。

  3. ステップ 3:データの処理

    DataWorks の EMR Hive ノードを使用して、OSS に同期したユーザー情報とアクセスログデータを処理し、ユーザープロファイル結果を生成します。

  4. ステップ 4:モニターの設定

    DataWorks のデータ品質で、処理済みデータから生成された dwd_log_info_di_emr テーブルを対象に、モニターを設定します。

よくある質問

DataWorks コンソールで EMR データソースを DataWorks ワークスペースに関連付ける際に、クラスターが見つからない場合はどうすればよいですか。

クラスタータイプが DataWorks でサポートされているか、また、EMR データソースを DataWorks ワークスペースに関連付けるための制限と前提条件を確認してください。詳細については、「Data Studio (レガシー):EMR クラスターの登録」をご参照ください。DataWorks では、EMR ノードで Flink ジョブを実行できず、Dataflow クラスターもサポートされていません。Flink ジョブをスケジュールするには、EMR Workflow を使用できます。EMR Workflow と Realtime Compute for Apache Flink の詳細については、「EMR Workflow とは」および「Realtime Compute for Apache Flink とは」をご参照ください。