All Products
Search
Document Center

E-MapReduce:Gunakan DataWorks pada EMR untuk melakukan analisis profil pengguna

Last Updated:Aug 22, 2026

DataWorks terintegrasi dengan E-MapReduce (EMR) untuk pengembangan dan analisis gudang data. Tutorial ini memandu Anda melalui studi kasus analisis profil pengguna yang mencakup Data Integration, Data Studio, dan Operation Center.

Pengenalan eksperimen

Strategi bisnis yang efektif memerlukan data profil dasar pengguna website, termasuk atribut geografis dan sosial yang diperoleh dari aktivitas pengguna. Dengan menganalisis data profil berdasarkan waktu dan lokasi, Anda dapat mengoptimalkan operasi traffic website. DataWorks dan EMR secara bersama mendukung sinkronisasi, pemrosesan, manajemen, dan konsumsi data secara end-to-end.

Catatan

Baca Ikhtisar eksperimen untuk memahami seluruh proses eksperimen analisis profil pengguna sebelum memulai tutorial ini.

Prosedur

  1. Langkah 1: Persiapkan lingkungan

    Buat kluster EMR dan ruang kerja DataWorks, lalu konfigurasikan lingkungan tersebut.

  2. Langkah 2: Sinkronkan data

    Konfigurasikan task sinkronisasi data di DataWorks untuk menyinkronkan informasi pengguna dan log akses website ke sumber data Object Storage Service (OSS), lalu buat tabel menggunakan node EMR Hive untuk mengkueri data yang telah disinkronkan.

  3. Langkah 3: Proses data

    Gunakan node EMR Hive di DataWorks untuk memproses data informasi pengguna dan log akses yang telah disinkronkan ke OSS, lalu hasilkan data profil pengguna.

  4. Langkah 4: Konfigurasikan monitor

    Konfigurasikan monitor di DataWorks Data Quality untuk tabel dwd_log_info_di_emr yang dihasilkan dari data yang telah diproses.

FAQ

Apa yang harus saya lakukan jika tidak dapat menemukan kluster saat mengaitkan sumber data EMR dengan ruang kerja DataWorks di Konsol DataWorks?

Verifikasi bahwa tipe kluster didukung oleh DataWorks dan tinjau batasan serta prasyarat untuk mengaitkan sumber data EMR dengan ruang kerja DataWorks. Untuk informasi lebih lanjut, lihat Data Studio (legacy): Daftarkan kluster EMR. DataWorks tidak mengizinkan Anda menjalankan Pekerjaan Flink pada node EMR dan tidak mendukung kluster Dataflow. Anda dapat menggunakan EMR Workflow untuk menjadwalkan Pekerjaan Flink. Untuk informasi tentang EMR Workflow dan Realtime Compute for Apache Flink, lihat Apa itu EMR Workflow? dan Apa itu Realtime Compute for Apache Flink?.