Topik ini menjelaskan cara menggunakan node MaxCompute di DataWorks untuk memproses tabel informasi pengguna ods_user_info_d dan data log akses ods_raw_log_d yang telah disinkronkan ke MaxCompute guna menghasilkan data profil pengguna target. Setelah membaca topik ini, Anda akan memahami cara menggunakan kombinasi DataWorks dan MaxCompute untuk menghitung serta menganalisis data yang telah disinkronkan dan menyelesaikan skenario pemrosesan data sederhana dalam gudang data.
Prasyarat
Sebelum memulai, selesaikan langkah-langkah dalam Sinkronisasi data.
Langkah 1: Bangun alur kerja pemrosesan data
Setelah menyinkronkan data ke MaxCompute dalam langkah Sinkronisasi data, kini Anda akan memprosesnya untuk menghasilkan profil pengguna dasar.
-
Pada panel navigasi kiri DataStudio, klik ikon
untuk membuka halaman pengembangan data. Di bagian Project Directory, temukan alur kerja yang telah Anda buat dan klik namanya untuk membuka kanvas alur kerja.Tabel berikut menjelaskan contoh node dan fungsinya dalam tutorial ini.
Type
Name
Description
MaxCompute SQLdwd_log_info_diGunakan fungsi bawaan dan UDF seperti
getregionuntuk memisahkan data log mentah dariods_raw_log_ddan menuliskannya ke tabeldwd_log_info_dike beberapa bidang.
MaxCompute SQLdws_user_info_all_diRangkum tabel informasi dasar pengguna (
ods_user_info_d) dan tabel data log yang telah diproses awal (dwd_log_info_di), lalu tulis datanya ke tabeldws_user_info_all_di.
MaxCompute SQLads_user_info_1dLanjutkan pemrosesan data dari tabel
dws_user_info_all_didan tulis hasilnya ke tabelads_user_info_1duntuk menghasilkan profil pengguna dasar. -
Catatan
Dalam alur kerja, Anda dapat menggambar garis secara manual untuk mengatur dependensi penjadwalan antar node. Anda juga dapat membiarkan sistem mengidentifikasi dependensi secara otomatis dengan mengurai kode di node anak. Tutorial ini menggunakan metode koneksi manual. Untuk informasi selengkapnya tentang penguraian kode, lihat Penguraian dependensi otomatis.
Langkah 2: Daftarkan UDF
Untuk memastikan tugas pemrosesan data berjalan lancar, Anda perlu mendaftarkan UDF MaxCompute (getregion) guna mengurai struktur data log yang disinkronkan ke MaxCompute selama tahap Sinkronisasi Data menjadi sebuah tabel.
-
Tutorial ini menyediakan resource yang diperlukan untuk fungsi yang memetakan alamat IP ke wilayah. Unduh resource tersebut ke mesin lokal Anda dan unggah ke ruang kerja DataWorks sebelum mendaftarkan fungsi tersebut.
-
Fungsi dan contoh resource IP hanya untuk keperluan tutorial. Untuk kasus penggunaan produksi yang memerlukan pemetaan alamat IP ke lokasi geografis, Anda harus memperoleh layanan konversi IP dari penyedia profesional.
Unggah resource (ip2region.jar)
-
Unduh paket ip2region.jar.
CatatanContoh resource
ip2region.jarhanya untuk keperluan tutorial. -
Pada panel navigasi kiri halaman DataStudio, klik ikon
untuk membuka halaman RESOURCE MANAGEMENT. Klik . Setelah menetapkan nama untuk resource, halaman unggah resource akan muncul.CatatanNama resource tidak perlu sama dengan nama file yang diunggah.
-
Untuk Document Source, pilih Local, klik Click Upload, lalu pilih file
ip2region.jaryang telah Anda unduh secara lokal. -
Untuk Data Source, pilih resource komputasi MaxCompute yang telah Anda ikat pada tahap Persiapkan lingkungan.
-
Pada bilah alat node, klik Save lalu klik Publish. Ikuti petunjuk pada panel publish untuk menerbitkan resource ke proyek MaxCompute untuk lingkungan pengembangan dan produksi.
Daftarkan UDF (getregion)
-
Pada halaman Resource Management, klik , tetapkan nama untuk resource, lalu Anda akan diarahkan ke halaman Register Function (dalam tutorial ini, fungsi diberi nama
getregion). -
Pada halaman Create Function, konfigurasikan parameter yang dijelaskan dalam tabel berikut. Anda dapat mempertahankan nilai default untuk semua parameter lainnya.
Parameter
Description
Function type
Pilih
OTHER.Data Source
Pilih resource komputasi MaxCompute yang telah Anda asosiasikan pada langkah Persiapkan lingkungan.
Class Name
Masukkan
org.alidata.odps.udf.Ip2Region.Resource List
Pilih
ip2region.jar.Description
Konversi alamat IP menjadi wilayah.
Command Format
Masukkan
getregion('ip').Parameter Description
Alamat IP.
-
Klik Save pada bilah alat node, lalu klik Publish. Pada panel penerbitan, ikuti petunjuk untuk menerbitkan fungsi ke proyek MaxCompute untuk lingkungan pengembangan dan produksi.
Langkah 3: Konfigurasikan node pemrosesan data
Pemrosesan data mengharuskan Anda menerapkan logika untuk setiap lapisan dengan menjadwalkan job MaxCompute SQL. Tutorial ini menyediakan kode SQL contoh lengkap untuk mengonfigurasi node dwd_log_info_di, dws_user_info_all_di, dan ads_user_info_1d secara berurutan.
Konfigurasikan node dwd_log_info_di
Dalam kode contoh untuk node ini, kode SQL menggunakan fungsi yang telah dibuat untuk memproses bidang dari tabel hulu ods_raw_log_d dan menuliskan hasilnya ke tabel dwd_log_info_di.
-
Pada panel navigasi kiri DataStudio, klik ikon
untuk membuka halaman pengembangan data. Di bagian Project Directory, temukan alur kerja yang telah Anda buat dan klik namanya untuk membuka kanvas alur kerja. -
Pada halaman orkestrasi alur kerja, arahkan kursor ke node
dwd_log_info_di, lalu klik Open Node. -
Tempel kode berikut ke editor kode node.
-
Konfigurasikan parameter debugging.
Di sisi kanan editor node MaxCompute SQL, klik Run Configuration dan konfigurasikan parameter berikut untuk menjalankan pengujian dengan parameter relevan dari Run Configuration selama debugging di Langkah 4.
Parameter
Description
Computing Resources
Pilih resource komputasi MaxCompute dan kuota yang sesuai yang telah Anda asosiasikan pada langkah Persiapkan lingkungan.
Resource Group
Pilih kelompok sumber daya arsitektur tanpa server yang telah Anda beli pada langkah Persiapkan lingkungan.
Script Parameters
Tidak perlu konfigurasi. Kode contoh yang disediakan dalam tutorial ini menggunakan
${bizdate}untuk merepresentasikan waktu data. Di Langkah 4, saat Anda melakukan debugging dan menjalankan alur kerja, atur This operation value ke konstanta tertentu, misalnya20250223. Tugas tersebut kemudian akan mengganti variabel dengan konstanta ini selama waktu proses. -
(Opsional) Konfigurasikan properti penjadwalan.
Untuk tutorial ini, Anda dapat mempertahankan nilai default untuk parameter konfigurasi penjadwalan. Di sisi kanan halaman MaxCompute SQL, klik Scheduling Configuration. Untuk informasi selengkapnya tentang parameter konfigurasi penjadwalan, lihat Node Scheduling Configuration.
-
Scheduling Parameters: Parameter ini dikonfigurasi di tingkat alur kerja dalam tutorial ini. Anda tidak perlu mengonfigurasinya untuk setiap node dalam alur kerja. Anda dapat menggunakannya langsung dalam tugas atau kode Anda.
-
Scheduling Policy: Pada parameter Delayed execution time, Anda dapat menentukan berapa lama menunda eksekusi node anak setelah alur kerja dijalankan. Pengaturan ini tidak dikonfigurasi dalam tutorial ini.
-
-
Pada bilah alat node, klik Save.
Konfigurasikan node dws_user_info_all_di
Node ini merangkum tabel informasi dasar pengguna (ods_user_info_d) dan tabel data log yang telah diproses awal (dwd_log_info_di), lalu menuliskan datanya ke tabel dws_user_info_all_di.
-
Pada halaman orkestrasi alur kerja, arahkan kursor ke node
dws_user_info_all_di, lalu klik Open Node. -
Tempel kode berikut ke editor kode node.
-
Konfigurasikan parameter debugging.
Di sisi kanan editor node MaxCompute SQL, klik Run Configuration dan konfigurasikan parameter berikut untuk menjalankan pengujian dengan parameter relevan dari Run Configuration selama debugging di Langkah 4.
Parameter
Description
Computing Resources
Pilih resource komputasi MaxCompute dan kuota yang sesuai yang telah Anda asosiasikan pada langkah Persiapkan lingkungan.
Resource Group
Pilih kelompok sumber daya arsitektur tanpa server yang telah Anda beli pada langkah Persiapkan lingkungan.
Script Parameters
Tidak perlu konfigurasi. Kode contoh yang disediakan dalam tutorial ini menggunakan
${bizdate}untuk merepresentasikan waktu data. Di Langkah 4, saat Anda melakukan debugging dan menjalankan alur kerja, atur This operation value ke konstanta tertentu, misalnya20250223. Tugas tersebut kemudian akan mengganti variabel dengan konstanta ini selama waktu proses. -
(Opsional) Konfigurasikan properti penjadwalan.
Untuk tutorial ini, Anda dapat mempertahankan nilai default untuk parameter konfigurasi penjadwalan. Di sisi kanan halaman MaxCompute SQL, klik Scheduling Configuration. Untuk informasi selengkapnya tentang parameter konfigurasi penjadwalan, lihat Node Scheduling Configuration.
-
Scheduling Parameters: Parameter ini dikonfigurasi di tingkat alur kerja dalam tutorial ini. Anda tidak perlu mengonfigurasinya untuk setiap node dalam alur kerja. Anda dapat menggunakannya langsung dalam tugas atau kode Anda.
-
Scheduling Policy: Pada parameter Delayed execution time, Anda dapat menentukan berapa lama menunda eksekusi node anak setelah alur kerja dijalankan. Pengaturan ini tidak dikonfigurasi dalam tutorial ini.
-
-
Pada bilah alat node, klik Save.
Konfigurasikan node ads_user_info_1d
Node ini melanjutkan pemrosesan data dari tabel dws_user_info_all_di, menuliskan datanya ke tabel ads_user_info_1d, dan menghasilkan profil pengguna dasar.
-
Pada halaman orkestrasi alur kerja, arahkan kursor ke node
ads_user_info_1d, lalu klik Open Node. -
Tempel kode berikut ke editor kode node.
-
Konfigurasikan parameter debugging.
Di sisi kanan editor node MaxCompute SQL, klik Run Configuration dan konfigurasikan parameter berikut untuk menjalankan pengujian dengan parameter relevan dari Run Configuration selama debugging di Langkah 4.
Parameter
Description
Computing Resources
Pilih resource komputasi MaxCompute dan kuota yang sesuai yang telah Anda asosiasikan pada langkah Persiapkan lingkungan.
Resource Group
Pilih kelompok sumber daya arsitektur tanpa server yang telah Anda beli pada langkah Persiapkan lingkungan.
Script Parameters
Tidak perlu konfigurasi. Kode contoh yang disediakan dalam tutorial ini menggunakan
${bizdate}untuk merepresentasikan waktu data. Di Langkah 4, saat Anda melakukan debugging dan menjalankan alur kerja, atur This operation value ke konstanta tertentu, misalnya20250223. Tugas tersebut kemudian akan mengganti variabel dengan konstanta ini selama waktu proses. -
(Opsional) Konfigurasikan properti penjadwalan.
Untuk tutorial ini, Anda dapat mempertahankan nilai default untuk parameter konfigurasi penjadwalan. Di sisi kanan halaman MaxCompute SQL, klik Scheduling Configuration. Untuk informasi selengkapnya tentang parameter konfigurasi penjadwalan, lihat Node Scheduling Configuration.
-
Scheduling Parameters: Parameter ini dikonfigurasi di tingkat alur kerja dalam tutorial ini. Anda tidak perlu mengonfigurasinya untuk setiap node dalam alur kerja. Anda dapat menggunakannya langsung dalam tugas atau kode Anda.
-
Scheduling Policy: Pada parameter Delayed execution time, Anda dapat menentukan berapa lama menunda eksekusi node anak setelah alur kerja dijalankan. Pengaturan ini tidak dikonfigurasi dalam tutorial ini.
-
-
Pada bilah alat node, klik Save.
Langkah 4: Proses data
-
Proses data.
Pada bilah alat alur kerja, klik Run. Tetapkan nilai untuk variabel parameter yang didefinisikan di setiap node untuk eksekusi ini (tutorial ini menggunakan
20250223; Anda dapat mengubahnya sesuai kebutuhan). Klik OK dan tunggu hingga eksekusi selesai. -
Kueri hasil pemrosesan data.
Pada panel navigasi kiri Data Studio, klik
untuk membuka halaman pengembangan data. Di bagian direktori pribadi, klik
untuk membuat file dengan akhiran .sql(Anda dapat menggunakan nama file apa pun).Di bagian bawah halaman, pastikan mode bahasa diatur ke
MaxCompute SQL.
-
Pada editor SQL, masukkan pernyataan SQL berikut untuk memeriksa jumlah catatan di tabel hasil akhir
ads_user_info_1ddan memastikan apakah data telah diproses.-- Anda perlu mengubah kondisi filter partisi ke waktu data aktual untuk eksekusi Anda. -- Dalam tutorial ini, parameter debugging bizdate (waktu data) diatur ke 20250223. SELECT count(*) FROM ads_user_info_1d WHERE dt='<your_data_timestamp>';-
Jika kueri mengembalikan data, berarti data telah berhasil diproses.
Jika tidak ada data yang dikembalikan, pastikan This operation value yang dikonfigurasi saat Anda menjalankan alur kerja sesuai dengan tanggal bisnis yang ditentukan oleh
dtdalam kueri. Anda dapat mengklik alur kerja, lalu klik Runtime Logs di sisi kanan, klik View di kolom Operation pada catatan eksekusi, lalu periksa nilai tanggal bisnis (partition=[pt=xxx]) dalam log waktu proses alur kerja.
-
Langkah 5: Terapkan alur kerja
Tugas hanya dapat dijadwalkan secara otomatis setelah diterapkan ke lingkungan produksi. Anda dapat mengikuti langkah-langkah berikut untuk menerapkan alur kerja.
Dalam tutorial ini, parameter penjadwalan dikonfigurasi di properti penjadwalan alur kerja. Anda tidak perlu mengonfigurasinya untuk setiap node sebelum penerapan.
-
Pada bilah navigasi kiri Data Studio, klik
untuk membuka halaman DataStudio. Lalu, di area Project Directory, temukan alur kerja yang telah dibuat dan klik alur kerja tersebut untuk membuka halaman orkestrasi alur kerja. -
Klik Publish pada bilah alat node untuk membuka panel Publish.
-
Klik Start Release Production. Pada kotak dialog konfirmasi yang muncul, pilih metode penerapan berdasarkan kebutuhan Anda:
-
Full deployment: Menerapkan alur kerja saat ini dan semua node tugas internalnya.
-
Incremental deployment: Hanya menerapkan alur kerja saat ini dan node tugas internal yang telah dimodifikasi sejak penerapan terakhir. Ini cocok untuk optimasi iteratif dan pembaruan minor.
-
-
Setelah Anda mengonfirmasi metode penerapan, sistem akan secara otomatis menjalankan proses penerapan, menerapkan alur kerja dan node tugas yang dipilih ke lingkungan pengembangan dan produksi secara berurutan. Untuk menyelesaikan penerapan ke lingkungan produksi, Anda harus mengklik Confirm Release.
Langkah 6: Jalankan tugas di produksi
Setelah tugas diterapkan, instans akan dihasilkan untuk dijalankan pada hari berikutnya. Anda dapat menggunakan Supplementary data untuk melakukan pengisian ulang data untuk alur kerja yang telah diterapkan dan memeriksa apakah tugas dapat dijalankan di lingkungan produksi. Untuk informasi selengkapnya, lihat Data Backfill Instance O&M.
-
Setelah tugas berhasil diterapkan, klik Operation and Maintenance Center di pojok kanan atas.
Atau, klik ikon
di pojok kiri atas dan pilih . -
Pada bilah navigasi kiri, klik . Pada halaman Auto Triggered Node, klik node virtual
workshop_start. -
Pada DAG di sisi kanan, klik kanan node
workshop_start, lalu pilih . -
Pilih tugas yang memerlukan pengisian ulang data, atur waktu data, lalu klik Submit and Redirect.
-
Pada halaman pengisian ulang data, klik Refresh hingga semua tugas SQL berhasil dijalankan.
Setelah menyelesaikan tutorial ini, untuk menghindari biaya tambahan, Anda dapat mengatur periode validitas penjadwalan node atau freeze node root proses bisnis (node virtual workshop_start).
Langkah selanjutnya
-
Visualisasi data: Setelah analisis profil pengguna selesai, gunakan modul analisis data untuk menampilkan data yang telah diproses dalam bentuk grafik. Hal ini membantu Anda dengan cepat mengekstraksi informasi penting dan memperoleh wawasan tentang tren bisnis.
-
Pantau kualitas data: Konfigurasikan aturan pemantauan kualitas data untuk tabel yang dihasilkan selama pemrosesan data. Hal ini memungkinkan Anda mengidentifikasi dan memblokir data kotor sebelumnya untuk mencegah dampaknya menyebar.
-
Kelola data: Setelah alur kerja analisis profil pengguna selesai, tabel data yang sesuai dibuat di MaxCompute. Anda dapat melihat tabel-tabel ini di Data Map dan memeriksa lineage untuk memahami hubungan di antara mereka.
-
Layanan data API: Setelah memperoleh data hasil akhir yang telah diproses, gunakan modul layanan data untuk berbagi data melalui API yang distandarkan. Hal ini memungkinkan Anda menyediakan data ke modul bisnis lain yang mengonsumsi data melalui API.
> New Resource > MaxCompute Jar