Kembangkan dan analisis data di DataWorks dengan membangun analisis kelompok pembeli rumah dari awal.
Pendahuluan
Tutorial ini mengunggah data pembelian rumah on-premises ke tabel MaxCompute bernama bank_data melalui DataWorks, menggunakan node MaxCompute SQL untuk menganalisis kelompok pengguna dan menghasilkan tabel bernama result_table, lalu memvisualisasikan result_table guna menghasilkan profil kelompok pengguna.
Tutorial ini menggunakan data simulasi. Dalam skenario bisnis aktual, sesuaikan langkah-langkah berdasarkan data bisnis Anda.
Bagan alir berikut menunjukkan alur data dan proses pengembangan.
Setelah analisis selesai, data menunjukkan bahwa tingkat pendidikan orang lajang yang memiliki hipotek terutama university.degree dan high.school.

Persiapan
Aktifkan DataWorks
Buat ruang kerja
Buat resource group dan asosiasikan dengan ruang kerja
Buat proyek MaxCompute dan asosiasikan proyek tersebut dengan ruang kerja sebagai sumber daya komputasi
Prosedur
Unggah data uji yang disediakan ke proyek MaxCompute, buat alur kerja di Data Studio untuk membersihkan dan menulis data, debug serta jalankan alur kerja tersebut, lalu eksekusi pernyataan SQL untuk mengkueri dan memverifikasi hasilnya.
Langkah 1: Buat tabel MaxCompute
Sebelum mengunggah data uji, buat tabel bernama bank_data di proyek MaxCompute untuk menyimpan data masuk dengan menggunakan fitur Data Catalog di DataWorks.
-
Masuk ke Konsol DataWorks. Di bilah navigasi atas, pilih wilayah yang diinginkan. Di panel navigasi kiri Konsol DataWorks, pilih . Di halaman yang muncul, pilih ruang kerja yang diinginkan dari daftar drop-down Select Workspace dan klik Go to Data Studio.
-
Di panel navigasi kiri halaman Data Studio, klik ikon
untuk membuka panel Data Catalog. -
(Opsional) Jika proyek MaxCompute Anda tidak tercantum di Data Catalog, klik ikon
di samping MaxCompute untuk membuka tab Data Sources di DataWorks. Di sana, tambahkan proyek MaxCompute Anda (yang telah dikonfigurasi sebagai sumber daya komputasi atau sumber data) ke ruang kerja sebagai katalog data. -
Di panel Data Catalog, klik MaxCompute. Di bawah proyek MaxCompute Anda, navigasikan ke Table. Klik ikon
untuk membuat tabel baru.Catatan-
Jika fitur skema diaktifkan untuk proyek MaxCompute, buka skema di proyek MaxCompute sebelum membuat tabel MaxCompute di folder Table di bawah proyek MaxCompute.
-
Dalam tutorial ini, digunakan ruang kerja dalam Standard Mode, dan debugging hanya dilakukan di lingkungan pengembangan. Oleh karena itu, Anda hanya perlu membuat tabel
bank_datadi lingkungan pengembangan proyek MaxCompute. Jika Anda menggunakan ruang kerja dalam Basic Mode, Anda perlu membuat tabelbank_datadi lingkungan produksi.
-
-
Di bagian DDL tab pembuatan tabel, masukkan kode SQL berikut. Sistem akan secara otomatis menghasilkan semua informasi untuk tabel tersebut.
CREATE TABLE IF NOT EXISTS bank_data ( age BIGINT COMMENT 'The age', job STRING COMMENT 'The job type', marital STRING COMMENT 'The marital status', education STRING COMMENT 'The education level', default STRING COMMENT 'Whether a credit card is possessed', housing STRING COMMENT 'The mortgage', loan STRING COMMENT 'The loan', contact STRING COMMENT 'The contact information', month STRING COMMENT 'The month', day_of_week STRING COMMENT 'The day of the week', duration STRING COMMENT 'The duration', campaign BIGINT COMMENT 'The number of contacts during the campaign', pdays DOUBLE COMMENT 'The time elapsed since the last contact', previous DOUBLE COMMENT 'The number of contacts with the customer', poutcome STRING COMMENT 'The result of the previous marketing campaign', emp_var_rate DOUBLE COMMENT 'The employment change rate', cons_price_idx DOUBLE COMMENT 'The consumer price index', cons_conf_idx DOUBLE COMMENT 'The consumer confidence index', euribor3m DOUBLE COMMENT 'The euro deposit rate', nr_employed DOUBLE COMMENT 'The number of employees', y BIGINT COMMENT 'Whether a time deposit is possessed' ); -
Di bilah alat atas tab konfigurasi, klik Deploy untuk membuat tabel
bank_datadi proyek MaxCompute di lingkungan pengembangan. -
Setelah tabel
bank_datadibuat, klik nama tabel di bagian MaxCompute untuk melihat informasi detail tabel tersebut.
Langkah 2: Unggah data ke tabel bank_data
Unduh file banking.csv ke mesin on-premises Anda, lalu unggah data dalam file tersebut ke tabel bank_data yang telah dibuat di proyek MaxCompute. Untuk informasi lebih lanjut, lihat Unggah data.
Sebelum mengunggah data dalam file, pastikan Anda telah menentukan resource group untuk penjadwalan dan resource group untuk Data Integration guna mengunggah data. Untuk informasi lebih lanjut, lihat Batasan.
-
Di pojok kiri atas Konsol DataWorks, klik ikon
dan pilih . -
Di bagian Recent Upload Records, klik Upload Data. Di halaman Upload Data, konfigurasikan parameter dengan mengacu pada tabel berikut.
Bagian
Deskripsi
Data Source
File lokal.
Specify Data to Be Uploaded
Select File
Unggah file
banking.csvyang telah diunduh ke mesin on-premises Anda.Configure Destination Table
Compute Engine
MaxCompute.
MaxComputeProject Name
Pilih proyek MaxCompute tempat tabel
bank_databerada.Select Destination Table
Pilih
bank_data. Jikabank_datatidak ditampilkan, lihat FAQ untuk refresh metadata tabel.Preview Data of Uploaded File
Klik Mapping by Order untuk menyelesaikan pemetaan antara data dalam file dengan bidang-bidang di tabel
bank_data.Catatan-
Unggah file yang namanya diakhiri dengan
.csv,.xls,.xlsx, dan.jsondari mesin on-premises Anda. -
Jika Anda mengunggah file yang namanya diakhiri dengan .xls atau .xlsx, sheet pertama file tersebut akan diunggah secara default.
-
Jika Anda mengunggah file yang namanya diakhiri dengan
.csv, ukuran file tidak boleh melebihi 5 GB. Untuk jenis file lainnya, ukuran file tidak boleh melebihi 100 MB. -
Pertahankan nilai default untuk parameter yang tidak dijelaskan dalam tabel.
-
-
Klik Upload Data untuk mengunggah data dalam file CSV ke tabel
bank_data. -
Periksa apakah data telah ditulis ke tabel
bank_data.Setelah data diunggah, Anda dapat menggunakan fitur SQL query (legacy) untuk memeriksa apakah data telah ditulis ke tabel
bank_data.-
Klik ikon
di pojok kiri atas. Di halaman pop-up, klik All Products > DataAnalysis > SQL Query. -
Di bawah My Files, klik . Tentukan File Name sesuai keinginan dan klik Determine.
-
Di halaman kueri SQL, masukkan pernyataan SQL berikut.
SELECT * FROM bank_data limit 10; -
Di pojok kanan atas tab konfigurasi file kueri SQL, pilih ruang kerja tempat tabel
bank_databerada dan sumber data MaxCompute yang diinginkan, lalu klik OK.CatatanDalam tutorial ini, digunakan ruang kerja dalam Standard Mode, dan tabel
bank_datahanya dibuat di lingkungan pengembangan. Oleh karena itu, pilih sumber data MaxCompute di lingkungan pengembangan. Jika Anda menggunakan ruang kerja dalam basic mode, Anda dapat memilih sumber data MaxCompute di lingkungan produksi. -
Di bilah alat atas tab konfigurasi, klik ikon Run . Di kotak dialog Estimate Costs, klik Run. Setelah pernyataan SQL dieksekusi, Anda dapat melihat sepuluh catatan data pertama di tabel
bank_datayang ditampilkan di bagian bawah tab konfigurasi. Hal ini menunjukkan bahwa data dalam file berhasil diunggah dari mesin on-premises Anda ke tabelbank_data.
-
Langkah 3: Proses data
Gunakan node MaxCompute SQL untuk menyaring data di tabel bank_data, memperoleh distribusi tingkat pendidikan di antara orang lajang yang memiliki hipotek, dan menulis data yang telah diproses ke tabel result_table.
Bangun tautan pemrosesan data
-
Di pojok kiri atas Konsol DataWorks, klik ikon
dan pilih . -
Di bilah navigasi atas halaman Data Studio, beralih ke ruang kerja yang dibuat untuk tutorial ini. Di panel navigasi kiri halaman Data Studio, klik ikon
. -
Di bagian Workspace Directories panel DATA STUDIO, klik ikon
dan pilih Create Workflow. Di kotak dialog Create Workflow, masukkan nama di kolom Name dan klik OK untuk menyimpan alur kerja. Dalam tutorial ini, parameter Name diatur menjadi dw_basic_case. -
Di tab konfigurasi alur kerja, seret Zero Load Node dan MaxCompute SQL dari bagian kiri ke kanvas di sebelah kanan, lalu tentukan nama untuk node-node tersebut. Tabel berikut mencantumkan nama node yang digunakan dalam tutorial ini dan fungsionalitas node tersebut.
Jenis node
Node name
Node functionality
Zero load nodeworkshop_startNode zero load yang mengelola semua node dalam tutorial ini dan menjelaskan alur data. Node ini tidak memerlukan kode.
MaxCompute SQLddl_result_tableMembuat tabel bernama
result_tableuntuk menyimpan data yang telah dibersihkan dari tabel bank_data.
MaxCompute SQLinsert_result_tableMenyaring data di tabel
bank_datadan menulis data yang telah disaring ke tabelresult_table. -
Gambar garis untuk mengonfigurasi dependensi antar node, seperti yang ditunjukkan pada gambar berikut.
CatatanAnda dapat menggambar garis untuk mengonfigurasi dependensi penjadwalan untuk node dalam alur kerja. Anda juga dapat menggunakan fitur parsing otomatis agar sistem secara otomatis mengidentifikasi dependensi penjadwalan antar node.
Dalam tutorial ini, dependensi penjadwalan antar node dikonfigurasi dengan menggambar garis. Untuk informasi tentang fitur parsing otomatis, lihat Gunakan fitur parsing otomatis.
-
Di bilah alat atas tab konfigurasi, klik Save.
Konfigurasikan node pemrosesan data
Langkah 4: Debug dan jalankan alur kerja
Setelah mengonfigurasi alur kerja dw_basic_case, debug dan jalankan di halaman Data Studio untuk memverifikasi konfigurasi.
-
Setelah menyelesaikan pengembangan node internal alur kerja, beralih ke tab konfigurasi alur kerja dan klik ikon Save di bilah alat atas tab konfigurasi untuk menyimpan alur kerja.
-
Setelah alur kerja disimpan, klik ikon Run di bilah alat atas tab konfigurasi untuk melakukan debug dan menjalankan alur kerja.
-
Setelah alur kerja selesai dijalankan, lihat hasilnya. Gambar berikut menunjukkan hasil yang diharapkan.

Langkah 5: Kueri dan tampilkan data
Setelah data diunggah ke MaxCompute dan diproses di Data Studio, kueri dan visualisasikan hasil analisisnya.
-
Klik ikon
di pojok kiri atas. Di halaman pop-up, klik All Products > DataAnalysis > SQL Query. -
Di panel SQL Query, klik ikon
di samping My Files dan pilih Create File. Di kotak dialog Create File, konfigurasikan parameter File Name sesuai kebutuhan bisnis Anda dan klik OK. -
Di halaman kueri SQL, masukkan pernyataan SQL berikut.
SELECT * FROM result_table; -
Di pojok kanan atas tab konfigurasi file kueri SQL, pilih ruang kerja tempat tabel
result_tableberada dan sumber data MaxCompute yang diinginkan, lalu klik OK.CatatanDalam tutorial ini, digunakan ruang kerja dalam Standard Mode, dan tabel
result_tablehanya dibuat di lingkungan pengembangan dan tidak dideploy ke lingkungan produksi. Oleh karena itu, pilih sumber data MaxCompute di lingkungan pengembangan. Jika Anda menggunakan ruang kerja dalam basic mode, Anda dapat memilih sumber data MaxCompute di lingkungan produksi. -
Di bilah alat atas tab konfigurasi, klik ikon Run. Di kotak dialog Estimate Costs, klik Run.
-
Di tab yang menampilkan hasil eksekusi, klik ikon
untuk melihat hasil visualisasi. Anda dapat mengklik ikon
di pojok kanan atas tab untuk menyesuaikan pola grafik. -
Di pojok kanan atas tab yang menampilkan hasil eksekusi, klik ikon Save untuk menyimpan grafik sebagai kartu. Di panel navigasi kiri halaman SQL Query, klik ikon
(Cards) untuk melihat kartu yang telah disimpan.
Langkah selanjutnya
-
Untuk detail tentang modul dan parameter yang digunakan dalam tutorial ini, lihat topik-topik di Data Studio (versi baru) dan Analisis Data.
-
DataWorks juga mendukung modul lain seperti Data Modeling, Data Quality, Data Security Guard, DataService Studio, Data Integration, dan konfigurasi penjadwalan node untuk pemantauan dan O&M data end-to-end. Untuk informasi lebih lanjut, lihat Data Modeling, Ikhtisar Data Quality, Ikhtisar Data Security Guard, DataService Studio, Data Integration, dan Konfigurasi penjadwalan node.
-
Anda juga dapat mencoba tutorial DataWorks lainnya. Untuk informasi lebih lanjut, lihat Tutorial untuk berbagai skenario bisnis.
Lampiran: Rilis dan penghapusan sumber daya
FAQ
Tabel target bank_data tidak ditampilkan saat mengunggah data
Buka . Guid harus mengikuti format "project.table" atau "odps.project.table", di mana:
-
project adalah project name. Anda dapat menemukannya dengan mengklik
bank_datadi Data Catalog pada Langkah 1, lalu memeriksa panel Basic Information di sebelah kanan. -
table adalah nama tabel, yaitu
bank_data.