Machine Learning Designer menggunakan pipeline untuk membangun model. Anda membuat pipeline, mengatur komponen pada canvas, dan menentukan logika pemrosesan. Tutorial ini memandu Anda dalam membangun dan menerapkan model visual untuk prediksi penyakit jantung, mulai dari persiapan data hingga penerapan.
Prasyarat
-
PAI telah diaktifkan dan ruang kerja telah dibuat. Aktifkan dan buat ruang kerja default.
-
Ruang kerja telah dikaitkan dengan resource MaxCompute. Panduan Cepat - Prasyarat.
Langkah 1: Buat pipeline
Buka Machine Learning Designer, pilih ruang kerja, lalu di pojok kanan atas, klik New Pipeline. Masukkan nama pipeline dan klik OK.
|
Parameter |
Deskripsi |
|
Workflow name |
Nama alur kerja kustom. |
|
Workflow data storage |
Jalur Bucket OSS untuk data dan model sementara. Jika tidak dikonfigurasi, nilai default-nya adalah penyimpanan ruang kerja. Untuk setiap eksekusi, Designer secara otomatis membuat folder sementara di |
|
Visibility |
|
Langkah 2: Persiapkan dan pra-proses data
Persiapkan dan pra-proses data pelatihan sebelum membangun model.
Persiapkan data
Tambahkan komponen Source/Target untuk membaca data dari MaxCompute, OSS, atau sumber lainnya. Referensi Komponen: Source/Target. Contoh ini menggunakan Read Table untuk membaca dataset publik penyakit jantung dari PAI. Heart Disease Data Set.
-
Pilih komponen Source/Target untuk membaca data.
Di daftar komponen kiri, klik Source/Target lalu seret Read Table ke canvas. Node Read Table-1 akan dibuat.
-
Konfigurasikan tabel sumber.
Pilih Read Table-1 di canvas. Di panel konfigurasi sebelah kanan, masukkan nama tabel MaxCompute di Table Name. Untuk contoh ini, masukkan
pai_online_project.heart_disease_prediction. -
Beralih ke tab Fields untuk melihat detail bidang.
Pra-proses data
Komponen regresi logistik biner memerlukan input berupa tipe DOUBLE atau BIGINT. Pra-proses dataset dengan konversi tipe data untuk pelatihan model.
-
Konversi bidang non-numerik ke tipe numerik.
-
Cari SQL script lalu seret ke canvas. Node SQL script-1 akan dibuat.
-
Hubungkan Read Table-1 ke port input t1 dari SQL script-1.
-
Konfigurasikan node tersebut.
Klik SQL script-1. Di panel konfigurasi, masukkan SQL berikut. Input source pada tab Parameters adalah t1.
select age, (case sex when 'male' then 1 else 0 end) as sex, (case cp when 'angina' then 0 when 'notang' then 1 else 2 end) as cp, trestbps, chol, (case fbs when 'true' then 1 else 0 end) as fbs, (case restecg when 'norm' then 0 when 'abn' then 1 else 2 end) as restecg, thalach, (case exang when 'true' then 1 else 0 end) as exang, oldpeak, (case slop when 'up' then 0 when 'flat' then 1 else 2 end) as slop, ca, (case thal when 'norm' then 0 when 'fix' then 1 else 2 end) as thal, (case status when 'sick' then 1 else 0 end) as ifHealth from ${t1}; -
Klik Save di pojok kiri atas canvas.
-
Klik kanan komponen SQL script-1 lalu pilih Run from Root Node To Here untuk men-debug dan menjalankan pipeline.
Node dijalankan secara berurutan. Ikon
muncul di setiap node setelah eksekusi berhasil.CatatanAnda juga dapat mengklik
(Run) di pojok kiri atas canvas untuk menjalankan seluruh pipeline. Untuk pipeline kompleks, jalankan node satu per satu guna menyederhanakan debugging. Jika eksekusi gagal, klik kanan node yang gagal lalu pilih View Log untuk pemecahan masalah. -
Setelah eksekusi selesai, klik kanan node tujuan, misalnya SQL script-1, lalu pilih untuk memverifikasi output.
-
-
Konversi semua bidang ke tipe data DOUBLE.
Seret komponen data type conversion ke canvas dan hubungkan setelah SQL script-1. Di tab Set fields, klik Select fields di bawah Columns to convert to double lalu pilih semua bidang.
-
Normalisasi fitur ke rentang [0, 1].
Seret komponen normalization ke canvas dan hubungkan setelah data type conversion-1. Pilih semua bidang di tab Set fields.
-
Pisahkan data menjadi set pelatihan dan set pengujian.
Seret komponen split ke canvas dan hubungkan setelah normalization-1. Komponen ini menghasilkan dua tabel.
Secara default, data dipisahkan dengan rasio 4:1. Sesuaikan Splitting ratio di tab Parameters. Split.
-
Klik kanan data type conversion-1 lalu pilih Run from Here untuk menjalankan node sisanya.
Langkah 3: Latih model
Prediksi penyakit jantung merupakan masalah klasifikasi biner — setiap sampel menunjukkan kondisi sakit atau sehat. Gunakan komponen regresi logistik biner untuk membangun model.
-
Seret komponen Binary Logistic Regression ke canvas dan hubungkan ke port Output Table 1 dari node split-1.
-
Konfigurasikan node tersebut.
Klik binary logistic regression-1. Di tab Set fields, atur Label column menjadi ifhealth dan Feature columns menjadi semua kolom tersisa. Binary Logistic Regression.
CatatanUntuk menerapkan model di Langkah 6: Terapkan model (opsional), Anda harus memilih binary logistic regression dan centang Generate PMML file di tab Set fields.
-
Jalankan node tersebut.
Langkah 4: Lakukan prediksi
-
Jalankan node prediksi dan lihat hasilnya.
Klik kanan node prediksi lalu pilih View Data > Output of Prediction Result.
Output berisi: ifhealth (label aktual, 1.0 atau 0.0), prediction_result (hasil prediksi), prediction_score (skor kepercayaan), dan prediction_detail (probabilitas per kelas dalam format JSON).
Langkah 5: Evaluasi model
-
Seret komponen binary classification evaluation ke canvas dan hubungkan setelah prediction-1.
-
Klik binary classification evaluation-1. Di tab Set fields, atur Original label column menjadi ifhealth.
Langkah 6: Terapkan model (opsional)
Machine Learning Designer terintegrasi dengan Elastic Algorithm Service (EAS). Setelah pelatihan, prediksi, dan evaluasi selesai, terapkan model ke EAS sebagai layanan online.
-
Setelah pipeline dijalankan, klik Model List, pilih model, lalu klik Deploy to EAS.
-
Konfirmasi konfigurasi. Terapkan model sebagai layanan online.
Model file dan Processor type telah dikonfigurasi sebelumnya. Sesuaikan parameter lain sesuai kebutuhan.
-
Klik Deploy.
Layanan dinyatakan diterapkan ketika Service status berubah dari Creating menjadi Running.
PentingUntuk menghindari biaya yang tidak perlu, klik Stop di bagian Actions saat layanan tidak lagi digunakan.
Dokumen terkait
-
Designer menyediakan templat pipeline untuk membangun model. Templat pipeline.
-
Jadwalkan pipeline offline dengan DataWorks untuk memperbarui model secara berkala. Gunakan DataWorks untuk menjadwalkan pipeline offline Designer.
-
Konfigurasikan variabel global agar pipeline lebih fleksibel dan efisien untuk layanan online serta pekerjaan yang dijadwalkan oleh DataWorks. Variabel global.
