Berdasarkan teorema Bayes, Naive Bayes adalah algoritma klasifikasi probabilistik yang mengasumsikan semua fitur dalam data masukan bersifat independen. Komponen Naive Bayes di Machine Learning Designer (sebelumnya Studio) mendukung berbagai permasalahan klasifikasi. Topik ini menjelaskan cara mengonfigurasi komponen Naive Bayes.
Limitations
Mesin komputasi yang didukung adalah MaxCompute.
Konfigurasi komponen
Anda dapat mengonfigurasi parameter komponen Naive Bayes dengan salah satu cara berikut.
Metode 1: Designer
Konfigurasikan parameter komponen pada halaman pipeline Visualized Modeling (Designer).
|
Tab |
Parameter |
Description |
|
Fields Setting |
Feature column |
Secara default, semua kolom kecuali kolom label digunakan sebagai kolom fitur. Tipe data yang didukung adalah DOUBLE, STRING, dan BIGINT. |
|
Excluded columns |
Kolom yang akan dikecualikan dari pelatihan. Parameter ini tidak dapat digunakan bersamaan dengan Feature column. |
|
|
Forced conversion column |
Aturan penguraian data adalah sebagai berikut:
Catatan
Untuk mengurai kolom BIGINT sebagai tipe CATEGORICAL, Anda harus menggunakan parameter forceCategorical. |
|
|
Label column |
Menentukan kolom label dalam tabel input. Anda hanya dapat memilih kolom non-fitur. Tipe data yang didukung adalah STRING, DOUBLE, dan BIGINT. |
|
|
Input is in sparse format |
Pilih opsi ini jika data input bersifat sparse dan direpresentasikan dalam format pasangan kunci-nilai (KV). |
|
|
Key-value pair delimiter for sparse input |
Delimiter yang memisahkan pasangan kunci-nilai. Nilai default-nya adalah koma (,). |
|
|
Key and value delimiter for sparse input |
Delimiter yang memisahkan kunci dari nilainya. Nilai default-nya adalah titik dua (:). |
|
|
Whether to generate PMML |
Pilih kotak centang ini untuk menghasilkan model Predictive Model Markup Language (PMML). Jika jalur penyimpanan data belum dikonfigurasi untuk pipeline, klik Create Now untuk menetapkan jalur tersebut. |
|
|
Tuning |
Number of cores |
Dialokasikan secara otomatis oleh sistem. |
|
Memory per core (MB) |
Dialokasikan secara otomatis oleh sistem. |
Metode 2: Perintah PAI
Anda dapat menggunakan komponen SQL Script untuk menjalankan perintah PAI guna mengonfigurasi parameter komponen. Untuk informasi selengkapnya, lihat SQL Script.
PAI -name NaiveBayes -project algo_public
-DinputTablePartitions="pt=20150501"
-DmodelName="xlab_m_NaiveBayes_23772"
-DlabelColName="poutcome"
-DfeatureColNames="age,previous,cons_conf_idx,euribor3m"
-DinputTableName="bank_data_partition";
|
Parameter |
Required |
Description |
Default |
|
inputTableName |
Yes |
Nama tabel input. |
None |
|
inputTablePartitions |
No |
Partisi dalam tabel input yang akan digunakan untuk pelatihan. |
All partitions |
|
modelName |
Yes |
Nama model output. |
None |
|
labelColName |
Yes |
Nama kolom label dalam tabel input. |
None |
|
featureColNames |
No |
Nama kolom fitur dalam tabel input yang digunakan untuk pelatihan. |
All columns except the label column. |
|
excludedColNames |
No |
Menentukan kolom yang akan dikecualikan dari penggunaan sebagai fitur. Parameter ini tidak dapat digunakan bersamaan dengan featureColNames. |
Empty |
|
forceCategorical |
No |
Aturan penguraian data adalah sebagai berikut:
Catatan
Untuk mengurai kolom BIGINT sebagai tipe CATEGORICAL, Anda harus menggunakan parameter forceCategorical. |
BIGINT diperlakukan sebagai tipe kontinu. |
|
coreNum |
No |
Jumlah core yang digunakan untuk komputasi. |
System-allocated |
|
memSizePerCore |
No |
Ukuran memori per core dalam MB. Nilai yang valid: 1 hingga 65536. |
System-allocated |
Contoh
-
Siapkan data pelatihan dan data uji.
-
Gunakan client MaxCompute untuk membuat tabel
train_datadantest_dataguna menyimpan data pelatihan dan data uji, masing-masing. Kedua tabel harus memiliki nama kolom dan tipe data berikut:id bigint, y bigint, f0 double, f1 double, f2 double, f3 double, f4 double, f5 double, f6 double, f7 double. Untuk petunjuk pemasangan dan konfigurasi client MaxCompute, lihat MaxCompute client (odpscmd). Untuk petunjuk pembuatan tabel, lihat Create tables. -
Impor data pelatihan dan data uji berikut ke dalam tabel
train_datadantest_data, masing-masing. Untuk petunjuk impor data, lihat Import data.-
Data pelatihan
id
y
f0
f1
f2
f3
f4
f5
f6
f7
1
-1
-0.294118
0.487437
0.180328
-0.292929
-1
0.00149028
-0.53117
-0.0333333
2
+1
-0.882353
-0.145729
0.0819672
-0.414141
-1
-0.207153
-0.766866
-0.666667
3
-1
-0.0588235
0.839196
0.0491803
-1
-1
-0.305514
-0.492741
-0.633333
4
+1
-0.882353
-0.105528
0.0819672
-0.535354
-0.777778
-0.162444
-0.923997
-1
5
-1
-1
0.376884
-0.344262
-0.292929
-0.602837
0.28465
0.887276
-0.6
6
+1
-0.411765
0.165829
0.213115
-1
-1
-0.23696
-0.894962
-0.7
7
-1
-0.647059
-0.21608
-0.180328
-0.353535
-0.791962
-0.0760059
-0.854825
-0.833333
8
+1
0.176471
0.155779
-1
-1
-1
0.052161
-0.952178
-0.733333
9
-1
-0.764706
0.979899
0.147541
-0.0909091
0.283688
-0.0909091
-0.931682
0.0666667
10
-1
-0.0588235
0.256281
0.57377
-1
-1
-1
-0.868488
0.1
-
Data uji
id
y
f0
f1
f2
f3
f4
f5
f6
f7
1
+1
-0.882353
0.0854271
0.442623
-0.616162
-1
-0.19225
-0.725021
-0.9
2
+1
-0.294118
-0.0351759
-1
-1
-1
-0.293592
-0.904355
-0.766667
3
+1
-0.882353
0.246231
0.213115
-0.272727
-1
-0.171386
-0.981213
-0.7
4
-1
-0.176471
0.507538
0.278689
-0.414141
-0.702128
0.0491804
-0.475662
0.1
5
-1
-0.529412
0.839196
-1
-1
-1
-0.153502
-0.885568
-0.5
6
+1
-0.882353
0.246231
-0.0163934
-0.353535
-1
0.0670641
-0.627669
-1
7
-1
-0.882353
0.819095
0.278689
-0.151515
-0.307329
0.19225
0.00768574
-0.966667
8
+1
-0.882353
-0.0753769
0.0163934
-0.494949
-0.903073
-0.418778
-0.654996
-0.866667
9
+1
-1
0.527638
0.344262
-0.212121
-0.356974
0.23696
-0.836038
-0.8
10
+1
-0.882353
0.115578
0.0163934
-0.737374
-0.56974
-0.28465
-0.948762
-0.933333
-
-
-
Buat dan jalankan pipeline dengan mengikuti langkah-langkah berikut. Untuk informasi selengkapnya, lihat algorithm modeling.

-
Dari daftar komponen di Designer, seret komponen berikut ke kanvas: dua komponen Read Table, satu komponen Naive Bayes, satu komponen Prediction, dan satu komponen Multiclass Classification Evaluation.
-
Sambungkan node untuk membangun pipeline.
-
Konfigurasikan parameter komponen.
-
Klik komponen Read Table-1 pada kanvas. Di panel sisi kanan, pada tab select table, atur table name menjadi train_data.
-
Klik komponen Read Table-2 pada kanvas. Di panel sisi kanan, pada tab select table, atur table name menjadi test_data.
-
Klik komponen Naive Bayes-1 pada kanvas. Di panel sisi kanan, atur parameter sebagai berikut. Biarkan parameter lain tetap pada nilai default-nya.
Tab
Parameter
Description
field settings
feature column
Pilih kolom f0, f1, f2, f3, f4, f5, f6, dan f7.
label column
Pilih kolom y.
-
Klik komponen Prediction-1 pada kanvas. Di panel sisi kanan, pada tab field settings, atur reserved columns menjadi id dan y. Biarkan parameter lain tetap pada nilai default-nya.
-
Klik komponen Multiclass Classification Evaluation-1 pada kanvas. Di panel sisi kanan, pada tab field settings, atur original classification result column menjadi y. Biarkan parameter lain tetap pada nilai default-nya.
-
-
Setelah komponen dikonfigurasi, klik tombol Run
untuk menjalankan pipeline.
-
-
Setelah pipeline selesai dijalankan, klik kanan komponen Prediction-1 dan pilih dari menu pintasan. Tabel hasil prediksi berisi kolom id, y (label asli), prediction_result (label prediksi, dengan nilai 1 atau -1), prediction_score (skor prediksi), dan prediction_detail (detail probabilitas kelas dalam format JSON). Untuk 10 sampel uji, skor prediksinya mendekati 1, menunjukkan tingkat kepercayaan model yang tinggi dan performa yang baik.
Referensi
-
Setelah Anda menjalankan komponen Naive Bayes untuk menghasilkan model PMML, Anda dapat menerapkan model tersebut sebagai layanan online. Untuk informasi selengkapnya, lihat Deploy a model as an online service.
-
Untuk informasi selengkapnya tentang Machine Learning Designer, lihat Overview of Machine Learning Designer.
-
Machine Learning Designer mencakup beberapa komponen algoritma preset. Anda dapat memilih salah satu yang paling sesuai dengan kasus penggunaan Anda. Untuk informasi selengkapnya, lihat Component reference: Overview of all components.