Evaluasi Pentingnya Fitur Random Forest adalah metode untuk menganalisis kontribusi setiap fitur terhadap hasil prediksi dalam model random forest. Metode ini menentukan pentingnya fitur dengan menghitung penurunan rata-rata impurity untuk setiap fitur di seluruh decision tree atau menggunakan permutation importance, sehingga membantu mengidentifikasi fitur yang paling berdampak terhadap kinerja model.
Konfigurasi Komponen
Metode 1: Metode GUI
Di Machine Learning Designer, tambahkan komponen Random Forest Feature Importance Evaluation ke pipeline Anda dan konfigurasikan parameternya di panel sebelah kanan:
|
Tab |
Parameter |
Description |
|
Field Settings |
Feature Columns |
Kolom fitur yang akan digunakan dari tabel input. Parameter ini opsional. Secara default, semua kolom kecuali kolom label dipilih. |
|
Target Column |
Wajib diisi. |
|
|
Parameter Settings |
Parallel Computing Cores |
Jumlah core untuk komputasi paralel. |
|
Memory Size per Core |
Ukuran memori per core, dalam MB. |
Metode 2: Perintah PAI
Anda dapat mengonfigurasi komponen Random Forest Feature Importance Evaluation dengan menjalankan perintah PAI di komponen SQL Script. Untuk informasi lebih lanjut, lihat Skenario 4: Jalankan perintah PAI di komponen SQL Script.
pai -name feature_importance -project algo_public
-DinputTableName=pai_dense_10_10
-DmodelName=xlab_m_random_forests_1_20318_v0
-DoutputTableName=erkang_test_dev.pai_temp_2252_20319_1
-DlabelColName=y
-DfeatureColNames="pdays,previous,emp_var_rate,cons_price_idx,cons_conf_idx,euribor3m,nr_employed,age,campaign,poutcome"
-Dlifecycle=28 ;
|
Parameter |
Required |
Default |
Description |
|
inputTableName |
Yes |
None |
Nama tabel input. |
|
outputTableName |
Yes |
None |
Nama tabel output. |
|
labelColName |
Yes |
None |
Nama kolom label di tabel input. |
|
modelName |
Yes |
None |
Nama model input. |
|
featureColNames |
No |
All columns except the label column |
Kolom fitur yang akan digunakan dari tabel input. |
|
inputTablePartitions |
No |
The entire table |
Partisi yang akan digunakan dari tabel input. |
|
lifecycle |
No |
Not specified |
Siklus hidup tabel output. |
|
coreNum |
No |
Calculated automatically |
Jumlah core. |
|
memSizePerCore |
No |
Calculated automatically |
Ukuran memori per core, dalam MB. |
Contoh
-
Gunakan Pernyataan SQL untuk menghasilkan data pelatihan.
Contoh ini membuat tabel bernama
pai_dense_10_10dengan memilih kolom tertentu dan 10 baris pertama dari tabelbank_data. Anda dapat membuat tabel sesuai kebutuhan bisnis aktual Anda.drop table if exists pai_dense_10_10; create table pai_dense_10_10 as select age,campaign,pdays, previous, poutcome, emp_var_rate, cons_price_idx, cons_conf_idx, euribor3m, nr_employed, y from bank_data limit 10; -
Buat pipeline. Untuk informasi lebih lanjut, lihat Custom pipelines.
Tetapkan
ysebagai kolom label, dan semua kolom lainnya sebagai kolom fitur. Untuk parameter Columns Forced to Convert, pilihagedancampaignuntuk memprosesnya sebagai fitur enumerasi. Gunakan nilai default untuk semua parameter lainnya.
-
Jalankan pipeline dan lihat hasilnya. Output berikut menunjukkan nilai pentingnya fitur yang dihasilkan oleh komponen Random Forest Feature Importance Evaluation.
colname gini entropy age 0.06625000000000003 0.13978726292803723 campaign 0.00175000000000003 0.00434851554559677 cons_conf_idx 0.01399999999999999 0.0290840949701885 cons_price_idx 0.002 0.00498044991346125 emp_var_rate 0.01470000000000003 0.0267863068026093 euribor3m 0.06300000000000003 0.132193634884603 nr_employed 0.10499999999999998 0.220322724807673 pdays 0.0845 0.177503292343975 poutcome 0.03360000000000001 0.070503271938455 previous 0.01770000000000004 0.038103810058015 -
Setelah eksekusi selesai, klik kanan komponen Random Forest Feature Importance Evaluation dan pilih View Analytics Report.
