ランダムフォレスト特徴量重要度評価は、ランダムフォレストモデルにおいて、各特徴量が予測結果にどの程度寄与しているかを分析する手法です。すべての決定木における各特徴量の不純度の平均減少量を計算するか、パーミュテーション重要度を使用することで、特徴量の重要度を判定します。このプロセスにより、モデルのパフォーマンスに最も影響を与える特徴量を特定できます。
コンポーネントの設定
方法1:GUIによる設定
Machine Learning Designer で、[ランダムフォレスト特徴量の重要度評価] コンポーネントをパイプラインに追加し、右側のペインでそのパラメーターを設定します:
|
タブ |
パラメータ |
説明 |
|
フィールド設定 |
特徴列 |
入力テーブルから使用する特徴列を指定します。このパラメータはオプションです。既定では、ラベル列を除くすべての列が選択されます。 |
|
ターゲット列 |
入力テーブルのラベル列の名前を指定します。 |
|
|
パラメータ設定 |
並列コンピューティングコア |
並列コンピューティングに使用するコア数を指定します。 |
|
コアあたりのメモリサイズ |
コアあたりのメモリサイズを MB 単位で指定します。 |
方法2:PAI コマンドによる設定
SQL Script コンポーネントで PAI コマンドを実行することで、[ランダムフォレスト特徴量重要度評価] コンポーネントを設定できます。 詳細については、「シナリオ 4: SQL Script コンポーネントで PAI コマンドを実行する」をご参照ください。
pai -name feature_importance -project algo_public
-DinputTableName=pai_dense_10_10
-DmodelName=xlab_m_random_forests_1_20318_v0
-DoutputTableName=erkang_test_dev.pai_temp_2252_20319_1
-DlabelColName=y
-DfeatureColNames="pdays,previous,emp_var_rate,cons_price_idx,cons_conf_idx,euribor3m,nr_employed,age,campaign,poutcome"
-Dlifecycle=28 ;
|
パラメータ |
必須 |
デフォルト値 |
説明 |
|
inputTableName |
はい |
なし |
入力テーブルの名前を指定します。 |
|
outputTableName |
はい |
なし |
出力テーブルの名前を指定します。 |
|
labelColName |
はい |
なし |
入力テーブルのラベル列の名前を指定します。 |
|
modelName |
はい |
なし |
入力モデルの名前を指定します。 |
|
featureColNames |
いいえ |
ラベル列を除くすべての列 |
入力テーブルから使用する特徴列を指定します。 |
|
inputTablePartitions |
いいえ |
テーブル全体 |
入力テーブルから使用するパーティションを指定します。 |
|
lifecycle |
いいえ |
指定なし |
出力テーブルのライフサイクルを指定します。 |
|
coreNum |
いいえ |
自動計算 |
コア数を指定します。 |
|
memSizePerCore |
いいえ |
自動計算 |
コアあたりのメモリサイズを MB 単位で指定します。 |
使用例
-
SQL ステートメントを使用して、トレーニングデータを生成します。
この例では、
bank_dataテーブルから特定の列と最初の 10 行を選択して、pai_dense_10_10という名前のテーブルを作成します。実際のビジネスニーズに基づいてテーブルを作成してください。drop table if exists pai_dense_10_10; create table pai_dense_10_10 as select age,campaign,pdays, previous, poutcome, emp_var_rate, cons_price_idx, cons_conf_idx, euribor3m, nr_employed, y from bank_data limit 10; -
パイプラインを構築します。詳細については、「カスタムパイプライン」をご参照ください。
yをラベル列に、その他すべての列を特徴列に設定します。[強制的に変換する列] パラメーターでageとcampaignを選択し、列挙型特徴として処理します。その他すべてのパラメーターは、デフォルト値を使用します。
-
パイプラインを実行し、結果を確認します。以下の出力は、ランダムフォレスト特徴量重要度評価コンポーネントによって生成された特徴量重要度の値を示しています。
colname gini entropy age 0.06625000000000003 0.13978726292803723 campaign 0.00175000000000003 0.00434851554559677 cons_conf_idx 0.01399999999999999 0.0290840949701885 cons_price_idx 0.002 0.00498044991346125 emp_var_rate 0.01470000000000003 0.0267863068026093 euribor3m 0.06300000000000003 0.132193634884603 nr_employed 0.10499999999999998 0.220322724807673 pdays 0.0845 0.177503292343975 poutcome 0.03360000000000001 0.070503271938455 previous 0.01770000000000004 0.038103810058015 -
実行が完了したら、[ランダムフォレスト-特徴量の重要度評価] コンポーネントを右クリックし、[分析レポートの表示] を選択します。
