北京で収集された 1 年分の実データを分析し、PM 2.5 濃度に最も大きな影響を与える汚染物質を特定するモデルを構築します。
データセット
本実験では、2016 年の北京における時間単位の大気質データを使用します。次の表は、データセット内のフィールドを示しています。
|
フィールド名 |
タイプ |
説明 |
|
time |
STRING |
データ収集日。 |
|
hour |
STRING |
データ収集時刻(時間)。 |
|
pm2 |
STRING |
PM 2.5 インデックス。 |
|
pm10 |
STRING |
PM 10 インデックス。 |
|
so2 |
STRING |
二酸化硫黄 (SO2) インデックス。 |
|
co |
STRING |
一酸化炭素 (CO) インデックス。 |
|
no2 |
STRING |
二酸化窒素 (NO2) インデックス。 |
大気質の予測
-
Machine Learning Designer ページに移動します。
-
PAI コンソールにログインします。
-
左側のナビゲーションウィンドウで、[ワークスペース] をクリックします。ワークスペースページで、管理対象のワークスペース名をクリックします。
-
左側のナビゲーションウィンドウで、 の順に選択します。
-
-
パイプラインを構築します。
-
Designer ページで、事前定義テンプレート タブをクリックします。
-
[大気質予測] セクションで、作成 をクリックします。
-
ワークフローの新規作成 ダイアログボックスで、パラメーターを設定します。すべてのパラメーターをデフォルト設定のまま使用できます。
ワークフローデータストレージ パラメーターは、パイプライン実行中に生成される一時データおよびモデルを保存する OSS バケットパスを指定します。
-
OK をクリックします。
パイプラインの作成には約 10 秒かかります。
-
パイプライン一覧で、[大気質予測] パイプラインをダブルクリックして開きます。
-
システムがプリセットテンプレートから自動的にパイプラインを構築します。

領域
説明
①
データのインポートと前処理:
-
[テーブルデータの読み込み] コンポーネントがデータセットをインポートします。
-
[型変換] コンポーネントが STRING 型のデータを DOUBLE 型に変換します。
-
[SQL スクリプト] コンポーネントがラベル列を 0 または 1 のバイナリ形式に変換します。本実験では、pm2 列がラベル列です。200 を超える値(重度の大気汚染を示す)は 1 としてマークされ、その他の値は 0 としてマークされます。次の SQL ステートメントが使用されます:
select time,hour,(case when pm2>200 then 1 else 0 end),pm10,so2,co,no2 from ${t1}; -
[正規化] コンポーネントが汚染物質指標データを標準化し、ディメンションを除去します。
②
統計分析:
-
ヒストグラム コンポーネントが各汚染物質のディストリビューションを可視化します。
たとえば、PM2.5 の場合、最も頻度が高い値の範囲は 11.74 ~ 15.61 で、430 回発生しています(下図参照)。

-
[データビュー] コンポーネントが各汚染物質の値の範囲が結果に与える影響を可視化します。
たとえば、no2 特徴量の場合、112.33 ~ 113.9 の範囲にはターゲットラベル 0 のインスタンスが 7 件、ターゲットラベル 1 のインスタンスが 9 件含まれています(下図参照)。これは、no2 値がこの範囲にある場合、重度の大気汚染の確率が高くなることを示しています。エントロピーおよびジニ係数は、この特徴量範囲がターゲット値に与える情報利得(影響度)を測定します。値が大きいほど、影響が大きいことを意味します。

③
モデルのトレーニングと予測:ランダムフォレスト コンポーネントおよび ロジスティック回帰 (二値分類) コンポーネントがモデルをトレーニングします。
④
モデル評価。
-
-
-
パイプラインを実行し、モデルの結果を確認します。
-
キャンバス上部の実行アイコン
をクリックします。 -
パイプラインの実行が完了したら、キャンバス上の ランダムフォレスト コンポーネントの下流にある [バイナリ分類評価] コンポーネントを右クリックし、ショートカットメニューから ビジュアル分析 を選択します。
-
[バイナリ分類評価] ダイアログボックスで、評価チャート タブをクリックし、ランダムフォレスト モデルの予測結果を確認します。
曲線下面積(AUC)は99%を超えています。これは、ランダムフォレスト モデルの高い予測精度を示しています。 -
キャンバス上の ロジスティック回帰 (二値分類) コンポーネントの下流にある [バイナリ分類評価] コンポーネントを右クリックし、ショートカットメニューから ビジュアル分析 を選択します。
-
[バイナリ分類評価] ダイアログボックスで、評価チャート タブをクリックし、ロジスティック回帰 (二値分類) モデルの予測結果を確認します。
AUC は 98 % を超えており、ロジスティック回帰 (二値分類) モデルの予測精度が高いことを示しています。
-