本記事では、北京の1年間の実際の大気質データを分析してヘイズ予測モデルを構築する方法を説明します。このモデルは、ヘイズの主要な指標である PM 2.5 レベルに最も大きな影響を与える汚染物質を特定するのに役立ちます。
データセット
この実験では、2016年の北京の1時間ごとの大気質データを使用します。次の表に、データセットのフィールドを示します。
|
パラメーター |
型 |
説明 |
|
time |
STRING |
日付 (日まで正確)。 |
|
hour |
STRING |
データが記録された時間。 |
|
pm2 |
STRING |
PM 2.5 インデックス。 |
|
pm10 |
STRING |
PM 10 インデックス。 |
|
so2 |
STRING |
二酸化硫黄 (SO2) インデックス。 |
|
co |
STRING |
一酸化炭素 (CO) インデックス。 |
|
no2 |
STRING |
二酸化窒素 (NO2) インデックス。 |
操作手順
-
ビジュアルモデリングのページへ移動
-
PAI コンソールにログインします。
-
左側のナビゲーションウィンドウで、[ワークスペース] をクリックします。[ワークスペース] ページで、管理するワークスペースの名前をクリックします。
-
左側のナビゲーションウィンドウで、 を選択します。
-
-
パイプラインの構築
-
[ヘイズ予測] セクションで、Create をクリックします。
-
パイプラインリストで、[ヘイズ予測] パイプラインをダブルクリックし、キャンバスに開きます。
-
システムは、プリセットテンプレートに基づいて、次の図に示すようにパイプラインを自動的に構築します。

セクション
説明
①
データインポートと前処理:
-
[データテーブルの読み込み] コンポーネントはデータソースをインポートします。
-
[型変換] コンポーネントは、データを STRING 型から DOUBLE 型に変換します。
-
[SQL スクリプト] コンポーネントは、ラベル列を 0 と 1 のバイナリ値に変換します。この実験では、pm2 列がラベル列です。値が 200 を超える場合は深刻なヘイズを示しているため 1 に設定され、それ以外の場合は 0 に設定されます。SQL ステートメントは次のとおりです。
select time,hour,(case when pm2>200 then 1 else 0 end),pm10,so2,co,no2 from ${t1}; -
[正規化] コンポーネントは、測定単位を削除して、さまざまな汚染物質指標のスケールを標準化します。
②
統計分析:
-
[ヒストグラム] コンポーネントは、各汚染物質の分布を可視化します。
たとえば、PM 2.5 の最も頻度の高い間隔は 11.74 から 15.61 で、次の図に示すように 430 回発生しました。

-
[データビュー] コンポーネントは、各汚染物質の異なる値の範囲が結果にどのように影響するかを可視化します。
たとえば、no2 の場合、112.33 から 113.9 の間隔には、ラベル値が 0 のレコードが 7 件、ラベル値が 1 のレコードが 9 件含まれています (次の図を参照)。これは、no2 がこの範囲内にある場合、重度のヘイズが発生する可能性が高いことを示しています。エントロピーとジニは、この特徴量の間隔からの情報利得を測定します。値が大きいほど、ラベルへの影響が大きくなります。

③
モデルトレーニングと予測。このパイプラインは、Random Forest と [ロジスティック回帰] コンポーネントを使用してモデルをトレーニングします。
④
モデル評価。
-
-
-
パイプラインの実行とモデルパフォーマンスの表示
-
キャンバスの上にある実行ボタン
をクリックします。 -
パイプラインが完了したら、キャンバス上で Random Forest コンポーネントの下流にある [二項分類の評価] コンポーネントを右クリックし、Visual Analysis を選択します。
-
[二項分類の評価] ダイアログボックスで、Evaluation Charts タブをクリックして、Random Forest コンポーネントでトレーニングされたモデルの予測性能を表示します。
曲線下面積 (AUC) 値は、Random Forest コンポーネントでトレーニングされた霞予測モデルの精度が 99% を超えることを示しています。 -
キャンバスで、[ロジスティック回帰] コンポーネントの下流にある [二項分類の評価] コンポーネントを右クリックし、Visual Analysis を選択します。
-
[二項分類の評価] ダイアログボックスで、Evaluation Charts タブをクリックすると、[ロジスティック回帰] コンポーネントによってトレーニングされたモデルの予測性能を表示できます。
AUC 値は、[ロジスティック回帰] コンポーネントによってトレーニングされた霞予測モデルの精度が 98% を超えていることを示しています。
-