線形回帰は、2 つ以上の変数間の定量的関係を決定するために使用される統計的回帰アルゴリズムです。Machine Learning Designer (ビジュアルモデリング) には、過去の融資データに基づいて農業融資の適格性を迅速に予測できる、プリセットの線形回帰アルゴリズムテンプレートが用意されています。このトピックでは、Designer でプリセットの線形回帰テンプレートを使用する方法について説明します。
背景情報
農業融資の適格性の判断は、典型的なデータマイニングの問題です。貸し手は、申請者の年収、作物の種類、借入履歴などの過去の融資データに基づいて予測モデルを構築し、返済能力を評価します。
このパイプラインで使用されるデータは架空のものであり、デモ目的でのみ使用されます。
前提条件
-
ワークスペースを作成済みであること。詳細については、「ワークスペースの作成と管理」をご参照ください。
-
MaxCompute リソースをワークスペースに関連付けていること。詳細については、「ワークスペースの作成と管理」をご参照ください。
データセット
このパイプラインのデータセットには、次のフィールドが含まれます。
|
フィールド名 |
タイプ |
説明 |
|
id |
STRING |
データレコードの一意の識別子。 |
|
name |
STRING |
ユーザー名。 |
|
region |
STRING |
ユーザーのリージョン。文字列値は、北から南の順に数値にマッピングされます。 |
|
farmsize |
DOUBLE |
土地面積。 |
|
rainfall |
DOUBLE |
降雨量。 |
|
landquality |
DOUBLE |
土地の質。値が高いほど質が良いことを示します。 |
|
farmincome |
DOUBLE |
年収。 |
|
maincrop |
STRING |
栽培されている作物の種類。 |
|
claimtype |
STRING |
融資の種類。 |
|
claimvalue |
DOUBLE |
融資額。 |
農業融資適格性の予測
-
Machine Learning Designer (ビジュアルモデリング) のページに移動します。
-
PAI コンソールにログインします。
-
左側のナビゲーションウィンドウで、[ワークスペース] をクリックします。[ワークスペース] ページで、管理するワークスペースの名前をクリックします。
-
左側のナビゲーションウィンドウで、 を選択します。
-
-
パイプラインを作成します。
-
[デザイナー] ページで、Preset Templates タブをクリックします。
-
テンプレートのリストで [農業融資予測] テンプレートを見つけ、Create をクリックします。
-
Create Pipeline ダイアログボックスで、パラメーターを設定します。デフォルト設定を使用できます。
Data Storage パラメーターは OSS バケットパスを指定します。このパスは、パイプラインの実行時に生成される一時データとモデルを格納するために使用されます。
-
パイプラインリストから作成したパイプラインを選択し、Open をクリックします。
-
システムは、プリセットテンプレートに基づいて、次の図に示すようにキャンバス上にパイプラインを自動的に構築します。

セクション
説明
①
「データテーブルの読み込み」コンポーネントは、次の 2 つのデータセットをインポートします:
-
融資トレーニングセット: farmsize や rainfall などの特徴量を含む、合計 100 件の過去の融資レコード。回帰モデルのトレーニングに使用されます。claimvalue 特徴量は、回収された融資額を表します。
-
融資予測セット: 今年融資を申請した合計 71 人。このセットでは、claimvalue は申請融資額を表します。
パイプラインは、融資トレーニングセットの過去のデータを使用して、融資予測セットのどの申請者に融資を承認すべきかを予測します。
②
文字列データは、その意味に基づいて数値にマッピングされます。たとえば、region フィールドの場合、値 north、middle、south は、北から南の順にそれぞれ 0、1、2 にマッピングされ、結果は DOUBLE 型に変換されます。
③
まず、[線形回帰] コンポーネントを使用して過去のデータをトレーニングし、回帰モデルを生成します。次に、Predicted コンポーネントで、回帰モデルを使用して予測データセットの融資発行を予測します。最後に、[列の追加] コンポーネントを使用して、ユーザー ID、予測値、および申請融資額を結合します。結果は次の図のようになります。
ここで、prediction_score はユーザーの返済能力 (返済可能と予測される金額) を表します。④
[評価] コンポーネントは、モデルのパフォーマンスを評価します。評価メトリックの詳細については、「評価メトリック」をご参照ください。
⑤
[SQL マッピング] コンポーネントは、結果をフィルター処理して、どの申請者が融資の対象となるかを特定します。各申請者について、予測された返済能力が申請融資額よりも大きい場合、融資は承認されます。
表 1. 評価メトリック
メトリック
説明
MAE
平均絶対誤差
MAPE
平均絶対パーセント誤差
MSE
平均二乗誤差
R
重相関係数
R2
決定係数
RMSE
平方根平均二乗誤差
SAE
絶対誤差の合計
SSE
二乗誤差の合計
SSR
回帰による平方和
SST
平方和の合計
count
行数。
predictionMean
予測結果の平均値。
yMean
元のターゲット変数の平均値。
-
-
-
パイプラインを実行し、出力を表示します。
-
キャンバスの上部にある実行アイコン
をクリックして、パイプラインを実行します。 -
パイプラインの実行が完了したら、キャンバス上の [SQL マッピング] コンポーネントを右クリックし、 を選択して、融資の対象となる申請者を表示します。

-
関連トピック
これらのアルゴリズムコンポーネントの詳細については、以下をご参照ください: