Gbdt-LR model
関連タグ:1.GBDT Regression
2. GBDT Binary Classification
概要:GBDT+LR モデルは 2014 年に Facebook によって提案されました。このモデルは GBDT を使用して特徴を自動的にフィルタリングし、組み合わせることで新しい離散特徴ベクトルを生成し、その特徴ベクトルを LR モデルの入力として使用して最終予測結果を生成します。
導入:このモデルは、ユーザー、アイテム、コンテキストなどの多様な特徴を総合的に活用して、より包括的なレコメンデーションを生成でき、CTR のクリック率予測シナリオで広く使用されています。
Gbdt-LR モデルを開き、右上の「Open in DSW」をクリックしてください。
Gbdt + LR 統合モデルのトレーニングとサービスデプロイ
1:GBDT+LR モデルは 2014 年に Facebook によって提案されました。このモデルは GBDT を使用して特徴を自動的にフィルタリングし、組み合わせることで新しい離散特徴ベクトルを生成し、その特徴ベクトルを LR モデルの入力として使用して最終予測結果を生成します。このモデルは、ユーザー、アイテム、コンテキストなどの多様な特徴を総合的に活用して、より包括的なレコメンデーションを生成でき、CTR のクリック率予測シナリオで広く使用されています。
2:本記事では、DSW 上で Alink を使用して Gbdt+LR モデルを迅速に構築する方法と、構築したモデルをサービスとして簡単にデプロイする方法を紹介します。
この例では、useLocalEnv を使用してローカル(DSW コンテナ内)で Alink ジョブを実行し、マルチスレッドで分散コンピューティングをシミュレートしています。
大規模データの場合は、usePAIEnv を使用して大規模クラスターにジョブをサブミットしてください。詳細な使用方法は help(usePAIEnv) で確認できます。
データ準備
Adult データソース https://archive.ics.uci.edu/ml/datasets/Adult
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/csvsourcebatchop
Adult データセット(別名「census income」データセット)は、米国国勢調査データセットから抽出されたもので、合計 48,842 件のレコードを含みます。年収 50k ドル超の割合は 23.93%、年収 50k ドル未満の割合は 76.07% で、32,561 件の訓練データと 16,281 件のテストデータに分割されています。このデータセットのクラス変数は年収が 50k ドルを超えるかどうかで、属性変数には年齢、職種、学歴、職業など 14 種類の重要な情報が含まれます。そのうち 8 種類はカテゴリ離散変数に属し、残りの 6 種類は数値連続変数に属します。このデータセットは、年収が 50k ドルを超えるかを予測する分類用データセットです。

アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/intro
• https://www.yuque.com/pinshu/alink_doc/gbdtencoder
• https://www.yuque.com/pinshu/alink_doc/logisticregression
GbdtEncoder と LR の 2 つのオペレーターをパイプラインに組み込むことで、モデルの統合トレーニングを完了します。GbdtEncoder は入力データのエンコードに使用され、エンコードされた結果が LR に渡されてトレーニングが行われます。最終的にパイプラインモデルが得られ、データの推論やサービスとしてのデプロイに使用できます。
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/evalbinaryclassbatchop
• https://www.yuque.com/pinshu/alink_doc/jsonvaluebatchop
モデル評価フェーズでは、まず上記でトレーニングしたモデルを使用してテストデータを推論し、次に評価コンポーネント EvalBinaryClassBatchOp を使用して推論結果を評価し、最後に JsonValueBatchOp コンポーネントを使用して評価結果の抽出を完了します。
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/aksinkbatchop
モデル書き出しフェーズでは、AkSinkBatchOp を使用してモデルをファイルシステムに書き出します。ファイルシステムはローカルファイルシステム(コードに示す通り)またはネットワークファイルシステム(OSS など)を指定できます。
モデルのロードパスは、モデル書き出し時と同じで、ローカルファイルシステム(コードに示す通り)またはネットワークファイルシステム(OSS など)を指定できます。
2. GBDT Binary Classification
概要:GBDT+LR モデルは 2014 年に Facebook によって提案されました。このモデルは GBDT を使用して特徴を自動的にフィルタリングし、組み合わせることで新しい離散特徴ベクトルを生成し、その特徴ベクトルを LR モデルの入力として使用して最終予測結果を生成します。
導入:このモデルは、ユーザー、アイテム、コンテキストなどの多様な特徴を総合的に活用して、より包括的なレコメンデーションを生成でき、CTR のクリック率予測シナリオで広く使用されています。
直接使用する
Gbdt-LR モデルを開き、右上の「Open in DSW」をクリックしてください。
Gbdt + LR 統合モデルのトレーニングとサービスデプロイ
1:GBDT+LR モデルは 2014 年に Facebook によって提案されました。このモデルは GBDT を使用して特徴を自動的にフィルタリングし、組み合わせることで新しい離散特徴ベクトルを生成し、その特徴ベクトルを LR モデルの入力として使用して最終予測結果を生成します。このモデルは、ユーザー、アイテム、コンテキストなどの多様な特徴を総合的に活用して、より包括的なレコメンデーションを生成でき、CTR のクリック率予測シナリオで広く使用されています。
2:本記事では、DSW 上で Alink を使用して Gbdt+LR モデルを迅速に構築する方法と、構築したモデルをサービスとして簡単にデプロイする方法を紹介します。
大規模データへのスケーリング
この例では、useLocalEnv を使用してローカル(DSW コンテナ内)で Alink ジョブを実行し、マルチスレッドで分散コンピューティングをシミュレートしています。
大規模データの場合は、usePAIEnv を使用して大規模クラスターにジョブをサブミットしてください。詳細な使用方法は help(usePAIEnv) で確認できます。
データ準備
Adult データソース https://archive.ics.uci.edu/ml/datasets/Adult
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/csvsourcebatchop
Adult データセット(別名「census income」データセット)は、米国国勢調査データセットから抽出されたもので、合計 48,842 件のレコードを含みます。年収 50k ドル超の割合は 23.93%、年収 50k ドル未満の割合は 76.07% で、32,561 件の訓練データと 16,281 件のテストデータに分割されています。このデータセットのクラス変数は年収が 50k ドルを超えるかどうかで、属性変数には年齢、職種、学歴、職業など 14 種類の重要な情報が含まれます。そのうち 8 種類はカテゴリ離散変数に属し、残りの 6 種類は数値連続変数に属します。このデータセットは、年収が 50k ドルを超えるかを予測する分類用データセットです。

モデルトレーニング
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/intro
• https://www.yuque.com/pinshu/alink_doc/gbdtencoder
• https://www.yuque.com/pinshu/alink_doc/logisticregression
GbdtEncoder と LR の 2 つのオペレーターをパイプラインに組み込むことで、モデルの統合トレーニングを完了します。GbdtEncoder は入力データのエンコードに使用され、エンコードされた結果が LR に渡されてトレーニングが行われます。最終的にパイプラインモデルが得られ、データの推論やサービスとしてのデプロイに使用できます。
モデル評価
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/evalbinaryclassbatchop
• https://www.yuque.com/pinshu/alink_doc/jsonvaluebatchop
モデル評価フェーズでは、まず上記でトレーニングしたモデルを使用してテストデータを推論し、次に評価コンポーネント EvalBinaryClassBatchOp を使用して推論結果を評価し、最後に JsonValueBatchOp コンポーネントを使用して評価結果の抽出を完了します。
モデルの書き出し
アルゴリズム関連ドキュメント:
• https://www.yuque.com/pinshu/alink_doc/aksinkbatchop
モデル書き出しフェーズでは、AkSinkBatchOp を使用してモデルをファイルシステムに書き出します。ファイルシステムはローカルファイルシステム(コードに示す通り)またはネットワークファイルシステム(OSS など)を指定できます。
モデルのロードと推論
モデルのロードパスは、モデル書き出し時と同じで、ローカルファイルシステム(コードに示す通り)またはネットワークファイルシステム(OSS など)を指定できます。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
