Ali launched a new sorting model
背景
E コマースシナリオにおけるユーザークリックの最適化を例にとると、レコメンデーションシステムのタスクは、大量の候補プロダクトの中からユーザーが最も関心を持ち、クリックする可能性の高いプロダクトを選定することである。取得の効率を向上させるため、取得は通常 2 つのフェーズに分けられる。リコール / 候補生成フェーズでは、U2I 相関に基づいて全体の候補セットから少数の候補プロダクト (たとえば 1000 件) を選別し、協調フィルタリングがよく使用される。ランキングフェーズでは、ランキングモデルに基づいて少数の候補プロダクトの CTR を推定し、ソート後にユーザーに表示する。
レコメンデーションシステムにおける CTR 推定の重要性は言うまでもなく、パーソナライゼーションは CTR モデルの効果向上の鍵である。本稿では、新しいランキングモデルを紹介する。主な考え方は、マッチングにおける協調フィルタリングの概念を統合し、ランキングモデルで U2I 相関を表現することで、モデルのパーソナライゼーション能力を向上させ、良好な結果を達成することである。
検索シナリオでは、ユーザーが検索語を入力して意図を明示的に表現するが、レコメンデーションシナリオではユーザーの意図を明示的に取得する方法がない。ユーザーの意図はユーザー行動シーケンスに隠されている。ユーザー行動シーケンスはレコメンデーションにおけるクエリそのものと言える。したがって、ユーザーの意図を抽出するためにユーザー行動シーケンスをモデル化することが非常に重要である。DIN[1] や DIEN[2] などの後続の研究はユーザー興味の表現に注目してモデルの効果を向上させているが、私たちの研究はこの基盤の上でさらに一歩前進し、U2I 相関の表現に注目している。U2I 相関はターゲットアイテムに対するユーザーの選好強度を直接測定できる。ユーザー特徴 (ユーザー興味の特性化) から U2I クロス特徴 (U2I 相関の特性化) へのアップグレードとして理解できる。
U2I 相関の特性化において、リコールにおける協調フィルタリング (CF) が想起される。I2I CF は業界で最も一般的な方法であり、I2I の類似度を事前計算し、ユーザー行動と I2I 類似度に基づいて U2I 相関を間接的に取得する。行列分解の方法はより直接的で、ユーザー表現とプロダクト表現の内積を通じて U2I 相関を直接取得する。ここではこの方法を暫定的に U2I CF と呼ぶ。最近では、いくつかの深層学習手法が関連分野に登場している。たとえば、I2I CF における NAIS[7] はアテンションメカニズムを使用してユーザー行動の重要性を区別しており、DIN[1] と類似している。U2I CF における DNN4YouTube[3] は、モデルのリコールを大規模な多クラス分類問題として扱う。これは DeepMatch と呼ばれることが多い。DeepMatch は行列分解技術の非線形汎化と見なすことができる。私たちは協調フィルタリングにおける U2I CF と I2I CF に基づいてそれぞれ 2 つのサブネットワークを構築し、U2I 相関を表現する。
モデル紹介
DMR (Deep Match to Rank) モデルのネットワーク構造を図に示す。MLP の暗黙的な特徴交叉だけでは U2I 相関を捕捉するのは困難である。MLP に入力される U2I クロス特徴として、手動で構築された U2I クロス特徴に加えて、User-to-Item サブネットワークと Item-to-Item サブネットワークを使用して U2I 相関を表現し、モデルの表現力をさらに向上させる。
User-to-Item ネットワーク
行列分解の手法に着想を得て、ユーザー表現とアイテム表現の内積を使用して U2I 相関を表現する。これは明示的な特徴交叉と見なせる。ユーザー表現はユーザー行動特徴に基づいて取得される。単純な方法として、各行動特徴を同等に重要視する平均プーリングがある。行動時間などのコンテキスト特徴が行動を区別する上での重要性を考慮し、アテンションメカニズムを採用し、位置エンコーディング (Transformer[4] を参照) などのコンテキスト特徴をクエリとして使用し、各行動の重みを適応的に学習する。ここで、時系列順に並べた位置エンコーディングされた行動シーケンスの番号は、行動時間の距離を表現している。式は以下の通りである。
ここで、は t 番目の位置埋め込み、は t 番目のユーザー行動の特徴ベクトル、は学習パラメータ、は t 番目のユーザー行動の正規化重みである。加重和プーリングを通じて固定長の特徴ベクトルを取得し、全結合層を通じて非線形変換を行ってアイテム表現の次元に合わせたユーザー表現を取得する。最終的なユーザー表現は以下のように定義できる。
ここで、関数は非線形変換を表し、入力次元は、出力次元は、は t 番目のユーザー行動の重み付き特徴ベクトルである。
ターゲットアイテムの表現は埋め込みルックアップから直接取得される。この埋め込み行列は出力専用の別行列であり、入力時にアイテムが使用する埋め込み行列 V とは異なる (word2vec[6] の単語と同様に、入力と出力の 2 つの表現を持つ)。ユーザー表現とアイテム表現が得られたら、内積を使用して U2I 相関を表現する。
r が大きいほど相関が強く、CTR 予測にプラスの影響を与えることを期待する。しかし、誤差逆伝播の観点からは、クリックラベルの監視だけではこのような効果を学習するのは困難である。また、埋め込み行列の学習は相関ユニット r に完全に依存している。以上の 2 点に基づき、ユーザー行動をラベルとして User-to-Item ネットワークの学習を監視する DeepMatch ネットワーク (すなわち、図の最後の Auxiliary Match Network) を提案する。
DeepMatch ネットワークのタスクは、前の T-1 個の行動に基づいて T 番目の行動を予測することである。これは大規模な多クラス分類タスクであり、候補プロダクトの数だけ分類クラスが存在する。前述のユーザー表現の形式に従って、上位 T-1 個のユーザー行動に対応するユーザー表現を取得し、と表す。ユーザーがこれらの T-1 個の行動を行った後、次にプロダクト j をクリックする確率はソフトマックス関数で定義できる。
ここで、j 番目のプロダクトの (出力) 表現はである。ターゲットプロダクトの出力表現は、実質的にソフトマックス層のパラメータである。クロスエントロピーを損失関数として、以下の損失が得られる。
ここで、はサンプル i の j 番目のプロダクトのラベル、は対応する予測結果、K は異なるカテゴリの数、すなわちプロダクト数である。プロダクト j がユーザー行動シーケンスの T 番目の行動である場合に限り成り立つ。ソフトマックスの計算量がプロダクト総数 K に比例して大きいため、ネガティブサンプリングを使用して計算を簡略化し、損失は以下の形式になる。
ここで、はシグモイド関数、は正例、は負例、k は使用される負例の数であり、プロダクト総数 K よりもはるかに小さい。DeepMatch の損失は MLP の最終分類損失に追加される。DeepMatch ネットワークは、より大きな内積 r がより強い相関を表現するように促進し、モデルのトレーニングに寄与する。実際、User-to-Item ネットワークはランキングモデルとマッチングモデルを統一された方法で共同トレーニングしている。これは、リコールフェーズの match_type や match_score などの特徴を単純にランキングモデルに追加するのとは異なる。リコールフェーズは通常マルチチャネルリコールであり、異なるリコール手法のスコアは同じメトリック下にないため直接比較できない (たとえば、swing と DeepMatch のスコアは直接比較できない)。DMR は User-to-Item ネットワークを通じて任意のターゲットプロダクトの U2I 相関を表現でき、相互に比較可能である。
Item-to-Item ネットワーク
User-to-Item ネットワークは内積を通じて U2I 相関を直接表現するのに対し、Item-to-Item ネットワークは I2I 類似度を計算することで U2I 相関を間接的に表現する。DIN[1] などのモデルにおけるターゲットアテンションを思い出す。これは、ターゲットプロダクトをクエリとしてユーザー行動シーケンスにアテンションを適用し、行動の重要性を区別するものである。これは I2I 類似度の計算として理解でき、ターゲットプロダクトにより類似したユーザー行動プロダクトがより高い重みを獲得し、プーリング後の特徴ベクトルを支配する。この理解に基づき、すべての重み (ソフトマックス正規化前) を合計して、もう一つの U2I 相関表現を取得する。式は以下の通りである。
Item-to-Item ネットワークは加法アテンション [5] の形式で計算され、User-to-Item の内積形式とは異なり、表現能力を高めることができる。
U2I 相関表現に加えて、Item-to-Item ネットワークはターゲットアテンション後のユーザー表現も MLP に入力する。DMR から U2I 相関表現と位置エンコーディングを取り除くと、実質的には DIN[1] モデルと同等である。
実験
Alimama のパブリックデータセットと 1688 のレコメンデーションプロダクトデータセットで一連の実験を行い、モデルの全体的な効果を検証し、特定モジュールのモデルへの影響を探求した。
オフライン実験
オンライン実験
1688 でオンライン DMR モデルをレコメンデーションに展開した。比較モデルは DIN[1] (私たちの以前の CTR モデル) である。CTR の相対増加は 5.5%、DPV の相対増加は 12.8% である。現在、完全に実装されている。
まとめと今後の展望
私たちの論文「Deep Match to Rank Model for Personalized Click-Through Rate Prediction」は AAAI-20 で口頭発表論文として採択された。原文リンク:https://github.com/lvze92/DMR
DMR はマッチングとランキングの共同トレーニングフレームワークを提供する。U2I 相関表現のモジュールは既存の CTR モデルに容易に組み込むことができ、元のモデルに効果的な特徴を追加することに相当する。今後の CTR モデルの反復では、DMR フレームワークを基盤に新しい改善を加え続ける予定である。
E コマースシナリオにおけるユーザークリックの最適化を例にとると、レコメンデーションシステムのタスクは、大量の候補プロダクトの中からユーザーが最も関心を持ち、クリックする可能性の高いプロダクトを選定することである。取得の効率を向上させるため、取得は通常 2 つのフェーズに分けられる。リコール / 候補生成フェーズでは、U2I 相関に基づいて全体の候補セットから少数の候補プロダクト (たとえば 1000 件) を選別し、協調フィルタリングがよく使用される。ランキングフェーズでは、ランキングモデルに基づいて少数の候補プロダクトの CTR を推定し、ソート後にユーザーに表示する。
レコメンデーションシステムにおける CTR 推定の重要性は言うまでもなく、パーソナライゼーションは CTR モデルの効果向上の鍵である。本稿では、新しいランキングモデルを紹介する。主な考え方は、マッチングにおける協調フィルタリングの概念を統合し、ランキングモデルで U2I 相関を表現することで、モデルのパーソナライゼーション能力を向上させ、良好な結果を達成することである。
検索シナリオでは、ユーザーが検索語を入力して意図を明示的に表現するが、レコメンデーションシナリオではユーザーの意図を明示的に取得する方法がない。ユーザーの意図はユーザー行動シーケンスに隠されている。ユーザー行動シーケンスはレコメンデーションにおけるクエリそのものと言える。したがって、ユーザーの意図を抽出するためにユーザー行動シーケンスをモデル化することが非常に重要である。DIN[1] や DIEN[2] などの後続の研究はユーザー興味の表現に注目してモデルの効果を向上させているが、私たちの研究はこの基盤の上でさらに一歩前進し、U2I 相関の表現に注目している。U2I 相関はターゲットアイテムに対するユーザーの選好強度を直接測定できる。ユーザー特徴 (ユーザー興味の特性化) から U2I クロス特徴 (U2I 相関の特性化) へのアップグレードとして理解できる。
U2I 相関の特性化において、リコールにおける協調フィルタリング (CF) が想起される。I2I CF は業界で最も一般的な方法であり、I2I の類似度を事前計算し、ユーザー行動と I2I 類似度に基づいて U2I 相関を間接的に取得する。行列分解の方法はより直接的で、ユーザー表現とプロダクト表現の内積を通じて U2I 相関を直接取得する。ここではこの方法を暫定的に U2I CF と呼ぶ。最近では、いくつかの深層学習手法が関連分野に登場している。たとえば、I2I CF における NAIS[7] はアテンションメカニズムを使用してユーザー行動の重要性を区別しており、DIN[1] と類似している。U2I CF における DNN4YouTube[3] は、モデルのリコールを大規模な多クラス分類問題として扱う。これは DeepMatch と呼ばれることが多い。DeepMatch は行列分解技術の非線形汎化と見なすことができる。私たちは協調フィルタリングにおける U2I CF と I2I CF に基づいてそれぞれ 2 つのサブネットワークを構築し、U2I 相関を表現する。
モデル紹介
DMR (Deep Match to Rank) モデルのネットワーク構造を図に示す。MLP の暗黙的な特徴交叉だけでは U2I 相関を捕捉するのは困難である。MLP に入力される U2I クロス特徴として、手動で構築された U2I クロス特徴に加えて、User-to-Item サブネットワークと Item-to-Item サブネットワークを使用して U2I 相関を表現し、モデルの表現力をさらに向上させる。
User-to-Item ネットワーク
行列分解の手法に着想を得て、ユーザー表現とアイテム表現の内積を使用して U2I 相関を表現する。これは明示的な特徴交叉と見なせる。ユーザー表現はユーザー行動特徴に基づいて取得される。単純な方法として、各行動特徴を同等に重要視する平均プーリングがある。行動時間などのコンテキスト特徴が行動を区別する上での重要性を考慮し、アテンションメカニズムを採用し、位置エンコーディング (Transformer[4] を参照) などのコンテキスト特徴をクエリとして使用し、各行動の重みを適応的に学習する。ここで、時系列順に並べた位置エンコーディングされた行動シーケンスの番号は、行動時間の距離を表現している。式は以下の通りである。
ここで、は t 番目の位置埋め込み、は t 番目のユーザー行動の特徴ベクトル、は学習パラメータ、は t 番目のユーザー行動の正規化重みである。加重和プーリングを通じて固定長の特徴ベクトルを取得し、全結合層を通じて非線形変換を行ってアイテム表現の次元に合わせたユーザー表現を取得する。最終的なユーザー表現は以下のように定義できる。
ここで、関数は非線形変換を表し、入力次元は、出力次元は、は t 番目のユーザー行動の重み付き特徴ベクトルである。
ターゲットアイテムの表現は埋め込みルックアップから直接取得される。この埋め込み行列は出力専用の別行列であり、入力時にアイテムが使用する埋め込み行列 V とは異なる (word2vec[6] の単語と同様に、入力と出力の 2 つの表現を持つ)。ユーザー表現とアイテム表現が得られたら、内積を使用して U2I 相関を表現する。
r が大きいほど相関が強く、CTR 予測にプラスの影響を与えることを期待する。しかし、誤差逆伝播の観点からは、クリックラベルの監視だけではこのような効果を学習するのは困難である。また、埋め込み行列の学習は相関ユニット r に完全に依存している。以上の 2 点に基づき、ユーザー行動をラベルとして User-to-Item ネットワークの学習を監視する DeepMatch ネットワーク (すなわち、図の最後の Auxiliary Match Network) を提案する。
DeepMatch ネットワークのタスクは、前の T-1 個の行動に基づいて T 番目の行動を予測することである。これは大規模な多クラス分類タスクであり、候補プロダクトの数だけ分類クラスが存在する。前述のユーザー表現の形式に従って、上位 T-1 個のユーザー行動に対応するユーザー表現を取得し、と表す。ユーザーがこれらの T-1 個の行動を行った後、次にプロダクト j をクリックする確率はソフトマックス関数で定義できる。
ここで、j 番目のプロダクトの (出力) 表現はである。ターゲットプロダクトの出力表現は、実質的にソフトマックス層のパラメータである。クロスエントロピーを損失関数として、以下の損失が得られる。
ここで、はサンプル i の j 番目のプロダクトのラベル、は対応する予測結果、K は異なるカテゴリの数、すなわちプロダクト数である。プロダクト j がユーザー行動シーケンスの T 番目の行動である場合に限り成り立つ。ソフトマックスの計算量がプロダクト総数 K に比例して大きいため、ネガティブサンプリングを使用して計算を簡略化し、損失は以下の形式になる。
ここで、はシグモイド関数、は正例、は負例、k は使用される負例の数であり、プロダクト総数 K よりもはるかに小さい。DeepMatch の損失は MLP の最終分類損失に追加される。DeepMatch ネットワークは、より大きな内積 r がより強い相関を表現するように促進し、モデルのトレーニングに寄与する。実際、User-to-Item ネットワークはランキングモデルとマッチングモデルを統一された方法で共同トレーニングしている。これは、リコールフェーズの match_type や match_score などの特徴を単純にランキングモデルに追加するのとは異なる。リコールフェーズは通常マルチチャネルリコールであり、異なるリコール手法のスコアは同じメトリック下にないため直接比較できない (たとえば、swing と DeepMatch のスコアは直接比較できない)。DMR は User-to-Item ネットワークを通じて任意のターゲットプロダクトの U2I 相関を表現でき、相互に比較可能である。
Item-to-Item ネットワーク
User-to-Item ネットワークは内積を通じて U2I 相関を直接表現するのに対し、Item-to-Item ネットワークは I2I 類似度を計算することで U2I 相関を間接的に表現する。DIN[1] などのモデルにおけるターゲットアテンションを思い出す。これは、ターゲットプロダクトをクエリとしてユーザー行動シーケンスにアテンションを適用し、行動の重要性を区別するものである。これは I2I 類似度の計算として理解でき、ターゲットプロダクトにより類似したユーザー行動プロダクトがより高い重みを獲得し、プーリング後の特徴ベクトルを支配する。この理解に基づき、すべての重み (ソフトマックス正規化前) を合計して、もう一つの U2I 相関表現を取得する。式は以下の通りである。
Item-to-Item ネットワークは加法アテンション [5] の形式で計算され、User-to-Item の内積形式とは異なり、表現能力を高めることができる。
U2I 相関表現に加えて、Item-to-Item ネットワークはターゲットアテンション後のユーザー表現も MLP に入力する。DMR から U2I 相関表現と位置エンコーディングを取り除くと、実質的には DIN[1] モデルと同等である。
実験
Alimama のパブリックデータセットと 1688 のレコメンデーションプロダクトデータセットで一連の実験を行い、モデルの全体的な効果を検証し、特定モジュールのモデルへの影響を探求した。
オフライン実験
オンライン実験
1688 でオンライン DMR モデルをレコメンデーションに展開した。比較モデルは DIN[1] (私たちの以前の CTR モデル) である。CTR の相対増加は 5.5%、DPV の相対増加は 12.8% である。現在、完全に実装されている。
まとめと今後の展望
私たちの論文「Deep Match to Rank Model for Personalized Click-Through Rate Prediction」は AAAI-20 で口頭発表論文として採択された。原文リンク:https://github.com/lvze92/DMR
DMR はマッチングとランキングの共同トレーニングフレームワークを提供する。U2I 相関表現のモジュールは既存の CTR モデルに容易に組み込むことができ、元のモデルに効果的な特徴を追加することに相当する。今後の CTR モデルの反復では、DMR フレームワークを基盤に新しい改善を加え続ける予定である。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
