How to apply GCN in a 1 billion node heterogeneous network
1 はじめに
本論文の構成では、ユーザーとプロダクト間の相互作用が、通常最も直接的かつ効果的なエッジ接続手段です。これはユーザーの嗜好を明示的に記述するものであり、レコメンデーションの效果にある程度の改善をもたらしてきました。この方式の最大の問題は、明示的なインタラクションデータに大規模なデータスパース性が存在することです。実際のシナリオでは、ユーザーの検索語、閲覧したストア、嗜好ブランド、嗜好属性など、ネットワーク表現の豊かさを高めるために導入可能な異種情報が大量に存在します。これらの特徴は、より豊かなセマンティック表現と関連性の記述を強化できます。intentGC は、本論文で提案する GCN に基づく統一的なネットワーク埋め込み学習フレームワークであり、ユーザーとプロダクト間の明示的な嗜好関係と豊富な異種関係情報を統合して、レコメンデーションシステムの效果を向上させます。本アルゴリズムのコア技術はグラフ畳み込みであり、古典的なグラフ畳み込みを基盤として、ビジネスにおける強い異種性や大規模性といったコア課題をよりよく解決するための革新的な最適化を施しています。
2. 問題定義
3. モデル設計
本論文で設計するモデルは、複数の情報を統合する大規模グラフ畳み込み学習アルゴリズムであり、二部異種グラフモデリングを採用しています。損失設計にはトリプレット損失を使用し、ユーザーの顕在的な嗜好と表現を効果的に制御しつつ学習できます。学習プロセス全体は半教師ありモデルであり、E コマースシステム内の大量のラベルなし情報を効果的に活用して、学習目標の精度を向上させます。ソリューションのコアは 3 つの部分で構成されます。1 つ目はネットワーク変換で、元のネットワークの無損失変換を実行します。2 つ目は高速畳み込みネットワークで、異種情報に対する効率的な畳み込みを実行します。3 つ目はデュアル畳み込みで、HIN 変換に基づくユーザーとプロダクトの表現学習を行います。
ネットワーク変換
多種多様な異種ノードをネットワークに導入することで、より豊富な情報がもたらされると同時に、意味的非互換性の課題も生じます。ノードタイプを区別する計算は、多種多様な異種ノードとエッジを持つ大規模ネットワークにとって、巨大な複雑性と計算負荷となります。本論文では、二次類似性に基づき、関連研究を用いて元のネットワークをユーザー間関係またはプロダクト間関係に変換します。類似性の計算は同一の補助情報の数量に基づいています。コアとなる考え方は、u1 と u2 が同じ補助情報に接続されていれば u1 と u2 も関連しているというものであり、これによりネットワーク内の異種ノードのセマンティック情報をユーザー間関係またはプロダクト間関係にエンコードし、元のネットワーク情報を変換できます。
高速畳み込みネットワーク IntentNet
元の GCN は大規模グラフ上で計算する際、内容が高次伝播方式で伝搬されるため、計算量が指数関数的に増大するという問題があります。本論文で提案する高速畳み込みネットワーク IntentNet は、以下の 2 つの最適化によりこの問題を効果的に解決します。1 つ目は、畳み込み演算子において、すべてのニューロンが等しく重要というわけではなく、活性化プロセスにおいて最も関連性の高いニューロンが最大の效果を発揮するため、グラフ畳み込みをスパースネットワーク活性化として設計しました。これはチャネル共有のためのベクトル学習とも見なせ、ベクトル化畳み込みを通じて近傍情報伝播を実現します。2 つ目は、元の高次指数関数的な畳み込み複雑性が主に高次ノードに由来することを発見しましたが、このトレーニング方式はデカップリング可能であり、グラフ視点とノード視点の 2 つのトレーニングモジュールに分割できます。これら 2 つの観察に基づき、グラフ畳み込みを再設計し、全結合ネットワークによる特徴量の組み合わせを実現しました。実験により、GraphSage と比べて優れた効率と效果が示されています。
a) ベクトル化畳み込み関数
表現学習は主に 2 つのタスクを行います。1 つは、ノード自身とその近傍の関係を学習して、近傍が效果に与える影響を測定することです。もう 1 つは、異なる次元のベクトルの空間関係を学習して、有用な組み合わせ特徴を自動的に抽出することです。グラフ畳み込みは 2 つのステップを含みます。1 つは集約です。
もう 1 つは畳み込みです。
本論文ではこれをビット単位畳み込みと呼びます。実際、すべての特徴間の相互作用を計算する必要がないことが分かりました。グラフ畳み込みをスパースネットワーク活性化として設計し、これはチャネル共有のためのベクトル学習とも見なせます。ベクトル化畳み込みを通じて近傍情報伝播を実現します。本論文で設計したベクトル化畳み込み関数は以下の通りです。
b) IntentNet
畳み込みトレーニング方式は、グラフ視点とノード視点の 2 つのトレーニングモジュールに分割するよう設計されており、両者の組み合わせによりグラフ畳み込みの機能を実現します。前者は前述のベクトル化畳み込み関数に基づき、複数の畳み込み層をスタッキングすることで近傍の伝播関係を効果的に学習し、グラフ畳み込みのタスクを実現します。後者は全結合層に接続され、異なる次元のベクトル空間の特徴関係を学習します。
デュアル畳み込み
ユーザーとアイテムの表現とラベル情報を正確に記述するため、従来の GCN とは異なり、デュアル GCN 構造を設計し、同一フレームワーク内で学習を行います。具体的な方法は、ユーザーは独立畳み込みを行い、アイテムとネガティブサンプリングは共有畳み込みを行い、畳み込み層の最後で 3 つを密なネットワークを通じて同一の意味空間に射影し、最後にトリプレット損失を用いて学習します。この構造の利点は、従来の GCN よりも正確な異種表現能力を持つことです。同時に、この方法により 2 つのデュアル畳み込みが収束することが証明されており、優れた半教師あり学習效果を発揮します。
IntentGC アルゴリズムフレームワーク
IntentGC アルゴリズムフレームワークは主に 3 つの部分で構成されます。1) ネットワーク変換、2) トレーニング、3) 推論です。トレーニング完了後、ユーザーとプロダクトのベクトル表現を取得でき、k 近傍法の考え方を用いて検索とレコメンデーションを行います。
4. 実験結論
実験では、IntentGC と既存アルゴリズムの效果比較、IntentNet と GraphSage の 10 億規模グラフ学習タスク処理における効率比較、および異種情報を追加した場合のモデル学習能力の比較を主に検証しています。Taobao と Amazon のデータに基づきオフライン評価を実施し、DeepWalk、GraphSage、DSPR、Metapath2vec++、BiNE などのアルゴリズムと比較しています。Taobao と Amazon のデータセットでのオフライン評価結果と Taobao 環境でのオンライン実験の結果はいずれも、本アルゴリズムの有効性を示しています。
5. まとめと展望
本論文では、複数の情報を統合する新しい大規模グラフ畳み込み学習方式を提案しました。実験の結果、E コマースシステム内の大量のラベルなし情報をプロダクトレコメンデーションに活用することは大きな価値があることが示されました。設計した高速グラフ畳み込み学習フレームワークは、10 億ノード規模のネットワーク構造アプリケーションをサポートできます。プロダクトレコメンデーションでの有効性が証明されたことから、今後このフレームワークをより多くのタスクに適用することを期待しています。さらに、オンラインリアルタイムユーザー特徴の重要性を考慮し、動的グラフ畳み込みモデルによるモデルのリアルタイム性向上も今後の研究方向です。
本論文の構成では、ユーザーとプロダクト間の相互作用が、通常最も直接的かつ効果的なエッジ接続手段です。これはユーザーの嗜好を明示的に記述するものであり、レコメンデーションの效果にある程度の改善をもたらしてきました。この方式の最大の問題は、明示的なインタラクションデータに大規模なデータスパース性が存在することです。実際のシナリオでは、ユーザーの検索語、閲覧したストア、嗜好ブランド、嗜好属性など、ネットワーク表現の豊かさを高めるために導入可能な異種情報が大量に存在します。これらの特徴は、より豊かなセマンティック表現と関連性の記述を強化できます。intentGC は、本論文で提案する GCN に基づく統一的なネットワーク埋め込み学習フレームワークであり、ユーザーとプロダクト間の明示的な嗜好関係と豊富な異種関係情報を統合して、レコメンデーションシステムの效果を向上させます。本アルゴリズムのコア技術はグラフ畳み込みであり、古典的なグラフ畳み込みを基盤として、ビジネスにおける強い異種性や大規模性といったコア課題をよりよく解決するための革新的な最適化を施しています。
2. 問題定義
3. モデル設計
本論文で設計するモデルは、複数の情報を統合する大規模グラフ畳み込み学習アルゴリズムであり、二部異種グラフモデリングを採用しています。損失設計にはトリプレット損失を使用し、ユーザーの顕在的な嗜好と表現を効果的に制御しつつ学習できます。学習プロセス全体は半教師ありモデルであり、E コマースシステム内の大量のラベルなし情報を効果的に活用して、学習目標の精度を向上させます。ソリューションのコアは 3 つの部分で構成されます。1 つ目はネットワーク変換で、元のネットワークの無損失変換を実行します。2 つ目は高速畳み込みネットワークで、異種情報に対する効率的な畳み込みを実行します。3 つ目はデュアル畳み込みで、HIN 変換に基づくユーザーとプロダクトの表現学習を行います。
ネットワーク変換
多種多様な異種ノードをネットワークに導入することで、より豊富な情報がもたらされると同時に、意味的非互換性の課題も生じます。ノードタイプを区別する計算は、多種多様な異種ノードとエッジを持つ大規模ネットワークにとって、巨大な複雑性と計算負荷となります。本論文では、二次類似性に基づき、関連研究を用いて元のネットワークをユーザー間関係またはプロダクト間関係に変換します。類似性の計算は同一の補助情報の数量に基づいています。コアとなる考え方は、u1 と u2 が同じ補助情報に接続されていれば u1 と u2 も関連しているというものであり、これによりネットワーク内の異種ノードのセマンティック情報をユーザー間関係またはプロダクト間関係にエンコードし、元のネットワーク情報を変換できます。
高速畳み込みネットワーク IntentNet
元の GCN は大規模グラフ上で計算する際、内容が高次伝播方式で伝搬されるため、計算量が指数関数的に増大するという問題があります。本論文で提案する高速畳み込みネットワーク IntentNet は、以下の 2 つの最適化によりこの問題を効果的に解決します。1 つ目は、畳み込み演算子において、すべてのニューロンが等しく重要というわけではなく、活性化プロセスにおいて最も関連性の高いニューロンが最大の效果を発揮するため、グラフ畳み込みをスパースネットワーク活性化として設計しました。これはチャネル共有のためのベクトル学習とも見なせ、ベクトル化畳み込みを通じて近傍情報伝播を実現します。2 つ目は、元の高次指数関数的な畳み込み複雑性が主に高次ノードに由来することを発見しましたが、このトレーニング方式はデカップリング可能であり、グラフ視点とノード視点の 2 つのトレーニングモジュールに分割できます。これら 2 つの観察に基づき、グラフ畳み込みを再設計し、全結合ネットワークによる特徴量の組み合わせを実現しました。実験により、GraphSage と比べて優れた効率と效果が示されています。
a) ベクトル化畳み込み関数
表現学習は主に 2 つのタスクを行います。1 つは、ノード自身とその近傍の関係を学習して、近傍が效果に与える影響を測定することです。もう 1 つは、異なる次元のベクトルの空間関係を学習して、有用な組み合わせ特徴を自動的に抽出することです。グラフ畳み込みは 2 つのステップを含みます。1 つは集約です。
もう 1 つは畳み込みです。
本論文ではこれをビット単位畳み込みと呼びます。実際、すべての特徴間の相互作用を計算する必要がないことが分かりました。グラフ畳み込みをスパースネットワーク活性化として設計し、これはチャネル共有のためのベクトル学習とも見なせます。ベクトル化畳み込みを通じて近傍情報伝播を実現します。本論文で設計したベクトル化畳み込み関数は以下の通りです。
b) IntentNet
畳み込みトレーニング方式は、グラフ視点とノード視点の 2 つのトレーニングモジュールに分割するよう設計されており、両者の組み合わせによりグラフ畳み込みの機能を実現します。前者は前述のベクトル化畳み込み関数に基づき、複数の畳み込み層をスタッキングすることで近傍の伝播関係を効果的に学習し、グラフ畳み込みのタスクを実現します。後者は全結合層に接続され、異なる次元のベクトル空間の特徴関係を学習します。
デュアル畳み込み
ユーザーとアイテムの表現とラベル情報を正確に記述するため、従来の GCN とは異なり、デュアル GCN 構造を設計し、同一フレームワーク内で学習を行います。具体的な方法は、ユーザーは独立畳み込みを行い、アイテムとネガティブサンプリングは共有畳み込みを行い、畳み込み層の最後で 3 つを密なネットワークを通じて同一の意味空間に射影し、最後にトリプレット損失を用いて学習します。この構造の利点は、従来の GCN よりも正確な異種表現能力を持つことです。同時に、この方法により 2 つのデュアル畳み込みが収束することが証明されており、優れた半教師あり学習效果を発揮します。
IntentGC アルゴリズムフレームワーク
IntentGC アルゴリズムフレームワークは主に 3 つの部分で構成されます。1) ネットワーク変換、2) トレーニング、3) 推論です。トレーニング完了後、ユーザーとプロダクトのベクトル表現を取得でき、k 近傍法の考え方を用いて検索とレコメンデーションを行います。
4. 実験結論
実験では、IntentGC と既存アルゴリズムの效果比較、IntentNet と GraphSage の 10 億規模グラフ学習タスク処理における効率比較、および異種情報を追加した場合のモデル学習能力の比較を主に検証しています。Taobao と Amazon のデータに基づきオフライン評価を実施し、DeepWalk、GraphSage、DSPR、Metapath2vec++、BiNE などのアルゴリズムと比較しています。Taobao と Amazon のデータセットでのオフライン評価結果と Taobao 環境でのオンライン実験の結果はいずれも、本アルゴリズムの有効性を示しています。
5. まとめと展望
本論文では、複数の情報を統合する新しい大規模グラフ畳み込み学習方式を提案しました。実験の結果、E コマースシステム内の大量のラベルなし情報をプロダクトレコメンデーションに活用することは大きな価値があることが示されました。設計した高速グラフ畳み込み学習フレームワークは、10 億ノード規模のネットワーク構造アプリケーションをサポートできます。プロダクトレコメンデーションでの有効性が証明されたことから、今後このフレームワークをより多くのタスクに適用することを期待しています。さらに、オンラインリアルタイムユーザー特徴の重要性を考慮し、動的グラフ畳み込みモデルによるモデルのリアルタイム性向上も今後の研究方向です。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
