Cross modal retrieval based on generation model
はじめに
ビッグデータ時代を迎え、テキストや画像など異なるモダリティのデータが爆発的な速度で増大しています。これらの異種モダリティデータは、ユーザーの検索にも新たな課題をもたらしています。
テキスト視覚クロスモーダル表現において、一般的な手法は各モダリティのデータをまずそのモダリティ固有の特徴表現にエンコードし、その後共通空間にマッピングします。そしてランキング損失による最適化を行い、類似した画像テキストペアがマップする特徴ベクトル間の距離が、類似していない画像テキストペア間の距離よりも小さくなるようにします。
この手法で学習した特徴はマルチモーダルデータの高レベルセマンティクスを適切に記述できますが、画像の局所類似性や文の文レベル類似性は十分に活用されていません。たとえば、テキストから画像を検索する場合、画像の色、テクスチャ、レイアウトなどの細部により注目します。しかし、高レベル特徴のマッチングだけでは局所類似性を考慮できません。
本稿のアイデアは、人間の思考プロセスに対する考察から生まれました。人間の場合、テキスト記述から対応する画像を取得する際、訓練された画家は普通の人よりも優れたマッチング画像を見つけられます。これは画家が期待される画像の姿を理解しているからです。同様に、画像から対応するテキスト記述を取得する際、作家も一般人より優れた記述を提示する傾向があります。この取得対象を予測するプロセスを「Imagine」(想像)または「ブレイン補完」と呼びます。そこで、生成モデルに基づく生成的クロスモーダル特徴学習フレームワーク(GXN)を提案します。以下の図は本稿のコンセプトを示しています。
従来の「見る」と「照合する」を、「見る」「想像する」「照合する」の 3 ステップに変更しました。「見たもの、考えたこと、見つけたもの」とも言えます。「見る」は「見たもの」すなわち「見ること」は理解であり、実質的には特徴抽出です。「想像する」は「考えたこと」であり、「見たもの」を利用して期待されるマッチング結果を「ブレイン補完」します。すなわち、取得した局所特徴から対象モダリティのデータを生成します。そして、局所レベル(文レベル / ピクセルレベル)のマッチングと高レベルセマンティクス特徴のマッチングの結果を統合します。
手法
GXN は 3 つのモジュールで構成されます。マルチモーダル特徴表現(上部領域)、画像テキスト生成特徴学習(青いパス)、およびテキスト画像生成敵対特徴学習(緑のパス)です。
第 1 部分(上部領域)は基本的なクロスモーダル特徴表現と同様に、異なるモダリティのデータを共通空間にマッピングします。これには画像エンコーダー 1 つと文エンコーダー 2 つが含まれます。文エンコーダーを 2 つに分離した理由は、異なるレベルの特徴を効率的に学習できるようにするためです。ここでは高レベルセマンティクス特徴と局所レベル特徴を扱います。局所レベルの特徴は生成モデルによって学習されます。
第 2 部分(青いパス)は、視覚特徴からテキスト記述を生成します。画像エンコーダーと文デコーダーで構成されます。損失の計算において、強化学習のアイデアを取り入れ、報酬を通じて生成された文と実際の文の類似度を最大化します。
第 3 部分(緑のパス)は、生成器と判別器を使用してテキスト特徴から画像を生成します。判別器はテキストから生成された画像と実際の画像を識別するために使用されます。
最後に、双方向のクロスモーダル特徴生成学習を通じて、より優れたクロスモーダル特徴表現を学習します。テスト時には、高レベルセマンティクス特徴と局所レベル特徴の間の類似度を計算するだけで、クロスモーダル検索を実行できます。
実験
本稿で提案する手法を MSCOCO データセット上で最先端の手法と比較し、state-of-the-art の結果を達成しました。
まとめ
本稿では、画像テキスト生成モデルとテキスト画像生成モデルを従来のクロスモーダル表現に革新的に導入することで、マルチモーダルデータの高レベル抽象表現と低レベル表現の両方を学習できるようにしました。最先端の手法を大幅に上回る性能により、提案手法の有効性が確認されています。
ビッグデータ時代を迎え、テキストや画像など異なるモダリティのデータが爆発的な速度で増大しています。これらの異種モダリティデータは、ユーザーの検索にも新たな課題をもたらしています。
テキスト視覚クロスモーダル表現において、一般的な手法は各モダリティのデータをまずそのモダリティ固有の特徴表現にエンコードし、その後共通空間にマッピングします。そしてランキング損失による最適化を行い、類似した画像テキストペアがマップする特徴ベクトル間の距離が、類似していない画像テキストペア間の距離よりも小さくなるようにします。
この手法で学習した特徴はマルチモーダルデータの高レベルセマンティクスを適切に記述できますが、画像の局所類似性や文の文レベル類似性は十分に活用されていません。たとえば、テキストから画像を検索する場合、画像の色、テクスチャ、レイアウトなどの細部により注目します。しかし、高レベル特徴のマッチングだけでは局所類似性を考慮できません。
本稿のアイデアは、人間の思考プロセスに対する考察から生まれました。人間の場合、テキスト記述から対応する画像を取得する際、訓練された画家は普通の人よりも優れたマッチング画像を見つけられます。これは画家が期待される画像の姿を理解しているからです。同様に、画像から対応するテキスト記述を取得する際、作家も一般人より優れた記述を提示する傾向があります。この取得対象を予測するプロセスを「Imagine」(想像)または「ブレイン補完」と呼びます。そこで、生成モデルに基づく生成的クロスモーダル特徴学習フレームワーク(GXN)を提案します。以下の図は本稿のコンセプトを示しています。
従来の「見る」と「照合する」を、「見る」「想像する」「照合する」の 3 ステップに変更しました。「見たもの、考えたこと、見つけたもの」とも言えます。「見る」は「見たもの」すなわち「見ること」は理解であり、実質的には特徴抽出です。「想像する」は「考えたこと」であり、「見たもの」を利用して期待されるマッチング結果を「ブレイン補完」します。すなわち、取得した局所特徴から対象モダリティのデータを生成します。そして、局所レベル(文レベル / ピクセルレベル)のマッチングと高レベルセマンティクス特徴のマッチングの結果を統合します。
手法
GXN は 3 つのモジュールで構成されます。マルチモーダル特徴表現(上部領域)、画像テキスト生成特徴学習(青いパス)、およびテキスト画像生成敵対特徴学習(緑のパス)です。
第 1 部分(上部領域)は基本的なクロスモーダル特徴表現と同様に、異なるモダリティのデータを共通空間にマッピングします。これには画像エンコーダー 1 つと文エンコーダー 2 つが含まれます。文エンコーダーを 2 つに分離した理由は、異なるレベルの特徴を効率的に学習できるようにするためです。ここでは高レベルセマンティクス特徴と局所レベル特徴を扱います。局所レベルの特徴は生成モデルによって学習されます。
第 2 部分(青いパス)は、視覚特徴からテキスト記述を生成します。画像エンコーダーと文デコーダーで構成されます。損失の計算において、強化学習のアイデアを取り入れ、報酬を通じて生成された文と実際の文の類似度を最大化します。
第 3 部分(緑のパス)は、生成器と判別器を使用してテキスト特徴から画像を生成します。判別器はテキストから生成された画像と実際の画像を識別するために使用されます。
最後に、双方向のクロスモーダル特徴生成学習を通じて、より優れたクロスモーダル特徴表現を学習します。テスト時には、高レベルセマンティクス特徴と局所レベル特徴の間の類似度を計算するだけで、クロスモーダル検索を実行できます。
実験
本稿で提案する手法を MSCOCO データセット上で最先端の手法と比較し、state-of-the-art の結果を達成しました。
まとめ
本稿では、画像テキスト生成モデルとテキスト画像生成モデルを従来のクロスモーダル表現に革新的に導入することで、マルチモーダルデータの高レベル抽象表現と低レベル表現の両方を学習できるようにしました。最先端の手法を大幅に上回る性能により、提案手法の有効性が確認されています。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
