Syntax Sensitive Entity Representation for Neural Network Relation Extraction
まとめ:
ニューラルネットワークによる関係抽出のための構文感性エンティティ表現。関係抽出タスクの大規模応用における主なボトルネックは、コーパスの取得にある。近年、ニューラルネットワークベースの関係抽出モデルは、文を低次元空間で表現している。本研究の革新性は、エンティティの表現モデルに構文情報を加える点にある。まず、Tree-GRU に基づき、エンティティのコンテキストの依存構造木を文レベル表現に導入する。次に、文間アテンションと文内アテンションを活用して、対象エンティティを含む文の集合の表現を獲得する。
研究の背景と動機:
関係抽出タスクの大規模応用における主なボトルネックは、コーパスの取得にある。遠隔教師あり学習モデルは、知識ベースを非構造化テキストに自動的にアライメントすることで大規模な訓練データを構築し、人手で構築したデータへの依存を低減するとともに、モデルのクロスドメイン適応性を向上させる。しかし、遠隔教師あり学習を用いてコーパスを構築する過程では、エンティティ名のみがアライメントに使用される。異なるエンティティは異なる関係のもとで、より豊かで多様な意味表現を持つべきであり、誤ラベリングなどの問題が生じる。したがって、より豊かなエンティティ表現が特に重要となる。
一方で、文法情報に基づく手法は通常、2 つのエンティティ間の関係に作用し、文法情報はエンティティの表現を豊かにすることができる。そこで本研究では、構文コンテキストに基づくエンティティ表現を活用して、異なる関係スキーマにおけるエンティティのセマンティクスを豊かにし、ニューラルネットワークモデルと組み合わせて関係抽出タスクを処理する手法を提案する。
関連研究の紹介:
関連研究を大別すると、初期の遠隔教師あり学習ベースの手法と、近年のニューラルネットワークモデルベースの手法の 2 つのカテゴリに分けられる。
関係抽出タスクがアノテーション済みコーパスに強く依存するという問題を解決するため、Mintz ら (2009) は遠隔教師あり学習に基づくアノテーションコーパス構築手法をいち早く提案した。しかし、このようにして自動的に構築されたアノテーションコーパスには大量のノイズが含まれる。コーパス中のノイズの影響を軽減するため、Riedel ら (2010) は関係抽出を多インスタンス単一カテゴリ問題として定式化した。さらに、Hoffmann ら (2011) と Surdeanu ら (2012) は多インスタンス複数カテゴリ戦略を採用した。同時に、最短依存パスが関係の文法特徴量として利用されている。上記の手法の典型的な欠点は、モデルの性能が特徴テンプレートの設計に依存することである。
近年、ニューラルネットワークは自然言語処理タスクで広く利用されている。関係抽出の分野では、Socher ら (2012) が回帰型ニューラルネットワークを採用して関係抽出に取り組み、Zeng ら (2014) はエンドツーエンドの畳み込みニューラルネットワークを構築した。さらに、Zeng ら (2015) は複数のインスタンスのうち少なくとも 1 つが対応する関係を正しく表現していると仮定した。一対のエンティティ間の関係を表現するインスタンスが存在すると仮定する手法と比較して、Line ら (2016) はアテンションメカニズムを通じて正例を選択することで、アノテーションコーパスに含まれる情報をより十分に活用している。
これらのニューラルネットワークベースの手法の多くは、単語レベル表現を用いて文ベクトル表現を生成する。一方で、文法情報に基づく表現も多くの研究者から注目されており、その中でも最も重要なものが最短依存パスである (Miwa and Bansal (2016)、Cai et al. (2016))。
主な手法:
まず、依存構文木に基づき、Tree-GRU (木構造回帰型ニューラルネットワーク) モデルを用いてエンティティの文レベル表現を生成する。上図に示すように、エンティティ自体だけでなく、そのコンテキストの依存構造木を用いることで、長距離の情報をより適切に表現できる。具体的なエンティティの意味表現は下図に示すとおりで、Tree-GRU を用いてエンティティのセマンティック表現を獲得する。
次に、子ノードベースのアテンションメカニズム (ATTCE、上図) と文レベルのエンティティ表現に対するアテンションメカニズム (ATTEE、下図) を導入し、構文解析エラーと誤ラベリングの悪影響を軽減する。
実験結果:
本研究では NYT コーパス上で実験を行った。最終結果は上図に示すとおりである。そのうち、SEE-CAT と SEE-TRAINS は、3 種類のベクトル表現 (文のベクトル表現と 2 つのエンティティのベクトル表現) をそれぞれ組み合わせるために本研究で用いた 2 つの戦略である。図から分かるように、提案モデルは同じデータセットにおいて、既存の遠隔教師あり関係抽出モデルよりも優れた性能を達成している。
要約:
本研究の実験結果は、固有表現のより豊かな意味表現が、最終的な関係抽出タスクに効果的に寄与することを示している。
ニューラルネットワークによる関係抽出のための構文感性エンティティ表現。関係抽出タスクの大規模応用における主なボトルネックは、コーパスの取得にある。近年、ニューラルネットワークベースの関係抽出モデルは、文を低次元空間で表現している。本研究の革新性は、エンティティの表現モデルに構文情報を加える点にある。まず、Tree-GRU に基づき、エンティティのコンテキストの依存構造木を文レベル表現に導入する。次に、文間アテンションと文内アテンションを活用して、対象エンティティを含む文の集合の表現を獲得する。
研究の背景と動機:
関係抽出タスクの大規模応用における主なボトルネックは、コーパスの取得にある。遠隔教師あり学習モデルは、知識ベースを非構造化テキストに自動的にアライメントすることで大規模な訓練データを構築し、人手で構築したデータへの依存を低減するとともに、モデルのクロスドメイン適応性を向上させる。しかし、遠隔教師あり学習を用いてコーパスを構築する過程では、エンティティ名のみがアライメントに使用される。異なるエンティティは異なる関係のもとで、より豊かで多様な意味表現を持つべきであり、誤ラベリングなどの問題が生じる。したがって、より豊かなエンティティ表現が特に重要となる。
一方で、文法情報に基づく手法は通常、2 つのエンティティ間の関係に作用し、文法情報はエンティティの表現を豊かにすることができる。そこで本研究では、構文コンテキストに基づくエンティティ表現を活用して、異なる関係スキーマにおけるエンティティのセマンティクスを豊かにし、ニューラルネットワークモデルと組み合わせて関係抽出タスクを処理する手法を提案する。
関連研究の紹介:
関連研究を大別すると、初期の遠隔教師あり学習ベースの手法と、近年のニューラルネットワークモデルベースの手法の 2 つのカテゴリに分けられる。
関係抽出タスクがアノテーション済みコーパスに強く依存するという問題を解決するため、Mintz ら (2009) は遠隔教師あり学習に基づくアノテーションコーパス構築手法をいち早く提案した。しかし、このようにして自動的に構築されたアノテーションコーパスには大量のノイズが含まれる。コーパス中のノイズの影響を軽減するため、Riedel ら (2010) は関係抽出を多インスタンス単一カテゴリ問題として定式化した。さらに、Hoffmann ら (2011) と Surdeanu ら (2012) は多インスタンス複数カテゴリ戦略を採用した。同時に、最短依存パスが関係の文法特徴量として利用されている。上記の手法の典型的な欠点は、モデルの性能が特徴テンプレートの設計に依存することである。
近年、ニューラルネットワークは自然言語処理タスクで広く利用されている。関係抽出の分野では、Socher ら (2012) が回帰型ニューラルネットワークを採用して関係抽出に取り組み、Zeng ら (2014) はエンドツーエンドの畳み込みニューラルネットワークを構築した。さらに、Zeng ら (2015) は複数のインスタンスのうち少なくとも 1 つが対応する関係を正しく表現していると仮定した。一対のエンティティ間の関係を表現するインスタンスが存在すると仮定する手法と比較して、Line ら (2016) はアテンションメカニズムを通じて正例を選択することで、アノテーションコーパスに含まれる情報をより十分に活用している。
これらのニューラルネットワークベースの手法の多くは、単語レベル表現を用いて文ベクトル表現を生成する。一方で、文法情報に基づく表現も多くの研究者から注目されており、その中でも最も重要なものが最短依存パスである (Miwa and Bansal (2016)、Cai et al. (2016))。
主な手法:
まず、依存構文木に基づき、Tree-GRU (木構造回帰型ニューラルネットワーク) モデルを用いてエンティティの文レベル表現を生成する。上図に示すように、エンティティ自体だけでなく、そのコンテキストの依存構造木を用いることで、長距離の情報をより適切に表現できる。具体的なエンティティの意味表現は下図に示すとおりで、Tree-GRU を用いてエンティティのセマンティック表現を獲得する。
次に、子ノードベースのアテンションメカニズム (ATTCE、上図) と文レベルのエンティティ表現に対するアテンションメカニズム (ATTEE、下図) を導入し、構文解析エラーと誤ラベリングの悪影響を軽減する。
実験結果:
本研究では NYT コーパス上で実験を行った。最終結果は上図に示すとおりである。そのうち、SEE-CAT と SEE-TRAINS は、3 種類のベクトル表現 (文のベクトル表現と 2 つのエンティティのベクトル表現) をそれぞれ組み合わせるために本研究で用いた 2 つの戦略である。図から分かるように、提案モデルは同じデータセットにおいて、既存の遠隔教師あり関係抽出モデルよりも優れた性能を達成している。
要約:
本研究の実験結果は、固有表現のより豊かな意味表現が、最終的な関係抽出タスクに効果的に寄与することを示している。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
