How does NLP break through the capabilities of deep learning?

1. 背景

本質的に、言語は論理記号の集合であり、自然言語処理(NLP)が処理する入力は高度に抽象化された離散記号である。つまり、知覚プロセスを経ることなく、さまざまな抽象概念、セマンティクス、論理的推論に直接焦点を当てている。NLP は高レベルのセマンティクス、記憶、知識の抽象化、論理的推論といった複雑な認知機能を扱うため、データ駆動型の統計学習に基づくディープラーニングモデルは NLP 分野で比較的大きなボトルネックに直面している。誇張ではなく、NLP における複雑な認知機能はディープラーニングの能力を完全に超えていると言える。では、この呪縛をどう打ち破り、ディープラーニングの能力境界を突破し、感知的インテリジェンスから認知インテリジェンスへの重要な飛躍を実現するのか。これこそ本稿が探求すべき課題である。一つの可能な突破口は、非構造化データ(ビジネスデータ、プロダクトデータ、業界データなど)を統合・蒸留して構造化ビジネス知識、構造化プロダクト知識、構造化業界ドメイン知識に変換し、それらの構造化知識を基盤としてディープラーニングモデルで推論を行い、知識駆動を実現し、さらに推論ベースの駆動へと発展させることである。これにより構造化知識推論エンジンが形成され、インテリジェントシステム全体の認知能力が向上する。知識グラフは非構造化データを構造化知識に精製・要約するためのインフラであり、グラフニューラルネットワーク(GNN)は知識グラフ基盤上の推論モデルである。一言で言えば、不確かな目で世界を観察し、確実な構造化知識でその不確実性を排除するのである。

2. 知識グラフ

知識グラフを紹介する前に、まず知識とは何かを明確にする必要がある。知識は大量の意味のあるデータから要約され、圧縮・精製されて価値ある法則を形成する。たとえば、天文学者が日夜さまざまな惑星の位置と対応する時刻を観測するが、これらは観測データである。しかしニュートンはこれらの観測データから万有引力の法則を発見した。これが知識である。後の天文学者がニュートンの万有引力の法則という貴重な知識を利用してさらに未知の星や宇宙の謎を発見したように、知識はインテリジェントシステムの認知能力を大幅に強化し、未知の領域へ深く進出することを可能にする。知識グラフは、知識の保存、表現、抽出、融合、推論のためのインフラである。

知識グラフシステムを構築するには、知識モデリング、知識獲得、知識融合、知識格納、知識モデルマイニング、知識応用の 6 つの部分を含める必要がある。

1. 知識スキーマモデリング:多層的な知識システムを構築し、抽象的な知識、属性、関係情報を定義、整理、管理、変換して、実際のナレッジベースに変換する。

2. 知識抽出:異なるソースと構造のデータをグラフデータに変換する。構造化データ、半構造化データ(分析)、知識のインデックス作成、知識推論などを含み、データの有効性と整合性を確保する。

3. 知識融合:知識グラフでは知識ソースの範囲が広いため、知識の品質にばらつきがある、異なるデータソースからの知識が重複している、知識間のつながりが不明確であるといった問題が存在する。そのため知識融合を実施する必要がある。知識融合は高レベルの知識組織化であり、異なる知識ソースからの知識を同じフレームワーク仕様のもとで、異種データ統合、曖昧性解消、処理、推論検証、更新といったステップを経て、データ、情報、手法、経験、思想の融合を実現し、高品質なナレッジベースを形成する。

4. 知識格納:ビジネス特性と知識の規模に応じて適切な保存方法を選択し、融合された知識を永続化する。

5. 知識モデルマイニング:知識の分散表現学習を行い、グラフマイニング関連アルゴリズムを通じて知識推論から新たな知識を導出し、連関規則により潜在的な知識をマイニングする。

6. 知識応用:構築された知識グラフに対して、グラフ検索、知識計算、グラフ可視化などの分析・応用機能を提供する。また、グラフ基本アプリケーションクラス、グラフ構造分析クラス、グラフセマンティクスアプリケーションクラス、自然言語処理クラス、グラフデータ取得クラス、グラフ統計クラスなど、知識計算のさまざまな API も提供する。

これほど多くの知識グラフの概念を説明したが、これらの概念はやや抽象的かもしれない。ここでは税関 HS コード分野における実際の知識グラフの例を示す。

3. グラフニューラルネットワーク GNN

知識グラフは、テキスト、画像、時系列などのユークリッド空間に従って分布するデータを帰納的に融合し、非ユークリッド空間に従ってグラフ構造を抽出して構造化知識を保存する。グラフ構造の複雑さは従来のディープラーニングアルゴリズムにとって大きな課題となっている。主に非ユークリッド空間のグラフ構造データは不規則であり、各グラフは無制限の数のノードを持ち、グラフ内の各ノードは異なる数の隣接ノードを持つため、従来のディープラーニングの畳み込み演算をグラフ構造上で効果的に計算できないことに起因する。同時に、従来のディープラーニングアルゴリズムの核心的な仮定は、サンプルインスタンスが互いに独立していることである。たとえば、猫に関する 2 枚の画像は完全に独立している。しかしグラフ構造データではそうではない。グラフ内のノードはエッジの接続情報を通じて有機的に結合され、強力な構造的特徴を自然に構築する。さらに、業界が認識している従来のディープラーニングの大きな弱点は、因果推論を効果的に実行できず、ある意味での統計的相関推論しか行えないことであり、これによりインテリジェントシステムの認知能力が大幅に低下する。上記のグラフ構造データおよび因果推論における従来のディープラーニングアルゴリズムの先天的な弱点に対応して、近年、グラフ構造データモデリングと因果推論のための新たな研究方向であるグラフニューラルネットワーク GNN が登場した。

3.1 グラフ畳み込みネットワーク GCN の基本原理

グラフ畳み込みニューラルネットワーク GCN は現在最も重要なグラフニューラルネットワークである。本稿で実装するグラフニューラルネットワークもグラフ畳み込みニューラルネットワーク GCN に基づいている。グラフ畳み込みニューラルネットワーク GCN は本質的に Message-Passing ベースの情報伝達の汎用フレームワークである。多層のグラフ畳み込み演算で構成され、各グラフ畳み込み層は 1 次近傍情報のみを処理する。いくつかのグラフ畳み込み層を重ねることで、多次近傍のメッセージ転送を実現できる。Message-Passing に基づくグラフニューラルネットワークは以下の 3 つの基本式から成る。

ほぼすべての GNN モデルの基礎的な動作メカニズムは上記の 3 つの式に基づいているが、異なる AGGREGATE、COMBINE、READOUT の実装戦略の違いにより、GCN、GAT、GraphSAGE などの異なるタイプのグラフニューラルネットワークに進化している。

3.2 グラフ畳み込みネットワーク GCN の AGGREGATE 計算方法
グラフ畳み込みネットワーク GCN の AGGREGATE は、GCN の各層を通じて隣接行列 A と特徴ベクトルを乗算し、各頂点の隣接点の特徴の要約を取得し、さらにパラメータ行列を乗算して活性化関数 σ を加え、1 回の非線形変換を行って隣接頂点の特徴を集約した行列を得る。基本式は以下の通りである。


1. グラフ畳み込みネットワーク GCN の第 l 層の特徴ベクトルである。ここで image.png
は入力特徴である。

2. グラフ畳み込みネットワーク GCN の各層のパラメータ行列である。

3. グラフ Graph の隣接行列に各グラフノードの単位行列を加えたものである。

4. グラフ Graph の隣接行列の次数行列 image.png である。

上記は一般的な GCN の AGGREGATE 戦略であるが、このような AGGREGATE 戦略はトランスダクティブ学習手法である。すべてのノードがトレーニングに参加してグラフ内のノードの特徴表現を取得する必要があり、新たなノードの特徴表現を迅速に取得できない。この問題を解決するため、参考文献 [1] の GraphSAGE は一部のノードをサンプリングして学習し、K 個の集約 AGGREGATE 関数を学習する。GraphSAGE は AGGREGATE 関数の設計に重点を置いており、パラメータなしの 𝑚𝑎𝑥、𝑚𝑒𝑎𝑛、または LSTM などのパラメータ付きニューラルネットワークとすることができる。下図は参考文献 [1] GraphSAGE の AGGREGATE 関数の学習プロセスである。

3.3 グラフ畳み込みネットワーク GCN の COMBINE 計算方法

グラフ畳み込みネットワーク GCN の COMBINE の計算方法は、一般的に第 k 層のノードが AGGREGATE によって学習したベクトルと第 K-1 層までに既に学習したノードベクトルを CONCAT し、CONCAT 後のベクトルに 1 層のニューラルネットワークの Dense 層を適用する。GCN の COMBINE は連結を使用して 2 つの元の特徴を直接結合し、ネットワークに学習させ、学習プロセス中に最適な特徴融合方法を決定することで、融合プロセスにおける情報の損失がないようにする。

3.4 グラフ畳み込みネットワーク GCN の READOUT 計算方法
グラフ読み取り演算(READOUT)はグラフ全体の表現を生成するために使用され、統合されたグラフ内の全ノードの特徴ベクトルを最終的に抽象化してグラフ全体の特徴を表現する。GCN のグラフ読み取り演算には現在、統計ベースの手法と学習ベースの手法の 2 種類がある。

統計ベースの手法

統計ベースの手法でグラフ読み取り演算を実装する場合、一般的に sum、max、average を使用してグラフ全体の抽象表現を取得する。これらの統計の利点はシンプルで、グラフニューラルネットワークモデル全体に追加のパラメータを導入しないことであるが、sum、max、average がもたらす不利な要素も明白である。これらの統計演算は高次元特徴を圧縮し、各次元におけるデータの分布特性を完全に消去するため、情報損失が比較的大きい。

学習ベースのアプローチ

統計ベースの手法の欠点はパラメータ化できず情報損失を引き起こすため、ノードからグラフベクトルへの「複雑な」プロセスを表現することが困難である。学習ベースの手法はニューラルネットワークを使用してこのプロセスをフィッティングすることを試みる。現在、参考文献 [2] において、Stanford 大学などの研究者が DIFFPOOL を提案している。これは微分可能なグラフプーリングモジュールであり、異なるグラフニューラルネットワークに階層的かつエンドツーエンドで適用できる。DIFFPOOL はグラフ全体の階層的表現を効果的に学習できる。DIFFPOOL はノードを非均一にソフトクラスタに集約でき、密に接続されたサブグラフをクラスタに集約する傾向がある。GNN は密なクリーク状のサブグラフ(直径が小さい)上で効率的に情報を転送できるため、そのような密なサブグラフ上の全ノードをプーリングしても構造情報が失われる可能性は低い。つまり、DIFFPOOL はグラフ内の各ノードが一度にグラフ全体のベクトル表現を取得するのではなく、段階的に情報を圧縮するプロセスを通じてグラフの最終表現を得ようとするものである。参考文献 [2] の下図に示す通りである。

グラフニューラルネットワークの異なる層でのクラスタ割り当てを可視化することで、DIFFPOOL が有意義なノードクラスタを学習する程度を検証する。参考文献 [2] の DIFFPOOL の階層的集約分布図は、COLLAB データセットからのグラフの 1 層目と 2 層目のノード分布の可視化を示しており、グラフ内のノードの色はどの集約クラスタに属しているかを示している。

4. 知識グラフに基づくグラフニューラルネットワークの HS コード商品分類への実装

HS コードは「Harmonized System Code」の略称である。コード調和システムは国際海関係理事会によって制定され、英語名は The Harmonization System Code(HS-Code)である。HS コードは科学的かつ体系的な国際貿易商品分類システムであり、各国の税関と商品輸出入管理機関が商品カテゴリの確認、商品分類管理の実施、関税基準の審査、商品品質指標の検査を行うために使用される。HS コードは合計 22 類 98 章で構成され、最初の 6 桁のコードは国際的に使用され、それ以降のコードは各国・地域が実際の状況に応じて拡張する。中国の現在の税関コードは 10 桁の税関コードである。HS コード分類は非常に特殊な NLP シナリオである。一般的な NLP シナリオでは、テキストセマンティックマッチングに基づいてトップ 3 でリコールできれば、NLP の効果は悪くないことを示している。しかし HS コード分類は通関プロセスで為替レートと規制条件を決定する上で重要な役割を果たすため、HS コードにはより厳格な精度が要求される。これが他のビジネスシナリオの商品分類との最大の違いであり、トップ 1 の正確性を確保する必要がある。具体的な例を挙げると、より実感しやすいだろう。

上記の例から、従来の NLP テキストのセマンティック類似度の観点では、上記のテキストのセマンティックマッチング類似度は非常に高いことがわかる。しかし HS コードは申告要素(たとえば上図の「液体要素の有無」、「定格容量」など)に基づき、具体的なビジネス知識に基づく詳細な推論を経て、初めて正しい HS コードが得られる。

4.1 従来のディープラーニングに基づく NLP モデルの HS コード分類におけるボトルネック
HS コード分類において、従来のディープラーニングに基づく NLP モデルのアーキテクチャ図は以下の通りである。

従来のディープラーニングの NLP モデルは主に以下の部分から成る。

1. HS コードのパーティクルベクトルの計算:word2vec の平均プーリングに基づく kmeans クラスタリングアルゴリズムにより HS コードのパーティクルベクトルを計算する。HS コードのベクトル表現能力とノイズ耐性。

2. HS コード階層的分類器:2 層の階層的分類器を通じて、まず粗選別により候補 HS コードを選別する。

3. 精緻化段階のセマンティック推論:HS コード商品分類のドメイン固有の知識形式に基づき、最終的に BiLSTM + Attention ベースの Encoder-Decoder セマンティック推論モデルを選択した。

従来のディープラーニングに基づく NLP モデルはオンラインの HS コード分類シナリオで稼働中である。オンラインの実際の顧客から提出された 2223 件の元分類サンプルをビジネス担当者が評価した結果、アルゴリズムが予測する HS コードのトップ 1 精度は以下の通りである。

修正なし:ビジネスレビュアーが顧客の元入力情報に対して修正を行っていない。

コード化された商品名が修正されていない:ビジネスが商品名を修正していないが、プロダクトの他の分類申告要素の属性を修正している。

その他の修正:その他の修正の状況はより複雑である。HS コード分類自体が非常に複雑で専門的な分野であるため、顧客が最初に提出した情報が税関申告の仕様に適合せず、ビジネス担当者が顧客が最初に提出した情報を修正する必要がある。

評価結果の詳細分析:従来のディープラーニングに基づく NLP モデルのトレーニングデータは、ビジネス担当者がレビューした標準化サンプルでトレーニングされているため、顧客の元入力情報が修正されていない部分では、従来のディープラーニング NLP モデルの精度とアルゴリズムテストセットの精度の差はほぼ 89.3%である。同時に、商品名が修正されていないが他の分類要素が修正された場合、従来のディープラーニング NLP モデルの精度は 87.7%であり、従来のディープラーニング NLP モデルがある程度の汎化能力を持つことを証明している。しかしその他の修正の場合、つまり顧客の元提出情報が税関仕様に適合していない場合、従来のディープラーニング NLP モデルの精度はわずか 17.3%である。この結果、全体のサンプルにおける精度は 59.3%にとどまる(計算式:0.31 × 89.3% + 0.28 × 87.7% + 0.41 × 17.3% = 59.3%)。

上記の分析から、従来のディープラーニング NLP モデルはその他の修正の場合(顧客が最初に提出した情報が税関申告仕様に適合していない)に精度が非常に低いことがわかった。不良ケースはある程度分解されており、主な原因は以下の通りである。

1. 申告要素は欠落していないが、顧客が入力した具体的な申告要素値が標準化されていない。不規則性は以下の通り:顧客の元入力は業界用語の「Lailing film」(実際には摩擦膜)であるが、NLP のコーパスにこのような業界ドメイン知識が存在しないため、従来のディープ NLP モデルはこれらのケースを解決できない。

2. 申告要素は欠落していないが、申告要素値に論理計算が必要である。たとえば、顧客が「綿 75%、ウール 10%、繊維 15%」と入力し、綿含有率が 60%未満の場合は HS コード A、綿含有組成 >60%の場合は HS コード B となる。このような論理計算を伴う NLP の問題について、従来のディープ NLP モデルはこれらのケースを解決できない。

3. ユーザーが申告要素を多く入力しすぎてノイズが多すぎる。従来のディープ NLP モデルは核心的な申告要素の構造情報を効果的に捉えられず、冗長なノイズに簡単にバイアスされる。

4. HS コード体系には「その他」が多すぎる。バックコードを使用しない限り、つまり HS コード A、HS コード B、HS コード C 以外の場合、すべてのケースが HS コード D となる。この推定もこの問題を解決するために一定の推論を必要とする。

5. 申告要素が欠落しており、顧客が完全な HS コード申告要素を入力していないため、分類が不正確になる。この推定はどのモデルに対しても有効ではない。

上記の 1 と 2 はモデル推論のための構造化知識の欠如であり、3 と 4 は因果論理推論のための構造化特徴を効果的に捉えられないことである。そのため、知識グラフに基づく GCN モデルに着目し、上記の問題の解決を試みる。

4.2 HS コード分類シナリオにおける知識グラフの知識スキーマモデリング
知識グラフのメタデータスキーマ情報定義は非常に重要である。設計の初期段階において、ontology 間の関係だけでなく、ontology スキーマの次元変化も考慮する必要がある。HS コード商品分類知識エンジンのスキーマは以下の通りである。

4.3 知識グラフに基づく GCN モデルの全体アルゴリズムアーキテクチャ

1. HS コード分野において、基盤となる知識グラフ構築のエンティティは商品名、具体的な申告要素値、申告要素に対応する業界分野の属性値であり、グラフ内のエッジは異なる申告要素のキーである。そのため、基礎となるグラフ構造は異なる関係エッジから成る異種グラフの構成である。同時に、同じプロダクトでも申告要素の値が異なると異なる HS コード(ラベル)になるため、ここでは HS コード(ラベル)は商品名と申告要素値で構築されたサブグラフ上にマーキングされ、そのようなサブグラフは予測エンティティノードとして使用される。

2. HS コード分野において、知識グラフの各エンティティノードには word2vec の平均プーリング後のセマンティックベクトルが格納されており、これによりグラフはセマンティックな汎化能力を持つ。これは従来の知識グラフで各ノードに文字テキスト中心のエンティティが格納されていたのとは異なる。

3. HS コード分野において、知識グラフに格納された構造化知識は、グラフ内のノードテキストのセマンティック特徴、グラフ内の異なるエッジの特徴、およびグラフの構造的特徴を通じて、GCN モデルの埋め込み入力層に融合・変換される必要がある。

4. HS コード分野において、グラフニューラルネットワークの隣接ノードの集約メカニズムは以下の通りである。

4.5 実装効果
4.1の詳細な分析から、従来のディープラーニングに基づく NLP モデルの HS コードオンライン精度は 59.3%であった(計算式:0.31 × 89.3% + 0.28 × 87.7% + 0.41 × 17.3% = 59.3%)。知識グラフに基づく GCN モデルは 2017-01-01 から 2020-01-08 までの全顧客元提出データをトレーニングに使用し、2020-01-09 から 2020-01-12 までの 5687 件のオンライン実データの顧客元提出データをテストデータとした。ビジネス評価の結果は以下の通りである:知識グラフに基づく GCN モデルの精度は 76%に達し、従来のディープラーニング NLP モデルの精度より 16.7%高い結果となり、知識グラフベースの GCN モデルが優れたフォールトトレランスを持つことを証明した。

5. 実験

現在、2 つの比較実験を設計しており、比較指標はテストセットの精度である。1 つはグラフニューラルネットワーク GCN のグラフレベル READOUT 戦略の sum と average の比較であり、もう 1 つは基礎となる知識グラフのグラフ構造にいくつかの変更を加えたもので、1 つはよりシンプルなスター構造、もう 1 つは複雑なグラフ構造である。

グラフニューラルネットワーク GCN のグラフレベル READOUT 戦略の sum と average の比較
知識グラフの GCN モデルの他のパラメータを保持したまま、GCN のグラフレベル READOUT 戦略を sum から average に変更し、テストサンプルの精度を観察する。

基礎となる知識グラフのグラフ構造にいくつかの変更を加えたもの。1 つはよりシンプルなスター構造、もう 1 つは複雑なグラフ構造
知識グラフの GCN モデルのパラメータを同じに保った場合、基礎となる知識グラフの保存構造がシンプルなスター構造、つまり商品名-申告要素のみをエッジで関連付け、申告要素間にエッジを生成しない。もう 1 つの知識グラフ保存構造は複雑なグラフ構造であり、商品名と申告要素の関係に加えて、センシティブな申告要素間にもエッジ関係があり、属性値と申告要素間にもエッジの関連がある。


実験を通じて、知識グラフの基礎となる構造化知識が豊かであるほど、知識グラフに基づく GCN モデルの精度が高いことがわかった。グラフニューラルネットワークモデル全体の READOUT 戦略を変更することも、モデルの精度向上に寄与する。今後さらに多くの実験を行い、知識グラフベースの GCN モデルの NLP における可能性を十分に引き出していく。

6. 今後の展望

1. 多くのビジネス分野では、大量のビジネスルール知識が手動で整理されている。これらの異種ルール知識をどのように抽出・統合して知識グラフに組み込み、知識グラフの構造化推論能力をさらに向上させるか。ビジネス整理の多段論理ルールをグラフでどのように保存するか。ビジネス整理の人工ルールはルールツリーの組織形式に似ており、and、or、not といった原子論理命題を有機的に組織化している。ここで、ビジネス整理の多段論理ルールツリーからエンティティと関係をどのように抽象化し、グラフ構造に変換するかも、今後取り組むべき課題である。

2. ルールをグラフニューラルネットワークとどのように効果的に統合するか。たとえば、HS コード分野には大量の手動ルールが既に蓄積されている。これらのルールは貴重な知識の富である。これらのルールを教師ネットワークとして HS コード分類タスクの生徒ネットワークを指導させれば、HS コード分野の精度は大幅に向上する。ルールの教師ネットワークは指導と制約の役割を果たし、ルール教師ネットワークが学習する各ルールの制約部分空間はセマンティック推論により有利である。ここで、ルールをどのように教師ネットワークに変換し、知識グラフのグラフニューラルネットワークと組み合わせるかも重要な最適化方向である。

3. 現在の知識グラフは主にテキストベースである。真に完全な知識グラフはマルチモーダルな構造化知識であるべきである。たとえば、テキストだけでなく、画像や音声などのマルチモーダル情報も持つべきである。マルチモーダルな構造化知識こそが、インテリジェントシステム全体の認知能力をさらに向上させることができる。

Related Articles

Explore More Special Offers

  1. Short Message Service(SMS) & Mail Service

    50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00

phone お問い合わせ
Hi, I'm Alibaba Cloud AI Assistant!
I can help with questions and solutions.