What are the progress and trends of natural language processing technology?
2019 年回顧:5 つの主要技術進歩と4 つの主要アプリケーション・プロダクト
過去を振り返ると、自然言語処理技術の応用・研究分野では意義ある里程碑的な出来事が数多く起こってきました。「技術進歩」と「応用・プロダクト」の2 つの視点から回顧します。
2019 年、技術進歩は主に事前学習済み言語モデル、言語横断 NLP・教師なし機械翻訳、ナレッジグラフ開発と対話技術の統合、インテリジェントなヒューマンコンピュータインタラクション、そして AI プロダクトラインの統合に見られます。
1 事前学習済み言語モデル
Google が 2018 年末に提案した事前学習済み言語モデル BERT は、複数の NLP タスクで優れた成果を収め、事前学習済み言語モデルの研究と応用は学術界と産業界の双方から NLP 分野の重大な突破と見なされました。そのアプローチは、それまでの各タスクに対する複雑なモデル設計から、事前学習とファインチューニングのパラダイムへと逐次移行し、多くの NLP アプリケーションが大規模コーパスによる事前学習モデルの配当を享受できるようになりました。単純なタスクレイヤーを追加し、自身のシナリオの少量のコーパスを組み合わせることで、良質なドメイン NLP モデルを得ることができます。
これにより、自然言語処理の新たな章が開かれました。
2019 年、各研究機関や企業は BERT を基盤にさらなる革新を重ね、Facebook が公開した RoBERTa、CMU が公開した XLNet、Stanford が公開した ELECTRA、Baidu の ERNIE モデルなど、各社独自の事前学習モデルを提案しました。Alibaba の structBERT モデル、NEZHA、HKUST、科大迅飛もそれぞれ独自のモデルを提案し、NLP タスクの最良成果を次々と更新しました。
まとめると、この新しい研究は主にトレーニングタスク設計とトレーニングアルゴリズムの2 つの視点から生まれています。
トレーニングタスク設計
より細かいセマンティクスの粒度でモデリングを行い、より細かい粒度のモデリング対象の導入や、セマンティクスの関連性をより精密に記述します。
たとえば、「全体語マスク」や「ナレッジマスキング」は、MLM 事前学習タスクで個々のトークンではなく語全体をマスクし、タスクの難度を上げることで BERT がより多くのセマンティクス情報を学習できるようにする技術で、HKUST と科大迅飛が共同で公開した中国語 BERT モデルや NEZHA モデルに応用されています。また、文間関係の種類を増やすことで、セマンティクスの関連性をより正確に記述し、セマンティクスマッチング能力を向上させることができます。これは Alibaba と Ant チームの BERT モデルに見られます。
新たな機械学習手法によるモデリング
CMU と Google が共同で公開した XLNet はオートエンコーダーと自己回帰の2 つの方式を採用し、Stanford が提案した ELECTRA モデルはより良質な MLM 学習のために対抗的メカニズムを導入しています。University of Washington と Facebook が共同で公開した SpanBERT モデルはスパン予測タスクも導入しています。これらの方式はより多くの学習手法を適用して語間の接続をモデリングし、モデル性能を向上させています。
トレーニングアルゴリズム設計
モデルの使いやすさを向上させるため、モデルパラメータを削減し、またはモデルの複雑さを低減させます。Google が公開した ALBERT は、語彙埋め込みマトリックスの分解と中間レイヤーの共有を採用しています。
トレーニング速度向上のための最適化
混合精度トレーニングで FP16 を用いて重み、活性化関数、勾配を表現し、LAMB オプティマイザーが各パラメータの学習率を適応的に調整することで、大きなバッチサイズでのモデルトレーニングが可能となります。これらの手法により、トレーニング速度が顕著に向上しました。
Alibaba の structBERT モデルは、より多くのモデル構造情報とタスク構造情報を導入することで言語表現能力を向上させます。GLUE ベンチマークでは複数回にわたりトップを獲得し、その地位を維持しました。知識蒸留と CPU 加速により RT を 10 倍改善し、ファインチューニング済みモデルは複数のビジネスシナリオに著しい改善をもたらし、AliNLP プラットフォームで公開されました。
事前学習済み言語モデルは大規模な教師なしテキストで事前学習され、得られた語と文の表現は、テキストマッチング、テキスト分類、テキスト抽出、読解、機械質問応答など、さまざまな下流タスクに転移されます。たとえば、Alibaba の言語モデルは MS MARCO 質問応答評価と TREC Deep Learning 評価でともに 1 位を獲得しました。
下流タスクでは少ないリソースで迅速に良質なソリューションを得ることができ、NLP アルゴリズムの応用実装能力が大幅に向上します。
2 言語横断 NLP・教師なし機械翻訳
事前学習済み言語モデルの拡張として、Facebook の研究者は言語横断言語モデル事前学習「Cross-lingual Language Model Pretraining」を提案し、単一言語データの教師なしトレーニングと並列コーパスを用いた教師ありトレーニングのみで、モデルが言語横断テキスト表現を効果的に学習し、多言語分類や教師なし機械学習などのタスクで従来の最良成果から著しく改善されました。
2018 年に Google の事前学習済み言語モデル BERT が主流の NLP タスクを席巻したのを受け、Facebook は 2019 年に新たな言語横断事前学習済み言語モデル XLM を公開しました。これにより、統一された埋め込み空間で異なる言語の表現共有が可能となり、著しい品質向上がもたらされました。大規模で多言語のニューラル機械翻訳の方向性を探るにあたり、Google や Alibaba などが有効な探索を行い、数十から数百の言語の並列コーパスで同時に 1 つのモデルをトレーニングすることで、言語方向ごとに分割したモデル構築に代え、セマンティクスマッピング関係の共有を実現し、モデル数を圧縮するだけでなく、少数言語の翻訳効果も一般的に向上させます。
過去 1 年間、多言語 NLP 技術の研究成果は主に機械翻訳(特に教師なし機械翻訳)、言語横断単語ベクトル、多言語 NER、依存関係構文解析、語整合、多言語辞書生成に集中しました。
言語横断単語ベクトルの学習・マッピングは重要なステップであるため、現在の教師なし・言語横断 NLP タスクは類似言語間(英語・仏語、英語・スペイン語など)では最も効果的ですが、異なる語族間(英語・ベトナム語など)での効果にはまだ大きな改善の余地があります。
3 ナレッジグラフ開発と対話技術の統合
データ量の蓄積とデータ品質・構造に対する応用要件の向上に伴い、ナレッジグラフは近年注目されはじめた技術となっています。
2019 年のナレッジグラフ技術の発展には、ドメインナレッジグラフ(金融、企業など)の構築と統合、グラフプラットフォームの標準機能(スキーマ定義、構築、呼び出し)の構築、グラフ応用アルゴリズムの構築(グラフデータに基づくグラフモデルやルール推論など)が含まれます。また、構築されたグラフデータと機能を基盤に、検索・レコメンデーションのコンテンツ理解とマイニング、金融リスク管理と意思決定、対話理解とコンテンツ生成など、より多くのビジネスシナリオでの応用が始まっています。
ナレッジグラフと対話の組み合わせの技術方向性では、対話技術は近年、質問応答とタスク指向対話で一定の技術的フレームワークとビジネスカバレッジを形成しており、より高いナレッジ理解と応答の専門性が求められるドメインシナリオ(金融アシスタントなど)への対応が求められています。
対話技術とドメインナレッジの完全性、そしてナレッジグラフの構造的品質優位を組み合わせることで、対応するシナリオにおけるコーパスアノテーション(意図理解)と専門家による構成(対話プロセスと応答生成)の不足を解消し、対話のカバー率と応答品質をさらに向上させることができます。ナレッジグラフを対話に統合する方向性により、2020 年にはより多くの実際のシナリオとカバレッジが実現されるでしょう。
4 インテリジェントなヒューマンコンピュータインタラクション
自然言語理解と深層的な質問応答マッチング技術は学術界と産業界で発展を続け、世界中のビジネスとシナリオで大規模に応用されています。事前学習済み言語モデルに基づき、性能がさらに向上しました。
機械読解は低コストの汎用技術となり、百科事典、規制・法規、製品詳細ページ、マニュアルなどのシナリオを対象に応用ミドルレイヤーが構築され、アクセス効率が大幅に向上しました。画像とテキストを組み合わせたマルチモーダル VQA 質問応答技術は業界で初めて育成され、製品詳細ページの長尺画像を理解して質問応答する新たな競争力となっています。
対話技術の能力はさらに発展しましたが、エンドツーエンドのデータ駆動型対話状態追跡と対話戦略は限られた範囲でしか探索できません。産業シナリオの対話プラットフォーム上に構築されたタスク指向ロボットが主流の実装ソリューションとなっています。
多言語技術は新言語の迅速な拡張を実現し、Cross-Lingual に基づく多言語言語モデルを構築し、英語→中国語、英語→タイ語の遠距離言語ペアで Google を上回り、新言語の追加に要する期間を前年の 2 ヶ月から 2 週間に短縮しました。
対話生成技術は突破を始めています。構造化されたナレッジの導入により生成の制御性が向上し、セールスポットの生成がショッピングガイドの転換率向上につながっています。
5 プラットフォームベンダーによる AI プロダクトラインの統合
AI 技術の発展と AI 応用のニーズ、そして TensorFlow や PyTorch などの AI 技術フレームワークの成熟に伴い、AI 技術能力は一連の AI プラットフォームプロダクトに標準化され、企業や開発者向けにより低いしきい値とより高い効率の AI アプリケーションサポートを提供しています。
会話型プラットフォームにおいて、Google は 2016 年から Assistant 対話アシスタントを公開し、近年では Google Home(現在は Google Nest スマートホームブランドに統合)、Duplex ボイス通話を公開し、API.AI 対話開発プラットフォームを買収しました。今年、Google はこれらの対話プロダクトラインを基本的に統合し、プラットフォームと端末の両方をカバーする対話プロダクトラインを形成しています。
AI プラットフォームにおいて、Amazon は 2017 年から SageMaker 機械学習プラットフォームを公開し、今年は SageMaker を基盤に AI 開発プロセスをさらに統合するとともに、下流の技術フレームワークと上流の AI アプリケーションを接続し、AI プロダクトラインを統合しました。Alibaba の機械学習プラットフォーム PAI と同様、企業と開発者向けのワンストップ機械学習プラットフォームとして位置づけられています。
2019 年、応用とプロダクトは主に機械翻訳、対話システム、マルチターン対話インテリジェントサービス、インテリジェントボイスアプリケーションの持続的な発展に見られます。
6 機械翻訳
機械翻訳の製品開発は従来のトレンドを引き続き、汎用分野(ニュース)と特定分野(E コマース、医療など)でより多くの言語方向を拡張し、より豊富なビジネスシナリオをサポートし、商業的価値をもたらし続けています。Alibaba は翻訳介入とインテリジェント汎化の方向性で実りある探索を行い、ビジネスナレッジをニューラルネットワーク翻訳フレームワークにより良く統合し、垂直シナリオの重要情報の翻訳精度を大幅に向上させました。
高価値で感度の高いコンテンツの翻訳は、依然として人手を離れません。そのため、コンピュータ支援翻訳(CAT)にインテリジェントアルゴリズムを導入して人機協力翻訳を実現することや、機械翻訳ポストエディティング(MTPE)などの新たな生産モデルがより多くの注目を集めています。Alibaba と Tencent は自動ポストエディティング(APE)とインタラクティブ機械翻訳(IMT)の製品を提供し始め、実際のビジネスに導入されています。
テキスト翻訳に加えて、さまざまなマルチモーダル翻訳アプリケーションシナリオが出現しています。たとえば、会議の同時通訳における音声翻訳、二言語字幕、翻訳機ハードウェアへの試みがあります(Alibaba の 20 周年記念年会での馬氏と逍遙子氏のスピーチもリアルタイムで二言語字幕の形式で表示されました)。
OCR、機械翻訳、画像合成技術を組み合わせた画像翻訳は Alipay、WeChat、Sogou 翻訳に応用されています。セラーによるライブストリーミングの台頭に伴い、ライブ動画翻訳のシナリオと需要はさらに増えていくでしょう。ただし、ライブブロードキャストの複雑なフィールド、専門用語、高速な発話速度、ノイズの多いバックグラウンド環境に制限され、ライブ翻訳は音声認識と機械翻訳にとって大きな課題です。
7 対話システム
対話システムの言語カバレッジがさらに向上しました。多言語移行能力に基づき、仏語、アラビア語、台湾語の対話システムが迅速に拡張され、現在 11 言語とマレー語・英語、タイ語・英語の混在言語理解をサポートしています。Lazada と AE で解決率が大幅に向上しました。
対話システムはより大規模な加盟店と企業をサポートし、50 以上のグループ経済クライアントをサポートしています。汎用パッケージ、業界パッケージ、ストアパッケージのナレッジ位置特定能力を拡張し、累計で数百万のアクティブ加盟店を支え、数千万の対話ラウンドを処理しています。DingTalk は企業向けインテリジェントアシスタントに基づき、日間 40 万のアクティブ企業を支えています。
対話システムのインタラクション形式がさらに豊富になりました。ライブストリーミングでは、製品関連の質問への受動的な回答から、ユーザーとの能動的なオープン対話への移行が実現され、100 万以上の cdau をもたらしました。
VQA などのマルチモーダル理解能力がストアと経済プラットフォームに導入され、ユーザーのインタラクション体験を向上させるとともに、加盟店の構成コストを大幅に削減しました。
代表的な事例として、Hotline の音声インタラクション能力は 2019 年の MIT Technology Review の十大突破技術の 1 つにノミネートされました。
8 マルチターン対話インテリジェントサービス
マルチターンインタラクションは、インテリジェントサービスシナリオ(カスタマーサービスロボット)において、ユーザーの曖昧な質問を解決し、ユーザー体験を向上させる上で重要な役割を果たしています。曖昧な質問とは、たとえば「有効化方法は?」のように、どのビジネスかを特定していない不完全な質問のことです。この種の質問はカスタマーサービスロボットへの全質問数の 30% を占めています。
Ant インテリジェントサービスチームはタグベースのマルチターンインタラクション方式を設計しました。まず、タグをオフラインでマイニングしてレビューします。タグにはビジネスタグ(Huabei、準備金…)と要求タグ(有効化方法、返済方法…)が含まれ、ユーザーにタグリストを再提示することで質問を明確にします。
従来の問題明確化手法は主に完全なソリューションを直接推薦して問題を明確にするものでしたが、良質な明確化問題の定義は依然として不明確です。Ant チームは強化学習に基づくソリューションを設計し、タグリストを推薦して問題を明確にします。タグ推薦全体は順次的意思決定プロセスであり、ユーザーがタグをクリックすると、クリックされたタグと当初の質問を組み合わせて明確化された質問とします。
最適化の目標は、異なるタグによる潜在的な明確化問題セットの効率的な分割を維持しながら、潜在的な明確化問題に対するタグリスト全体のカバー率を最大化することです。そのため、強化学習プロセスでは情報利得に基づく報酬(Reward)が相応に設計されています。
強化学習手法に基づくマルチターンインタラクションを導入した結果、Ant カスタマーサービスロボットのシナリオでの曖昧な質問の 33% が解決され、ロボット総合シナリオから人手への移行率が 1.2% 低下しました。
9 人間機械対話が新たなインタラクションゲートウェイを構築
シナリオ駆動型のパーソナライズされたマルチターン対話技術が人間機械対話シナリオの拡張を促進し、音声とセマンティクスを統合したコンテキスト理解技術がマルチターン対話の完了率を継続的に向上させています。
過去 1 年間、Tmall Genie は人間機械対話能力を Erha 通話アシスタント、ボイスショッピング、新規ユーザーガイドなどの複雑なインタラクションシナリオに拡張し、ダブルイレブント期間に 100 万件のボイスショッピング注文の記録を作りました。
Tmall Genie は去年の 315 に迷惑防止通話アシスタント「Erha」を公開し、新たな人間機械対話インタラクションシナリオを開きました。すなわち、ユーザーの代わりに対話を完了することです。Erha の対話シナリオは垂直分野のオープンマルチターン対話であり、対話を通じて着信の意図を特定し、ユーザーの代わりに必要な情報を取得することを目的としています。Erha では、マルチターン対話コンテキストに基づく機械読解技術を提案し、着信の意図と重要情報を理解します。着信内容の理解に基づき、Transformer ベースの対話戦略モデルを構築し、戦略の選択と対話生成を行います。Erha の対話シナリオを対象に、チューリングテストの合格率で対話品質を測定することを提案します。つまり、着信者が会話中に機械と会話していることに気づかなければ、Erha がチューリングテストに合格したと見なせます。Erha の現在のチューリングテスト合格率は 87% であり、ユーザーが不慣れな着信に対応するのを効果的に支援し、ユーザーの時間を節約しています。
人間機械対話を通じた複雑なタスクの完了(コーヒーの注文、ショッピングなど)には、機械とユーザーの間で複数の対話インタラクションが必要です。たとえば、ボイスショッピングシナリオでは、Tmall Genie が業界を超えたインテリジェントショッピングガイドとしての能力を備え、各業界のショッピングガイドの経験を吸収し、ユーザーがボイスショッピングを行う際に、最終的な取引の転換を目指し、買い物センターのように能動的にマルチターン対話の形式でショッピングガイドを行い、ユーザーのショッピングニーズを深く掘り起こし、ユーザープロフィールに基づいた精密なお勧めを行います。さらに、異なるユーザーに対して、Tmall Genie はそのユーザーに最も適した対話方法を採用し、パーソナライズされたマルチターン対話を実現します。
マルチターン対話の完了は、一連のシングルラウンドインタラクションの完了に基づいています。全体タスクの完了率が単純なシングルラウンド完了率の積であると、マルチターン対話の完了率の向上が困難になります。単純な積の関係を打破する鍵は、各ラウンドの対話を理解する際にコンテキスト情報を十分に活用することです。
Tmall Genie では、コンテキストを考慮した音声とセマンティクスの理解を探索しました。まず、音声デコーディングプロセスで、マルチターン対話で言及されたエンティティ情報をメモリに構築し、アテンションメカニズムを用いてデコーダーネットワークがこれらの対話シーン情報を認識できるようにし、マルチターン対話シーンの音声認識精度が顕著に向上しました。さらにセマンティクス理解フェーズでは、ラウンドを跨ぐアテンション機能を備えたエンドツーエンドのコンテキスト継承モデルを作成し、より効率的な対話シーン復元能力を実現しました。この結果、オンラインのマルチターン対話のエラー率が 58.5% 低減し、複雑なマルチターン対話シナリオの拡張を効果的に保証しました。
10 インテリジェントボイスアプリケーションの持続的な発展
スマートスピーカーは、近年、国内外の大手企業が次々と参入し(Amazon Alexa、Google Home/Nest、Tmall Genie)、2019 年に競争構図に入りました。出貨量は依然として増加していますが、その速度は緩やかです。
スマートスピーカーは依然として音楽再生などのソフトウェアサービスに焦点を当てていますが、さらなる応用イノベーションはスマートホームと IoT デバイスのさらなる普及に依存しています。
スマートボイス通話において、Google I/O 2018 で Duplex のボイス通話アシスタントのデモが披露されました。2019 年、スマートボイス通話はテレマーケティング、金融、公共機関などの実際のビジネス分野にさらに応用されるようになり、ユーザーサービスのカバレッジ向上と人件コスト削減を図っています。
2019 年、Ant のスマートボイス通話は、セキュリティ(セキュリティ検証)、金融(保険の再訪問、少額融資の取立て)、決済(クライアントの有効化)など、さらに多くの金融シナリオに応用・導入されます。
インテリジェントボイスアプリケーションは、対話と音声インタラクションに大きく依存するユーザーシナリオを持ち、NLP 技術と音声技術の発展を促進しています。技術と製品の発展とユーザーの受容性の向上に伴い、2020 年の応用規模と分野はさらに拡大するでしょう。
2020 年のトレンド:NLP が人工知能の知覚インテリジェンスから認知インテリジェンスへの進化をさらに促進
新たな 10 年に立ち、インテリジェントなヒューマンコンピュータインタラクション、マルチモーダル融合、分野のニーズに合わせた NLP ソリューション構築、ナレッジグラフと実装シナリオの組み合わせなどで突破的な変化が起こるでしょう。
1 インテリジェントなヒューマンコンピュータインタラクション
言語モデルはインテリジェントなヒューマンコンピュータインタラクションでより重要な役割を果たし、より豊富な形式を形成し、100 以上の言語を混在した多言語言語モデル、画像テキストと音声テキストを融合したマルチモーダル言語モデルが登場し、異なる言語、異なるモダリティ、異なる分野の少ナンプルシナリオにおいて、包括的な能力向上をもたらします。
多言語インタラクションは、異なる言語の理解から異なる文化の理解へと升華します。越文化理解技術を通じて、現地文化に深く入り込み、より自然な対話インタラクションを実現します。
オンラインテキスト中心のインタラクションモードは、動画、画像、音声、テキストを組み合わせたマルチモーダルのヒューマンコンピュータインタラクションに全面的に移行します。
データ駆動型の対話状態追跡と対話戦略がルールベースの戦略を逐次置き換え、マルチターン対話技術をさらに進化させ、より自然な対話体験をもたらします。
ナレッジグラフは質問応答や対話のさまざまなディープラーニングモデルに広範に統合されます。事前知識と推論能力の統合により、モデルのホワイトボックス化が進み、より良い制御可能性と解釈可能性がもたらされます。
少ナンプルシナリオにおける対話システムのコールドスタート能力の向上により、アプリケーション構築コストが顕著に削減されます。対話システムは大量のクライアントへのサービスから、より包括的で広範な各業界の小規模企業への支援に拡張し、さらに海外へも拡大し、より多くの異なる国、言語、文化のユーザーがインテリジェントサービスの時代に入ります。
2 マルチモーダル融合
5G とエッジコンピューティングの逐次的な成熟と普及に伴い、動画、画像、テキスト、音声などのモードの包括的な融合がもたらされます。システムは、ユーザーがマルチターン対話を通じて送信した画像、音声、テキストコンテンツを統合的に理解し、マルチモーダルの形式で回答できるようになります。
対話システム製品はマルチモーダルインタラクション能力を全面的に実現します。ライブストリーミングと IoT 大型スクリーンインタラクションでは動画、画像、テキストのマルチモーダル技術を全面的に応用し、豊富なインタラクティブ体験をもたらし、スムーズな全二重音声対話ロボットが広範に利用され、聴きながら考える、聴きながら推測する、能動的に発話を抓むなどの人間のようなインタラクション能力を実現します。
音声インタラクションシナリオでは、音響信号とテキスト信号を通じてユーザーの通信における感情の変化を識別し、IoT インタラクションシナリオのカメラとマイクに基づく生まれたモノマネを実現します。
3 分野のニーズに合わせた NLP ソリューションの構築
従来、NLP アルゴリズムは主にプラットフォームや API の形で汎用モデルを出力してきました。それに対応し、各種クラウドに汎用 NLP アルゴリズムプラットフォームが構築されています(Amazon Comprehend、Microsoft Azure Text Analytics、Google Cloud Natural Language、Ali NLP、Baidu NLP など)。
ただし、ビジネスシナリオでは、各シナリオドメインにはそれぞれ特定の要件があり、対応するシナリオデータが生成されます。汎用モデルはシーンデータを組み合わせてドメイン適応トレーニングを行うことで、出力されるドメインカスタマイズモデルがビジネスニーズをより良く満たします。
4 ナレッジグラフと実装シナリオの組み合わせ
新たな 10 年に向け、NLP とナレッジグラフの2 つのコア技術を用いて業界ナレッジグラフを構築します。機械はナレッジグラフを通じて隠れた関係をマイニングし、「裸眼」では発見できない関係とロジックを洞察し、最終的なビジネス意思決定に活用し、より深層的なビジネスシナリオへの実装を実現します。発展方向性の視点から、以下の要素に分類できます。
知識抽出能力の最適化:既存の知識と NLP 技術能力を組み合わせて非構造化データ理解能力をさらに向上させ、事前学習済み言語モデル、情報抽出、エンティティリンクなどの関連技術を適用して非構造化データと半構造化データを抽出・変換し、ナレッジグラフの形式でナレッジを形成し、ナレッジグラフ内の構造化された知識とリンクさせます。
業界ナレッジの蓄積:業界ナレッジグラフソリューションの実際の導入プロセスには多くの課題があります。業界ナレッジグラフの構築にはビジネスシナリオに基づくデータ蓄積とデータ理解が必要です。業界ナレッジグラフの構築と蓄積は、認知インテリジェンス時代のコア競争力となります。業界データの構築では、知識の精度が非常に高く、エンティティは通常より多く、業界的な意義を持つ必要があります。多源異種データの融合には、動的に変化する「概念・エンティティ・属性・関係」データモデルに基づく各種データの抽象モデリングが必要です。
インテリジェントで信頼できる知識推論:既知の知識に基づく知識推論、業界イベント知識の理解による知識推論の伝達、業界ルールロジックとディープモデルを組み合わせた推論を行うことで、ビジネス推論と意思決定支援においてより高いインテリジェンスとパーソナライズされた体験をもたらします。
以上が、過去 1 年間の NLP 技術の発展の回顧と、今年のトレンドに対する考えです。一家の言であるため、遺漏や概括化は免れません。砧を投げて玉を引く、より多くの方々の考えとご指摘をいただければ幸いです。Bill Gates は昔「言語理解は人工知能の王冠の珠である」と述べました。その高みに達するには、技術と応用の両面での突破が必要です。次の 10 年の幕開けを見据え、NLP 技術をより迅速に発展させ、応用シナリオを豊富にし、認知インテリジェンスの発展を促進していくことを期待しています。
7 対話システム
対話システムの言語カバレッジがさらに向上しました。多言語移行能力に基づき、仏語、アラビア語、台湾語の対話システムが迅速に拡張され、現在 11 言語とマレー語・英語、タイ語・英語の混在言語理解をサポートしています。Lazada と AE で解決率が大幅に向上しました。
対話システムはより大規模な加盟店と企業をサポートし、50 以上のグループ経済クライアントをサポートしています。汎用パッケージ、業界パッケージ、ストアパッケージのナレッジ位置特定能力を拡張し、累計で数百万のアクティブ加盟店を支え、数千万の対話ラウンドを処理しています。DingTalk は企業向けインテリジェントアシスタントに基づき、日間 40 万のアクティブ企業を支えています。
対話システムのインタラクション形式がさらに豊富になりました。ライブストリーミングでは、製品関連の質問への受動的な回答から、ユーザーとの能動的なオープン対話への移行が実現され、100 万以上の cdau をもたらしました。
VQA などのマルチモーダル理解能力がストアと経済プラットフォームに導入され、ユーザーのインタラクション体験を向上させるとともに、加盟店の構成コストを大幅に削減しました。
代表的な事例として、Hotline の音声インタラクション能力は 2019 年の MIT Technology Review の十大突破技術の 1 つにノミネートされました。
8 マルチターン対話インテリジェントサービス
マルチターンインタラクションは、インテリジェントサービスシナリオ(カスタマーサービスロボット)において、ユーザーの曖昧な質問を解決し、ユーザー体験を向上させる上で重要な役割を果たしています。曖昧な質問とは、たとえば「有効化方法は?」のように、どのビジネスかを特定していない不完全な質問のことです。この種の質問はカスタマーサービスロボットへの全質問数の 33% を占めています。
Ant インテリジェントサービスチームはタグベースのマルチターンインタラクション方式を設計しました。まず、タグをオフラインでマイニングしてレビューします。タグにはビジネスタグ(Huabei、準備金…)と要求タグ(有効化方法、返済方法…)が含まれ、ユーザーにタグリストを再提示することで質問を明確にします。
従来の問題明確化手法は主に完全なソリューションを直接推薦して問題を明確にするものでしたが、良質な明確化問題の定義は依然として不明確です。Ant チームは強化学習に基づくソリューションを設計し、タグリストを推薦して問題を明確にします。タグ推薦全体は順次的意思決定プロセスであり、ユーザーがタグをクリックすると、クリックされたタグと当初の質問を組み合わせて明確化された質問とします。
最適化の目標は、異なるタグによる潜在的な明確化問題セットの効率的な分割を維持しながら、潜在的な明確化問題に対するタグリスト全体のカバー率を最大化することです。そのため、強化学習プロセスでは情報利得に基づく報酬(Reward)が相応に設計されています。
強化学習手法に基づくマルチターンインタラクションを導入した結果、Ant カスタマーサービスロボットのシナリオでの曖昧な質問の 33% が解決され、ロボット総合シナリオから人手への移行率が 1.2% 低下しました。
9 人間機械対話が新たなインタラクションゲートウェイを構築
シナリオ駆動型のパーソナライズされたマルチターン対話技術が人間機械対話シナリオの拡張を促進し、音声とセマンティクスを統合したコンテキスト理解技術がマルチターン対話の完了率を継続的に向上させています。
過去 1 年間、Tmall Genie は人間機械対話能力を Erha 通話アシスタント、ボイスショッピング、新規ユーザーガイドなどの複雑なインタラクションシナリオに拡張し、ダブルイレブント期間に 100 万件のボイスショッピング注文の記録を作りました。
Tmall Genie は去年の 315 に迷惑防止通話アシスタント「Erha」を公開し、新たな人間機械対話インタラクションシナリオを開きました。すなわち、ユーザーの代わりに対話を完了することです。Erha の対話シナリオは垂直分野のオープンマルチターン対話であり、対話を通じて着信の意図を特定し、ユーザーの代わりに必要な情報を取得することを目的としています。Erha では、マルチターン対話コンテキストに基づく機械読解技術を提案し、着信の意図と重要情報を理解します。着信内容の理解に基づき、Transformer ベースの対話戦略モデルを構築し、戦略の選択と対話生成を行います。Erha の対話シナリオを対象に、チューリングテストの合格率で対話品質を測定することを提案します。つまり、着信者が会話中に機械と会話していることに気づかなければ、Erha がチューリングテストに合格したと見なせます。Erha の現在のチューリングテスト合格率は 87% であり、ユーザーが不慣れな着信に対応するのを効果的に支援し、ユーザーの時間を節約しています。
人間機械対話を通じた複雑なタスクの完了(コーヒーの注文、ショッピングなど)には、機械とユーザーの間で複数の対話インタラクションが必要です。たとえば、ボイスショッピングシナリオでは、Tmall Genie が業界を超えたインテリジェントショッピングガイドとしての能力を備え、各業界のショッピングガイドの経験を吸収し、ユーザーがボイスショッピングを行う際に、最終的な取引の転換を目指し、買い物センターのように能動的にマルチターン対話の形式でショッピングガイドを行い、ユーザーのショッピングニーズを深く掘り起こし、ユーザープロフィールに基づいた精密なお勧めを行います。さらに、異なるユーザーに対して、Tmall Genie はそのユーザーに最も適した対話方法を採用し、パーソナライズされたマルチターン対話を実現します。
マルチターン対話の完了は、一連のシングルラウンドインタラクションの完了に基づいています。全体タスクの完了率が単純なシングルラウンド完了率の積であると、マルチターン対話の完了率の向上が困難になります。単純な積の関係を打破する鍵は、各ラウンドの対話を理解する際にコンテキスト情報を十分に活用することです。
Tmall Genie では、コンテキストを考慮した音声とセマンティクスの理解を探索しました。まず、音声デコーディングプロセスで、マルチターン対話で言及されたエンティティ情報をメモリに構築し、アテンションメカニズムを用いてデコーダーネットワークがこれらの対話シーン情報を認識できるようにし、マルチターン対話シーンの音声認識精度が顕著に向上しました。さらにセマンティクス理解フェーズでは、ラウンドを跨ぐアテンション機能を備えたエンドツーエンドのコンテキスト継承モデルを作成し、より効率的な対話シーン復元能力を実現しました。この結果、オンラインのマルチターン対話のエラー率が 58.5% 低減し、複雑なマルチターン対話シナリオの拡張を効果的に保証しました。
10 インテリジェントボイスアプリケーションの持続的な発展
スマートスピーカーは、近年、国内外の大手企業が次々と参入し(Amazon Alexa、Google Home/Nest、Tmall Genie)、2019 年に競争構図に入りました。出貨量は依然として増加していますが、その速度は緩やかです。
スマートスピーカーは依然として音楽再生などのソフトウェアサービスに焦点を当てていますが、さらなる応用イノベーションはスマートホームと IoT デバイスのさらなる普及に依存しています。
スマートボイス通話において、Google I/O 2018 で Duplex のボイス通話アシスタントのデモが披露されました。2019 年、スマートボイス通話はテレマーケティング、金融、公共機関などの実際のビジネス分野にさらに応用されるようになり、ユーザーサービスのカバレッジ向上と人件コスト削減を図っています。
2019 年、Ant のスマートボイス通話は、セキュリティ(セキュリティ検証)、金融(保険の再訪問、少額融資の取立て)、決済(クライアントの有効化)など、さらに多くの金融シナリオに応用・導入されます。
インテリジェントボイスアプリケーションは、対話と音声インタラクションに大きく依存するユーザーシナリオを持ち、NLP 技術と音声技術の発展を促進しています。技術と製品の発展とユーザーの受容性の向上に伴い、2020 年の応用規模と分野はさらに拡大するでしょう。
2020 年のトレンド:NLP が人工知能の知覚インテリジェンスから認知インテリジェンスへの進化をさらに促進
新たな 10 年に立ち、インテリジェントなヒューマンコンピュータインタラクション、マルチモーダル融合、分野のニーズに合わせた NLP ソリューション構築、ナレッジグラフと実装シナリオの組み合わせなどで突破的な変化が起こるでしょう。
1 インテリジェントなヒューマンコンピュータインタラクション
言語モデルはインテリジェントなヒューマンコンピュータインタラクションでより重要な役割を果たし、より豊富な形式を形成し、100 以上の言語を混在した多言語言語モデル、画像テキストと音声テキストを融合したマルチモーダル言語モデルが登場し、異なる言語、異なるモダリティ、異なる分野の少ナンプルシナリオにおいて、包括的な能力向上をもたらします。
多言語インタラクションは、異なる言語の理解から異なる文化の理解へと升華します。越文化理解技術を通じて、現地文化に深く入り込み、より自然な対話インタラクションを実現します。
オンラインテキスト中心のインタラクションモードは、動画、画像、音声、テキストを組み合わせたマルチモーダルのヒューマンコンピュータインタラクションに全面的に移行します。
データ駆動型の対話状態追跡と対話戦略がルールベースの戦略を逐次置き換え、マルチターン対話技術をさらに進化させ、より自然な対話体験をもたらします。
ナレッジグラフは質問応答や対話のさまざまなディープラーニングモデルに広範に統合されます。事前知識と推論能力の統合により、モデルのホワイトボックス化が進み、より良い制御可能性と解釈可能性がもたらされます。
少ナンプルシナリオにおける対話システムのコールドスタート能力の向上により、アプリケーション構築コストが顕著に削減されます。対話システムは大量のクライアントへのサービスから、より包括的で広範な各業界の小規模企業への支援に拡張し、さらに海外へも拡大し、より多くの異なる国、言語、文化のユーザーがインテリジェントサービスの時代に入ります。
2 マルチモーダル融合
5G とエッジコンピューティングの逐次的な成熟と普及に伴い、動画、画像、テキスト、音声などのモードの包括的な融合がもたらされます。システムは、ユーザーがマルチターン対話を通じて送信した画像、音声、テキストコンテンツを統合的に理解し、マルチモーダルの形式で回答できるようになります。
対話システム製品はマルチモーダルインタラクション能力を全面的に実現します。ライブストリーミングと IoT 大型スクリーンインタラクションでは動画、画像、テキストのマルチモーダル技術を全面的に応用し、豊富なインタラクティブ体験をもたらし、スムーズな全二重音声対話ロボットが広範に利用され、聴きながら考える、聴きながら推測する、能動的に発話を抓むなどの人間のようなインタラクション能力を実現します。
音声インタラクションシナリオでは、音響信号とテキスト信号を通じてユーザーの通信における感情の変化を識別し、IoT インタラクションシナリオのカメラとマイクに基づく生まれたモノマネを実現します。
3 分野のニーズに合わせた NLP ソリューションの構築
従来、NLP アルゴリズムは主にプラットフォームや API の形で汎用モデルを出力してきました。それに対応し、各種クラウドに汎用 NLP アルゴリズムプラットフォームが構築されています(Amazon Comprehend、Microsoft Azure Text Analytics、Google Cloud Natural Language、Ali NLP、Baidu NLP など)。
ただし、ビジネスシナリオでは、各シナリオドメインにはそれぞれ特定の要件があり、対応するシナリオデータが生成されます。汎用モデルはシーンデータを組み合わせてドメイン適応トレーニングを行うことで、出力されるドメインカスタマイズモデルがビジネスニーズをより良く満たします。
4 ナレッジグラフと実装シナリオの組み合わせ
新たな 10 年に向け、NLP とナレッジグラフの2 つのコア技術を用いて業界ナレッジグラフを構築します。機械はナレッジグラフを通じて隠れた関係をマイニングし、「裸眼」では発見できない関係とロジックを洞察し、最終的なビジネス意思決定に活用し、より深層的なビジネスシナリオへの実装を実現します。発展方向性の視点から、以下の要素に分類できます。
知識抽出能力の最適化:既存の知識と NLP 技術能力を組み合わせて非構造化データ理解能力をさらに向上させ、事前学習済み言語モデル、情報抽出、エンティティリンクなどの関連技術を適用して非構造化データと半構造化データを抽出・変換し、ナレッジグラフの形式でナレッジを形成し、ナレッジグラフ内の構造化された知識とリンクさせます。
業界ナレッジの蓄積:業界ナレッジグラフソリューションの実際の導入プロセスには多くの課題があります。業界ナレッジグラフの構築にはビジネスシナリオに基づくデータ蓄積とデータ理解が必要です。業界ナレッジグラフの構築と蓄積は、認知インテリジェンス時代のコア競争力となります。業界データの構築では、知識の精度が非常に高く、エンティティは通常より多く、業界的な意義を持つ必要があります。多源異種データの融合には、動的に変化する「概念・エンティティ・属性・関係」データモデルに基づく各種データの抽象モデリングが必要です。
インテリジェントで信頼できる知識推論:既知の知識に基づく知識推論、業界イベント知識の理解による知識推論の伝達、業界ルールロジックとディープモデルを組み合わせた推論を行うことで、ビジネス推論と意思決定支援においてより高いインテリジェンスとパーソナライズされた体験をもたらします。
以上が、過去 1 年間の NLP 技術の発展の回顧と、今年のトレンドに対する考えです。一家の言であるため、遺漏や概括化は免れません。砧を投げて玉を引く、より多くの方々の考えとご指摘をいただければ幸いです。Bill Gates は昔「言語理解は人工知能の王冠の珠である」と述べました。その高みに達するには、技術と応用の両面での突破が必要です。次の 10 年の幕開けを見据え、NLP 技術をより迅速に発展させ、応用シナリオを豊富にし、認知インテリジェンスの発展を促進していくことを期待しています。
過去を振り返ると、自然言語処理技術の応用・研究分野では意義ある里程碑的な出来事が数多く起こってきました。「技術進歩」と「応用・プロダクト」の2 つの視点から回顧します。
2019 年、技術進歩は主に事前学習済み言語モデル、言語横断 NLP・教師なし機械翻訳、ナレッジグラフ開発と対話技術の統合、インテリジェントなヒューマンコンピュータインタラクション、そして AI プロダクトラインの統合に見られます。
1 事前学習済み言語モデル
Google が 2018 年末に提案した事前学習済み言語モデル BERT は、複数の NLP タスクで優れた成果を収め、事前学習済み言語モデルの研究と応用は学術界と産業界の双方から NLP 分野の重大な突破と見なされました。そのアプローチは、それまでの各タスクに対する複雑なモデル設計から、事前学習とファインチューニングのパラダイムへと逐次移行し、多くの NLP アプリケーションが大規模コーパスによる事前学習モデルの配当を享受できるようになりました。単純なタスクレイヤーを追加し、自身のシナリオの少量のコーパスを組み合わせることで、良質なドメイン NLP モデルを得ることができます。
これにより、自然言語処理の新たな章が開かれました。
2019 年、各研究機関や企業は BERT を基盤にさらなる革新を重ね、Facebook が公開した RoBERTa、CMU が公開した XLNet、Stanford が公開した ELECTRA、Baidu の ERNIE モデルなど、各社独自の事前学習モデルを提案しました。Alibaba の structBERT モデル、NEZHA、HKUST、科大迅飛もそれぞれ独自のモデルを提案し、NLP タスクの最良成果を次々と更新しました。
まとめると、この新しい研究は主にトレーニングタスク設計とトレーニングアルゴリズムの2 つの視点から生まれています。
トレーニングタスク設計
より細かいセマンティクスの粒度でモデリングを行い、より細かい粒度のモデリング対象の導入や、セマンティクスの関連性をより精密に記述します。
たとえば、「全体語マスク」や「ナレッジマスキング」は、MLM 事前学習タスクで個々のトークンではなく語全体をマスクし、タスクの難度を上げることで BERT がより多くのセマンティクス情報を学習できるようにする技術で、HKUST と科大迅飛が共同で公開した中国語 BERT モデルや NEZHA モデルに応用されています。また、文間関係の種類を増やすことで、セマンティクスの関連性をより正確に記述し、セマンティクスマッチング能力を向上させることができます。これは Alibaba と Ant チームの BERT モデルに見られます。
新たな機械学習手法によるモデリング
CMU と Google が共同で公開した XLNet はオートエンコーダーと自己回帰の2 つの方式を採用し、Stanford が提案した ELECTRA モデルはより良質な MLM 学習のために対抗的メカニズムを導入しています。University of Washington と Facebook が共同で公開した SpanBERT モデルはスパン予測タスクも導入しています。これらの方式はより多くの学習手法を適用して語間の接続をモデリングし、モデル性能を向上させています。
トレーニングアルゴリズム設計
モデルの使いやすさを向上させるため、モデルパラメータを削減し、またはモデルの複雑さを低減させます。Google が公開した ALBERT は、語彙埋め込みマトリックスの分解と中間レイヤーの共有を採用しています。
トレーニング速度向上のための最適化
混合精度トレーニングで FP16 を用いて重み、活性化関数、勾配を表現し、LAMB オプティマイザーが各パラメータの学習率を適応的に調整することで、大きなバッチサイズでのモデルトレーニングが可能となります。これらの手法により、トレーニング速度が顕著に向上しました。
Alibaba の structBERT モデルは、より多くのモデル構造情報とタスク構造情報を導入することで言語表現能力を向上させます。GLUE ベンチマークでは複数回にわたりトップを獲得し、その地位を維持しました。知識蒸留と CPU 加速により RT を 10 倍改善し、ファインチューニング済みモデルは複数のビジネスシナリオに著しい改善をもたらし、AliNLP プラットフォームで公開されました。
事前学習済み言語モデルは大規模な教師なしテキストで事前学習され、得られた語と文の表現は、テキストマッチング、テキスト分類、テキスト抽出、読解、機械質問応答など、さまざまな下流タスクに転移されます。たとえば、Alibaba の言語モデルは MS MARCO 質問応答評価と TREC Deep Learning 評価でともに 1 位を獲得しました。
下流タスクでは少ないリソースで迅速に良質なソリューションを得ることができ、NLP アルゴリズムの応用実装能力が大幅に向上します。
2 言語横断 NLP・教師なし機械翻訳
事前学習済み言語モデルの拡張として、Facebook の研究者は言語横断言語モデル事前学習「Cross-lingual Language Model Pretraining」を提案し、単一言語データの教師なしトレーニングと並列コーパスを用いた教師ありトレーニングのみで、モデルが言語横断テキスト表現を効果的に学習し、多言語分類や教師なし機械学習などのタスクで従来の最良成果から著しく改善されました。
2018 年に Google の事前学習済み言語モデル BERT が主流の NLP タスクを席巻したのを受け、Facebook は 2019 年に新たな言語横断事前学習済み言語モデル XLM を公開しました。これにより、統一された埋め込み空間で異なる言語の表現共有が可能となり、著しい品質向上がもたらされました。大規模で多言語のニューラル機械翻訳の方向性を探るにあたり、Google や Alibaba などが有効な探索を行い、数十から数百の言語の並列コーパスで同時に 1 つのモデルをトレーニングすることで、言語方向ごとに分割したモデル構築に代え、セマンティクスマッピング関係の共有を実現し、モデル数を圧縮するだけでなく、少数言語の翻訳効果も一般的に向上させます。
過去 1 年間、多言語 NLP 技術の研究成果は主に機械翻訳(特に教師なし機械翻訳)、言語横断単語ベクトル、多言語 NER、依存関係構文解析、語整合、多言語辞書生成に集中しました。
言語横断単語ベクトルの学習・マッピングは重要なステップであるため、現在の教師なし・言語横断 NLP タスクは類似言語間(英語・仏語、英語・スペイン語など)では最も効果的ですが、異なる語族間(英語・ベトナム語など)での効果にはまだ大きな改善の余地があります。
3 ナレッジグラフ開発と対話技術の統合
データ量の蓄積とデータ品質・構造に対する応用要件の向上に伴い、ナレッジグラフは近年注目されはじめた技術となっています。
2019 年のナレッジグラフ技術の発展には、ドメインナレッジグラフ(金融、企業など)の構築と統合、グラフプラットフォームの標準機能(スキーマ定義、構築、呼び出し)の構築、グラフ応用アルゴリズムの構築(グラフデータに基づくグラフモデルやルール推論など)が含まれます。また、構築されたグラフデータと機能を基盤に、検索・レコメンデーションのコンテンツ理解とマイニング、金融リスク管理と意思決定、対話理解とコンテンツ生成など、より多くのビジネスシナリオでの応用が始まっています。
ナレッジグラフと対話の組み合わせの技術方向性では、対話技術は近年、質問応答とタスク指向対話で一定の技術的フレームワークとビジネスカバレッジを形成しており、より高いナレッジ理解と応答の専門性が求められるドメインシナリオ(金融アシスタントなど)への対応が求められています。
対話技術とドメインナレッジの完全性、そしてナレッジグラフの構造的品質優位を組み合わせることで、対応するシナリオにおけるコーパスアノテーション(意図理解)と専門家による構成(対話プロセスと応答生成)の不足を解消し、対話のカバー率と応答品質をさらに向上させることができます。ナレッジグラフを対話に統合する方向性により、2020 年にはより多くの実際のシナリオとカバレッジが実現されるでしょう。
4 インテリジェントなヒューマンコンピュータインタラクション
自然言語理解と深層的な質問応答マッチング技術は学術界と産業界で発展を続け、世界中のビジネスとシナリオで大規模に応用されています。事前学習済み言語モデルに基づき、性能がさらに向上しました。
機械読解は低コストの汎用技術となり、百科事典、規制・法規、製品詳細ページ、マニュアルなどのシナリオを対象に応用ミドルレイヤーが構築され、アクセス効率が大幅に向上しました。画像とテキストを組み合わせたマルチモーダル VQA 質問応答技術は業界で初めて育成され、製品詳細ページの長尺画像を理解して質問応答する新たな競争力となっています。
対話技術の能力はさらに発展しましたが、エンドツーエンドのデータ駆動型対話状態追跡と対話戦略は限られた範囲でしか探索できません。産業シナリオの対話プラットフォーム上に構築されたタスク指向ロボットが主流の実装ソリューションとなっています。
多言語技術は新言語の迅速な拡張を実現し、Cross-Lingual に基づく多言語言語モデルを構築し、英語→中国語、英語→タイ語の遠距離言語ペアで Google を上回り、新言語の追加に要する期間を前年の 2 ヶ月から 2 週間に短縮しました。
対話生成技術は突破を始めています。構造化されたナレッジの導入により生成の制御性が向上し、セールスポットの生成がショッピングガイドの転換率向上につながっています。
5 プラットフォームベンダーによる AI プロダクトラインの統合
AI 技術の発展と AI 応用のニーズ、そして TensorFlow や PyTorch などの AI 技術フレームワークの成熟に伴い、AI 技術能力は一連の AI プラットフォームプロダクトに標準化され、企業や開発者向けにより低いしきい値とより高い効率の AI アプリケーションサポートを提供しています。
会話型プラットフォームにおいて、Google は 2016 年から Assistant 対話アシスタントを公開し、近年では Google Home(現在は Google Nest スマートホームブランドに統合)、Duplex ボイス通話を公開し、API.AI 対話開発プラットフォームを買収しました。今年、Google はこれらの対話プロダクトラインを基本的に統合し、プラットフォームと端末の両方をカバーする対話プロダクトラインを形成しています。
AI プラットフォームにおいて、Amazon は 2017 年から SageMaker 機械学習プラットフォームを公開し、今年は SageMaker を基盤に AI 開発プロセスをさらに統合するとともに、下流の技術フレームワークと上流の AI アプリケーションを接続し、AI プロダクトラインを統合しました。Alibaba の機械学習プラットフォーム PAI と同様、企業と開発者向けのワンストップ機械学習プラットフォームとして位置づけられています。
2019 年、応用とプロダクトは主に機械翻訳、対話システム、マルチターン対話インテリジェントサービス、インテリジェントボイスアプリケーションの持続的な発展に見られます。
6 機械翻訳
機械翻訳の製品開発は従来のトレンドを引き続き、汎用分野(ニュース)と特定分野(E コマース、医療など)でより多くの言語方向を拡張し、より豊富なビジネスシナリオをサポートし、商業的価値をもたらし続けています。Alibaba は翻訳介入とインテリジェント汎化の方向性で実りある探索を行い、ビジネスナレッジをニューラルネットワーク翻訳フレームワークにより良く統合し、垂直シナリオの重要情報の翻訳精度を大幅に向上させました。
高価値で感度の高いコンテンツの翻訳は、依然として人手を離れません。そのため、コンピュータ支援翻訳(CAT)にインテリジェントアルゴリズムを導入して人機協力翻訳を実現することや、機械翻訳ポストエディティング(MTPE)などの新たな生産モデルがより多くの注目を集めています。Alibaba と Tencent は自動ポストエディティング(APE)とインタラクティブ機械翻訳(IMT)の製品を提供し始め、実際のビジネスに導入されています。
テキスト翻訳に加えて、さまざまなマルチモーダル翻訳アプリケーションシナリオが出現しています。たとえば、会議の同時通訳における音声翻訳、二言語字幕、翻訳機ハードウェアへの試みがあります(Alibaba の 20 周年記念年会での馬氏と逍遙子氏のスピーチもリアルタイムで二言語字幕の形式で表示されました)。
OCR、機械翻訳、画像合成技術を組み合わせた画像翻訳は Alipay、WeChat、Sogou 翻訳に応用されています。セラーによるライブストリーミングの台頭に伴い、ライブ動画翻訳のシナリオと需要はさらに増えていくでしょう。ただし、ライブブロードキャストの複雑なフィールド、専門用語、高速な発話速度、ノイズの多いバックグラウンド環境に制限され、ライブ翻訳は音声認識と機械翻訳にとって大きな課題です。
7 対話システム
対話システムの言語カバレッジがさらに向上しました。多言語移行能力に基づき、仏語、アラビア語、台湾語の対話システムが迅速に拡張され、現在 11 言語とマレー語・英語、タイ語・英語の混在言語理解をサポートしています。Lazada と AE で解決率が大幅に向上しました。
対話システムはより大規模な加盟店と企業をサポートし、50 以上のグループ経済クライアントをサポートしています。汎用パッケージ、業界パッケージ、ストアパッケージのナレッジ位置特定能力を拡張し、累計で数百万のアクティブ加盟店を支え、数千万の対話ラウンドを処理しています。DingTalk は企業向けインテリジェントアシスタントに基づき、日間 40 万のアクティブ企業を支えています。
対話システムのインタラクション形式がさらに豊富になりました。ライブストリーミングでは、製品関連の質問への受動的な回答から、ユーザーとの能動的なオープン対話への移行が実現され、100 万以上の cdau をもたらしました。
VQA などのマルチモーダル理解能力がストアと経済プラットフォームに導入され、ユーザーのインタラクション体験を向上させるとともに、加盟店の構成コストを大幅に削減しました。
代表的な事例として、Hotline の音声インタラクション能力は 2019 年の MIT Technology Review の十大突破技術の 1 つにノミネートされました。
8 マルチターン対話インテリジェントサービス
マルチターンインタラクションは、インテリジェントサービスシナリオ(カスタマーサービスロボット)において、ユーザーの曖昧な質問を解決し、ユーザー体験を向上させる上で重要な役割を果たしています。曖昧な質問とは、たとえば「有効化方法は?」のように、どのビジネスかを特定していない不完全な質問のことです。この種の質問はカスタマーサービスロボットへの全質問数の 30% を占めています。
Ant インテリジェントサービスチームはタグベースのマルチターンインタラクション方式を設計しました。まず、タグをオフラインでマイニングしてレビューします。タグにはビジネスタグ(Huabei、準備金…)と要求タグ(有効化方法、返済方法…)が含まれ、ユーザーにタグリストを再提示することで質問を明確にします。
従来の問題明確化手法は主に完全なソリューションを直接推薦して問題を明確にするものでしたが、良質な明確化問題の定義は依然として不明確です。Ant チームは強化学習に基づくソリューションを設計し、タグリストを推薦して問題を明確にします。タグ推薦全体は順次的意思決定プロセスであり、ユーザーがタグをクリックすると、クリックされたタグと当初の質問を組み合わせて明確化された質問とします。
最適化の目標は、異なるタグによる潜在的な明確化問題セットの効率的な分割を維持しながら、潜在的な明確化問題に対するタグリスト全体のカバー率を最大化することです。そのため、強化学習プロセスでは情報利得に基づく報酬(Reward)が相応に設計されています。
強化学習手法に基づくマルチターンインタラクションを導入した結果、Ant カスタマーサービスロボットのシナリオでの曖昧な質問の 33% が解決され、ロボット総合シナリオから人手への移行率が 1.2% 低下しました。
9 人間機械対話が新たなインタラクションゲートウェイを構築
シナリオ駆動型のパーソナライズされたマルチターン対話技術が人間機械対話シナリオの拡張を促進し、音声とセマンティクスを統合したコンテキスト理解技術がマルチターン対話の完了率を継続的に向上させています。
過去 1 年間、Tmall Genie は人間機械対話能力を Erha 通話アシスタント、ボイスショッピング、新規ユーザーガイドなどの複雑なインタラクションシナリオに拡張し、ダブルイレブント期間に 100 万件のボイスショッピング注文の記録を作りました。
Tmall Genie は去年の 315 に迷惑防止通話アシスタント「Erha」を公開し、新たな人間機械対話インタラクションシナリオを開きました。すなわち、ユーザーの代わりに対話を完了することです。Erha の対話シナリオは垂直分野のオープンマルチターン対話であり、対話を通じて着信の意図を特定し、ユーザーの代わりに必要な情報を取得することを目的としています。Erha では、マルチターン対話コンテキストに基づく機械読解技術を提案し、着信の意図と重要情報を理解します。着信内容の理解に基づき、Transformer ベースの対話戦略モデルを構築し、戦略の選択と対話生成を行います。Erha の対話シナリオを対象に、チューリングテストの合格率で対話品質を測定することを提案します。つまり、着信者が会話中に機械と会話していることに気づかなければ、Erha がチューリングテストに合格したと見なせます。Erha の現在のチューリングテスト合格率は 87% であり、ユーザーが不慣れな着信に対応するのを効果的に支援し、ユーザーの時間を節約しています。
人間機械対話を通じた複雑なタスクの完了(コーヒーの注文、ショッピングなど)には、機械とユーザーの間で複数の対話インタラクションが必要です。たとえば、ボイスショッピングシナリオでは、Tmall Genie が業界を超えたインテリジェントショッピングガイドとしての能力を備え、各業界のショッピングガイドの経験を吸収し、ユーザーがボイスショッピングを行う際に、最終的な取引の転換を目指し、買い物センターのように能動的にマルチターン対話の形式でショッピングガイドを行い、ユーザーのショッピングニーズを深く掘り起こし、ユーザープロフィールに基づいた精密なお勧めを行います。さらに、異なるユーザーに対して、Tmall Genie はそのユーザーに最も適した対話方法を採用し、パーソナライズされたマルチターン対話を実現します。
マルチターン対話の完了は、一連のシングルラウンドインタラクションの完了に基づいています。全体タスクの完了率が単純なシングルラウンド完了率の積であると、マルチターン対話の完了率の向上が困難になります。単純な積の関係を打破する鍵は、各ラウンドの対話を理解する際にコンテキスト情報を十分に活用することです。
Tmall Genie では、コンテキストを考慮した音声とセマンティクスの理解を探索しました。まず、音声デコーディングプロセスで、マルチターン対話で言及されたエンティティ情報をメモリに構築し、アテンションメカニズムを用いてデコーダーネットワークがこれらの対話シーン情報を認識できるようにし、マルチターン対話シーンの音声認識精度が顕著に向上しました。さらにセマンティクス理解フェーズでは、ラウンドを跨ぐアテンション機能を備えたエンドツーエンドのコンテキスト継承モデルを作成し、より効率的な対話シーン復元能力を実現しました。この結果、オンラインのマルチターン対話のエラー率が 58.5% 低減し、複雑なマルチターン対話シナリオの拡張を効果的に保証しました。
10 インテリジェントボイスアプリケーションの持続的な発展
スマートスピーカーは、近年、国内外の大手企業が次々と参入し(Amazon Alexa、Google Home/Nest、Tmall Genie)、2019 年に競争構図に入りました。出貨量は依然として増加していますが、その速度は緩やかです。
スマートスピーカーは依然として音楽再生などのソフトウェアサービスに焦点を当てていますが、さらなる応用イノベーションはスマートホームと IoT デバイスのさらなる普及に依存しています。
スマートボイス通話において、Google I/O 2018 で Duplex のボイス通話アシスタントのデモが披露されました。2019 年、スマートボイス通話はテレマーケティング、金融、公共機関などの実際のビジネス分野にさらに応用されるようになり、ユーザーサービスのカバレッジ向上と人件コスト削減を図っています。
2019 年、Ant のスマートボイス通話は、セキュリティ(セキュリティ検証)、金融(保険の再訪問、少額融資の取立て)、決済(クライアントの有効化)など、さらに多くの金融シナリオに応用・導入されます。
インテリジェントボイスアプリケーションは、対話と音声インタラクションに大きく依存するユーザーシナリオを持ち、NLP 技術と音声技術の発展を促進しています。技術と製品の発展とユーザーの受容性の向上に伴い、2020 年の応用規模と分野はさらに拡大するでしょう。
2020 年のトレンド:NLP が人工知能の知覚インテリジェンスから認知インテリジェンスへの進化をさらに促進
新たな 10 年に立ち、インテリジェントなヒューマンコンピュータインタラクション、マルチモーダル融合、分野のニーズに合わせた NLP ソリューション構築、ナレッジグラフと実装シナリオの組み合わせなどで突破的な変化が起こるでしょう。
1 インテリジェントなヒューマンコンピュータインタラクション
言語モデルはインテリジェントなヒューマンコンピュータインタラクションでより重要な役割を果たし、より豊富な形式を形成し、100 以上の言語を混在した多言語言語モデル、画像テキストと音声テキストを融合したマルチモーダル言語モデルが登場し、異なる言語、異なるモダリティ、異なる分野の少ナンプルシナリオにおいて、包括的な能力向上をもたらします。
多言語インタラクションは、異なる言語の理解から異なる文化の理解へと升華します。越文化理解技術を通じて、現地文化に深く入り込み、より自然な対話インタラクションを実現します。
オンラインテキスト中心のインタラクションモードは、動画、画像、音声、テキストを組み合わせたマルチモーダルのヒューマンコンピュータインタラクションに全面的に移行します。
データ駆動型の対話状態追跡と対話戦略がルールベースの戦略を逐次置き換え、マルチターン対話技術をさらに進化させ、より自然な対話体験をもたらします。
ナレッジグラフは質問応答や対話のさまざまなディープラーニングモデルに広範に統合されます。事前知識と推論能力の統合により、モデルのホワイトボックス化が進み、より良い制御可能性と解釈可能性がもたらされます。
少ナンプルシナリオにおける対話システムのコールドスタート能力の向上により、アプリケーション構築コストが顕著に削減されます。対話システムは大量のクライアントへのサービスから、より包括的で広範な各業界の小規模企業への支援に拡張し、さらに海外へも拡大し、より多くの異なる国、言語、文化のユーザーがインテリジェントサービスの時代に入ります。
2 マルチモーダル融合
5G とエッジコンピューティングの逐次的な成熟と普及に伴い、動画、画像、テキスト、音声などのモードの包括的な融合がもたらされます。システムは、ユーザーがマルチターン対話を通じて送信した画像、音声、テキストコンテンツを統合的に理解し、マルチモーダルの形式で回答できるようになります。
対話システム製品はマルチモーダルインタラクション能力を全面的に実現します。ライブストリーミングと IoT 大型スクリーンインタラクションでは動画、画像、テキストのマルチモーダル技術を全面的に応用し、豊富なインタラクティブ体験をもたらし、スムーズな全二重音声対話ロボットが広範に利用され、聴きながら考える、聴きながら推測する、能動的に発話を抓むなどの人間のようなインタラクション能力を実現します。
音声インタラクションシナリオでは、音響信号とテキスト信号を通じてユーザーの通信における感情の変化を識別し、IoT インタラクションシナリオのカメラとマイクに基づく生まれたモノマネを実現します。
3 分野のニーズに合わせた NLP ソリューションの構築
従来、NLP アルゴリズムは主にプラットフォームや API の形で汎用モデルを出力してきました。それに対応し、各種クラウドに汎用 NLP アルゴリズムプラットフォームが構築されています(Amazon Comprehend、Microsoft Azure Text Analytics、Google Cloud Natural Language、Ali NLP、Baidu NLP など)。
ただし、ビジネスシナリオでは、各シナリオドメインにはそれぞれ特定の要件があり、対応するシナリオデータが生成されます。汎用モデルはシーンデータを組み合わせてドメイン適応トレーニングを行うことで、出力されるドメインカスタマイズモデルがビジネスニーズをより良く満たします。
4 ナレッジグラフと実装シナリオの組み合わせ
新たな 10 年に向け、NLP とナレッジグラフの2 つのコア技術を用いて業界ナレッジグラフを構築します。機械はナレッジグラフを通じて隠れた関係をマイニングし、「裸眼」では発見できない関係とロジックを洞察し、最終的なビジネス意思決定に活用し、より深層的なビジネスシナリオへの実装を実現します。発展方向性の視点から、以下の要素に分類できます。
知識抽出能力の最適化:既存の知識と NLP 技術能力を組み合わせて非構造化データ理解能力をさらに向上させ、事前学習済み言語モデル、情報抽出、エンティティリンクなどの関連技術を適用して非構造化データと半構造化データを抽出・変換し、ナレッジグラフの形式でナレッジを形成し、ナレッジグラフ内の構造化された知識とリンクさせます。
業界ナレッジの蓄積:業界ナレッジグラフソリューションの実際の導入プロセスには多くの課題があります。業界ナレッジグラフの構築にはビジネスシナリオに基づくデータ蓄積とデータ理解が必要です。業界ナレッジグラフの構築と蓄積は、認知インテリジェンス時代のコア競争力となります。業界データの構築では、知識の精度が非常に高く、エンティティは通常より多く、業界的な意義を持つ必要があります。多源異種データの融合には、動的に変化する「概念・エンティティ・属性・関係」データモデルに基づく各種データの抽象モデリングが必要です。
インテリジェントで信頼できる知識推論:既知の知識に基づく知識推論、業界イベント知識の理解による知識推論の伝達、業界ルールロジックとディープモデルを組み合わせた推論を行うことで、ビジネス推論と意思決定支援においてより高いインテリジェンスとパーソナライズされた体験をもたらします。
以上が、過去 1 年間の NLP 技術の発展の回顧と、今年のトレンドに対する考えです。一家の言であるため、遺漏や概括化は免れません。砧を投げて玉を引く、より多くの方々の考えとご指摘をいただければ幸いです。Bill Gates は昔「言語理解は人工知能の王冠の珠である」と述べました。その高みに達するには、技術と応用の両面での突破が必要です。次の 10 年の幕開けを見据え、NLP 技術をより迅速に発展させ、応用シナリオを豊富にし、認知インテリジェンスの発展を促進していくことを期待しています。
7 対話システム
対話システムの言語カバレッジがさらに向上しました。多言語移行能力に基づき、仏語、アラビア語、台湾語の対話システムが迅速に拡張され、現在 11 言語とマレー語・英語、タイ語・英語の混在言語理解をサポートしています。Lazada と AE で解決率が大幅に向上しました。
対話システムはより大規模な加盟店と企業をサポートし、50 以上のグループ経済クライアントをサポートしています。汎用パッケージ、業界パッケージ、ストアパッケージのナレッジ位置特定能力を拡張し、累計で数百万のアクティブ加盟店を支え、数千万の対話ラウンドを処理しています。DingTalk は企業向けインテリジェントアシスタントに基づき、日間 40 万のアクティブ企業を支えています。
対話システムのインタラクション形式がさらに豊富になりました。ライブストリーミングでは、製品関連の質問への受動的な回答から、ユーザーとの能動的なオープン対話への移行が実現され、100 万以上の cdau をもたらしました。
VQA などのマルチモーダル理解能力がストアと経済プラットフォームに導入され、ユーザーのインタラクション体験を向上させるとともに、加盟店の構成コストを大幅に削減しました。
代表的な事例として、Hotline の音声インタラクション能力は 2019 年の MIT Technology Review の十大突破技術の 1 つにノミネートされました。
8 マルチターン対話インテリジェントサービス
マルチターンインタラクションは、インテリジェントサービスシナリオ(カスタマーサービスロボット)において、ユーザーの曖昧な質問を解決し、ユーザー体験を向上させる上で重要な役割を果たしています。曖昧な質問とは、たとえば「有効化方法は?」のように、どのビジネスかを特定していない不完全な質問のことです。この種の質問はカスタマーサービスロボットへの全質問数の 33% を占めています。
Ant インテリジェントサービスチームはタグベースのマルチターンインタラクション方式を設計しました。まず、タグをオフラインでマイニングしてレビューします。タグにはビジネスタグ(Huabei、準備金…)と要求タグ(有効化方法、返済方法…)が含まれ、ユーザーにタグリストを再提示することで質問を明確にします。
従来の問題明確化手法は主に完全なソリューションを直接推薦して問題を明確にするものでしたが、良質な明確化問題の定義は依然として不明確です。Ant チームは強化学習に基づくソリューションを設計し、タグリストを推薦して問題を明確にします。タグ推薦全体は順次的意思決定プロセスであり、ユーザーがタグをクリックすると、クリックされたタグと当初の質問を組み合わせて明確化された質問とします。
最適化の目標は、異なるタグによる潜在的な明確化問題セットの効率的な分割を維持しながら、潜在的な明確化問題に対するタグリスト全体のカバー率を最大化することです。そのため、強化学習プロセスでは情報利得に基づく報酬(Reward)が相応に設計されています。
強化学習手法に基づくマルチターンインタラクションを導入した結果、Ant カスタマーサービスロボットのシナリオでの曖昧な質問の 33% が解決され、ロボット総合シナリオから人手への移行率が 1.2% 低下しました。
9 人間機械対話が新たなインタラクションゲートウェイを構築
シナリオ駆動型のパーソナライズされたマルチターン対話技術が人間機械対話シナリオの拡張を促進し、音声とセマンティクスを統合したコンテキスト理解技術がマルチターン対話の完了率を継続的に向上させています。
過去 1 年間、Tmall Genie は人間機械対話能力を Erha 通話アシスタント、ボイスショッピング、新規ユーザーガイドなどの複雑なインタラクションシナリオに拡張し、ダブルイレブント期間に 100 万件のボイスショッピング注文の記録を作りました。
Tmall Genie は去年の 315 に迷惑防止通話アシスタント「Erha」を公開し、新たな人間機械対話インタラクションシナリオを開きました。すなわち、ユーザーの代わりに対話を完了することです。Erha の対話シナリオは垂直分野のオープンマルチターン対話であり、対話を通じて着信の意図を特定し、ユーザーの代わりに必要な情報を取得することを目的としています。Erha では、マルチターン対話コンテキストに基づく機械読解技術を提案し、着信の意図と重要情報を理解します。着信内容の理解に基づき、Transformer ベースの対話戦略モデルを構築し、戦略の選択と対話生成を行います。Erha の対話シナリオを対象に、チューリングテストの合格率で対話品質を測定することを提案します。つまり、着信者が会話中に機械と会話していることに気づかなければ、Erha がチューリングテストに合格したと見なせます。Erha の現在のチューリングテスト合格率は 87% であり、ユーザーが不慣れな着信に対応するのを効果的に支援し、ユーザーの時間を節約しています。
人間機械対話を通じた複雑なタスクの完了(コーヒーの注文、ショッピングなど)には、機械とユーザーの間で複数の対話インタラクションが必要です。たとえば、ボイスショッピングシナリオでは、Tmall Genie が業界を超えたインテリジェントショッピングガイドとしての能力を備え、各業界のショッピングガイドの経験を吸収し、ユーザーがボイスショッピングを行う際に、最終的な取引の転換を目指し、買い物センターのように能動的にマルチターン対話の形式でショッピングガイドを行い、ユーザーのショッピングニーズを深く掘り起こし、ユーザープロフィールに基づいた精密なお勧めを行います。さらに、異なるユーザーに対して、Tmall Genie はそのユーザーに最も適した対話方法を採用し、パーソナライズされたマルチターン対話を実現します。
マルチターン対話の完了は、一連のシングルラウンドインタラクションの完了に基づいています。全体タスクの完了率が単純なシングルラウンド完了率の積であると、マルチターン対話の完了率の向上が困難になります。単純な積の関係を打破する鍵は、各ラウンドの対話を理解する際にコンテキスト情報を十分に活用することです。
Tmall Genie では、コンテキストを考慮した音声とセマンティクスの理解を探索しました。まず、音声デコーディングプロセスで、マルチターン対話で言及されたエンティティ情報をメモリに構築し、アテンションメカニズムを用いてデコーダーネットワークがこれらの対話シーン情報を認識できるようにし、マルチターン対話シーンの音声認識精度が顕著に向上しました。さらにセマンティクス理解フェーズでは、ラウンドを跨ぐアテンション機能を備えたエンドツーエンドのコンテキスト継承モデルを作成し、より効率的な対話シーン復元能力を実現しました。この結果、オンラインのマルチターン対話のエラー率が 58.5% 低減し、複雑なマルチターン対話シナリオの拡張を効果的に保証しました。
10 インテリジェントボイスアプリケーションの持続的な発展
スマートスピーカーは、近年、国内外の大手企業が次々と参入し(Amazon Alexa、Google Home/Nest、Tmall Genie)、2019 年に競争構図に入りました。出貨量は依然として増加していますが、その速度は緩やかです。
スマートスピーカーは依然として音楽再生などのソフトウェアサービスに焦点を当てていますが、さらなる応用イノベーションはスマートホームと IoT デバイスのさらなる普及に依存しています。
スマートボイス通話において、Google I/O 2018 で Duplex のボイス通話アシスタントのデモが披露されました。2019 年、スマートボイス通話はテレマーケティング、金融、公共機関などの実際のビジネス分野にさらに応用されるようになり、ユーザーサービスのカバレッジ向上と人件コスト削減を図っています。
2019 年、Ant のスマートボイス通話は、セキュリティ(セキュリティ検証)、金融(保険の再訪問、少額融資の取立て)、決済(クライアントの有効化)など、さらに多くの金融シナリオに応用・導入されます。
インテリジェントボイスアプリケーションは、対話と音声インタラクションに大きく依存するユーザーシナリオを持ち、NLP 技術と音声技術の発展を促進しています。技術と製品の発展とユーザーの受容性の向上に伴い、2020 年の応用規模と分野はさらに拡大するでしょう。
2020 年のトレンド:NLP が人工知能の知覚インテリジェンスから認知インテリジェンスへの進化をさらに促進
新たな 10 年に立ち、インテリジェントなヒューマンコンピュータインタラクション、マルチモーダル融合、分野のニーズに合わせた NLP ソリューション構築、ナレッジグラフと実装シナリオの組み合わせなどで突破的な変化が起こるでしょう。
1 インテリジェントなヒューマンコンピュータインタラクション
言語モデルはインテリジェントなヒューマンコンピュータインタラクションでより重要な役割を果たし、より豊富な形式を形成し、100 以上の言語を混在した多言語言語モデル、画像テキストと音声テキストを融合したマルチモーダル言語モデルが登場し、異なる言語、異なるモダリティ、異なる分野の少ナンプルシナリオにおいて、包括的な能力向上をもたらします。
多言語インタラクションは、異なる言語の理解から異なる文化の理解へと升華します。越文化理解技術を通じて、現地文化に深く入り込み、より自然な対話インタラクションを実現します。
オンラインテキスト中心のインタラクションモードは、動画、画像、音声、テキストを組み合わせたマルチモーダルのヒューマンコンピュータインタラクションに全面的に移行します。
データ駆動型の対話状態追跡と対話戦略がルールベースの戦略を逐次置き換え、マルチターン対話技術をさらに進化させ、より自然な対話体験をもたらします。
ナレッジグラフは質問応答や対話のさまざまなディープラーニングモデルに広範に統合されます。事前知識と推論能力の統合により、モデルのホワイトボックス化が進み、より良い制御可能性と解釈可能性がもたらされます。
少ナンプルシナリオにおける対話システムのコールドスタート能力の向上により、アプリケーション構築コストが顕著に削減されます。対話システムは大量のクライアントへのサービスから、より包括的で広範な各業界の小規模企業への支援に拡張し、さらに海外へも拡大し、より多くの異なる国、言語、文化のユーザーがインテリジェントサービスの時代に入ります。
2 マルチモーダル融合
5G とエッジコンピューティングの逐次的な成熟と普及に伴い、動画、画像、テキスト、音声などのモードの包括的な融合がもたらされます。システムは、ユーザーがマルチターン対話を通じて送信した画像、音声、テキストコンテンツを統合的に理解し、マルチモーダルの形式で回答できるようになります。
対話システム製品はマルチモーダルインタラクション能力を全面的に実現します。ライブストリーミングと IoT 大型スクリーンインタラクションでは動画、画像、テキストのマルチモーダル技術を全面的に応用し、豊富なインタラクティブ体験をもたらし、スムーズな全二重音声対話ロボットが広範に利用され、聴きながら考える、聴きながら推測する、能動的に発話を抓むなどの人間のようなインタラクション能力を実現します。
音声インタラクションシナリオでは、音響信号とテキスト信号を通じてユーザーの通信における感情の変化を識別し、IoT インタラクションシナリオのカメラとマイクに基づく生まれたモノマネを実現します。
3 分野のニーズに合わせた NLP ソリューションの構築
従来、NLP アルゴリズムは主にプラットフォームや API の形で汎用モデルを出力してきました。それに対応し、各種クラウドに汎用 NLP アルゴリズムプラットフォームが構築されています(Amazon Comprehend、Microsoft Azure Text Analytics、Google Cloud Natural Language、Ali NLP、Baidu NLP など)。
ただし、ビジネスシナリオでは、各シナリオドメインにはそれぞれ特定の要件があり、対応するシナリオデータが生成されます。汎用モデルはシーンデータを組み合わせてドメイン適応トレーニングを行うことで、出力されるドメインカスタマイズモデルがビジネスニーズをより良く満たします。
4 ナレッジグラフと実装シナリオの組み合わせ
新たな 10 年に向け、NLP とナレッジグラフの2 つのコア技術を用いて業界ナレッジグラフを構築します。機械はナレッジグラフを通じて隠れた関係をマイニングし、「裸眼」では発見できない関係とロジックを洞察し、最終的なビジネス意思決定に活用し、より深層的なビジネスシナリオへの実装を実現します。発展方向性の視点から、以下の要素に分類できます。
知識抽出能力の最適化:既存の知識と NLP 技術能力を組み合わせて非構造化データ理解能力をさらに向上させ、事前学習済み言語モデル、情報抽出、エンティティリンクなどの関連技術を適用して非構造化データと半構造化データを抽出・変換し、ナレッジグラフの形式でナレッジを形成し、ナレッジグラフ内の構造化された知識とリンクさせます。
業界ナレッジの蓄積:業界ナレッジグラフソリューションの実際の導入プロセスには多くの課題があります。業界ナレッジグラフの構築にはビジネスシナリオに基づくデータ蓄積とデータ理解が必要です。業界ナレッジグラフの構築と蓄積は、認知インテリジェンス時代のコア競争力となります。業界データの構築では、知識の精度が非常に高く、エンティティは通常より多く、業界的な意義を持つ必要があります。多源異種データの融合には、動的に変化する「概念・エンティティ・属性・関係」データモデルに基づく各種データの抽象モデリングが必要です。
インテリジェントで信頼できる知識推論:既知の知識に基づく知識推論、業界イベント知識の理解による知識推論の伝達、業界ルールロジックとディープモデルを組み合わせた推論を行うことで、ビジネス推論と意思決定支援においてより高いインテリジェンスとパーソナライズされた体験をもたらします。
以上が、過去 1 年間の NLP 技術の発展の回顧と、今年のトレンドに対する考えです。一家の言であるため、遺漏や概括化は免れません。砧を投げて玉を引く、より多くの方々の考えとご指摘をいただければ幸いです。Bill Gates は昔「言語理解は人工知能の王冠の珠である」と述べました。その高みに達するには、技術と応用の両面での突破が必要です。次の 10 年の幕開けを見据え、NLP 技術をより迅速に発展させ、応用シナリオを豊富にし、認知インテリジェンスの発展を促進していくことを期待しています。
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
