EasyNLP realizes Chinese and English machine reading comprehension
ガイド
機械読解は自然言語処理 (NLP) の重要な研究方向の一つであり、特に自然言語理解 (NLU) の分野で注目されています。1977 年の提唱以来、機械読解は約 50 年の発展の歴史を持ち、「人工ルール」「従来の機械学習」「ディープラーニング」「大規模事前学習モデル」といった複数の発展段階を経てきました。
機械読解は、大量のテキストから関連情報に素早く着目し、手動での情報取得コストを削減し、情報検索の効率を高めることを目的としています。人工知能の自然言語理解における「達人」として、機械読解タスクは「単語」から「文」、さらには「章」に至るあらゆる粒度の言語理解能力を評価します。現在、非常に難易度が高く重要な「戦略家の戦場」となっています。SQuAD に代表される読解データセットは、ディープラーニングの発展時代において各社の革新的なソリューションが次々と登場し、大規模事前学習の時代には BERT などの事前学習モデルのリーダーとなる評価ベンチマークとしての役割を果たしてきました。この 10 年間、機械読解は自然言語処理分野の繁栄と発展を大きく推進し、その証人でもあったと言えます。
形式的には、機械読解タスクの入力は文脈テキスト (context) と質問 (question) であり、学習モデルを通じて予測された回答テキスト (answer) を出力します。回答の取得方法の違いにより、現在の業界の主流では読解タスクをクローズテスト、多肢選択、スパン抽出 (Span extraction)、自由生成 (Free answering) の 4 つのカテゴリに分類しています。中でも、スパン抽出手法は質問文 (question) に基づいて文脈テキスト (context) から回答テキスト (answer) の開始位置と終了位置を直接予測し、回答を抽出します。実シーンに近く、適度な難易度で評価が容易であり、SQuAD などの高品質データセットに支えられているため、現在の主流な読解タスクとなっています。事前学習済み言語モデルの発展に伴い、スパン抽出読解の性能は近年何度も新記録を更新しています。英語シーンでは、従来の BERT、RoBERTa、ALBERT などのモデルが人間を超える結果を達成しています。中国語シーンでは、MacBERT (Pre-Training with Whole Word Masking for Chinese BERT) が単語単位のマスキングを導入した誤り訂正型のマスク言語モデル (Mac) 事前学習タスクにより、「事前学習―下流タスク」の不一致を緩和し、中国語シーンに最適化されています。機械読解を含む様々な NLP タスクで顕著な性能向上を実現しています。そこで我々は、MacBERT アルゴリズムとモデルを EasyNLP フレームワークに統合し、EasyNLP の既存の BERT、RoBERTa などのモデルと連携させることで、ユーザーが中国語および英語の機械読解タスクの訓練と予測を簡単に行えるようにしました。
EasyNLP (https://github.com/alibaba/EasyNLP) は、Alibaba Cloud の機械学習 PAI チームが PyTorch ベースで開発した使いやすく包括的な中国語 NLP アルゴリズムフレームワークです。中国語の事前学習済みモデルや大規模モデルの実装技術をサポートし、訓練からデプロイまでのワンストップの NLP 開発体験を提供します。EasyNLP は、NLP アプリケーション AppZoo や事前学習済み ModelZoo など、NLP モデル開発のための簡潔なインターフェイスを提供し、超大規模事前学習モデルを効率的にビジネスに実装する技術も備えています。自然言語理解の「達人」として、機械読解はテキスト質問応答や情報抽出の分野でも基礎タスクであり、高い研究価値を持っています。そこで EasyNLP は中国語および英語の機械読解タスクへの対応を追加し、より多くの NLP/NLU アルゴリズム開発者や研究者に貢献するとともに、コミュニティと協力して NLU 関連技術の発展と実装を推進することを目指しています。
本ドキュメントでは、MacBERT モデルの技術的解説と、EasyNLP フレームワーク内で MacBERT およびその他の事前学習済み言語モデルを使用して中国語および英語の機械読解タスクの訓練と予測を行う方法について説明します。
MacBERT モデルの解説
従来の大規模事前学習済み言語モデル (BERT、RoBERTa など) は主に英語向けに設計されています。中国語シーンに直接適用すると、中国語と英語の言語自体の差異に直面します。たとえば、中国語には単語間のスペースがなく、分かち書きが不要であることや、複数の文字から成る意味の完全な単語の扱いなどが異なります。たとえば、下図の元の文「言語モデルを使って次の単語の確率を予測する」で、一文字を落とすと、マスキング効果と言語モデルの事前学習に影響を与えます。また、従来の言語モデルは事前学習時に [MASK] トークンを使用してマスキングを行いますが、下流タスクのテキストには [MASK] が存在しないため、当然ながら 2 つの段階の間にギャップが生じます。これらの課題を緩和するため、MacBERT などのモデルは従来の MLM タスクを改良し、誤り訂正型のマスク言語モデル (Mac) 事前学習タスクを導入しています。全単語マスキング (wwm)、n-gram マスキング (NM)、類義語置換などの多様なマスキング方式により、中国語シーンにより適応し、「事前学習―下流タスク」の不一致を軽減し、事前学習モデルの各種 NLP タスクでの効果を向上させています。さらに、MacBERT の主要フレームワークは BERT と完全に一致しているため、既存のコードを変更せずにシームレスに移行でき、開発者のコード移行に大きな利便性をもたらします。
具体的には、MacBERT などのモデルは中国語の MLM において、単語内のすべての文字を同時にマスクし、n-gram マスク戦略を採用しています。unigram から 4-gram までの対応するマスク確率は 40%〜10% です。マスク時に [MASK] トークンは使用せず、代わりに単語の類義語を使用します。類義語は word2vec の類似度計算に基づく Synonyms ツールキットを使用して取得します。類義語が存在しない稀なケースでは、ランダムな単語で置換します。モデルは一般的に入力単語の 15% をマスクします。マスク時、80% の確率で類義語に置換し、10% の確率でランダムな単語に置換し、10% の確率で元の単語を保持します。さらに、BERT の元の NSP モデルは研究者から長らく批判されてきました。MacBERT モデルでは、NSP を SOP (文順序予測) に改良し、正例を連続テキスト、負例を元のテキストの順序を入れ替えたものとし、複数文のテキストタスクにおけるモデルの効果を大幅に改善しています。モデルの実験結果は、前述の MLM 改良のいずれかを削除すると平均性能の低下を招くことを示しており、これはマスク戦略の修正が言語モデルの学習に有効であることを示しています。同時に、SOP タスクを削除すると機械読解タスクへの影響が顕著であり、これはディスコース学習における文レベルの事前学習タスクの必要性も示しています。
機械読解モデルチュートリアル
以下では、EasyNLP フレームワーク内で MacBERT およびその他の事前学習済み言語モデルを使用して機械読解タスクの訓練と予測を行う方法を簡単に紹介します。
EasyNLP のインストール
ユーザーは GitHub (https://github.com/alibaba/EasyNLP) の手順に従って EasyNLP アルゴリズムフレームワークを直接インストールできます。
Pipeline インターフェイスで手軽に効果を体験
開発者の利便性のため、EasyNLP フレームワーク内で推論 Pipeline 機能を実装しました。ユーザーはモデルの訓練やファインチューニングを行うことなく、Pipeline インターフェイスを使ってファインチューニング済みの中国語および英語の機械読解モデルを直接呼び出し、手軽に体験できます。以下のコマンドを実行してください:
from easylp.pipelines import pipeline
# 入力データ
data = [{
"query": "杭州はいつ「杭州アジア競技大会都市行動計画概要」を公表しましたか?",
"answer_text": "2020年4月",
"context": "新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進んでいる。全民健身ブーム... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。",
"qas_id": "CN_01"
},
{
"query": "今年9月末の市内の高速道路の総走行距離はどれくらいになりますか?",
"answer_text": "480キロメートル",
"context": "新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進んでいる。全民健身ブーム... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。",
"qas_id": "CN_02"
}]
# パイプラインのパラメータはファインチューニング済みモデルです
# 現在、EasyNLP は中国語と英語の機械読解パイプラインのクイック体験をサポートしており、それぞれファインチューニング済みの中国語 macbert モデルと英語 bert モデルを統合しています
# 英語読解を体験する場合は、モデル名を 'bert-base-rcen' に変更してください
generator = pipeline('macbert-base-rczh')
results = generator(data)
for input_dict, result in zip(data, results):
context = result["context"]
query = result["query"]
answer_gold = result["gold_answer"]
answer_pred = result["best_answer"]
コードに示すように、入力データはリスト形式で、各インスタンスは辞書型であり、クエリ、回答、文脈、ID 情報を含みます。パイプラインのパラメータはファインチューニング済みのモデルです。現在、EasyNLP は中国語および英語の機械読解パイプラインのクイック体験をサポートしており、それぞれファインチューニング済みの中国語 macbert モデルと英語 bert モデルを統合しています。中国語機械読解モデルは 'macbert-base-rczh' で、英語読解を体験する場合は上記コードのパイプラインパラメータのモデル名を 'bert-base-rcen' に変更してください。
上記コードの実行結果を以下に示します。モデルがテキストと質問の意味を正確に理解し、正しい結果を導き出していることが確認できます。
context: 新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進み、アジア競技大会会場の早期開放により全民健身ブームが巻き起こっている... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。
query: 杭州はいつ「杭州アジア競技大会都市行動計画概要」を公表しましたか?
gold_answer: 2020年4月
pred_answer: 2020年4月
context: 新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進み、アジア競技大会会場の早期開放により全民健身ブームが巻き起こっている... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。
query: 今年9月末の市内の高速道路の総走行距離はどれくらいになりますか?
gold_answer: 480キロメートル
pred_answer: 480キロメートル
以下では、中国語および英語の機械読解モデルの詳細な実装プロセスを、データ準備からモデル訓練、評価、予測までを紹介し、EasyNLP ベースの簡便かつ迅速なワンステップ実行方法をいくつか示します。
データ準備
事前学習済み言語モデルを使用して機械読解タスクのファインチューニングを行う際、ユーザーはタスク関連の訓練データと検証データを提供する必要があります。いずれも tsv 形式です。ファイルの各行はタブ文字 で区切られた複数の列を含み、読解訓練に必要なすべての情報が含まれています。左から順に、サンプル ID、文脈テキスト (context)、質問文 (question)、回答テキスト (answer)、文脈テキスト内での回答テキストの開始位置、章タイトルです。サンプルは以下の通りです:
DEV_125_QUERY_3 グリオキサールは化学式 OCCHHO の有機化合物で、2 つのアルデヒド基 -C で結合されている。最も単純なジアルデヒドであり、常温では黄色の液体である。工業的には、グリコールを銀または銅の触媒下で気相酸化するか、硝酸溶液でアセトアルデヒドを酸化することで製造できる。実験室では、亜セレン酸でアセトアルデヒドを酸化してグリリオキサールを調製する。無水グリリオキサールは固体水和物と五酸化リンを加熱して調製できる。グリリオキサールの用途は以下の通りである:通常、グリリオキサールは 40% 溶液として販売されている。他の低分子アルデヒドと同様に水和物を形成し、その水和物は縮合して一連の「オリゴマー」を形成するが、その構造はまだ不明確である。現在、少なくとも以下の 2 つの水和物が販売されている:推定によると、水溶液中のグリリオキサール濃度が 1M 以下の場合、主にモノマーまたは水和物の形で存在し、すなわち OCHCHO、OCHCH(OH) または (HO)CHCH(OH) である。濃度が 1M を超える場合、主に二量体型であり、アセタール/ケトン構造の可能性がある。分子式は [(HO)CH]OCHCHO である。グリリオキサールは工業的にどのように製造されるか?グリコールを銀または銅の触媒下で気相酸化するか、硝酸溶液でアセトアルデヒドを酸化することで得られる。59 グリリオキサール
以下のファイルは前処理済みの中国語および英語の機械読解訓練・検証データであり、モデルの訓練とテストに使用できます:
# 中国語機械読解データ
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/train_cmrc2018.tsv
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/dev_cmrc2018.tsv
# 英語機械読解データ
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/train_squad.tsv
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/dev_squad.tsv
機械読解は自然言語処理 (NLP) の重要な研究方向の一つであり、特に自然言語理解 (NLU) の分野で注目されています。1977 年の提唱以来、機械読解は約 50 年の発展の歴史を持ち、「人工ルール」「従来の機械学習」「ディープラーニング」「大規模事前学習モデル」といった複数の発展段階を経てきました。
機械読解は、大量のテキストから関連情報に素早く着目し、手動での情報取得コストを削減し、情報検索の効率を高めることを目的としています。人工知能の自然言語理解における「達人」として、機械読解タスクは「単語」から「文」、さらには「章」に至るあらゆる粒度の言語理解能力を評価します。現在、非常に難易度が高く重要な「戦略家の戦場」となっています。SQuAD に代表される読解データセットは、ディープラーニングの発展時代において各社の革新的なソリューションが次々と登場し、大規模事前学習の時代には BERT などの事前学習モデルのリーダーとなる評価ベンチマークとしての役割を果たしてきました。この 10 年間、機械読解は自然言語処理分野の繁栄と発展を大きく推進し、その証人でもあったと言えます。
形式的には、機械読解タスクの入力は文脈テキスト (context) と質問 (question) であり、学習モデルを通じて予測された回答テキスト (answer) を出力します。回答の取得方法の違いにより、現在の業界の主流では読解タスクをクローズテスト、多肢選択、スパン抽出 (Span extraction)、自由生成 (Free answering) の 4 つのカテゴリに分類しています。中でも、スパン抽出手法は質問文 (question) に基づいて文脈テキスト (context) から回答テキスト (answer) の開始位置と終了位置を直接予測し、回答を抽出します。実シーンに近く、適度な難易度で評価が容易であり、SQuAD などの高品質データセットに支えられているため、現在の主流な読解タスクとなっています。事前学習済み言語モデルの発展に伴い、スパン抽出読解の性能は近年何度も新記録を更新しています。英語シーンでは、従来の BERT、RoBERTa、ALBERT などのモデルが人間を超える結果を達成しています。中国語シーンでは、MacBERT (Pre-Training with Whole Word Masking for Chinese BERT) が単語単位のマスキングを導入した誤り訂正型のマスク言語モデル (Mac) 事前学習タスクにより、「事前学習―下流タスク」の不一致を緩和し、中国語シーンに最適化されています。機械読解を含む様々な NLP タスクで顕著な性能向上を実現しています。そこで我々は、MacBERT アルゴリズムとモデルを EasyNLP フレームワークに統合し、EasyNLP の既存の BERT、RoBERTa などのモデルと連携させることで、ユーザーが中国語および英語の機械読解タスクの訓練と予測を簡単に行えるようにしました。
EasyNLP (https://github.com/alibaba/EasyNLP) は、Alibaba Cloud の機械学習 PAI チームが PyTorch ベースで開発した使いやすく包括的な中国語 NLP アルゴリズムフレームワークです。中国語の事前学習済みモデルや大規模モデルの実装技術をサポートし、訓練からデプロイまでのワンストップの NLP 開発体験を提供します。EasyNLP は、NLP アプリケーション AppZoo や事前学習済み ModelZoo など、NLP モデル開発のための簡潔なインターフェイスを提供し、超大規模事前学習モデルを効率的にビジネスに実装する技術も備えています。自然言語理解の「達人」として、機械読解はテキスト質問応答や情報抽出の分野でも基礎タスクであり、高い研究価値を持っています。そこで EasyNLP は中国語および英語の機械読解タスクへの対応を追加し、より多くの NLP/NLU アルゴリズム開発者や研究者に貢献するとともに、コミュニティと協力して NLU 関連技術の発展と実装を推進することを目指しています。
本ドキュメントでは、MacBERT モデルの技術的解説と、EasyNLP フレームワーク内で MacBERT およびその他の事前学習済み言語モデルを使用して中国語および英語の機械読解タスクの訓練と予測を行う方法について説明します。
MacBERT モデルの解説
従来の大規模事前学習済み言語モデル (BERT、RoBERTa など) は主に英語向けに設計されています。中国語シーンに直接適用すると、中国語と英語の言語自体の差異に直面します。たとえば、中国語には単語間のスペースがなく、分かち書きが不要であることや、複数の文字から成る意味の完全な単語の扱いなどが異なります。たとえば、下図の元の文「言語モデルを使って次の単語の確率を予測する」で、一文字を落とすと、マスキング効果と言語モデルの事前学習に影響を与えます。また、従来の言語モデルは事前学習時に [MASK] トークンを使用してマスキングを行いますが、下流タスクのテキストには [MASK] が存在しないため、当然ながら 2 つの段階の間にギャップが生じます。これらの課題を緩和するため、MacBERT などのモデルは従来の MLM タスクを改良し、誤り訂正型のマスク言語モデル (Mac) 事前学習タスクを導入しています。全単語マスキング (wwm)、n-gram マスキング (NM)、類義語置換などの多様なマスキング方式により、中国語シーンにより適応し、「事前学習―下流タスク」の不一致を軽減し、事前学習モデルの各種 NLP タスクでの効果を向上させています。さらに、MacBERT の主要フレームワークは BERT と完全に一致しているため、既存のコードを変更せずにシームレスに移行でき、開発者のコード移行に大きな利便性をもたらします。
具体的には、MacBERT などのモデルは中国語の MLM において、単語内のすべての文字を同時にマスクし、n-gram マスク戦略を採用しています。unigram から 4-gram までの対応するマスク確率は 40%〜10% です。マスク時に [MASK] トークンは使用せず、代わりに単語の類義語を使用します。類義語は word2vec の類似度計算に基づく Synonyms ツールキットを使用して取得します。類義語が存在しない稀なケースでは、ランダムな単語で置換します。モデルは一般的に入力単語の 15% をマスクします。マスク時、80% の確率で類義語に置換し、10% の確率でランダムな単語に置換し、10% の確率で元の単語を保持します。さらに、BERT の元の NSP モデルは研究者から長らく批判されてきました。MacBERT モデルでは、NSP を SOP (文順序予測) に改良し、正例を連続テキスト、負例を元のテキストの順序を入れ替えたものとし、複数文のテキストタスクにおけるモデルの効果を大幅に改善しています。モデルの実験結果は、前述の MLM 改良のいずれかを削除すると平均性能の低下を招くことを示しており、これはマスク戦略の修正が言語モデルの学習に有効であることを示しています。同時に、SOP タスクを削除すると機械読解タスクへの影響が顕著であり、これはディスコース学習における文レベルの事前学習タスクの必要性も示しています。
機械読解モデルチュートリアル
以下では、EasyNLP フレームワーク内で MacBERT およびその他の事前学習済み言語モデルを使用して機械読解タスクの訓練と予測を行う方法を簡単に紹介します。
EasyNLP のインストール
ユーザーは GitHub (https://github.com/alibaba/EasyNLP) の手順に従って EasyNLP アルゴリズムフレームワークを直接インストールできます。
Pipeline インターフェイスで手軽に効果を体験
開発者の利便性のため、EasyNLP フレームワーク内で推論 Pipeline 機能を実装しました。ユーザーはモデルの訓練やファインチューニングを行うことなく、Pipeline インターフェイスを使ってファインチューニング済みの中国語および英語の機械読解モデルを直接呼び出し、手軽に体験できます。以下のコマンドを実行してください:
from easylp.pipelines import pipeline
# 入力データ
data = [{
"query": "杭州はいつ「杭州アジア競技大会都市行動計画概要」を公表しましたか?",
"answer_text": "2020年4月",
"context": "新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進んでいる。全民健身ブーム... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。",
"qas_id": "CN_01"
},
{
"query": "今年9月末の市内の高速道路の総走行距離はどれくらいになりますか?",
"answer_text": "480キロメートル",
"context": "新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進んでいる。全民健身ブーム... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。",
"qas_id": "CN_02"
}]
# パイプラインのパラメータはファインチューニング済みモデルです
# 現在、EasyNLP は中国語と英語の機械読解パイプラインのクイック体験をサポートしており、それぞれファインチューニング済みの中国語 macbert モデルと英語 bert モデルを統合しています
# 英語読解を体験する場合は、モデル名を 'bert-base-rcen' に変更してください
generator = pipeline('macbert-base-rczh')
results = generator(data)
for input_dict, result in zip(data, results):
context = result["context"]
query = result["query"]
answer_gold = result["gold_answer"]
answer_pred = result["best_answer"]
コードに示すように、入力データはリスト形式で、各インスタンスは辞書型であり、クエリ、回答、文脈、ID 情報を含みます。パイプラインのパラメータはファインチューニング済みのモデルです。現在、EasyNLP は中国語および英語の機械読解パイプラインのクイック体験をサポートしており、それぞれファインチューニング済みの中国語 macbert モデルと英語 bert モデルを統合しています。中国語機械読解モデルは 'macbert-base-rczh' で、英語読解を体験する場合は上記コードのパイプラインパラメータのモデル名を 'bert-base-rcen' に変更してください。
上記コードの実行結果を以下に示します。モデルがテキストと質問の意味を正確に理解し、正しい結果を導き出していることが確認できます。
context: 新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進み、アジア競技大会会場の早期開放により全民健身ブームが巻き起こっている... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。
query: 杭州はいつ「杭州アジア競技大会都市行動計画概要」を公表しましたか?
gold_answer: 2020年4月
pred_answer: 2020年4月
context: 新華社通信、杭州、9月22日(記者 商意盈、夏亮)競技会場はすべて完成し、競技の機能検証も終了。「アジア競技大会を迎える」都市インフラ整備が急速に進み、アジア競技大会会場の早期開放により全民健身ブームが巻き起こっている... 23日、延期された杭州アジア競技大会はカウントダウン1周年を迎える。各種準備も実りある成果を上げ、「天国の都市」が再び出発する準備ができている。一つの大会の成功開催が一つの都市を向上させる。2020年4月、杭州は「杭州アジア競技大会都市行動計画概要」を公表し、インフラ整備の改善、緑水緑山の保護、デジタルガバナンスの権限付与など8つの具体的な行動を含む。アジア競技大会が近づくにつれ、杭州西駅、蕭山国際空港第三期、杭杭高速鉄道杭杭区間、空港鉄道快速(19号線)などの「2拠点2路線」の主要プロジェクトが正式に運用を開始した。杭州城郷建設委員会が発表した情報によると、今年9月末までに市内の高速道路の総走行距離は480キロメートルに達する見込みである。ここに住む人々は静かに起きた変化を体験している―交通がより便利になり、道路がより美しくなり、都市インフラがますます充実してきた。
query: 今年9月末の市内の高速道路の総走行距離はどれくらいになりますか?
gold_answer: 480キロメートル
pred_answer: 480キロメートル
以下では、中国語および英語の機械読解モデルの詳細な実装プロセスを、データ準備からモデル訓練、評価、予測までを紹介し、EasyNLP ベースの簡便かつ迅速なワンステップ実行方法をいくつか示します。
データ準備
事前学習済み言語モデルを使用して機械読解タスクのファインチューニングを行う際、ユーザーはタスク関連の訓練データと検証データを提供する必要があります。いずれも tsv 形式です。ファイルの各行はタブ文字 で区切られた複数の列を含み、読解訓練に必要なすべての情報が含まれています。左から順に、サンプル ID、文脈テキスト (context)、質問文 (question)、回答テキスト (answer)、文脈テキスト内での回答テキストの開始位置、章タイトルです。サンプルは以下の通りです:
DEV_125_QUERY_3 グリオキサールは化学式 OCCHHO の有機化合物で、2 つのアルデヒド基 -C で結合されている。最も単純なジアルデヒドであり、常温では黄色の液体である。工業的には、グリコールを銀または銅の触媒下で気相酸化するか、硝酸溶液でアセトアルデヒドを酸化することで製造できる。実験室では、亜セレン酸でアセトアルデヒドを酸化してグリリオキサールを調製する。無水グリリオキサールは固体水和物と五酸化リンを加熱して調製できる。グリリオキサールの用途は以下の通りである:通常、グリリオキサールは 40% 溶液として販売されている。他の低分子アルデヒドと同様に水和物を形成し、その水和物は縮合して一連の「オリゴマー」を形成するが、その構造はまだ不明確である。現在、少なくとも以下の 2 つの水和物が販売されている:推定によると、水溶液中のグリリオキサール濃度が 1M 以下の場合、主にモノマーまたは水和物の形で存在し、すなわち OCHCHO、OCHCH(OH) または (HO)CHCH(OH) である。濃度が 1M を超える場合、主に二量体型であり、アセタール/ケトン構造の可能性がある。分子式は [(HO)CH]OCHCHO である。グリリオキサールは工業的にどのように製造されるか?グリコールを銀または銅の触媒下で気相酸化するか、硝酸溶液でアセトアルデヒドを酸化することで得られる。59 グリリオキサール
以下のファイルは前処理済みの中国語および英語の機械読解訓練・検証データであり、モデルの訓練とテストに使用できます:
# 中国語機械読解データ
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/train_cmrc2018.tsv
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/dev_cmrc2018.tsv
# 英語機械読解データ
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/train_squad.tsv
http://atp-modelzoo-sh.oss-cn-shanghai.aliyuncs.com/release/tutorials/machine_reading_comprehension/dev_squad.tsv
Related Articles
-
A detailed explanation of Hadoop core architecture HDFS
Knowledge Base Team
-
What Does IOT Mean
Knowledge Base Team
-
6 Optional Technologies for Data Storage
Knowledge Base Team
-
What Is Blockchain Technology
Knowledge Base Team
Explore More Special Offers
-
Short Message Service(SMS) & Mail Service
50,000 email package starts as low as USD 1.99, 120 short messages start at only USD 1.00
