アリババが先進 AI 技術で中国古典籍のデジタル化を支援
Alibaba Cloud 2021 年 5 月 19 日
2021 年 5 月 18 日、北京 - 中国古典のデジタル化は困難を極めます。古代中国の文字は複雑で、歴史を通じて一つの漢字に複数の異体字や書体が存在してきたためです。光学文字認識 (OCR) を用いた中国古典籍のデジタル化は、機械による読解を可能にするだけでなく、数多くの古典籍に新たな命を吹き込み、一般公開の道を開きます。
アリババのグローバル研究機関であるアリババ DAMO アカデミー (DAMO) は、アリババ公益基金会、カリフォルニア大学バークレー校図書館、四川大学、中国国家図書館、浙江図書館と共同で中国古典のデジタル化プロジェクトを開始しました。本プログラムは、中国古典籍をデジタル化して集約し、スキャン画像をテキストに変換してオープンアクセスで公開することを目的としています。これにより、国内外の図書館が連携して、所蔵する中国古典籍を世界中に無償で公開することができます。
アリババ DAMO アカデミー代表の Jeff Zhang は次のように述べています。「アリババは、このようなプロジェクトを支援するため、リソースと最先端技術への投資を続けてまいります。古典籍を一般公開することは、私たちの『Tech for Change』の価値観と信念に一致するものです。技術は貴重な文化遺産の保存において重要な役割を果たすことができると確信しており、国内外の図書館と連携してこの実現に取り組んでまいります。」
本共同プロジェクトの第一弾となる中国古典は、中国古典籍の豊富な蔵書を誇る最大級の学術図書館であるカリフォルニア大学バークレー校の C.V. スター東アジア図書館の所蔵品です。宋および元の時代の木版印刷本や写本を含む 20 万ページのデジタル画像が公開されており、1,000 年以上前の古代中国の時代に遡ります。その他の資料には、清時代の 四庫全書 の原本巻や、中国古典大全 のデジタルページも含まれます。
UC バークレー図書館がスキャンページとメタデータを提供し、DAMO が光学文字認識 (OCR) を用いてスキャン画像をテキストに変換しました。さらに、DAMO は四川大学の研究者と連携し、単文字インデックス化、自動文字グルーピング、自己教師あり学習や Few-shot 学習などの様々な機械学習手法を活用した AI モデルを共同開発しました。このモデルは古代文字の認識で 97.5% の精度を達成しています。現在、この新しいモデルは 3 万文字の古代中国文字を効率的に認識でき、その速度は人間の読書速度の 30 倍に達します。
「アリババは中国古典籍の機械読解に向けた AI システムを近く一般公開する予定です」と Jeff 氏は語りました。
