阿里巴巴以先進 AI 技術助力中國古籍數字化
阿里雲 2021年5月19日
2021年5月18日,北京——中國典籍數字化面臨諸多挑戰,因為中國古文字結構複雜,同一個漢字在歷史上可能有多種變體和字形。藉助光學字元辨識(OCR)技術數字化中國古籍,不僅實現了機器閱讀,更讓大量古籍煥發新生,供公眾閱覽。
阿里巴巴全球研究機構達摩院,攜手阿里巴巴公益基金會、加州大學伯克利分校圖書館、四川大學、中國國家圖書館和浙江圖書館,共同開展中國典籍數字化專案。該專案旨在匯聚中國古籍,將掃描映像轉化為文本,實現開放擷取,讓國內外圖書館合作向全球免費提供中國古籍。
達摩院負責人Jeff Zhang表示:“阿里巴巴將持續投入資源和前沿技術,支援此類專案。讓古籍為公眾所享,符合我們‘科技向善’的理念。我們相信,技術在保護珍貴文化典籍和文化遺產方面能發揮關鍵作用,期待與國內外圖書館攜手實現這一願景。”
本次合作的首批中國典籍來自加州大學伯克利分校C.V. Starr東亞圖書館,該館是中國古籍收藏最豐富的學術圖書館之一。現已展出20萬頁古籍,包括宋代和元代的刻本和手稿,距今已有千年歷史。此外還有清代《四庫全書》原冊等典籍。
加州大學伯克利分校圖書館提供掃描頁面和中繼資料,達摩院利用光學字元辨識(OCR)將掃描映像轉化為文本。此外,達摩院與四川大學學者合作開發了AI模型,用於單字索引和自動字形歸類,並採用自監督學習和少樣本學習等多種機器學習方法。該模型古文字識別準確率達97.5%,可高效識別3萬個古文字,速度是人工閱讀的30倍。
“阿里巴巴即將向公眾開放這一中國古籍機器閱讀AI系統,”Jeff補充道。
