阿里巴巴以先进 AI 技术助力中国古籍数字化
阿里云 2021年5月19日
2021年5月18日,北京——中国典籍数字化面临诸多挑战,因为中国古文字结构复杂,同一个汉字在历史上可能有多种变体和字形。借助光学字符识别(OCR)技术数字化中国古籍,不仅实现了机器阅读,更让大量古籍焕发新生,供公众阅览。
阿里巴巴全球研究机构达摩院,携手阿里巴巴公益基金会、加州大学伯克利分校图书馆、四川大学、中国国家图书馆和浙江图书馆,共同开展中国典籍数字化项目。该项目旨在汇聚中国古籍,将扫描图像转化为文本,实现开放获取,让国内外图书馆合作向全球免费提供中国古籍。
达摩院负责人Jeff Zhang表示:“阿里巴巴将持续投入资源和前沿技术,支持此类项目。让古籍为公众所享,符合我们‘科技向善’的理念。我们相信,技术在保护珍贵文化典籍和文化遗产方面能发挥关键作用,期待与国内外图书馆携手实现这一愿景。”
本次合作的首批中国典籍来自加州大学伯克利分校C.V. Starr东亚图书馆,该馆是中国古籍收藏最丰富的学术图书馆之一。现已展出20万页古籍,包括宋代和元代的刻本和手稿,距今已有千年历史。此外还有清代《四库全书》原册等典籍。
加州大学伯克利分校图书馆提供扫描页面和元数据,达摩院利用光学字符识别(OCR)将扫描图像转化为文本。此外,达摩院与四川大学学者合作开发了AI模型,用于单字索引和自动字形归类,并采用自监督学习和少样本学习等多种机器学习方法。该模型古文字识别准确率达97.5%,可高效识别3万个古文字,速度是人工阅读的30倍。
“阿里巴巴即将向公众开放这一中国古籍机器阅读AI系统,”Jeff补充道。
