Alibaba soutient la numérisation des livres anciens chinois grâce à une technologie d'IA avancée
Alibaba Cloud 19 mai 2021
18 mai 2021, Pékin - La numérisation des classiques chinois est un défi de taille, car les caractères chinois anciens sont complexes. Tout au long de l'histoire, un même caractère chinois a pu connaître plusieurs variantes et formes d'écriture. La numérisation des livres anciens chinois par reconnaissance optique de caractères (OCR) facilite non seulement la lecture automatique, mais offre également une nouvelle vie à de nombreux ouvrages anciens pour le grand public.
L'Alibaba DAMO Academy (DAMO), l'institut de recherche mondial d'Alibaba, a lancé un nouveau projet de numérisation des classiques chinois en collaboration avec la Fondation Alibaba, la bibliothèque de l'Université de Californie à Berkeley, l'Université du Sichuan, la Bibliothèque nationale de Chine et la Bibliothèque du Zhejiang. Ce programme vise à numériser et rassembler des livres anciens chinois et à convertir les images numérisées en textes pour un accès libre. Ainsi, les bibliothèques en Chine et à l'étranger peuvent collaborer pour mettre leurs livres anciens chinois à la disposition du monde entier.
Jeff Zhang, directeur de l'Alibaba DAMO Academy, a déclaré : « Alibaba continuera d'investir dans les ressources et les technologies de pointe pour soutenir de tels projets. Rendre les livres anciens accessibles au public est conforme à nos valeurs et à notre conviction en la ‹ Tech for Change ›. Nous sommes convaincus que la technologie peut jouer un rôle déterminant dans la préservation des précieuses reliques et du patrimoine culturels, et nous nous réjouissons de collaborer avec les bibliothèques en Chine et à l'étranger pour y parvenir. »
Le premier lot de classiques chinois issu de cette collaboration provient de la bibliothèque C.V. Starr d'études est-asiatiques de l'Université de Californie à Berkeley, l'une des plus grandes bibliothèques universitaires dotée d'un riche fonds de livres anciens chinois. 200 000 pages numériques de livres anciens sont désormais présentées, dont des livres imprimés par xylographie et des manuscrits des dynasties Song et Yuan, une période de la Chine ancienne remontant à plus de 1 000 ans. D'autres documents comprennent des pages numériques d'un volume original du Siku Quanshu 四库全书, les Œuvres complètes des classiques chinois de la dynastie Qing.
La bibliothèque de l'UC Berkeley a fourni les pages numérisées et les métadonnées, tandis que DAMO a utilisé la reconnaissance optique de caractères (OCR) pour convertir les images numérisées en texte. Par ailleurs, DAMO s'est associé à des chercheurs de l'Université du Sichuan pour développer un modèle d'IA d'indexation par caractère, de regroupement automatique de caractères et de diverses formes d'apprentissage automatique telles que l'apprentissage auto-supervisé et l'apprentissage à partir de peu d'exemples. Ce modèle atteint un taux de précision de 97,5 % dans la reconnaissance des caractères anciens. Le nouveau modèle peut désormais reconnaître 30 000 caractères chinois anciens avec efficacité, dépassant la vitesse de lecture humaine d'un facteur trente.
« Alibaba mettra prochainement ce système d'IA pour la lecture automatique des livres anciens chinois à la disposition du public », a ajouté Jeff.
