Alibaba apoia a digitalização de livros antigos chineses com tecnologia avançada de IA
Alibaba Cloud 19/05/2021
18 de maio de 2021, Pequim — A digitalização dos clássicos chineses é um desafio, pois os caracteres chineses antigos são complexos. Ao longo da história, um único caractere chinês pode ter diversas variantes e formas de escrita. Digitalizar livros antigos chineses por meio do reconhecimento óptico de caracteres (OCR) não só facilita a leitura automatizada, mas também dá nova vida a inúmeros livros antigos para consulta pública.
A Alibaba DAMO Academy (DAMO), o instituto de pesquisa global da Alibaba, iniciou um novo projeto para digitalizar clássicos chineses em parceria com a Alibaba Foundation, a Library of University of California, Berkeley, a Sichuan University, a National Library of China e a Zhejiang Library. O programa tem como objetivo digitalizar e reunir livros antigos chineses e converter imagens digitalizadas em textos para acesso aberto. Dessa forma, bibliotecas na China e no exterior podem trabalhar juntas para disponibilizar seus livros antigos chineses gratuitamente ao mundo.
Jeff Zhang, diretor da Alibaba DAMO Academy, afirmou: “A Alibaba continuará investindo em recursos e tecnologia de ponta para apoiar projetos como este. Tornar os livros antigos acessíveis ao público está alinhado com nossos valores e nossa crença no ‘Tech for Change’. Acreditamos que a tecnologia pode desempenhar um papel fundamental na preservação de relíquias culturais e patrimônios preciosos, e esperamos trabalhar com bibliotecas na China e no exterior para tornar isso possível.”
O primeiro lote de clássicos chineses desta iniciativa conjunta vem da C.V. Starr East Asian Library da University of California, Berkeley, uma das maiores bibliotecas acadêmicas com um rico acervo de livros antigos chineses. 200.000 páginas digitais de livros antigos estão agora em exibição, incluindo livros impressos em xilogravura e manuscritos das dinastias Song e Yuan, um período da China antiga que remonta a mais de 1.000 anos. Outros materiais incluem páginas digitais de um volume original de Siku Quanshu 四库全书, The Complete Works of Chinese Classics da dinastia Qing.
A biblioteca da UC Berkeley forneceu páginas digitalizadas e metadados, enquanto a DAMO usou reconhecimento óptico de caracteres (OCR) para converter as imagens digitalizadas em texto. Além disso, a DAMO se uniu a estudiosos da Sichuan University para desenvolver um modelo de IA para indexação por caractere único, agrupamento automático de caracteres e diversas formas de machine learning, como self-supervised learning e few shot learning. Esse modelo alcança uma taxa de precisão de 97,5% no reconhecimento de caracteres antigos. O novo modelo já consegue reconhecer 30.000 caracteres chineses antigos com eficiência, superando a velocidade de leitura humana em trinta vezes.
“A Alibaba disponibilizará em breve ao público este sistema de IA para a leitura automatizada de livros antigos chineses”, acrescentou Jeff.
