Alibaba, Çin Antik Kitaplarının Dijitalleştirilmesini Gelişmiş Yapay Zeka Teknolojisiyle Destekliyor
Alibaba Cloud 19 Mayıs 2021
18 Mayıs 2021, Pekin - Çin klasiklerinin dijitalleştirilmesi, Çin antik karakterlerinin karmaşıklığı nedeniyle zordur. Tarih boyunca tek bir Çin karakterinin birden fazla varyantı ve yazım biçimi olabilmekteydi. Optik karakter tanıma (OCR) yoluyla Çin antik kitaplarının dijitalleştirilmesi, yalnızca makine okumasını kolaylaştırmakla kalmıyor, aynı zamanda çok sayıda antik kitabı halkın incelemesine sunarak onlara yeni bir yaşam veriyor.
Alibaba'nın küresel araştırma enstitüsü Alibaba DAMO Academy (DAMO), Çin klasiklerini dijitalleştirmek için Alibaba Foundation, UC Berkeley Kütüphanesi, Sichuan Üniversitesi, Çin Ulusal Kütüphanesi ve Zhejiang Kütüphanesi ile birlikte yeni bir proje başlattı. Program, antik Çin kitaplarını dijitalleştirip bir araya getirmeyi ve taranmış görüntüleri metne dönüştürerek açık erişim sunmayı amaçlıyor. Bu sayede Çin'deki ve yurt dışındaki kütüphaneler, antik Çin kitaplarını dünyaya ücretsiz olarak sunmak için birlikte çalışabilir.
Alibaba DAMO Academy Başkanı Jeff Zhang şöyle dedi: "Alibaba, bu tür projeleri desteklemek için kaynak ve öncü teknoloji yatırımlarına devam edecek. Antik kitapları halkın erişimine sunmak, 'Tech for Change' değerlerimiz ve inancımızla örtüşüyor. Teknolojinin değerli kültürel eserlerin ve mirasın korunmasında kritik bir rol oynayabileceğine inanıyoruz ve bunu gerçekleştirmek için Çin'deki ve yurt dışındaki kütüphanelerle çalışmayı dört gözle bekliyoruz."
Bu ortak çalışmanın ilk Çin klasikleri partisi, Çin antik kitapları açısından zengin koleksiyonlara sahip en büyük akademik kütüphanelerden biri olan UC Berkeley'deki C.V. Starr East Asian Library'den gelmektedir. 200.000 dijital sayfa, Song Hanedanı ve Yuan Hanedanı dönemine ait, günümüzden 1.000 yıldan fazla bir süre öncesine dayanan antik Çin döneminden ahşap baskı kitaplar ve el yazmaları dahil olmak üzere şu anda sergilenmektedir. Diğer materyaller arasında Qing Hanedanı dönemine ait orijinal bir Siku Quanshu cildi ve The Complete Works of Chinese Classics'in dijital sayfaları yer almaktadır.
UC Berkeley Kütüphanesi taranmış sayfaları ve meta verileri sağlarken, DAMO taranmış görüntüleri metne dönüştürmek için optik karakter tanıma (OCR) kullandı. Ayrıca DAMO, Sichuan Üniversitesi'nden bilim insanları ile birlikte tek karakter indeksleme, otomatik karakter gruplama ve kendi kendine denetimli öğrenme ile az örnekli öğrenme gibi çeşitli makine öğrenimi biçimleri için bir Yapay Zeka modeli geliştirdi. Bu model, antik karakterleri tanımada %97,5 doğruluk oranı elde etti. Yeni model artık 30.000 antik Çin karakterini verimli bir şekilde tanıyabiliyor ve insan okuma hızının otuz katı hıza ulaşıyor.
"Alibaba, Çin antik kitaplarının makineyle okunması için bu Yapay Zeka sistemini yakında halkın kullanımına sunacak" diye ekledi Jeff.
