Pelatihan AI sering melibatkan pembacaan berulang terhadap set data besar, yang dapat menimbulkan beban jaringan signifikan dan mengurangi efisiensi pelatihan. Untuk mengatasi hal tersebut, PAI (Platform of AI) menyediakan akselerasi cache lokal untuk Layanan Komputasi AI Lingjun. Fitur ini menyimpan data dalam cache pada node komputasi lokal guna mengurangi beban jaringan, meningkatkan throughput pelatihan, serta memperbaiki kinerja pembacaan data sehingga mempercepat Pekerjaan Pelatihan AI Anda.
Manfaat
-
Cache berkecepatan tinggi: Membuat cache baca berbasis single-node dan terdistribusi dari memori serta disk lokal node komputasi. Cache ini mempercepat akses ke set data dan checkpoint Anda, secara signifikan mengurangi latensi akses data.
-
Skalabilitas horizontal: Throughput cache meningkat secara linear seiring bertambahnya jumlah node komputasi, mendukung lingkungan dengan ratusan hingga ribuan node.
-
Distribusi model peer-to-peer (P2P): Mendukung pemuatan dan distribusi model berskala besar dengan konkurensi tinggi melalui teknologi Peer-to-peer (P2P), memanfaatkan jaringan berkecepatan tinggi antar node GPU untuk mempercepat pembacaan paralel data yang sering diakses (hot data).
-
Tanpa server dan mudah digunakan: Anda dapat mengaktifkan atau menonaktifkan fitur ini hanya dengan satu klik. Tidak memerlukan modifikasi kode dan beroperasi secara non-intrusif, sehingga tidak perlu perawatan.
Batasan dan catatan
-
Penyimpanan yang didukung: Mendukung Object Storage Service (OSS) dan Lingjun CPFS.
-
Sumber daya yang berlaku: Fitur ini hanya tersedia untuk sumber daya Layanan Komputasi AI Lingjun. Saat diaktifkan, fitur ini mengonsumsi sumber daya pada setiap node komputasi (CPU: 4 core, Memori: 14 GB).
-
Kapasitas dan kebijakan: Kapasitas cache maksimum bergantung pada spesifikasi sumber daya Layanan Komputasi AI Lingjun Anda. Kebijakan penggantian yang digunakan adalah Least Recently Used (LRU).
-
Target akselerasi: Tujuan utamanya adalah meningkatkan kinerja pembacaan data. Operasi penulisan tidak didukung.
-
Ketersediaan tinggi data: Cache lokal tidak menyediakan ketersediaan tinggi, sehingga data dalam cache dapat hilang. Segera backup data pelatihan penting Anda.
-
Cara kerja: Selama pelatihan multi-epoch, epoch pertama membaca data dari instans penyimpanan, seperti Object Storage Service (OSS) atau Lingjun CPFS. Kinerjanya sama dengan membaca langsung dari instans penyimpanan tersebut. Pada epoch berikutnya, data dibaca dari cache lokal, sehingga meningkatkan kecepatan baca.
Prosedur
-
Aktifkan cache lokal pada kuota sumber daya. Di panel navigasi sebelah kiri, buka Resource Quota > Intelligent Computing LINGJUN Resources, lalu klik nama kuota target. Aktifkan sakelar Enable Local Cache dan tentukan path penyimpanan yang akan di-cache.
Jika Anda menggunakan kuota sumber daya bersarang, pastikan caching lokal diaktifkan pada kuota sumber daya tingkat atas.
Pada bagian Advanced Information, setelah Anda mengaktifkan sakelar Local Cache, klik View Configuration untuk melihat layanan penyimpanan yang telah dikonfigurasi, termasuk URI untuk OSS dan sistem file untuk Lingjun CPFS.
-
Buat Pekerjaan DLC menggunakan sumber daya Lingjun dari kuota sumber daya target, lalu aktifkan opsi Use Cache. Ketika alamat penyimpanan yang dimount sesuai dengan alamat cache yang Anda tentukan pada Langkah 1, akselerasi akan diaktifkan secara default. Anda dapat memilih untuk menonaktifkannya.
Pada langkah Environment Information, di bagian Direct Mount, konfigurasikan URI mount OSS dan path mount, misalnya
/mnt/data/. Sakelar Use Cache yang sesuai akan diaktifkan secara otomatis.
Konfigurasi aturan masuk grup keamanan
Jika Anda menggunakan Enterprise Security Group, Anda harus menambahkan aturan masuk untuk mengizinkan traffic dari Virtual Private Cloud (VPC) Anda.
-
Di halaman kuota sumber daya, temukan grup keamanan yang telah dikonfigurasi di bagian Informasi Jaringan. Catat nama atau ID grup keamanan tersebut untuk menemukannya nanti.
-
Saat Anda mengaktifkan akselerasi cache, jumlah port masuk yang Anda konfigurasi harus sama dengan jumlah layanan penyimpanan yang dikonfigurasi. Contoh ini menggunakan empat layanan.
Di halaman kuota sumber daya, pada bagian Advanced Information, aktifkan sakelar Cache Acceleration. Di kotak dialog Enable Local Cache yang muncul, daftar Storage Services menampilkan jumlah entri OSS yang telah dikonfigurasi. Dalam contoh ini, terdapat empat entri, yang berarti Anda perlu mengonfigurasi empat port masuk.
-
Buka grup keamanan Anda. Jika ini merupakan Enterprise Security Group, Anda harus menambahkan aturan inbound.
Parameter aturan: Atur Authorization Policy ke Allow, Priority ke 1, dan Protocol ke Custom TCP. Atur Source ke tipe IPv4 dan masukkan
10.0.0.0/8(Blok CIDR VPC ini). Untuk Destination (instans ini), pilih tipe Port dan masukkan10080/10083. Setelah konfigurasi selesai, klik Submit. Source adalah Blok CIDR vSwitch yang digunakan oleh kuota sumber daya. Untuk Destination, Anda harus mengonfigurasi port-port tersebut. Jumlah port harus sama dengan jumlah layanan penyimpanan dalam konfigurasi cache. Jika jumlah layanan penyimpanan adalah n, konfigurasikan range port sebagai 10080/10080+n-1, dengan n<=10. (Artinya, range port-nya adalah10080–10080+n−1). Sebagai contoh, jika empat layanan penyimpanan dikonfigurasi, range port-nya adalah10080/10083.