Topik ini menjelaskan cara menggunakan fitur SanityCheck di DLC.
Ikhtisar
Dalam skenario pelatihan AI, Anda mungkin menghadapi masalah berikut:
Kegagalan sumber daya yang mengganggu pekerjaan dan membuang sumber daya GPU: Suatu pekerjaan mungkin menghabiskan waktu signifikan untuk inisialisasi, seperti memuat checkpoint model, hanya untuk gagal akibat sumber daya yang rusak. Menyelidiki masalah tersebut dan mengirim ulang pekerjaan akan menyia-nyiakan sumber daya GPU.
Alat diagnosis dan pengujian performa yang tidak memadai: Jika performa pelatihan model menurun selama pekerjaan berjalan, node yang lambat mungkin menjadi penyebabnya, tetapi sulit untuk segera mengidentifikasinya. Selain itu, pengguna sering kali tidak memiliki benchmark yang nyaman dan andal untuk menguji performa komputasi dan komunikasi GPU pada mesin dalam suatu kelompok sumber daya.
Untuk mengatasi masalah ini, DLC menyediakan fitur SanityCheck guna memeriksa kesehatan dan performa sumber daya komputasi untuk pekerjaan pelatihan terdistribusi. Anda dapat mengaktifkan fitur ini saat membuat pekerjaan pelatihan DLC. SanityCheck melakukan pemeriksaan komprehensif terhadap sumber daya pelatihan, secara otomatis mengisolasi node yang rusak, dan memicu alur kerja pemeliharaan backend otomatis. Proses ini mengurangi kemungkinan terjadinya masalah pada fase awal pelatihan dan meningkatkan tingkat keberhasilan pekerjaan. Setelah pemeriksaan selesai, SanityCheck menghasilkan laporan mengenai performa komputasi dan komunikasi GPU. Laporan tersebut membantu Anda mengidentifikasi faktor-faktor yang dapat menurunkan performa pelatihan, sehingga meningkatkan efisiensi diagnosis secara keseluruhan.
Batasan
Saat ini, fitur ini hanya tersedia untuk pekerjaan pelatihan PyTorch yang menggunakan sumber daya komputasi cerdas Lingjun. Pekerjaan tersebut harus menggunakan semua GPU pada setiap mesin yang dialokasikan. Sumber daya komputasi cerdas Lingjun hanya tersedia bagi pengguna yang termasuk dalam daftar izin (allowlisted). Untuk meminta akses, hubungi manajer akun Anda.
Aktifkan pemeriksaan kesehatan
Gunakan Konsol
Saat Anda membuat pekerjaan pelatihan DLC di Konsol PAI, Anda dapat mengaktifkan pemeriksaan kesehatan dengan mengonfigurasi parameter kunci berikut. Setelah pekerjaan dibuat, sistem akan memeriksa kesehatan dan ketersediaan sumber daya sebelum memberikan hasilnya.
Parameter kunci tersebut dijelaskan sebagai berikut:
Pada bagian Resource Information:
Parameter
Deskripsi
Resource Type
Pilih Lingjun Intelligence Resources.
Source
Pilih Resource Quota.
Resource Quota
Pilih kuota sumber daya yang sudah ada untuk resource komputasi cerdas Lingjun. Untuk informasi tentang cara membuat kuota sumber daya, lihat Buat kuota sumber daya.
Framework
Pilih PyTorch.
Job Resource
Pekerjaan harus dikonfigurasi untuk menggunakan semua GPU pada setiap mesin.
Pada bagian Fault Tolerance and Diagnosis, aktifkan sakelar Health Check dan konfigurasikan parameter berikut:
Parameter
Deskripsi
Check Time
Before Job Runs (default): Menjalankan pemeriksaan awal pada node komputasi setelah sistem mengalokasikan resource ke pekerjaan dan sebelum menjalankan kode Anda.
After Job Restarts: Menjalankan pemeriksaan kesehatan setelah AIMaster Fault Tolerance secara otomatis memulai ulang Pekerjaan karena terjadi pengecualian.
CatatanUntuk menggunakan opsi ini, Anda harus mengaktifkan sakelar Automatic Fault Tolerance. Untuk informasi lebih lanjut, lihat AIMaster: An elastic and automatic fault tolerance engine.
Before Job Runs + After Job Restarts: Menjalankan pemeriksaan kesehatan baik sebelum pekerjaan dijalankan maupun setelah pekerjaan di-restart.
CatatanUntuk menggunakan opsi ini, Anda harus mengaktifkan sakelar Automatic Fault Tolerance. Untuk informasi lebih lanjut, lihat AIMaster: An elastic and automatic fault tolerance engine.
Check Items
Item pemeriksaan dikelompokkan ke dalam empat kategori: pemeriksaan performa komputasi, pemeriksaan komunikasi node, pemeriksaan tumpang tindih komputasi dan komunikasi, serta verifikasi simulasi model. Untuk informasi lebih lanjut mengenai item pemeriksaan dan skenario yang direkomendasikan, lihat Lampiran: Item pemeriksaan.
Secara default, GPU GEMM (untuk memeriksa performa GPU GEMM) dan All-Reduce (untuk memeriksa performa komunikasi node dan mengidentifikasi node lambat atau rusak) diaktifkan.
Anda dapat mencari atau memilih item pemeriksaan dari daftar. Anda juga dapat menggunakan templat konfigurasi cepat untuk memilih kumpulan item pemeriksaan yang telah ditentukan sebelumnya.
Maximum Check Duration
Waktu maksimum yang diizinkan untuk pemeriksaan kesehatan. Nilai default adalah 60 menit. Jika pemeriksaan timeout, sistem akan memicu kebijakan yang dikonfigurasi untuk menangani pengecualian pemeriksaan.
Exception Handling Policy
Jika pemeriksaan kesehatan gagal, sistem akan menangani pekerjaan sesuai dengan kebijakan yang dipilih:
End job: Jika node rusak atau mencurigakan teridentifikasi, pekerjaan dihentikan dan ditandai sebagai Check Failed.
Add to blocklist and rerun: Jika node rusak atau mencurigakan teridentifikasi, sistem secara otomatis menambahkan node tersebut ke daftar blokir, me-restart pekerjaan, dan menjalankan ulang pemeriksaan hingga semua pemeriksaan berhasil.
Maximum Restart Count
Saat kebijakan penanganan diatur ke 'add to blocklist and rerun', Anda dapat mengonfigurasi jumlah maksimum restart. Nilai default adalah 10. Jika jumlah maksimum restart terlampaui, tugas secara otomatis gagal.
Other Configurations
Parameter ini kosong secara default. Anda dapat menggunakannya untuk mengonfigurasi parameter lanjutan.
Lihat hasil pemeriksaan
Status pemeriksaan kesehatan
Proses pemeriksaan kesehatan untuk pekerjaan DLC mencakup status berikut:
Checking: Pemeriksaan kesehatan sedang berlangsung.
Check Failed: Pemeriksaan gagal jika node rusak terdeteksi atau jika pemeriksaan timeout.
Check Passed: Setelah semua pemeriksaan kesehatan berhasil, status pekerjaan berubah menjadi Running.
Lihat hasil pemeriksaan kesehatan
Gunakan Konsol
Pada halaman detail pekerjaan DLC, buka tab Event dan klik Health Check untuk melihat progres dan hasil pemeriksaan.
Pemeriksaan kesehatan mencakup item seperti Preparing Check Environment, GPU GEMM, GPU Kernel Launch, All-Reduce-Single-Node, MatMul/All-Reduce Overlap, dan Mini GPT-Single-Node. Tanda centang hijau menunjukkan bahwa suatu item telah lulus.
Klik tab Restart History untuk melihat jumlah restart, alasan restart, dan hasilnya.
Konfigurasi notifikasi pesan
Anda dapat membuat aturan notifikasi di pengaturan notifikasi event ruang kerja PAI Anda. Untuk Event Type, pilih DLC Job > Automatic Fault Tolerance. Untuk informasi tentang cara mengonfigurasi parameter lainnya, lihat Notifikasi Pesan. Sistem akan mengirim notifikasi jika pemeriksaan kesehatan gagal.
Untuk petunjuk cara membuat aturan notifikasi pesan di ruang kerja, lihat Pengaturan Notifikasi Event.
Lampiran: Item pemeriksaan
Durasi perkiraan pemeriksaan didasarkan pada konfigurasi dua mesin dan hanya untuk referensi. Waktu aktual dapat bervariasi.
Item pemeriksaan | Deskripsi (skenario) | Durasi perkiraan | |
Pemeriksaan performa komputasi | GPU GEMM | Menguji performa GPU GEMM. Pemeriksaan ini dapat mengidentifikasi:
| 1 menit |
GPU Kernel Launch | Menguji latensi peluncuran kernel GPU. Pemeriksaan ini dapat mengidentifikasi:
| 1 menit | |
Pemeriksaan komunikasi node | All-Reduce | Menguji performa komunikasi node dan mengidentifikasi node komunikasi lambat atau rusak. Untuk berbagai pola komunikasi kolektif, pemeriksaan ini mengidentifikasi:
| Pemeriksaan komunikasi kolektif tunggal 5 menit |
All-to-All | |||
All-Gather | |||
Multi-All-Reduce | |||
Network Connectivity | Menguji konektivitas jaringan untuk node head atau tail guna mengidentifikasi node dengan masalah konektivitas. | 2 menit | |
Pemeriksaan tumpang tindih komputasi dan komunikasi | MatMul/All-Reduce Overlap | Menguji performa single-node saat kernel komunikasi dan komputasi tumpang tindih. Pemeriksaan ini dapat mengidentifikasi:
| 1 menit |
Verifikasi simulasi model | Mini GPT | Memverifikasi keandalan sistem AI dengan menggunakan simulasi model. Pemeriksaan ini mengidentifikasi:
| 1 menit |
Megatron GPT | 5 menit | ||
ResNet | 2 menit | ||