All Products
Search
Document Center

Platform For AI:SanityCheck: Pemeriksaan kesehatan komputasi

Last Updated:Jun 22, 2026

Topik ini menjelaskan cara menggunakan fitur SanityCheck di DLC.

Ikhtisar

Dalam skenario pelatihan AI, Anda mungkin menghadapi masalah berikut:

  • Kegagalan sumber daya yang mengganggu pekerjaan dan membuang sumber daya GPU: Suatu pekerjaan mungkin menghabiskan waktu signifikan untuk inisialisasi, seperti memuat checkpoint model, hanya untuk gagal akibat sumber daya yang rusak. Menyelidiki masalah tersebut dan mengirim ulang pekerjaan akan menyia-nyiakan sumber daya GPU.

  • Alat diagnosis dan pengujian performa yang tidak memadai: Jika performa pelatihan model menurun selama pekerjaan berjalan, node yang lambat mungkin menjadi penyebabnya, tetapi sulit untuk segera mengidentifikasinya. Selain itu, pengguna sering kali tidak memiliki benchmark yang nyaman dan andal untuk menguji performa komputasi dan komunikasi GPU pada mesin dalam suatu kelompok sumber daya.

Untuk mengatasi masalah ini, DLC menyediakan fitur SanityCheck guna memeriksa kesehatan dan performa sumber daya komputasi untuk pekerjaan pelatihan terdistribusi. Anda dapat mengaktifkan fitur ini saat membuat pekerjaan pelatihan DLC. SanityCheck melakukan pemeriksaan komprehensif terhadap sumber daya pelatihan, secara otomatis mengisolasi node yang rusak, dan memicu alur kerja pemeliharaan backend otomatis. Proses ini mengurangi kemungkinan terjadinya masalah pada fase awal pelatihan dan meningkatkan tingkat keberhasilan pekerjaan. Setelah pemeriksaan selesai, SanityCheck menghasilkan laporan mengenai performa komputasi dan komunikasi GPU. Laporan tersebut membantu Anda mengidentifikasi faktor-faktor yang dapat menurunkan performa pelatihan, sehingga meningkatkan efisiensi diagnosis secara keseluruhan.

Batasan

Saat ini, fitur ini hanya tersedia untuk pekerjaan pelatihan PyTorch yang menggunakan sumber daya komputasi cerdas Lingjun. Pekerjaan tersebut harus menggunakan semua GPU pada setiap mesin yang dialokasikan. Sumber daya komputasi cerdas Lingjun hanya tersedia bagi pengguna yang termasuk dalam daftar izin (allowlisted). Untuk meminta akses, hubungi manajer akun Anda.

Aktifkan pemeriksaan kesehatan

Gunakan Konsol

Saat Anda membuat pekerjaan pelatihan DLC di Konsol PAI, Anda dapat mengaktifkan pemeriksaan kesehatan dengan mengonfigurasi parameter kunci berikut. Setelah pekerjaan dibuat, sistem akan memeriksa kesehatan dan ketersediaan sumber daya sebelum memberikan hasilnya.

Parameter kunci tersebut dijelaskan sebagai berikut:

  • Pada bagian Resource Information:

    Parameter

    Deskripsi

    Resource Type

    Pilih Lingjun Intelligence Resources.

    Source

    Pilih Resource Quota.

    Resource Quota

    Pilih kuota sumber daya yang sudah ada untuk resource komputasi cerdas Lingjun. Untuk informasi tentang cara membuat kuota sumber daya, lihat Buat kuota sumber daya.

    Framework

    Pilih PyTorch.

    Job Resource

    Pekerjaan harus dikonfigurasi untuk menggunakan semua GPU pada setiap mesin.

  • Pada bagian Fault Tolerance and Diagnosis, aktifkan sakelar Health Check dan konfigurasikan parameter berikut:

    Parameter

    Deskripsi

    Check Time

    • Before Job Runs (default): Menjalankan pemeriksaan awal pada node komputasi setelah sistem mengalokasikan resource ke pekerjaan dan sebelum menjalankan kode Anda.

    • After Job Restarts: Menjalankan pemeriksaan kesehatan setelah AIMaster Fault Tolerance secara otomatis memulai ulang Pekerjaan karena terjadi pengecualian.

      Catatan

      Untuk menggunakan opsi ini, Anda harus mengaktifkan sakelar Automatic Fault Tolerance. Untuk informasi lebih lanjut, lihat AIMaster: An elastic and automatic fault tolerance engine.

    • Before Job Runs + After Job Restarts: Menjalankan pemeriksaan kesehatan baik sebelum pekerjaan dijalankan maupun setelah pekerjaan di-restart.

      Catatan

      Untuk menggunakan opsi ini, Anda harus mengaktifkan sakelar Automatic Fault Tolerance. Untuk informasi lebih lanjut, lihat AIMaster: An elastic and automatic fault tolerance engine.

    Check Items

    Item pemeriksaan dikelompokkan ke dalam empat kategori: pemeriksaan performa komputasi, pemeriksaan komunikasi node, pemeriksaan tumpang tindih komputasi dan komunikasi, serta verifikasi simulasi model. Untuk informasi lebih lanjut mengenai item pemeriksaan dan skenario yang direkomendasikan, lihat Lampiran: Item pemeriksaan.

    • Secara default, GPU GEMM (untuk memeriksa performa GPU GEMM) dan All-Reduce (untuk memeriksa performa komunikasi node dan mengidentifikasi node lambat atau rusak) diaktifkan.

    • Anda dapat mencari atau memilih item pemeriksaan dari daftar. Anda juga dapat menggunakan templat konfigurasi cepat untuk memilih kumpulan item pemeriksaan yang telah ditentukan sebelumnya.

    Maximum Check Duration

    Waktu maksimum yang diizinkan untuk pemeriksaan kesehatan. Nilai default adalah 60 menit. Jika pemeriksaan timeout, sistem akan memicu kebijakan yang dikonfigurasi untuk menangani pengecualian pemeriksaan.

    Exception Handling Policy

    Jika pemeriksaan kesehatan gagal, sistem akan menangani pekerjaan sesuai dengan kebijakan yang dipilih:

    • End job: Jika node rusak atau mencurigakan teridentifikasi, pekerjaan dihentikan dan ditandai sebagai Check Failed.

    • Add to blocklist and rerun: Jika node rusak atau mencurigakan teridentifikasi, sistem secara otomatis menambahkan node tersebut ke daftar blokir, me-restart pekerjaan, dan menjalankan ulang pemeriksaan hingga semua pemeriksaan berhasil.

    Maximum Restart Count

    Saat kebijakan penanganan diatur ke 'add to blocklist and rerun', Anda dapat mengonfigurasi jumlah maksimum restart. Nilai default adalah 10. Jika jumlah maksimum restart terlampaui, tugas secara otomatis gagal.

    Other Configurations

    Parameter ini kosong secara default. Anda dapat menggunakannya untuk mengonfigurasi parameter lanjutan.

Lihat hasil pemeriksaan

Status pemeriksaan kesehatan

Proses pemeriksaan kesehatan untuk pekerjaan DLC mencakup status berikut:

  • Checking: Pemeriksaan kesehatan sedang berlangsung.

  • Check Failed: Pemeriksaan gagal jika node rusak terdeteksi atau jika pemeriksaan timeout.

  • Check Passed: Setelah semua pemeriksaan kesehatan berhasil, status pekerjaan berubah menjadi Running.

Lihat hasil pemeriksaan kesehatan

Gunakan Konsol

Pada halaman detail pekerjaan DLC, buka tab Event dan klik Health Check untuk melihat progres dan hasil pemeriksaan.

Pemeriksaan kesehatan mencakup item seperti Preparing Check Environment, GPU GEMM, GPU Kernel Launch, All-Reduce-Single-Node, MatMul/All-Reduce Overlap, dan Mini GPT-Single-Node. Tanda centang hijau menunjukkan bahwa suatu item telah lulus.

Klik tab Restart History untuk melihat jumlah restart, alasan restart, dan hasilnya.

Konfigurasi notifikasi pesan

Anda dapat membuat aturan notifikasi di pengaturan notifikasi event ruang kerja PAI Anda. Untuk Event Type, pilih DLC Job > Automatic Fault Tolerance. Untuk informasi tentang cara mengonfigurasi parameter lainnya, lihat Notifikasi Pesan. Sistem akan mengirim notifikasi jika pemeriksaan kesehatan gagal.

Catatan

Untuk petunjuk cara membuat aturan notifikasi pesan di ruang kerja, lihat Pengaturan Notifikasi Event.

Lampiran: Item pemeriksaan

Catatan

Durasi perkiraan pemeriksaan didasarkan pada konfigurasi dua mesin dan hanya untuk referensi. Waktu aktual dapat bervariasi.

Item pemeriksaan

Deskripsi (skenario)

Durasi perkiraan

Pemeriksaan performa komputasi

GPU GEMM

Menguji performa GPU GEMM. Pemeriksaan ini dapat mengidentifikasi:

  • GPU rusak: error komputasi atau hang.

  • Node lambat: TFLOPS komputasi rendah.

1 menit

GPU Kernel Launch

Menguji latensi peluncuran kernel GPU. Pemeriksaan ini dapat mengidentifikasi:

  • Node rusak: error peluncuran kernel atau hang.

  • Node lambat: latensi peluncuran kernel tinggi.

1 menit

Pemeriksaan komunikasi node

All-Reduce

Menguji performa komunikasi node dan mengidentifikasi node komunikasi lambat atau rusak. Untuk berbagai pola komunikasi kolektif, pemeriksaan ini mengidentifikasi:

  • Node komunikasi rusak: error komunikasi atau hang.

  • Node komunikasi lambat: bandwidth komunikasi rendah.

Pemeriksaan komunikasi kolektif tunggal

5 menit

All-to-All

All-Gather

Multi-All-Reduce

Network Connectivity

Menguji konektivitas jaringan untuk node head atau tail guna mengidentifikasi node dengan masalah konektivitas.

2 menit

Pemeriksaan tumpang tindih komputasi dan komunikasi

MatMul/All-Reduce Overlap

Menguji performa single-node saat kernel komunikasi dan komputasi tumpang tindih. Pemeriksaan ini dapat mengidentifikasi:

  • Node rusak: error komputasi tumpang tindih atau hang.

  • Node lambat: latensi tinggi untuk komputasi tumpang tindih.

1 menit

Verifikasi simulasi model

Mini GPT

Memverifikasi keandalan sistem AI dengan menggunakan simulasi model. Pemeriksaan ini mengidentifikasi:

  • Node rusak: anomali loss pelatihan, hang pelatihan, atau error pelatihan.

  • Node lambat: latensi tinggi per langkah pelatihan.

1 menit

Megatron GPT

5 menit

ResNet

2 menit