All Products
Search
Document Center

Container Service for Kubernetes:Troubleshoot masalah node berakselerasi GPU dengan diagnosis Node

Last Updated:Jun 18, 2026

Diagnosis masalah node GPU di kluster ACK Pro menggunakan kode status nvidia-smi dan referensi error XID.

Prasyarat

  • ACK Pro cluster telah dibuat.

  • Kluster berada dalam status Running. Masuk ke ACK console untuk memeriksa status kluster pada halaman Clusters.

Jalankan diagnosis node

Pilih node berakselerasi GPU, jalankan Node diagnosis, lalu gunakan laporan tersebut untuk mengidentifikasi dan menyelesaikan masalah.

  1. Masuk ke ACK console. Di panel navigasi kiri, klik Clusters.

  2. Pada halaman Clusters, klik nama kluster target. Di panel navigasi sisi kiri, pilih Inspections and Diagnostics > Diagnostics.

  3. Pada halaman Diagnostics, klik Node diagnosis. Pada halaman Node diagnosis, klik Diagnosis di pojok kiri atas.

  4. Pada panel Select Node, pilih Node Name, baca catatan yang tersedia, centang I know and agree, lalu klik Create diagnosis.

    Anda dapat melacak progres diagnosis di halaman tersebut. Setelah diagnosis selesai, halaman akan menampilkan hasil dan daftar item diagnosis. Anda kemudian dapat meninjau hasilnya untuk mengidentifikasi dan menyelesaikan masalah apa pun.

Jika node yang didiagnosis merupakan node berakselerasi GPU, laporan diagnostik akan menampilkan metrik terkait GPU setelah diagnosis selesai. Gunakan laporan ini bersama dengan Troubleshoot dengan kode status nvidia-smi dan Troubleshoot dengan error XID untuk menyelesaikan masalah.

Troubleshoot dengan kode status nvidia-smi

nvidia-smi memantau performa dan kesehatan GPU NVIDIA. Temukan hasil NVIDIASMIStatusCode dalam laporan diagnostik. Tabel berikut mencantumkan setiap kode status dan tindakan yang direkomendasikan.

Nvidia-smi status code

Description

Actions

0

Command succeeded. nvidia-smi bekerja sebagaimana mestinya.

Tidak berlaku.

3

Operasi tidak tersedia pada perangkat target. Node mungkin tidak mendukung nvidia-smi, atau terdapat masalah driver.

Periksa /var/log/nvidia-installer.log untuk log driver dan jalankan dmesg | grep -i nv untuk error kernel.

6

Gagal melakukan kueri perangkat GPU. Mengindikasikan adanya masalah driver.

Periksa /var/log/nvidia-installer.log untuk log driver dan jalankan dmesg | grep -i nv untuk error kernel.

8

Kabel daya perangkat GPU tidak terhubung dengan benar. Mengindikasikan adanya masalah hardware.

Submit a ticket untuk menghubungi dukungan teknis ECS.

9

Driver NVIDIA tidak dimuat. Mengindikasikan adanya masalah driver.

Periksa /var/log/nvidia-installer.log untuk log driver dan jalankan dmesg | grep -i nv untuk error kernel.

10

Kernel NVIDIA mendeteksi masalah interrupt.

Periksa /var/log/nvidia-installer.log untuk log driver, jalankan dmesg | grep -i nv untuk error kernel, atau tinjau hasil diagnosis XID.

12

Pustaka bersama NVML tidak ditemukan atau gagal dimuat.

Periksa /var/log/nvidia-installer.log untuk log driver, jalankan dmesg | grep -i nv untuk error kernel, atau tinjau hasil diagnosis XID.

13

Versi NVML lokal tidak sesuai dengan versi driver.

Periksa /var/log/nvidia-installer.log untuk log driver, jalankan dmesg | grep -i nv untuk error kernel, atau tinjau hasil diagnosis XID.

14

infoROM rusak. Mengindikasikan adanya masalah hardware.

Submit a ticket untuk menghubungi dukungan teknis ECS.

15

GPU telah jatuh dari bus. Mengindikasikan adanya masalah hardware.

Submit a ticket untuk menghubungi dukungan teknis ECS.

255

Error driver tidak dikenal. Mengindikasikan adanya masalah driver.

Periksa /var/log/nvidia-installer.log untuk log driver, jalankan dmesg | grep -i nv untuk error kernel, atau tinjau hasil diagnosis XID.

-1

Perintah nvidia-smi timeout.

Periksa /var/log/nvidia-installer.log untuk log driver, jalankan dmesg | grep -i nv untuk error kernel, atau tinjau hasil diagnosis XID.

Troubleshoot dengan error XID

Pesan XID adalah laporan error GPU yang dicatat oleh driver NVIDIA ke log kernel OS. Pesan ini mengidentifikasi jenis error, lokasi, dan kode yang terkait dengan hardware GPU, perangkat lunak NVIDIA, atau aplikasi Anda.

Dalam laporan diagnostik, periksa item XID exceptions on GPU-accelerated node. Jika kosong, berarti tidak ada error XID. Jika tidak, gunakan tabel berikut untuk troubleshooting atau submit tiket.

Self-troubleshooting

Jika Anda mengalami salah satu error XID berikut, coba langkah-langkah ini untuk menyelesaikannya:

  1. Kirim ulang workload dan periksa apakah error XID menghilang.

  2. Jika error tetap muncul, tinjau kode dan log Anda untuk menentukan apakah kode Anda menyebabkannya.

  3. Jika bukan disebabkan oleh kode Anda,submit a ticket untuk dukungan teknis.

XID

Description

13

Graphics Engine Exception. Biasanya disebabkan oleh akses array di luar batas atau instruksi ilegal. Jarang merupakan masalah hardware.

31

Page fault memori GPU. Biasanya disebabkan oleh akses memori ilegal dari aplikasi. Jarang merupakan masalah driver atau hardware.

43

GPU berhenti memproses. Biasanya merupakan error aplikasi, bukan masalah hardware.

45

Pembersihan preemptive akibat error sebelumnya. Umumnya terjadi saat menjalankan beberapa aplikasi CUDA dengan Double Bit ECC Error (DBE). Mengindikasikan aplikasi GPU keluar karena penghentian manual, masalah hardware, atau batasan resource. Penyebab spesifik memerlukan analisis log lebih lanjut.

68

NVDEC0 Exception. Biasanya merupakan masalah hardware atau driver.

Troubleshooting berbasis tiket

Untuk error XID berikut,submit a ticket ke dukungan teknis dengan output diagnostik lengkap node GPU.

XID

Description

32

Aliran push buffer tidak valid atau rusak. Dilaporkan oleh controller DMA pada bus PCIe. Biasanya disebabkan oleh masalah kualitas PCI, bukan aplikasi.

38

Error firmware driver, bukan masalah hardware.

48

Double Bit ECC Error (DBE). Dilaporkan ketika GPU mengalami error yang tidak dapat dikoreksi, juga dilaporkan ke aplikasi Anda. Biasanya memerlukan reset GPU atau restart node untuk membersihkannya.

61

Breakpoint/peringatan mikrokontroler internal. Mesin internal GPU telah berhenti, memengaruhi workload Anda.

62

Halt mikrokontroler internal. Mirip dengan XID 61.

63

Event pencatatan retirement halaman ECC atau remapping baris. Ketika terjadi error hardware memori GPU, mekanisme self-correction NVIDIA melakukan retirement atau remapping area memori yang rusak dan mencatatnya di infoROM.

  • Volta: Event retirement halaman ECC berhasil dicatat ke infoROM.

  • Ampere: Event remapping baris berhasil dicatat ke infoROM.

64

Kegagalan pencatatan retirement halaman ECC atau remapper baris. Mirip dengan XID 63, tetapi pencatatan ke infoROM gagal.

74

NVLINK Error. Mengindikasikan kegagalan hardware NVLink kritis. GPU harus di-offline-kan untuk maintenance.

79

GPU telah jatuh dari bus dan tidak dapat lagi terdeteksi. Kegagalan hardware kritis. GPU harus di-offline-kan untuk maintenance.

92

Laju error ECC single-bit tinggi. Mengindikasikan kegagalan hardware atau driver.

94

Error ECC terkandung. Mekanisme containment error NVIDIA mengisolasi error ECC yang tidak dapat dikoreksi ke aplikasi yang terpengaruh, sehingga mencegah dampak terhadap aplikasi lain di node tersebut.

95

Error ECC tidak terkandung. Mirip dengan XID 94, tetapi containment gagal. Semua aplikasi di GPU terpengaruh.

Topik terkait