All Products
Search
Document Center

Platform For AI:Detail pelatihan

Last Updated:Jun 11, 2026

Setelah mengirimkan pekerjaan pelatihan, Anda dapat meninjau informasi dasar, konfigurasi, event, metrik sumber daya, dan log-nya untuk memperoleh ikhtisar komprehensif mengenai eksekusinya. Anda juga dapat mencari berdasarkan nama atau ID pekerjaan untuk beralih dengan cepat antara instans yang sedang berjalan dan instans historis.

Informasi dasar dan konfigurasi

  1. Masuk ke Konsol PAI. Dari bilah navigasi atas, pilih wilayah target dan, di sebelah kanan, ruang kerja target. Lalu, klik Enter DLC.

  2. Klik nama pekerjaan target untuk membuka halaman ikhtisarnya.

  3. Tab Overview menampilkan informasi dasar, informasi lingkungan, dan informasi sumber daya pekerjaan tersebut.

    Bagian atas halaman menampilkan status pekerjaan (misalnya, Succeeded), durasi, tipe komputasi (misalnya, General-purpose computing), tipe pekerjaan (misalnya, PyTorchJob), serta kelompok sumber daya dan garis waktu tahapan-tahapannya mulai dari pembuatan hingga penyelesaian. Informasi dasar mencakup nama pekerjaan, ID pekerjaan, dan tag. Informasi sumber daya mencakup tipe sumber daya, jumlah worker, dan tipe instans (misalnya, ecs.gn7i-c8g1.2xlarge). Informasi lingkungan mencakup URL image node, konfigurasi mount dataset, dan perintah eksekusi. Halaman ini juga menyertakan bagian konfigurasi seperti Fault Tolerance and Diagnosis (dengan toggle untuk Auto Fault Tolerance dan Health Check), Network Information (dengan detail mengenai Virtual Private Cloud (VPC), security group, dan vSwitch), serta Roles and Permissions (dengan detail mengenai Instance RAM role dan visibilitas).

  4. Klik nama pekerjaan di bagian atas halaman untuk membuka daftar drop-down pekerjaan. Daftar tersebut mendukung pencarian fuzzy berdasarkan nama atau ID sehingga Anda dapat beralih dengan cepat antara instans yang sedang berjalan dan instans historis.

Event pekerjaan

Event logs mencatat progres penjadwalan pekerjaan dan alokasi sumber daya. Anda dapat menggunakan event-event ini untuk mengidentifikasi dan memecahkan masalah.

  • Beralih ke tab Event untuk melihat log event pekerjaan.

    Tab Event menampilkan garis waktu event di sebelah kiri, yang menunjukkan tahapan-tahapan seperti pembuatan pekerjaan, persiapan lingkungan, eksekusi pekerjaan, dan penyelesaian pekerjaan beserta rentang waktunya masing-masing. Di sebelah kanan, panel log event menampilkan detail event siklus hidup PyTorchJob, seperti Job Queued, Dequeued, Pod Created, Service Created, Scheduled, Running, dan Succeeded.

  • Pada tab Overview, buka bagian Instance. Pada kolom Actions untuk suatu instans, klik Log, lalu pilih tab System Log untuk melihat log event spesifik node.

    Log sistem mencatat seluruh event siklus hidup pod, termasuk perubahan status (ResourcePurchasing → NetworkInitializing → Initializing → ImagePulling → WaitingForRun → Running → Succeeded), catatan pengambilan image, serta event pembuatan dan startup kontainer.

Metrik sumber daya

Metrik utama mencakup pemanfaatan GPU, penggunaan memori GPU, pemanfaatan CPU, penggunaan memori, dan I/O jaringan. Dengan memantau metrik sumber daya ini secara real time, Anda dapat memahami kebutuhan sumber daya pekerjaan Anda, melacak pemanfaatan dan konsumsi, serta merencanakan optimalisasi sumber daya.

Beralih ke tab Monitoring untuk melihat metrik sumber daya pekerjaan.

Jika Anda membuat pekerjaan pelatihan dengan kuota sumber daya, Anda juga dapat menggunakan fitur pemantauan berikut:

  1. Metrik tersedia berdasarkan Job Dimension, Pod Dimension, dan GPU Dimension.

    Bagian atas halaman Monitoring menampilkan garis waktu siklus hidup pekerjaan, yang menunjukkan tahapan seperti Job Created, Queued, Preparing Environment, Running, dan Succeeded beserta waktu yang dibutuhkan untuk setiap tahapan. Di bawah garis waktu tersebut, Anda dapat beralih antara tab Job Dimension, Pod Dimension, dan GPU Dimension untuk melihat metrik yang sesuai. Tab GPU Dimension menampilkan grafik garis untuk pemanfaatan GPU dan penggunaan memori GPU.

  2. Anda dapat menggunakan fitur interaktif, termasuk penyaringan berdasarkan waktu dan tipe metrik, serta pengkategorian metrik. Klik More untuk menyesuaikan tampilan metrik dan mengurutkannya. Tampilan pemantauan DLC memungkinkan Anda membuat dasbor personal dengan memilih dan mengatur ulang urutan metrik. Anda dapat memilih indikator kinerja utama berdasarkan kebutuhan bisnis Anda serta menyesuaikan prioritas tampilannya dengan menyeret dan meletakkannya agar fokus pada hal yang paling penting.

    Metrik pemantauan GPU yang tersedia mencakup GPU utilization, Total GPU Memory, GPU memory usage, GPU Memory Used, GPU Memory Interface Utilization, GPU Memory Bandwidth Usage, GPU SM Core Utilization, GPU Power Consumption, dan GPU Temperature. Setelah memilih metrik yang diinginkan, seret metrik tersebut ke area Sort metrics di sebelah kanan untuk menyesuaikan urutan tampilannya, lalu klik OK untuk menyimpan konfigurasi Anda.

  3. DLC juga mendukung pemantauan dan peringatan untuk melacak tingkat sumber daya pekerjaan Anda secara real time. Untuk informasi lebih lanjut, lihat Pemantauan dan Peringatan Pelatihan.

Log pekerjaan

Jika pekerjaan berjalan tidak normal atau Anda perlu meninjau riwayat eksekusinya, Anda dapat melihat log pekerjaan dengan salah satu cara berikut:

  • Pada tab Overview, buka bagian Instance. Pada kolom Actions untuk suatu instans, klik Log untuk melihat log output node tersebut.

  • Beralih ke tab Log untuk mencari event log berdasarkan kata kunci. Untuk informasi lebih lanjut, lihat Kueri Log Teragregasi Berdasarkan Kata Kunci. Berikut beberapa tips cepat untuk sintaks kueri:

    - Kueri dasar: error: menemukan log yang berisi "error".
    - Kueri multi-kata: "Unexpected result": menemukan log yang berisi "Unexpected" dan "result".
    - Kueri wildcard: error*: menemukan kata yang dimulai dengan "error". Karakter khusus tidak didukung.
    - Kueri frasa: #"abc$def": mencocokkan frasa tepat "abc$def".
    Pembatas: Log dipisahkan oleh pembatas. Pembatas dalam kata kunci diperlakukan sebagai karakter null. Untuk mencari konten yang berisi pembatas, gunakan kueri frasa. Pembatas umum meliputi: \n\t\r,;[]{}()&^*#@~=<>/\?:'"

    Pada halaman Log, sisi kiri menampilkan daftar instans, dan sisi kanan menampilkan log pengguna untuk instans yang dipilih. Pada contoh tersebut, log pelatihan menunjukkan hasil validasi dari Epoch 16 hingga Epoch 18, dan output akhirnya adalah Model saved with accuracy: 98.96%, yang menunjukkan bahwa pelatihan model telah berhasil diselesaikan.

Log audit

PAI terintegrasi dengan ActionTrail. Anda dapat melihat dan mencari event aksi DLC selama 90 hari terakhir untuk Akun Alibaba Cloud Anda di ActionTrail. Untuk informasi lebih lanjut, lihat ActionTrail.

Catatan restart

Jika Anda mengaktifkan Auto Fault Tolerance atau Health Check (blocklist dan rerun) saat membuat pekerjaan, Anda dapat mengklik Restart Count untuk membuka halaman catatan restart. Halaman ini menampilkan informasi mengenai restart, termasuk jumlah restart, waktu restart, alasan restart, hasil restart, dan durasi restart.

  • Pada daftar catatan restart, klik Error Details untuk melihat informasi detail mengenai restart tertentu, termasuk jumlah restart, waktu restart, nama node, nama instans, kode kesalahan, pesan kesalahan, dan sumber kesalahan.

  • Klik View Aggregated Error Details untuk menampilkan daftar lengkap catatan restart beserta detailnya.

Dokumentasi terkait

Anda dapat mengelola pekerjaan berdasarkan statusnya. Untuk informasi lebih lanjut, lihat Mengelola Pekerjaan Pelatihan.