CNP (Cloud Native Application Performance Optimizer) adalah platform untuk mengevaluasi, menganalisis, dan mengoptimalkan performa aplikasi cloud-native. Platform ini mengotomatiskan evaluasi performa pelatihan kluster Lingjun dan memberikan rekomendasi optimasi.
CNP Platform Entry
-
Masuk ke Lingjun console.
-
Pada bilah navigasi kiri, klik Performance Evaluation > CNP Performance Evaluation Platform.
-
Di platform CNP, Anda dapat memulai evaluasi kinerja atau melihat hasil evaluasi.
-
Di pojok kiri bawah halaman, klik Back untuk kembali dengan cepat ke Lingjun console.


Start Evaluation
Step 1: Select a Cluster
Pada halaman selamat datang atau halaman Performance Evaluation, klik Start Evaluation untuk masuk ke langkah pertama: Select a cluster.

-
Cluster name: Pilih kluster yang akan dievaluasi dari daftar kluster yang tersedia.
-
Authorize DLC access info: Setelah mengisi bidang-bidang tersebut, klik Test Connectivity. Jika koneksi berhasil, pesan sukses akan dikembalikan; jika tidak, alasan kegagalannya akan ditampilkan. Alasan kegagalan umum:
Failure reason enumeration
Suggested operation
Connection timeout
Tambahkan IP saat ini ke daftar putih akses CNP dan coba lagi
Incorrect info
Setidaknya salah satu dari AccessID, AccessKey, workspace, atau Endpoint salah. Periksa informasi tersebut dan coba lagi.
Failed to obtain STS token (D3001)
Failed to create SLR (D3002)
Failed to create Arms instance (D3003)
Failed to check Arms service (D3004)
Aktifkan layanan ARMS
Failed to retrieve ARMS info (D3005)
No permission to create SLR (D3006)
Authorize SLR
Setelah pengujian konektivitas berhasil, klik Next untuk melanjutkan ke Step 2: Select a test solution.
Step 2: Select a test solution
Use Template
Sistem menyediakan dua templat solusi uji default. Pilih salah satu berdasarkan skenario bisnis Anda.

|
Solution |
Test content |
Scale of the cluster to be tested |
|
Solution A: General solution for LLM-based scenarios |
|
|
|
Solution B: General solution for image recognition scenarios |
|
|
Custom solution
Jika templat yang disediakan tidak memenuhi kebutuhan Anda, buat solusi uji kustom.
-
Single GPU test: Jumlah node dapat dikustomisasi. Kasus uji default adalah MatMul.
-
Single machine test: Jumlah node dapat dikustomisasi. Kasus uji default adalah Bert-base.
-
AI model test: Model dan jumlah GPU dalam kluster evaluasi dapat dikustomisasi.
-
Model yang didukung saat ini meliputi: LLaMA-7B, Stable-Diffusion, Swin-Transformer, Bert-base, dan UNet.
-
Pengaturan parameter default menggunakan konfigurasi garis dasar. Lihat konfigurasi spesifik di halaman tersebut.

Estimated Evaluation Time
Setelah Anda memilih solusi uji, perkiraan waktu evaluasi dihitung berdasarkan konten uji dalam solusi tersebut. Catatan: Perkiraan ini mengasumsikan skala maksimum kluster yang Anda pilih pada langkah satu. Jika kluster aktif Anda belum mencapai skala maksimumnya, waktu evaluasi aktual akan lebih lama.
One-Click Start Evaluation
Setelah menyelesaikan langkah satu dan dua, klik One-Click Start Evaluation untuk memulai evaluasi.
View Evaluation Progress and Results
Setelah rencana uji dibuat, Anda dapat melihat status eksekusi dan progresnya secara real time di halaman daftar rencana evaluasi. Temukan rencana uji tersebut dan klik Details di kolom Actions untuk melihat progres evaluasi setiap langkah.

Single GPU Test
-
Test passed
Jika tidak ada GPU yang dicurigai rusak atau GPU peringatan terdeteksi di antara GPU yang diuji, uji single GPU dinyatakan lolos.
Catatan-
Suspected faulty GPU: Pekerjaan yang menguji GPU gagal, dan GPU tersebut mungkin rusak.
-
Warning GPU: TFLOPS GPU melebihi rentang ambang batas normal lebih dari 5% iterasi.
-
Logika perhitungan rentang ambang batas normal: Ambil median TFLOPS semua GPU pada setiap iterasi sebagai garis dasar, lalu bandingkan 103% dan 97% dari garis dasar tersebut dengan 4×sigma (4× deviasi standar). Nilai yang lebih besar digunakan sebagai batas atas dan bawah rentang ambang batas normal.

-
-
Test Results Abnormal
Jika setidaknya satu GPU yang dicurigai rusak atau GPU peringatan terdeteksi di antara GPU yang diuji, hasil uji single GPU dinyatakan abnormal.
Di daftar pekerjaan evaluasi, klik ikon plus (+) untuk melihat detail GPU yang dicurigai rusak atau GPU peringatan. Laporkan node abnormal ke tim O&M untuk troubleshooting. Klik Evaluation Details untuk melihat hasil evaluasi pekerjaan ini.

Single machine test progress
-
Test passed
Jika tidak ada node yang dicurigai rusak atau node peringatan terdeteksi di antara node tepi yang diuji, uji single machine dinyatakan lolos.
Catatan-
Suspected faulty node: Pekerjaan DLC pada node gagal, dan node tersebut mungkin rusak.
-
Warning node: Throughput node melebihi rentang ambang batas normal lebih dari 5% iterasi.
-
Logika perhitungan rentang ambang batas normal: Ambil median throughput semua node pada setiap iterasi sebagai garis dasar, lalu bandingkan 103% dan 97% dari garis dasar tersebut dengan 4× sigma (4× deviasi standar). Nilai yang lebih besar digunakan sebagai ambang batas maksimum dan minimum rentang ambang batas normal.

-
-
Abnormal test results
Jika setidaknya satu node tepi yang dicurigai rusak atau node tepi peringatan terdeteksi di antara node tepi yang diuji, hasil uji single machine dinyatakan abnormal.
Di daftar pekerjaan evaluasi, klik plus (+) icon untuk melihat detail node yang dicurigai rusak atau node peringatan, dan laporkan node abnormal ke tim O&M untuk troubleshooting. Klik Evaluation Details untuk melihat hasil evaluasi pekerjaan tersebut.

AI model test
-
Test Progress
Pending: Semua pekerjaan berada dalam status pending.
Completed: Semua pekerjaan telah berhasil, gagal, atau dihentikan.
Stopped: Semua pekerjaan dihentikan.
Running: Sebagian pekerjaan telah selesai, dan sebagian lainnya masih pending atau running.

-
Test job list
Lihat semua pekerjaan yang termasuk dalam langkah AI model dari Rencana Uji saat ini. Untuk menghentikan pekerjaan yang sedang berjalan, klik Stop. Semua pekerjaan dapat dihapus.
PeringatanPekerjaan yang dihapus dan pekerjaan yang gagal tidak termasuk dalam dashboard performa. Lakukan dengan hati-hati.
View test result performance dashboard
Operation Entry
Anda dapat melihat dashboard performa untuk rencana uji dengan status Completed. Dashboard ini mencakup pekerjaan evaluasi yang berhasil dijalankan pada fase uji AI model dari rencana uji saat ini.

Dashboard Content
Scalability of Test Model

Menunjukkan bagaimana throughput berubah seiring peningkatan jumlah GPU untuk setiap model yang dievaluasi dalam rencana uji saat ini, mencerminkan skalabilitas model pada kluster. Hasil tidak dibandingkan lintas model yang berbeda.
Formula: Skor Skalabilitas = log₂(throughput model / throughput spesifikasi evaluasi minimum)
Contoh: Contoh ini menggunakan model GPT3-175B (data MOCK, hanya untuk ilustrasi).
|
GPUs |
Throughput |
Scalability Score |
Theoretical Scalability Score |
|
64 |
10 |
||
|
128 |
18 |
log₂(18 / 10) |
log₂ 2 |
|
256 |
35 |
log₂(35 / 10) |
log₂ 4 |
|
512 |
69 |
log₂(69 / 10) |
log₂ 8 |
|
1024 |
137 |
log₂(137 / 10) |
log₂ 16 |
Catatan: Semakin dekat Skor Skalabilitas dengan nilai Skor Skalabilitas teoretis, semakin baik skalabilitas performanya.
Evaluation Result Details
Menampilkan throughput, MFU, dan latensi iterasi untuk setiap model pada jumlah GPU yang dievaluasi dalam rencana uji saat ini. Sumbu Y merepresentasikan jumlah GPU, dan sumbu X merepresentasikan nilai metrik.
