All Products
Search
Document Center

Intelligent Computing LINGJUN:Gunakan Evaluasi Performa CNP

Last Updated:Aug 21, 2026

CNP (Cloud Native Application Performance Optimizer) adalah platform untuk mengevaluasi, menganalisis, dan mengoptimalkan performa aplikasi cloud-native. Platform ini mengotomatiskan evaluasi performa pelatihan kluster Lingjun dan memberikan rekomendasi optimasi.

CNP Platform Entry

  1. Masuk ke Lingjun console.

  2. Pada bilah navigasi kiri, klik Performance Evaluation > CNP Performance Evaluation Platform.

  3. Di platform CNP, Anda dapat memulai evaluasi kinerja atau melihat hasil evaluasi.

  4. Di pojok kiri bawah halaman, klik Back untuk kembali dengan cepat ke Lingjun console.

image.png

image.png

Start Evaluation

Step 1: Select a Cluster

Pada halaman selamat datang atau halaman Performance Evaluation, klik Start Evaluation untuk masuk ke langkah pertama: Select a cluster.

image.png

  • Cluster name: Pilih kluster yang akan dievaluasi dari daftar kluster yang tersedia.

  • Authorize DLC access info: Setelah mengisi bidang-bidang tersebut, klik Test Connectivity. Jika koneksi berhasil, pesan sukses akan dikembalikan; jika tidak, alasan kegagalannya akan ditampilkan. Alasan kegagalan umum:

    Failure reason enumeration

    Suggested operation

    Connection timeout

    Tambahkan IP saat ini ke daftar putih akses CNP dan coba lagi

    Incorrect info

    Setidaknya salah satu dari AccessID, AccessKey, workspace, atau Endpoint salah. Periksa informasi tersebut dan coba lagi.

    Failed to obtain STS token (D3001)

    Failed to create SLR (D3002)

    Failed to create Arms instance (D3003)

    Failed to check Arms service (D3004)

    Aktifkan layanan ARMS

    Failed to retrieve ARMS info (D3005)

    No permission to create SLR (D3006)

    Authorize SLR

Setelah pengujian konektivitas berhasil, klik Next untuk melanjutkan ke Step 2: Select a test solution.

Step 2: Select a test solution

Use Template

Sistem menyediakan dua templat solusi uji default. Pilih salah satu berdasarkan skenario bisnis Anda.

image.png

Solution

Test content

Scale of the cluster to be tested

Solution A: General solution for LLM-based scenarios

  • Single GPU test: MatMul (matrix operator)

  • Single machine test: Bert-base

  • AI model test: LLaMA-7B

  • Single GPU test: Secara default, menggunakan skala maksimum kluster Anda.

  • Single machine test: Secara default, menggunakan skala maksimum kluster Anda.

  • AI model test: Secara default, pekerjaan evaluasi dibuat untuk 8 GPU, 16 GPU, 32 GPU, 64 GPU, 128 GPU, 256 GPU, dan 512 GPU, dibatasi oleh skala maksimum kluster Anda. Misalnya, jika skala maksimum kluster Anda adalah 100 GPU, pekerjaan evaluasi hanya dibuat untuk 8 GPU, 16 GPU, 32 GPU, dan 64 GPU.

Solution B: General solution for image recognition scenarios

  • Single GPU test: MatMul (matrix operator)

  • Single machine test: Bert-base

  • AI model test: Swin-Transformer dan Stable Diffusion

  • Single GPU test: Secara default, menggunakan skala maksimum kluster Anda.

  • Single machine test: Secara default, menggunakan skala maksimum kluster Anda.

  • AI model test: Secara default, pekerjaan evaluasi dibuat untuk 8 GPU, 16 GPU, 32 GPU, dan 64 GPU, dibatasi oleh skala maksimum kluster Anda. Misalnya, jika skala maksimum kluster Anda adalah 16 GPU, pekerjaan evaluasi hanya dibuat untuk 8 GPU dan 16 GPU.

Custom solution

Jika templat yang disediakan tidak memenuhi kebutuhan Anda, buat solusi uji kustom.

  1. Single GPU test: Jumlah node dapat dikustomisasi. Kasus uji default adalah MatMul.

  2. Single machine test: Jumlah node dapat dikustomisasi. Kasus uji default adalah Bert-base.

  3. AI model test: Model dan jumlah GPU dalam kluster evaluasi dapat dikustomisasi.

Catatan
  • Model yang didukung saat ini meliputi: LLaMA-7B, Stable-Diffusion, Swin-Transformer, Bert-base, dan UNet.

  • Pengaturan parameter default menggunakan konfigurasi garis dasar. Lihat konfigurasi spesifik di halaman tersebut.

image.png

Estimated Evaluation Time

Setelah Anda memilih solusi uji, perkiraan waktu evaluasi dihitung berdasarkan konten uji dalam solusi tersebut. Catatan: Perkiraan ini mengasumsikan skala maksimum kluster yang Anda pilih pada langkah satu. Jika kluster aktif Anda belum mencapai skala maksimumnya, waktu evaluasi aktual akan lebih lama.

One-Click Start Evaluation

Setelah menyelesaikan langkah satu dan dua, klik One-Click Start Evaluation untuk memulai evaluasi.

View Evaluation Progress and Results

Setelah rencana uji dibuat, Anda dapat melihat status eksekusi dan progresnya secara real time di halaman daftar rencana evaluasi. Temukan rencana uji tersebut dan klik Details di kolom Actions untuk melihat progres evaluasi setiap langkah.

image.png

Single GPU Test

  • Test passed

    Jika tidak ada GPU yang dicurigai rusak atau GPU peringatan terdeteksi di antara GPU yang diuji, uji single GPU dinyatakan lolos.

    Catatan
    • Suspected faulty GPU: Pekerjaan yang menguji GPU gagal, dan GPU tersebut mungkin rusak.

    • Warning GPU: TFLOPS GPU melebihi rentang ambang batas normal lebih dari 5% iterasi.

    • Logika perhitungan rentang ambang batas normal: Ambil median TFLOPS semua GPU pada setiap iterasi sebagai garis dasar, lalu bandingkan 103% dan 97% dari garis dasar tersebut dengan 4×sigma (4× deviasi standar). Nilai yang lebih besar digunakan sebagai batas atas dan bawah rentang ambang batas normal.

    image.png

  • Test Results Abnormal

    Jika setidaknya satu GPU yang dicurigai rusak atau GPU peringatan terdeteksi di antara GPU yang diuji, hasil uji single GPU dinyatakan abnormal.

    Di daftar pekerjaan evaluasi, klik ikon plus (+) untuk melihat detail GPU yang dicurigai rusak atau GPU peringatan. Laporkan node abnormal ke tim O&M untuk troubleshooting. Klik Evaluation Details untuk melihat hasil evaluasi pekerjaan ini.

    image.png

Single machine test progress

  • Test passed

    Jika tidak ada node yang dicurigai rusak atau node peringatan terdeteksi di antara node tepi yang diuji, uji single machine dinyatakan lolos.

    Catatan
    • Suspected faulty node: Pekerjaan DLC pada node gagal, dan node tersebut mungkin rusak.

    • Warning node: Throughput node melebihi rentang ambang batas normal lebih dari 5% iterasi.

    • Logika perhitungan rentang ambang batas normal: Ambil median throughput semua node pada setiap iterasi sebagai garis dasar, lalu bandingkan 103% dan 97% dari garis dasar tersebut dengan 4× sigma (4× deviasi standar). Nilai yang lebih besar digunakan sebagai ambang batas maksimum dan minimum rentang ambang batas normal.

    image.png

  • Abnormal test results

    Jika setidaknya satu node tepi yang dicurigai rusak atau node tepi peringatan terdeteksi di antara node tepi yang diuji, hasil uji single machine dinyatakan abnormal.

    Di daftar pekerjaan evaluasi, klik plus (+) icon untuk melihat detail node yang dicurigai rusak atau node peringatan, dan laporkan node abnormal ke tim O&M untuk troubleshooting. Klik Evaluation Details untuk melihat hasil evaluasi pekerjaan tersebut.

    image.png

AI model test

  • Test Progress

    Pending: Semua pekerjaan berada dalam status pending.

    Completed: Semua pekerjaan telah berhasil, gagal, atau dihentikan.

    Stopped: Semua pekerjaan dihentikan.

    Running: Sebagian pekerjaan telah selesai, dan sebagian lainnya masih pending atau running.

    image.png

  • Test job list

    Lihat semua pekerjaan yang termasuk dalam langkah AI model dari Rencana Uji saat ini. Untuk menghentikan pekerjaan yang sedang berjalan, klik Stop. Semua pekerjaan dapat dihapus.

    Peringatan

    Pekerjaan yang dihapus dan pekerjaan yang gagal tidak termasuk dalam dashboard performa. Lakukan dengan hati-hati.

View test result performance dashboard

Operation Entry

Anda dapat melihat dashboard performa untuk rencana uji dengan status Completed. Dashboard ini mencakup pekerjaan evaluasi yang berhasil dijalankan pada fase uji AI model dari rencana uji saat ini.

image.png

Dashboard Content

Scalability of Test Model

image.png

Menunjukkan bagaimana throughput berubah seiring peningkatan jumlah GPU untuk setiap model yang dievaluasi dalam rencana uji saat ini, mencerminkan skalabilitas model pada kluster. Hasil tidak dibandingkan lintas model yang berbeda.

Formula: Skor Skalabilitas = log₂(throughput model / throughput spesifikasi evaluasi minimum)

Catatan

Contoh: Contoh ini menggunakan model GPT3-175B (data MOCK, hanya untuk ilustrasi).

GPUs

Throughput

Scalability Score

Theoretical Scalability Score

64

10

128

18

log₂(18 / 10)

log₂ 2

256

35

log₂(35 / 10)

log₂ 4

512

69

log₂(69 / 10)

log₂ 8

1024

137

log₂(137 / 10)

log₂ 16

Catatan: Semakin dekat Skor Skalabilitas dengan nilai Skor Skalabilitas teoretis, semakin baik skalabilitas performanya.

Evaluation Result Details

Menampilkan throughput, MFU, dan latensi iterasi untuk setiap model pada jumlah GPU yang dievaluasi dalam rencana uji saat ini. Sumbu Y merepresentasikan jumlah GPU, dan sumbu X merepresentasikan nilai metrik.

image.png