Dasbor pemantauan EAS adalah panel terpadu untuk melacak kinerja real-time semua layanan EAS yang telah dideploy di suatu wilayah—tanpa perlu memeriksa setiap layanan satu per satu.
Data dasbor terbatas pada wilayah tertentu dan menggabungkan metrik dari semua layanan di seluruh ruang kerja dalam wilayah tersebut di bawah Akun Alibaba Cloud Anda. Mengganti ruang kerja hanya mengubah konteks konsol dan tidak memengaruhi cakupan data dasbor.
Kasus penggunaan
-
Ikhtisar layanan secara keseluruhan: Evaluasi kesehatan semua layanan EAS di wilayah saat ini secara sekilas.
-
Pemantauan kinerja: Lacak metrik agregat utama secara real-time—QPS, waktu respons, dan jumlah replika.
-
Manajemen sumber daya: Pantau penggunaan CPU, memori, dan GPU untuk mendukung keputusan skala keluar (scale-out) dan skala-masuk (scale-in).
-
Pemecahan masalah: Identifikasi anomali kinerja dan masalah layanan berdasarkan data pemantauan agregat.
-
Perencanaan kapasitas: Gunakan data pemantauan historis untuk merencanakan kapasitas di masa depan.
Lihat dasbor
-
Masuk ke Konsol PAI. Pilih wilayah di bagian atas halaman, lalu pilih ruang kerja yang diinginkan dan klik Elastic Algorithm Service (EAS).
-
Beralih ke tab Monitoring. Dasbor mendukung interaksi berikut:
-
Pemilihan rentang waktu: Pilih rentang prasetel seperti 5 menit atau 15 menit terakhir. Nilai default adalah 6 jam terakhir.
-
Refresh manual: Klik tombol refresh untuk mendapatkan data terbaru, atau atur frekuensi penyegaran otomatis.
-
Filter dimensi: Filter data berdasarkan dimensi—misalnya, filter berdasarkan dimensi User untuk melihat data semua pengguna atau pengguna tertentu.
-
Interaksi grafik: Arahkan kursor ke grafik untuk memeriksa titik data, atau klik entri legenda untuk mengaktifkan/menonaktifkan tampilannya.
Klik tab Monitoring untuk membuka halaman pemantauan. Halaman ini menampilkan empat grafik pemantauan di bawah dimensi Service secara default: QPS (permintaan per detik), Avg RT (waktu respons rata-rata), Replicas (jumlah dan status replika, termasuk Total, Pending, dan Available), serta Replicas By Resource (replika yang berjalan berdasarkan kelompok sumber daya). Beralihlah ke sub-tab GPU untuk melihat metrik terkait GPU.
-
Metrik pemantauan
Dasbor layanan
Tabel berikut menjelaskan semua metrik pada dasbor Service. Perhitungan berlaku untuk semua instans layanan EAS di wilayah saat ini di bawah Akun Alibaba Cloud Anda. Sum adalah nilai total dari semua instans; Average adalah rata-rata.
QPS dan Avg RT merupakan indikator kinerja paling penting. Replicas mencerminkan aktivitas penskalaan kluster. Metrik CPU, memori, dan GPU mencerminkan konsumsi sumber daya. Traffic dan Daily Invoke mencerminkan volume trafik dan panggilan secara keseluruhan.
| Kategori | Metrik | Deskripsi | Perhitungan | Tujuan |
|---|---|---|---|---|
| Kinerja permintaan | QPS | Permintaan per detik. | Sum | Evaluasi throughput kluster secara keseluruhan; identifikasi puncak trafik dan badai kesalahan jika dikombinasikan dengan data laju error. |
| Avg RT | Waktu respons rata-rata — rata-rata waktu dari pengiriman permintaan hingga menerima tanggapan. | Average | Evaluasi kecepatan respons kluster secara keseluruhan; identifikasi bottleneck kinerja global. | |
| Skala instans | Replicas | Jumlah instans. Mencakup tiga sub-metrik: TotalReplicas (total), PendingReplicas (standby), dan Available Replicas (aktif). | Sum | Pahami skala kluster secara real-time; pantau apakah perilaku auto scaling sesuai ekspektasi. |
| Replicas By Resource | Jumlah instans yang dipecah berdasarkan tipe sumber daya. | Sum | Pahami distribusi sumber daya di berbagai tipe instans. | |
| CPU | CPU Total | Total CPU yang tersedia untuk layanan. | Sum | Evaluasi kapasitas CPU reservasi total. |
| CPU Utilization | Persentase pemanfaatan CPU. | Average | Evaluasi efisiensi CPU kluster secara keseluruhan untuk perencanaan kapasitas dan optimalisasi biaya. | |
| CPU Usage | Penggunaan CPU. | Average | Perkirakan biaya sumber daya CPU yang dikonsumsi. | |
| Memori | Memory | Penggunaan memori. Mencakup RSS (jumlah memori resident) dan Cache (jumlah page cache). | Average | Pantau penggunaan memori sistem untuk menentukan tekanan sumber daya dan menemukan bottleneck kinerja. |
| Memory Utilization | Persentase pemanfaatan memori. | Average | Evaluasi efisiensi sumber daya memori secara keseluruhan. | |
| GPU | GPU Total | Total GPU yang sedang digunakan. | Sum | Evaluasi skala sumber daya GPU. |
| GPU Utilization | Persentase pemanfaatan GPU. | Average | Evaluasi efisiensi sumber daya GPU. | |
| GPU Memory | Penggunaan memori GPU aktual. | Average | Evaluasi konsumsi memori GPU. | |
| Trafik dan panggilan | Traffic | Jumlah trafik jaringan inbound (In) dan outbound (Out) untuk semua layanan. | Sum | Mencerminkan status komunikasi jaringan lintas layanan. |
| Daily Invoke | Jumlah panggilan harian, dikategorikan berdasarkan kode status HTTP. | Sum | Amati kesehatan bisnis jangka panjang dan tren laju error. |
Dasbor GPU
Dasbor GPU menyediakan pemantauan detail untuk layanan berbasis GPU guna membantu mengoptimalkan pemanfaatan sumber daya GPU.
Dasbor GPU sangat berguna untuk mengidentifikasi inefisiensi biaya. Fokuslah pada metrik pemanfaatan rendah untuk menemukan layanan dengan konfigurasi sumber daya yang boros.
| Kategori | Metrik | Deskripsi | Tujuan |
|---|---|---|---|
| Ikhtisar | Total GPU usage | Total GPU yang digunakan oleh semua layanan di wilayah saat ini. | Menunjukkan skala GPU secara keseluruhan untuk perencanaan kapasitas. |
| Average GPU utilization | Persentase rata-rata pemanfaatan GPU di semua layanan yang menggunakan GPU. | Mengukur efisiensi GPU secara keseluruhan; mengidentifikasi risiko pemborosan sumber daya. | |
| Number of services using GPUs | Jumlah total layanan yang saat ini menggunakan sumber daya GPU. | Pahami distribusi layanan GPU dan cakupan penggunaan sumber daya. | |
| Pemanfaatan berdasarkan layanan | Number of services with average GPU utilization below 10% | Layanan dengan pemanfaatan GPU rata-rata di bawah 10%. | Mengidentifikasi pemborosan sumber daya parah; prioritaskan layanan ini untuk dioptimalkan atau dilepas. |
| Number of services with average GPU utilization below 30% | Layanan dengan pemanfaatan GPU rata-rata di bawah 30%. | Mengidentifikasi layanan dengan pemanfaatan rendah; pertimbangkan penyesuaian konfigurasi sumber dayanya. | |
| Number of services with average GPU utilization above 50% | Layanan dengan pemanfaatan GPU rata-rata di atas 50%. | Mengonfirmasi pemanfaatan GPU yang efektif; gunakan untuk memverifikasi hasil optimalisasi. | |
| Distribusi pemanfaatan GPU | Number of GPUs with average utilization below 10% | Kartu GPU dengan pemanfaatan rata-rata di bawah 10%. | Mengidentifikasi GPU idle yang dapat dilepas untuk mengurangi biaya. |
| Number of GPUs with average utilization below 30% | Kartu GPU dengan pemanfaatan rata-rata di bawah 30%. | Mengidentifikasi GPU dengan pemanfaatan rendah; sesuaikan konfigurasi sumber dayanya. | |
| Number of GPUs with average utilization above 50% | Kartu GPU dengan pemanfaatan rata-rata di atas 50%. | Mengonfirmasi GPU yang sepenuhnya dimanfaatkan; evaluasi apakah perlu melakukan skala keluar. | |
| Distribusi sumber daya | Number of GPUs in dedicated resource groups (including Lingjun) | GPU di kelompok sumber daya khusus, termasuk Lingjun. | Memantau perubahan sumber daya khusus untuk perencanaan kapasitas. |
| Number of GPUs in public resource groups | GPU di kelompok sumber daya publik. | Memantau penggunaan sumber daya publik untuk mengoptimalkan kebijakan alokasi. | |
| Number of GPUs in spot instances (including Lingjun) | GPU di spot instans, termasuk Lingjun. | Memantau sumber daya GPU berbiaya rendah untuk membantu menyeimbangkan biaya dan stabilitas. | |
| Pemanfaatan detail | Detailed GPU utilization per service | Pemanfaatan GPU per layanan. Menampilkan "No data" jika tidak ada data yang tersedia. | Memungkinkan analisis mendalam penggunaan GPU per layanan untuk menemukan masalah kinerja. |
Catatan penggunaan
-
Data dasbor diagregasi dari semua layanan di wilayah tersebut dan mungkin mengalami keterlambatan.
-
Untuk pemantauan detail pada layanan tertentu, buka halaman pemantauan layanan tersebut.
FAQ
Mengapa pemanfaatan CPU pada dasbor rendah, tetapi layanan saya gagal melakukan skala keluar atau melaporkan sumber daya tidak mencukupi?
Dasbor menampilkan pemanfaatan CPU rata-rata di semua layanan. Layanan yang idle menurunkan rata-rata ini, meskipun sumber daya fisik kluster telah habis.
Periksa metrik Pending_Replicas. Jika nilainya terus-menerus di atas 0, kolam sumber daya kluster penuh dan tidak dapat menjadwalkan instans baru. Lakukan skala keluar pada kluster atau optimalkan konfigurasi sumber daya layanan yang ada.
Bagaimana cara melihat pemantauan detail untuk layanan tertentu?
Buka tab Inference Service, pilih layanan target, lalu buka halaman detailnya. Beralihlah ke tab Monitoring untuk melihat grafik detail. Untuk deskripsi metrik, lihat Ikhtisar pemantauan layanan.