All Products
Search
Document Center

Platform For AI:Pantau layanan inferensi EAS dengan Prometheus

Last Updated:Aug 25, 2026

Impor metrik layanan inferensi PAI-EAS dan kelompok sumber daya ke Managed Service for Prometheus melalui Pusat Integrasi CloudMonitor 2.0. Kueri metrik menggunakan PromQL dan hubungkan ke sistem pemantauan eksternal seperti Grafana.

Penagihan

Mengaktifkan PAI-EAS Inference Service Metrics dan PAI-EAS Resource Group Metrics di Pusat Integrasi CloudMonitor 2.0 akan dikenakan biaya berikut:

Langkah 1: Aktifkan metrik pemantauan EAS

  1. Login ke Konsol CloudMonitor 2.0, pilih ruang kerja target, lalu klik Integration Center di panel navigasi sebelah kiri.

  2. Pada halaman Integration Center, cari "PAI-EAS" di kotak pencarian dan klik kartu hasilnya.

  3. Pilih PAI-EAS Inference Service Metrics dan PAI-EAS Resource Group Metrics sebagai sumber data.

    Penting

    Metrik pemantauan lanjutan mencakup metrik framework inferensi (vLLM atau SGLang), metrik komputasi GPU, metrik gerbang PAI-EAS, statistik tingkat layanan dan tingkat penyewa, serta metrik kustom aplikasi inferensi (dengan awalan custom_). Untuk detailnya, lihat Metrik layanan dan kelompok sumber daya EAS. Wilayah yang didukung meliputi Beijing, Shanghai, Hangzhou, Ulanqab, Singapura, dan Heyuan. Untuk mengaktifkan wilayah tambahan, kirim tiket.

    Aktifkan metrik pemantauan lanjutan untuk membuat Dasbor Grafana atau mengonfigurasi peringatan kustom.

  4. Integrasi berjalan secara otomatis di latar belakang dan memerlukan waktu sekitar 1–2 menit. Klik Integration Management untuk melihat status integrasi dan memastikan integrasi telah selesai.

Langkah 2: Dapatkan informasi sumber data Prometheus

CloudMonitor 2.0 membuat instans Prometheus untuk menyimpan metrik pemantauan EAS. Lokasi penyimpanan default adalah RegionShare:{{workspaceName}}:{{regionId}}, di mana {{workspaceName}} adalah nama ruang kerja dan {{regionId}} adalah ID wilayah.

Untuk mengambil data pemantauan melalui API Prometheus, dapatkan wilayah dan URL akses instans Prometheus ini.

  1. Beralih ke tab Integration Management. Di daftar konfigurasi integrasi, klik ikon perluas di samping integrasi yang ingin Anda lihat.

  2. Pada item yang diperluas, temukan PAI-EAS Inference Service Metrics atau PAI-EAS Resource Group Metrics untuk melihat komponen integrasi, status, dan wilayah.

  3. Pada kolom Actions, klik Data Source untuk melihat wilayah dan URL akses layanan Prometheus.

Langkah 3: Kueri dan eksplorasi metrik

Eksplorasi metrik pemantauan EAS melalui Metrics Explorer atau kueri PromQL di layanan Prometheus.

  1. Pada halaman Data Source dari Langkah 2, klik ID instans untuk membuka halaman detail Prometheus Service.

  2. Pada tab Metrics Explorer, lihat detail metrik untuk layanan EAS.

    Metode

    Deskripsi

    Filter metrik untuk melihat detail

    1. Pada tab Metrics Explorer, klik Metric Explorer di pembuat kueri.

    2. Masukkan kata kunci metrik seperti AliyunLearn di kotak pencarian, lalu pilih metrik target dari daftar drop-down, seperti penggunaan core CPU, pemanfaatan CPU, atau pemanfaatan memori GPU.

    3. Pada kolom Actions, klik ikon eksplorasi untuk mengatur kondisi filter, lalu klik ikon tambah untuk menambahkan metrik ke kotak kueri.

    4. Klik Run Query untuk melihat grafik tren metrik.

    Kueri metrik dengan ekspresi PromQL.

    Contohnya, untuk mengkueri total QPS di semua layanan:

    1. Masukkan sum(AliyunLearn_eas_qps_total). (Untuk sintaks PromQL, lihat Sintaks kueri dan analisis data metrik)

    2. Klik Run Query untuk melihat tren total QPS di semua layanan EAS pada wilayah saat ini.

Langkah 4: Gunakan dasbor Grafana

Lihat dasbor Grafana default

CloudMonitor 2.0 menyediakan dasbor Grafana default:

  1. Di panel navigasi sebelah kiri halaman detail layanan Prometheus, klik Dashboard List.

  2. Klik nama dasbor untuk melihat dasbor Grafana bawaan.

Catatan

Anda juga dapat beralih ke tab Dashboard dari kebijakan integrasi di Provisioning.

Tambahkan panel

Tambahkan panel QPS global ke dasbor Grafana default. Untuk informasi lebih lanjut tentang Grafana, lihat Managed Service for Grafana.

  1. Pada halaman detail dasbor, klik tombol Add panel di pojok kanan atas image, lalu klik Add a new panel pada dialog yang muncul.

  2. Di sisi kanan halaman Edit Panel, ubah jenis grafik menjadi Stat.

  3. Di pojok kiri bawah halaman, ubah Data source menjadi ${datasource}.

  4. Di area Query, alihkan ke code di sisi kanan. Di kotak teks Metrics browser, masukkan kueri PromQL sum(AliyunLearn_eas_eas_qps_total) lalu klik Run queries.

  5. Atur ambang batas untuk mengonfigurasi warna tampilan berbeda untuk rentang nilai yang berbeda. Setelah pratinjau grafik muncul, klik Apply untuk menyimpan pengaturan.

Langkah 5: Konfigurasi aturan peringatan

Pada halaman detail instans Prometheus, Anda dapat melihat aturan peringatan bawaan. Semua aturan peringatan bawaan berlevel P2 dan awalnya dalam status Stopped.

  1. Di panel navigasi sebelah kiri halaman detail layanan Prometheus, klik Alert Rules.

  2. Pada halaman Alert Rules, lihat aturan peringatan yang telah ditentukan. Untuk mengaktifkan aturan, ubah statusnya menjadi Enabled atau Disabled. Untuk mengubah konfigurasi notifikasi, klik Edit.

Jika templat default tidak memenuhi kebutuhan Anda, klik Create Alert Rule untuk membuat aturan peringatan kustom. Untuk deskripsi parameter, lihat Aturan peringatan.

Lampiran: Metrik pemantauan EAS lanjutan

Catatan

Metrik berikut hanya tersedia jika metrik pemantauan lanjutan diaktifkan pada Langkah 1.

Metrik instans layanan

Metrik

Deskripsi

Tag metrik (dimensi)

Kategori

Tipe

Unit

Periode pengumpulan (dtk)

instance_cpu_count

Jumlah CPU untuk instans layanan

instance,resource_type

CPU

Gauge

count

60

instance_gpu_count

Jumlah GPU untuk instans layanan

instance,resource_type

GPU

Gauge

count

60

instance_cpu_usage

Penggunaan CPU instans layanan

instance

CPU

Gauge

core

60

instance_user_cpu_usage

Penggunaan CPU proses pengguna instans layanan

instance

CPU

Gauge

core

60

instance_system_cpu_usage

Penggunaan CPU proses sistem instans layanan

instance

CPU

Gauge

core

60

instance_cpu_util

Pemanfaatan CPU instans layanan

instance

CPU

Gauge

%

60

instance_memory_rss_usage

Penggunaan memori instans layanan

instance

Memory

Gauge

byte

60

instance_memory_cache_usage

Penggunaan cache memori instans layanan

instance

Memory

Gauge

byte

60

instance_memory_total

Total memori instans layanan

instance

Memory

Gauge

byte

60

instance_memory_util

Pemanfaatan memori instans layanan

instance

Memory

Gauge

%

60

instance_response

Jumlah permintaan ke instans layanan

instance

Request

Counter

count

60

instance_gpu_util

Pemanfaatan GPU instans layanan

instance

GPU

Gauge

%

60

instance_gpu_memory_usage

Penggunaan memori GPU instans layanan

instance

GPU

Gauge

MiB

60

instance_gpu_memory_total

Total memori GPU instans layanan

instance

GPU

Gauge

MiB

60

instance_gpu_memory_util

Pemanfaatan memori GPU instans layanan

instance

GPU

Gauge

MiB

60

instance_gpu_memory_bandwidth_limit

Batas bandwidth memori GPU instans layanan

instance

GPU

Gauge

bytes/second

60

instance_gpu_temperature

Suhu GPU instans layanan

instance

GPU

Gauge

°C

60

instance_gpu_slow_temperature

Suhu throttling GPU instans layanan

instance

GPU

Gauge

°C

60

instance_gpu_shut_temperature

Suhu shutdown GPU instans layanan

instance

GPU

Gauge

°C

60

instance_gpu_nvswitch_error

Jumlah error fatal NVSwitch untuk instans layanan

instance

GPU

Gauge

count

60s

instance_gpu_nvswitch_non_fatal_error

Jumlah error non-fatal NVSwitch untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_ecc_total_vol_sbe

Total error ECC volatile single-bit untuk instans layanan

instance

GPU

Counter

count

60

instance_gpu_ecc_total_vol_dbe

Total error ECC volatile double-bit untuk instans layanan

instance

GPU

Counter

count

60

instance_gpu_ecc_total_agg_sbe

Total error ECC agregat (persisten) single-bit untuk instans layanan

instance

GPU

Counter

count

60

instance_gpu_ecc_total_agg_dbe

Total error ECC agregat (persisten) double-bit untuk instans layanan

instance

GPU

Counter

count

60

instance_gpu_remap_fail

Jumlah kegagalan remapping baris untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_remap_pending

Jumlah remapping baris tertunda untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_pcie_replay_counter

Counter replay PCIe untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_pcie_transmit_measure_by_dcgm

Laju transmisi PCIe yang diukur oleh DCGM untuk instans layanan

instance

GPU

Gauge

bytes/second

60

instance_gpu_pcie_receive_measure_by_dcgm

Laju penerimaan PCIe yang diukur oleh DCGM untuk instans layanan

instance

GPU

Gauge

bytes/second

60

instance_gpu_graphics_engine_util

Pemanfaatan engine grafis instans layanan

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_sm_util

Pemanfaatan Streaming Multiprocessor (SM) instans layanan

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_dram_active

Rasio waktu antarmuka memori perangkat aktif mengirim atau menerima data untuk instans layanan

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_tensortflops_used

TFLOPS yang digunakan oleh pipeline Tensor untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_memory_bandwidth_used

Penggunaan bandwidth memori instans layanan

instance

GPU

Gauge

bytes/second

60

instance_gpu_sm_clock

Frekuensi clock SM instans layanan

instance

GPU

Gauge

MHz

60

instance_gpu_sm_occupancy

Rasio warp yang berada di SM untuk instans layanan

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_fp32tflops_used

TFLOPS yang digunakan oleh pipeline FP32 untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_fp16tflops_used

TFLOPS yang digunakan oleh pipeline FP16 untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_pipe_fp32_active

Rasio siklus aktif untuk pipeline FP32 instans layanan

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_pipe_fp16_active

Rasio siklus aktif untuk pipeline FP16 instans layanan

instance

GPU

Gauge

ratio (0~1)

60s

instance_gpu_pipe_tensor_active

Rasio siklus aktif untuk pipeline Tensor instans layanan

instance

GPU

Gauge

ratio (0~1)

60

instance_gpu_power_usage

Penggunaan daya GPU instans layanan

instance

GPU

Gauge

watts

60

instance_accelerator_power_usage

Penggunaan daya akselerator instans layanan

instance

GPU

Gauge

milliwatts

60

instance_gpu_mem_copy_util

Pemanfaatan copy memori instans layanan

instance

GPU

Gauge

%

60

instance_gpu_health_count

Total jumlah status kesehatan GPU untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_lost_card_num

Jumlah GPU yang hilang di VM untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_driver_hang

Jumlah hang driver GPU untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_profile_status

Status profiling Amperf untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_uncorrectable_ecc

Jumlah error ECC tidak terkoreksi untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_xid_cnt

Jumlah error Xid untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_fatal_xid_error

Jumlah error Xid fatal untuk instans layanan

instance

GPU

Gauge

count

60

instance_gpu_kernel_err_cnt

Jumlah error non-Xid dari log kernel untuk instans layanan

instance

GPU

Gauge

count

60

instance_qps

Permintaan per detik untuk instans layanan

instance

Request

Gauge

count

60

instance_traffic

Trafik instans layanan

instance

Request

Gauge

bps

60

instance_avg_latency

Waktu respons rata-rata permintaan instans layanan

instance

Request

Gauge

ms

60

instance_tpxx_latency

Waktu respons permintaan TOPXX instans layanan

instance

Request

Gauge

ms

60

instance_traffic_in

Trafik masuk instans layanan

instance

Request

Gauge

bps

60

instance_traffic_out

Trafik keluar instans layanan

instance

Request

Gauge

bps

60

instance_tcp_connections

Jumlah koneksi TCP untuk instans layanan

instance

Request

Gauge

count

60

Metrik layanan

Metrik

Deskripsi

Tag metrik (dimensi)

Kategori

Tipe

Unit

Periode pengumpulan (dtk)

service_replicas

Jumlah instans layanan

service

Meta

Gauge

count

60

service_pending_replicas

Jumlah instans layanan tertunda

service

Meta

Gauge

count

60

service_available_replicas

Jumlah instans layanan yang berjalan

service

Meta

Gauge

count

60

service_replicas_with_resource_type

Jumlah instans layanan (dengan tag tipe sumber daya)

service

Meta

Gauge

count

60

service_cpu_count

Total CPU yang dialokasikan ke layanan

service

CPU

Gauge

core

60

service_cpu_count_with_resource_type

Total CPU untuk layanan (dengan tag tipe sumber daya)

service

CPU

Gauge

core

60

service_gpu_count_with_resource_type

Total GPU untuk layanan (dengan tag tipe sumber daya)

service

GPU

Gauge

count

60

service_rps_status_2xx

Jumlah respons 2XX untuk layanan

service

Request

Gauge

count

60

service_rps_status_4xx

Jumlah respons 4XX untuk layanan

service

Request

Gauge

count

60

service_rps_status_5xx

Jumlah respons 5XX untuk layanan

service

Request

Gauge

count

60

service_rps_status_2xx_ratio

Rasio respons 2XX untuk layanan

service

Request

Gauge

%

60

service_rps_status_4xx_ratio

Rasio respons 4XX untuk layanan

service

Request

Gauge

%

60

service_rps_status_5xx_ratio

Rasio respons 5XX untuk layanan

service

Request

Gauge

%

60

service_qps

Permintaan per detik untuk layanan

service

Request

Gauge

count

60

service_avg_latency

Waktu respons rata-rata permintaan layanan

service

Request

Gauge

ms

60

service_tpxx_latency

Waktu respons permintaan TOPXX layanan

service

Request

Gauge

ms

60

service_tp100_latency

Waktu respons permintaan TOP100 layanan

service

Request

Gauge

ms

60

service_traffic_in

Trafik masuk layanan

service

Network

Gauge

bps

60

service_traffic_out

Trafik keluar layanan

service

Network

Gauge

60

service_cpu_usage

Penggunaan CPU layanan

service

CPU

Gauge

core

60

service_user_cpu_usage

Penggunaan CPU proses pengguna dari layanan

service

CPU

Gauge

core

60

service_system_cpu_usage

Penggunaan CPU proses sistem layanan

service

CPU

Gauge

core

60

service_cpu_util

Pemanfaatan CPU layanan

service

CPU

Gauge

%

60

service_memory_rss_usage

Penggunaan memori layanan

service

Memory

Gauge

byte

60

service_memory_cache_usage

Penggunaan cache memori layanan

service

Memory

Gauge

byte

60

service_memory_total

Total memori layanan

service

Memory

Gauge

byte

60

service_memory_util

Pemanfaatan memori layanan

service

Memory

Gauge

%

60

service_gpu_util

Pemanfaatan GPU layanan

service

GPU

Gauge

%

60

service_gpu_memory_usage

Penggunaan memori GPU layanan

service

GPU

Gauge

MiB

60

service_gpu_memory_total

Total memori GPU layanan

service

GPU

Gauge

MiB

60

service_gpu_memory_util

Pemanfaatan memori GPU layanan

service

GPU

Gauge

MiB

60

service_gpu_memory_bandwidth_limit

Batas bandwidth memori GPU layanan

service

GPU

Gauge

bytes/second

60

service_gpu_temperature

Suhu GPU layanan

service

GPU

Gauge

°C

60

service_gpu_slow_temperature

Suhu throttling GPU layanan

service

GPU

Gauge

°C

60

service_gpu_shut_temperature

Suhu shutdown GPU layanan

service

GPU

Gauge

°C

60

service_gpu_nvswitch_error

Jumlah error fatal NVSwitch untuk layanan

service

GPU

Gauge

count

60

service_gpu_nvswitch_non_fatal_error

Jumlah error non-fatal NVSwitch untuk layanan

service

GPU

Gauge

count

60

service_gpu_ecc_total_vol_sbe

Total error ECC volatile single-bit untuk layanan

service

GPU

Counter

count

60

service_gpu_ecc_total_vol_dbe

Total error ECC volatile double-bit untuk layanan

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_sbe

Total error ECC agregat (persisten) single-bit untuk layanan

service

GPU

Counter

count

60

service_gpu_ecc_total_agg_dbe

Total error ECC agregat (persisten) double-bit untuk layanan

service

GPU

Counter

count

60

service_gpu_remap_fail

Jumlah kegagalan remapping baris untuk layanan

service

GPU

Gauge

count

60

service_gpu_remap_pending

Jumlah remapping baris tertunda untuk layanan

service

GPU

Gauge

count

60

service_gpu_pcie_replay_counter

Counter replay PCIe untuk layanan

service

GPU

Gauge

count

60

service_gpu_pcie_transmit_measure_by_dcgm

Laju transmisi PCIe yang diukur oleh DCGM untuk layanan

service

GPU

Gauge

bytes/second

60

service_gpu_pcie_receive_measure_by_dcgm

Laju penerimaan PCIe yang diukur oleh DCGM untuk layanan

service

GPU

Gauge

bytes/second

60

service_gpu_graphics_engine_util

Utilisasi mesin grafis dari layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_sm_util

Pemanfaatan Streaming Multiprocessor (SM) layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_dram_active

Rasio waktu antarmuka memori perangkat aktif mengirim atau menerima data untuk layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_tensortflops_used

TFLOPS yang digunakan oleh pipeline Tensor untuk layanan

service

GPU

Gauge

count

60

service_gpu_memory_bandwidth_used

Penggunaan bandwidth memori layanan

service

GPU

Gauge

bytes/second

60

service_gpu_sm_clock

Frekuensi clock SM layanan

service

GPU

Gauge

MHz

60

service_gpu_sm_occupancy

Rasio warp yang berada di SM untuk layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_fp32tflops_used

TFLOPS yang digunakan oleh pipeline FP32 untuk layanan

service

GPU

Gauge

count

60

service_gpu_fp16tflops_used

TFLOPS yang digunakan oleh pipeline FP16 untuk layanan

service

GPU

Gauge

count

60

service_gpu_pipe_fp32_active

Rasio siklus aktif untuk pipeline FP32 layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_pipe_fp16_active

Rasio siklus aktif untuk pipeline FP16 layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_pipe_tensor_active

Rasio siklus aktif untuk pipeline Tensor layanan

service

GPU

Gauge

ratio (0~1)

60

service_gpu_power_usage

Penggunaan daya GPU layanan

service

GPU

Gauge

watts

60

service_accelerator_power_usage

Penggunaan daya akselerator layanan

service

GPU

Gauge

milliwatts

60

service_gpu_mem_copy_util

Pemanfaatan copy memori layanan

service

GPU

Gauge

%

60

service_gpu_health_count

Total jumlah status kesehatan GPU untuk layanan

service

GPU

Gauge

count

60

service_gpu_lost_card_num

Jumlah GPU yang hilang di VM untuk layanan

service

GPU

Gauge

count

60

service_gpu_driver_hang

Jumlah hang driver GPU untuk layanan

service

GPU

Gauge

count

60

service_gpu_profile_status

Status profiling Amperf untuk layanan

service

GPU

Gauge

count

60

service_gpu_uncorrectable_ecc

Jumlah error ECC tidak terkoreksi untuk layanan

service

GPU

Gauge

count

60

service_gpu_xid_cnt

Jumlah error Xid untuk layanan

service

GPU

Gauge

count

60

service_gpu_fatal_xid_error

Jumlah error Xid fatal untuk layanan

service

GPU

Gauge

count

60

service_gpu_kernel_err_cnt

Jumlah error non-Xid dari log kernel untuk layanan

service

GPU

Gauge

count

60

service_tcp_connections

Jumlah koneksi TCP untuk layanan

service

Network

Gauge

count

60

service_gateway_requests

llm-gateway: jumlah permintaan saat ini yang diterima oleh gateway

service

Request

Gauge

count

60

service_gateway_pending_requests

llm-gateway: jumlah permintaan saat ini yang dibuffer di gateway

service

Request

Gauge

count

60

service_llm_ttft_max

llm-gateway: Time to First Token (TTFT) maksimum untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_ttft_min

llm-gateway: Time to First Token (TTFT) minimum untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_ttft_mean

llm-gateway: Time to First Token (TTFT) rata-rata untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_ttft_percent

llm-gateway: persentil Time to First Token (TTFT) untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_max

llm-gateway: Time Per Output Token (TPOT) maksimum untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_min

llm-gateway: Time Per Output Token (TPOT) minimum untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_mean

llm-gateway: Time Per Output Token (TPOT) rata-rata untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_llm_tpot_percent

llm-gateway: persentil Time Per Output Token (TPOT) untuk permintaan streaming LLM

service

Request

Gauge

time

60

service_endpoint_llm_waiting_requests

llm-gateway: jumlah permintaan yang antri di mesin inferensi LLM

service

Request

Gauge

count

60

service_endpoint_llm_running_requests

llm-gateway: jumlah permintaan yang sedang diproses oleh mesin inferensi LLM

service

Request

Gauge

count

60

service_endpoint_llm_gpu_cache_usage

llm-gateway: pemanfaatan GPU KV-cache mesin inferensi LLM

service

Request

Gauge

count

60

service_endpoint_llm_tps_in

llm-gateway: token input per detik untuk mesin LLM

service

Request

Gauge

count

60

service_endpoint_llm_tps_out

llm-gateway: token output per detik untuk mesin LLM

service

Request

Gauge

count

60

Metrik kelompok sumber daya

Metrik

Deskripsi

Tag metrik (dimensi)

Kategori

Type

Unit

Periode pengumpulan (dtk)

resource_instance_cpu_util

Pemanfaatan CPU instans kelompok sumber daya

instance_id

Resource Instance

Gauge

%

60

resource_instance_memory_total

Total memori instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_used

Penggunaan memori instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_util

Pemanfaatan memori instans kelompok sumber daya

instance_id

Resource Instance

Gauge

%

60

resource_instance_memory_cache

Penggunaan cache memori instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_memory_free

Memori bebas instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_traffic_in

Trafik masuk instans kelompok sumber daya

instance_id

Resource Instance

Gauge

bytes/second

60

resource_instance_traffic_out

Trafik keluar instans kelompok sumber daya

instance_id

Resource Instance

Gauge

bytes/second

60

resource_instance_disk_used

Penggunaan disk instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_disk_total

Total disk instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_disk_util

Pemanfaatan disk instans kelompok sumber daya

instance_id

Resource Instance

Gauge

byte

60

resource_instance_tcp_established

Koneksi TCP established instans kelompok sumber daya

instance_id

Resource Instance

Gauge

count

60

resource_instance_tcp_time_wait

Koneksi TCP dalam status TIME_WAIT instans kelompok sumber daya

instance_id

Resource Instance

Gauge

count

60

resource_instance_gpu_util

Pemanfaatan GPU instans kelompok sumber daya

instance_id

Resource Instance

Gauge

%

60

resource_instance_gpu_memory_usage

Penggunaan memori GPU instans kelompok sumber daya

instance_id

Resource Instance

Gauge

MiB

60

resource_instance_gpu_memory_total

Total memori GPU instans kelompok sumber daya

instance_id

Resource Instance

Gauge

MiB

60

resource_instance_gpu_memory_util

Pemanfaatan memori GPU instans kelompok sumber daya

instance_id

Resource Instance

Gauge

%

60

resource_cpu_util

Pemanfaatan CPU kelompok sumber daya

resource

Resource

Gauge

%

60

resource_memory_total

Total memori kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_memory_used

Penggunaan memori kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_memory_util

Pemanfaatan memori kelompok sumber daya

resource

Resource

Gauge

%

60

resource_memory_cache

Penggunaan cache memori kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_memory_free

Memori bebas kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_traffic_in

Trafik masuk kelompok sumber daya

resource

Resource

Gauge

bytes/second

60

resource_traffic_out

Trafik keluar kelompok sumber daya

resource

Resource

Gauge

bytes/second

60

resource_disk_used

Penggunaan disk kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_disk_total

Total disk kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_disk_util

Pemanfaatan disk kelompok sumber daya

resource

Resource

Gauge

byte

60

resource_tcp_established

Koneksi TCP established kelompok sumber daya

resource

Resource

Gauge

count

60

resource_tcp_time_wait

Koneksi TCP dalam status TIME_WAIT kelompok sumber daya

resource

Resource

Gauge

count

60

resource_gpu_util

Pemanfaatan GPU kelompok sumber daya

resource

Resource

Gauge

%

60

resource_gpu_memory_usage

Penggunaan memori GPU kelompok sumber daya

resource

Resource

Gauge

MiB

60

resource_gpu_memory_total

Total memori GPU kelompok sumber daya

resource

Resource

Gauge

MiB

60

resource_gpu_memory_util

Pemanfaatan memori GPU kelompok sumber daya

resource

Resource

Gauge

%

60