Topik ini menjelaskan variabel dan panel pada dasbor lapisan kontrol Fluid serta dasbor cache JindoRuntime. Variabel dasbor memungkinkan Anda menyesuaikan dimensi observabilitas seperti interval pemantauan dan namespace dataset; panel membantu Anda menilai kesehatan komponen dan kinerja cache sehingga Anda dapat mendeteksi masalah serta peluang optimalisasi lebih awal.
-
Dasbor lapisan kontrol Fluid — memantau kesehatan dan kinerja komponen lapisan kontrol Fluid: dataset controller, runtime controller, webhook, dan plug-in CSI.
-
Dasbor cache JindoRuntime Fluid — memantau efisiensi cache dan penggunaan sumber daya sistem cache JindoRuntime tertentu.
Detect component failures, diagnose cache performance issues, and spot optimizations before they affect workloads.
Prasyarat
Sebelum memulai, pastikan Anda telah:
-
Managed Service for Prometheus diaktifkan untuk komponen Fluid. Lihat Langkah 2: Melihat dasbor Fluid.
Dasbor lapisan kontrol Fluid
Variabel dasbor
Variabel mengontrol cakupan dan granularitas data di seluruh panel. Mengubah nilai variabel akan memperbarui semua panel terkait.
| Variabel | Nilai yang valid | Deskripsi |
|---|---|---|
interval |
1m, 5m, 10m, 30m, 1h, 6h | Durasi siklus pemantauan. Interval yang lebih pendek menampilkan tren dengan granularitas lebih halus; interval yang lebih panjang meratakan lonjakan. |
quantile |
0.5, 0.75, 0.90, 0.95, 0.99 | Persentil untuk panel latensi dan waktu pemrosesan. Contohnya, 0.90 = P90. |
runtime |
JindoRuntime, AlluxioRuntime, JuiceFSRuntime | Jenis runtime yang dipantau. Memfilter semua panel terkait runtime ke jenis yang dipilih. |
Jenis runtime:
-
JindoRuntime — mesin eksekusi JindoFS, dikembangkan oleh tim Alibaba Cloud Elastic MapReduce (EMR). Dibangun dalam C++, menyediakan manajemen dataset, caching, dan dukungan OSS.
-
AlluxioRuntime — mesin eksekusi open-source Alluxio. Mendukung manajemen dataset, caching, dan akses dipercepat ke PVC, Ceph, dan Cloud Parallel File System (CPFS). Cocok untuk skenario cloud hibrida.
-
JuiceFSRuntime — mesin akselerasi cache terdistribusi berbasis JuiceFS. Mendukung caching dan akselerasi spesifik skenario. Lihat Introduction to JuiceFS.
Panel
Empat kelompok panel: mulai dengan Component running status untuk pemeriksaan kesehatan, lalu telusuri Fluid Controller Detailed Indicator atau Fluid webhook detailed indicators untuk menemukan akar permasalahan. Resource usage menyediakan data CPU, memori, dan jaringan untuk semua pod controller.
Component running status
Menunjukkan apakah setiap komponen Fluid sedang berjalan dan seberapa sering pod melakukan restart. Restart yang sering mengindikasikan ketidakstabilan.
| Panel | Deskripsi |
|---|---|
| Dataset Controller Ready Replicas | Pod dataset controller dalam status Running. Jika jumlahnya di bawah jumlah replika yang diharapkan, operasi dataset mungkin terhenti. |
| History of Dataset controller restarts | Jumlah restart pod dataset controller. |
| Runtime Number of ready copies of controller | Pod runtime controller dalam status Running. |
| History Runtime Controller Restart Times | Jumlah restart pod runtime controller. |
| Fluid Webhook ready copies | Pod Fluid webhook dalam status Running. |
| Number of historical fluid Webhook restarts | Jumlah restart pod Fluid webhook. |
| Fluid CSI Plug-in Ready Copies | Pod Fluid CSI plug-in dalam status Running. |
| Historical Fluid CSI plug-in restarts | Jumlah restart pod Fluid CSI plug-in. |
| Fluid Component Restart | Lima komponen Fluid teratas berdasarkan jumlah restart dalam siklus 2 menit terakhir. Mengidentifikasi komponen yang perlu diperhatikan. |
Fluid Controller Detailed Indicator
Metrik kinerja internal dari controller runtime dan DataLoad. Periksa saat rekonsiliasi dataset melambat atau beban server API meningkat.
| Panel | Deskripsi |
|---|---|
| Runtime Controller processing time | Waktu pemrosesan runtime controller per siklus, dalam bentuk nilai persentil. Nilai tinggi yang berkelanjutan dapat mengindikasikan kelebihan beban. |
| Number of Runtime controller processing failures | Jenis dan jumlah kegagalan selama penanganan resource runtime: kegagalan penerapan dan kegagalan pemeriksaan kesehatan. Nilai bukan nol memerlukan investigasi. |
| Runtime Number of controller threads | Jumlah thread aktif dan maksimum dari runtime controller. Jika jumlah thread aktif mendekati maksimum, controller mungkin menjadi bottleneck. |
| DataLoad Controller Threads | Jumlah thread aktif dan maksimum dari controller DataLoad. |
| Controller Queue Length | Panjang workqueue setiap controller Fluid. Antrean yang terus bertambah mengindikasikan controller ketinggalan dalam proses rekonsiliasi. |
| Total number of Kubernetes API requests | Total permintaan dari semua pod controller Fluid ke server API Kubernetes per siklus. Lonjakan mendadak dapat menyebabkan pembatasan kecepatan pada server API. |
| Runtime Controller Kubernetes API requests | Permintaan runtime controller ke server API Kubernetes, berdasarkan kode status HTTP. Laju 4xx atau 5xx yang tinggi mengindikasikan kesalahan konfigurasi atau masalah izin. |
| Total time consumed by unfinished processing of controller | Waktu kumulatif yang dihabiskan setiap controller Fluid untuk tugas yang sedang berlangsung. Nilai tinggi yang berkelanjutan mengindikasikan tugas macet. |
Fluid webhook detailed indicators
Memantau Fluid webhook, yang mencegat permintaan pembuatan pod untuk menyuntikkan sidecar FUSE. Latensi webhook secara langsung memengaruhi waktu startup pod.
| Panel | Deskripsi |
|---|---|
| Fluid Webhook Pod CPU Usage | Utilisasi CPU setiap pod Fluid webhook per siklus. |
| Fluid Webhook Pod Memory Usage | Penggunaan memori setiap pod Fluid webhook per siklus. |
| Total number of requests processed in Fluid Webhook | Total permintaan yang ditangani oleh Fluid webhook per siklus. |
| The number of requests processed in each Fluid Webhook Pod | Jumlah permintaan per pod Fluid webhook per siklus. Mengidentifikasi ketidakseimbangan beban antar replika. |
| Fluid Webhook Request Processing Delay | Latensi pemrosesan permintaan Fluid webhook, dalam bentuk persentil. P99 yang tinggi memperlambat startup pod di seluruh kluster. |
| Request processing delay of each Fluid Webhook Pod | Latensi pemrosesan permintaan per pod, dalam bentuk persentil. Mengidentifikasi pod lambat yang menyebabkan tail latency. |
Resource usage
Metrik CPU, memori, dan jaringan untuk semua pod controller Fluid. Gunakan untuk mendeteksi tekanan sumber daya yang mendasari masalah yang ditampilkan di kelompok panel lain.
| Panel | Deskripsi |
|---|---|
| CPU usage | Utilisasi CPU setiap pod controller Fluid per siklus. |
| Memory usage | Penggunaan memori setiap pod controller Fluid per siklus. |
| Network Send Rate per Pod | Laju transmisi jaringan setiap pod controller Fluid per siklus. |
| Network Receive Rate per Pod | Laju penerimaan jaringan setiap pod controller Fluid per siklus. |
Dasbor cache JindoRuntime Fluid
Variabel dasbor
Pilih dataset berdasarkan namespace dan nama untuk membatasi semua panel hanya pada sistem cache dataset tersebut.
| Variabel | Deskripsi |
|---|---|
namespace |
Namespace dataset target. |
fluid_dataset |
Nama dataset Fluid target. |
Panel
Tiga kelompok panel: mulai dengan Dataset overview untuk memastikan kesehatan pod cache, lalu periksa Cache system metrics untuk efisiensi cache dan bandwidth. Untuk masalah tingkat FUSE seperti latensi aplikasi tinggi, gunakan FUSE metrics untuk mengisolasi penyebabnya.
Dataset overview
| Panel | Deskripsi |
|---|---|
| Ready Pod Num | Jumlah pod siap per komponen (master, worker, FUSE) dari sistem cache yang dipilih. |
| Pod Overview | Informasi pod per komponen: jumlah restart (jam terakhir), permintaan dan batas CPU serta memori. |
Cache system metrics
Indikator kesehatan cache inti: penggunaan kapasitas, efektivitas pelayanan data, dan bandwidth yang dikirimkan ke aplikasi.
| Panel | Deskripsi |
|---|---|
| Cache Capacity Usage (%) | Proporsi kapasitas cache yang sedang digunakan. |
| Cache Capacity Usage | Kapasitas cache maksimum dan saat ini dalam nilai absolut. |
| Cache Hit Ratio Per Minute | Tingkat hit cache per menit dari sistem cache yang dipilih. |
| Read Bytes Per Minute | Bacaan per menit dibagi menjadi hit cache (Cache Hit) dan miss dari penyimpanan backend (From Backend). Proporsi From Backend yang tinggi berarti sebagian besar bacaan melewati cache. |
| Cache System Aggregated Bandwidth |
Total lalu lintas outbound di seluruh antarmuka jaringan pod worker — bandwidth yang dikirimkan sistem cache ke aplikasi.
Catatan
Jika pod worker dijalankan pada jaringan host, nilai ini mungkin membengkak. Untuk pembacaan akurat, jalankan pod worker pada jaringan kontainer. |
| Cache Worker Pod Network I/O |
I/O jaringan per pod worker.
Catatan
Jika pod worker dijalankan pada jaringan host, nilai ini mungkin membengkak. Untuk pembacaan akurat, jalankan pod worker pada jaringan kontainer. |
| Cache System Pod Memory Usage | Penggunaan memori pod master dan worker. Jika worker menggunakan memori proses sebagai media cache, kapasitas cache termasuk di dalamnya. |
| Cache System Pod CPU Usage by Cores | Penggunaan CPU pod master dan worker. |
| Aggregated File Operation Requests | Frekuensi agregat operasi metadata file. Hanya GetAttr dan ReadDir yang dihitung. |
FUSE metrics (via CSI)
Memantau pod FUSE yang disuntikkan melalui driver CSI. Periksa saat aplikasi melaporkan latensi akses file tinggi atau operasi metadata lambat.
| Panel | Deskripsi |
|---|---|
| FUSE Network I/O |
I/O jaringan per pod FUSE.
Catatan
Jika pod FUSE dijalankan pada jaringan host, nilai ini mungkin membengkak. Untuk pembacaan akurat, jalankan pod FUSE pada jaringan kontainer. |
| FUSE Memory Usage/Limit (%) | Penggunaan memori sebagai persentase dari batas per pod FUSE. Kosong jika tidak ada batas yang ditetapkan. |
| FUSE CPU Throttled Percent | Persentase pembatasan CPU per pod FUSE. Kosong jika tidak ada batas yang ditetapkan. |
| Meta Ops Per Second | Operasi metadata per detik (GetAttr, ReadDir, Open) per pod FUSE. |
| Meta Ops P99 Latency | Latensi P99 operasi metadata (GetAttr, ReadDir, Open) per pod FUSE. |
| Read/Write Ops Per Second | Operasi baca/tulis per detik per pod FUSE. |
| Read/Write Ops P99 Latency | Latensi P99 operasi baca/tulis per pod FUSE. |
FUSE metrics (via sidecar)
Memantau kontainer sidecar FUSE yang disuntikkan ke dalam pod aplikasi. Setara dengan metrik CSI, tetapi terbatas pada sidecar.
| Panel | Deskripsi |
|---|---|
| FUSE Memory Usage/Limit (%) | Penggunaan memori sebagai persentase dari batas per sidecar FUSE. Kosong jika tidak ada batas yang ditetapkan. |
| FUSE CPU Throttled Percent | Persentase pembatasan CPU per sidecar FUSE. Kosong jika tidak ada batas yang ditetapkan. |
| Meta Ops Per Second | Operasi metadata per detik (GetAttr, ReadDir, Open) per sidecar FUSE. |
| Meta Ops P99 Latency | Latensi P99 operasi metadata (GetAttr, ReadDir, Open) per sidecar FUSE. |
| Read/Write Ops Per Second | Operasi baca/tulis per detik per sidecar FUSE. |
| Read/Write Ops P99 Latency | Latensi P99 operasi baca/tulis per sidecar FUSE. |