Dokumen ini menyediakan metrik peringatan utama, konfigurasi peringatan yang direkomendasikan, serta contoh operasional untuk Realtime Compute for Apache Flink guna memungkinkan pemantauan kinerja sistem dan diagnosis masalah secara efektif.
Prasyarat
Lihat Konfigurasikan pemantauan dan peringatan dan pilih metode konfigurasi yang sesuai untuk layanan pemantauan ruang kerja Anda.
Di ARMS, pemantauan multi-metrik hanya didukung ketika Anda menggunakan pernyataan PromQL kustom untuk membuat aturan peringatan. Untuk penyiapan yang lebih sederhana, Anda dapat mengonfigurasi peringatan dengan CloudMonitor.
Aturan peringatan yang direkomendasikan
|
Scenario |
Metric/event name |
Rule configuration |
Severity |
Actions |
|
Job run status event |
= FAILED (Event-based alert) |
P0 |
1. Periksa apakah kebijakan restart salah dikonfigurasi. Disarankan menggunakan konfigurasi default. 2. Tentukan apakah kegagalan disebabkan oleh kebijakan restart atau oleh exception pada JobManager/TaskManager. 3. Pulihkan job dari savepoint terbaru atau checkpoint yang berhasil. |
|
|
Overview / NumOfRestart |
≥ 1 selama 1 periode berturut-turut |
P0 |
1. Identifikasi akar penyebabnya.
2. Pulihkan job dari savepoint terbaru atau checkpoint yang berhasil. |
|
|
NumOfCheckpoints (agregat 5 menit) |
≤ 0 selama 1 periode berturut-turut |
P0 |
1. Lihat System checkpoints untuk mendiagnosis akar penyebab kegagalan checkpoint. 2. Identifikasi dan selesaikan masalah tersebut.
3. Perbarui konfigurasi secara dinamis atau pulihkan job dari checkpoint terakhir yang berhasil. |
|
|
Overview / CurrentEmitEventTimeLag && NumOfRecordsInFromSourcePerSecond |
Latensi maksimum ≥ 180.000 ms Input records > 0 selama 3 periode berturut-turut |
P1 |
1. Lihat Monitor metrics untuk mengidentifikasi penyebab latensi.
|
|
|
Overview / NumOfRecordsInFromSourcePerSecond && SourceIdleTime |
Input records ≤ 0 (tergantung logika bisnis Anda) Waktu idle maksimum ≥ 60.000 ms selama 5 periode berturut-turut |
P1 |
1. Periksa taskmanager.log, flame graph, dan metrik layanan upstream untuk memastikan apakah masalahnya disebabkan oleh tidak adanya data upstream, rate limiting, atau exception, atau stack thread yang macet.
|
|
|
Overview / NumOfRecordsOutToSinkPerSecond |
≤ 0 selama 5 periode berturut-turut |
P1 |
1. Verifikasi apakah data mencapai operator sink.
2. Verifikasi apakah sink dapat menulis ke sistem eksternal.
3. Sebagai fallback sementara, terapkan dual-write ke sistem backup storage. |
|
|
CPU / TMCPUUsage |
≥ 85% selama 10 periode berturut-turut |
P2 |
1. Gunakan flame graph atau UI Flink untuk mengidentifikasi operator hotspot.
2. Tingkatkan parallelism operator bottleneck atau alokasikan lebih banyak core CPU ke TaskManager. |
|
|
TMHeapMemoryUsed |
≥ 90% selama 10 periode berturut-turut |
P2 |
1. Analisis log GC untuk mengidentifikasi masalahnya.
2. Tingkatkan ukuran heap atau parallelism untuk mengurangi volume data per slot. |
Ketersediaan job
Peringatan kegagalan job
Console (ARMS)
-
Login ke console Realtime Compute for Apache Flink dan klik Console di kolom Actions ruang kerja target Anda.
-
Di panel navigasi kiri, pilih . Klik nama job target Anda.
-
Klik tab Alarm.
Klik Add Alert Rule. Di panel Create Rule, konfigurasikan peringatan tersebut. Untuk Rule, masukkan nama dan deskripsi, pilih Job Failed sebagai Metric, lalu atur interval Effective Period dan Mute For. Untuk Notification Method, pilih metode yang diinginkan dan contact group. Untuk mengelola kontak, klik tautan Manage Contact.
CloudMonitor
-
Login ke Cloud Monitor console.
-
Di panel navigasi kiri, pilih .
-
Di tab Subscription Policies, klik Create Subscription Policy.
-
Di halaman Create Subscription Policy, konfigurasikan parameter. Untuk informasi lebih lanjut, lihat Manage event subscriptions (Recommended).
Pada langkah Subscribe to Events, atur Type menjadi System Event. Di bagian Scope, pilih Realtime Compute for Apache Flink untuk Product, dan pilih Job Failed untuk Event Name. Anda dapat membiarkan Level dan application group diatur ke All.
Stabilitas pekerjaan
Frequent JobManager restarts
-
Metric:
NumOfRestart -
Rule: Beri peringatan jika job restart dalam waktu satu menit.
-
Recommended configuration:
-
NumOfRestartNilai ≥ 1
-
Periode: 1 menit
-
Notifikasi: Telepon + SMS + Email + Webhook (Kritis)
-
Checkpoint success rate
-
Metric:
NumOfCheckpoints -
Rule: Beri peringatan jika tidak ada checkpoint yang berhasil dalam 5 menit.
-
Recommended configuration:
-
NumOfCheckpoints -
Nilai ≤ 0
-
Periode: 5 menit
-
Notifikasi: Telepon + SMS + Email + Webhook (Kritis)
-
Ketepatan waktu data
Latency SLA
-
Metrics:
-
CurrentEmitEventTimeLag -
NumOfRecordsInFromSourcePerSecond
-
-
Rule: Beri peringatan jika data sedang diingest dan latensi bisnis melebihi 5 menit. Anda dapat menyesuaikan ambang batas dan tingkat peringatan sesuai kebutuhan bisnis Anda.
-
Recommended configuration:
-
CurrentEmitEventTimeLagNilai maksimum ≥ 300.000
-
NumOfRecordsInFromSourcePerSecondNilai > 0
-
Periode: 5 menit
-
Upstream data flow interruptions
-
Metrics:
-
NumOfRecordsInFromSourcePerSecond -
SourceIdleTime
-
-
Rule: Beri peringatan jika input data berhenti dan sumber tetap idle lebih dari 1 menit. Anda dapat menyesuaikan ambang batas dan tingkat peringatan sesuai kebutuhan bisnis Anda.
-
Recommended configuration:
-
NumOfRecordsInFromSourcePerSecondNilai ≤ 0
-
SourceIdleTimeNilai maksimum > 60.000
-
Periode: 5 menit
-
No data output
-
Metric:
NumOfRecordsOutToSinkPerSecond -
Rule: Beri peringatan jika tidak ada data yang dikirim selama lebih dari 5 menit. Anda dapat menyesuaikan ambang batas dan tingkat peringatan sesuai kebutuhan bisnis Anda.
-
Recommended configuration:
-
NumOfRecordsOutToSinkPerSecondNilai ≤ 0
-
Periode: 5 menit
-
Bottleneck kinerja sumber daya
CPU performance bottleneck
-
Metric:
TMCPUUsage -
Rule: Beri peringatan jika utilisasi CPU melebihi 85% selama lebih dari 10 menit.
-
Recommended configuration:
-
TMCPUUsageNilai maksimum ≥ 85
-
Periode: 10 menit
-
Memory performance bottleneck
-
Metric:
TMHeapMemoryUsed -
Rule: Beri peringatan jika penggunaan memori heap melebihi 90% selama lebih dari 10 menit.
-
Recommended configuration:
-
TMHeapMemoryUsedNilai maksimum ≥ Ambang batas (90%)
Ambang batas ini dapat ditemukan di halaman . Misalnya, jika total memori adalah 413 MB, Anda dapat mengatur ambang batas menjadi 372 MB (90% dari 413 MB).
-
Periode: 10 menit
-