Flink Advisor mendiagnosis penerapan Realtime Compute for Apache Flink Anda dengan menganalisis log, event, metrik, dan konfigurasi secara real time. Fitur ini memantau kesehatan penerapan sepanjang siklus hidupnya, mendeteksi pengecualian dan risiko, serta memberikan saran optimisasi yang dapat ditindaklanjuti untuk mengurangi waktu troubleshooting dan mean time to repair (MTTR).

Batasan
Hanya penerapan streaming yang mendukung diagnostik penerapan cerdas. Penerapan batch tidak didukung.
Cara kerja
Flink Advisor mengevaluasi status kesehatan penerapan Anda secara berkelanjutan. Skor kesehatan dimulai dari 100 dan dikurangi berdasarkan jumlah serta tingkat keparahan risiko yang terdeteksi dalam 30 menit terakhir.
Skor tersebut ditampilkan sebagai lencana berkode warna dalam daftar penerapan:
|
Warna |
Rentang skor |
Makna |
|
Green |
Di atas 80 |
Tidak ada risiko potensial. Saran konfigurasi mungkin diberikan. |
|
Yellow |
60–80 |
Isu atau risiko potensial terdeteksi. Tinjau penerapan tersebut. |
|
Red |
Di bawah 60 |
Isu serius terdeteksi. Segera ambil tindakan untuk mencegah pembatalan penerapan. |
Diagnosis log pengecualian draft
Gunakan alur kerja ini untuk mendiagnosis error SQL sebelum menerbitkan penerapan.
-
Masuk ke Konsol Realtime Compute for Apache Flink. Temukan ruang kerja yang ingin Anda kelola, lalu klik Console pada kolom Actions.
-
Pada panel navigasi kiri, pilih Development > ETL. Buat draft, tulis pernyataan SQL Anda, lalu klik Validate.
-
Pada bagian bawah halaman SQL Editor, tinjau detail error, kemungkinan penyebab, dan saran optimisasi.
Sebagai contoh, bagian Deep Check menampilkan ikon error merah dengan status pemeriksaan (misalnya, "Pemeriksaan sintaksis SQL dan konektivitas jaringan gagal") serta pesan error rinci. Bagian Analysis Result mencantumkan kemungkinan penyebab (misalnya, "Tabel atau view yang dirujuk dalam pernyataan SQL tidak ada") dan solusi yang disarankan (misalnya, "Pastikan nama tabel atau view telah dibuat"). Bagian SQL Optimization yang dapat dilipat muncul di bagian bawah halaman.
Jika Anda tidak dapat mengidentifikasi penyebabnya dari hasil pemeriksaan sintaksis, pilih log terkait dan klik Search in Documentation untuk menemukan informasi relevan.
Diagnosis log pengecualian penerapan
Gunakan alur kerja ini untuk menyelidiki pengecualian tingkat log pada penerapan yang sedang berjalan atau gagal.
-
Masuk ke Konsol Realtime Compute for Apache Flink. Temukan ruang kerja yang ingin Anda kelola, lalu klik Console pada kolom Actions.
-
Pada panel navigasi kiri, pilih O&M > Deployments. Klik nama penerapan yang ingin Anda selidiki.
-
Klik tab Logs. Pada panel kiri, klik Logs, Startup Logs, atau JM Exceptions untuk melihat log terkait.
Area utama menampilkan jejak stack pengecualian. Di bawahnya, bagian Analysis based on current logs mencantumkan kemungkinan penyebab dan solusi yang disarankan. Di bagian bawah, tabel Exception History menampilkan riwayat pengecualian beserta waktu kemunculan pertama, nama, jenis pengecualian, dan jumlah kemunculannya.
Untuk informasi lebih lanjut tentang tipe log, lihat Lihat log boot dan log operasional penerapan. Untuk menyelidiki log pengecualian, lihat Lihat log pengecualian penerapan. Untuk mengakses catatan historis, lihat Lihat log penerapan historis.
Jalankan diagnostik cerdas pada penerapan abnormal
Gunakan alur kerja ini ketika penerapan berada dalam kondisi abnormal dan Anda perlu mengidentifikasi akar permasalahannya.
-
Buka tab Diagnosis menggunakan salah satu metode berikut:
-
Pada daftar penerapan, temukan penerapan tersebut dan klik skornya pada kolom Health.
-
Klik nama penerapan, lalu klik tab Diagnosis.
Pada halaman Diagnosis, Anda dapat melihat Health Score (misalnya, 99) dan waktu diagnosis. Klik Diagnose untuk menjalankan pemeriksaan diagnostik. Hasilnya menunjukkan jumlah total item yang diperiksa (misalnya, 5), dengan kategori seperti Resource Analysis yang memerlukan perhatian, sedangkan Startup Analysis, Deployment Analysis, State Analysis, dan Exception Analysis lulus pemeriksaan diagnostik.
-
-
Klik Diagnose. Flink Advisor menyediakan berbagai repositori log untuk log pengecualian Flink. Untuk daftar lengkap item diagnostik dan langkah remediasi, lihat Item diagnostik Flink Advisor.
-
Tinjau hasil diagnostik dan saran optimisasi. Untuk menerapkan saran, klik Apply di sebelahnya.
Item diagnostik Flink Advisor
Item diagnostik terbagi menjadi dua kategori:
-
Exception: Eksekusi penerapan terpengaruh. Tindakan segera diperlukan.
-
Risk: Penerapan saat ini berjalan, tetapi terdapat isu potensial. Tangani secara proaktif untuk mencegah kegagalan di masa depan.
|
Tipe |
Fase |
Item diagnostik |
Deskripsi |
|
Exception (eksekusi penerapan terpengaruh) |
Startup |
Startup file analysis |
Paket JAR yang diperlukan tidak ditemukan di direktori Object Storage Service (OSS). Unggah ulang paket JAR sebelum memulai penerapan. |
|
Startup |
Resource analysis |
Sumber daya tersedia yang tersisa tidak mencukupi. Kurangi nilai konfigurasi sumber daya untuk penerapan, atau scale out kluster. |
|
|
Startup |
Resource analysis |
Container Network Interface (CNI) gagal melakukan bind ke penerapan. Periksa apakah jumlah alamat IP vSwitch terkait telah mencapai batas maksimumnya. |
|
|
Startup |
Resource analysis |
Jumlah alamat IP Elastic Network Interface (ENI) melebihi batas maksimum. Tambah jumlah ENI dan coba lagi. |
|
|
Startup |
Topology network analysis |
Tidak ada koneksi jaringan yang terbentuk antara TaskManager dan JobManager. Penerapan tidak normal. |
|
|
Startup |
Topology network analysis |
Proses binding ENI ke instans Elastic Compute Service (ECS) mengalami timeout dalam 10 menit terakhir. Penerapan berjalan sangat lambat. Tunggu hingga proses selesai. |
|
|
Startup |
Network analysis of upstream and downstream services |
Pemeriksaan port TCP normal, tetapi konektor upstream atau downstream tidak terhubung. Periksa konfigurasi jaringan layanan upstream dan downstream. |
|
|
Startup |
Permission detection of upstream and downstream services |
Sumber data upstream tidak terhubung. Periksa konfigurasi izin layanan upstream. |
|
|
Startup |
Permission detection of upstream and downstream services |
Sumber data downstream tidak terhubung. Periksa konfigurasi izin layanan downstream. |
|
|
Startup |
Startup speed analysis |
Paket JAR terlalu besar, sehingga startup berjalan lambat. Kompres paket JAR dan unggah ulang, atau tunggu hingga startup selesai. |
|
|
Startup |
JobGraph check |
File konfigurasi dari versi sebelumnya Realtime Compute for Apache Flink mungkin hilang. Penerapan mungkin tidak pulih setelah failover. Batalkan dan mulai ulang penerapan secara manual. |
|
|
Startup |
Session cluster check |
Kluster sesi dari versi sebelumnya Realtime Compute for Apache Flink mungkin tidak normal, sehingga menyebabkan penerapan tidak normal. |
|
|
Run icon |
High availability (HA) status check |
HA tidak diaktifkan. Penerapan tidak dapat pulih setelah kegagalan. Terbitkan ulang draft, lalu batalkan dan mulai ulang penerapan secara manual. |
|
|
Run icon |
Checkpoint check |
Fitur checkpoint dari versi sebelumnya Realtime Compute for Apache Flink mungkin tidak normal, yang dapat menyebabkan kegagalan checkpointing. |
|
|
Run icon |
Permission detection of upstream and downstream services |
Pemeriksaan port TCP normal, tetapi konektor upstream atau downstream tidak terhubung. Periksa konfigurasi izin layanan upstream dan downstream. |
|
|
Run icon |
Running status check |
Terjadi error kehabisan memori (OOM) pada TaskManager. Periksa konfigurasi penerapan dan tambah memori TaskManager. |
|
|
Cancellation |
Cancellation speed analysis |
Pembatalan berjalan lambat pada versi sebelumnya Realtime Compute for Apache Flink. Batalkan dan mulai ulang penerapan secara manual. |
|
|
Risk (eksekusi penerapan tidak terpengaruh) |
Configurations |
JobGraph check |
Penerapan berjalan normal. Namun, file konfigurasi dari versi sebelumnya mungkin hilang. Penerapan mungkin tidak pulih setelah kegagalan. Batalkan dan mulai ulang penerapan secara manual. |
|
Configurations |
HA status check |
Penerapan berjalan normal. Namun, HA tidak diaktifkan. Penerapan mungkin tidak pulih setelah kegagalan. Terbitkan ulang draft, lalu batalkan dan mulai ulang penerapan secara manual. |
|
|
Configurations |
Version check |
Penerapan berjalan normal. Namun, terdeteksi cacat besar pada versi Realtime Compute for Apache Flink saat ini. |
|
|
Run icon |
Checkpoint check |
Penerapan berjalan normal. Namun, pengecualian checkpoint pada versi sebelumnya Realtime Compute for Apache Flink mungkin menyebabkan isu stabilitas potensial. |
|
|
Run icon |
Checkpoint check |
Penerapan berjalan normal. Namun, tidak ada checkpoint yang dibuat dalam periode waktu yang lama. |
|
|
Run icon |
Cancellation speed analysis |
Penerapan berjalan normal. Namun, terdeteksi risiko yang dapat menyebabkan pembatalan lambat pada versi sebelumnya Realtime Compute for Apache Flink. Batalkan dan mulai ulang penerapan secara manual. |
|
|
Run icon |
Runtime environment analysis |
Penerapan mengalami failover karena pengecualian pada mesin host. Penerapan dapat dipulihkan secara otomatis setelah failover. Tidak diperlukan tindakan. |
|
|
Run icon |
Runtime environment analysis |
Peningkatan mesin mungkin menyebabkan penerapan mengalami failover dalam beberapa menit. Penerapan dapat dipulihkan secara otomatis setelah failover. Untuk mencegah hal ini, batalkan dan mulai ulang penerapan secara manual sebelum peningkatan mesin. |
|
|
Run icon |
Runtime environment analysis |
Terjadi kegagalan perangkat keras pada mesin host. Penerapan mengalami failover. Batalkan dan mulai ulang penerapan secara manual. |
|
|
Run icon |
Version check |
Versi ini telah mencapai End of Service (EOS). Isu stabilitas mungkin terjadi, atau dukungan produk mungkin tidak lagi tersedia. Untuk informasi lebih lanjut, lihat Operasi Konsol. |
Langkah berikutnya
-
Monitor metrik performa JobManager dan TaskManager untuk penerapan yang sedang berjalan. Untuk informasi lebih lanjut, lihat Monitor performa penerapan.
-
Konfigurasikan tuning otomatis agar sistem dapat mengonfigurasi ulang sumber daya secara otomatis atau sesuai jadwal. Untuk informasi lebih lanjut, lihat Aktifkan tuning performa otomatis.
-
Optimalkan penerapan Flink SQL dengan menyesuaikan konfigurasi penerapan dan logika SQL. Untuk informasi lebih lanjut, lihat Optimalkan Flink SQL.