All Products
Search
Document Center

Realtime Compute for Apache Flink:Latihan pemulihan bencana (Beta)

Last Updated:Aug 21, 2026

Fitur latihan pemulihan bencana mensimulasikan kegagalan satu zona ketersediaan (AZ) dalam suatu ruang kerja untuk memverifikasi kemampuan migrasi dan pemulihan otomatis pekerjaan Flink dalam skenario kegagalan AZ yang nyata. Topik ini menjelaskan cara mengaktifkan dan menggunakan latihan pemulihan bencana.

Ikhtisar

Latihan pemulihan bencana diinisiasi pada tingkat ruang kerja. Ruang kerja apa pun yang berisi namespace cross-zone (high availability dalam satu kota) dapat menjalankan latihan ini. Selama latihan, sistem menambahkan AZ target ke daftar blacklist zona, memicu deteksi kegagalan Flink dan penyeimbangan ulang sumber daya, mengeluarkan pekerjaan yang terdampak, menjadwalkan ulang pekerjaan tersebut di AZ yang sehat, serta memulihkan statusnya dari checkpoint sukses terbaru. Setelah latihan selesai, sistem menghasilkan laporan latihan dalam format HTML untuk catatan audit.

Fitur latihan ini menyediakan verifikasi self-service dan dukungan audit kepatuhan bagi pelanggan dengan high availability, tanpa intervensi manual dari SRE platform.

Batasan

  • Hanya arsitektur Intel x86 yang didukung. Arsitektur ARM tidak didukung karena perbedaan pada image dasar.

  • Ruang kerja harus berisi namespace cross-zone, artinya high availability dalam satu kota harus diaktifkan. Untuk petunjuknya, lihat High availability dalam satu kota.

  • Saat latihan sedang berlangsung, operasi scaling dilarang pada ruang kerja target, dan operasi penghapusan serta scaling dilarang pada namespace yang terlibat.

  • Dalam mode penagihan hybrid, pekerjaan pada sumber daya elastis dipulihkan secara best-effort. Jika sumber daya elastis di AZ yang sehat tidak mencukupi, pemulihan pekerjaan elastis mungkin tertunda.

Prasyarat

  • Namespace cross-zone dengan high availability dalam satu kota telah dibeli dan diaktifkan.

  • Blok CIDR vSwitch dari semua AZ yang terlibat dalam latihan (termasuk AZ kegagalan yang disimulasikan dan AZ yang sehat) telah ditambahkan ke daftar putih akses sistem hulu dan hilir, seperti Kafka, ApsaraDB RDS, Hologres, Paimon, dan OSS.

  • Semua pekerjaan yang terdampak berada dalam status RUNNING, checkpointing diaktifkan, dan terdapat catatan checkpoint sukses.

  • Akun operator memiliki izin flink:DescribeDisasterRecoveryDrill, flink:DescribeInstanceZoneJobs, flink:ListDisasterRecoveryDrills, flink:StartDisasterRecoveryDrill, dan flink:StopDisasterRecoveryDrill.

Mengajukan akses daftar putih latihan pemulihan bencana

Latihan pemulihan bencana merupakan fitur berbasis daftar putih. Anda harus mengajukan permohonan akses sebelum dapat menggunakannya.

  1. Masuk ke Konsol Realtime Compute for Apache Flink.

  2. Daftar namespace ruang kerja target berisi namespace cross-zone.

  3. Pada kolom Actions ruang kerja, klik Disaster Recovery Drill > Start Drill.

Catatan

Namespace single-zone tidak menampilkan menu Disaster Recovery Drill. Jika entri Disaster Recovery Drill berwarna abu-abu, arahkan kursor ke atasnya untuk melihat alasannya, misalnya "Whitelist verification failed" atau "Same-city high availability not enabled".

Memulai latihan pemulihan bencana

Penting
  • Lakukan latihan selama jam sepi. Pekerjaan yang terdampak akan mengalami gangguan singkat selama latihan, biasanya puluhan detik hingga beberapa menit.

  • Kelangsungan bisnis end-to-end juga bergantung pada sistem hulu dan hilir yang memiliki high availability cross-zone. Jika sistem tersebut tidak dideploy lintas zona, pekerjaan yang dimigrasikan mungkin mengalami timeout koneksi, kegagalan penulisan, atau backlog data. Untuk ketentuan risiko, lihat Informed consent for high-risk operations in disaster recovery drills.

Langkah 1: Pilih AZ kegagalan target

  1. Masuk ke Konsol Realtime Compute for Apache Flink.

  2. Pada kolom Actions ruang kerja target, klik Disaster Recovery Drill > Start Drill.

  3. Pada daftar drop-down Target Failure AZ, pilih AZ yang akan disimulasikan sebagai gagal.

    Setelah Anda memilih AZ kegagalan, pekerjaan yang terdampak akan ditampilkan.

Setelah Anda mengonfirmasi pemilihan AZ, lanjutkan ke Langkah 2.

Langkah 2: Konfirmasi cakupan dampak

  1. Tinjau Estimasi Cakupan Dampak dan konfirmasi informasi berikut:

    Item

    Deskripsi

    Affected jobs

    Jumlah pekerjaan dalam status RUNNING di AZ kegagalan target.

    RTO

    Perkiraan waktu pemulihan dari AZ kegagalan ke AZ yang sehat.

    Affected job list

    Nama, status saat ini, dan AZ setiap pekerjaan yang terdampak.

  2. Pilih tiga kotak centang konfirmasi berikut:

Penting
  1. Baca semua ketentuan dalam Informed Consent for High-Risk Operations, yang mencakup gangguan pekerjaan singkat, jaminan mandiri high availability sistem hulu dan hilir, pemulihan best-effort dalam mode penagihan hybrid, serta interval dan frekuensi latihan.

  2. Verifikasi Ringkasan Latihan dan konfirmasi AZ kegagalan target, jumlah pekerjaan yang terdampak, serta perkiraan RTO.

Memantau progres latihan

Setelah latihan dimulai, halaman secara otomatis dialihkan ke halaman progres latihan, yang menampilkan seluruh proses latihan secara real time.

Elemen halaman:

Elemen

Deskripsi

Progress bar

Menampilkan langkah saat ini, total langkah, waktu yang telah berlalu, dan persentase progres.

AZ topology diagram

AZ yang sehat ditampilkan dalam warna hijau. AZ kegagalan ditampilkan dalam warna merah dan diberi label "Simulating failure". Panah merah menunjukkan arah migrasi pekerjaan.

Drill step timeline

Menampilkan status eksekusi lima langkah secara berurutan: simulasi kegagalan AZ, deteksi kegagalan sistem, eksekusi migrasi kegagalan, evaluasi dampak pekerjaan, dan pembuatan laporan latihan.

Penting
  • Jendela migrasi pekerjaan adalah 15 menit. Pekerjaan yang gagal dimigrasikan dalam jendela tersebut akan dilewati, dan laju pemulihan pekerjaan mungkin turun di bawah 100%.

  • Untuk menghentikan latihan lebih awal, klik Stop di pojok kanan bawah dan konfirmasi dalam kotak dialog konfirmasi sekunder.

  • Apakah jendela migrasi telah berakhir, latihan dihentikan lebih awal, atau semua pekerjaan selesai dimigrasikan, Anda harus secara manual mengklik End Drill untuk menghapus AZ target dari daftar blacklist dan melanjutkan penjadwalan.

  • Catatan migrasi yang telah selesai disimpan dalam laporan latihan. Untuk pekerjaan yang gagal dimigrasikan dalam jendela tersebut, kolom Checkpoint pada detail migrasi pekerjaan menampilkan Recovery failed. Metrik inti dihitung berdasarkan bagian yang berhasil diselesaikan.

Menampilkan hasil latihan dan mengunduh laporan

Setelah migrasi latihan selesai, halaman dialihkan ke halaman hasil latihan.

Informasi inti pada halaman:

Item

Deskripsi

Core metrics

Menampilkan metrik seperti RTO dan laju pemulihan pekerjaan.

Job migration details

Menampilkan AZ asal, AZ target migrasi, durasi migrasi, dan status pemulihan checkpoint untuk setiap pekerjaan.

Timeline

Mencatat semua event dan cap waktu proses latihan.

Klik Download Report untuk mengunduh laporan audit latihan. Laporan tersebut berisi informasi dasar latihan, konfigurasi latihan, timeline proses latihan, dan detail migrasi pekerjaan.

Catatan

Mengakhiri latihan akan menambahkan kembali AZ kegagalan ke daftar putih dan mengembalikannya sebagai AZ yang sehat. Pekerjaan yang telah dimigrasikan tetap berada di AZ baru dan tidak dimigrasikan kembali secara otomatis.

Menampilkan riwayat latihan

  1. Pada kolom Actions ruang kerja target, klik Disaster Recovery Drill > Drill History.

  2. Lihat waktu latihan terakhir, jumlah total latihan, dan hasil terbaru.

  3. Pada tabel riwayat latihan, klik View Details untuk membuka halaman hasil latihan, dan klik Download Report untuk mengunduh laporan latihan HTML yang sesuai.

Referensi