Tous les produits
Search
Centre de documentation

Realtime Compute for Apache Flink:Disaster recovery drill (Beta)

Dernière mise à jour :Aug 20, 2026

La fonctionnalité de test de reprise après sinistre simule une panne d'une seule zone de disponibilité au sein d'un workspace afin de vérifier les capacités de migration automatique et de récupération des jobs Flink dans des scénarios réels de panne de zone. Cette rubrique décrit comment activer et utiliser le test de reprise après sinistre.

Overview

Un test de reprise après sinistre se lance au niveau du workspace. Tout workspace contenant un namespace inter-zones (haute disponibilité intra-région) peut exécuter ce test. Pendant le test, le système ajoute la zone cible à la liste de blocage des zones, déclenche la détection de panne Flink et le rééquilibrage des ressources, expulse les jobs affectés, les replanifie dans des zones saines et restaure leur état à partir du dernier checkpoint réussi. Une fois le test terminé, le système génère un rapport HTML pour l'audit.

Cette fonctionnalité offre une vérification en libre-service et un support d'audit de conformité pour les clients exigeant une haute disponibilité, sans intervention manuelle des équipes SRE de la plateforme.

Limits

  • Seule l'architecture Intel x86 est prise en charge. L'architecture ARM n'est pas compatible en raison des différences au niveau de l'image sous-jacente.

  • Le workspace doit contenir un namespace inter-zones, c'est-à-dire que la haute disponibilité intra-région doit être activée. Pour plus d'instructions, consultez Same-city high availability.

  • Pendant l'exécution d'un test, les opérations de mise à l'échelle sont interdites sur le workspace cible, et les opérations de suppression et de mise à l'échelle sont interdites sur les namespaces concernés.

  • En mode de facturation hybride, la récupération des jobs sur des ressources élastiques se fait dans la mesure du possible. Si les ressources élastiques dans les zones saines sont insuffisantes, la récupération des jobs élastiques peut être retardée.

Prerequisites

  • Un namespace inter-zones avec haute disponibilité intra-région a été acheté et activé.

  • Les blocs CIDR des vSwitch de toutes les zones impliquées dans le test (y compris la zone simulée en panne et les zones saines) ont été ajoutés aux listes d'autorisation des systèmes en amont et en aval, tels que Kafka, ApsaraDB RDS, Hologres, Paimon et OSS.

  • Tous les jobs affectés sont à l'état RUNNING, le checkpointing est activé et des enregistrements de checkpoints réussis existent.

  • Le compte opérateur dispose des permissions flink:DescribeDisasterRecoveryDrill, flink:DescribeInstanceZoneJobs, flink:ListDisasterRecoveryDrills, flink:StartDisasterRecoveryDrill et flink:StopDisasterRecoveryDrill.

Apply for the disaster recovery drill whitelist

Le test de reprise après sinistre est une fonctionnalité réservée à une liste d'autorisation. Vous devez demander l'accès avant de pouvoir l'utiliser.

  1. Connectez-vous à la Realtime Compute for Apache Flink console.

  2. Vérifiez que la liste des namespaces du workspace cible contient un namespace inter-zones.

  3. Dans la colonne Actions du workspace, cliquez sur Disaster Recovery Drill > Start Drill.

Remarque

Les namespaces mono-zone n'affichent pas le menu Disaster Recovery Drill. Si l'entrée Disaster Recovery Drill est grisée, survolez-la pour afficher la raison, telle que « Whitespace verification failed » ou « Same-city high availability not enabled ».

Initiate a disaster recovery drill

Important
  • Lancez le test pendant les heures creuses. Les jobs affectés subissent une brève interruption pendant le test, généralement de quelques dizaines de secondes à plusieurs minutes.

  • La continuité des activités de bout en bout dépend également de la haute disponibilité inter-zones des systèmes en amont et en aval. S'ils ne sont pas déployés sur plusieurs zones, les jobs migrés peuvent rencontrer des délais de connexion dépassés, des échecs d'écriture ou des accumulations de données. Pour connaître les conditions de risque, consultez Informed consent for high-risk operations in disaster recovery drills.

Step 1: Select the target failure AZ

  1. Connectez-vous à la Realtime Compute for Apache Flink console.

  2. Dans la colonne Actions du workspace cible, cliquez sur Disaster Recovery Drill > Start Drill.

  3. Dans la liste déroulante Target Failure AZ, sélectionnez la zone à simuler comme étant en panne.

    Après avoir sélectionné une zone en panne, les jobs affectés s'affichent.

Une fois la sélection de la zone confirmée, passez à l'étape 2.

Step 2: Confirm the impact scope

  1. Examinez l'Impact Scope Estimation et confirmez les informations suivantes :

    Item

    Description

    Affected jobs

    Nombre de jobs à l'état RUNNING sur la zone cible en panne.

    RTO

    Temps estimé pour récupérer depuis la zone en panne vers une zone saine.

    Affected job list

    Nom, statut actuel et zone de chaque job affecté.

  2. Cochez les trois cases de confirmation suivantes :

Important
  1. Lisez toutes les conditions de l'Informed Consent for High-Risk Operations, couvrant les brèves interruptions de jobs, la garantie autonome de la haute disponibilité des systèmes en amont et en aval, la récupération dans la mesure du possible en mode de facturation hybride, ainsi que l'intervalle et la fréquence des tests.

  2. Vérifiez le Drill Summary et confirmez la zone cible en panne, le nombre de jobs affectés et le RTO estimé.

Monitor drill progress

Après le démarrage du test, la page redirige automatiquement vers la page de progression du test, qui affiche l'ensemble du processus en temps réel.

Éléments de la page :

Element

Description

Progress bar

Affiche l'étape actuelle, le nombre total d'étapes, le temps écoulé et le pourcentage de progression.

AZ topology diagram

Les zones saines sont affichées en vert. La zone en panne est affichée en rouge et étiquetée « Simulating failure ». Les flèches rouges indiquent la direction de la migration des jobs.

Drill step timeline

Affiche le statut d'exécution des cinq étapes dans l'ordre : simulation de la panne de zone, détection de la panne par le système, exécution de la migration après panne, évaluation de l'impact sur les jobs et génération du rapport de test.

Important
  • La fenêtre de migration des jobs est de 15 minutes. Les jobs qui ne parviennent pas à migrer dans ce délai sont ignorés, et le taux de récupération des jobs peut tomber en dessous de 100 %.

  • Pour arrêter le test prématurément, cliquez sur Stop dans le coin inférieur droit et confirmez dans la boîte de dialogue de confirmation secondaire.

  • Que la fenêtre de migration expire, que le test soit arrêté prématurément ou que tous les jobs terminent leur migration, vous devez cliquer manuellement sur End Drill pour retirer la zone cible de la liste de blocage et reprendre la planification.

  • Les enregistrements de migration terminés sont conservés dans le rapport de test. Pour les jobs qui ne parviennent pas à migrer dans le délai imparti, la colonne Checkpoint dans les détails de la migration des jobs affiche Recovery failed. Les métriques principales sont calculées sur la base de la partie terminée.

View drill results and download the report

Une fois la migration du test terminée, la page redirige vers la page des résultats du test.

Informations principales sur la page :

Item

Description

Core metrics

Affiche des métriques telles que le RTO et le taux de récupération des jobs.

Job migration details

Affiche la zone d'origine, la zone cible de migration, la durée de migration et le statut de récupération du checkpoint pour chaque job.

Timeline

Enregistre tous les événements et horodatages du processus de test.

Cliquez sur Download Report pour télécharger le rapport d'audit du test. Le rapport contient les informations de base du test, la configuration du test, la chronologie du processus de test et les détails de la migration des jobs.

Remarque

La fin du test réintègre la zone en panne dans la liste d'autorisation et la restaure en tant que zone saine. Les jobs migrés restent dans la nouvelle zone et ne sont pas automatiquement migrés en retour.

View drill history

  1. Dans la colonne Actions du workspace cible, cliquez sur Disaster Recovery Drill > Drill History.

  2. Consultez la date du dernier test, le nombre total de tests et le résultat le plus récent.

  3. Dans le tableau de l'historique des tests, cliquez sur View Details pour ouvrir la page des résultats du test, et cliquez sur Download Report pour télécharger le rapport HTML correspondant.

References