全部产品
Search
文档中心

:高可用容灾演练高风险操作知情书

更新时间:Jul 30, 2026

本知情书说明容灾演练功能的操作性质、潜在风险及注意事项。发起演练前请仔细阅读全部条款,勾选确认后方可执行演练操作。

重要
  • 适用范围:已开启同城高可用(跨可用区部署)的项目空间。

  • 适用场景:发起容灾演练前,需阅读本知情书相关条款。

演练机制

容灾演练通过模拟指定可用区(AZ)故障,验证 Flink 作业在真实可用区故障场景下的自动迁移与恢复能力。演练过程中系统将依次执行以下操作:

  1. 设置可用区黑名单(Zone Blacklist):将选定的目标可用区标记为"故障态",模拟该可用区不可用。

  2. 触发故障感知:检测到节点不可用后,自动启动资源重平衡。

  3. Pod 驱逐与重建:受影响作业的计算节点(Pod)从故障可用区驱逐,在健康可用区重新调度。

  4. 作业状态恢复:作业从最近一次成功的 Checkpoint 恢复运行状态。

  5. 移除黑名单并生成报告:演练结束后恢复正常可用区状态,自动生成演练结果报告。

风险知悉条款

发起演练即表示已充分了解并确认以下事项:

条款 1:作业短暂中断

演练期间受影响作业将出现短暂中断。中断时长取决于作业状态大小、Checkpoint 间隔及资源调度速度,通常为数十秒至数分钟。在此期间,上下游数据链路(如 Kafka 消费、数据库写入等)可能出现短暂的数据延迟或积压。

条款 2:上下游系统高可用需自行保障

容灾演练仅验证 Flink 作业在可用区故障场景下的自动迁移与恢复能力。端到端业务连续性依赖于上下游系统(如 Kafka、RDS、Hologres、Paimon、OSS 等)同样具备跨可用区高可用能力。若上游数据源或下游写入端未开启跨可用区部署或容灾机制,迁移后的作业可能出现连接超时、写入失败或数据积压等问题。Flink 平台不对因上下游单可用区部署导致的业务中断承担责任。

条款 3:混合计费模式下的尽力恢复

若项目空间采用混合计费模式(包年包月 + 按量付费),弹性资源上的作业在演练期间为尽力恢复模式(Best-Effort Recovery)。即健康可用区的弹性资源不足时,弹性资源上的作业可能无法立即恢复,需等待资源释放或扩容后方可恢复。

条款 4:演练间隔与频次

  • 同一工作空间同时只能进行一次容灾演练。

  • 单次演练的作业迁移窗口为 15 分钟。窗口期内未成功迁移的作业将被跳过,作业恢复率会不足 100%。演练结束后需手动单击结束演练恢复目标可用区。

前置条件确认

发起演练前须确认以下条件均已满足:

确认项

要求

业务时段

当前为非业务高峰期

作业状态

所有受影响作业处于 RUNNING 状态

网络连通性

所有参与容灾演练的可用区(包括故障模拟可用区和健康可用区)的交换机网段均已添加至上下游系统访问白名单

操作权限

具备 flink:StartDisasterRecoveryDrill以及flink:StopDisasterRecoveryDrill权限

Checkpoint状态

所有受影响作业已开启 Checkpoint,且近期有成功完成的 Checkpoint 记录。若未开启或无成功记录,演练后作业将无法从状态恢复,可能导致数据重复处理或丢失。

免责声明

  • 容灾演练为模拟性操作,旨在验证高可用能力。阿里云已采取充分的技术措施确保演练过程的安全性和可控性,但不对因演练导致的短暂业务中断、数据重复处理或延迟承担除服务等级协议(SLA)之外的额外责任。

  • 若因未在非业务高峰期发起演练、未确认前置条件或未评估跨可用区延迟影响而导致的业务损失,由用户自行承担。

  • 演练结果受多种因素影响(作业状态大小、Checkpoint 配置、资源负载等),历史演练结果不代表未来演练表现。