本知情书说明容灾演练功能的操作性质、潜在风险及注意事项。发起演练前请仔细阅读全部条款,勾选确认后方可执行演练操作。
-
适用范围:已开启同城高可用(跨可用区部署)的项目空间。
-
适用场景:发起容灾演练前,需阅读本知情书相关条款。
演练机制
容灾演练通过模拟指定可用区(AZ)故障,验证 Flink 作业在真实可用区故障场景下的自动迁移与恢复能力。演练过程中系统将依次执行以下操作:
-
设置可用区黑名单(Zone Blacklist):将选定的目标可用区标记为"故障态",模拟该可用区不可用。
-
触发故障感知:检测到节点不可用后,自动启动资源重平衡。
-
Pod 驱逐与重建:受影响作业的计算节点(Pod)从故障可用区驱逐,在健康可用区重新调度。
-
作业状态恢复:作业从最近一次成功的 Checkpoint 恢复运行状态。
-
移除黑名单并生成报告:演练结束后恢复正常可用区状态,自动生成演练结果报告。
风险知悉条款
发起演练即表示已充分了解并确认以下事项:
条款 1:作业短暂中断
演练期间受影响作业将出现短暂中断。中断时长取决于作业状态大小、Checkpoint 间隔及资源调度速度,通常为数十秒至数分钟。在此期间,上下游数据链路(如 Kafka 消费、数据库写入等)可能出现短暂的数据延迟或积压。
条款 2:上下游系统高可用需自行保障
容灾演练仅验证 Flink 作业在可用区故障场景下的自动迁移与恢复能力。端到端业务连续性依赖于上下游系统(如 Kafka、RDS、Hologres、Paimon、OSS 等)同样具备跨可用区高可用能力。若上游数据源或下游写入端未开启跨可用区部署或容灾机制,迁移后的作业可能出现连接超时、写入失败或数据积压等问题。Flink 平台不对因上下游单可用区部署导致的业务中断承担责任。
条款 3:混合计费模式下的尽力恢复
若项目空间采用混合计费模式(包年包月 + 按量付费),弹性资源上的作业在演练期间为尽力恢复模式(Best-Effort Recovery)。即健康可用区的弹性资源不足时,弹性资源上的作业可能无法立即恢复,需等待资源释放或扩容后方可恢复。
条款 4:演练间隔与频次
-
同一工作空间同时只能进行一次容灾演练。
-
单次演练的作业迁移窗口为 15 分钟。窗口期内未成功迁移的作业将被跳过,作业恢复率会不足 100%。演练结束后需手动单击结束演练恢复目标可用区。
前置条件确认
发起演练前须确认以下条件均已满足:
|
确认项 |
要求 |
|
业务时段 |
当前为非业务高峰期 |
|
作业状态 |
所有受影响作业处于 RUNNING 状态 |
|
网络连通性 |
所有参与容灾演练的可用区(包括故障模拟可用区和健康可用区)的交换机网段均已添加至上下游系统访问白名单 |
|
操作权限 |
具备 |
|
Checkpoint状态 |
所有受影响作业已开启 Checkpoint,且近期有成功完成的 Checkpoint 记录。若未开启或无成功记录,演练后作业将无法从状态恢复,可能导致数据重复处理或丢失。 |
免责声明
-
容灾演练为模拟性操作,旨在验证高可用能力。阿里云已采取充分的技术措施确保演练过程的安全性和可控性,但不对因演练导致的短暂业务中断、数据重复处理或延迟承担除服务等级协议(SLA)之外的额外责任。
-
若因未在非业务高峰期发起演练、未确认前置条件或未评估跨可用区延迟影响而导致的业务损失,由用户自行承担。
-
演练结果受多种因素影响(作业状态大小、Checkpoint 配置、资源负载等),历史演练结果不代表未来演练表现。